최근 Generalist AI를 방문했을 때 로봇 팔이 즉석에서 도구를 임기응변하여 바나나를 사용하는 모습을 관찰했습니다. 이는 인공지능이 사전 프로그래밍된 명령을 넘어 실제 환경에서 새로운 상황을 학습하고 적응하는 능력을 보여주는 사례입니다.
이러한 관찰은 범용 인공지능(Generalist AI)이 단순한 작업 수행을 넘어 예측 불가능한 환경에서 스스로 문제를 해결하고 새로운 도구를 활용하는 방식으로 학습할 수 있음을 시사합니다. 로봇이 환경과의 상호작용을 통해 학습하는 능력은 AI 시스템이 복잡하고 유연한 작업을 수행하는 데 있어 중요한 진전이 될 수 있습니다.
개발자 입장에서 이는 로봇 시스템이 고정된 데이터셋에 의존하지 않고 실시간 피드백을 통해 스스로 지식을 구축하고 행동을 조정하는 방향으로 발전할 수 있음을 의미합니다. 즉, AI가 환경을 이해하고 즉각적으로 적응하는 능력이 향상되면, 미래의 로봇 시스템은 더욱 유연하고 지능적인 방식으로 설계될 수 있습니다.
Wired AI
뉴스
발행 2026-08-19
Will Knight
수집 2026-08-19 20:13
Ramp가 새로운 모델 라우터를 출시했다는 소식이 보도되었습니다. 이는 개발자 및 인프라 분야에 새로운 라우팅 기술과 아키텍처에 대한 정보를 제공할 수 있습니다.
이번 출시로 인해 Ramp는 특정 모델 라우터 솔루션을 시장에 선보였으며, 이는 기존 네트워크 인프라의 효율성과 확장성에 영향을 미칠 수 있습니다. 구체적으로 어떤 모델과 기술적 사양이 적용되었는지에 대한 상세 내용은 기사를 통해 확인할 수 있습니다.
이 소식은 네트워크 프로토콜 및 라우팅 기술을 다루는 개발자들에게 새로운 구현 방식을 탐색할 기회를 제공합니다. 관련 기술 스택과 성능 최적화 측면에서 이 새로운 라우터 모델이 어떤 이점을 제공하는지 분석하는 것이 중요합니다.
Hacker News
뉴스
피드 등록 2026-08-19
zackfield
수집 2026-08-19 20:12
인공지능이 대중을 사로잡을 것으로 기대되었으나 실제로는 그렇지 못하며, 기술 발전에도 불구하고 AI에 대한 대중의 인식이 악화되고 있다는 보고가 나왔습니다. 최근 Axios 보도에 따르면, 공화당 상원 위원회는 미국 데이터 센터가 주요 선거에 부정적인 영향을 미치고 있다고 AI 기업들에게 경고하는 메모를 발송했습니다. 또한 Pew Research의 연구 결과에 따르면 미국인들은 일상생활에서 AI 사용에 대해 2021년 37%에서 52%로 우려가 더 커졌으며, 많은 미국인들은 AI가 너무 빠르게 발전하고 있다고 인식하고 있습니다.
이러한 불만은 기업의 재무제표에도 영향을 미치고 있습니다. 월스트리트저널은 AI 데이터 센터 구축 계획으로 인해 기술 기업들이 공공 관계 위기에 직면했으며, 이에 따라 고용 보장이나 지역 투자와 같은 인센티브를 제공하는 방식으로 거래 조건을 완화했다고 보도했습니다. 이는 소비자들이 AI가 삶을 개선하는 방식을 명확히 보지 못하고 비용을 수용해야 한다는 근본적인 감정에서 비롯됩니다.
소비자들은 AI를 챗봇이나 검색 경험과 같은 제한적인 도구로 인식하며, AI가 학업이나 지적 재산권 침해에 사용되는 것에 대해 의문을 제기하고 있습니다. 이러한 소비자 반발은 아이폰이나 인터넷과 같은 다른 혁신 기술보다 AI에서 더 크게 나타나고 있습니다. 특히 젊은 세대는 레트로 기술에 관심을 보이며 AI에서 벗어난 클래식 제품이나 취미를 선호하는 경향을 보이고 있습니다.
업계 리더들 역시 이러한 대중의 반발을 인지하고 있습니다. Airbnb CEO인 브라이언 체스키는 AI 반발이 업계가 "일반 사람들"이 원하는 제품을 출시하지 못했기 때문이라고 인정했습니다. 또한 Anthropic CEO인 다리오 아모데이 역시 AI의 약속을 이행하지 못한 것이 "신뢰의 위기"라고 지적하며, AI가 인류에게 혜택을 주어야 한다는 점을 강조했습니다.
TechCrunch
뉴스
발행 2026-08-19
Sarah Perez
수집 2026-08-19 19:11
구글이 학생들을 위한 전용 제미나이 허브를 출시하며 학습 환경을 개선합니다. 이 허브는 연구 노트 수집, 플래시카드 생성, 연습 퀴즈 진행 등을 한 곳에서 할 수 있는 통합 저장소 역할을 합니다. 구글은 또한 학습 노트를 그래프와 이미지 지원으로 확장했으며, 교과 과정에 기반하여 시험 날짜와 마감 기한을 구글 캘린더에 추가할 수 있게 했습니다.
이러한 기능은 학생들이 복잡한 연구 자료를 체계적으로 정리하고 학습 계획을 효율적으로 관리하는 데 도움을 줍니다. 특히 학습 노트를 시각 자료로 보강하고 일정 관리를 통합함으로써 학습 과정의 효율성과 접근성을 크게 높일 수 있습니다.
더불어 구글은 제미나이 라이브에 '딥 리서치' 기능을 추가하여 복잡한 연구 보고서를 생성하고 그 결과를 논의할 수 있게 했습니다. 긴 연구 작업 시 사용자가 채팅을 닫고 화면을 잠글 수 있도록 하여 제미나이가 백그라운드에서 작업을 처리할 수 있도록 지원합니다.
The Verge
뉴스
발행 2026-08-19
Terrence O’Brien
수집 2026-08-19 19:12
구글이 검색과 제미나이에 새로운 학습 도구 기능을 통합하며 인공지능 경쟁을 심화하고 있습니다. 이번 발표는 제미나이를 학생들이 학습하고 공부할 때 의지하는 AI 비서로 만드는 데 중점을 두고 있습니다.
이는 구글이 오픈AI와 같은 경쟁사들과의 경쟁 속에서 AI 시장에서 우위를 점하기 위한 최신 전략으로 해석됩니다. 구글은 제미나이가 단순한 대화형 AI를 넘어 실제 학습 과정에 깊이 관여하는 도구가 되도록 기능을 확장했습니다.
새롭게 추가된 학습 기능들은 학생들이 정보를 탐색하고 복잡한 개념을 이해하는 데 도움을 주도록 설계되었습니다. 개발자 및 사용자 입장에서는 구글이 AI를 교육 분야에 적용하는 방식과 그 결과에 주목할 필요가 있습니다.
TechCrunch
뉴스
발행 2026-08-19
Aisha Malik
수집 2026-08-19 19:11
경찰관이 이혼한 아내를 추적하기 위해 플록 카메라를 717회 사용했다는 내용의 기사가 보도되었습니다. 해당 기사는 경찰관이 이혼한 아내를 추적하기 위해 플록 카메라를 사용한 사건에 대한 내용을 다루고 있습니다.
다만, 현재 기사 본문은 접속 지역 제한으로 인해 제공되지 않아 구체적인 사건의 상세 내용이나 배경 정보는 확인할 수 없습니다. 따라서 해당 기사의 전체 맥락과 구체적인 세부 사항에 대해서는 추가적인 확인이 필요합니다.
Hacker News
뉴스
피드 등록 2026-08-19
speckx
수집 2026-08-19 20:12
보안 연구원들이 OpenAI의 제한된 사이버 프로그램 접근 권한을 갑작스럽게 상실했다는 보고가 나왔습니다. 이는 검증된 사용자에게는 일반 사용자보다 적은 안전장치를 가진 AI 모델을 사용할 수 있도록 제공하는 트러스트 액세스 포 사이버(TAC) 프로그램 접근이 취소되었기 때문입니다.
TAC 프로그램은 방어자들이 버그와 취약점을 신속하게 보고하여 보안을 개선하고 악성 해커의 접근을 차단하기 위해 설계되었습니다. 이 프로그램은 연구원들이 OpenAI의 최신 AI 모델을 보안 연구 목적으로 활용할 수 있도록 허용하며, 연구원들은 접근을 얻기 위해 신원 확인 및 검증 절차를 거쳐야 했습니다.
OpenAI는 이 접근 권한이 일부 사용자에게 영향을 미친 기술적 문제로 인해 취소되었다고 밝혔으며, 연구원들에게 재신청 및 검증 절차를 완료하도록 요청했습니다. 특히 최신 검증 등급인 Daybreak Blue에 대한 접근이 중단되었는데, 이는 취약점 발견, 보안 코드 검토, 악성코드 분석 등 방어 관련 작업에 필수적인 모델에 대한 접근이 제한된다는 의미입니다.
이러한 접근 취소는 연구원들이 해당 모델을 이용해 보안 연구를 수행하는 데 직접적인 영향을 미치므로, OpenAI 측에서 발생한 기술적 문제의 구체적인 원인과 영향을 파악하는 것이 중요합니다. 또한, 관련 보고에 따르면 해당 문제로 인해 접근이 취소된 연구원들은 미국과 유럽 외 지역에 거주하고 있어, 이 문제가 특정 지역에 국한되었을 가능성도 시사됩니다.
TechCrunch
뉴스
발행 2026-08-19
Lorenzo Franceschi-Bicchierai
수집 2026-08-19 19:11
중국 기업이 재사용 가능한 로켓 부스터를 착륙시키는 데 성공하면서 우주 발사 분야의 기회가 크게 확대되고 있습니다. 이는 중국의 발사 능력이 지속적으로 성장하고 있음을 보여주는 또 다른 사례입니다.
이러한 발전은 미국 우주 산업의 재사용 로켓 개발과 비교될 때 더욱 주목됩니다. 스페이스X가 벌컨 9 로켓으로 재사용 가능한 부스터를 선보인 이후, 블루 오리진과 같은 다른 미국 회사들이 재사용 로켓 개발에 참여하고 있습니다. 현재 로켓 랩, 스토크 스페이스, 레일러티비 스페이스, 파이어플라이 에어로스페이스 등 여러 기업들이 재사용 로켓 개발을 진행하며 향후 몇 년 내에 비행을 목표로 하고 있습니다.
중국에서도 유사한 수의 발사 회사가 재사용 로켓 개발에 참여하고 있으며, 일부는 중국 항공우주과학기술총국(CASC) 산하에서 운영되고 일부는 민간 자본에 의해 주도되고 있습니다. 이러한 글로벌 경쟁은 재사용 로켓 기술의 상업화와 보편화에 있어 새로운 흐름을 만들고 있습니다.
Ars Technica
뉴스
발행 2026-08-19
Stephen Clark
수집 2026-08-19 21:13
Unsloth에서 발표한 Dynamic 3.0 GGUF 관련 문서가 공개되었습니다. 이 업데이트는 Unsloth 프레임워크를 사용하여 LLM(대규모 언어 모델)을 효율적으로 훈련하고 최적화하는 데 사용되는 GGUF 포맷에 대한 새로운 접근 방식을 다룹니다.
Dynamic 3.0은 모델 로딩 및 훈련 프로세스의 효율성과 속도를 개선하기 위해 도입되었으며, 특히 메모리 사용량과 처리 속도 측면에서 중요한 변화를 제공합니다. 개발자들은 이 새로운 방식을 통해 더 적은 리소스로 더 큰 모델을 처리하거나 훈련할 수 있게 됩니다.
이 변경 사항은 Unsloth를 활용하여 고성능 AI 모델을 개발하려는 사용자들에게 직접적인 이점을 제공합니다. 구체적으로 Dynamic 3.0을 사용하면 메모리 관리 및 연산 효율성이 향상되어, 복잡한 딥러닝 작업을 수행할 때 병목 현상을 줄이고 작업 시간을 단축할 수 있습니다.
다만, 이 기술을 적용하기 위해서는 기존 GGUF 포맷과 Dynamic 3.0의 새로운 요구 사항을 이해하고 적절히 설정해야 합니다. 따라서 새로운 기능을 활용하기 위해서는 Unsloth의 공식 문서를 참고하여 구체적인 구현 방법과 잠재적인 제약 사항을 확인하는 것이 필요합니다.
Hacker News
튜토리얼
피드 등록 2026-08-19
jonesy827
수집 2026-08-19 20:12
해당 기사는 '좋은 사회적 기술의 규칙(Rules of Good Social Skills)'이라는 제목을 가지고 있습니다.
이 글은 해커 뉴스(Hacker News)에 게시된 링크이며, 구체적인 본문 내용은 제공되지 않았습니다. 따라서 기사에서 제시하는 사회적 기술에 대한 구체적인 규칙이나 내용은 확인할 수 없습니다.
제공된 정보만으로는 기사의 핵심 내용을 요약하거나 독자가 기사를 열어볼지 결정할 만한 구체적인 정보를 제공하기 어렵습니다. 관련 논의나 댓글을 확인하려면 링크를 통해 원문을 직접 참조해야 합니다.
Hacker News
피드 등록 2026-08-19
bilsbie
수집 2026-08-19 20:12
Go 1.27 버전이 출시되었으며 언어, 툴체인, 런타임, 표준 라이브러리 전반에 걸쳐 주요 개선 사항이 포함되었습니다. 이번 업데이트의 핵심은 제네릭 메서드 지원, 구조체 초기화의 유연성 향상, 그리고 함수 타입 추론의 일반화입니다. 이제 모든 정수 타입에 대해 제네릭 메서드를 사용할 수 있게 되어 코드의 재사용성과 유연성이 크게 향상되었습니다.
구조체 리터럴에서 키를 사용하거나 채널 전송 시 함수 타입 추론이 확장되어 복잡한 코드 작성 시 타입 명시 없이도 더 간결하게 코드를 작성할 수 있게 되었습니다. 예를 들어, 중첩된 구조체에 대한 초기화나 채널 사용 시 타입 추론이 개선되어 개발자가 런타임 오류를 줄이고 코드를 더 효율적으로 관리할 수 있습니다.
또한 런타임 성능 개선과 표준 라이브러리 기능 추가도 눈에 띕니다. 메모리 할당에 특화된 크기 기반 할당을 통해 작은 객체 할당 비용이 최대 30%까지 줄어들어 전반적인 성능이 향상되었습니다. 더불어 런타임/pprof에서 고루틴 누수 프로파일링 기능이 일반적으로 사용 가능해졌으며, JSON 처리에는 고수준 옵션이 제공되는 encoding/json/v2가 추가되었습니다.
암호화 및 네트워킹 분야에서도 중요한 업데이트가 있었습니다. crypto/mldsa 패키지가 양자 내성 ML-DSA 서명 스킴을 통합했으며, uuid 패키지가 UUID 생성 및 파싱을 네이티브로 지원합니다. 또한, SIMD 지원이 실험적으로 추가되었고, net/http/httptest에 인메모리 테스트 서버를 제공하여 테스트 환경 구축이 용이해졌습니다.
Hacker News
출시
피드 등록 2026-08-19
database64128
수집 2026-08-19 20:12
밸브가 스팀 프레임의 언박싱, 설정 과정, 다양한 액세서리를 보여주는 새로운 영상을 유출했습니다. 이 영상들은 ARM 스팀 클라이언트에서 업데이트 이후에 나타났으나, 스팀 하드웨어 업데이트 계정은 이를 "곧바로 회수했다"고 밝혔습니다. 스팀 프레임은 PC에서 게임을 스트리밍하거나 로컬로 플레이할 수 있는 밸브의 가상 현실 헤드셋입니다.
이 헤드셋은 작년에 처음 공개되었으며, 눈당 2160 x 2160 해상도의 LCD 화면, 스냅드래곤 8 Gen 3 칩, 최대 110도의 시야각을 제공합니다. 이번 유출된 영상들은 이러한 하드웨어의 실제 언박싱 및 설정 경험을 더 자세히 볼 수 있게 해줍니다.
유출된 영상들은 스팀 프레임이라는 제품의 물리적인 모습과 사용 환경에 대한 구체적인 정보를 제공합니다. 이는 스팀 프레임의 기술적 사양과 실제 사용 경험에 관심 있는 사용자들에게 중요한 참고 자료가 될 것입니다.
The Verge
뉴스
발행 2026-08-19
Emma Roth
수집 2026-08-19 19:12
웹메일이 신뢰할 수 없는 HTML 및 CSS를 신뢰된 사용자 인터페이스 내에서 렌더링하는 과정에서 발생하는 파서와 새니타이저 간의 불일치가 심각한 보안 문제를 야기합니다. 이 불일치는 사용자 인터페이스를 조작하고, 토큰을 유출하며, 외부 서비스에 침해를 일으키고 심지어 비밀번호 탈취까지 가능하게 만듭니다.
이러한 취약점은 웹메일 환경에서 허용되는 요소들, 예를 들어 레이블(label), 의사 요소, 속성 선택자, 글꼴 높이 측정, 애니메이션 등을 악용하여 공격에 사용될 수 있습니다. 특히 Outlook과 같은 환경에서의 호환성 문제와 연관되어 이러한 공격 경로가 열릴 수 있습니다.
개발자는 웹메일 클라이언트가 외부 스타일링을 처리하는 방식에 대해 파서와 새니타이저의 일관성을 면밀히 검토해야 합니다. 이러한 불일치를 통해 발생하는 UI 조작과 데이터 유출 위험을 방지하기 위해 렌더링 과정에서의 보안 메커니즘을 강화하는 것이 중요합니다.
GeekNews
분석
피드 등록 2026-08-19
neo
수집 2026-08-20 23:30
웨어러블 기기의 미래는 현재 실험적이고 존재론적인 불확실성 속에 머물러 있습니다. 최근 구글 픽셀 워치 5를 테스트한 결과, 이 기기는 일반적인 스마트워치로 보이지만, 웨어러블 기술이 빠르게 변화하는 흐름 속에서 미래의 한 부분으로 느껴집니다.
웨어러블 기술 분야에서 전문가들이 추구하는 공통된 목표는 곧 사용자가 선택하는 기기에 유용한 AI 코치, 질병을 예방하는 "엔진 체크" 알림, 그리고 개인화된 건강 추천 기능을 탑재하는 것입니다. 이러한 기능들은 사용자의 건강 관리를 혁신적으로 변화시킬 잠재력을 가지고 있습니다.
이러한 AI 통합은 단순한 시간 추적을 넘어선 건강 관리의 패러다임을 제시하며, 웨어러블 기기가 단순한 장치를 넘어 개인화된 건강 코치로 진화하고 있음을 보여줍니다. 따라서 픽셀 워치 5와 같은 기기들이 어떻게 이러한 실험적인 미래를 구현해 나갈지 주목할 필요가 있습니다.
The Verge
분석
발행 2026-08-19
Victoria Song
수집 2026-08-19 18:11
LLM 기반 에이전트의 지속적인 자기 개선을 위해서는 다양하고 적응적인 목표 풀이 필요하지만, 기존의 훈련 환경은 고정되어 있어 학습 규모가 커질수록 목표 분포가 제한됩니다. 본 논문은 이러한 문제를 해결하기 위해 SPADE(Self-Play in Adaptive Synthetic Executable Environments)라는 자기 플레이 강화 학습 프레임워크를 제안합니다. SPADE는 단일 LLM이 두 가지 역할을 수행하는 방식으로 작동하는데, 하나는 OpenAI Gym 스타일의 reset()/step() 인터페이스를 가진 실행 가능한 코드로 장기 훈련 환경을 작성하는 환경 설계자(Environment Designer)이고, 다른 하나는 이 환경 내에서 행동을 학습하는 추론 에이전트(Reasoning Agent)입니다.
이 두 환경은 상태 전이, 보상 함수, 검증 코드를 포함하는 상태 기반의 다중 턴 환경이므로 추론 문제와 다단계 에이전트 도구 사용을 모두 포괄할 수 있습니다. 추론 에이전트의 후회(regret)는 특권적인 힌트가 있을 때와 없을 때의 보상 차이로 추정되며, 이 후회 신호를 최적화하는 과정에서 환경 설계자는 에이전트 능력의 경계에 있는 환경을 목표로 학습하게 됩니다. 성공적인 학습을 위해 환경 설계자를 대규모 사전 훈련 코퍼스에서 샘플링된 문서로 기반을 다지고 누적된 환경 메모리를 제공하는 것이 중요하다고 밝혀졌습니다.
300억 개의 매개변수를 가진 모델로 확장했을 때 SPADE는 가장 강력한 고정 환경 기준선 대비 평균적으로 8가지 수학, 과학, 코드, 추론 벤치마크에서 5.3%의 성능 향상을 보였습니다. 또한 도구 사용 설정에서는 BFCL-v4 멀티턴에서 5.7%, ACEBench-Agent에서 13.9%의 향상을 달성했습니다. 게임 설정에서는 모델 규모가 커질수록 기준선 대비 마진이 증가하는 것으로 나타났습니다. 환경 설계 자체를 학습 가능한 구성 요소로 만들면서 SPADE는 개방형 자기 개선을 향한 구체적인 발걸음을 내디뎠습니다.
arXiv AI/ML
arXiv API
논문
발행 2026-08-19
Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
수집 2026-08-20 02:18
아마존과 베스트 바이에서 11인치 아이패드 에어 M4 칩 모델을 할인된 가격에 판매하고 있습니다. 이 제품은 649달러에 판매되며, 이는 6월에 시행된 새로운 소매 가격보다 100달러 낮은 가격입니다. 이는 애플의 다른 제품 가격 인상과 함께 고성능 메모리나 저장 공간을 갖춘 기기의 가격이 전반적으로 상승하는 추세 속에서 주목할 만한 가격 조정입니다.
현재 판매되는 옵션으로는 128GB Wi-Fi 모델이 649달러이며, 256GB 모델은 749달러, 셀룰러 안테나 버전은 799달러에 판매되고 있습니다. 이 가격은 기존의 소매 가격 대비 상당한 할인율을 제공합니다.
M4 아이패드 에어에 대한 리뷰 결과, 이전 세대와 매우 유사한 경험을 제공하지만, Wi-Fi 7 및 블루투스 6과 같은 업그레이드를 통해 시스템 성능과 연결성이 향상되었습니다. 하지만 이전 몇 년간 아이패드 에어 사용자들에게는 눈에 띄거나 흥미로운 새로운 기능이 부족하다는 평가가 있었습니다.
The Verge
뉴스
발행 2026-08-19
Brad Bourque
수집 2026-08-19 18:11
강화된 민첩성 사전 학습을 통한 가속(ADEPT)이라는 대규모 강화 학습 프레임워크가 소개되었습니다. 이 방법은 고자유도(DoF) 로봇 구현체 전반에 걸쳐 시뮬레이션에서 현실로의 전이 가능한 민첩성을 학습하며, 원시 시각-촉각 지각으로부터 장기 목표 작업을 직접 해결할 수 있게 합니다. ADEPT는 일반적인 물체 재배치 과제를 통해 민첩한 정책을 사전 학습한 후, 이 사전 학습된 행동을 기반으로 다운스트림 정책을 추가 학습시키는 방식으로 작동합니다.
이 접근 방식은 다지(multi-fingered) 로봇에서 처음부터 발견하기 어려운 새로운 행동을 학습할 수 있게 하며, 각 새로운 다운스트림 작업마다 동일한 기술을 다시 학습할 필요가 없다는 장점을 제공합니다. 그러나 사전 학습된 정책을 이용한 단순한 미세 조정은 전이 과정에서 해당 능력을 빠르게 저하시키는 문제가 발생합니다.
연구진은 이러한 문제를 해결하기 위해 행동 복제 증류(behavior-cloning distillation), 비평가 예열(critic warm-up), 보수적인 온폴리시 업데이트를 결합한 안정적인 후처리 레시피를 제시했습니다. 또한, RL 정책과 로봇 사이를 중재하는 공통 공간 기하학적 직물(Geometric Fabric)을 도입하여 전체 운동 민첩성을 안전하게 활용합니다.
이 기술을 통해 훈련된 교사(teachers)를 지각 능력을 갖춘 학생(students)으로 증류하여 두 가지 구현체에서 시뮬레이션-현실 전이를 제로샷으로 가능하게 했습니다. 구체적으로 23 DoF Kuka-Allegro와 29 DoF Flexiv-Sharpa 로봇에 적용했을 때, 이들은 도전적인 초기 상태에서 인간 수준의 속도로 장기 목표 작업을 해결할 수 있습니다.
arXiv AI/ML
arXiv API
논문
발행 2026-08-19
Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
수집 2026-08-20 02:18
장문 컨텍스트에서의 추론 능력을 향상시키기 위해 그룹 보정 온폴리 증류(Group-Calibrated On-Policy Distillation, GC-OPD) 기법을 제안합니다. 온폴리 증류(OPD)는 강한 교사로부터 밀도 높은 토큰 수준 지침을 사용하여 학생 모델을 훈련시키지만, 장문 컨텍스트 작업에서는 이러한 토큰 수준의 교사 지원이 입력 전체에 분산된 증거를 생략하거나 전역 작업 제약을 위반하는 국소적으로 그럴듯한 응답을 선호하는 경향이 있습니다.
이러한 현상은 작업별 검증자(verifier)가 응답 수준에서 작업 완료를 평가하는 점과 충돌하여 교사와 검증자 간의 불일치가 발생합니다. 연구진은 두 가지 대표적인 증거 집계 작업에서 이 불일치를 진단했으며, 입력 범위가 길어질수록 궤적 수준의 OPD 점수는 검증자 보상과 점점 더 불일치함을 발견했습니다.
이러한 불일치를 해결하기 위해 GC-OPD를 도입했는데, 이는 각 롤아웃 그룹 내에서 검증자 보상과 궤적 수준의 OPD 점수를 분리하여 정규화하고 그 차이를 부호 있는 교사-검증자 불일치 잔차로 사용합니다. 여기에 상대적 이점 기반 신용 할당(Relative-advantage-based credit assignment, RACA)을 추가하여 이 잔차를 토큰에 분배함으로써 밀도 높은 토큰 수준 지침을 유지하면서 검증자 결과를 통합할 수 있음을 보였습니다.
GC-OPD를 적용한 후, Qwen3-4B와 Qwen3-8B 체크포인트의 5개 벤치마크 평균 점수는 각각 29.08에서 40.47, 35.12에서 44.65로 크게 향상되었습니다. 이는 그룹 상대 잔차 보정이 밀도 높은 토큰 수준 지침을 버리지 않으면서 검증자 결과를 효과적으로 통합할 수 있음을 입증합니다.
arXiv AI/ML
arXiv API
논문
발행 2026-08-19
Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang, Zihan Zhou, Zhiyuan Wang, Shuo Wang, Chaojun Xiao, Yuezhi Zhou
수집 2026-08-20 02:18
이 기술 보고서는 음성 모방을 통한 소리 질의라는 주제로 AES AIMLA 2025 챌린지에서 수상한 제출 결과를 설명합니다. 연구진은 두 가지 상호 보완적인 미세 조정 전략을 조사했습니다.
첫 번째 전략은 사전 학습된 고정된 CED 인코더를 사용하는 대조 학습(contrastive learning)입니다. 두 번째 전략은 MobileNetV3 인코더를 사용하여 반(semi-)하드 부정 샘플을 활용하는 공동 대조-삼중항 학습(joint contrastive-triplet learning)입니다.
이 보고서는 챌린지 이후 공개된 세부 사항을 포함하도록 후대에 업데이트되었습니다. 이는 음성 모방을 이용한 소리 질의 작업에 적용할 수 있는 구체적인 미세 조정 방법론을 제시한다는 점에서 개발자들에게 중요한 참고 자료가 됩니다.
arXiv AI/ML
arXiv API
논문
발행 2026-08-19
Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang, Emmanouil Benetos
수집 2026-08-20 02:18
불규칙하게 샘플링된 시계열에 대한 딥 모델은 질의에 답할 수 있지만 각 답변을 얼마나 신뢰해야 하는지에 대한 불확실성을 보고하지 못합니다. 이 논문은 어텐션 레이어 자체를 통해 이 간극을 메울 수 있음을 보여줍니다. 확률론적 공식화를 통해 각 예측이 얼마나 신뢰할 수 있는지 계산하고, 이를 추가 비용 없이 닫힌 형태로 보고하는 방법을 제시합니다.
저자들은 레비 어텐션(Lévy Attention)을 도입했는데, 이는 비균일 포아송 랜덤 측정에 대한 확률적 적분으로 정의되는 교차 어텐션 연산자입니다. 이는 쿼리-키 호환성을 사용하여 연속적인 인덱스 공간에 강도를 구성하고, 이 강도 아래에 원자를 분산시킨 후, 해당 원자들의 평균화된 값 필드를 출력합니다. 기대값으로는 완화된 코사인 커널 어텐션으로 환원되어 소프트맥스 레이어를 대체하며 정확한 기울기로 훈련이 가능합니다.
소프트맥스가 버리는 정보와 달리, 포아송 구성은 증거($\Lambda_q$)와 불일치($\mathrm{tr}\,Σ_V(q)$)를 닫힌 형태로 보존합니다. 이 두 요소를 결합하여 샘플링된 연산자의 평균 제곱 편차 $\hat\sigma(q)$를 도출하며, 이는 훈련되지 않은 헤드를 가진 결정론적 통과를 통해 방출됩니다. 실증적으로 불일치가 신호를 전달하며, 증거 요인은 밀집된 데이터에서는 정보가 부족하지만 희소한 데이터에서는 강력한 정보를 제공합니다.
t-PatchGNN 실험에서 연산자 교체 비용은 최대 5.6%의 정확도 손실만을 보였으며, 불일치 신호는 20회 마르코프 체인 드롭아웃에서 개선되었습니다. 또한 $\hat\sigma$는 0 샘플 CRPS에서 50회 샘플러보다 우수한 가우시안을 조정하며, 단 한 번의 통과만으로도 3,383명의 보지 못한 환자를 1.4초 만에 신뢰도에 따라 순위를 매길 수 있었습니다.
arXiv AI/ML
arXiv API
논문
발행 2026-08-19
Sotirios P. Chatzis, Loukas Papadoulas
수집 2026-08-20 02:18