거대 언어 모델(LLM)은 대화의 반복적인 생성 및 수정 과정을 통해 사용자에게 결과물(artifact)을 제공하지만, 사용자가 수정 요청 시 국소적인 변경만을 지정할 경우 LLM은 관련 의존성을 파악하여 결과물의 모든 영향을 받는 부분에 수정 사항을 전파해야 하는 과제를 안고 있습니다. 이 논문은 대화 기록에 결과물의 맥락과 의존성이 포함된 대화 생성 결과물에서 LLM의 이러한 수정 전파 능력을 연구합니다.
연구는 이러한 능력에 초점을 맞추고 실용적인 사용을 위해 비용 효율적인 테스트 시간 컴퓨팅 방법을 탐구합니다. 이를 위해 새로운 벤치마크를 도입하고 순차적 반성(sequential reflection) 및 병렬 샘플링 변형을 포함한 아홉 가지 수정 방법을 평가했습니다. 평가에는 gpt-oss-20b/120b, gpt-5.4-mini, qwen3.5-9b/27b/122b와 같은 다양한 모델이 사용되었습니다.
평가 결과, 기준 모델들은 68.3%에서 93%의 정확도를 달성했으며, 가장 비용 효율적인 방법은 LLM 기반 또는 메도이드 선택을 사용하여 세 개의 병렬 샘플 중에서 선택하는 방식으로, 정확도를 2.2%에서 9.7%까지 향상시켰습니다. 이 연구는 LLM 기반 결과물의 수정 전파 문제를 해결하고 비용 효율적인 방법을 제시하며, 관련 코드와 데이터셋은 GitHub에서 공개되어 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Daisuke Kikuta
수집 2026-09-08 03:29
비전-언어 모델(VLM)은 일반적인 멀티모달 작업에서는 뛰어난 성능을 보이지만, 물리적 세계에 대해 추론할 때는 근본적으로 '평면적'이라는 한계를 가집니다. 이는 VLMs가 2차원 투영을 해석하도록 훈련되었기 때문에 발생하며, 실제 공간 추론을 위해서는 잠재된 3차원 기하학과 시간적 연속성을 복구해야 하는 차원 불일치에서 기인합니다.
이러한 고차원적 복잡성을 극복하기 위해 연구진은 단일 학습 방식에서 벗어나 '분할 정복(divide and conquer)' 패러다임을 제안합니다. 이를 위해 FactoSR이라는 분해된 강화 학습 프레임워크를 제시했는데, 이는 시각적 투영에 의해 소실된 차원들을 명시적으로 해석합니다. FactoSR의 핵심은 세계 일관성 추론이라는 단일 문제를 평면 대응(XY), 깊이 일관성(Z), 시간 반전성(T)이라는 세 가지 직교적인 기하학적 하위 목표로 분해하는 것입니다.
이러한 검증 가능한 제약 조건들을 통합된 정책 학습 메커니즘 내에서 최적화함으로써, 연구진은 모호한 투영 복구 문제를 구체적인 추론 단계로 변환시킵니다. 다중 시점 및 비디오 벤치마크에 대한 광범위한 평가 결과, 이러한 우아한 분해는 3차원 및 4차원 추론에서 상당한 이점을 제공하며, VSI-Bench에서 5.9%, All-Angles-Bench에서 4.5%의 성능 향상을 달성했습니다.
연구 결과는 명시적이고 분해된 4차원 일관성을 강화하는 것이 VLMs를 더욱 강력하고 세계를 인식하는 추론자로 발전시키는 데 결정적인 단계임을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Yijun Yang, Shenghe Zheng, Wenbo Li, Jianhui Liu, Haoze Sun, Yanbing Zhang, Jiaxiu Jiang, Lin Song, Haoyang Huang, Nan Duan, Lei Zhu
수집 2026-09-08 01:28
LLM 에이전트가 동물을 죽이는 것을 피하기 위해 지불할 의사를 측정하는 새로운 벤치마크인 HarvestBench가 발표되었습니다. 이 벤치마크는 기존의 측정이 목표 달성 과정에서 발생하는 부작용을 측정하는 것과 달리, 부작용을 살아있는 생명체로 명명하고 이에 대한 가격을 매기는 최초의 시도입니다.
HarvestBench는 농장 시뮬레이션 환경에서 LLM 하위 에이전트들이 두 대의 트랙터를 통해 옥수수 수확을 진행하는 환경을 사용합니다. 이 환경은 강화 학습 그리드월드이며, 모든 결정은 기억 없이 이루어지며 목표에는 피해가 명시되지 않습니다. 동물이 트랙터 경로를 막을 경우, 자동 조종 시스템은 연료 비용 없이 계속 운전하거나, 명시된 연료 가격을 지불하고 경로를 우회할지 모델에게 질문합니다. 이 실험에서 동물은 바위나 무해한 건초 더미와 비교되었으며, 모델들은 이웃 밭의 작물을 취하는 행위도 테스트되었습니다.
총 7,201개의 가격 책정된 결정에 걸쳐 9개의 모델을 평가한 결과, 3,951번의 결정에서 모델들은 건초 더미나 바위 대신 동물을 피하는 선택을 했습니다. 살상률은 0.4%에서 98.8%까지 다양했으며, Terra와 Sol 모델이 가장 자비로웠고 GPT-4o-mini는 가장 잔혹했습니다. 특히 도덕성 브리핑을 적용했을 때, 6개 모델 중 5개 모델에서 살상률은 6% 미만이었으나, 이 브리핑을 제거하자 모든 모델에서 살상률은 84% 이상으로 증가했습니다.
이 벤치마크는 모델이 피해에 대해 무엇을 말하는지보다는 피해를 피하기 위해 무엇을 지불할 의향이 있는지를 측정합니다. HarvestBench는 LLM 평가자를 사용하지 않고 게임 로그의 이벤트를 세어 측정하므로 완벽하게 재현 가능하며, 에이전트의 행동에 대한 민감도와 도덕적 판단의 영향을 구체적으로 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Jasmine Brazilek, Miles Tidmarsh, Matthias Endres, Anshuman Singh, Jeremiah Miller
수집 2026-09-07 17:21
2026년 PNPL 대회는 비침습적 음성 디코딩을 위한 다년 과정의 목표를 가지고 진행되었습니다. 이 대회는 기초적인 음성 탐지 및 음소 분류 작업에서 출발하여 실제 뇌-컴퓨터 인터페이스(BCI)에 필요한 언어적 복잡성으로 발전시키는 것을 목표로 했습니다. 이전 대회에서 LibriBrain 데이터셋을 활용하여 강력한 성능을 입증했으나, 실제 BCI를 구현하기 위해서는 수 시간의 데이터가 아닌 몇 분의 데이터로 새로운 사용자에게 일반화할 수 있는 능력이 필요하다는 한계가 지적되었습니다.
이러한 일반화 문제를 해결하기 위해 2026년 대회에서는 LibriBrain100 데이터셋을 확장하여 32개의 추가 피험자를 포함시켰습니다. 이 데이터셋은 기존의 내피험자 데이터 외에도 추가적인 내피험자 데이터({sim}80시간)를 포함하고 있습니다. 대회를 통해 제시된 두 가지 트랙은 내피험자 수준의 성능과 사용자 간 일반화 능력을 동시에 추구합니다.
딥 트랙은 대규모 내피험자 단어 분류를 목표로 최고의 성능을 달성하는 데 중점을 둡니다. 반면, 브로드 트랙은 사용자 간 일반화를 목표로 하며, 피험자별 미세 조정 데이터의 양을 {sim}40분에서 {sim}20분에서 {sim}10분으로 점진적으로 줄이는 것을 목표로 합니다. 이 {sim}10분의 데이터 기간은 임상적으로 실행 가능한 범위에 속하며, 심각한 마비 상태에 있는 사람들에게 의사소통을 복원할 수 있는 비침습적 BCI에 한 걸음 더 다가갈 수 있게 합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Francesco Mantegna, Gereon Elvers, Dulhan Jayalath, Gilad Landau, Tasha Kim, Miran Özdogan, Luisa Kurth, Teyun Kwon, SungJun Cho, Benjamin Ballyk, Alex Fung, Anna Greer, Pratik Somaiya, Christian Herff, Yorguin Mantilla Ramos, Hamza Abdelhedi, Karim Jerbi, Greg Farquhar, Brendan Shillingford, Mark Woolrich, Oiwi Parker Jones
수집 2026-09-07 16:21
오디오-비디오 확산 모델은 텍스트, 음성, 시각 콘텐츠를 조정하기 위해 교차 모달 어텐션을 사용하지만, 이 메커니즘은 미묘하고 체계적인 의미 누수(semantic leakage)를 발생시킬 수 있습니다. 연구진은 이 모델들을 분석하기 위해 텍스트, 오디오, 비디오 스트림을 연결하는 세 개의 교차 어텐션 엣지로 구성된 '어텐션 삼각형'을 탐색하고 분석했습니다.
분석 결과, 오디오-비디오 엣지를 따라 이루어지는 라우팅은 양방향이며, 오디오는 비디오 생성에 영향을 미치고 비디오는 오디오 생성에 영향을 미칩니다. 이 엣지는 모델 파라미터에 인코딩된 편향에 의해 형성되며, 프롬프트가 학습된 사전 지식과 충돌할 때 교차 모달 상호작용이 의도된 조건화를 무시하고 의미를 시각적으로는 정형화되어 있으나 잘못된 결과로 재라우팅하여 누수의 주요 원인이 됩니다.
이러한 현상은 의미적 인공물이 단순히 어텐션이 의도된 대상을 넘어 퍼지는 것이 아니라 특정 경로를 따라 편향에 의해 구조화된 상호작용에서 발생함을 시사합니다. 연구진은 이러한 의미 분포와 기반을 노출하는 어텐션 기반 신호를 추출하여 통제된 조건 하에서 누수를 분석하고 의도적으로 발생시킬 수 있는 진단 도구로 활용했습니다.
궁극적으로 이 신호들을 활용하여 추론 시점 개입(inference-time interventions)을 안내함으로써 교차 모달 정렬을 더욱 일관되게 만들 수 있습니다. 광범위한 실험 결과는 생성 품질을 유지하면서 의미적 기반을 개선했음을 입증하며, 이는 모델의 내부 동역학을 탐색하고 개별 상호작용의 역할을 분리하는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Sagi Polaczek, Noa Kraicer, Gal Metzer, Zhuo Ning, Ali Mahdavi-Amiri, Daniel Cohen-Or, Raja Giryes
수집 2026-09-07 09:15
시각적 장소 인식(VPR)은 데이터셋의 제한된 외관 다양성으로 인해 조명, 날씨, 계절 변화와 같은 도메인 변화로 인해 견고성이 저하되는 문제가 있습니다. 이러한 문제를 해결하기 위해 본 연구는 견고한 VPR 훈련을 위한 동일 장소의 하드 포지티브를 생성하는 경로 인식 생성 증강 프레임워크인 AdaptVPR을 제안합니다.
AdaptVPR은 비전 언어 모델을 사용하여 장면 속성을 분석하고 편집 가능성을 추정하며, 규칙 기반 스케줄러를 통해 편집 가능성과 위험 제약 조건에 따라 생성 경로를 결정합니다. 생성 과정은 전역 외관 경로, 국소 가림 경로, 그리고 두 경로를 결합한 이중 경로 등 세 가지 상호 보완적인 경로로 분해됩니다. 각 생성 후보는 기하학적 일관성과 외관 다양성을 기반으로 하는 VPR 지향 검증 방식을 사용하여 구조적 표류 위험을 줄입니다.
이러한 프레임워크를 통해 160K개의 검증된 합성 동일 장소 하드 포지티브를 포함하는 AdaptCities 데이터셋을 구축했습니다. 여러 VPR 기준선과 비전 파운데이션 백본에 대한 실험 결과, 표준 벤치마크에서 일관된 성능 향상과 도전적인 도메인 변화 하에서 상당한 개선을 보였으며, R@1 지표에서 최대 9.2%의 이득을 달성했습니다.
해당 연구의 소스 코드와 데이터 리소스는 공개되어 있으며, 개발자들은 https://github.com/chenshunpeng/AdaptVPR에서 접근할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Shunpeng Chen, Jingyi Zhang, Changwei Wang, Shengpeng Xu, Yukun Song, Xingtian Pei, Jinzhou Lin, Li Guo, Shibiao Xu
수집 2026-09-07 05:13
검색 에이전트 분야에서 Iris-mini와 Iris-pro라는 두 모델이 발표되었으며, 이들은 각각 35B-A3B와 397B-A17B 규모로 훈련되었습니다. 이 연구는 웹 코퍼스의 하이퍼링크 구조를 역으로 추적하여 작업과 데이터를 구성하는 데이터 파이프라인과 훈련 레시피를 제시합니다. 구체적으로, 모델은 시드 페이지와 아웃링크에서 추출된 엔티티 그래프를 기반으로 멀티홉 체인을 구성하고, 문자열 매칭으로 단서를 해결할 수 없도록 모든 비답변 엔티티를 설명적 참조로 재작성하는 방식으로 태스크를 역으로 구성합니다.
이러한 데이터는 참조 모델이 닫힌 책(closed-book) 방식으로 해결하지 못하지만, 지원 증거가 제공되면 해결할 수 있는 질문만을 허용하도록 설계되었습니다. 이 질문들은 궤적(trajectory)으로 변환되어 SFT 전에 궤적 및 턴 레벨에서 필터링됩니다. 정책은 라이브 검색에 대해 강화 학습(RL)을 통해 최적화되며, 보상 판단자와 관찰 요약자는 훈련 클러스터 내에서 제공됩니다.
훈련 과정은 SFT-RL 클라이밍이라는 절차를 통해 두 단계를 교차하며, 각 RL 라운드의 가장 효율적이고 가장 잘 해결된 궤적을 다음 지도 학습 단계로 반환합니다. 이 방법은 추론 시 컨텍스트 관리가 시스템 간의 차이보다 더 중요함을 평가하며, 도구 세트, 컨텍스트 제한, 판단 기준을 고정시킨 상태에서 모든 벤치마크를 평가합니다.
관리 기능이 활성화된 상태에서 BrowseComp, BrowseComp-ZH, DeepSearchQA, HLE 벤치마크에서 두 모델은 각각 82.2/88.6, 84.8/85.1, 86.9/92.9, 52.3/56.4의 결과를 달성했습니다. 이는 해당 매개변수 범위 내에서 오픈 소스 검색 에이전트 중 가장 강력한 결과를 보여줍니다. 연구팀은 모델 가중치와 데이터 구성, 훈련, 평가에 대한 전체 레시피를 공개할 계획입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang, Xu Chu, Shaowei Chen, Yuantao Gu, Mu Chuan
수집 2026-09-07 02:11
재귀 신경망에서 양자화(Quantization)는 연산 및 메모리 요구 사항을 줄이는 데 널리 사용되지만, 이 과정에서 상태 저장 규칙이 후속 계산에 영향을 미쳐 문제가 발생할 수 있습니다. 본 연구는 이러한 규칙을 나타내기 위해 재귀 상태 쓰기(recurrent-state write-back)를 도입하여 양자화된 재귀 역학의 영향을 분리하고자 합니다.
이 방법은 형광 수명 이미징(fluorescence lifetime imaging)을 위한 GRU 인코더-디코더에 적용되었는데, 이는 정량적 생물학적 이미징에 사용되는 분자 이미징 양식입니다. 이 모델의 주요 임무는 고잡음 시간 분해 형광 신호로부터 단명 성분 $\tau1$과 장명 성분 $\tau2$ 두 가지 수명 매개변수를 추정하는 것입니다.
훈련된 모델을 고정하고 연속적인 상태 전파 대신 결정론적인 4비트 상태 저장을 사용했을 때, $\tau1$과 $\tau2$에 대한 추정 오류는 각각 약 70배와 300배 증가하는 것으로 나타났습니다. 이는 반복적인 작은 업데이트가 쓰기 임계값 이하로 남아 저장된 상태가 거의 고정된 채 네트워크가 변화를 제안하는 상황에서 실패가 발생하기 때문입니다.
오류 피드백, 잔여 메모리, 방향 메모리 등의 기법을 통해 재학습 없이 정확도를 회복할 수 있으며, 연구 결과는 재귀 상태 쓰기(recurrent-state write-back)가 저정밀 재귀 역학의 핵심 결정 요인임을 입증합니다. 또한, 이 연구는 양자화된 재귀 추론을 위해 상태 저장 인터페이스를 핵심 설계 고려 사항으로 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Ismail Erbas, Xavier Intes, Vikas Pandey
수집 2026-09-07 02:11
고성능 가속기용 커스텀 커널 설계는 깊은 하드웨어 지식이 필요한 복잡한 작업입니다. 이 연구는 대규모 언어 모델(LLM)과 실시간 컴파일러 피드백을 결합하여 커널 생성을 위한 에이전트 시스템을 구축하는 MaxKernel을 제시합니다. MaxKernel은 TPU 커널 개발을 위한 세 가지 뚜렷한 패러다임을 구현하는 멀티 에이전트 시스템입니다.
첫 번째는 협업적 단계별 설계를 위한 인간 참여(Human-in-the-Loop, HITL) 에이전트이며, 두 번째는 측정 및 추적 기반 최적화 루프를 실행하는 자율(Autonomous, Auto) 에이전트입니다. 세 번째는 설계 공간의 전역 탐색을 위해 Auto 에이전트를 확장하는 그래프 기반 자율 검색입니다. 이 세 가지 패러다임은 계획, 구현, 자체 디버깅, 테스트, 하드웨어 프로파일링을 처리하기 위해 공유된 전문 서브 에이전트 풀을 활용합니다.
연구진은 MaxKernel을 JaxBench라는 50가지 다양한 TPU 커널 작업과 최신 오픈소스 모델의 복잡한 실제 워크로드를 평가했습니다. 그 결과 MaxKernel은 전문가가 수동으로 조정한 기준선과 일치하는 고도로 최적화된 구현을 일관되게 생성하며 벤치마크 전반에 걸쳐 상당한 성능을 제공함을 입증했습니다.
이 에이전트는 오픈 소스로 공개되어 있으며 GitHub를 통해 접근 가능합니다. 이 연구는 LLM을 활용하여 하드웨어 수준의 커널 최적화 과정을 자동화하고 고성능 커널 개발을 가속화하는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Shangkun Wang, Nina Cai, Charles Hoong, Julian Walker, Gerson Kroiz, George Vanica, Deepak Patil, Andi Gavrilescu, Hassan Sipra, Sethu Sankaran
수집 2026-09-07 02:11
대규모 언어 모델(LLM)이 기존 코드를 편집하는 데 사용되지만, 단순히 정확성만으로는 충분하지 않으며 수정 사항은 최소화되고 검토 가능하며 원본 구현에 충실해야 합니다. 본 연구는 버그 수정을 위해 필요한 최소한의 수정 외에 코드를 과도하게 재작성하는 경향인 과도 편집(over-editing) 현상을 탐구합니다.
연구진은 400개의 BigCodeBench 문제를 기반으로 AST 수준의 손상을 주입하고 각 수정 작업에 알려진 최소 패치를 제공하는 평가 프레임워크를 구축했습니다. 이 결과, GPT-5.5와 같은 강력한 모델에서도 높은 Pass@1 점수가 불필요하게 큰 수정과 추가된 인지 복잡성을 수반하는 경우가 광범위하게 관찰되었습니다.
이러한 과도 편집을 방지하기 위해 보존 지침(preservation instruction)을 추가했을 때 이러한 행동이 크게 감소했습니다. 보존 지침은 평균 과도 레벤슈타인 거리(excess Levenshtein distance)를 0.195에서 0.131로 낮추고 추가된 인지 복잡성을 26.6% 줄이며 Pass@1 점수를 2.3점으로 증가시켰습니다.
하지만 이러한 개선은 단순히 더 큰 추론 예산이나 더 큰 모델에서 비롯된 것이 아니었습니다. 연구는 추가적인 편집 품질을 학습하는 방법에 초점을 맞추었으며, 지도 미세 조정(supervised fine-tuning)은 관찰된 손상 패턴에 과적합되는 반면, 강화 학습(reinforcement learning)은 도메인 외 편집 충실도와 성능 유지를 위한 최적의 균형을 제공했습니다. 결과적으로 편집 충실도를 코드 수정 품질의 별도 축으로 설정하고 측정 및 학습할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Tongyao Zhu, Wei Hern Lim, Min-Yen Kan
수집 2026-09-07 02:11
Go의 내장 맵이 스위스 테이블을 사용하여 어떻게 작동하는지 내부 구현을 자세히 설명합니다. Go 1.24 버전에서 맵의 런타임 구현이 이전 방식에서 스위스 테이블 기반 설계로 변경되었으며, 이는 맵의 효율적인 키 검색을 가능하게 합니다.
맵은 키와 값의 쌍을 저장하며, 키는 배열의 인덱스와 달리 어떤 비교 가능한 타입이든 될 수 있습니다. 런타임 레벨에서 맵은 내부적으로 `maps.Map` 구조를 사용하며, 이 구조는 항목의 개수(`used`)와 시드(`seed`)와 같은 정보를 포함합니다. 맵의 항목 개수를 조회할 때 전체 맵을 스캔할 필요 없이 O(1) 시간 복잡도로 접근할 수 있도록 설계되었습니다.
실제 데이터 저장 방식은 맵의 시드를 사용하여 키를 해시하고 이 해시 값을 기반으로 저장 위치를 결정하는 방식으로 이루어집니다. 맵의 가장 작은 저장 단위는 최대 8개의 키-값 쌍을 담는 `group`이며, 각 그룹은 8개의 제어 바이트로 구성되어 있습니다. 이 제어 바이트는 키 해시 값에서 파생된 H1과 H2 값으로 나누어져 각 저장 위치를 지정하는 데 사용됩니다.
Hacker News
논문
발행 2026-09-03
valyala
수집 2026-09-06 11:59
장기 목표 에이전트 훈련에서 보상 신호가 부족한 문제를 해결하기 위해 DRACO라는 방법론이 제안되었습니다. 이 연구는 결과에 대한 참값 성공 신호가 없는 결과 불감(outcome-blind) 환경에서 다중 기준 루브릭(multi-criteria rubrics)을 활용하여 보상을 제공하는 데 중점을 둡니다. 기존의 단일 스칼라 보상은 수십 단계에 걸친 과정에서 부적절한 신호가 되기 때문에, DRACO는 훈련 중에 루브릭을 동적으로 생성하여 정책의 진화하는 능력을 추적하고 이를 바탕으로 각 단계별 이점을 재분배합니다.
DRACO는 루브릭을 한 번의 궤적당 점수화한 후, 해당 루브릭이 주석 처리된 단계들에 그 판단을 재분배하여 GRPO에서 차별화된 단계별 이점을 생성합니다. 이 재분배 과정은 폐쇄형 공식으로 이루어져 있으며 훈련된 속성 모듈을 도입하지 않아 효율적입니다.
실제 실험 결과, DRACO는 검증기(verifier)를 사용하지 않고도 AppWorld 환경에서 기본 모델 대비 15.9점, 그리고 희소한 참값 보상을 사용한 GRPO 대비 5.3점의 이점을 얻었습니다. 또한, 도메인 외 Tau-Bench 환경에서는 프론티어 심판 없이도 기본 모델보다 5.3점의 이점을 달성하며 다른 루브릭 기반 훈련 설정들을 능가했습니다.
DRACO의 코드는 GitHub에서 공개되어 있으며, 이는 장기 에이전트 훈련에서 복잡한 보상 신호를 효과적으로 최적화하는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk
수집 2026-09-04 15:27
장시간 비디오 언어 모델(MLLM)은 모든 프레임을 볼 수 없기 때문에, 프레임 선택이 사전 처리 세부 사항인지에 대한 연구를 진행했습니다. 연구는 프레임 선택, 공간 압축, 그리고 절약된 토큰 재투자라는 세 가지 결정 요소를 통제된 환경에서 비교했습니다.
선택(Selection)은 가장 큰 영향력을 보였는데, LongVideoBench의 한 시간 분량 데이터에서 쿼리 선택된 여덟 개의 프레임은 균일하게 배치된 열여섯 개의 프레임보다 6.9점 더 높은 정확도를 보였습니다. 공간 압축(Compression)은 비용이 매우 낮았으며, 각 프레임의 공간 예산을 절반으로 줄이는 것은 최대 0.44점의 비용만 발생했습니다.
실제 정확도 향상은 절약된 토큰을 재투자(Reinvestment)할 때 발생했는데, 절약된 토큰을 사용하여 두 배 많은 압축된 프레임에 할당했을 경우, 원래 여덟 개의 프레임에 할당했을 때보다 2점에서 3점의 추가 정확도를 얻을 수 있었습니다.
이러한 비교를 통해 결과의 신뢰성을 높이기 위해, 연구진은 구현 오류와 발표된 규칙 간의 차이를 고려하여 모든 비교를 단일하고 통제된 환경 내에서 수행할 필요가 있음을 지적했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Prakhar Khatri
수집 2026-09-04 11:25
온라인 3D 재구성 모델은 긴 비디오에서 성능이 저하되는 문제가 발생하는데, 이는 고정된 첫 프레임 앵커에 상대적인 자세를 회귀시키는 과정에서 훈련 분포를 벗어난 외삽이 발생하여 작은 드리프트가 누적되고 심각한 기하학적 붕괴로 이어지기 때문입니다. 하지만 이 실패 과정에서 프레임별 깊이와 백본의 국소 기하학은 안정적으로 유지되며, 오직 전역 자세 헤드만이 손상된다는 점을 관찰했습니다.
이러한 분리(decoupling)를 바탕으로 Scal3R을 제안하며, 온라인 재구성을 다중 참조 상대 자세 쿼리(multi-reference relative pose querying)로 재정의합니다. Scal3R은 전체 백본을 고정하고 비대칭 어텐션(asymmetric attention)을 통해 약 1%에 불과한 경량 학습 토큰(learnable tokens)을 주입하여 여러 과거 키프레임에 대한 자세를 쿼리합니다. 또한 루프 클로저(loop closure)를 포함하는 온라인 자세 그래프 최적화 시스템을 사용하여 장거리 드리프트를 억제합니다.
이 시스템은 단일 GPU에서 8시간 만에 수렴하며, KITTI 데이터셋에서 온라인 기준 대비 평균 ATE를 60% 이상 감소시킵니다. Scal3R은 Virtual KITTI, Sintel, TUM-Dynamic, ScanNet, 7-Scenes 등 다양한 데이터셋에서 최고 성능을 달성했습니다. 이 연구는 온라인 3D 재구성의 안정성과 효율성을 개선하는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Wei-Chen Chiu, Yu-Lun Liu
수집 2026-09-04 08:23
개인화된 비서가 사용자의 요청을 단순히 이행하는 것을 넘어 현재 상황에 비추어 적절한지 평가해야 한다는 필요성이 제기되었습니다. 기존 연구들은 요청의 정확한 실행에 초점을 맞추었기 때문에, 비서가 맥락을 고려하고 충돌 기반 거부를 수행하는 필요성을 간과했습니다. 특히 충돌이나 안전성을 감지하는 기존 방법들은 명시적으로 제공된 요인에 의존하는 반면, 실제 시나리오는 지식 기반(KB)에서 암묵적인 요인을 검색해야 하는 경우가 많습니다.
이러한 문제를 해결하기 위해 연구진은 개인화된 비서의 충돌 평가를 위한 데이터셋인 Personalized Assistants for Conflict Evaluation (PACE)을 소개했습니다. PACE는 잘 정의된 페르소나를 기반으로 한 사용자 요청과 자기중심적 지식(egocentric KB) 사실을 쌍으로 구성하여, 모델이 문맥적 증거를 통합하여 요청이 충돌하는지 판단하도록 요구합니다. 그러나 이러한 암묵적 검색 설정은 사용자 요청과 충돌을 유발하는 지식 간의 직접적인 연관성을 어렵게 만들어 기존 모델이 관련 사용자별 사실을 식별하는 데 어려움을 줍니다.
이러한 도전을 해결하기 위해 연구진은 다중 에이전트 프레임워크인 PaceMaker를 제안했습니다. PaceMaker는 질의 재구성, 다중 홉 그래프 탐색, 충돌 인식 필터링을 통해 문맥적으로 결정적인 증거를 검색하는 전문 에이전트들을 조정합니다. PACE 실험 결과, PaceMaker는 증거 검색 품질과 충돌 결정 정확도 모두에서 기존 접근 방식보다 일관되게 우수한 성능을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Yoojin Kim, Jihyoung Jang, Hyounghun Kim
수집 2026-09-04 06:21
스트리밍 비디오 이해를 위해서는 멀티모달 대규모 언어 모델(MLLM)이 엄격한 인과관계와 제한된 메모리 하에서 연속적인 시각 입력을 처리해야 합니다. 기존 접근 방식은 과거 관찰을 외부 메모리 뱅크에 압축하고 관련 증거를 검색하여 추가 시각적 맥락으로 사용하는 저장 및 검색 패러다임을 취합니다. 그러나 이러한 방식은 과거 증거를 지속적인 스트리밍 추론을 안내할 수 있는 작고 진화하는 잠재적 메모리로 내재화하는 것을 방해합니다.
이러한 격차를 해소하기 위해 본 논문은 스트리밍 메모리를 저장 및 검색에서 검색 및 내재화로 전환하는 점진적인 잠재적 작업 메모리 프레임워크인 LatentStream을 제안합니다. LatentStream은 세 가지 조정된 구성 요소로 이루어져 있습니다. 첫째, 질의에 구애받지 않는 계층적 스트리밍 메모리는 Jenks 가이드에 따라 시각 역사를 짧은 기간, 중간 기간, 장기 기간으로 조직하여 고정된 메모리 예산 내에서 잠재적 메모리로 내재화합니다.
다음으로, 계층적 잠재적 메모리 진화는 잠재적 메모리 토큰 그룹에 점진적으로 확장되는 메모리 수용 범위를 부여하여 해당 범위에서 과거 증거를 반복적으로 검색하고 이를 고정된 길이의 잠재적 메모리로 내재화합니다. 마지막으로, 점진적 신뢰도 기반 잠재적 메모리 최적화는 그룹별 예측 엔트로피로부터 계층적 진행 보상을 구성하여 잠재적 메모리 토큰과 검색된 증거를 공동으로 정제함으로써 점점 더 자신감 있는 스트리밍 추론을 장려합니다.
광범위한 실험 결과는 LatentStream이 기존 온라인 및 오프라인 비디오 벤치마크에서 새로운 최고 수준의 결과를 달성했음을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan
수집 2026-09-04 04:20
Puffin-World는 외부 오프라인 모듈에 의존하지 않고 물리적 이해, 공간 시뮬레이션, 3D 세계 생성 및 재구성을 통합하는 통일된 멀티모달 아키텍처를 제안합니다. 이 프레임워크는 3D 세계를 안정적으로 구축하고 상호작용하기 위해 물리학(중력장 및 위도), 기하학(깊이), 외관(이미지)이라는 세 가지 고유한 세계 상태를 공동으로 모델링합니다.
이 모델은 다양한 작업과 유연한 움직임을 지원하는 통일된 옴니-카메라 표현을 함께 사용합니다. 또한, 미래 프레임에 걸쳐 물리적 역학을 전파하는 전략을 도입하여 절대적인 카메라 속성을 실제 세계에 기반을 두게 함으로써 물리적으로 일관되고 시각적으로 안정적인 세계 생성을 가능하게 합니다.
Puffin-World는 외관과 기하학을 단일 생성 과정 내에서 결합하여 각 미래 시점을 합성하고 그 기하학을 재구성합니다. 이러한 통합된 패러다임은 모방 및 자가 보정 세계 탐색을 포함하여 여러 작업 간의 시너지가 필요한 인터리브된 폐쇄 루프 애플리케이션을 가능하게 합니다.
복잡한 시나리오로 확장하기 위해 Puffin-16M을 구축하여 15백만 개의 시각-언어-카메라 삼중항과 다양한 움직임을 포함하는 1백만 개의 궤적을 포함시켰습니다. 연구를 촉진하기 위해 관련 코드, 모델, 데이터셋이 공개되었습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu, Chunyu Lin, Yao Zhao, Fei Wang, Wei Li, Chen Change Loy
수집 2026-09-04 04:20
온폴리 정책 증류(OPD)는 학생이 생성한 롤아웃과 교사로부터의 밀집된 토큰 수준 감독을 결합하는 방법입니다. 기존 연구들이 OPD의 알고리즘적 행동에 주로 초점을 맞추었기 때문에 훈련 데이터의 역할은 불분명했습니다. 본 연구는 단일 쿼리 훈련을 통해 데이터 최소 한계에서 이 데이터의 역할을 탐구했습니다.
단일 쿼리 기반 OPD는 수백 단계에 걸쳐 계속 개선되며 전체 데이터 기반 OPD의 이득 대부분을 다른 작업 도메인과 모델 패밀리 전반에서 회복합니다. 연구진은 훈련 중 방문한 상태와 학생이 교사와 정렬하는 속도를 통해 이 결과를 설명합니다. 단일 쿼리만으로도 이미 100단계 내에 71.5%의 상태 커버리지를 달성하며, 의미적으로 구별되는 쿼리를 추가하면 커버리지와 검증 정확도가 함께 향상되어 16개의 쿼리가 전체 데이터 훈련과 일치하는 98.9%에 도달합니다.
하지만 정렬 속도는 단일 쿼리 훈련이든 전체 데이터셋 훈련이든 비슷한 속도로 느려지며, 고정된 상태 집합을 흡수하는 데도 수백 단계가 필요합니다. 이는 OPD가 데이터는 과도하게 공급받았지만 알고리즘은 부족한 상태임을 시사합니다. 상태 커버리지 결과는 다중 교사 OPD(MOPD)로 확장되어 각 도메인당 16개의 의미적으로 다양한 쿼리가 전체 데이터 기반 MOPD와 일치함을 보여줍니다.
추가적인 스트레스 테스트에서 콘텐츠가 적은 템플릿과 도메인 외부의 WildChat 쿼리 역시 실제 쿼리 기준선에 근접했습니다. 따라서 작업 콘텐츠와 유도된 상태 커버리지는 서로 분리될 수 있습니다. 연구진은 이러한 발견이 OPD의 단계 효율성에 초점을 맞추고, 최근 사전 훈련 후 성공의 데이터와 메커니즘을 재검토하도록 촉구합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang, Ruhang Xiao, Cheng Qian, Qinyu Luo, Huan-ang Gao, Yudong Wang, Zhiyuan Liu, Ning Ding, Chaojun Xiao
수집 2026-09-04 03:19
대규모 언어 모델은 확장된 추론이 필요한 작업에서 우수한 성능을 보이지만, 긴 사고 과정은 KV 캐시를 심각한 메모리 병목 현상으로 만듭니다. 기존의 KV 캐시 압축 방법들은 캐시된 토큰에 대한 중요도 추정치를 기반으로 점수를 매겨 상위 토큰만 유지하는 단일 패러다임을 공유합니다.
본 논문은 점수 신호가 거의 아무런 기여를 하지 않음을 보이며, 점수를 계산하지 않고 각 어텐션 헤드 내에서 균등하게 무작위로 토큰을 제거하는 랜덤 어텐션(Random Attention)을 제안합니다. 이 방법은 네 가지 모델과 여섯 가지 추론 작업에서 기존의 가장 강력한 제거자(evictor)와 일치하며 vLLM 배포 시 32~43% 더 높은 처리량을 제공합니다.
이러한 성능 향상은 캐시의 취약성과 추론 경로의 중복성에서 비롯됩니다. 프롬프트가 캐시의 취약한 부분이며 선택 신호의 차이는 프롬프트를 유지했는지 여부에 불과합니다. 또한 추론 흔적(reasoning trace)은 텍스트 내에서 모델이 필요한 것을 반복하고 어텐션 헤드 전반에 걸쳐 복사본을 유지함으로써 제거로부터 스스로를 보호합니다. 따라서 프롬프트가 안전해지면 무작위 추출만으로도 모델이 여전히 필요로 하는 충분한 복사본을 유지할 수 있어 점수가 필요하지 않습니다.
해당 연구의 코드는 공개되어 있으며 https://github.com/SalesforceAIResearch/Random-Attention 에서 확인할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Heng Wang, Jielin Qiu, Wenting Zhao, Cheng Qian, Liangwei Yang, Jiawei Han, Heng Ji, Silvio Savarese, Shelby Heinecke, Huan Wang
수집 2026-09-04 03:19
카메라 조건부 월드 모델은 명령된 행동이 예상되는 장면 변화를 유도하면서 외관, 기하학, 시간 역학이 일관성을 유지하는 상호작용 비디오를 생성합니다. 기존의 보상 모델들은 이러한 요구 사항들을 분리하여 평가하는데, 기하학 기반 보상은 궤적 실행을 추정하지만 실행된 움직임의 시각적 품질을 판단할 수 없으며, 이미지 기반 보상은 행동 실행이나 시간 역학을 포착하지 않고 프레임 품질만을 측정합니다.
이에 본 연구는 행동과 시각적 결과 사이의 관계를 연결하는 공유 추론 공간을 제공하는 비전-언어 모델(VLM)을 활용하여 행동 일관성과 시각적 품질 평가를 통합하는 새로운 쌍별 선호도 보상 모델인 WorldReward를 제시합니다. WorldReward는 쌍별 비디오를 행동에 맞게 정렬된 청크로 분해하고 각 청크를 구조화된 시각적 증거로 정리하여 행동 일관성과 시각적 품질 평가를 통합합니다.
이 모델을 훈련하기 위해 선도적인 VLM이 생성한 구조화된 판단과 도구 기반 에이전트 감사 및 목표 지향적인 인간 검토를 통해 구축된 대규모 추론 증강 선호도 데이터셋을 사용했습니다. 또한, 행동 일관성, 외관 품질, 움직임 품질에 대한 인간 선호도와 보상 모델의 일치를 측정하는 인간 주석 기반 벤치마크인 WorldReward-Bench를 도입했습니다.
WorldReward는 이 세 가지 차원에서 GPT-5.5를 각각 3.42%, 1.45%, 3.56 퍼센트 포인트 초과하는 최고 수준의 일치를 달성했습니다. 이 모델을 HY-WorldPlay 1.5의 강화 학습 후 훈련에 사용했을 때, 단기 및 장기 시간 범위에서 행동 실행과 시각적 품질 모두를 일관되게 개선하는 결과를 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-03
Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou, Jiazi Bu, Pengyang Ling, Feng Han, Zhixiong Zhang, Long Xing, Shengyuan Ding, Ziang Li, Cheng Jin, Yuhang Zang, Jiaqi Wang, Tianyu Pang
수집 2026-09-04 03:19