임베딩 기반 코드 검색은 코딩 에이전트와 검색 증강 코드 생성의 핵심 요소이며, 단순히 유사한 코드보다 정확한 코드를 검색하는 것이 더 중요합니다. 그러나 기존의 코드 검색 벤치마크는 각 쿼리의 정규 구현에 대한 실행 검증된 단일 수정 변형을 검색 풀에 포함하지 않아, 임베딩이 올바른 코드와 거의 동일하지만 잘못된 코드 사이의 기능적 차이를 구별할 수 있는지에 대한 질문이 해결되지 않았습니다.
이러한 문제를 해결하기 위해 연구진은 검색 풀 자체에 관련 반사실(counterfactuals), 즉 정규 구현과 거의 동일하지만 실행이 검증된 버그 변형을 포함하는 벤치마크를 제안합니다. 이 벤치마크를 통해 검색기(retriever)의 순위 지정이 주제나 동일성 중복이 아닌 기능적 차이를 직접적으로 테스트할 수 있도록 합니다. 연구팀은 939개의 파이썬 작업을 도입하여 각 작업마다 실행 검증된 정규 구현과 최대 네 개의 실행 검증된 버그 방해 요소를 쌍으로 구성했습니다.
ExecRetrieval 실험 결과, 이러한 반사실이 포함된 풀에서 상위 시스템은 exec@10 값은 1.00에 도달했지만 exec@1 값은 0.331에 불과했습니다. 또한, 4개 선도 시스템 전반에 걸쳐 순위 1 오류는 쌍으로 구성된 버그 변형인 경우 91.5%에서 99.4%의 확률로 발생했으며, 정규 코드 점수는 선도 시스템에서 67%에서 78%의 쿼리에서 최소한 네 개의 방해 요소 중 하나보다 낮았습니다.
전체 데이터셋, 실행 오라클, 임베딩 행렬, 환경 스냅샷 및 쌍별 통계 테스트 결과는 부록 D에 공개되어 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Aaryan Kapoor, Md Abdullah Al Hafiz Khan
수집 2026-09-03 03:01
동물 움직임에 대한 이해는 생물학 및 생체역학 모델링에 필수적이지만, 고품질 움직임 데이터 부족으로 인해 인간 움직임 연구에 비해 발전이 더디게 진행되어 왔습니다. 대부분의 동물은 통제된 환경에서 움직임을 포착하기가 비현실적이어서, 애니메이션과 같은 후속 응용 분야에 제한적인 데이터셋만 존재했습니다.
이러한 문제를 해결하기 위해 연구진은 비디오에서 움직임을 재구성하고 대규모로 움직임 사전 지식(motion priors)을 학습하며 실제 적용 가능한 움직임을 생성하는 프레임워크인 Kirin을 소개했습니다. Kirin은 야생 동물 비디오를 사용하여 3차원 움직임 시퀀스를 재구성하고 캡션과 쌍을 이루어 사족 보행 동물에 대한 정렬된 비디오-텍스트-움직임 튜플을 제공하는 최초의 대규모 데이터셋인 AiM3D를 구축했습니다.
이 AiM3D 데이터셋을 기반으로, 연구진은 텍스트와 이미지를 모두 조건으로 사용하여 다양한 동물 종에 걸쳐 현실적인 움직임을 안내하는 시각 기반 움직임 생성 모델을 개발했습니다. 최종적으로, 이 생성된 움직임을 활용하여 기존의 이미지-3D 모델을 통해 3차원 메시를 자동으로 리깅하고 애니메이션화하여 바로 렌더링할 수 있는 움직이는 동물을 만들어냅니다.
결과적으로 이 데이터셋과 프레임워크는 대규모의 텍스트 및 이미지 조건부 동물 움직임 생성 및 애니메이션을 위한 새로운 기반을 확립했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Brian Nlong Zhao, Zhuoyang Pan, James M. Rehg, Jiajun Wu, Shangzhe Wu
수집 2026-09-03 03:01
검색 및 광고 시스템에서 검색은 후보 집합을 선택하는 첫 단계이며, 최근에는 LLM을 활용하여 질의 확장, 데이터 합성, 검색 피드백 훈련 등을 통해 검색 성능을 개선하는 연구가 활발합니다. 그러나 기존 방식에서는 생성 요소가 주로 질의 측 증강에 사용되고 최종 매칭은 하위 검색기에게 위임되는 한계가 있었습니다.
본 논문은 이러한 한계를 극복하기 위해 CoGR이라는 새로운 검색 프레임워크를 제안하며, LLM이 질의와 아이템 양쪽 모두에서 직접 검색 표현을 구축하도록 훈련시킵니다. 각 생성기는 키워드 집합을 생성하고 이를 역 인덱스를 통해 직접 매칭하여 기존 키워드 기반 검색 인프라와의 호환성을 유지합니다.
CoGR은 두 단계의 훈련 파이프라인을 사용하는데, 먼저 지도 미세 조정(Supervised fine-tuning)을 통해 키워드 공간을 정렬한 후, GRPO를 이용한 공진화 강화 학습(co-evolving reinforcement learning)을 통해 질의 및 아이템 측 생성기를 서로의 고정된 인덱스에 대해 상호 최적화합니다. 이때 아이템 측은 생성된 키워드가 질의 측 F1에 미치는 변화를 측정하는 반사실적 한계 보상(counterfactual marginal reward)을 받습니다.
이러한 접근 방식은 10가지 대표적인 희소, 밀집, 생성 기준선에서 내부 APP 마켓플레이스 데이터셋과 공개 WANDS 벤치마크 모두에서 최고의 성능을 달성했습니다. CoGR은 가장 강력한 기준선 대비 F1 점수를 각각 10.9%와 36.1% 향상시켰으며, 훈련 과정에서 질의와 아이템 키워드 공간이 안정적으로 공진화하고 정렬됨을 추가 분석을 통해 확인했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Runpeng Dai, Kaili Huang, Changsung Kang, Ciya Liao
수집 2026-09-03 02:00
장기 실행 LLM 에이전트는 상호작용 전반에 걸쳐 권한, 제한, 취소 등의 상태를 유지하기 위해 영구 메모리에 의존합니다. 그러나 메모리가 이러한 진화하는 권한 상태를 잘못 표현할 경우, 에이전트의 기록 자체가 실제 이력이 허용하지 않은 권한을 부여하여 외부 공격 없이도 비정렬된 행동을 초래합니다. 연구진은 이러한 실패를 내재적 권한 세탁(endogenous authorization laundering)이라고 명명하며, 메모리에 기록된 허위 권한이 출처를 잃으면서 무단 행동으로 이어지는 현상을 설명합니다.
이 문제를 측정하기 위해 연구진은 영구 메모리가 진화하는 권한 상태를 얼마나 정확하게 보존하는지, 그리고 오류가 하위의 무단 행동으로 전파되는지를 측정하는 EAL-Bench를 도입했습니다. 이 벤치마크를 통해 다섯 개의 LLM을 메모리 작성자로, 두 개를 실행자로 평가했으며, 증분 메모리 업데이트 하에서 작성자는 무단 요청의 최대 50.2%에 해당하는 허위 권한을 생성하는 것으로 나타났습니다.
실제로 허위 권한이 존재하게 되면 실행자들은 98.6%의 실험에서 이를 바탕으로 행동을 취하는 것으로 확인되었습니다. 이러한 권한 세탁을 줄이기 위해 저장된 권한이 유효한 출처 이벤트에 의해 뒷받침되도록 하고, 경계가 있는 이벤트 소싱(bounded event sourcing)을 통해 권한 변경 사항을 추적하는 두 가지 안전장치를 제안했습니다. 하지만 이러한 안전장치는 더 합법적인 행동을 거부하기 때문에 안전성과 유용성 사이의 상충 관계를 노출합니다. 따라서 영구 메모리는 단순한 성능 구성 요소가 아니라 LLM 에이전트의 효과적인 권한 정책의 일부로 간주되어야 합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Tommaso Cerruti, Mika Okamoto, Ansel Kaplan Erol
수집 2026-09-03 00:59
모방 학습을 통해 습득된 숙련된 조작 정책이 작업 실행 속도 변화에 대해 얼마나 시간적 견고성을 유지하는지 비교 분석했습니다. 연구진은 동일한 작업 조건과 초기 조건 하에서 전문가와 액션 청킹 트랜스포머(ACT) 정책을 비교했으며, 이는 학습된 정책의 시간적 견고성을 평가합니다.
실험은 물체를 획득, 재정렬, 삽입하는 접촉이 풍부한 작업인 ParcelStow에서 진행되었으며, 물체 획득 후 조작 단계의 가속 범위에 걸쳐 시연이 이루어졌습니다. 스크립트화된 전문가와 전문가 시연으로부터 학습된 ACT 정책 모두 공칭 속도에서는 100%의 작업 성공률을 달성했지만, 최대 속도에서는 성공률이 크게 차이를 보였습니다. 전문가의 성공률은 84%였던 반면, ACT 정책의 성공률은 53%에 불과했습니다.
특히 ACT 정책은 공칭 속도에서 최대 시연 속도로 갈수록 성공률이 크게 저하되었는데, 이는 전문가의 성공률이 최대 속도에서 16% 감소한 것에 비해 34%에서 48% 포인트 감소한 수치입니다. 또한 최대 속도에서 발생한 ACT 실패 사례 중 35건은 삽입 정렬 오류로 나타났습니다. 상대 운동 핸드오프 상황에서 ACT 획득물은 64%만이 전체 작업을 완료한 반면, 전문가는 95%를 완료했습니다.
결론적으로 공칭 작업 성공률이 같더라도 실행 속도 변화에 따른 전문가 성능의 보존을 의미하지 않으며, 이는 모방 학습 정책이 실행 속도에 따라 시간적 견고성이 달라질 수 있음을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Clinton Enwerem, John S. Baras, Calin Belta
수집 2026-09-02 23:58
지식 증류(KD)는 더 강한 교사로부터 학습을 통해 작은 언어 모델(LM)을 훈련하는 데 사용되지만, 훈련 단계에 따라 그 이점이 달라진다는 연구 결과가 나왔습니다. 표준 KD 방식인 순방향 쿨백-라이블러(KL) 증류를 사용한 실험 결과, 사전 훈련 단계에서는 표준 다음 토큰 예측(NTP) 대비 추론 능력과 사실적 회상 능력이 동시에 향상되지만, 중간 훈련 단계에서는 추론 능력은 계속 향상되더라도 사실적 회상 습득이 오히려 느려지는 현상이 관찰되었습니다.
이러한 단계 의존성은 교사의 신뢰도 불균형과 학생의 지식 상태 변화에서 기인하는데, 교사는 절차적 데이터에 더 자신감을 가지는 반면 학생은 훈련 초기에 낮은 엔트로피의 사실적 지식을 습득하기 때문입니다. 연구진은 이러한 불균형을 완화하기 위해 중간 훈련 목표인 스위치 증류(Switch Distillation)를 제안했습니다. 스위치 증류는 교사가 자신감을 갖는 토큰에 집중하여 증류하고 교사의 예측 엔트로피를 경량 라우팅 신호로 사용하여 효율성을 높입니다.
스위치 증류는 기존 증류 목표보다 우수한 성능을 보였으며, 표준 NTP 대비 추론 능력은 1.61~1.71배, 지식 및 상식 능력은 1.13~1.19배 향상시키면서도 사실적 회상 능력은 96.7~96.8%를 보존했습니다. 특히 훈련 후에도 이러한 이점은 지속되었는데, 스위치 증류는 사실적 회상 격차를 해소하면서 추론 및 지식/상식 능력에서 각각 1.25~1.32배 및 1.13~1.20배의 향상을 유지했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Jacqueline He, Howard Yen, Shuyue Stella Li, Margaret Li, Hanqing Zeng, Yinglong Xia, Benyu Zhang, Zhuokai Zhao, Qiang Zhang, Pang Wei Koh, Luke Zettlemoyer, Wen-tau Yih
수집 2026-09-02 22:58
샤오미 15 울트라를 루트 권한 없이 컴퓨터에 연결하지 않고 디블로트하는 방법에 대한 가이드가 제시됩니다. 이 방법은 안드로이드 17 대신 안드로이드 16 버전에 운영체제를 고정하여 불필요한 텔레메트리, 사용자 권한, AI 관련 서비스 등을 최소화하는 것을 목표로 합니다.
사용자는 이 과정을 위해 공장 초기화부터 시작하여 시스템 설정을 재구성해야 하며, 특히 위치 정보, 시스템 업데이트, 사용량 및 진단 데이터 전송, 사용자 경험 프로그램, 그리고 다양한 확장 서비스 등을 비활성화해야 합니다. 이 과정은 기기의 기능을 최대한 유지하면서 개인 정보 보호를 강화하는 데 중점을 둡니다.
또한, 최신 카메라 애플리케이션 개선을 위해 HyperOS의 최신 버전으로 펌웨어를 업데이트해야 하며, 이 과정에서 블루투스 모듈 및 배터리 펌웨어 업데이트도 함께 진행해야 합니다. 하지만 업데이트 후에는 대부분의 사용자 정의 권한이 초기화되므로, 사용자는 이 점을 인지하고 진행해야 합니다.
이 가이드는 숙련된 사용자에게 권장되며, 절차를 따르지 않을 경우 기기가 손상되거나 데이터가 손실될 수 있으므로 모든 데이터 백업이 필수적입니다. 따라서 사용자는 제시된 정보를 참고하여 신중하게 시스템 설정을 조정해야 합니다.
Hacker News
튜토리얼
발행 2026-09-01
spacedrone808
수집 2026-09-02 17:54
상업용 단편 드라마 제작은 스크립트, 스토리보드, 키프레임 이미지, 샷 레벨 비디오, 그리고 완성된 단편 드라마로 이어지는 다단계 체인을 따른다. 기존의 대부분의 벤치마크는 실제 상류 파이프라인 결과 대신 사전 작성된 입력을 사용하여 비디오 생성 단계만을 평가하므로, 각 단계가 원본 스크립트 의도를 준수하는지, 그리고 여러 에피소드로 편집될 때 샷들이 일관성을 유지하는지에 대한 중요한 질문들이 해결되지 않았다.
이에 따라 본 연구는 전체 제작 체인의 모든 단계를 평가하는 최초의 단편 드라마 벤치마크인 DramaChain Bench을 제시한다. 이 벤치마크는 DramaChain Dimensions라는 세 가지 내부 시스템을 기반으로 구축되었으며, 각 단계마다 5개의 평가 축을 설정하여 총 63개의 세부 차원(leaf dimensions)으로 평가한다.
DramaChain Agent는 상업용 단편 드라마 플랫폼의 워크플로우 및 완성된 드라마 품질에 맞춰 보정되었으며, 레이블링 시스템은 5,785개 항목에 대해 세 명의 전문 주석가로 독립적으로 점수를 매겼다. 이 과정에서 모든 결함은 시공간적으로 국소화되었으며, 총 17,488개의 유효 점수와 255,925개의 추적 가능한 귀속 기록이 생성되었다.
인간 주석 결과는 상류 결함이 파이프라인 전체에 걸쳐 연쇄적으로 발생함을 확인시켜 주며, 최종 에피소드의 품질이 비디오 생성에만 의해 결정되는 것이 아님을 입증한다. DramaChain Agentic Judge는 모든 세부 차원을 자동으로 점수화하여 여러 에이전트 라운드를 거쳐 최종 판단을 내리며, 평균 PLCC 0.918을 달성하여 주석 비용 없이 새로운 모델을 수용할 수 있게 한다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Haoyuan Shi, Mingtao Chen, Shuo Jiang, Ziyan Chen, Xuyi Sheng, Yiming Liu, Ying Zhang, Miao Wang, Jianxiang Lu, Fanyang Lu, Songyuanyi Lu, Xiele Wu, Zhichao Hu, Yuhong Liu, Richeng Xuan
수집 2026-09-02 16:54
데이터 주권 제약으로 인해 기업들은 거대 언어 모델(LLM)을 자체 호스팅해야 하지만, 새로운 모델을 지속적으로 채택하면서 이전 모델을 폐기하지 않아 GPU 풀이 분산되고 있습니다. 이 문제를 해결하기 위해 200개 이상의 내부 애플리케이션 트래픽을 단일 모델로 통합하고, 생산 오류 분석을 통해 지시 사항 준수, 함수 호출, 내부 작업 분배라는 세 가지 축을 중심으로 품질 격차를 해소했습니다.
품질은 생산 트래픽에 맞춰 분류된 오프라인 벤치마크를 통해 결정론적 검증기나 보정된 LLM 심사위원으로 평가됩니다. 모든 목표를 동시에 최적화할 경우 발생하는 교차 도메인 보상 간섭 문제를 피하기 위해, 각 축별로 별도의 GRPO 전문가를 훈련한 후 두 단계의 SLERP를 통해 통합하는 방식을 사용했습니다.
각 전문가의 보상은 의미론적 붕괴, 과도한 호출, 장황함 해소와 같은 뚜렷한 실패 모드를 노출하며, 이는 각 도메인별 수정이 필요함을 의미합니다. 비추론 모드에서 이 모델은 사내 아레나에서 총 파라미터 기준으로 {sim}7배 더 큰 성능을 보였으며, 지시 사항 준수는 0.85에서 0.83 사이, 함수 호출은 0.79에서 0.77 사이의 성능을 기록하며 일반 대화 벤치마크를 향상시켰습니다.
이 모델은 서비스 비용의 일부로 플랫폼 트래픽의 50%, 즉 월 1억 1600만 건의 요청을 처리할 수 있어 효율적인 자원 활용을 가능하게 합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin, Mikhail Gashkov, Viktor Zelenkovskiy, Aleksandr Fida, Gleb Alektorov, Nikita Gulyakov, Arthur Babkin, Aleksandr Medvedev, Pavel Gein, Anatolii Potapov
수집 2026-09-02 10:49
Looped Transformers는 레이어 블록을 반복하여 유효 깊이를 증가시키지만, 기존 평가 방식은 모델 크기가 고정되어 있어 구조적 이점과 추가적인 FLOPs를 혼동하는 문제가 있었습니다. 본 연구는 Mixture-of-Experts(MoE) Transformer에 루핑을 적용하면서 토큰당 FLOPs, 총 비임베딩 파라미터, KV 캐시를 정밀하게 일치시키는 방식으로 분석을 진행했습니다.
이를 통해 연구진은 SMELT(Sparse MoE Transformer, middle layers Loop Twice)라는 구체적인 방법을 제시했습니다. SMELT는 중간 레이어 절반을 두 번 반복하면서 루프되지 않은 기준선과 세 가지 예산 모두에서 일치시키는 레시피입니다. 이 방법을 54B 비임베딩 파라미터까지 확장하여 적용한 결과, SMELT는 계산 최적 지점에서 훈련 FLOPs를 6.8%에서 18.0%까지 절약하는 것으로 나타났습니다.
이러한 효율성 증가는 검증 손실을 넘어선 다운스트림 벤치마크에서 가장 크게 나타났으며, 특히 Code 관련 작업에서 성능 향상이 두드러졌습니다. 또한 샘플 길이와 인컨텍스트 예제 수에 따라 이 이점은 증가하는 것으로 확인되었습니다.
기계적 분석 결과, 두 번째 방문은 어텐션 싱크를 줄이고 정보를 콘텐츠 관련 토큰으로 재분배하여 성능 향상의 근본적인 원인이 될 수 있는 귀납적 편향을 제공합니다. 이는 루핑이 예산 일치 조건 하에서도 트랜스포머 성능을 개선하며 깊이 재사용을 측정 가능한 이득으로 전환하는 실용적인 방법을 제공함을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu, Wenhao Huang, Shen Yan, Jian Li
수집 2026-09-02 03:44
언구이디드(Unguided) 방식으로 진행되는 언어 모델의 셀프 플레이는 효과적인 자기 진화 패러다임이지만, 가이드 없이 진행될 경우 라운드별 성능이 정체되거나 하락할 수 있습니다. 기존 방법들은 난이도나 다양성 같은 신호를 통해 질문을 생성하지만, 다음 라운드에서 해결해야 할 구체적인 추론 약점을 지정하지 못합니다.
본 연구는 이러한 방향성을 솔버 자신의 실패 기록에서 도출하는 방법을 제시하며, 이를 위해 DiagEvo라는 모델을 소개합니다. DiagEvo는 이 실패 기록에서 반복되는 오류 원인을 추출하여 계층적 오류-원인 메모리(hierarchical error-cause memory)에 저장합니다. 이 메모리는 관련 원인들을 기술 노드 아래에 그룹화하고, 특정 질문에 대한 자기 일관성(self-consistency)을 통해 각 원인을 활성(Active) 또는 숙달(Mastered) 상태로 추적합니다.
추가적으로 이 방법은 이중 신뢰 필터링(double-confidence filtering)을 사용하여 가장 일반적인 솔버 답변에 명확한 표가 있을 때만 중간 난이도의 질문을 유지합니다. DiagEvo는 외부 작업 자원 없이 셀프 플레이 과정에서 생성된 정보만을 사용하여 커리큘럼을 도출합니다.
이러한 접근 방식을 통해 DiagEvo는 Qwen3-4B, Qwen3-8B, OctoThinker-8B 세 가지 솔버 모두에서 아홉 가지 벤치마크 전반에 걸쳐 모든 기준 모델을 능가하는 평균 정확도를 달성했습니다. 특히 Qwen3-8B에서는 다섯 가지 수학적 추론 벤치마크에서 72.3%의 평균 정확도를 기록했으며, 이는 R-Zero보다 4.5 퍼센트 포인트 높은 수치입니다. 이 결과는 계층적 오류-원인 메모리와 이중 신뢰 필터링이 성능 향상에 기여했음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Xincheng Wei, Yifan Ding, Yoshua Li, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Wenjian Ding, Yao Zhang
수집 2026-09-02 03:44
SAR 이미지를 전기광학(EO) 이미지로 변환하는 작업은 기존 잠재 확산 접근 방식에서 코덱과 모달리티에 따라 재구성 충실도가 달라지는 문제가 있었습니다. 잠재 코덱은 SAR 조건과 EO 목표의 왕복 보존에 영향을 미치기 때문에 코덱 선택이 중요한 설계 결정이지만, 기존 방법들은 주로 자연 이미지로 사전 학습된 코덱에 의존했습니다.
이에 연구진은 SAR-EO 재구성 감사를 통해 코덱을 선택하는 조건부 잠재 흐름 매칭 프레임워크인 ReFlowSET을 제안합니다. ReFlowSET은 무거운 사전 학습된 생성기를 상속받는 대신, 선택된 잠재 공간에서 처음부터 훨씬 작은 조건부 DiT를 훈련합니다. 이 과정에서 이중 스트림 SAR 조건화와 공동 특징 정제를 사용합니다.
추가적인 의미론적 지도를 제공하기 위해, 중간 단계의 노이즈 EO 특징은 고정된 비전 파운데이션 모델로 추출된 깨끗한 목표 EO 표현과 정렬됩니다. 이 정렬은 훈련 중에만 사용되어 추론 비용을 추가하지 않습니다. QXS-SAROPT 및 SAR2Opt 실험 결과는 다양한 지각적 충실도와 분포 측정 기준에서 최고 수준의 성능을 입증했습니다. 코드와 사전 학습된 가중치는 공개되어 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Jeonghyeok Do, Seungchul Lee, Munchurl Kim
수집 2026-09-02 02:43
멀티모달 메모리는 장편 비디오 질의응답을 위한 확장 가능한 인터페이스를 제공하지만, 기존 방법들은 캡션, 프레임, 스크립트, 요약 또는 그래프 사실과 같은 단편적인 조각만을 검색합니다. 이러한 조각들은 검색 가능하지만, 언어 모델이 추론 시점에 문맥이 제한되고 귀속(attribution)이 어려운 상황에서 교차 모달 및 시간적 정렬을 재구성해야 하므로 생성 준비가 되지 않습니다.
이에 연구진은 메모리 구축 과정에서 이질적인 증거를 이벤트 앵커에 결합하는 이벤트 중심 멀티모달 메모리 프레임워크인 EM^2Mem을 제안합니다. EM^2Mem은 각 이벤트 인덱스 메모리 셀이 멀티모달 기록, 시간적 문맥, 그래프 연결 관계, 의미적 사실, 출처를 정렬하여 모달리티별 조각이 아닌 근거가 있는 멀티모달 이벤트에 대한 압축된 증거 읽기를 가능하게 합니다.
세 가지 장편 비디오 QA 벤치마크에서 EM^2Mem은 가장 강력한 메모리 기준선 대비 평균 정확도를 각각 2.0, 2.4, 3.7%p 향상시켰습니다. 또한 엄격한 이벤트 수준의 Top-5 증거 검색 재현율을 7.0%p 개선했으며, 쿼리당 지연 시간을 4.67배, 총 추론 토큰 수를 63.66% 감소시켰습니다.
이 연구 결과는 코드와 함께 https://github.com/zjunlp/LightMem에 통합될 예정입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Yijun Chen, Yaqi Zheng, Yanya Li, Boyi Xiao, Buqiang Xu, Shuofei Qiao, Jizhan Fang, Xinle Deng, Yunzhi Yao, Xuehai Wang, Liuxin Zhang, Hui Li, Huajun Chen, Shumin Deng
수집 2026-09-02 02:43
통합 멀티모달 모델(UMM)은 시각 이해와 생성을 단일 모델 내에서 수행하지만, 기능적 통합이 반드시 학습 시너지를 보장하지는 않는다는 연구 결과가 나왔습니다. 연구진은 사전 학습된 시각 정보 없이 통제된 환경에서 표현, 작업, 시스템 수준에서 이 두 목표 간의 관계를 조사했습니다.
표현 수준에서 각 목표는 서로에게 유용한 신호를 제공하는 것으로 나타났습니다. 즉, 생성이 이해를 위한 시각 특징을 풍부하게 하고, 이해는 생성에 필요한 시각-언어 정렬을 강화합니다. 그러나 두 목표를 동일한 계산 경로를 통해 강제할 경우 한쪽이 지배적으로 작용하는 비대칭적 성능 저하가 발생합니다.
이러한 비대칭적 저하를 피하기 위해 상충되는 시각 계산을 전문화하면서 의미적 상호작용을 보존하는 작업 분리 아키텍처가 필요합니다. 작업 수준에서는 세 가지 사례 연구를 통해 이해와 생성 작업이 공유 지식에 의존할 때 긍정적인 양방향 전이가 있음을 발견했습니다.
시스템 수준에서는 종단 간 UMM이 이미지 이해와 생성을 명시적으로 요구하는 복잡한 작업에서 일치된 계획자-실행기 파이프라인보다 더 우수한 성능을 보였습니다. 결론적으로 UMM의 가치는 통합된 인터페이스를 넘어 적절한 전문화, 공유된 작업 지식, 종단 간 최적화를 통해 공존을 시너지로 전환할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Penghao Wu, Haiwen Diao, Weichen Fan, Lewei Lu, Dahua Lin, Ziwei Liu
수집 2026-09-02 02:43
멀티 에이전트 LLM 시스템에서 프롬프트 최적화는 작업 관련 콘텐츠 생성과 메시지 라우팅, 출력 형식 지정과 같은 실행에 필수적인 프로토콜을 동시에 수행하는 얽힌 역할을 합니다. 따라서 콘텐츠 생성을 개선하기 위한 프롬프트 수정이 의도치 않게 프로토콜을 손상시켜 전체 에이전트 파이프라인을 실패하게 만들 수 있습니다.
연구진은 이 두 역할이 서로 다른 표현 방식을 가진다고 관찰했습니다. 실행 프로토콜은 일반적으로 구조화되어 있는 반면, 작업 관련 콘텐츠는 비구조화된 언어로 표현됩니다. 이를 바탕으로 연구진은 제어-데이터 흐름 분리(control-data flow separation)를 제안했습니다. 이 방법은 실행에 중요한 제어는 타입이 지정되고 검증된 프로그램 객체로 표현하고, 작업 관련 언어는 에이전트 통신을 위한 최적화 가능한 데이터 흐름으로 유지하는 방식입니다.
이러한 설계는 최적화기가 프롬프트 드리프트에 라우팅이나 형식 지정 인터페이스를 노출하지 않으면서 멀티 에이전트의 동작을 개선할 수 있게 합니다. 이 프레임워크는 합성 추론, 협업 검토 생성, 보험 등급 워크플로우 등 다양한 작업에서 100%의 최종 프로토콜 유효성을 달성하면서도 작업 성능을 지속적으로 향상시켰습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Wentao Zhang, Syed Shariyar Murtaza, Junaid Ahmad Bhatti, Utkarsh Soni, Yifan Nie, Eugene Wen, Yuntian Deng
수집 2026-09-02 02:43
멀티모달 대규모 언어 모델(MLLM)이 드론 제어와 같은 행동에 얼마나 확장될 수 있는지 평가하는 연구가 발표되었습니다. 연구진은 MLLM을 드론 제어 루프에 직접 삽입하여 전체 행동 공간을 프롬프트만으로 선언하는 아키텍처인 DroneCATS-Agent와 이를 측정하는 벤치마크인 DroneCATS를 소개했습니다. 이 에이전트는 미세 조정이나 함수 호출 스키마 없이도 모델이 목표물에 접근하고, 추적하고, 탐색하며, 다중 드론 군단을 지휘하는 등 네 가지 핵심 능력을 평가합니다.
평가 결과, 모델의 공간 인식 능력은 유지되지만 행동 프로토콜이 부족하다는 점이 드러났습니다. 단순히 픽셀을 향해 비행하는 것을 넘어, 에이전트는 불확실할 때 숙고하고, 도착을 스스로 선언하는 등의 행동을 수행합니다. 이는 드론 제어에서 내비게이션 능력보다 선언된 프로토콜을 유지하고 올바른 종료 행동을 내보내는 규율이 배포 가능한 엣지 모델과 최전선 모델을 구분하는 핵심임을 시사합니다.
특히, 20억 개의 파라미터로 모델 규모를 줄였을 때, 작은 오픈 모델이 최전선 모델보다 더 안정적으로 내비게이션을 수행하지만, 도착을 조기에 선언하거나 아예 선언하지 못하는 문제점을 보였습니다. 다중 드론 지휘 상황에서는 작은 모델이 단일 좌표를 맹목적으로 복사하여 실패하는 경향이 관찰되었습니다.
결론적으로, 배포 가능한 엣지 모델과 최전선 모델 사이의 격차를 좁히는 열린 문제는 온보드 컴퓨팅 비용을 고려하여 지속적으로 계획하고 완료 시점을 정확히 아는 빠른 모델을 만드는 데 있습니다. DroneCATS는 이러한 격차를 측정하여 이 목표에 도달하는 거리를 측정하는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon, Dohoon Ryu, Daehee Kim, Myungseo Song, Jihyuk Byun, Seunggyu Chang, Taeho Kil, Jiseob Kim, Bado Lee, Geewook Kim
수집 2026-09-02 02:43
AI 튜터는 학생의 강점, 약점, 선호하는 지도 방식에 맞게 적응할 때 가장 유용하지만, 어떤 지도가 어떤 학생에게 효과적인지에 대한 증거를 실제 학습자로부터 수집하는 것은 희소하고 느리며 비용이 많이 듭니다. 기존의 접근 방식들은 학생의 행동을 따르는 상태 추적 모델이나 지도를 유창하게 따르지만 학생의 역량을 신뢰성 있게 반영하지 못하는 LLM 역할극 모델의 한계를 가지고 있습니다.
이에 연구진은 희소한 학생별 데이터를 개별화된 시뮬레이터로 전환하는 훈련 프레임워크인 StudentSim을 제시했습니다. 이 프레임워크는 풀링 훈련(pooled training)을 통해 데이터를 통합한 후 학생별 특화(per-student specialization)를 거쳐 결과적으로 학생의 반응을 반영하고 튜터 지침에 따라 업데이트되는 시뮬레이터를 생성합니다. 또한, 체스, 제2외국어 작문, 수학 분야 60명의 학생을 대상으로 공공 학습 데이터셋을 사용하여 행동 충실도(Behavioral Fidelity, F)와 지도 반응성(Guidance Responsiveness, R)을 측정하는 표준화된 프로토콜인 StudentSimEval을 도입했습니다.
StudentSimEval 결과, StudentSim은 GPT-5.4보다 두 지표 모두에서 우수한 성능을 보였습니다. 특히 체스 분야에서 StudentSim은 F=0.51, R=0.91을 달성하여 GPT-5.4(F=0.23, R=0.72) 및 Maia2(F=0.45, R=0.27)보다 훨씬 높은 점수를 기록했습니다. 이 연구는 StudentSim을 튜터 강화 학습(RL)의 보상 모델로 사용하여 훈련된 체스 튜터가 전문가들에 의해 기존의 보상 모델을 사용한 튜터보다 더 정확하고, 더 잘 지도하며, 더 개인화되었다고 평가받는다는 것을 입증했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Ke Yang, Chenglong Wang, Michel Galley, Chandan Singh, Jeevana Priya Inala, ChengXiang Zhai, Jianfeng Gao
수집 2026-09-02 02:43
H3-World는 33B MiniMax-H3 비디오 생성기를 상호작용 가능한 월드 모델로 전환하는 효율적인 프레임워크를 제시합니다. 이 연구의 핵심 발견은 대규모 비디오 생성기가 발전함에 따라 언어가 제어를 위한 자연스러운 인터페이스로 부상하고 있다는 것입니다. MiniMax-H3는 이미 자연어 지시를 통해 캐릭터 행동과 카메라 움직임을 제로샷으로 제어할 수 있습니다. H3-World는 이러한 거친 언어 인터페이스를 전용 액션 모듈 없이도 정밀하고 시간적으로 기반을 둔 월드 제어로 전환합니다.
구체적으로 각 행동을 캐릭터 및 카메라 지시의 구조화된 조합으로 표현하고 이를 해당 시간적 비디오 잠재값과 정렬합니다. 시간적 정밀도를 높이기 위해 시간 주의 라우팅(temporal attention routing)을 도입하여 각 지시를 의도된 시간 간격으로 제한하고 행동 간의 제어 누수를 줄입니다. 이 프레임워크는 대규모 비디오 사전 학습에서 학습된 의미 표현을 직접 재사용하며 경량 적응만 필요로 합니다.
H3-World는 단 8,000개의 게임플레이 샘플, 10,000회의 LoRA 최적화 단계, 그리고 0.199%의 학습 가능한 파라미터만을 사용하여 강력한 생성 품질을 유지하면서 효과적인 캐릭터 및 카메라 제어를 달성합니다. 또한 이 모델은 보지 못한 시나리오에도 일반화될 수 있습니다. 이는 대규모 비디오 생성기에서 나타나는 제어 능력을 상호작용 가능한 월드 제어로 효율적으로 변환할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
수집 2026-09-02 02:43
LLM 기반 코딩 에이전트가 인간의 개입 없이 고수준 요구사항을 완전하고 기능적이며 사용 가능한 소프트웨어 시스템으로 변환하는 자율 소프트웨어 개발에 관한 연구가 발표되었습니다. 이 논문은 자율 개발 과정에서 코딩 에이전트가 소프트웨어를 지속적으로 개선할 수 있도록 돕는 프레임워크인 Harness-of-Harness(HoH)를 소개합니다.
HoH는 기존 코딩 에이전트 하네스(harness)를 기반으로 하며, 실행을 반복적인 계획-코딩-테스트 루프로 구성하여 자율 개발을 체계화합니다. 이 프레임워크는 루프 전반에 걸쳐 복구와 능력 성장을 균형 있게 맞추고, 개발을 작고 검증 가능한 증분으로 제한하며, 구현 시간 테스트와 독립적인 평가를 분리합니다. 또한, 에이전트의 작업 흐름을 지시하기보다 검증 가능한 결과물을 제약하고, 결과물, 역할별 도구, 기술을 점진적으로 노출하여 재사용을 장려하고 버전별 프로젝트 역사를 유지합니다.
GameCraft-Bench, FrontierSWE, ProgramBench와 같은 벤치마크에서 세 가지 하네스-모델 쌍(Codex와 GPT-5.5, OpenCode와 DeepSeek-V4-Pro, Pi와 MiniMax-M3)을 적용한 결과, HoH는 독립적인 하네스보다 평균적으로 52.25%의 상대적 이득과 최대 82.86%의 이득을 달성했습니다. 또한, 70회 이상의 반복을 포함하는 다일(multi-day) 배포에서 HoH는 일관된 스토리라인, 완전히 구현된 핵심 메커니즘, 인간이 플레이 가능한 경험, 세련된 시각 및 통합된 오디오 기능을 갖춘 1인칭 슈팅 게임을 자율적으로 개발해냈습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu
수집 2026-09-02 02:43
배포된 LLM 서비스의 안전장치는 거부율, 공격 성공률, 정책 위반율로 평가됩니다. 이러한 비율들은 테스트된 요청에 대해 제어 메커니즘이 어떻게 작동했는지를 나타냅니다. 그러나 배포된 시스템에 대한 평가는 서비스가 여전히 공격자에게 유해한 작업을 얼마나 많은 도움을 제공하는지에 대한 질문에 답해야 합니다.
각 보고 결과가 이 질문에 대해 무엇을 의미하는지 판단하여 서로 다른 안전장치 계열의 결과를 하나의 배포 기준 아래 비교할 수 있도록 합니다. 하지만 증거 요구 사항은 강하게 비대칭적입니다. 배포된 서비스로부터 유해한 도움을 얻는 단 한 번의 공격만으로도 그러한 도움이 여전히 남아 있음을 입증할 수 있으며, 이러한 공격은 코드 기록에서 반복적으로 나타납니다.
따라서 안전장치 자체의 수치만으로는 남아 있는 것이 거의 없다는 것을 입증할 수 없습니다. 이는 안전장치가 로컬 기능을 수행한 후에도 주변 시스템이 여전히 허용하는 것에 대한 증거를 필요로 합니다. 이러한 증거는 깊이 코딩된 주장 중 소수만이 뒷받침하거나 도출하며, 한 주장은 그 범위의 잔여 위험을 제한합니다.
결론적으로, 더 나은 로컬 점수가 배포에 대한 더 강력한 주장인 것은 아닙니다. 안전장치 연구는 로컬 점수를 높이는 데서 멈출 수 없으며, 얻은 이득은 배포된 시스템을 실제로 더 안전하게 만드는지에 따라 판단되어야 합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Pingyu Wu, Weiming Zhang, Nenghai Yu
수집 2026-09-02 01:43