이미지 검색은 전통적으로 각 후보 이미지를 개별적으로 점수화하는 점별 매칭 문제로 구성되어 왔습니다. 그러나 이러한 원자적 패러다임은 사용자가 고립된 스냅샷이 아닌 구조적 관계에 의해 묶인 응축된 시각적 이야기를 찾는 개인 사진 컬렉션 내의 인간 검색 의도의 복잡성을 포착하지 못합니다.
이러한 한계를 해결하기 위해 연구진은 대규모 비정형 사진 풀에서 응집력 있는 이미지 번들을 동적으로 구성하는 새로운 패러다임인 이미지 번들 구성(Image Bundle Composition, IBC)을 제안합니다. IBC는 개별 이미지 순위를 매기는 목표에서 벗어나 번들을 구성하는 것을 목표로 하며, 목표 번들이 미리 정의되어 있지 않기 때문에 심각한 조합 폭발 문제를 야기하고 비분해적 공동 관련성을 모델링해야 하는 과제를 제시합니다.
이러한 패러다임을 확립하기 위해 연구진은 109,467개의 이미지와 667개의 검증된 쿼리를 포함하는 최초의 IBC 벤치마크 데이터셋인 IBCBench를 구축했습니다. 또한, BundleWeaver라는 에이전트 프레임워크를 제안하여 IBC를 쿼리 조건화된 증분 초하이퍼엣지 발견으로 재정의합니다. BundleWeaver는 대규모 언어 모델(LLM)을 사용하여 누락된 관계적 역할을 적응적으로 검색하고 전체 번들 검증을 위해 비전-언어 모델(VLM)을 활용함으로써 조합 공간을 효과적으로 탐색합니다.
실험 결과는 최신 임베딩 모델과 정적 분해-재순위를 매기는 패러다임이 관계적 맹점을 가지고 있는 반면, BundleWeaver는 상당한 성능 향상을 달성했음을 보여줍니다. 이는 개별 점수화에서 동적 관계적 구성으로 전환해야 할 필요성을 강조하며, 이 연구는 관계적 구성의 중요성을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Rong Shan, Tianyi Xu, Congmin Zheng, Wenteng Chen, Jiachen Zhu, Junjie Wu, Teng Wang, Weiwen Liu, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin
수집 2026-09-01 06:30
실외 LiDAR 의미론적 장면 완성(SSC) 연구는 클래스 불균형이 7,000배를 초과하는 상황에서 스캔된 영역의 1%만 관찰하여 밀도 높은 의미론적 복셀 그리드를 복원하는 것을 목표로 합니다. 연구진은 SSC를 세 가지 역할로 구성된 단일 이산 확산(discrete-diffusion) 공식화인 생성적 의미론적 장면 완성(GSSC)으로 재구성했습니다.
이 프레임워크는 먼저 쌍별 희소-밀집 장면 합성(PS^3)을 통해 희소 LiDAR 관측과 밀집 의미론적 완성 간의 일치를 확보하여 학습 데이터셋을 구축합니다. 다음으로 의미론적 가이드 생성 장면 완성(SGSC)은 조각난 스캔을 조감도 의미론적 맵과 희소 3D 특징 스트림으로 조건화하여 노이즈로부터 장면을 생성합니다. 마지막으로 동일한 프레임워크는 기존 완성을 단 한 번의 흐름 일치 단계에서 개선하는 구조화된 소스 이산 확산(S^2D^2)을 도입했습니다.
S^2D^2는 사전 학습이나 테스트 시간 적응 없이 SGSC의 출력과 외부 SSC 기반의 mIoU를 향상시킵니다. 가장 강력한 기반에서 테스트 시간 증강 없이 단 한 단계만으로도 SemanticKITTI 숨겨진 테스트에서 38.8%의 mIoU를 달성했으며, 이는 해당 순위표에서 가장 인과적이고 단일 스윕, 단일 샘플 결과로 알려져 이전 최고 점수보다 2.1%p 높은 수치입니다.
여기에 여덟 뷰 테스트 시간 증강을 포함한 네 단계의 보정 단계를 적용하면 39.2%의 mIoU를 달성할 수 있습니다. 이는 모델이 외부 조정 없이도 의미론적 장면 완성 성능을 효과적으로 개선할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Shi Chen, Weifeng Ge
수집 2026-08-31 16:17
현재 비디오 생성 모델은 긴 시간 동안의 콘텐츠를 처리하는 데 있어 강력한 장기 기억 능력이 부족하다는 한계에 직면해 있습니다. 이러한 결핍은 객체 영속성, 즉 객체가 재진입 시 외관을 정확하게 재현하는 능력과 초장기 컨텍스트를 처리하고 먼 과거의 정보를 활용하는 메모리 용량이라는 두 가지 측면에서 연구될 수 있습니다.
강력한 장기 기억을 위해서는 두 가지 요소가 모두 필요합니다. 충분한 컨텍스트 처리 없이 객체 영속성만 확보하면 시간적 범위가 제한되고, 영속성 없이 긴 컨텍스트 길이만 확보하면 정체성을 유지하기 어렵습니다. 이러한 문제를 해결하기 위해 본 연구는 장기 기억을 구축하고 정밀하게 활용하도록 설계된 자기회귀 비디오 확산 프레임워크인 Ring Forcing을 제시합니다.
Ring Forcing은 고리 구조 훈련 전략을 통해 먼 과거로부터 정보를 검색하도록 강제하여 엄격한 역사적 일관성과 생성적 다양성 사이의 상충 관계를 효과적으로 조정합니다. 또한 메모리 용량을 확장하기 위해 압축 및 타임스텝 구성 전략을 도입하여 고정된 시퀀스 길이 제약 하에서 유효한 역사적 범위를 분 단위로 확장하고 전체 역사에 걸친 포괄적인 수용 범위를 달성합니다.
나아가, 사전 훈련된 선험적 지식을 최대한 활용하면서 유연하고 확장 가능한 메모리 적응을 가능하게 하는 희소 RoPE 메커니즘도 함께 제시했습니다. 광범위한 실험 결과, Ring Forcing은 수 분 길이의 일관성과 객체 영속성을 달성하여 기존의 최첨단 방법들을 크게 능가하는 성능을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Bowen Xue, Brandon Y. Feng, Chenguo Lin, Yuchen Lin, Yujia Zeng, Lvmin Zhang, Maneesh Agrawala, Honglei Yan, Panwang Pan
수집 2026-08-31 07:10
재귀적 빠른 가중치 메모리와 선택적 상태 공간 모델은 확장되는 컨텍스트를 고정된 크기의 재귀적 상태로 압축하여 상태 전이를 온라인 학습 규칙으로 만듭니다. 연구는 읽은 후 쓰기 자기회귀 의미론 하에서 이 규칙을 분석하며, 접두사 예측 목표에 대해 단계 t에서 나타나는 로컬 빠른 메모리 예시는 접두사 정렬 쌍 $(x_t, y_t) = (\phi(k_{t-1}), v_t)$임을 밝혀냈습니다.
동시에 같은 단계 연관성 $(\phi(k_t), v_t)$은 인과적이지만 다른 내부 목표를 최적화하며, 이를 통해 제곱 오차 회귀 및 음의 내적 목표에 대한 정규화된 일차 업데이트를 도출했습니다. 이 회귀 계열에는 스칼라 NLMS 업데이트인 Falcon-1, 열별 확장인 Falcon-2, 슬라이딩 윈도우 미니 배치 업데이트인 Falcon-3이 포함되며, 이에 대응하는 내적 변형인 Falcon-1A/2A/3A도 제시됩니다.
이 프레임워크는 재귀적 시퀀스 모델에서 시간 정렬, 가소성, 망각, 그리고 제한된 리허설을 분리하는 역할을 합니다. 재귀적, 마스크 병렬, 청크 병렬 형태와 수치적으로 안정적인 양의 감쇠 재조정(positive-decay renormalization)을 제공하며, 대표적인 변형들은 언어 모델링에서 경쟁력을 유지하고 가변 자릿수 덧셈에 대한 길이 외삽을 개선합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang, Yifeng Liu, Huizhuo Yuan, Mengdi Wang, Quanquan Gu, Andrew Chi-Chih Yao
수집 2026-08-31 07:10
언어 모델 사전 학습은 막대한 비용 때문에 학계와 오픈소스 커뮤니티에서 접근하기 어려운 상황입니다. 비용 효율적이고 하드웨어 접근성이 높으며 오픈소스인 사전 학습 레시피가 부족했기 때문에 연구자들이 대규모 모델 학습에 어려움을 겪어왔습니다.
본 보고서는 이러한 장벽을 낮추기 위해 새로운 오픈 사전 학습 레시피를 제시합니다. 이 레시피를 사용하여 RTX 5090과 같은 소비자용 GPU에서 FP8 정밀도로 최대 1.4조 토큰에 걸쳐 Puro-2B 모델을 처음부터 학습시켰습니다. 이 모델들은 하드웨어 선택, 저정밀도 학습, 하이퍼볼 최적화, 커리큘럼 모델 평균화, 데이터 레시피 등의 조합을 통해 비용 효율성을 달성했습니다.
최적화된 결과를 통해 가장 좋은 모델은 6.9K 미만의 컴퓨팅 비용으로 학습되었으며, 평가 프로토콜 하에서 Qwen2.5-1.5B 성능에 근접했습니다. 또한, 학습 비용과 모델 성능을 연결하는 Puro 비용 스케일링 법칙을 도출했는데, 이는 Qwen2-1.5B 성능에 도달하기 위해 4.4K, 즉 5,090달러 미만의 비용이 충분함을 시사합니다.
연구진은 데이터, 코드, 모델 가중치를 포함한 전체 학습 레시피를 Apache 2.0 라이선스로 공개했습니다. 이 레시피는 사전 학습 파이프라인 전체에 대한 통제된 연구를 가능하게 하며, 다른 개발자들이 비용 효율적인 대규모 모델 학습을 시도할 수 있도록 돕습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen
수집 2026-08-31 06:10
자기 진화 언어 모델은 인간의 감독 비용을 줄일 수 있는 잠재력을 가지고 있어 초지능으로 가는 유망한 경로로 부상하고 있습니다. 그러나 검증 가능한 영역에서는 상당한 진전이 있었지만, 검증 불가능한 영역에서의 자기 진화는 여전히 탐구가 덜 이루어졌습니다. 이에 연구진은 두 영역 모두에서 자기 개선을 지원하는 통합적인 도전자-해결자-판정자 공동 진화 프레임워크인 Judge co-adaptation from Zero data(J-Zero)를 제안합니다.
J-Zero는 도전자와 해결자가 적대적 상호작용을 통해 공동 진화하도록 설계됩니다. 도전자는 점점 더 어려운 과제를 생성하고, 해결자는 이에 대해 더 높은 품질의 응답을 학습합니다. 동시에 판정자는 판정자의 점수보다는 응답이 생성된 방식, 즉 도전자의 답변 대비 해결자의 답변이나 단일 응답 대비 분해 및 재결합된 답변과 같은 선호 쌍을 사용하여 공동 적응을 수행합니다.
이러한 접근 방식은 기존 기준 모델을 능가하는 결과를 보였습니다. J-Zero는 검증 가능한 영역에서 평균 4.2점, 검증 불가능한 영역에서 평균 8.0점의 성능 향상을 보였으며, 최소 10회 반복을 통해 지속적으로 개선되었습니다. 반면, 기존 기준 모델들은 두 번의 반복 후 성능이 저하되는 경향을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Gyouk Chu, Myeongho Jeon, Eunho Yang
수집 2026-08-31 04:09
매우 긴 비디오에서 스트리밍 3D 재구성을 위해서는 제한된 메모리와 연산 하에서 카메라 움직임과 장면 기하학을 온라인으로 추정해야 합니다. 초기 스트리밍 모델들은 유한한 컨텍스트 버퍼나 압축된 순환 상태를 사용하여 인과적이고 비용이 제한된 추론을 달성했지만, 시퀀스가 길어질수록 추정치가 악화되는 문제가 있었습니다.
본 연구는 이러한 문제를 해결하기 위해 학습된 시간 상태를 엄격하게 지역적으로 유지하고 시퀀스 길이에 독립적인 예측 대상을 설정하는 다른 접근 방식을 취합니다. 이를 통해 ABot-Recon이라는 간단한 스트리밍 모델을 제시하며, 이는 이전 방법들보다 우수한 장거리 성능을 보입니다. 이 모델은 이전 11프레임의 KV 특징만을 캐싱하여 현재 카메라 좌표계에서의 포인트 맵과 인접 프레임의 상대 자세를 예측합니다.
이 예측들은 참조 프레임 변화에 대해 등방성(equivariant)을 유지하며, 순차적 합성(sequential composition)을 통해 전역 자세와 기하학을 복구할 수 있습니다. 또한 누적 드리프트를 줄이기 위해 경량의 시간 정제기(temporal refiner)가 최근 시각 및 움직임 컨텍스트를 사용하여 상대 회전을 개선하고, 합성 인식 자세 손실(composition-aware pose loss)이 다단계 자세 합성을 감독합니다.
이러한 접근 방식에 대한 광범위한 평가 결과, ABot-Recon의 지역 컨텍스트 접근법이 장거리 성능에서 우수함을 입증했습니다. 옥스퍼드 스파이어스(Oxford Spires) 벤치마크에서 ABot-Recon은 ATE 4.35m와 RPE-R 0.12°를 달성했으며, 이는 기존 최고 결과 대비 두 오류를 약 40% 감소시키는 결과를 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian
수집 2026-08-31 03:08
물리적 이해와 추론은 세계에 대한 작고 일반화 가능한 표현을 형성하는 것에 달려 있습니다. 현재의 비전-언어 모델은 다양한 물리적 사건을 인식하고 설명할 수 있지만, 객체의 상태, 물리적 매개변수, 지배적인 역학 등 세계가 어떻게 진화하고 개입에 어떻게 반응하는지에 필요한 근본적인 메커니즘에 대한 명시적인 표현은 부족합니다.
이 연구는 이러한 한계를 극복하기 위해 물리적 세계를 실행 가능한 세계 표현을 통해 나타내는 패러다임인 Code-as-World를 제안합니다. 물리적 구성, 동적 진화, 시각적 외관을 실행 가능한 코드로 표현함으로써 Code-as-World는 물리적 세계에 대한 작고, 정량적으로 근거하며, 제어 가능한 추상화를 제공합니다.
이러한 표현을 멀티모달 관찰, 예를 들어 자연어 설명이나 실제 비디오로부터 구축하기 위해, 연구진은 가설을 제안하고 실행하고 렌더링하고 검증하며 반복적으로 개선하는 추론적 추론(abductive reasoning)에서 영감을 받은 에이전트 발견 루프를 개발했습니다. 이 방법은 실행 가능한 세계 가설을 구성하는 데 사용됩니다.
실제 적용 사례로, 검증된 실행 가능한 세계를 사용하여 비전-언어 모델이 정량적 물리 추론을 훈련하는 데 확장 가능한 물리적 감독을 제공합니다. 실험 결과, Code-as-World-VL은 QuantiPhy에서 최고 성능을 달성하고 선도적인 독점 모델들을 능가하여 실행 가능한 세계 표현이 물리적 지능을 위한 확장 가능한 기반이 될 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu
수집 2026-08-31 02:08
로봇 데이터를 확장하는 것은 일반적인 비전-언어-행동(VLA) 모델 구축에 필수적이지만, 물리적 세계의 데이터 수집 비용과 희소성 때문에 웹 규모의 이미지-텍스트 데이터만큼 확장하기 어렵습니다. 따라서 제한된 로봇 데이터 예산 내에서 지속적인 사전 학습은 단순히 행동을 맞추는 것을 넘어, 제한된 궤적을 전이 가능한 시각-행동 지식으로 전환하는 표현 품질이 핵심 병목이 됩니다.
이러한 문제를 해결하기 위해 연구진은 VLAct라는 VLA 지향 VLM 백본을 제안했습니다. VLAct는 작업별 미세 조정 전에 광범위하고 이질적인 다중 구현 로봇 데이터를 사용하여 사전 학습하며, VLM 우선 보존, 다중 헤드 연속 행동 공동 감독, 부분적으로 통합된 교차 구현 행동 레이아웃을 통해 구현체 간 공유 행동 의미론을 장려합니다. 이 방법은 시뮬레이션, 실제 환경, 그리고 보지 못한 구현체로의 전이에서 다운스트림 성능을 일관되게 향상시킵니다.
VLAct는 다양한 벤치마크에서 뛰어난 성능을 입증했습니다. 특히 RoboCasa-GR1과 같은 보지 못한 휴머노이드 구현체에서 VLAct는 전체 데이터의 20%만 사용하여 다운스트림 궤적을 활용했을 때 전체 데이터 기반의 GR00T-N1.6 기준선보다 우수한 성능을 보였습니다. 이는 완전한 오픈 소스 데이터와 16개의 GPU만 사용하여 달성되었으며, 표현 중심의 지속적인 사전 학습이 적은 컴퓨팅 예산 내에서 경쟁력 있는 성능을 제공할 수 있음을 보여줍니다.
결론적으로 VLAct는 데이터 확장 너머 VLA 발전의 중요한 독립 축을 제시하며, 산업용 VLA 시스템을 능가하는 결과를 도출했습니다. 이는 표현 중심의 사전 학습이 데이터 규모 확장만큼이나 중요하며 효율적인 컴퓨팅 환경에서 VLA 모델을 발전시키는 데 기여할 수 있음을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia
수집 2026-08-31 02:08
실시간 스트리밍 환경에서 인물 중심의 캐릭터 비디오 편집은 기존 영상 편집 방식으로는 얼굴 표정의 불일치 문제를 해결하기 어렵고 실시간 상호작용에 부적합하다는 한계가 있었습니다. 이에 연구진은 실시간 스트리밍 캐릭터 비디오 편집을 위한 새로운 프레임워크인 EditaLive를 제안했습니다.
EditaLive는 사전 학습된 이미지 애니메이션 모델인 Wan-Animate에서 출발하여 외모와 움직임을 자연스럽게 분리하는 것을 기반으로 합니다. 또한 CharEdit-50K 데이터셋을 활용하여 참조 프레임 편집과 비디오 재구성을 통해 지시 기반의 인물 중심 비디오 편집을 수행합니다.
나아가 모델을 오프라인 양방향 생성 방식에서 인과적 스트리밍 생성 방식으로 전환하고, 정렬된 셀프 롤아웃 증류 전략을 설계하여 모델을 두 단계 샘플러로 압축했습니다. 이 과정에서 고정된 RoPE와 정렬 강제 적용을 통해 학습과 추론 간의 불일치를 줄이고, 첫 프레임에서 보존된 희소 어텐션 필터를 사용하여 외모 표류 현상을 완화합니다.
광범위한 실험 결과, EditaLive는 얼굴 표정을 충실하게 보존하면서도 낮은 지연 시간의 실시간 스트리밍 추론을 제공하는 최첨단 편집 성능을 입증했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Zhiyuan Li, Chi-Man Pun, Peng-Tao Jiang, Bo Li, Xiaodong Cun
수집 2026-08-28 13:29
장기 에이전트 실행은 현재 실행과 미래 작업 모두를 개선할 수 있는 경험을 생성합니다. 그러나 대부분의 자기 개선 방법은 실행이 끝난 후에 경험을 처리하기 때문에 활성 실행을 변경하거나 배운 교훈을 즉시 적용하고 검증할 수 없습니다. 연구진은 자기 개선은 실행 중 발생하는 경험을 사용하여 활성 실행을 재지정하고 영구적인 하네스를 업데이트하는 라이브 방식으로 이루어져야 한다고 주장합니다.
기존 에이전트 아키텍처는 이러한 목표를 완전히 지원하지 못하며, 단일 에이전트 자기 수정이나 서브 에이전트 위임은 실행을 분리하지만 활성 서브 에이전트를 재지정할 수 없습니다. 이에 연구진은 라이브 자기 개선을 위한 감독-작업 하네스인 PILOT을 제시했는데, 이는 두 가지 결합된 메커니즘을 통해 이루어집니다. 첫째, 라이브 스티어링은 별도의 감독자가 실행 중인 작업자를 재지정하거나 중단할 수 있게 하며, 둘째, 라이브 자기 진화는 실행 중에 드러난 절차와 실패 모드를 재사용 가능한 기술과 메모리로 정제합니다.
PILOT은 두 개의 고정된 백본과 세 가지 벤치마크에서 두 가지 메커니즘을 통해 라이브 자기 개선을 수행합니다. 이 결과, PILOT은 여섯 가지 구성 중 다섯 가지에서 1위를 차지했으며, Terminal-Bench 2.0에서는 다른 하네스보다 최대 9.8퍼센트 포인트 더 높은 성능을 보였습니다. 또한 자기 개선 환경에서 PILOT은 GLM-5.1과 Kimi-K2.6 환경에서 각각 14.6점과 12.4점을 얻었습니다.
이러한 개선은 효율성 측면에서도 두드러집니다. 평균 출력 토큰은 각각 42.9%와 47.4% 감소했지만, 백만 출력 토큰당 성공적인 평가 횟수는 각각 110.3%와 134.0% 증가했습니다. 이는 PILOT이 에이전트의 성능을 향상시키면서도 효율성을 높이는 데 기여함을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan, Yao Hu, Wenjie Li, Chengyue Jiang
수집 2026-08-28 06:25
생성형 AI가 발전함에 따라 비디오 편집 기술도 크게 향상되었지만, 기존 방법들은 단일 샷이나 짧은 클립에 주로 초점을 맞추고 있어 여러 지침을 사용하여 긴 비디오를 편집하는 것은 여전히 어려운 과제로 남아 있습니다. 특히 고정된 시간 분할 전략은 개체 파편화, 심각한 편집 환각(hallucinations), 그리고 시간적 연속성의 단절을 유발하는 문제가 발생합니다.
이러한 한계를 극복하기 위해 본 연구는 다중 지침 다중 샷 장편 비디오 편집(MMLVE) 과제를 제안하며, 이는 교차 샷 편집 일관성(CSEC), 다중 지침 분리(MID), 그리고 시공간 구조에 대한 무손상(ZDSS)이라는 세 가지 핵심 목표를 중심으로 구성됩니다. 이 세 가지 문제를 해결하기 위해 대규모 언어 모델(LLM)과 비전-언어 모델(VLM)의 시너지를 활용하는 에이전트 기반 편집 프레임워크를 도입하여 샷 수준의 비디오 분리 및 정확한 지침 해석을 달성합니다.
또한, 이 과제를 포괄적으로 평가하기 위해 복잡한 실제 시공간 역학, 고밀도 이질 지침, 그리고 희소하고 무작위적인 개체 분포를 특징으로 하는 MMLVE 중심의 데이터셋인 MMLVE-Bench를 구축했습니다. 실험 결과, MMLVE-Agent는 기존의 폐쇄형 소스 SOTA 접근 방식(예: Seedance 2.0)보다 우수한 성능을 보였으며, 편집 환각을 제거하고 교차 샷 편집 일관성을 보존하며 매끄러운 시공간 전환을 달성했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li
수집 2026-08-28 05:24
멀티모달 대규모 언어 모델(MLLM)은 명시적인 시각 중간 결과물(visual intermediates)를 통해 공간 증거와 업데이트된 시각 상태를 외부화할 수 있지만, 이러한 중간 결과물의 유용성은 이미지 편집기가 요구되는 변환을 얼마나 충실하게 실현하느냐에 따라 달라집니다. 이 연구는 MLLM에서 이미지 편집기, 그리고 다시 MLLM으로 이어지는 파이프라인에 대한 자동화된 작업 발견 및 폐쇄 루프 진단 프레임워크인 Aphanta를 소개합니다.
Aphanta는 직접 추론, 편집기 생성 중간 결과물 사용 추론, 이상적인 참조 중간 결과물 사용 추론이라는 세 가지 조건을 평가하여 현재 편집기의 실질적인 유용성과 잠재적인 시각 여유 공간을 분리합니다. 20개의 후보 작업과 여러 편집기-MLLM 조합을 통해, 중간 결과물의 유용성은 작업에 따라 크게 달라진다는 것을 발견했습니다.
효용성은 시각 단서 주입(visual cue injection), 접지(grounding), 그리고 반사실 상태 실현(counterfactual state realization)에서 집중되었으며, 기호 민감한 구성이나 구조적 외삽을 요구하는 중간 결과물은 훨씬 덜 신뢰할 만한 것으로 나타났습니다. 선택된 긍정 작업 부분집합에서 통합된 Qwen 파이프라인은 평균 작업 점수를 0.343에서 0.445로 향상시켰으며 이는 상대적으로 29.7% 증가한 수치입니다.
이러한 결과는 이미지 편집을 보편적인 추론 메커니즘이 아닌 특화된 시각 작업 공간으로 위치시키며, Aphanta를 작업-표현 정렬, 편집기 실현, 그리고 다운스트림 파이프라인 유용성을 측정하는 재사용 가능한 프로토콜로 확립합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma
수집 2026-08-28 04:24
멀티모달 대규모 언어 모델(MLLM)은 거리 풍경을 해석할 수 있지만, 에이전트가 움직이기 시작한 후에도 이러한 지역적 증거가 신뢰할 수 있는 행동으로 이어질 수 있는지에 대한 연구가 진행되었습니다. 이 논문은 현재 MLLM 에이전트가 복잡한 실제 규모 도시에서 지역적 도시 인식을 얼마나 신뢰할 수 있는 행동으로 전환할 수 있는지 조사합니다.
연구진은 홍콩의 3D 지리 공간 데이터로 구축된 물리적으로 제약된 복제본을 기반으로 하는 최초의 샌드박스인 UrbanGround를 제안했습니다. UrbanGround는 1인칭 시점에서 폐쇄 루프 상호작용을 지원하며 내비게이션을 위한 상호작용 가능한 지도를 제공하여 에이전트가 3D 도시 내부로 직접 진입하여 탐색할 수 있게 합니다.
분석은 세 가지 연구 질문을 따라 공간 문제의 성장을 조사했습니다. 에이전트가 능동적인 관찰 후 공간 질문에 답하기 위해 지역 장면을 충분히 잘 기반(grounding)할 수 있는지, 그리고 이 기반이 목적지가 멀어질 때 내비게이션을 지원하는지, 마지막으로 경로 가용성과 보행자 움직임의 변화 속에서 결과 행동이 유지되는지를 검증했습니다.
현재 MLLM 에이전트는 시각 인식과 단거리 공간 추론에서 유용한 원자적 능력을 보여주지만, 방향 설정과 보행자 인식 움직임은 여전히 신뢰하기 어렵습니다. 에이전트의 주요 실패는 지역적 능력이 지속적인 목표 지향 행동으로 구성되지 않고 오류가 효과적으로 수정되지 않은 채 축적되는 장기 탐색에서 발생합니다. UrbanGround는 이러한 연구를 통해 현재 MLLM 에이전트가 복잡하고 열린 도시 환경에서 얼마나 신뢰성 있게 탐색할 수 있는지에 대한 광범위한 연구를 지원할 것으로 기대됩니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang
수집 2026-08-28 03:23
최근 비디오 생성 모델들은 세계 모델로 간주되고 있으며, 물리적 과정은 여러 유효한 방식으로 전개될 수 있기 때문에 세계 모델은 단순히 그럴듯한 궤적뿐만 아니라 동일한 초기 관찰과 행동 하에서의 가능한 행동 분포까지 재현해야 합니다. 이러한 분포 수준의 요구사항을 확률적 정렬(probabilistic alignment)이라고 부릅니다.
하지만 기존의 평가 방식은 주로 개별 비디오의 그럴듯함만을 평가할 뿐, 반복적인 생성에서 올바른 분포를 회복하는지 테스트하지 못한다는 한계가 있습니다. 이는 현재 비디오 생성 모델이 확률적으로 정렬된 세계 모델로부터 얼마나 떨어져 있는지에 대한 근본적인 질문을 제기합니다.
이러한 격차를 해소하기 위해 연구진은 세계 모델에 대한 분포 기준으로서 확률적 정렬을 공식화하고, 비디오 생성 모델을 세계 역학의 확률적 샘플러로 평가하는 벤치마크인 PAWBench를 도입했습니다. 또한 반복적인 비디오 롤아웃을 가능한 물리적 행동에 대한 경험적 분포로 변환하는 결과 수준 프로토콜인 PAWEval을 추가로 제시했습니다.
50가지 시나리오와 열한 가지 시스템에 걸쳐, 어떤 모델도 유효한 행동의 범위를 회복하면서 참조 확률과 일관되게 일치하지 못하는 것으로 나타났습니다. 연구진은 이러한 격차를 바탕으로 언어 프롬프트, 초기 노이즈 샘플링, 또는 모델 훈련이 모델의 예측 분포를 어떻게 변화시킬 수 있는지 테스트했습니다. 이 연구는 확률적으로 정렬된 세계 모델로 나아가는 미래 노력의 기반이 될 수 있다고 믿습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
수집 2026-08-28 03:23
LLM 에이전트가 외부 환경과 상호작용하는 방법을 학습하기 위해 생성된 상호작용 데이터에 점점 더 의존하고 있습니다. 따라서 에이전트 데이터 생성은 단순히 데이터의 양을 늘리는 것을 넘어, 환경, 작업, 상호작용, 성공 신호 간의 일관성을 유지하면서 경험이 풍부하기보다 유용하도록 만들어야 합니다. 기존 연구들은 다양한 에이전트 도메인을 다루고 있지만, 도메인 중심 조직과 이질적인 평가 방식 때문에 공통적인 생성 메커니즘이 가려지고 후보 구성과 검증 및 선택이 혼재되는 문제가 있었습니다.
이 연구는 이러한 문제를 해결하기 위해 두 단계의 프레임워크를 개발합니다. 첫째, 에이전트 데이터를 환경 명세(E), 작업 신호(q), 상호작용 실현(τ), 선택적 검증자(v)로 구성된 공통 인수분해 객체로 표현합니다. 둘째, 생성 과정을 정확도(Accuracy), 복잡도(Complexity), 다양성(divErsity)을 기준으로 하는 ACE 렌즈를 통해 제약된 분포 설계로 공식화합니다.
이 프레임워크에서 정확도는 접지되고 내부적으로 일관된 데이터의 실현 가능한 지지 범위를 설정하며, 복잡도는 선언된 학습자와 실행 구성의 능력에 상대적인 학습량을 측정합니다. 다양성은 데이터의 범위와 중복성을 제어하여 에이전트의 행동 범위를 확장하는 데 기여합니다. 연구자들은 이 틀을 사용하여 생성된 경험이 어떻게 검증되고, 난이도가 어떻게 구성되며, 행동 범위가 어떻게 확장되는지를 탐구합니다.
궁극적으로 핵심 과제는 단순히 더 많은 데이터를 생성하는 것이 아니라, 에이전트와 환경이 진화함에 따라 유효하고, 정보가 풍부하며, 중복되지 않는 경험을 지속적으로 할당하는 것입니다. 이는 에이전트 데이터 생성의 확장, 데이터 소스, 훈련 체제 및 적응형 학습에 대한 광범위한 방향과 새로운 추세를 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Weinan Zhang, Yong Yu, Qun Liu, Weiwen Liu
수집 2026-08-28 02:22
최근 게임 개발은 고품질 시각 콘텐츠를 위해 모델링, 재질 작성, 애니메이션, 조명, 효과 및 런타임 최적화가 필요하여 에셋 제작 비용이 높고 프로토타입 개발 주기가 길어지는 기존 그래픽 파이프라인에 의존해 왔습니다. 비디오 파운데이션 모델이 영상 제작에 변화를 가져오고 있지만, 게임은 선형 미디어와 달리 연속적이고 현실적인 이미지뿐만 아니라 안정적이고 재현 가능한 게임 규칙, 객체 상태, 상호작용 결과를 요구합니다.
이에 연구진은 상호작용 게임을 위한 실시간 생성형 월드 렌더링 시스템인 Magpie를 제시합니다. Magpie는 게임플레이 실행과 시각적 생성을 분리하여 게임 디자인의 재현성과 재현성을 보존하면서 실시간 게임 렌더링에 생성형 모델을 적용할 수 있는 시스템 수준의 구현 경로를 제공합니다.
구체적으로 게임 엔진은 장면과 규칙을 정의하고 플레이어 행동을 해결하며 월드 상태를 유지하는 역할을 합니다. 동시에 독립적인 렌더 서버는 엔진이 생성한 화이트박스 프레임으로부터 시각적 출력을 생성합니다. 이 구조는 초기 게임 프로토타입이 완전한 시각적 에셋에 의존하는 것을 줄이고, 게임플레이 디자인의 제어 가능성을 유지하는 데 중점을 둡니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Xiaoyu Zhan, Xinyu Wang, Xiaohong Zhang, Huanjie Zhu, Tengjiao Sun, Pengcheng Fang, Jiaxing Yu, Yanwen Guo, Dongjie Fu
수집 2026-08-28 02:22
LLM 추론을 위한 메모리 효율적인 후처리 패러다임으로 최근 진화 전략(Evolution Strategies, ES)이 부상하고 있습니다. 이 연구는 ES의 동역학과 메커니즘을 체계적으로 조사하여 기존의 주류 방법인 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO) 대비 ES의 성능 우위를 입증했습니다. 이론적으로는 ES 모집단 전반의 검증자 투영 젠센-섀넌 다양성(verifier-projected Jensen-Shannon diversity)이 더 높은 Pass@K 성능에 도움이 된다는 것을 보여줍니다.
실증적으로 ES는 GRPO가 보이는 엔트로피 붕괴(entropy collapse)와 달리 Pass@1을 개선하면서도 GRPO보다 높은 Pass@K 성능을 달성했습니다. 이는 ES가 사전 훈련된 LLM의 추론 능력을 더 잘 활용하여 더 광범위한 추론 커버리지를 제공함을 의미합니다. 또한, 전체 모델 파라미터 이동이 상당함에도 불구하고 ES의 태스크 성능 향상은 더 큰 규모의 업데이트가 아닌 희소한 부분 집합에서 기인한다는 것을 발견했습니다.
이러한 기능적 희소성(functional sparsity)은 큰 파라미터 움직임이 광범위한 기능 변화를 의미하지 않으며, 이는 치명적인 망각(catastrophic forgetting)으로 이어지지 않음을 시사합니다. 마지막으로, ES의 효과에 대한 하이퍼파라미터 설계의 영향을 연구하여, 더 큰 LLM에서 ES를 사용하기 위해서는 더 작은 모집단 크기가 필요함을 확인했습니다. 이러한 결과는 ES가 GRPO보다 덜 효과적인 메모리 효율적인 대안이 아니라, 고유한 추론 후처리 패러다임임을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang
수집 2026-08-28 02:22
온-정책 증류(OPD)는 대규모 언어 모델(LLM)에서 성공을 거두었으나, 새로운 목표에 대해 별도의 교사 모델을 훈련해야 하는 높은 계산 비용과 교사 및 학생 분포의 불일치로 인한 오류 누적이라는 두 가지 주요 문제점을 안고 있습니다. 이 논문은 이러한 문제를 해결하기 위해 흐름 매칭 모델을 위한 교사 없는 OPD 프레임워크인 Self-OPD를 제안합니다.
Self-OPD는 학생 모델의 자체 탐색을 단계별 지도 학습으로 전환하는 것을 목표로 합니다. 각 시간 단계에서 Self-OPD는 결정론적인 다음 상태 예측을 K개의 확률적 SDE 후보로 분기하고, ODE 샘플러를 사용하여 이를 실행한 후, 보상을 결정론적인 자기 참조 기준선과 비교하여 정규화된 이점을 얻습니다.
이후 속도장(velocity field)은 방향 인식 감쇠(direction-aware attenuation) 및 SDE 분산 정규화(SDE-variance normalization)를 통해 모든 분기에 대한 풀-푸시 목표로 최적화됩니다. 또한 다중 목표 정렬을 위해 Self-OPD는 보상 수준에서 정규화된 점수를 융합하여 직접적인 기울기 충돌을 피합니다.
단일 및 혼합 보상 벤치마크에 대한 실험 결과, Self-OPD는 작업별 교사 없이 이전의 강화 학습 및 OPD 방법들보다 우수한 성능을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng
수집 2026-08-28 02:22
구글이 개발자를 위해 생성형 비디오에 대한 제어 능력을 향상시킨 생산 준비 완료 업데이트인 Gemini Omni 1.1 Flash를 출시했습니다. 이 업데이트를 통해 사용자는 장면을 확장하고, 부드러운 전환을 위해 시작 및 끝 프레임을 지정하며, 고해상도 4K 출력을 생성할 수 있게 되었습니다.
Gemini Omni 1.1 Flash는 비디오 프로젝트에서 시각적 일관성과 서사적 흐름을 개선하여 최대 40초 분량의 장면을 확장할 수 있게 합니다. 또한, 카메라 움직임과 전환을 부드럽게 만들기 위해 시작 및 끝 프레임을 설정할 수 있으며, 360p 미리보기를 사용하여 창의적인 프로세스를 더 빠르게 반복하고 비용을 절감할 수 있습니다. 최종 결과물은 4K 해상도로 업스케일링되어 더욱 세련되고 전문적인 모습을 제공합니다.
개발자들은 Google AI Studio나 Gemini Enterprise Agent Platform을 통해 이 모델에 접근하여 즉시 빌드를 시작할 수 있습니다. 공식 문서, 요리책, 프롬프팅 가이드를 통해 장면 확장, 비디오 참조, 업스케일링 기능을 애플리케이션에 통합하는 방법을 배울 수 있습니다.
이 기능은 Google AI Plus, Pro, Ultra 구독자에게는 Google Flow와 Gemini 앱에서 장면 확장이 제공되며, 모든 Google AI 구독자에게는 Gemini 앱에서 장면 확장이 이용 가능합니다. 이는 개발자들이 AI를 활용하여 창의적인 비디오 소프트웨어를 구축하는 데 있어 큰 진전을 의미합니다.
Hacker News
출시
발행 2026-08-27
saretup
수집 2026-08-27 19:17