SenseNova-U1.5는 인코더와 VAE가 없는 구조에서 시각 콘텐츠를 이해하고 추론하며 생성하는 8B-MoT 네이티브 통합 멀티모달 모델을 발표했습니다. 이 모델은 공간적으로 일관된 패치 재구성을 통해 시각 인터페이스를 강화하고, 선별된 생성 및 편집 데이터, 개선된 작업 공식화, 구조적 프롬프트 향상, 그리고 최대 4K의 네이티브 해상도를 통해 훈련을 확장했습니다.
사전 훈련 이후에는 미학, 이중 언어 텍스트 렌더링, 인포그래픽 생성, 이미지 편집과 같은 전문 전문가들을 최적화하고 다중 전문가 온-폴리 정책 증류를 통해 그 능력을 통합했습니다. 광범위한 평가 결과, SenseNova-U1.5는 이미지 충실도, 텍스트 렌더링, 복잡한 구성, 다중 참조 편집, 인터리브 생성 능력을 크게 향상시켰습니다.
특히 모델은 지시 사항을 잘 따르고 피사체, 기하학, 수정되지 않은 영역을 보존하는 동시에 복잡하고 구조화된 시각 지침에 효과적으로 일반화하는 능력을 보였습니다. 이는 멀티모달 이해가 시각적 계획 및 생성으로 전이될 수 있음을 입증하며, 네이티브 통합 모델링이 종단 간 프레임워크 내에서 인식, 추론, 생성 시스템을 구축하는 유망한 경로임을 시사합니다.
연구팀은 지도 미세 조정, 강화 학습, 온-폴리 증류를 포함한 훈련 코드를 공개할 예정입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 어제
Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen, Ruixi Zhang, Ruohui Wang, Wenwen Tong, Xiangyu Fan, Yubo Wang, Yue Zhu, Yuwei Niu, Zhengqi Bai, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Bo Yang, Chen Feng, Chengguang Lv, Guangjia Liu, Guanlin Wang, Hanyu Zhang, Haojia Yu, Hongcan Xiao, Hongli Wang, Huan Wu, Huaping Zhong, Jian Fang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jing Zuo, Jingcheng Ni, Junxiang Xu, Linjun Dai, Mutian Xu, Peishen Yan, Penghao Wu, Ruijie Mao, Ruisi Wang, Shihao Bai, Shuang Yang, Shuya Yang, Shuyan Zheng, Silei Wu, Siying Li, Tao Chu, Tianbo Zhong, Tongxi Zhou, Weichao Luo, Weichen Fan, Wenhao Jia, Wenjie Gao, Xiangli Kong, Yan Li, Yang Yong, Zimo Wen, Zixuan Qian, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin
수집 2026-09-11 03:21
오토회귀 비디오 월드 모델은 상호작용적이고 장기적인 탐색을 가능하게 하지만, 유연한 제어는 여전히 어려운 과제로 남아 있습니다. 새로운 시점에서 소스 비디오를 탐색하려면 생성된 결과가 기록된 이벤트와 동기화되고, 관찰된 내용을 요청된 시점으로 배치하며, 새로 노출된 영역을 그럴듯하게 완성하고 재방문 시 이전에 생성된 외관을 복구해야 합니다. 기존 방법들은 보통 작업별 모듈이나 추가적인 훈련을 통해 이러한 요구 사항을 해결합니다.
본 논문은 이러한 문제를 해결하기 위해 World in World라는 훈련 불필요한 추론 시간 인터페이스를 제시합니다. 이 인터페이스는 이질적인 제어 증거를 카메라 및 시간 레이블이 지정된 깨끗한 시각 상태로 변환하며, 이는 고정된 인과적 비디오 모델의 내재된 자기 주의(self attention)를 통해 읽어들여집니다. 증거에는 소스 비디오 관찰, 타겟 시점 장면 투영, 새로 노출된 주제 영역 완성을 안내하는 기하학적 렌더링, 그리고 롤링 캐시를 넘어선 검색된 생성된 상태 등이 포함됩니다.
이 시스템은 대응 라우터(correspondence router)를 사용하여 영구적인 점 정체성과 기하학을 결합하여 토큰 대응 관계를 설정하고, 증거별 주의 조건화(Evidence-wise attention CFG, EWA)를 통해 동일한 디노이징 순방향 패스에서 얻은 주의 응답을 사용하여 각 보조 채널의 추가 기여도를 독립적으로 조절합니다. 이 공유 인터페이스는 동일한 고정된 백본을 사용하여 카메라 제어 재렌더링, 장기 재방문, 그리고 인간 움직임 전송을 지원합니다.
연구진은 World in World를 다양한 시점 변화 하에서 카메라 제어 비디오 재렌더링에 대해 평가했으며, 지각적 품질, 시간적 일관성, 그리고 카메라 추적 정확도를 측정했습니다. 이는 복잡한 비디오 월드 모델에서 제어의 유연성을 획기적으로 개선할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 어제
Chenxi Song, Yanming Yang, Chi Zhang
수집 2026-09-11 03:21
에이전트 사용이 코딩이나 과학적 발견과 같은 장기 목표 작업으로 이동함에 따라 터미널 작업이 특히 중요해지고 있습니다. 연구진은 강화 학습을 통해 훈련된 1220억 개의 매개변수를 가진 Mixture-of-Experts 모델인 T1을 소개하며, 이 모델은 클라우드 샌드박스에서 실제 셸을 운영하여 작업당 300회 이상의 도구 호출 턴을 수행하고 각 작업의 검증자 실행을 통해 보상을 받습니다.
T1을 훈련하기 위해 연구팀은 세 가지 핵심 방법을 제시했습니다. 첫째는 액터-크리틱 훈련을 안정화하기 위한 공격적인 워밍업과 프로세스 보상을 통한 궤적 점수화이며, 둘째는 TITO 구성, 드리프트 수정, 롤아웃 라우팅 리플레이를 통해 안정적인 최적화를 달성하는 것입니다. 셋째는 벤치마크 과적합을 피하기 위해 Terminal-Bench 2.1과 분리된 고립된 시드 및 합성 작업을 사용하는 완전히 분포 외 훈련 코퍼스를 활용합니다.
이러한 방법론을 통해 TITO와 R3는 훈련과 추론의 로그 확률 차이를 0.021에서 0.013으로 줄이고 손실 영역에서 정확히 정렬된 0 토큰 드리프트를 달성했습니다. Terminal-Bench 2.1에서 이 파이프라인은 초기 기반 모델을 43.8%에서 64.0%로 높였으며, 장기 터미널 벤치에서는 T1이 27.9%에 도달하여 GPT-5.4 및 GLM-5.1을 능가했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 어제
Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li, Haitao Mi, Leowei Liang
수집 2026-09-11 01:19