추측 디코딩(Speculative Decoding)은 드래프트 모델을 사용하여 후보 토큰을 생성하고 타겟 모델이 단일 순방향 패스로 이를 검증함으로써 대규모 언어 모델 추론 속도를 가속화합니다. 그러나 기존의 드래프트 학습 방식은 토큰 수준의 모방에 고정된 위치별 가중치를 적용하여 실제 검증 과정을 반영하지 못하는 한계가 있었습니다.
이에 연구진은 검증 과정을 학습 단계마다 시뮬레이션하고 그 결과인 수용 및 거절 패턴을 감독 신호로 활용하는 플러그인 프레임워크인 검증 인식 학습(Verification-Aware Training, VAT)을 제안합니다. VAT는 두 가지 구성 요소로 이루어져 있는데, 하나는 각 위치가 순차적 검증을 통과하는지 감독하는 경량 이진 분류기인 검증 헤드이며, 다른 하나는 고정된 가중치 스케줄을 대체하여 샘플의 첫 거절 지점까지 전체 가중치를 유지하고 감쇠를 재기준 설정하는 검증 적응형 가중치입니다.
VAT는 학습 목표만을 수정하기 때문에 드래프트 아키텍처, 타겟 모델 또는 추론 절차를 변경하지 않고 기존 방법론 위에 적용할 수 있습니다. EAGLE-3 및 DFlash 모델에 Qwen3-4B, Qwen3-8B, LLaMA-3.1-8B에 VAT를 적용한 결과, 평균 수용 길이(acceptance length)가 최대 11.4% 향상되었고 벽시계 속도(wall-clock speedup)는 최대 8.7% 향상되었습니다. 이러한 성능 향상은 수학, 코드, 채팅 벤치마크 전반에서 일관되게 나타났습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Geonmo Gu, Byeongho Heo, HeeJae Jun, Yoohoon Kang, Sangmin Lee, Sangdoo Yun, Dongyoon Han
수집 2026-09-01 06:30
파라미터 효율적인 모델 적응에 널리 사용되는 LoRA(Low-Rank Adaptation)의 훈련 역학을 안정적이고 효과적으로 최적화하는 방법에 대한 연구가 부족했습니다. LoRA는 업-프로젝션(up-projection)을 0으로 초기화하기 때문에 초기 최적화 역학은 주로 다운-프로젝션(down-projection)에 의해 지배됩니다.
이러한 관찰을 바탕으로 연구진은 훈련 중에 다운-프로젝션 행렬을 정규화하는 간단하면서도 효과적인 방법인 정규화된 저랭크 적응(Normalized Low-Rank Adaptation, NoRA)을 제안했습니다. NoRA는 정규화를 초기화 시점에만 적용하여 반복적인 정규화 없이 표준 LoRA를 개선합니다.
NoRA는 사전 훈련, 지도 미세 조정, 강화 학습 전반에 걸쳐 수렴 속도를 가속화하고 성능과 훈련 안정성을 향상시키며 치명적인 망각(catastrophic forgetting)을 완화하는 것으로 나타났습니다. 이 모든 이점은 추가적인 학습 가능한 파라미터나 추론 시 계산을 요구하지 않아 NoRA를 LoRA에 대한 간단하고 광범위하게 적용 가능한 개선책으로 만듭니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu
수집 2026-09-01 05:28
최근 비디오 생성 모델들은 오디오를 생략하거나 별도의 단계에서 합성하는 경우가 많아 시각적 역동성과 음향 이벤트 간의 상호 모델링이 제한되어 왔습니다. 이에 DreamX-Creator 1.0은 7B 생성기를 중심으로 하는 통합적인 오디오-비디오 생성 시스템을 제시합니다. 이 시스템은 첫 프레임과 텍스트 프롬프트를 조건으로 사용하여 양방향으로 오디오 및 비디오 스트림을 공동으로 노이즈 제거합니다.
모델은 네트워크의 전반부에서 스트림을 독립적으로 처리한 후, 후반부에서 게이티드 교차 모달 어텐션(Gated Cross-Modal Attention)을 통해 스트림을 결합합니다. 이 어텐션 헤드 출력 게이트는 각 활성 교차 모달 어텐션 헤드의 출력을 조절하여 시각적 및 청각적 정보를 효과적으로 통합합니다. 또한 통합 오디오-비디오 데이터 시스템은 시간적으로 일관된 클립을 구성하고 구조화된 멀티모달 주석을 생성하여 클립을 역량 중심의 데이터 풀로 정리합니다.
DreamX-Creator 1.0은 두 단계의 오디오-비디오 사전 훈련과 고품질 미세 조정을 포함하는 점진적 공동 훈련(Progressive Joint Training)을 통해 학습됩니다. 여기에 모달리티 인식 멀티모달 피드백(Modality-Aware Multimodal Feedback)을 활용한 오디오-비디오 강화 학습(Audio-Video Reinforcement Learning)을 추가하여 생성기를 추가로 훈련시킵니다. 고해상도 출력을 위해 자기회귀 1단계 2K 정제(Autoregressive 1-Step 2K Refinement) 파이프라인은 양방향 다단계 교사를 자기회귀 다단계 정제기로 변환하여 시간 청크당 한 번의 노이즈 제거 평가만 필요하도록 압축합니다.
결과적으로 DreamX-Creator 1.0은 최첨단 오픈 소스 시스템과 경쟁할 만한 성능으로 네이티브하고 동기화된 오디오-비디오 생성을 달성했습니다. 개발자들은 이 시스템이 7B 생성기와 2K Refiner를 공개함으로써 통합 오디오-비디오 생성 연구를 위한 접근 가능한 기반을 제공하고 오디오-비디오 생성 기술을 대중화할 수 있기를 기대합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu
수집 2026-09-01 05:28
BLARM은 모노큘러 비디오와 정적 객체 메시를 입력으로 받아 비디오를 따라 움직이는 시간적으로 일관성 있는 3D 메시 애니메이션을 예측하는 피드포워드 방법론을 소개합니다. 기존 방식처럼 명시적인 리깅이나 고차원 버텍스 움직임을 직접 회귀하는 대신, BLARM은 학습된 시간 변화형 강체 움직임 구성 요소와 시간 불변의 버텍스-구성 요소 스키닝 가중치를 사용하여 애니메이션을 표현합니다.
이 접근 방식은 스켈레톤, 케이지, 스키닝 가중치 또는 리그 주석 없이도 필요한 저차원 변형 공간을 제공합니다. 아키텍처는 공간-시간 주의(spatial-temporal attention)를 통해 기하학 기반 변형 잠재량(deformation latents)을 비디오 특징에 조건화한 다음, 예측된 스키닝 가중치로 혼합된 강체 변환을 디코딩합니다.
BLARM은 궤적 재구성, 엔트로피 정규화, 그리고 움직임 인식 대조 학습을 통해 훈련되었으며, 이를 통해 모노큘러 비디오에서 간결하고 해석 가능한 움직임 구조를 복원하면서 정확하고 시간적으로 안정적인 애니메이션을 생성합니다. 이는 복잡한 3D 애니메이션 생성 시 명시적인 제약 조건 없이 움직임을 효율적으로 모델링하려는 개발자에게 유용한 방법론을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Pradyumn Goyal, Yizhak Ben-Shabat, Hsueh-Ti Derek Liu, Haomiao Jiang, Snehasish Mukherjee, Kyle Spence, Mark Stauber, Evangelos Kalogerakis, Yunze Zeng
수집 2026-09-01 04:27
자율 과학 연구 에이전트는 문헌 검토, 데이터 분석, 실험, 보고서 생성 등 종단 간 과학 워크플로우에 점점 더 많이 적용되고 있습니다. 하지만 이러한 연구 작업은 종종 필요한 분석, 방법, 성공 기준을 명확하게 지정하지 않아 에이전트가 중요한 분석을 놓치거나 부적절한 방법을 사용하거나 증거로 충분히 뒷받침되지 않는 결론을 도출할 수 있습니다.
이 문제를 해결하기 위해 연구 실행 전에 작업별 실행 가능한 루브릭을 유도하는 평가 우선 프레임워크인 AutoSciRub을 제시합니다. AutoSciRub은 모호한 지시 사항을 원자적 과학 목표로 분해하고 관련 문헌 및 작업에서 보이는 데이터에 근거하며 구체적이고 실행 가능하며 검증 가능한 기준을 합성합니다. 이 루브릭은 암묵적인 실험 및 증거 요구 사항을 명시적으로 만들어 실험과 분석에 대한 지침을 제공합니다.
또한, 루브릭 기반 검증을 통해 충족되지 않은 기준을 식별하고 연구 보고서와 지원 산출물을 목표 지향적으로 개선할 수 있습니다. ResearchClawBench에서는 AutoSciRub이 고정된 Codex 하네스 및 고정된 DeepSeek-V4-Flash 백본 LLM 하네스에서 평균 2.08점, 에이전트 하네스에서는 2.95점의 평균 점수를 개선했습니다. AstaBench E2E Discovery의 무작위 샘플 20개 작업 세트에서는 세 가지 에이전트 하네스에 걸쳐 평균 16.8점의 개선을 달성하면서 성공적으로 완료된 작업의 수를 유지하거나 증가시켰습니다.
이러한 결과는 평가 우선 지침이 자율 과학 연구를 위한 효과적이고 일반화 가능한 제어 메커니즘을 제공한다는 것을 입증합니다. (Code: https://github.com/zjunlp/AutoSciRub)
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu, Jintian Zhang, Yijun Chen, Zirui Xue, Shumin Deng
수집 2026-09-01 04:27
부분적으로 관측 가능한 환경에서 AI 에이전트는 지속적으로 발전하는 지각 상태를 유지하기 위해 능동적 감각(active sensing)과 작업 기억(working memory)을 조정해야 합니다. 그러나 기존 벤치마크들은 물리적 및 제어 복잡성을 도입하여 지각 상태 구성 및 해석 능력을 분리하기 어렵다는 한계가 있습니다. 이를 해결하기 위해 MNIST-PRO라는 벤치마크가 제시되었는데, 이는 MNIST 숫자 인식을 시점 제약(lookback constraints)이 있는 순차적, 엿보기 기반 탐색 과제로 변환하여 에이전트의 지각 능력을 분리합니다.
이 연구는 원시 시각 기록, 텍스트 상태, 구조화된 메트릭 그리드 맵, 통합된 시각 캔버스 등 네 가지 기억 표현을 사용하여 열 가지 멀티모달 모델을 평가했습니다. 모델들은 완전한 관측 하에서는 우수한 성능을 보였지만, 부분적 관측 상황에서는 명확한 성능 격차가 드러났습니다. 연구진은 이 과정에서 세 가지 주요 병목 현상을 식별했습니다. 첫째, 에이전트가 파편화된 엿보기(glimpses)를 통합하는 데 어려움을 겪으며 지각 상태를 구성하고 해석하는 데 도전이 발생합니다.
둘째, 에이전트는 전체 시퀀스를 보기 전에 탐색을 중단하는 경향이 있습니다. 셋째, 에이전트는 후속 모순되는 증거에 직면하더라도 초기 잘못된 믿음을 수정하지 못하는 경우가 많습니다. 이러한 결과는 단순히 시각적 증거를 획득하는 것만으로는 충분하지 않으며, 에이전트가 신뢰할 수 있는 지각 상태를 구축하고 업데이트할 수 있어야 함을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
수집 2026-09-01 04:27
대규모 언어 모델(LLM) 에이전트는 장기적이고 상호작용적이며 상태를 기억하는 환경에서 점점 더 많이 사용되고 있습니다. 이러한 환경에서 잘못된 행동 하나는 되돌릴 수 없는 작업 실패를 초래할 수 있으므로 실행 전에 반드시 차단되어야 합니다. 이러한 실패는 모든 실행에서 나타나지 않을 수 있지만 반복된 시도에서 발생할 수 있어 단계와 시도 전반에 걸친 신뢰성이 매우 중요합니다.
하지만 에이전트의 신뢰성을 보장하는 것은 어렵습니다. 최첨단 LLM조차도 특히 도메인별 정책에 의해 통제되는 길고 얽힌 궤적에서 행동이 왜 잘못되었는지 설명하는 데 어려움을 겪습니다. 최근 연구들은 프롬프트 기반 비평 에이전트에 의존하는 반면, 최적화 기반 방법들은 훈련을 위한 풍부한 검증 추론을 체계적으로 생성하는 방법을 부족하게 여깁니다.
이러한 격차를 해소하기 위해 CAST라는 비평 인식 훈련 프레임워크가 제안되었습니다. CAST는 희소한 작업 결과를 비평 학습과 정책 최적화를 위한 행동 수준의 감독으로 변환하는 비평 인식 훈련 방법입니다. CAST는 에이전트 궤적을 분석하여 부분 관찰 하에서 행동의 유효성을 설명하는 구조화된 추론을 합성합니다.
이러한 비평 모델은 정책 모델을 최적화하기 위한 비평 인식 훈련 데이터를 구성하는 데 사용됩니다. CAST를 사용하여 동적 도구 호출 벤치마크에서 Qwen3 계열 모델을 미세 조정했을 때, CAST는 도메인 전반의 신뢰성을 향상시켰습니다. 이 결과는 소매(Retail) 작업에서 GPT-OSS-120B보다 10% 이상의 통과율을 능가했으며, 도메인 외 환경에서 헬스케어(Telehealth) 분야에서 추가로 9%의 개선을 달성했습니다. 이는 비평 인식 훈련이 현실적인 동적 환경에서 LLM 에이전트의 견고성을 향상시킨다는 것을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral
수집 2026-09-01 04:27
학습 환경 생성에 특화된 모델인 CogEvol을 소개하며, 과정에서 코스 개요를 완성된 학습 결과물(구조화된 JSON 슬라이드 또는 자체 포함형 인터랙티브 HTML 페이지)로 단일 단계에 만들어냅니다. 이 모델은 22만 건의 실제 생산 요청을 처리했으며, 슬라이드는 평균 17초, 인터랙티브 페이지는 59초 만에 완료되어 기존의 수 분이 걸리는 멀티턴 에이전트 스캐폴딩 과정을 대체합니다.
CogEvol은 신뢰성을 추구하며, 실제 실패 사례를 기반으로 한 데이터 파이프라인을 통해 53,687개의 검증된 SFT 샘플을 확보했습니다. 또한, 하이브리드 규칙-VLM 보상을 통해 강화 학습(GRPO 기반 RL)을 진행했으며, 시각적으로는 그럴듯하지만 플레이 불가능한 게임을 생성하는 보상 해킹 문제를 수정하여 모델의 안정성을 강화했습니다.
CogEvol-27B 모델은 플래그십 코딩 모델보다 26.9배 적은 파라미터로 슬라이드 품질 83.7점과 500개 사례 인터랙티브 HTML 벤치마크에서 63.7점을 기록했습니다. 특히 인터랙티브 페이지 생성 비용은 스캐폴딩 편집을 통해 추가로 약 76% 절감되었으며, 전체 스택은 국내 어센드 가속기에서 A800 GPU와 동등한 수준으로 구동되어 AI 기반 교육의 단위 비용을 대규모로 낮춥니다.
CogEvol-4B 모델은 Apache 2.0 라이선스로 공개되었으며, OpenMAIC 팀과 협력하여 실제 생산 트래픽을 지원하고 있습니다. 이 모델은 국내 하드웨어 환경에서 효율적인 학습 환경 생성을 실현하는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang, Huiqiang Rong, Mofei Chen, Shen Yang, Yini Chen, Yinuo Duan, Haoxuan Li, Binglin Liu, Ye He, Danqi Zheng, Zhanxin Hao, Yuxuan Wu, Mengting Tao, Yuqiu Liu, Jifan Yu, Juanzi Li, Bin Xu, Lei Hou, Huiqin Liu, Yu Zhang
수집 2026-09-01 04:27
장거리 물리 세계 에이전트는 먼 목표를 추론하면서도 신뢰할 수 있는 폐쇄 루프 행동에 결정을 기반으로 삼아야 합니다. 현재의 파운데이션 모델들은 이러한 능력을 분리하여 사용하고 있는데, 비전-언어 모델(VLM)은 정보 부족분을 추론하고 고수준 계획을 조정하지만 반복적인 내비게이션 기반을 확고히 하는 데는 비효율적입니다. 반면, 내비게이션 파운데이션 모델(NFM)은 의미론적 목표를 강력하게 실행하지만 지속적인 작업 수준 추론 없이 제한된 에피소드 내에서만 작동합니다.
이러한 한계를 극복하기 위해 연구진은 장거리 탐색을 위한 VLM 추론 에이전트와 NFM 실행기를 결합하는 에이전트 스캐폴딩 프레임워크인 NavMCP를 제안했습니다. NavMCP는 VLM이 어떤 증거를 찾고, 어디를 검색하며, 언제 멈출지 결정하게 하고, NFM이 각 의미론적 하위 목표를 폐쇄 루프 내비게이션으로 기반화합니다. 이 두 모델의 협업은 의도가 내비게이션 호출로, 관찰이 소스 기반 궤적 증거로, 메모리가 발견 사항과 부정적 증거를 축적하는 세 가지 채널을 통해 구조화됩니다.
이러한 설계는 개별 내비게이션 롤아웃을 재학습 없이 지속적인 체화 상호작용으로 전환시킵니다. NavMCP는 체화 질문 응답(Embodied Question Answering, HM-EQA), 멀티모달 내비게이션(MT-HM3D), EXPRESS-Bench에서 최고 수준의 결과를 달성했습니다. 특히 HM-EQA에서는 에이전트와 실행기 백본이 일치할 때 기존의 에피소드 인터페이스보다 14.9%p 더 나은 성능을 보였습니다.
Unitree Go2 모델에서 NavMCP는 78.3%의 성공률을 달성했으며, 작업 범위가 증가함에 따라 가장 강력한 기준선 대비 마진이 10점에서 45점으로 증가하는 것을 확인했습니다. 이는 상호 보완적인 파운데이션 모델을 장거리 물리 세계 에이전트에 스캐폴딩하는 잠재력을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen
수집 2026-09-01 04:27
컴포저블 장면 모델링은 실제 실내 장면을 관찰된 대로 배열된 완전하고 편집 가능한 객체 에셋으로 복원하여 로봇 시뮬레이션 및 체화된 AI를 위한 시뮬레이션 준비가 된 현실 환경 복제본을 제공하는 것을 목표로 합니다. 기존 파이프라인은 관찰을 인스턴스로 파싱하고, 각 인스턴스에 대한 에셋을 생성하고, 에셋을 다시 배치하는 세 단계로 구성되어 있지만, 이 과정은 정확한 인스턴스 기하학, 가려지지 않은 시점, 그리고 관찰과 정확히 일치하는 에셋과 같은 입력이 부족한 상황을 가정합니다.
Lucida는 이러한 순서를 유지하면서 요구 사항을 재분배하여, 각 단계가 실제 캡처가 신뢰할 수 있게 제공하는 정보만을 소비하도록 제안합니다. 이를 통해 정밀도는 시작 단계가 아닌 파이프라인의 끝에서 달성됩니다. Lucida는 비디오를 다중 시점 증거를 담은 노드를 가진 장면 그래프로 파싱하고, 각 인스턴스에서 증거를 바탕으로 완전한 에셋을 생성하며, 배치에는 GizmoAct라는 VLM 정책을 사용합니다. 이 정책은 배치를 다중 턴 GUI 상호작용으로 간주하여 객체의 기즈모를 닫힌 루프에서 조작하고 정렬이 달성되면 스스로 결정합니다.
이러한 접근 방식은 장면 수준의 3D 객체 감지, 객체 자세 추정, 장면 재구성 전반에 걸쳐 성능을 크게 향상시킵니다. Lucida는 R2S-Scene에서 Boxer 대비 mAP를 69% 개선했으며, CA-1M에서
[email protected]를 57.8%에서 83.4%로 높였고, SAM3D에 대한 장면 F-Score를 0.794에서 0.924로 증가시켰습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li
수집 2026-09-01 04:27
Qwen3.8-Flash-Next는 1250억 개의 파라미터를 가진 희소 혼합 전문가(sparse mixture-of-experts) 모델로, 토큰당 60억 개의 활성화 파라미터를 사용하며 추가로 510억 개의 n-gram 임베딩 테이블을 가속기 외부에서 유지하여 효율성을 극대화했습니다. 이 모델은 14가지 사전 학습 벤치마크에서 3970억 개의 파라미터 모델보다 8개 벤치마크에서 앞서고 나머지 벤치마크에서는 최대 2.6%p 차이로 뒤처지면서도, 활성화 파라미터는 1/3, 학습 토큰은 1/3, 훈련 FLOPs는 약 1/9 수준으로 훨씬 효율적인 성능을 보였습니다.
모델 구조는 게이티드 델타넷(GDN)과 글로벌 어텐션의 하이브리드 방식으로 토큰 혼합을 수행하며, 지속적인 사전 학습 시에는 마이크로 블록 단위로 컨텍스트를 평가하는 Qwen Sparse Attention(QSA)으로 전체 어텐션 레이어를 대체하여 효율성을 높였습니다. 또한 잔차 스트림은 네 개의 브랜치로 확장하고 요소별 게이트를 통해 읽어들이는 게이티드 잔차(Gated Residual, GR) 디자인을 채택했습니다.
이 모델은 n-gram 임베딩 레이어를 백본 외부에 추가하여 용량을 확장했으며, 손실과 다운스트림 정확도가 항상 함께 움직이지 않는다는 점을 고려하여 n-gram 어휘 크기를 늘리면 손실은 단조롭게 감소하지만 다운스트림 정확도는 포화되는 트레이드오프를 분석했습니다.
이러한 설계와 Muon 옵티마이저의 결합은 최적의 학습률과 배치 크기를 상향 조정하고 배치 크기 워밍업을 불필요하게 만들었으며, 스트레스 테스트 하에서 안정성을 크게 향상시켰습니다. 결과적으로 손실, 벤치마크, 효율성, 안정성은 하나의 설계 문제로 통합되어 동시에 더 효율적이고, 더 유능하며, 더 안정적인 결과를 도출하는 방법을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu
수집 2026-09-01 04:27
최근 연구들은 논문 내용으로부터 과학 다이어그램을 자동 생성하는 것을 목표로 하지만, 단일 턴에서 저자의 시각적 및 소통적 선호도를 완전히 만족시키는 것은 어렵다는 한계가 있습니다. 실제 사용자 연구 결과, 초기 초안을 본 참가자들은 추가 수정을 요청했으며, 수정된 다이어그램에 대해 86%가 더 만족한다고 평가했습니다. 이러한 명확한 요구에도 불구하고 다중 턴 워크플로우는 아직 충분히 탐구되지 않았습니다.
이러한 격차를 해소하기 위해 다중 턴 다이어그램 생성의 벤치마크인 MTPaperBananaBench를 제시했습니다. 이 벤치마크는 3,518개의 사용자 요구사항이 주석 처리된 292개의 이미지를 포함하고 있습니다. 또한, 비용이 많이 드는 인간 연구를 줄이고 확장 가능한 벤치마킹을 가능하게 하기 위해 사용자 시뮬레이터를 구축하여 각 턴마다 충족되지 않은 요구사항을 식별하고 자연어 피드백으로 변환합니다.
평가 결과, 다중 턴 시스템에서 발생하는 두 가지 주요 실패 모드가 확인되었습니다. 첫째는 품질 표류(quality drift)로, 턴이 진행됨에 따라 다이어그램 품질이 점진적으로 저하되는 현상이며, 둘째는 망각(forgetting)으로, 이전 턴에 구현된 특징들이 후속 턴에서 손실되는 현상입니다.
이러한 문제들을 해결하기 위해 내부 비평 및 개선 루프를 통해 다이어그램을 개선하는 다중 에이전트 시스템인 PaperBanana-Interact를 도입했습니다. PaperBanana-Interact는 턴을 거치면서 다이어그램 품질을 저하시키는 대신 지속적으로 개선하며, 기준 모델 대비 품질 점수는 11.9~18.6점, 망각은 3.7~6.2점 감소시키는 성과를 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang, Yale Song, Yiwen Song, Rui Meng, Tomas Pfister, Nanyun Peng
수집 2026-09-01 04:27
DoltLite는 Git 스타일의 버전 관리를 SQLite에 통합한 포크 버전으로, 2,000개의 에이전트 PR을 통해 개발되어 베타 버전을 출시했습니다. DoltLite는 SQLite의 B-트리 계층을 내용 주소 기반의 B-트리인 Prolly Tree로 대체하여 모든 Dolt 제품에 버전 관리 기능을 제공하며, 사용자가 SQLite에서 브랜치, 병합, 차이점 비교 등의 기능을 사용할 수 있게 합니다.
베타 출시를 통해 DoltLite는 저장 형식 안정성, SQL 호환성, 전체 버전 관리 기능, 그리고 생산 성능 측면에서 긍정적인 결과를 입증했습니다. 저장 형식은 이제 안정화되었으며 향후 변경 사항에 대한 마이그레이션 경로가 마련되어 사용자는 안정적으로 도입할 수 있습니다. 또한 DoltLite는 SQLite의 SQL 레이어 호환성을 대부분 충족하며, 580만 개의 복잡한 쿼리를 포함하는 sqllogictest에서 99.46%를 통과했습니다.
성능 측면에서는 버전 관리 기능이 추가됨에 따라 쓰기 성능에 약간의 타협이 발생합니다. 인메모리 데이터베이스의 경우 읽기 성능은 유사하지만 쓰기 성능은 60% 느려졌고, 파일 기반 데이터베이스는 읽기 성능은 동일하지만 배치 쓰기에서 10% 느립니다. 특히 자동 커밋 쓰기(autocommit writes)는 SQLite 대비 3.1배 느리게 작동하므로 성능에 민감한 워크플로우에서는 배치 쓰기를 활용하는 것이 권장됩니다.
Hacker News
출시
발행 2026-08-31
lbw1215
수집 2026-09-01 04:26
연구 계획 수립은 AI 과학자에게 결정적인 능력임에도 불구하고, 강화 학습은 평가 기준(critic)이 결합된 환경을 필요로 하므로 적절한 환경을 갖추지 못하고 있습니다. 이 문제를 해결하기 위해 과학 논문에서 추출한 평가 기준(rubric)을 활용하여 평가 기준을 제공하는 방법이 제시되었습니다. 기존 파이프라인들은 질문과 기준을 동일한 콘텐츠에서 추출하여 보상(reward)을 구두 변환(paraphrase)으로 얻는 방식이었으나, PaperGym이라는 통합 프레임워크를 통해 각 연구 논문을 완전한 훈련 환경으로 전환합니다.
PaperGym은 논문의 구조를 활용하여 연구 목표와 배경에서 질문을 합성하고 방법 및 실험에서 기준을 도출합니다. 이 기준은 방법론 혁신과 실험 설계에 걸쳐 있으며, 기존 데이터셋의 11.90%에서 34.10%에 달했던 평가 기준 누수(criterion leakage)를 3.7%로 크게 낮춥니다. 훈련 과정에서는 이 평가 기준을 두 번 사용하는데, 첫째는 OPSD의 자기 교사(self-teacher)를 위한 특권적 맥락으로, 둘째는 GRPO를 위한 보상으로 사용됩니다.
이러한 훈련 스케줄은 지도 미세 조정(supervised fine-tuning)보다 우수하며, 양쪽 단계를 개별적으로 훈련하는 것보다도 더 나은 결과를 보였습니다. PaperGym-20k 데이터셋으로 훈련된 모델은 세 가지 비교에서 58.1%의 승률을 기록하며 기존 RubricHub Science의 28.2%보다 훨씬 높은 성능을 보였습니다. 특히 훈련된 Qwen3-8B 모델은 ResearchQA에서 73.48점을 달성하여 Kimi K2.6보다 높은 점수를 기록했습니다.
연구팀은 이 프레임워크와 20,000개 인스턴스 코퍼스인 PaperGym-20k, 그리고 PaperGym-Innov 및 PaperGym-Design 벤치마크를 공개합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen
수집 2026-09-01 03:26
온폴리 정책 증류(OPD)는 강화 학습의 보상 기반보다 밀도 높은 토큰 수준의 감독을 제공하지만, 교사가 생성한 궤적은 정책과 본질적으로 다른 오프폴리(off-policy)이기 때문에 감독의 신뢰성과 개선의 원천이 불분명합니다. OPD 훈련 중 교사 감독에서 상당한 노이즈가 발견되었는데, 이 노이즈의 발생 빈도는 교사의 규모에 따라 증가합니다. 놀랍게도 학생 정책은 이러한 노이즈에 둔감하여 노이즈가 포함된 감독을 유지하든 제거하든 동등한 성능에 수렴합니다.
분석 결과, OPD의 이득을 이끄는 요인을 분석한 결과 학습이 낮은 로그 확률 토큰에 집중되며, 단일 고정된 음의 이점(negative advantage)을 사용하는 것이 교사가 제공하는 이점과 성능이 일치함을 알 수 있습니다. 이는 OPD가 낮은 로그 확률 토큰을 억제함으로써 학습을 수행하며 교사가 필요 없음을 시사합니다. 이러한 발견은 엔트로피 적응형 음의 이점을 사용하는 감독 없는 방법인 온폴리 자기 적응(OPSA)을 촉발했습니다.
OPSA는 엔트로피 적응형 음의 이점을 사용하여 고엔트로피 위치에 더 강한 학습 신호를 할당하고 꼬리 토큰을 억제하며 확률 질량을 헤드 토큰 사이에 균등하게 재분배합니다. Qwen3-1.7B 모델과 비교했을 때 OPSA는 AIME24에서 평균 점수(Avg@32)를 35.41점으로 향상시켜 263%의 상대적 이득을 보였으며, 세 가지 벤치마크 전반에서 Pass@32를 두 배 이상 증가시켰습니다. 또한 OPSA는 OPD보다 AIME24 평균 점수에서 16.77점으로 더 우수한 성능을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Yi Ding, Ruqi Zhang
수집 2026-09-01 03:26
대규모 추론 모델(LRM)의 발전은 검증 가능한 보상을 이용한 강화 학습(RLVR)이 수학 및 코드 추론 능력을 크게 향상시킬 수 있음을 보여주었습니다. 그러나 이러한 진전을 개방형 및 에이전트 작업으로 확장하는 것은 보상을 얻기가 더 어렵고 모델이 생성한 경험의 규모와 복잡성을 직접적인 인간 감독이 따라잡지 못하기 때문에 여전히 어렵습니다.
본 논문은 인간의 감독이 학습 루프에서 점차 감소함에 따라 LRM이 어떻게 계속 발전할 수 있는지 연구합니다. 연구는 이 문제를 보상 축과 경험 축이라는 두 가지 연결된 차원으로 분석합니다. 보상 축은 개별 인스턴스에 대한 인간 판단에서 인간 피드백 없이 작동하는 재사용 가능한 검증자와 보상으로 발전하는 과정을 추적합니다. 경험 축은 인간이 선별한 작업과 환경에서 자기 생성된 교육 과정, 구성된 환경, 그리고 자율적인 공진화로 학습이 어떻게 발전할 수 있는지 탐구합니다.
연구는 이 두 차원을 정책 능력, 피드백 충실도, 경험 품질이라는 세 가지 상호 보완적인 객체를 통해 연결합니다. 또한, 자율적인 보상과 경험 생성이 초래하는 보상 해킹, 피드백 드리프트, 커리큘럼 붕괴, 환경 오류와 같은 위험을 강조합니다. 이 분석은 인간 감독을 넘어 LRM을 확장하는 현재 접근 방식과 초지능을 향한 자립적인 학습 시스템 개발에 수반되는 미해결 문제를 구조적으로 설명합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo
수집 2026-09-01 03:26
에이전트 메모리를 파일 형식으로 정의하는 메모리필드(Memoryfields)라는 새로운 접근 방식이 제시되었습니다. 이는 기존의 복잡하거나 비효율적인 에이전트 메모리 시스템을 개선하여 AI 에이전트가 정보를 더 효과적으로 처리하고 기억하도록 돕는 것을 목표로 합니다. 현재 많은 메모리 시스템은 특정 하드웨어에 종속되거나 지나치게 복잡한 그래프 탐색 과정을 요구하여 모델을 혼란스럽게 만들고 확장성을 저해한다는 비판이 있습니다.
메모리필드는 메모리를 프로세스가 아닌 데이터 형식으로 간주하며, 마크다운 파일 페이지와 선택적인 YAML 프론트매터, 그리고 의미 검색을 위한 SQLite 벡터 인덱스를 결합한 포터블 파일 형식으로 설계되었습니다. 이 방식은 기존의 텍스트를 단순히 청크로 나누는 대신 에이전트가 직접 작성하는 산문(prose) 형태로 메모리를 저장하여, 정보가 의미적으로 검색되지 않더라도 불필요한 정보가 노출되는 것을 방지합니다.
이러한 파일 기반 메모리 구조는 지식 그래프를 탐색하는 방식보다 훨씬 효율적이며, 에이전트가 불필요한 정보를 메모리에 채우는 것을 방지하여 메모리 오염 문제를 해결합니다. 또한, 메모리에 출처(URL)를 포함하도록 권장하여 에이전트가 사실 확인을 할 수 있도록 하며, 메모리 필드를 SHA256으로 고정하여 보안을 확보할 수 있는 기능을 제공합니다.
Hacker News
논문
발행 2026-08-31
ingve
수집 2026-08-31 12:14
확산 언어 모델(Diffusion Language Model)은 기존의 자기회귀 모델이 가진 한계를 극복하며 새로운 생성 방식을 제시합니다. 현재 주류 언어 모델은 토큰을 순차적으로 생성하는 자기회귀 방식이지만, 이는 오류 수정이 어렵고 생성 속도가 느리며 미래 문맥을 고려하지 못하는 한계가 있습니다. 반면 확산 모델은 전체 시퀀스를 한 번에 생성한 후 반복적인 정제 과정을 통해 속도와 품질을 동시에 개선할 수 있습니다.
확산 모델의 핵심은 노이즈 제거(denoising) 과정에 있으며, 이는 깨끗한 이미지에서 시작하여 점진적으로 노이즈를 추가하는 순방향 과정과 이 노이즈를 다시 이미지로 되돌리는 역방향 과정을 통해 학습됩니다. 이러한 방식은 생성 과정에서 오류를 수정할 수 있고 양방향 문맥을 고려하여 더 나은 결과를 얻을 수 있게 합니다.
최근 연구에서는 확산 모델이 이미지와 텍스트에 걸쳐 적용될 수 있는 다중 모달 접근 방식을 제공하며, Gemma Diffusion이나 Nemotron Diffusion과 같은 모델들이 이미 등장했습니다. 저자는 확산 모델이 추론 시간과 후처리 단계의 스케일링 법칙을 개선하여 궁극적으로 더 지능적인 모델을 만드는 길을 열어줄 수 있다고 주장합니다. 이는 확산 모델이 사전 학습 스케일링 법칙을 바꾼 트랜스포머가 RNN에 대해 했던 역할과 유사하다고 분석합니다.
Hacker News
논문
피드 등록 2026-08-30
volodia
수집 2026-08-31 02:07
Matrox는 1976년에 설립되어 전문가용 그래픽 및 비디오 출력 기술을 선도한 회사입니다. 초기 제품인 MTX-1632와 MTX-256x2는 당시 S-100 버스 시스템을 위한 인터페이스 카드 형태로 개발되었으며, 이는 256x256 도트 레스터 해상도를 제공하는 등 초기 그래픽 시스템의 발전에 기여했습니다.
이 회사는 초기에는 특정 관심사를 가진 마그진을 통해 성공을 거두었으며, MTX-256x2와 같은 제품들은 당시의 제한적인 환경에서 DMA를 통한 비디오 모드 및 고해상도 디스플레이를 구현하는 데 중요한 역할을 했습니다. 특히 ALT-256x2와 같은 인터페이스 카드는 CPU 시간을 사용하지 않고 화면을 새로 고침하는 유연성과 속도를 제공하며 그래픽 시스템의 효율성을 높였습니다.
Matrox는 2019년 로른 트로티어(Lorne Trottier)에 의해 인수되었으며, 이후 이미지 처리 하드웨어, 그래픽, 비디오 기술을 포괄하는 다양한 사업 부문으로 발전했습니다. 현재 Matrox는 Intel ARC 기반의 Luma 시리즈 GPU를 출시하며 산업용 및 의료용 애플리케이션을 지원하는 고해상도(최대 8K) 및 HDR 12b 기능을 제공하고 있습니다.
이러한 역사는 Matrox가 초기 그래픽 기술의 기반을 다졌으며, 오늘날의 고성능 GPU 기술로 이어지는 중요한 맥락을 제공합니다. 개발자들은 Matrox의 초기 혁신이 어떻게 현대의 고성능 디스플레이 및 컴퓨팅 아키텍처로 발전했는지 이해하는 데 이 정보를 참고할 수 있습니다.
Hacker News
논문
피드 등록 2026-08-30
BirAdam
수집 2026-08-31 02:07
Rust를 기반으로 AI 데이터 파이프라인 전용 언어 및 플랫폼인 Xazz가 개발되었습니다. 이 플랫폼은 AI 프로토타이핑 시 파이썬(pandas, PyTorch) 기반으로 복잡한 파이프라인을 구축할 때 발생하는 타입 오류나 NaN 문제와 같은 런타임 오류를 해결하는 것을 목표로 합니다.
기존의 파이프라인 방식은 파이프라인이 커질수록 데이터 처리 과정에서 발생하는 오류를 런타임에 처리해야 하는 어려움이 있었습니다. Xazz는 이러한 문제를 해결하기 위해 Rust의 안전성과 성능을 활용하여 데이터 파이프라인에 특화된 DSL(Domain Specific Language)을 제공합니다.
특히 Xazz는 Polars와 Burn 프레임워크와의 통합을 통해 데이터 처리 및 딥러닝 연산을 효율적으로 통합할 수 있도록 설계되었습니다. 이는 개발자들이 더 안정적이고 효율적인 방식으로 대규모 AI 데이터 파이프라인을 구축할 수 있는 기반을 제공합니다.
GeekNews
출시
피드 등록 2026-08-30
ax1sdev
수집 2026-08-31 00:06