언어 모델의 성능 향상을 위해 추가적인 테스트 시간 컴퓨팅을 사용하는 테스트 시간 스케일링(test-time scaling) 기법이 연구되었습니다. 모델이 문제 해결을 위해 더 길게 추론할 수 있도록 허용하지만, 전체 추론 경로를 메모리에 유지하는 풀 어텐션(full attention) 방식은 장시간 추론 시 막대한 비용을 발생시킵니다. 연구진은 추론을 계속할수록 대부분의 중간 추론 토큰이 중요도를 잃는다는 점을 발견하고, 이 토큰들을 유지하는 것이 비용 대비 효율적인지 의문을 제기했습니다.
이에 연구진은 프레픽스 슬라이딩(Prefix Sliding)을 제안했는데, 이는 추론 과정에서 프레픽스나 최근 수천 토큰에 속하지 않는 토큰들을 버리는 방식입니다. 프레픽스는 모델에게 핵심 지침과 도구를 제공하며, 가장 최근 토큰들은 모델이 현재 작업 중인 추론에 해당합니다. 이 접근 방식은 모델이 얼마나 길게 추론하든 상관없이 총 메모리 요구 사항을 제한하여 효율적인 장기 테스트 시간 스케일링을 가능하게 합니다.
이 기술은 학습 없이 기존 모델의 성능을 유지하면서 속도를 3배 향상시킬 수 있습니다. 또한, 강화 학습을 사용하여 프레픽스 슬라이딩을 훈련하면 백만 토큰 이상의 추론 경로로 확장하여 더 나은 성능을 달성할 수 있습니다. 실험 결과에 따르면 프레픽스 슬라이딩은 중간 토큰 요약이나 일반적인 슬라이딩 윈도우 방식보다 우수한 성능을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John Yang, Dapeng Jiang, Mika Senghaas, Fares Obeid, Johannes Hagemann, Sami Jaghouar, Ludwig Schmidt, Percy Liang, Jason Wei, Andrew Y. Ng, Luke Zettlemoyer, Yejin Choi, Mike Lewis
수집 2026-08-27 14:14
문서 검색 파이프라인은 금융, 의료, 법률과 같은 고위험 정보 접근을 지원하지만, 모달리티(텍스트 또는 멀티모달)와 검색 아키텍처(밀집 또는 후기 상호작용)에 따라 선택이 달라집니다. 이러한 선택은 효과적인 파이프라인이 대규모로 실행하기에는 너무 느리고 비싸다는 문제와, 가장 빠른 파이프라인이 복잡한 문서에서 증거를 검색하지 못한다는 문제 사이의 어려운 타협을 발생시킵니다. 실무자들은 증거 누락과 사용 불가능한 지연 시간 사이에서 선택해야 하지만, 쿼리 수준에서 이 선택을 조정할 원칙적인 근거가 부족했습니다.
본 연구는 이러한 타협이 불필요함을 보여주며, 모든 쿼리가 동일한 파이프라인을 필요로 하지 않는다는 점을 입증합니다. 연구진은 쿼리 텍스트만을 사용하여 각 쿼리에 가장 적합한 검색 파이프라인을 학습하는 경량의 쿼리 인식 라우터인 RetrievalRouter를 제안합니다. 이 라우터는 단일 조정 가능한 매개변수를 통해 정확도와 지연 시간의 전체 경계(accuracy-latency frontier)를 노출시킵니다.
RetrievalRouter는 기존의 최적 정적 기준 대비 2.5% 더 정확하고 12.4배 더 빠른 성능을 제공합니다. 또한, 이전의 적응형 전략 선택 방법과 비교했을 때, RetrievalRouter는 정확도 중심 설정에서 nDCG@5를 상당히 높게 달성하는 동시에 지연 시간 중심 설정에서는 nDCG@5와 지연 시간 모두에서 동등하거나 더 나은 성능을 보였습니다. 이 결과는 검색 시스템 설계 시 정확도와 속도 사이의 상충 관계를 해소하는 데 중요한 통찰을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi
수집 2026-08-27 08:11
멀티모달 대규모 언어 모델(MLLM)은 비디오 이해에서 강력한 성능을 보였지만, 이 분야에서 지시 사항을 따르는 능력은 아직 충분히 탐구되지 않았습니다. 실제 비디오 이해는 단순히 비디오 내용을 해석하는 것을 넘어 사용자가 지정한 다양한 제약 조건을 만족시켜야 하므로, 기존 벤치마크들이 작업 정확도에 초점을 맞추고 지시 사항 준수 여부를 평가하지 못하는 한계를 가지고 있습니다.
이러한 격차를 해소하기 위해 비디오 이해에서의 지시 사항 준수를 평가하는 포괄적인 벤치마크인 Video-IFBench를 소개합니다. 이 벤치마크는 시각 및 오디오 콘텐츠에 기반한 다양한 제약 조건을 포함하여 모델이 만족해야 하는 요구 사항을 평가합니다. 또한, 32가지 작업 유형과 의미론 및 형식 요구 사항을 포괄하는 39가지 수동 설계 제약 범주를 포함하는 지시 분류 체계를 개발했습니다.
데이터 구축 비용을 줄이기 위해 MLLM, 프로그래밍 처리, 인간 검증을 결합한 반자동 데이터 구축 파이프라인을 사용하여 1,500개의 샘플을 확보했습니다. 20개 이상의 최신 MLLM에 대한 대규모 평가 결과, 현재 모델들은 비디오 콘텐츠를 기반으로 올바른 경로를 선택해야 하는 많은 제약 조건, 의미론적 제약 또는 복잡한 조건 구조를 가진 지시 사항을 따르는 데 여전히 어려움을 겪는 것으로 나타났습니다.
이 연구는 비디오 이해 시 지시 사항 준수에 대한 향후 연구를 촉진하는 데 기여할 것입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao
수집 2026-08-27 06:10
pnpm 12.0 버전은 Rust로 재작성되었지만 마이그레이션이 아닌 업데이트로 제공되며, 기존의 명령어, 플래그, 잠금 파일 형식은 그대로 유지됩니다. 주요 변경 사항은 Git 의존성 처리 방식과 의존성 그래프 해결 방식에 집중되어 있습니다.
이제 GitHub, GitLab 등 저장소에 대한 Git 의존성은 트랜스포트를 선택하는 대신 저장소 자체를 이름으로 지정하며, 잠금 파일은 SSH URL을 기록하지 않습니다. 이를 위해 SSH를 통한 비공개 저장소 접근 시 Git 설정에 URL 재작성 규칙을 구성해야 합니다. 또한, pnpm-workspace.yaml 파일에서 인식하지 못하는 설정이 발견되면 이전처럼 무시하지 않고 경고를 표시하여 설정 오류를 방지합니다.
의존성 그래프의 순환 구조에 대한 잠금 파일이 이제 피어 해결 과정에서 명확하게 파괴되어 순환 의존성이 더 잘 처리됩니다. 이로 인해 잠금 파일은 의존성 그래프의 순수 함수가 되며, 대규모 순환 의존성이 있는 작업 공간에서 피어 해결 속도가 2~3배 빨라지고 메모리 사용량이 약 25% 감소하며 잠금 파일 크기도 줄어듭니다.
파일 시스템 레벨에서는 Linux에서 `packageImportMethod: auto` 설정에 따라 하드링크가 우선 적용되며, 이는 설치 속도와 메모리 효율성을 개선합니다. 또한, `engineStrict` 옵션은 서브트리 대신 엣지를 따라 엔진이 작동하도록 변경되어 설치 실패 시점도 명확해집니다.
Hacker News
출시
발행 2026-08-26
jcbhmr
수집 2026-08-27 06:10
대화 시스템과 같은 듀플렉스 음성 언어 모델(SLM)은 여전히 영혼으로서 스트리밍되고 정확하며 공감 능력이 있는 메모리 시스템이 부족합니다. 이에 연구진은 병렬적인 정보 좌뇌, 감정 우뇌, 그리고 스트리밍 메모리 입출력 메커니즘을 갖춘 단순한 메모리 아키텍처인 VoiceMem을 제안합니다.
VoiceMem은 메모리 인식 SLM 훈련, 장기 평가, 그리고 교체 가능한 메모리 백엔드를 통한 분리된 배포를 위한 완전한 파이프라인을 구축합니다. 실험 및 실제 배포 결과는 세 가지 주요 이점을 보여줍니다. 첫째, 정확도 측면에서 상위 5개 검색 결과에서 좌뇌가 클래식 시스템인 Mem0보다 상위 200개에서 거의 30점 높은 성능을 보였습니다.
둘째, 감정 및 개인화 측면에서 우뇌는 단기 및 장기 정서 귀인과 이중 노드 페르소나 모델링을 통해 세 가지 페르소나 벤치마크에서 최고 성능을 달성했으며, 이전 최고 시스템보다 총 점수를 4.29점 향상시켰습니다. 셋째, 실시간 및 비용 효율성 측면에서 VoiceMem은 검색을 134ms 만에 완료하여 표준 VAD 지연 시간 내에 있으며, 높은 정확도와 낮은 비용을 유지하면서 대화 지연을 추가하지 않습니다.
이러한 결과들은 VoiceMem이 실시간으로 개인화되고 감정적으로 인식하는 음성 상호작용을 위한 실용적인 메모리 기반을 제공함을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan
수집 2026-08-27 05:10
비전-언어 모델은 시각적 증거에 충분히 기반되지 않은 답변을 생성할 수 있으며, 이는 단 하나의 지지되지 않는 객체나 추론 단계가 전체적으로 그럴듯한 응답을 훼손할 수 있습니다. 기존의 스칼라 결과 보상은 답변의 수용 가능성만을 나타낼 뿐, 어떤 시각적 사실이 근거로 제시되었는지, 어떤 추론 단계가 유효한지, 또는 어떤 지시 제약 조건이 누락되었는지를 식별하지 못하는 한계를 가집니다.
이에 연구진은 시각적 신뢰성(Visual Faithfulness, VF), 추론 일관성(Reasoning Consistency, RC), 지시 준수(Instruction Following, IF)를 통해 참조 응답을 원자적 명제(atomic propositions)로 분해하고 답변에 점수를 부여하는 시각적 루브릭 기반 강화 학습(Visual Rubrics-Based Reinforcement Learning)을 제안합니다. 이 루브릭 항목들은 구조화된 부분 점수를 제공하며, 지지 증거가 사용 가능한 경우 루브릭 점수를 국소화하여 부여할 수 있게 합니다.
연구팀은 공개된 OpenMMReasoner-SFT-874K 코퍼스를 사용하여 Qwen3-VL-8B-Instruct를 미세 조정하여 초기 체크포인트를 확보했습니다. 이후 17개의 시각적으로 근거 있는 출처에서 50,248개의 예시로 구성된 V-Rubrics 50K 데이터셋을 구축하고 Gemini-3-Pro를 사용하여 모든 예시를 주석 처리했습니다. 이 데이터를 기반으로 구성 요소별, 접두사 국소화 루브릭 점수를 사용하여 모델을 훈련시켰습니다.
실험 결과, 이 루브릭 기반 GRPO는 공유 SFT 기준선 및 답변 전용 GRPO보다 성능이 향상되었으며, 특히 지식 지향적 및 시각적으로 근거 있는 추론 벤치마크에서 가장 큰 이득을 보였습니다. 이는 시각적 후처리 학습에 루브릭이 유용한 보상 추상화 방법임을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu
수집 2026-08-27 04:09
비전-언어-행동(VLA) 모델은 로봇 조작에서 효과를 보였으나, pi0.5와 같은 최신 모델들은 단일 프레임 패러다임에 머물러 과거 관찰을 유지하고 정밀한 공간 인식을 개발하는 데 한계가 있었습니다. 이에 본 논문은 추가 파라미터 없이 단일 프레임 VLA에 시간 추론 능력을 부여하는 스트리밍 멀티모달 시간 모델링 프레임워크인 StreamPI를 제안합니다.
StreamPI의 핵심 설계는 지시 기반 시간 모델링입니다. 각 (시각 관찰, 언어 지시) 쌍을 원자적인 시간 단위로 간주하며, 쌍 내의 양방향 어텐션은 교차 모달 융합을 가능하게 하고, 쌍 간의 인과적 어텐션은 자기회귀 스트리밍 추론을 보존합니다. 이를 통해 언어 지시가 작업 실행 전반에 걸쳐 지속적인 의미적 앵커 역할을 수행하도록 보장합니다.
또한, 동기식 학습과 비동기식 실제 로봇 배포 사이의 격차를 해소하기 위해 프레임 간격(예: 3 프레임마다)을 도입하는 스트리밍 학습 전략을 제안합니다. 이 간격을 무작위화함으로써 프레임 타이밍 교란에 대한 견고성을 높여 실제 환경에서 비동기식 배포를 지원합니다.
더 나아가, LLM 백본의 길이 외삽(length extrapolation) 기능을 활용하여 StreamPI는 사전 학습된 단일 프레임 가중치를 원활하게 상속받고 유연한 단일 프레임 및 다중 프레임 추론을 지원합니다. 실제 로봇 작업과 시뮬레이션 벤치마크 LIBERO에 대한 실험 결과, StreamPI는 다양한 작업에서 pi0.5보다 우수한 성능을 입증했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao
수집 2026-08-27 04:09
다중 팔 협업은 구체적인 조작(embodied manipulation)의 핵심 능력으로 부상하고 있습니다. 최근 비전-언어-행동(VLA) 모델들은 지각, 언어, 제어를 통합하지만, 대부분 언어를 단일한 전역 지침으로만 표현하여 팔별 행동을 할당하고 구성하는 명시적인 메커니즘이 부족합니다. 이러한 설계는 훈련 중에 관찰된 협업 패턴과 다른 패턴으로의 전이를 제한합니다.
이에 연구진은 원자적 행동 할당을 통한 다중 팔 협업을 위한 통합 프레임워크인 MA-VLA를 제시했습니다. MA-VLA는 협력 행동을 중간 수준의 원자적 프롬프트로 분해하고 이를 개별 팔에 할당하여 명시적인 하위 목표 지정과 작업 간의 구성적 재사용을 가능하게 합니다. 또한, 고정된 실행 역할에 대한 의존도를 줄이기 위해 훈련 시 관찰, 상태, 할당된 원자적 프롬프트를 각 팔에 순열하는 Arm Shuffle을 도입했습니다. 이 순열은 역할에 구애받지 않는 지침 준수를 강제하며 보지 못한 조정 패턴으로의 재구성을 지원하는데, 이를 다중 팔 구성적 일반화라고 명명했습니다.
연구진은 훈련 세트에 테스트 시점 협업 패턴이 없는 벤치마크를 구축했습니다. 시뮬레이션 및 실제 환경 평가에서 기존의 최첨단 VLA 모델들은 이러한 보지 못한 협업에서 대부분 실패했지만, MA-VLA는 일관되게 성공했습니다. 이러한 결과는 팔별 원자적 행동 할당이 다중 팔 구체적 시스템에서 확장 가능한 일반화를 위한 실용적인 경로를 제공함을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang
수집 2026-08-27 04:09
기존의 세계 모델은 행동과 사건에 따른 복잡한 환경의 진화를 시뮬레이션하는 것을 목표로 하지만, 현재의 비디오 기반 세계 모델은 시각적 관찰로부터 역학을 학습하여 결과만을 드러낼 뿐, 세계 진화를 지배하는 근본적인 지식, 규칙, 메커니즘을 파악하는 데는 한계가 있습니다. 이러한 한계는 지속적인 결과를 유지하고 일관성 있는 개방형 진화를 지원하는 것을 어렵게 만듭니다.
이에 연구진은 언어 모델의 추론 및 코딩 능력과 비디오 모델의 생성적 사전 지식을 결합하는 프레임워크인 코드 세계 모델(Code World Model)을 제안합니다. 이 모델은 세계 진화를 시각적 구현으로부터 분리하며, 코딩 에이전트를 세계의 두뇌로 사용하여 사건과 그 결과를 추론하고 실행 가능한 코드를 생성함으로써 지속적인 세계 상태를 유지하고 규칙에 일관된 진화를 수행하게 합니다.
실행 가능한 상태와 시각적 생성을 연결하기 위해 프레임별 시공간 제약 조건을 인코딩하고 프록시 비디오로 컴파일하는 프록시 표현을 도입했습니다. 이 프록시 비디오는 비디오 모델이 고화질 시각적 관찰을 렌더링하도록 조건화합니다. 또한 게임플레이 및 실제 비디오에서 정렬된 프록시 관찰 쌍을 구축하기 위한 데이터 파이프라인도 개발했습니다.
이러한 접근 방식은 코드를 통한 지속적인 세계 진화와 비디오 모델을 통한 유연한 시각적 구현을 결합하여 개방형 세계 모델로 나아가는 새로운 경로를 제시합니다. 코딩 에이전트가 구축한 단순한 상호작용 세계의 프록시 기반 시공간 사양을 보존하면서도 풍부한 시각적 세부 사항과 역학을 유지하는 MiniMax-H3 결과는 이러한 결합의 잠재력을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Yiwen Chen, Guosheng Lin, Chi Zhang
수집 2026-08-27 03:09
현대 소프트웨어는 플러그인 시스템이나 자가 진화 에이전트와 같이 동적 조합을 점점 더 요구하고 있지만, 그 형식적 기반은 아직 미흡한 상태입니다. 연구진은 이 문제를 해결하기 위해 두 가지 직교하는 차원, 즉 구성 요소 제거 시 부수 효과를 완전히 되돌릴 수 있는 시간적 조합성(temporal composability)과 구성 요소 간의 의존성을 선언하고 반응적으로 관리하는 공간적 조합성(spatial composability)을 정의합니다.
이러한 차원을 다루기 위해 클래식한 효과(effect) 및 코효과(coeffect) 개념을 런타임 메커니즘으로 끌어올립니다. 구체적으로, 모든 컨텍스트 변환이 런타임에 역변환을 보유하게 하여 단일 구성 요소 수준의 시간적 조합성을 확립하는 되돌릴 수 있는 효과를 형식화합니다. 또한, 모든 컨텍스트 변화가 구성 요소의 코효과 사양에 따라 분류되어 활성화 및 비활성화를 유도하는 반응적 코효과를 형식화하여 공간적 조합성을 확립합니다.
이 두 메커니즘을 통합하여 효과 컨텍스트와 코효과 컨텍스트를 단일 컨텍스트 유형으로 통합하는 컨텍스트 패러다임을 제시합니다. 이를 통해 서로 다른 구성 요소의 효과가 서로를 방해하지 않고 겹쳐질 수 있는 관찰적 동등성을 유도합니다.
이러한 메커니즘을 구성 요소 개념으로 결합하여 단일 구성 요소에서 전체 시스템에 이르는 시공간적 조합성을 담는 동적 조합의 계산을 제공합니다. 연구진은 이러한 아이디어를 Cordis라는 시공간적 조합성의 메타 프레임워크에 구현했으며, 이는 효과 추적 및 코효과 해결, 구성 재조정 및 핫 모듈 교체를 제공하는 핵심 라이브러리와 선언적 구성 요소 로더를 포함합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Yifan Shi, Wei Zhang, Tianyi Cui
수집 2026-08-27 03:09
에이전트의 능력은 모델 자체에 의해서만 결정되는 것이 아니라, 메모리 관리, 계획 전략, 행동 프로토콜, 도구/기술 오케스트레이션을 포함하는 에이전트 하네스에 의해 더 크게 좌우됩니다. 하지만 현재 에이전트 하네스 설계는 수동적이고 특정 작업에 국한되어 있어 확장성이 부족한 상태입니다. 이에 연구진은 임의의 상용 에이전트 LLM에 대해 작업 적응형 에이전트 하네스를 즉시 합성하도록 훈련된 하네스 지능 모델인 JIT-Agent를 제시합니다.
JIT-Agent는 에이전트 하네스를 고정된 4모듈 프로토콜에 의해 관리되는 구성 가능하고 기계 생성 가능한 결과물로 공식화하며, 주어진 작업에 맞게 하네스를 맞춤 설정하고 안정적인 실행을 위해 하네스를 복구하며, 이전 하네스 구성의 성능 신호를 정제하여 스스로 진화하도록 훈련됩니다. 이 하네스 도우미로서 JIT-Agent를 활용했을 때, DeepSeek-V4-Flash는 DeepSearchQA에서 GPT-5.6을 능가하고 OdysseyBench에서 4.3점의 점수를 얻었으며, 이미 강력한 GLM-5.2는 최대 20.2점의 점수를 획득했습니다.
통제된 평가에서 JIT-Agent가 생성한 하네스는 OpenCode 및 Claude Code와 같은 성숙한 에이전트 실행 환경과 성능 경쟁력을 보였으며, DeepSeek V4, Mimo-V2.5, Qwen3.6과 같은 다중 스케일 모델 패밀리의 성능을 지속적으로 향상시켰습니다. 이는 JIT-Agent가 모델 스케일링과 직교하는 에이전트 능력의 훈련 가능하고, 전이 가능하며, 누적되는 차원으로서 하네스 지능을 확립한 최초의 모델이라고 알려져 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan
수집 2026-08-27 03:09
네이티브 시각 추론은 시각 생성 자체를 추론의 매체로 간주하며, 시각 상태(이미지 및 비디오)를 언어 이상의 문제 해결을 위한 일급 기질로 다룹니다. 그러나 현재 발전은 확장 가능한 훈련 작업, 신뢰할 수 있는 피드백, 그리고 생성 기질 전반에 걸친 통제된 비교의 부족으로 인해 병목 현상을 겪고 있습니다. 이 연구는 이러한 문제를 해결하기 위해 VBVR-Pro라는 폐쇄 루프 테스트베드를 소개하며, 이를 통해 생성 기반의 네이티브 시각 추론을 훈련 가능하고, 검증 가능하며, 최적화 가능하고, 실험적으로 통제 가능하게 만듭니다.
VBVR-Pro는 세 가지 주요 기여를 제공합니다. 첫째, 작업 확장입니다. VBVR-Pro는 시각 추론을 300개의 절차적으로 생성된 작업 공간으로 전환하여, 모델이 RISE-Video, MME-CoF-Pro, BabyVision과 같은 7가지 외부 시각 추론 벤치마크에서 강력한 전이를 보이도록 합니다. 둘째, 검증 가능한 보상입니다. 이 시스템은 작업 기반 평가를 위한 검증 가능한 보상 점수를 제공하며, 이는 VLM-as-a-judge 패러다임의 실패 모드를 식별하고 인간 판단과 미세하게 정렬된 결정론적 규칙에 기반하여 신뢰할 수 있는 보상 신호를 제공합니다. 셋째, 메커니즘 연구입니다. VBVR-Pro는 30개 이상의 이미지, 비디오, 인터리브(interleaved) 생성기를 대상으로 통제된 모달리티 연구를 가능하게 하며, 비디오 생성은 지속적인 시공간 상태 추적을 요구하는 작업에 가장 강력하고, 인터리브 생성은 계산 효율적인 대안을 제공함을 보여줍니다.
분석 결과는 시각 추론에 필수적인 시각 기반 궤적(vision-native trajectories)의 존재를 시사합니다. 연구진은 모든 데이터, 모델, 점수기, 코드를 공개하며, 이는 대규모 다중 작업 강화 학습(multi-task reinforcement learning)에서 더 강력한 사후 RL 성능을 입증합니다. 이 연구는 시각 추론 분야에서 생성 모델의 잠재력을 확장하고 신뢰성을 높이는 데 중요한 기반을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai
수집 2026-08-27 02:08
2026년 대학 에세이 작성에 있어 인공지능 모델 중 제미나이가 가장 선호되었습니다. StudyArena가 6,851명의 학생을 대상으로 진행한 블라인드 테스트 결과, 제미나이가 39.6%의 선택률로 클로드(31.8%)나 ChatGPT/OpenAI(29.2%)보다 우위를 보였습니다.
이러한 결과는 모델 이름이 숨겨진 상태에서 평가가 이루어졌기 때문에, 사용자들이 모델 자체의 성능보다는 결과물의 품질에 집중했음을 시사합니다. 연구 결과는 좋은 답변이 일반적으로 더 길었으며, 선택된 답변은 다른 모델들보다 평균적으로 37% 더 길었습니다.
또한, 에세이 작성에 있어 추론(reasoning)의 양이 글쓰기 품질을 향상시키지 않았다는 점도 주목할 만합니다. 학생들은 에세이 작업 시 낮은 노력 설정이나 기본 설정에서 시작하는 것이 더 효과적이었으며, 복잡한 논리 전개보다는 문장 작성에 집중하는 것이 유리했습니다.
따라서 학생들은 제미나이를 에세이 작성 시 보조적인 편집 도구로 활용하고, 최종적인 언어와 논리는 스스로 작성하는 방식으로 접근하는 것이 가장 좋은 워크플로우로 권장됩니다.
Hacker News
분석
발행 2026-08-25
pasharayan
수집 2026-08-26 05:53
Maiao는 GitHub, GitLab, Gitea 등 다양한 Git 호스팅 플랫폼에서 Gerrit 스타일의 코드 리뷰 워크플로우를 제공하는 도구입니다. 이 도구는 큰 기능 변경 사항을 작은 리뷰 가능한 커밋들로 나누어 관리하는 '스택된 풀 리퀘스트(Stacked Pull Requests)' 방식을 도입하여 코드 리뷰의 질을 높이는 것을 목표로 합니다.
Maiao는 `git review` 명령어를 통해 각 커밋마다 개별적인 풀 리퀘스트(PR) 또는 머지 리퀘스트(MR)를 생성하고 이를 자동으로 스택하여 관리합니다. 이를 통해 개발자는 각 커밋에 대해 독립적으로 피드백을 받고, 깔끔한 Git 히스토리를 유지하며, `git commit --fixup` 명령어를 사용하여 리뷰 피드백을 쉽게 반영할 수 있습니다.
이 시스템은 PR/MR 간의 종속성을 자동으로 관리하고, PR들이 병합될 때 스택을 자동으로 업데이트하며 리베이스를 처리하여 복잡한 병합 과정을 자동화합니다. 또한 GitHub Stacks나 GitLab의 자동 감지된 스택과 같은 네이티브 스택 기능과의 통합을 지원하여 다양한 환경에서 효율적인 워크플로우를 구축할 수 있습니다.
Maiao는 각 커밋을 독립적으로 검토하게 함으로써 더 세밀하고 집중적인 피드백을 가능하게 하며, 여러 플랫폼을 지원하고 자동화된 병합 감지 기능을 제공하여 개발팀의 코드 관리 효율성을 크게 향상시킵니다.
Hacker News
튜토리얼
피드 등록 2026-08-25
zdw
수집 2026-08-25 23:50
SpaceX는 스타십(Starship)이 도착할 때까지 플로리다에서 발사하는 횟수를 대폭 줄이고 있습니다. 이는 플로리다의 스페이스 코스트가 10년 동안 세계에서 가장 붐비는 우주 발사 기지가 되었던 상황이 변화함을 의미합니다.
이러한 변화는 스타십 발사 준비에 따른 것으로, SpaceX 관계자는 플로리다에서의 발사 횟수를 줄이고 있다고 확인했습니다. 과거에 벌컨카날 우주군 기지 및 케네디 우주 센터의 발사대에서 벌컨 9 로켓을 이용해 스타링크 위성을 주로 발사해 왔습니다.
이에 따라 SpaceX는 올해 1월 이후 캘리포니아 반덴버그 우주군 기지에서 더 많은 임무를 시작했으며, 이러한 추세는 연말까지 지속될 예정입니다. 이는 SpaceX가 발사 운영의 중심지를 플로리다에서 서부 해안 지역으로 분산시키고 있음을 보여줍니다.
Ars Technica
뉴스
발행 2026-08-25
Stephen Clark
수집 2026-08-25 23:50
가민이 새로운 내구성 있는 펜픽스 9 스마트워치 라인업을 출시하며 성능을 대폭 개선했습니다. 기본 모델은 최대 3,000니트 밝기의 OLED 디스플레이를 탑재하여 이전 모델보다 두 배 더 밝아졌습니다.
이 제품은 43mm 케이스 옵션 기준으로 999.99달러부터 시작하며, 메모리는 50% 증가한 RAM을 제공합니다. 또한 더 빠른 지도 패닝을 가능하게 하는 업그레이드된 지도 엔진이 적용되어 내비게이션 성능이 향상되었습니다.
하드웨어 외에도 펜픽스 9는 긁힘 방지 사파이어 렌즈와 64GB의 저장 공간을 제공하며, Garmin Epic과 같은 새로운 소프트웨어 기반 기능이 추가되었습니다. Garmin Epic은 여러 날, 주, 또는 몇 달 동안 수행한 운동을 그룹화하여 건강 및 성능 데이터를 보여주는 기능을 제공합니다.
The Verge
출시
발행 2026-08-25
Emma Roth
수집 2026-08-25 22:50
TeXbrain은 브라우저에서 LaTeX을 실행하고 PDF를 컴파일할 수 있는 오픈 소스 웹 기반 편집기입니다. 이 도구는 사용자가 로컬 환경 설정이나 서버 없이도 LaTeX 작업을 수행할 수 있도록 설계되었으며, WebAssembly 기반의 pdfTeX를 사용하여 브라우저 내에서 직접 컴파일을 진행합니다.
TeXbrain의 핵심은 모든 기능이 클라이언트 측에서 실행된다는 점이며, 파일 시스템 접근 API를 통해 사용자의 로컬 프로젝트 폴더를 읽고 쓰는 것이 가능합니다. 이를 통해 사용자는 Git 통합, 로컬 TeX 설치 사용, 또는 기타 로컬 에디터를 동일한 파일에 적용할 수 있습니다.
또한, TeXbrain은 isomorphic-git을 통해 터미널 명령어 없이도 Git의 모든 작업(클론, 브랜치, 커밋, 푸시 등)을 브라우저 내에서 처리할 수 있게 합니다. 보안 측면에서는 모든 프로세스가 WebAssembly 샌드박스 내에서 실행되어 셸 명령어가 실행되지 않으며, 데이터 수집이나 분석이 전혀 이루어지지 않아 사용자 파일이 기기를 벗어나지 않습니다.
패키지 관리는 필요할 때 TeX Live 미러에서 동적으로 로드하고 로컬에 캐시하여 오프라인 사용을 지원하며, 컴파일 시간은 프로젝트 복잡도에 따라 1~5초로 매우 빠릅니다. 이처럼 TeXbrain은 기존의 도구들이 요구하는 복잡한 환경 설정과 보안 문제를 해결하며 LaTeX 사용 경험을 혁신합니다.
Hacker News
출시
피드 등록 2026-08-25
swimmingbrain
수집 2026-08-25 22:49
국토안보부가 월요일 몇 시간 만에 H-1B 비자에 103,000달러 이상의 수수료를 부과한다고 발표했습니다. 또한 국무부는 최대 20만 명의 망명 신청자 비자를 취소할 계획이라고 밝혔는데, 이는 AP 통신에 따르면 미국 역사상 최대 규모의 비자 취소 조치가 될 것으로 보입니다.
이는 도널드 트럼프 대통령의 두 번째 임기 동안 이민 정책을 통해 추방 숫자를 늘리려는 시도와 관련이 있습니다. 행정부는 ICE를 통한 이민자 체포 및 추방 외에도 비이민자들에게 "자발적 추방"을 유도하며 비자 취소를 통해 이민자의 신분을 박탈하는 방식을 병행하고 있습니다.
이러한 조치들은 법적 이민자들의 신분을 박탈하는 것을 포함하며, 비이민자들에게 압력을 가하여 자발적으로 추방하도록 유도하는 데 중점을 두고 있습니다. 따라서 H-1B 비자 수수료 인상과 망명 신청자 비자 취소 계획은 미국 이민 정책의 광범위한 변화를 반영하는 맥락에서 이해해야 합니다.
The Verge
뉴스
발행 2026-08-25
Gaby Del Valle
수집 2026-08-25 21:49
마셜 마스터스(Eminem)가 X(구 트위터)에 돌리 파튼(Dolly Parton)에게서 받은 편지에 대한 감사를 표하며 게시물을 올렸습니다. 그는 만나지 못했지만 이 편지를 받는 것이 자신에게 큰 영향을 주었다고 밝혔습니다.
마스터스는 돌리 파튼이 자신에게 시간을 내어 편지를 보냈다는 사실에 감동하며 그녀가 아이돌이자 모든 면에서 슈퍼스타였다고 언급했습니다. 그는 자신이 랩 음악을 주로 들었던 아이에게 돌리 파튼은 진정한 아이콘이었다고 평가했습니다.
이 게시물은 단순한 감사 표현을 넘어 예술가와 대중 사이의 관계에 대한 깊은 성찰을 담고 있습니다. 마스터스는 돌리 파튼의 따뜻한 말에 대해 고마움을 표현하며 그녀의 안녕을 기원했습니다.
Hacker News
뉴스
발행 2026-08-25
tibbar
수집 2026-08-26 03:52
열한 살에 만난 아론은 뛰어난 재능과 강한 중독 성향을 보였으나 학업이나 진로에 정착하지 못했습니다. 그는 예측 시장에서 상속금을 잃은 후 스스로 직접 거래소를 만들기 시작하며 새로운 길을 모색했습니다.
이후 아론은 프로그래밍을 익혔고, 해커톤에서 받은 AI 에이전트 크레딧을 활용하여 3,000개의 봇을 구축하는 등 기술적인 성과를 이루어냈습니다. 이러한 경험을 통해 그는 자신의 재능을 실제 시스템 구축에 적용하는 방법을 배웠습니다.
이 이야기는 뛰어난 재능을 가진 개인이 좌절을 극복하고 기술을 통해 독자적인 플랫폼을 구축하는 과정을 보여줍니다. 특히 AI 에이전트 크레딧을 활용한 봇 구축 사례는 개발자들에게 창의적인 자원을 활용하여 실제 결과물을 만들어내는 방법에 대한 영감을 제공합니다.
GeekNews
뉴스
피드 등록 2026-08-25
neo
수집 2026-08-25 23:50