Show HN: Automatically detect and patch walking-dead states in Sierra games

Sierra 어드벤처 게임의 소프트락 상태를 자동으로 감지하고 수정하는 정적 분석 도구인 Lucasartsifier가 개발되었습니다. 이 도구는 게임의 SCI 스크립트를 디컴파일하고 추상 해석을 통해 플레이어가 진행할 수 없는 상태, 즉 소프트락을 찾아내며, 이를 방지하기 위한 보호 장치(guards)를 도출하고 컴파일하여 게임 리소스와 함께 적용할 수 있는 패치 파일을 생성합니다.

이 도구는 특정 게임에 국한되지 않고 엔진의 일반적인 논리를 분석하기 때문에 Leisure Suit Larry 2, King's Quest 4, King's Quest 6, Laura Bow 2 등 여러 게임에 적용할 수 있습니다. 예를 들어, 특정 아이템 없이 다음 단계로 넘어가는 것을 막아 플레이어가 물리적으로 불가능한 상황에 빠지는 것을 방지하는 방식으로 작동합니다. 현재 King's Quest 5에 대한 작업이 진행 중이며, 이 과정에서 상태 폭발 문제와 같은 복잡한 게임 내 상호작용을 해결하는 데 집중하고 있습니다.

이러한 분석은 게임 엔진 자체의 코드가 아닌 게임별로 추가된 코드에 의존하지 않기 때문에 엔진 레벨에서 소프트락을 해결하는 데 중요한 접근 방식을 제시합니다. 다만, 현재는 플레이어의 능력치나 전투, 체력 같은 요소들을 추상화하는 작업이 필요하며, Quest For Glory와 같은 게임에서 발생하는 상태 폭발 문제를 해결하기 위한 추가적인 연구가 진행 중입니다.

OpenLogi

Logitech Options+의 로컬-퍼스트 대안인 OpenLogi가 Rust 언어로 개발되어 출시되었습니다. 이 소프트웨어는 계정이나 텔레메트리 없이 사용자가 자신의 기기에서 모든 설정을 완전히 통제할 수 있도록 설계되었습니다.

OpenLogi는 HID++ 프로토콜을 통해 마우스의 버튼, DPI, SmartShift, 그리고 애플리케이션별 프로필 등 모든 기능을 직접 제어합니다. 사용자는 TOML 파일에 바인딩과 설정을 저장하며, 모든 변경 사항은 클라우드가 아닌 로컬 파일에 기록되어 개인 정보 보호를 보장합니다.

이 도구는 44가지 내장 액션에 대한 버튼 재매핑, DPI 제어, 사용자 지정 단축키 등을 지원하며, Logi Bolt, Unifying, Lightspeed 또는 블루투스 연결을 통해 다양한 장치를 지원합니다.

OpenLogi는 MIT 및 Apache-2.0 라이선스로 공개되어 있으며, macOS, Linux, Windows 환경에서 사용 가능합니다. 이는 사용자가 자신의 기기에서 마우스 설정을 완전히 소유하고 관리할 수 있게 하는 오픈 소스 접근 방식을 제공합니다.

The Vietnam Binh Chau (Chau Tan) Late Tang Wreck

2013년 폭풍으로 인해 베트남꽝응아이성 빈짜우(Chau Tan)의 해저 유물이 발견되었으며, 이는 당나라 말기 선박의 화물과 도자기 집합체를 보존하고 있습니다. 이 유물은 벨리퉁 유물과 유사한 도자기 혼합체를 포함하고 있으며, 창사(Changsha) 채색품, 예(Yue) 녹색 도자기, 싱(Xing)형 백색 도자기, 광둥 녹색 도자기 등으로 구성되어 당나라 말기 수출품의 품질과 유형을 이해하는 데 중요한 물리적 증거를 제공합니다.

선박의 구조 기술은 서아시아의 닻줄 판형(stitched-plank) 도우(dhow) 건설 방식과 대조적으로 동남아시아 선박 건조 기술을 사용한 것으로 보입니다. 특히 광둥 녹색 유약 항아리에는 아랍어 표기된 검은 잉크 문자가 새겨져 있어 당나라 시대 해상 네트워크에서 아랍 상인들의 활동이 있었음을 시사하는 역사적 증거를 더합니다.

도자기의 변화는 시대적 맥락을 보여줍니다. 벨리퉁 유물(826년경)의 투명한 황갈색 유약과 정교한 그림에서 빈짜우 유물(9세기 말)의 흐릿한 흰색 유약과 추상적인 색상 얼룩으로 변화했는데, 이는 당나라 말기 창사 생산의 특징을 나타냅니다. 싱형 도자기는 품질이 저하되었으나 여전히 중요했으며, 예 도자기는 5경 시대에 딩(Ding) 도자기로 대체되었습니다.

이 발견은 당나라 말기 수출 무역에서 창사 및 싱형 도자기가 차지했던 역할의 마지막 단계를 명확히 보여주며, 중국 도자기 생산 역사에 있어 중요한 발자취를 남겼습니다.

The Integer

정수 오버플로우가 발생했을 때 시스템이 어떻게 반응하는지에 대한 내용을 다루고 있습니다. 프로그램 내에서 정수 값이 최대치(2,147,483,647)를 초과하여 증가하는 연산이 발생하면, 수학적 결과가 음수(−2,147,483,648)로 반전되는 상황을 묘사합니다.

이러한 오버플로우 상황에서 Ada 런타임 환경이 어떻게 작동하는지에 초점을 맞추며, 오버플로우가 단순한 산술적 오류를 넘어 시스템의 제약 조건(CONSTRAINT_ERROR)으로 인식되는 과정을 설명합니다. 프로그래머가 명시적으로 예외를 발생시켰을 때, 시스템이 스택 프레임을 역추적하여 적절한 예외 처리기(exception handler)를 찾지 못하고 실행을 중단하는 과정을 보여줍니다.

결국, 시스템은 수학적 불가능한 상태를 허용하지 않으며, 런타임이 프로그램의 상태를 정리하고 실행을 중단시키는 방식으로 현실의 제약을 강제한다는 점을 강조합니다. 이는 개발자가 예상치 못한 시스템 오류나 경계 조건에서 프로그램이 어떻게 종료되는지 이해하는 데 중요한 맥락을 제공합니다.

Tiny satellite will use the dark side of the Moon as a shield

케임브리지 대학교가 주도하는 국제 과학팀이 우주의 초기 시대를 탐사하기 위해 달의 뒷면을 이용하는 소형 위성을 개발했습니다. 이 위성인 코스모큐브(CosmoCube)는 빅뱅 후 첫 별이 탄생하기 이전의 암흑 시대에 대한 정보를 얻기 위해 달의 어두운 면을 방패로 사용하여 지구의 잡음을 차단하고 우주의 희미한 신호를 포착할 계획입니다.

이 연구의 목표는 빅뱅 후 첫 별이 나타나기 전 약 1억 5천만 년 동안 우주가 어떻게 변화했는지, 그리고 암흑 물질이 초기 우주에서 어떻게 작용했는지 밝히는 것입니다. 과학자들은 이 시기에 수소 원자에서 방출된 21센티미터 선 신호를 탐지하고자 하는데, 이 신호는 지구 기반 망원경으로는 방해 요소 때문에 관측하기가 극도로 어렵습니다.

코스모큐브는 달 궤도를 돌면서 지구의 잡음으로부터 약 40분의 차폐를 얻어 신호를 포착하며, 10~50MHz의 매우 낮은 주파수에서 작동합니다. 이 방법은 달의 뒷면이 우주를 관측할 수 있는 유일한 환경을 제공하며, 암흑 물질의 역할을 이해하는 데 중요한 단서를 제공할 것으로 기대됩니다.

이번 임무는 영국 우주국(UK Space Agency)의 자금 지원을 받았으며, 연구팀은 향후 5년 이내에 코스모큐브를 발사하기를 희망하고 있습니다. 이 임무를 통해 과학자들은 우주의 초기 단계에 대한 새로운 이해를 얻을 수 있을 것입니다.

New paper shows that 37% of workers in US saw real wages decline from 2021-2024 [pdf]

최근 발표된 연구에 따르면 미국 노동자의 실질 임금이 2021년부터 2024년 사이에 감소한 것으로 나타났습니다. 이는 미국 노동자의 37%가 실질 임금 감소를 경험했다는 것으로, 경제 상황이 노동자들의 구매력에 미치는 영향을 보여줍니다.

실질 임금 감소는 명목 임금의 변화뿐만 아니라 인플레이션을 고려한 실제 구매력의 변화를 의미하며, 이는 노동자들이 같은 금액을 벌더라도 실제 생활 수준이 하락했음을 시사합니다. 이러한 데이터는 현재의 경제 환경이 노동 시장 참여자들의 재정 상태에 어떤 영향을 미치고 있는지 이해하는 데 중요한 맥락을 제공합니다.

연구는 특정 기간 동안의 경제적 흐름을 분석하여 이러한 임금 감소 추세를 확인했으며, 이는 거시 경제 지표와 노동 시장의 관계를 이해하는 데 도움이 됩니다. 따라서 개발자나 기술 분야 종사자들은 이러한 경제적 배경을 고려하여 시장 동향과 사용자 행동을 분석하는 데 참고할 수 있습니다.

Scientists stunned by children's lung recovery in ultra low emission zone

초저배출구역(ULEZ) 도입 후 런던 지역 아동들의 폐 성장이 놀랍게 회복했다는 연구 결과가 발표되었습니다. 2019년 ULEZ 시행 이후 런던 지역의 아동들은 대기 오염 감소로 인해 폐 용량에서 통제 집단인 루턴 지역 아동들과 비슷한 수준에 도달하며 성장이 가속화되었습니다.

연구팀은 런던과 루턴의 아동들을 비교 분석했으며, 런던 지역 아동들의 폐 용량이 루턴 지역과 거의 동일한 수준으로 회복되었다고 밝혔습니다. 이는 대기 오염이 아동의 폐 성장을 저해하는 데 기여하며, 깨끗한 공기 구역이 아동의 폐 발달을 빠르게 회복시키는 데 도움이 될 수 있다는 강력한 증거를 제시합니다.

연구 결과는 런던 지역 아동들의 폐 용량이 임상적으로 손상되었다고 간주되는 비율이 14%에서 9%로 감소했으며, 질소산화물(nitrogen dioxide) 노출 수준도 루턴보다 런던에서 더 빠르게 감소했음을 보여줍니다. 전문가들은 이러한 개선이 ULEZ 시행에 따른 대기 질 향상과 관련이 있으며, 이는 아동의 장기적인 건강에 긍정적인 영향을 미칠 수 있다고 평가합니다.

다만, 독립 연구자들은 다른 요인들도 고려해야 한다고 주의를 촉구하며, 공기 오염이 천식, 심장병 등의 위험을 높일 수 있다는 점을 강조했습니다. 또한 연구 기간에 코로나19 팬데믹이 포함되었기 때문에, 이 결과가 팬데믹과 관련된 변화가 아닌 실제 대기 질 개선에 기인한다는 점을 고려해야 합니다.

VisiGrid - 코드 에디터처럼 설계된 로컬 네이티브 스프레드시트

오픈소스 스프레드시트인 VisiGrid는 기존의 엑셀과 같은 방식에서 벗어나 코드 에디터의 사용 방식을 채택하여 설계되었습니다. 이는 메뉴 기반 접근 방식 대신 키보드와 Command Palette를 중심으로 작동하도록 설계되어 개발자들에게 더욱 효율적인 데이터 관리 경험을 제공합니다.

VisiGrid는 사용자 인터페이스를 GPU 가속 UI 프레임워크인 GPUI를 사용하여 구현했습니다. 이 기술을 통해 빠른 반응성과 효율적인 렌더링이 가능하며, 맥, 윈도우, 리눅스 등 다양한 운영체제를 지원합니다.

또한 VisiGrid는 빠른 실행 속도를 위해 콜드 스타트 시간이 약 300ms에 불과하며, 다운로드 크기도 효율적으로 관리되어 접근성이 높습니다. 이러한 설계는 스프레드시트 사용 경험을 개발 환경과 유사하게 만들어 생산성을 극대화하는 데 중점을 두고 있습니다.

Cerebras CS4

Cerebras의 새로운 AI 가속기인 CS-4는 GPU 대비 최대 30배 빠른 추론 성능을 제공하며 업계에서 가장 빠른 AI 가속기로 자리매김했습니다. CS-4는 WSE-Turbo 기술을 기반으로 GPU 시스템보다 최대 30배 빠른 추론 속도를 달성하며 생산 환경에서 가장 빠른 추론 기록을 세웠습니다.

이러한 성능 향상은 CS-4가 추론 파레토 경계를 이동시켜 CS-3 대비 와트당 최대 10배의 처리량을 제공하며, 생산 GPU 시스템보다 최대 30배 빠르게 토큰을 생성할 수 있게 합니다. 특히 웨이퍼 간 상호 연결 지연 시간을 2마이크로초로 줄여 10조 파라미터 이상의 모델에서 인터랙티브 디코딩 성능을 유지하며 대규모 확장성을 가능하게 합니다.

CS-4는 컴퓨팅, 전력, 입출력의 세 가지 핵심 요소로 구성된 새로운 Nexus 플랫폼 아키텍처를 통해 하이퍼스케일 데이터센터 배포를 간소화합니다. 웨이퍼 규모 백팩 디자인은 웨이퍼, 전력 변환, 냉각, 고속 I/O 및 제어 전자 장치를 하나의 3D 패키지에 통합하여 부품 수를 50% 줄이고 배포 시간을 며칠에서 몇 시간으로 단축합니다.

이러한 모듈식 접근 방식은 컴퓨팅을 전력 및 냉각 레이어와 분리하여, 컴퓨팅 백팩이 시스템에 삽입되면서 배포를 단순화하고 하이퍼스케일 환경에서 서비스 및 업그레이드를 용이하게 합니다. CS-4는 하이퍼스케일 환경에서 최고 성능과 효율성을 동시에 달성하고자 하는 개발자들에게 중요한 아키텍처 변화를 제시합니다.

Anthropic, 주간 Claude Code 한도 50% 상향을 8월 31일까지 연장

Anthropic이 Claude Code의 주간 한도 50% 상향 조치를 8월 31일까지 추가 연장했습니다. 이는 기존 8월 19일 종료 예정이었던 조치를 연장하여 7월 이후 지속되어 온 한시적인 상향 조치를 재연장한 것입니다.

이러한 연장은 모델에 대한 수요가 급증함에 따라 이루어졌습니다. 사용자들은 현재의 상향된 한도를 유지하기를 원하지만, 장기적으로는 영구적인 요금제 반영을 희망하고 있습니다.

다만, 현재 모델 수요가 매우 높기 때문에 Anthropic은 이 조치를 향후 몇 주간 추가로 연장하기로 결정했습니다. 따라서 개발자들은 8월 31일까지 상향된 한도를 활용할 수 있으며, 영구적인 요금제 반영에 대한 논의는 향후 상황을 지켜봐야 할 것입니다.

2026년에 매일 어떤 소프트웨어를 사용하시나요?

6년 전 온라인 커뮤니티에서 사용자들은 매일의 작업 흐름에 필수적인 소프트웨어 구성에 대해 공유하는 질문을 던졌습니다. 이는 운영체제, 데스크톱 환경, 창 관리자, 터미널, 셸, 편집기, 브라우저 등 일상적인 작업에 사용되는 도구들을 공유해 달라는 내용이었습니다.

이러한 질문은 단순히 어떤 소프트웨어를 사용하는지를 넘어, 사용자들이 자신의 작업 환경을 어떻게 구성하고 최적화하는지에 대한 깊은 논의를 촉발했습니다. 특히 잘 알려지지 않았거나 사소해 보일 수 있는 시스템 구성 요소들이 실제 작업 효율에 얼마나 큰 영향을 미치는지에 대한 관심이 집중되었습니다.

결국 이 논의는 사용자의 일상적인 소프트웨어 구성이 작업 효율과 직결된다는 점을 강조하며, 개발자나 사용자들에게 시스템의 세부적인 설정과 도구 선택이 중요한 맥락을 제공합니다. 이는 단순히 소프트웨어 사용을 넘어, 개인의 작업 흐름을 체계적으로 이해하고 개선하는 데 중요한 통찰을 제공합니다.

Why crypto's best infrastructure companies stopped looking like crypto?

암호화폐 인프라 분야에서 DePIN(탈중앙화 물리적 인프라) 모델은 종말을 고하고 인프라 서비스(Infrastructure-as-a-Service, IaaS)가 장기적으로 우위를 점할 것이라는 분석입니다. 과거 DePIN 모델은 일반 사용자들이 하드웨어, 대역폭, 저장 공간을 모금하여 서비스를 만드는 방식이었으나, 실제 수익 측정의 문제와 시장의 패턴을 고려할 때 이 모델은 한계에 도달했습니다.

클라우드, 통신, 칩 제조사 등 모든 인프라 분야는 동일한 패턴을 따랐으며, 이는 원자재 자원이 수요보다 앞서 구축되고, 그 위에 보장된 서비스를 판매하는 쪽으로 가치가 이동하는 구조를 보여줍니다. 현재 암호화폐 인프라 기업들도 이러한 흐름을 따라가고 있으며, 실제로 분산 저장 서비스 제공업체 중 Storj를 포함한 여러 레거시 DePIN 기업들이 토큰 요소를 분리하기 위해 구조조정이나 매각을 진행하고 있습니다.

이러한 변화는 인프라 자체보다 그 위에 구축된 서비스(SaaS)에서 가치가 축적된다는 점을 명확히 합니다. 전체 클라우드 시장 지출은 2024년에 59570억 달러에 달했으며, 인프라 계층은 서비스 계층보다 더 빠르게 성장하고 있습니다. 앞으로 GPU와 전력과 같은 핵심 자원의 희소성 때문에 인프라 계층의 수익성이 더욱 중요해질 것이며, 이는 암호화폐 인프라 시장에도 적용될 것입니다.

uBlock 하드 모드로 웹을 탐색하는 방법

uBlock Origin 하드 모드는 광고나 추적기 차단을 넘어 스크립트, 프레임, 글꼴, 미디어까지 차단하여 사용자가 원하는 콘텐츠만 표시하는 탐색 환경을 구성합니다. 이 모드는 단순한 차단을 넘어 웹페이지의 작동에 필수적인 요소만을 선별적으로 표시함으로써 사용자에게 보다 통제된 탐색 환경을 제공합니다.

이 기능을 활성화하면 동적 필터링과 고급 사용자 기능을 통해 모든 서드파티 요청을 기본적으로 차단하게 됩니다. 이는 웹사이트가 작동하는 데 필요한 최소한의 항목만을 선택적으로 허용하여 보안과 성능을 동시에 향상시키는 데 중점을 둡니다.

결과적으로 사용자는 불필요한 요소들을 제거하고 사이트 작동에 필요한 핵심 정보에만 집중할 수 있게 됩니다. 이는 광고 및 추적기뿐만 아니라 복잡한 웹 요소들을 관리하고자 하는 고급 사용자나 개발자에게 유용한 탐색 환경을 제공합니다.

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

지식 기반 시각 질의응답(KB-VQA)은 긴 꼬리 꼬리 엔티티를 포함하는 질의에 답하기 위해 외부 정보를 검색하는 방식에 의존합니다. 그러나 기존 검색 파이프라인은 주로 CLIP 스타일의 듀얼 인코더를 사용하며, 이는 엔티티 수준의 의미적 정렬보다 표면적인 시각적 유사성을 우선시합니다. 이 접근 방식은 의미적으로 동일한 개념이 시각적으로 큰 변화를 보이거나 서로 다른 엔티티가 시각적으로 유사하게 나타날 때 실패하는 경우가 많습니다.

이러한 문제를 해결하기 위해 KB-VQA에 맞춤화된 최초의 MLLM 기반 임베딩 검색기인 KBMR을 제안합니다. KBMR은 MLLM의 강력한 자기회귀(autoregressive) 능력을 활용하여 개념의 정체성을 더 잘 보존하는 의미 공간으로 이미지를 매핑합니다. 또한, 위키피디아 규모 검색에서 발생하는 노이즈가 많은 지도 학습 문제를 해결하기 위해 MLLM 기반의 의미적 판별기(semantic discriminator)를 도입하여 연속적인 엔티티 일관성 가중치(entity-consistency weights)를 생성합니다.

이 가중치들은 새로운 연속적 의미 정제 목표(continuous semantic distillation objective)를 안내하여 엄격한 이진 레이블을 넘어 효과적인 하드 네거티브 샘플링과 소프트 감독을 가능하게 합니다. 광범위한 실험 결과, KBMR은 CLIP 기준 모델을 크게 능가하며 검색 재현율@1에서 최대 14.7%의 개선과 종단 간 VQA 정확도에서 9.4%의 향상을 달성했습니다.

KBMR의 코드는 https://github.com/realHarryX/KBMR에서 확인할 수 있습니다.

Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers

역사적인 신문 자료는 방대하지만, 그 밀집되고 불규칙하며 때로는 노이즈가 있는 레이아웃 때문에 이러한 자료에 대한 계산 접근이 어렵고 제한적입니다. 이에 연구진은 보스턴 공립 도서관과 공동으로 설계한 모듈형 시스템인 'Institutional Newspapers Pipeline'을 제시하여 역사적인 신문 스캔에서 고품질의 구조화된 데이터셋을 추출합니다.

이 파이프라인은 각 단계가 해석 가능하고 사용자 정의가 가능하며, 전체 시스템이 워크스테이션 수준의 하드웨어에서 실행될 수 있을 만큼 계산적으로 절약되도록 설계되었습니다. 이 시스템은 각 스캔을 여러 단계로 처리하는데, 스캔을 개별 유형에 구애받지 않는 크롭으로 분할하고 각 세그먼트에 대해 OCR을 수행한 다음, 텍스트 분석, 유형 분류, 읽기 순서 감지, 개체명 인식, 주제 분류, 언어 감지, 그리고 사전 계산된 임베딩 생성을 수행합니다.

이 파이프라인을 보스턴 공립 도서관의 자료에 적용하여 1795년부터 1930년 사이에 발행된 1,473,635건의 공공 영역 신문 스캔에서 8,310만 개의 개별 크롭을 추출했습니다. 이 과정에서 OCR 결과는 8,310만 개의 개별 크롭에 걸쳐 총 163억 개의 o200k_base 토큰을 나타냅니다.

이 보고서는 각 처리 단계에 대한 방법, 훈련된 소형 모델, 평가 결과 및 수집된 데이터셋 규모 측정을 설명하며, 파이프라인, 모델, 데이터셋의 공개와 함께 제공됩니다. 이는 수백만 건의 신문 스캔에서 고품질 데이터를 잠금 해제하는 데 중요한 진전을 의미합니다.

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

대규모 언어 모델(LLM)에 다중 턴 도구 호출(multi-turn tool-calling) 기능을 부여하는 것은 자율 에이전트를 구축하는 데 필수적입니다. 그러나 현재의 발전은 전체 궤적 모방에 의존하기 때문에 근본적인 한계를 보입니다. 여러 순서에 독립적인 하위 목표를 포함하는 작업에서 최적의 해 공간은 방대한 조합적 다이아몬드 격자 형태로 존재하는데, 이를 단일 궤적으로 강제하면 위상 붕괴가 발생하여 유효한 대안 탐색을 무차별적으로 처벌하고 정책 다양성을 심각하게 저해합니다.

이 문제를 해결하기 위해 본 논문은 전역적 강제에서 위상 기반 국소적 수정으로 패러다임을 전환하는 새로운 프레임워크인 DART-SD(Diamond-topology Aware Retrieval and Tuning for Self-Distillation)를 제안합니다. DART-SD는 실행 과정을 상호작용 상태 전환 그래프(ISTG)로 모델링하여 성공 및 실패 탐색 경로의 내재된 다이아몬드 위상을 정확하게 포착합니다. 에이전트가 자율적으로 실행될 때 이 프레임워크는 임계 위상 단절점(CTB)을 식별하고 성공을 지원하는 복구 참조를 검색합니다.

나아가 DART-SD는 CTB 기반 국소적 감독을 통해 점진적인 자기 증류 패러다임을 도입합니다. 이를 통해 훈련 손실이 생성된 복구 단계에만 계산되도록 보장하며, 유효한 추론 접두사를 파괴적인 기울기 업데이트로부터 엄격하게 보호합니다. 이러한 접근 방식은 기존의 전체 궤적 기준선보다 복잡한 다중 턴 도구 호출 벤치마크에서 DART-SD가 현저히 우수한 성능을 보임을 실험적으로 입증했습니다.

Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

다중 교사 온-정책 증류(M-OPD)는 밀도 높은 토큰 수준 보상 감독을 통해 도메인 특화 강화 학습 전문가들을 단일 일반화 학생으로 통합하는 유망한 패러다임으로 부상했습니다. 그러나 다중 교사의 능력 통합을 지배하는 최적화 역학은 여전히 잘 이해되지 않았으며, 공개되고 재현 가능한 레시피가 부족한 상황입니다.

연구진은 SmolLM3-3B-Base 모델에 대해 오라클 라우팅을 사용하여 능력 통합을 분리하는 통제된 M-OPD 벤치마크를 구축했습니다. 이 조사 결과, 표준 M-OPD는 도메인 라우팅 오라클 앙상블 대비 사용 가능한 여유 공간의 35.6%만을 포착하며, 지시 따르기와 같은 간결한 작업에서 심각한 성능 저하와 조기 정체를 겪는다는 것을 발견했습니다.

이러한 실패는 기울기 충돌 때문이 아니라 토큰 수준 최적화 예산의 심각한 잘못된 할당에서 비롯되며, 이는 도메인 간 구조적 시퀀스 길이 불균형, 비균일한 학습률로 인한 동적 수렴 표류, 비동기 정책 업데이트로 인한 다단계 보상의 오래됨이라는 세 가지 직교적 요인에 의해 발생합니다.

연구진은 이러한 불균형을 해결하기 위해 토큰 공유 균형, 격차 인식 동적 예산 할당, 학생 보상 새로 고침을 통합한 원칙적인 프레임워크인 Open-MOPD를 도입했습니다. 이 메커니즘들은 교차 도메인 균형을 체계적으로 복원하여 단일 배포 가능한 학생에서 여유 공간 회복률을 35.6%에서 83.4%로 향상시킵니다. 또한 연구진은 이 종단 간 훈련 레시피, 훈련 궤적, 평가 스위트를 학술적으로 접근 가능한 하드웨어 예산 내에서 완전히 공개했습니다.

Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress

온폴리 정책 증류(OPD)는 학생이 생성한 궤적과 교사로부터의 밀도 높은 토큰 수준 감독을 결합하여 후처리 언어 모델을 훈련하는 효과적인 프레임워크로 부상했습니다. 하지만 OPD는 교사로부터 얻은 보상이 추론 진행의 적절한 대리 지표라고 암묵적으로 가정하며 정책 최적화 과정에서 모든 교사 피드백을 동일하게 취급합니다.

실제 환경에서 이러한 가정은 항상 성립하지 않으며, 교사로부터 얻은 보상이 실제 추론 진행과 충돌하는 경우가 관찰됩니다. 명확한 추론 진전을 포함하는 추론 단계가 교사의 출력에서 벗어났다는 이유만으로 더 낮은 증류 보상을 받을 수 있기 때문입니다.

이러한 불일치를 해결하기 위해 연구진은 추론 진행을 인식하는 온폴리 증류를 위한 보상 필터링(R2-OPD)을 제안했습니다. 이 방법은 추론 구간에 대한 두 가지 내궤적 순위, 즉 교사로부터 파생된 보상과 독립적으로 추정된 진행 보상을 구축합니다.

두 순위가 불일치할 때 증류 보상을 선택적으로 억제함으로써 추론 진행과 충돌하는 감독을 줄이면서도 효과적인 교사 지침을 보존합니다. 이 접근 방식은 표준 OPD에 비해 추론 성능에서 일관된 개선을 보였습니다.

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

학습 불필요한 블록 희소 어텐션은 비디오 트랜스포머를 가속화할 수 있지만, 행별 어텐션 집중만으로는 실행 가능한 희소 연산자를 명시하지 못합니다. 이는 공유 블록 경로를 가진 쿼리가 지원이 제대로 겹치지 않을 수 있으며, 유지된 어텐션 질량만으로는 건너뛴 상호작용에서 발생하는 소프트맥스 이후의 오류를 결정하지 못하기 때문입니다.

연구진은 파티션 기하학이 풀링된 지원과 희소 출력으로부터 나머지 잔차의 예측 가능성에 모두 영향을 미친다는 것을 보여줍니다. 이를 해결하기 위해 응답 연관 분할(Response-Coupled Partitioning)과 탐침 피팅 잔차 재구성(Probe-Fitted Residual Reconstruction)을 결합한 SparsePR을 제안합니다. SparsePR은 샘플링된 쿼리 키 응답을 쌍으로 묶어 공유 라우팅을 위한 쿼리-응답 좌표를 유도하고, 소수의 정확한 쿼리 행을 사용하여 탐침 잔차 내에서 희소 출력에 대한 호출별 아핀 보정을 수행합니다.

네 가지 이질적인 비디오 생성 및 월드 모델에 걸쳐 SparsePR은 어텐션 재구성 오류를 일관되게 감소시킵니다. 실험 결과는 탐침 피팅이 이러한 감소의 대부분을 설명하며, 응답 연관 분할은 하드 드롭 오류를 낮추고 유한한 탐침 예산 하에서 재구성을 개선함을 보여줍니다.

SparsePR은 22.0~26.0%의 실현된 실행 쌍 밀도에서 생성 품질을 유지하면서도 종단 간 속도를 1.48배에서 2.61배까지 향상시킵니다. 이는 희소 어텐션 기반 모델에서 품질과 속도를 동시에 개선하는 실질적인 방법을 제시합니다.

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

결합된 비디오-오디오 생성 모델을 강화 학습으로 파인튜닝하려면 보상 신호가 필요합니다. 기존 방법들은 오디오 품질, 시각적 충실도, 동기화와 같은 개별 품질 차원의 지표를 결합하여 보상을 구성하지만, 이는 텍스트 프롬프트, 비디오, 오디오 간의 전체적인 의미론적 및 시간적 일관성을 포착하지 못합니다. 이로 인해 모델이 이러한 지표에 높은 점수를 얻더라도 인간 시청자에게는 일관성이 없거나 불충실한 결과물을 생성하는 보상 해킹 문제를 야기합니다.

이 문제를 해결하기 위해 연구진은 오픈 소스 생성 모델로부터 얻은 9K 프롬프트와 10.3K의 세밀한 쌍별 비교를 포함하는 대규모 인간 선호도 데이터셋인 VAPref-10K를 구축했습니다. 또한, 보상 모델이 인간 선호도와 실제로 일치하는지 평가하기 위해 도메인 내 및 도메인 외 모델 비교를 포함하는 VA-Judger-Bench 벤치마크를 도입했습니다.

연구진은 최종적으로 결합된 비디오-오디오 생성 모델을 위한 체인-오브-사고 옴니 보상 모델인 VA-Judger를 제안했습니다. 이 모델은 인간 피드백을 단일 이진 선호 레이블보다 더 밀도 높은 보상 신호로 분해하기 위해 차원별 강화 학습을 수행합니다. 실험 결과, VA-Judger는 도메인 내 및 도메인 외 평가 모두에서 측정 기반 기준보다 인간 선호도를 예측하는 데 더 우수함을 입증했습니다. 또한, 인간에 맞춰진 보상을 사용하여 오디오-비디오 생성 모델을 후처리 학습할 때 생성 품질이 크게 향상되었습니다.