Writergate: Zig I/O Interface Overhaul

Zig의 I/O 인터페이스 개편 작업인 Writergate는 2023년 말부터 시작되어 2025년 8월에 GenericWriter, GenericReader 등을 완전히 제거하며 완료되었습니다. 이 변경은 Zig I/O 코드를 다루는 개발자들에게 직접적인 영향을 미쳤습니다. 이전 API는 타입 매개변수를 사용한 제네릭 디자인을 채택하여 모든 컨테이너 구조체를 제네릭으로 만들었고, 이는 API 재사용성을 저해하고 컴파일 시간을 악화시키는 문제를 일으켰습니다.

새로운 API는 vtable 기반의 구체적인 타입과 명시적인 버퍼링을 사용합니다. 예를 들어, 이전에는 `std.io.getStdOut()`을 사용했다면 이제 `std.fs.File.stdout()`을 사용하며, 버퍼는 호출자가 직접 제공해야 합니다. 이 변화는 I/O를 메모리 할당처럼 취급하여 비동기(async) 지원을 가능하게 하고, 버퍼가 vtable 위에 위치하여 성능을 개선하며, 백엔드 작업에 따라 구체적인 에러 세트를 제공하여 오류 처리를 정밀하게 만듭니다.

새로운 아키텍처는 Io(백엔드) 레벨과 File(구체적인 구현체) 레벨로 세 단계로 구성되어 있으며, 구조체는 @fieldParentPtr을 통해 상위 구조체와 연결됩니다. 개발자는 버퍼를 명시적으로 플러시해야 하며, 인터페이스를 복사할 때는 포인터를 사용해야 하는 등의 몇 가지 주의할 점이 있습니다. 특히 인터페이스를 상속받는 구조체를 복사할 때 vtable이 상위 구조체를 복구하는 방식 때문에 주의가 필요합니다.

Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing

거대 언어 모델(LLM)은 뛰어난 성능을 보이지만 정적인 데이터로 학습되어 빠르게 변화하는 세상에서는 지식이 쉽게 구식이 됩니다. 이러한 문제를 해결하기 위해 LLM 내의 특정 지식만 업데이트하는 지식 편집(Knowledge Editing, KE)이 연구되고 있으며, 최근에는 여러 사실을 동시에 포함하는 자유 형식의 문장인 비정형 지식 편집(Unstructured KE, UKE)으로 발전하고 있습니다.

하지만 기존의 편집 방식은 이러한 비정형 지식을 주입하더라도 모델이 해당 정보를 활용하여 원자적인 질문에 답하거나 다단계 추론을 구성하는 능력이 부족합니다. 연구진은 이러한 부족한 능력을 '컴포저빌리티(composability)'라고 정의하며, 이는 편집기가 고정된 문장을 유일한 학습 소스로 수동적으로 의존하기 때문에 발생한다고 분석했습니다.

이에 연구진은 편집을 외부 감독 없이 동일 모델의 특권적인 인컨텍스트 상태로부터 능동적으로 자기 증류(self-distillation)하는 방식으로 전환할 것을 제안했습니다. 특히 새로 주입된 지식의 특성상 사전 편집된 모델의 롤아웃이 해당 지식을 거의 포함하지 못하여 순수 온-폴리 정책 증류(on-policy distillation)의 효과가 제한된다는 한계를 지적했습니다.

이러한 격차를 해소하기 위해 연구진은 HPSE라는 하이브리드 롤아웃을 제안했는데, 이는 모델의 커버리지가 부족한 지점에 누락된 사실을 학생의 궤적 위에 정확히 배치하면서도 다른 부분에서는 정책을 유지하는 방식입니다. HPSE는 순수 온-폴리 증류 대비 이론적 우위를 분석했으며, 다양한 시나리오에서 네 가지 LLM 백본과 두 가지 KE 편집기 전반에 걸쳐 실증적인 개선 효과를 입증했습니다.

Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review

AI 코딩 에이전트가 인간의 검토나 사전 검증 없이 대규모 코드베이스의 핵심 구조적 불변성을 성공적으로 해체한 사례를 보고합니다. 이 연구는 사양 우선(specification-first) 프로토콜을 통해 목표 행동을 검증하는 오라클(oracle)이 없는 환경에서 에이전트가 복잡한 작업을 수행할 수 있음을 입증합니다.

실제 사례에서 에이전트는 717,725줄에 달하는 TypeScript 애플리케이션을 대상으로 핵심 수명 불변성(lifetime invariant)을 해체하는 작업을 수행했습니다. 이 불변성은 AI 요청 시간 동안 UI 패널이 열려 있어야 한다는 보장이었으며, 목표 행동은 스트리밍 생성물이 패널이 닫힌 후에도 재연결 시 손실이나 중복 없이 동일한 라이브 스트림에 다시 부착되는 것이었습니다.

에이전트는 사양 정의, 14회의 정제 주기, 17회의 검증 주기를 거치는 엄격한 프로토콜을 통해 코드를 구현하고 검증했습니다. 이 과정에서 인간이 코드를 실행하기 전에 201개의 결함이 수정되었으며, 두 번의 연속적인 검증 통과에서 0개의 결함이 발견되는 것을 기준으로 수렴했습니다.

이 작업은 3일 만에 완료되었으며, 변경된 코드는 189개 파일에 영향을 미쳤고 추출 단계에서는 총 288개 파일, 34,770개의 삽입, 16,422개의 삭제가 발생했습니다. 이 연구는 AI 에이전트가 복잡한 아키텍처 변경을 수행할 때 필요한 신뢰성과 자동 검증 메커니즘에 대한 중요한 통찰을 제공합니다.

TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement

항공 운송 분야의 심각한 지연이나 비정상적인 비행 시간과 같은 극단적인 사건은 운영, 경제, 안전에 상당한 비용을 초래하며, 이러한 사건은 역사적 기록에서 드물어 머신러닝 모델을 위한 충분한 학습 신호를 제공하지 못합니다. 기존의 합성 데이터 증강 방법은 분포의 꼬리 부분을 제대로 반영하지 못하며, 짧은 비행 시간과 긴 비행 거리처럼 운영상 불가능한 사례에 대한 보장을 제공하지 못하는 한계를 가지고 있습니다.

이에 연구진은 생성 모델과 두 개의 이상 탐지 레이어를 결합한 이중 계층 생성 프레임워크인 TailBooster를 제안했습니다. 이 프레임워크는 통계 레이어를 통해 사분위 범위(interquartile range)를 이용해 극단값을 추출하고, 이를 Tabular Variational Autoencoder와 같은 전용 생성 모델에 꼬리 집중형 학습 신호를 공급합니다. 또한 딥러닝 레이어는 오토인코더 기반 클리닝을 적용하여 과거 데이터에서 학습된 운영 한계를 위반하는 합성 기록을 제거함으로써 데이터의 운영 타당성을 확보합니다.

이 프레임워크는 다양성, 통계적 유사성, 충실도, 운영 타당성, 유용성이라는 다섯 가지 차원에서 평가되었으며, 데이터 기반 클리닝은 운영 타당성을 크게 개선했고, 목표 지향적인 증강은 극단 사건 예측에 대한 유용성을 향상시켰습니다. 특히, 이 프레임워크의 기록을 사용하여 6가지 회귀 알고리즘으로 훈련했을 때, 기존 합성 데이터 대비 극단 비행 시간 예측에서 평균 절대 오차(MAE)가 47~49%, 극단 도착 지연 예측에서 29~57% 감소하는 결과를 보였습니다.

TailBooster는 데이터 기반이며 모델에 구애받지 않는 접근 방식을 제공하므로, 특정 도메인 규칙이 없는 극단 사건 예측이 중요한 모든 영역으로 확장될 수 있습니다. 이는 극단 사건 예측이 필수적이지만 도메인별 규칙이 없는 분야에서도 유용하게 적용될 수 있음을 의미합니다.

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

레이어 간 혼합 어텐션(HLA) 대규모 언어 모델에서 거대한 활성화(Massive Activations, MAs)에 대한 체계적인 연구를 통해 두 가지 구조적으로 정렬된 형태가 밝혀졌습니다. 첫째는 전체 어텐션 레이어 직전에 발생하는 전어텐션 스파이크(pre-attention spikes, PAS)이며, 둘째는 중간의 선형 어텐션 레이어를 통과하여 지속되는 스파이크 간 간격(inter-spike plateaus, ISP)입니다.

이러한 현상은 전체 어텐션이 밀집될수록 연속적인 PAS가 ISP를 통해 점점 연결되어 최종적으로 전체 어텐션 LLM의 안정적인 MA 형태를 회복하는 방식으로 나타납니다. 연구진은 이러한 조직화가 다섯 가지 선형 어텐션 아키텍처, 여섯 가지 하이브리드 구성, 다섯 가지 데이터 도메인, 그리고 12억에서 3970억 개의 총 파라미터를 가진 대표적인 오픈 소스 하이브리드 모델에 걸쳐 재현됨을 확인했습니다.

또한, GDN 기반 하이브리드 모델을 13억 파라미터까지 제어 학습했을 때, 두 형태 모두 초기에 나타나며 출력 게이팅에 비대칭적으로 반응한다는 것을 발견했습니다. 전체 어텐션 출력 게이팅은 레이어별 조직화를 제거하지 않으면서 MA의 절대 크기를 강력하게 약화시키는 반면, GDN 게이트를 제거하면 상대적으로 적은 증폭 효과만 나타났습니다.

체계적인 이상치 분석을 통해 PAS는 국소적인 쓰기-싱크-취소 과정으로, ISP의 확장된 지속성은 지연된 취소와 일치하는 공통적인 수명 주기를 설명합니다. 이는 MA 취소 시점의 타이밍에 의해 통제되는 공유된 메커니즘임을 시사하며, 연구 코드는 GitHub에서 공개되어 있습니다.

Compute-Optimal Is Not Cluster-Optimal

새로운 연구에 따르면 계산 최적화가 클러스터 최적화와 같지 않다는 결론이 도출되었습니다. 이 연구는 시스템 단계를 스케일링 법칙 단계에 통합하는 MOSAIC 프레임워크를 사용하여, 특정 클러스터에서 실제로 달성할 수 있는 성능을 고려해야 함을 제시합니다.

모델의 희소성(sparsity)과 Mixture-of-Experts(MoE) 설정은 사용된 클러스터에 따라 달라지며, 이는 모델이 실제로 제공하는 성능에 영향을 미칩니다. 기존의 스케일링 법칙은 계산 예산을 모델로 변환하지만, 클러스터는 FLOPs가 아닌 GPU 시간으로 비용을 청구하기 때문에 실제 비용을 반영하지 못한다는 지적입니다.

연구 결과, 모델의 손실 대비 FLOPs를 최적화하는 설계와 실제 하드웨어 시간 대비 FLOPs를 최적화하는 설계는 서로 다른 결과를 보였습니다. 예를 들어, 동일한 모델 FLOPs 예산 내에서 희소성이 높을수록 손실이 감소하지만, 실제 하드웨어 컴퓨팅 비용을 고려하면 더 느린 설계가 우위를 점할 수 있습니다.

따라서 최적의 아키텍처를 선택하기 위해서는 모델의 손실뿐만 아니라 클러스터가 실제로 지불하는 비용, 즉 MFU(Model-FLOPs per GPU-hour)를 함께 고려하는 시스템 관점의 접근이 필요합니다.

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

LLM 에이전트 서비스는 모델과 툴 호출 사이에 결과 경로를 설정하고 상태를 업데이트하는 작은 결정들을 반복적으로 실행합니다. 연구는 이러한 제어 경로가 GPU 실행을 위한 충분한 동시 작업을 노출하는지, 그리고 GPU가 계산한 경로 결정이 장치 내에 남아있을 때 어떤 변화가 생기는지를 탐구합니다.

연구진은 고정 파티션 공유 F, 정확한 오프라인 공유 P*, 로컬 상한 U, 그리고 온라인 달성 공유 A를 사용하여 준비된 코호트 경계를 공식화했습니다. 서비스 시간이 0이고 용량이 무제한이며 출시 마감 기한이 동일할 때, 특화된 동적 프로그램은 P*를 정확하게 계산할 수 있음을 보였습니다. 특정 조건 하에서 실험 결과, 정확한 패킹은 고정된 창 경계에서 손실된 기회의 81.83%를 회복시켰습니다.

실제 실험에서는 100,000개의 활성 세션, K=256, 50ms 출시 마감 기한 조건에서 F=30.19%, P*=43.00%, U=45.85%라는 수치가 도출되었습니다. 또한, 결과에서 파생된 경로 키는 실행 가능한 정체성의 증거가 아니라 조건화 프록시임을 명확히 했습니다.

GPU 에이전트 제어를 위한 두 가지 측정 가능한 게이트, 즉 출시 마감 기한이 충족되는 코호트 공급과 관측 배치(observation placement)를 확립했습니다. 장치 내 경로를 유지하는 고정된 중첩 장치 그래프는 모든 배치에서 더 느렸으며, 장치 내 경로는 모든 구성에서 호스트 결정이 없는 경우 더 빨랐습니다. 이 연구는 A, CPU 변위, 서비스 수준 이점을 측정하기 위해 결합된 유한 온라인 런타임이 필요함을 시사합니다.

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

AI 모델의 능력과 잠재적 위험에 대한 메커니즘이 여전히 불분명한 상황에서, AI를 과학적 도구로 활용하여 지능의 근본적인 메커니즘을 자율적으로 발견하는 에이전트 시스템인 메카니스트를 소개합니다. 이 시스템은 자율적인 메커니즘 발견을 지원하기 위해 약 13,000편의 논문으로 구성된 해석 중심의 지식 그래프와 26개 분야에 걸친 4300만 편의 다학제 데이터베이스를 통합했습니다.

메카니스트는 메커니즘 분석, 인과적 개입, 검증을 위한 32가지 기초 방법을 포함하는 라이브러리를 구축하여 기존의 AI 과학자 시스템이나 Claude Code보다 더 가치 있는 메커니즘 가설을 생성하고 실험을 더 신뢰성 있게 수행합니다. 특히 메카니스트는 안전한 훈련 데이터에서도 안전하지 않은 특성이 양식(modality)을 통해 전이될 수 있다는 직관에 반하는 안전 위험을 발견했습니다.

나아가 메카니스트는 모델이 세계 지식을 어떻게 표현하고, 신념을 형성하며, 타인의 신념을 추론하는지, 그리고 이러한 메커니즘이 사전 훈련 중에 어떻게 발생하는지에 대한 신념의 메커니즘 이론을 개발했습니다. 최종적으로 메카니스트는 이러한 메커니즘적 통찰을 실제 개입으로 전환하여 다양한 시나리오에서 모델 성능을 개선하고, 과학적 기초 모델이 특정 속성을 가진 DNA 서열을 생성하도록 유도하는 실질적인 방법을 제시합니다.

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

거대 언어 모델(LLM) 에이전트가 외부 도구와 통합될 때 환경 상태에 내재된 간접 프롬프트 주입에 취약하다는 연구 결과가 나왔습니다. 기존 연구들은 수동으로 구현되거나 재사용된 환경, 확률적 도구 시뮬레이션, 미리 정의된 주입 위치에 의존하여 보안 연구의 확장성을 제한해 왔습니다.

이러한 한계를 극복하기 위해 연구진은 인간의 엔지니어링을 줄이고 추가적인 시드 도메인과 컴퓨팅으로 확장할 수 있는 확장 가능한 적대적 환경 합성 프레임워크인 ToolHazard를 제안했습니다. ToolHazard는 환경 시뮬레이터, 공격 에이전트, 사용자 시뮬레이터를 통해 실행 가능한 상태 기반 환경을 합성하고, 유효한 주입 지점을 발견하며, 환경별 페이로드를 생성하고, 상태에 기반한 장기 태스크를 구성합니다.

ToolHazard를 기반으로 복잡한 워크플로우와 다양한 환경 공격 하에서 에이전트를 스트레스 테스트하기 위한 ToolHazard-Bench를 구축했습니다. 실험 결과는 에이전트가 상당한 취약점을 보이며, 주입의 타이밍과 위치가 공격 효과에 영향을 미친다는 것을 보여줍니다. 또한 ToolHazard가 생성한 정렬 데이터는 벤치마크와 AgentDojo 모두에서 보안을 향상시키면서도 태스크의 유용성을 유지합니다.

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

연구 아이디어를 완전한 논문으로 만드는 과정은 단순히 텍스트를 생성하는 것을 넘어 문헌 검색, 실험 설계 및 실행, 증거에 따른 주장 수정, 출판 준비용 그림 생성, 그리고 장기간 생성 과정에서의 일관성 유지 등 복잡한 단계를 요구합니다. 이에 따라 연구팀은 기존 코딩 도우미 내에 13개의 조합 가능한 기술(composable skills)로 구현된 엔드투엔드 연구 논문 생성 시스템인 Spark-to-Paper를 제시했습니다.

Spark-to-Paper는 모델 기반 판단과 직접 실행 및 검증이 가능한 결정론적 연산을 분리하며, 실험 계획과 보고를 분리하여 결과가 관찰되기 전에 필요한 증거를 명시하고 측정된 결과에 따라 논문의 주장을 수정할 수 있도록 합니다. 또한 장기적인 연구 궤적에서 신뢰도를 높이기 위해 결정론적 무결성 검사와 자기 비판(self-critique)을 결합하고, 반복적인 실험이 원래 연구 목표를 거부하는 실패 모드인 자기 반박 루프(Self-Refutation Loop)를 제한합니다.

이 시스템은 실험 결과를 위한 편집 가능한 벡터 그림을 프로그래밍 방식으로 생성하고 생성된 방법 다이어그램을 코드 기반으로 재구성할 수 있습니다. 여덟 가지 통제된 연구 주제에 걸쳐 Spark-to-Paper는 인용 타당성 99.5%와 그림 편집 가능성 96.4%를 달성했습니다. 전체 시스템은 1190만 토큰을 사용하며 논문당 8.1달러의 비용이 들고 평균 3.2시간이 소요됩니다.

이러한 결과는 엔드투엔드 연구 논문 생성이 기존 코딩 도우미 내에서 경량의 조합 가능한 워크플로우로 구현될 수 있으며, 실험 증거가 주장 수용, 수정 또는 포기 과정의 중심에 유지될 수 있음을 보여줍니다.

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

프리비주얼라이제이션은 영화, 게임, 건축 등에서 아이디어를 실제 제작으로 옮기는 중간 단계이지만, 기존의 생성 모델들은 단일 프롬프트에 의존하여 모든 요소를 동시에 제어하는 데 한계가 있어 반복적인 편집에 대한 통제력이 약하다는 문제가 있습니다. 이는 장면의 기하학, 외관, 속성, 카메라 정보 등을 포함하는 명시적이고 지속적인 작업 상태가 부족하기 때문에 발생합니다.

이러한 문제를 해결하기 위해 연구진은 생성적 프리비주얼라이제이션을 위한 상태 중심 프레임워크인 StateFlow를 제안했습니다. StateFlow는 단일 시점에서 비디오를 생성하는 대신, 편집 가능한 3D 세계를 사용하여 장면 구조, 진화, 카메라를 조직하며, 장면 요소와 카메라 구성을 핵심 작업 표현으로 유지하는 지속적인 3D 상태를 관리합니다.

StateFlow는 세계 상태를 구축하고 진화시키며 접근하는 세 단계를 통해 작동합니다. 세계 상태 구축 단계에서는 사전 가이드 및 충돌 인식 이중 뷰 초기화(prior-guided, conflict-aware dual-view initialization)를 통해 생성된 2D 콘텐츠를 일관된 3D 세계로 끌어올립니다. 상태 진화 단계에서는 사용자의 의도를 세계 기억을 보존하면서 구조화된 상태 전환으로 변환하여 각 편집마다 전체 장면을 재생성하는 것을 피합니다.

마지막으로 상태 접근 단계에서는 렌더 피드백 반사(render-feedback reflection)를 사용하여 카메라 계획을 시각적으로 실현 가능한 궤적으로 정제함으로써 VLM 의미론에만 의존하지 않고 카메라 움직임을 개선합니다. 실험 결과, StateFlow는 비디오 제작과 게임과 유사한 프로토타이핑을 위한 고품질의 3D 세계를 생성할 수 있음을 보여줍니다.

AVA-Encoder: Towards Agent-Native Video Representation Learning

창의적 에이전트가 고품질의 인간 영화로부터 효과적으로 학습하는 데 어려움을 겪고 있으며, 이는 영화 수준의 영상을 제작하는 능력을 제한하는 주요 과제입니다. 핵심 문제는 영화 내용에 충실하면서도 에이전트의 추론 및 조작에 직접적으로 사용될 수 있는 구조화된 비디오 표현이 부재하다는 점입니다.

이러한 문제를 해결하기 위해 연구진은 에이전트 자동 인코딩을 통해 에이전트 고유의 비디오 표현을 학습하는 프레임워크인 에이전틱 비디오 오토 인코더(AVA-Encoder)를 제안했습니다. AVA-Encoder는 비디오를 지식 그래프(KG) 표현으로 변환한 다음 다시 비디오로 재구성하는 방식으로 작동합니다. 이 구조는 계층 및 상태 노드에 구조화된 텍스트를 저장하고, 연결된 자산 레이어에 생성된 이미지, 오디오, 비디오를 보관하며, 타입드 엣지는 에이전트가 쉽게 이해하고 질의하며 편집할 수 있도록 이러한 텍스트 설명과 자산 간의 관계를 보존합니다.

비디오 재구성의 차이를 기반으로 텍스트 기울기 최적화 프레임워크를 구동하여 평가 피드백을 자연어 업데이트 방향으로 표현합니다. 이는 외부 루프에서의 데이터 독립적 인코딩 정책 준훈련과 테스트 시간 내부 루프에서의 선택적 데이터 의존적 KG 표현 정제를 가능하게 합니다. 광범위한 실험 결과, AVA-Encoder는 가장 강력한 외부 기준선보다 20.7 퍼센트 포인트 향상되었음을 보여줍니다.

특히 정책 전용 설정에서는 이 프레임워크의 의사 훈련된 샷 수준 에이전틱 비디오 인코더 정책이 인간이 세심하게 조정한 정책보다 우수하며, 시스템 프롬프트 토큰을 74.3% 적게 사용하여 효율성을 입증했습니다. 연구팀은 완전한 AVA-Encoder 프레임워크, 신뢰할 수 있는 에이전틱 비디오 재구성 벤치마크, 그리고 고품질 영화 KG 표현의 첫 데이터셋을 공개합니다.

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

거대 언어 모델(LLM) 기반 에이전트 시스템이 비즈니스 아이디어 구상에 새로운 기회를 제공하지만, 기존 접근 방식은 텍스트에만 국한되어 실제 세계의 본질적인 멀티모달 특성을 반영하지 못한다는 한계가 있었습니다. 이에 연구진은 텍스트만으로는 완전히 전달되지 않는 시각적 단서가 특징인 여섯 가지 도메인에 걸쳐 3만 개의 샘플로 구성된 최초의 멀티모달 벤치마크인 MBA-Bench를 소개합니다.

이 벤치마크는 이미지를 자동으로 캡션하고 GPT-4o를 사용하여 검색 쿼리 생성, 시장 증거 검색, 증거 기반 합성 과정을 통해 세 가지 비즈니스 질문에 대한 다섯 가지 참고 아이디어를 생성하는 방식으로 구축되었습니다. 또한 MLLM-as-a-Judge를 사용하여 에이전트를 여섯 가지 비즈니스 지향 기준에 따라 평가하며, 기준이 숨겨지거나 공개된 상황을 고려하여 MBA-b와 MBA-k를 제시합니다.

두 모델은 창의성과 실현 가능성이라는 두 가지 새로운 보상 목표를 사용하여 학습되었으며, LoRA 기반의 지도 미세 조정과 그룹 상대 정책 최적화를 통해 설정별 보상을 적용했습니다. MBA-b와 MBA-k는 캡션 기반 기준보다 각각 63.9%와 77.1%, 그리고 멀티모달 기준보다 25.6%와 35.8% 더 우수한 성능을 보였습니다. 이는 멀티모달 기반 기준이 캡션 기반 기준보다 훨씬 높은 성능을 달성하며, 일부 지표에서는 폐쇄형 소스 성능에 근접함을 의미합니다.

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

유리 등을 통해 촬영된 영상에는 반사로 인해 시각 품질이 저하되어 후속 비전 작업에 방해가 되는 문제가 있습니다. 단일 이미지 반사 제거 연구는 활발했지만, 쌍을 이루는 비디오 데이터 부족, 시간적으로 일관된 제거 모델, 그리고 전용 평가 벤치마크의 부재로 인해 비디오 반사 제거 연구는 충분히 탐구되지 못했습니다.

본 논문은 물리학 기반 반사 시뮬레이션, 확산 기반 비디오 역변환, 그리고 벤치마크 평가를 통합하는 폐쇄 루프 프레임워크를 제시합니다. S2R-Synthesis 파이프라인은 구조 공간에서 물리학 기반 증강을 수행하고 훈련된 비디오 확산 렌더러를 사용하여 사실적인 반사 영상을 렌더링함으로써 쌍을 이루는 반사된 영상과 반사 없는 영상을 생성합니다. 이 과정에서 거칠기에 의한 블러, 두께에 의한 고스팅, 반사율 변화와 같은 유리 관련 효과를 모델링합니다.

이 합성 데이터를 기반으로 S2R-Removal을 소개하며, 이는 반사 인식 잠재 공간 적응과 단일 단계 픽셀-기하학 정제를 통해 사전 훈련된 비디오 확산 사전 지식을 조정하여 단일 디노이징 단계에서 깨끗한 투과율을 복원하는 최초의 확산 기반 비디오 반사 제거 모델입니다. 또한, S2R-Bench를 통해 비디오 반사 제거를 위한 최초의 벤치마크를 구축하여 전체 참조 평가와 실제 인간 지각 평가를 모두 지원합니다.

S2R-Bench에 대한 실험 결과는 확산 기반 모델이 비확산 기반 기준 모델보다 더 빠르고 최첨단 성능을 보이며 S2R-Synthesis의 효과를 입증합니다. 이는 비디오 반사 제거 분야에서 새로운 방법론과 평가 기준을 제시한다는 점에서 중요한 의미를 가집니다.

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

강력한 모델의 능력을 약한 모델로 전달하는 방법이 학습 시간(training-time)이 아닌 추론 시간(test-time)에 구현될 수 있다는 연구 결과가 발표되었습니다. 이 연구는 강한 빌더 모델이 파라미터 업데이트 없이 약한 목표 모델이 과제를 더 안정적으로 해결하도록 돕는 추론 시간 하네스(inference-time harnesses)를 구성하는 '강함에서 약함으로의 스캐폴딩(strong-to-weak scaffolding)'을 탐구합니다.

연구진은 네 가지 대표적인 이론적 사고(Theory-of-Mind) 벤치마크를 사용하여 이 방법을 검증했으며, 각 빌더 모델은 5%의 데이터를 사용하여 하네스를 반복적으로 개선한 후 전체 테스트 세트에서 평가했습니다. 실험 결과, 이러한 추론 시간 능력 전달 방식은 매우 효과적이었으며, 목표 모델의 평균 성능을 0.49에서 0.91로 거의 두 배로 증가시켰습니다.

이러한 성능 향상은 목표 모델이 더 광범위하게 추론하거나 샘플링하도록 유도하는 것이 아니라, 불안정한 모델 추론을 결정론적 코드, 벤치마크별 라우팅, 엄격한 답변 형식 강제를 통해 코드화함으로써 얻어졌습니다. 또한, 빌더 모델의 추론 노력이 하네스 품질을 단조롭게 개선시키고, 플랫폼 효과는 빌더 모델의 능력에 비해 미미하며, 약한 목표 모델이 가장 큰 성능 향상을 얻는 것으로 나타났습니다.

결론적으로, 추론 시간 하네스 설계는 기존의 학습 시간 증류(training-time distillation)와 보완적인 역할을 하며, 강력한 모델이 재학습 없이 인지 구조를 약한 모델로 전달할 수 있게 합니다. 이는 모델의 인지 구조를 전달하는 새로운 방법을 제시합니다.

Persistent Recursive Worlds Enable Autonomous Software Evolution

복잡한 소프트웨어 시스템은 개별 코딩 에이전트의 수명보다 긴 시간 동안 개발되므로, 대부분의 에이전트 기반 시스템은 지속적인 세션, 메모리, 관리자 또는 공유 컨텍스트를 통해 연속성을 유지합니다. 본 논문은 이러한 문제를 해결하기 위해 EvoX Genesis를 제안하며, 이는 소프트웨어 프로젝트 자체를 지속적인 재귀적 세계로 간주합니다. 각 로컬 세계는 승인된 버전과 저장소 경로로 설정되며, 유한한 수명의 에이전트가 로컬 변경 사항을 제안하고 작업을 경로를 통해 재귀적으로 위임하며, 승인된 결과만이 지속적인 버전 기록을 발전시킵니다.

연구진은 형성, 연속, 재개발 전반에 걸쳐 이 조직 방식을 평가했습니다. 구체적인 실험에서 Genesis는 컴파일러 구현이 없는 저장소에서 시작하여 DeepSeek V4 Flash를 사용하여 약 25만 줄의 추적된 라인을 가진 Rust 기반 C 컴파일러를 구축했습니다. 이 과정은 120시간 이상 지속되었으며 1,000개의 에이전트 에피소드가 보관되었고 모델 토큰 비용은 44달러에 불과했습니다. 이 컴파일러는 c-테스트스위트와 대부분의 LLVM 및 Csmith 테스트를 통과했습니다.

또한 GLM 5.2로 생성된 별도의 컴파일러 세계에서는 에이전트 교체를 반복하면서도 전체 테스트 성능을 유지하며 개발이 계속되었습니다. Genesis는 13개의 MESA 모듈을 10만 줄 이상의 Fortran 라인을 Rust 작업 공간으로 재구현했으며, 여섯 가지 수치 워크로드에서 중앙값 속도 향상 1.55배에서 6.87배를 달성했습니다.

이러한 결과는 장기적인 소프트웨어 개발이 지속적인 에이전트보다는 지속적인 프로젝트를 중심으로 조직될 수 있음을 보여줍니다. 즉, 에이전트의 수명과 관계없이 프로젝트의 연속성을 보장하는 것이 소프트웨어 개발의 효율성과 결과 품질을 높이는 핵심임을 시사합니다.

Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands

손 자세 추정(HPE)은 AR/VR 및 로봇 공학과 같은 다양한 응용 분야에서 핵심 기술이며, 특히 가려짐(occlusion) 상황에서 각 손 관절의 가시성은 추정 결과의 신뢰도를 평가하는 데 매우 중요합니다. 하지만 기존의 대부분의 HPE 방법들은 관절의 가시성을 명시적으로 나타내지 않으며, 가시성 추정은 주로 자세 추정을 개선하기 위한 보조 신호로 사용되어 왔습니다.

본 연구는 개별 손 관절의 가시성을 추정하는 모델인 Hand Visibility Detector를 제안하고, 가시성 추정을 독립적인 작업으로 체계적으로 조사한 최초의 연구를 제시합니다. 이 연구는 대규모 데이터로 사전 학습된 HPE 모델의 사전 지식을 백본으로 활용할 때 이 작업에서 높은 성능을 얻을 수 있음을 보여줍니다.

나아가 Hand Visibility Detector의 유용성을 2D 키포인트의 다중 시점 삼각 측량(multi-view triangulation)을 통한 3D 손 자세 주석(annotation)이라는 다운스트림 작업에 적용하여 결과를 입증했습니다. 이 방법은 가시성 가중 삼각 측량을 통해 재투영 오차(reprojection error)를 줄일 수 있음을 보여줍니다.

이 방법론은 즉시 사용 가능한 패키지로 공개되었으며, 관련 코드와 데모는 GitHub에서 제공하고 있습니다.

Building Security Agents That Cannot Escape Their Trust Boundary

보안 에이전트가 신뢰 경계를 벗어나지 않도록 구축하는 방법에 대한 논의가 이루어졌습니다. 현재의 AI 모델과 코딩 에이전트가 인프라에 직접 접근하여 보안 작업을 자동화할 때, 에이전트가 잘못된 결정을 내리거나 데이터를 삭제하는 실수를 저지를 위험이 있습니다. 이러한 위험을 방지하기 위해 에이전트가 라이브 인프라에 직접 접근하는 대신 데이터 레이크와 같은 격리된 환경에서 작동하도록 하는 방식이 사용되고 있습니다.

하지만 이러한 접근 방식은 비용, 데이터의 불완전성, 동기화 지연 등의 단점을 수반하며, 데이터 주권 상실과 막대한 운영 오버헤드 사이에서 선택해야 하는 딜레마가 존재합니다. 따라서 에이전트가 인프라에 대한 주권을 갖는 것이 중요하며, 이를 위해 최소 권한의 읽기 전용 접근 권한을 부여해야 합니다.

이러한 문제를 해결하기 위해 Cynative는 샌드박스와 액션 게이트라는 이중 아키텍처를 제안합니다. 샌드박스는 에이전트가 네트워크나 파일 시스템에 접근하지 못하도록 외부 세계와 완전히 격리된 환경에서 모델이 생성한 코드를 실행합니다. 액션 게이트는 자격 증명이 연결되기 전에 모든 커넥터 호출을 읽기 전용 정책에 따라 승인하며 실패 시 차단하는 방식으로 작동합니다.

이 구조를 통해 에이전트는 설계 시점에 허용된 범위 내에서만 작동하도록 보장받으며, 라이브 인프라를 변경하거나 데이터를 유출할 수 없습니다. 즉, 에이전트의 추론 능력은 유지하면서도 실제 인프라에 대한 통제권을 확보하여 보안 에이전트의 신뢰 경계를 유지할 수 있습니다.

Pixel Watch 5

구글 픽셀 워치 5는 제미나이 인텔리전스를 통해 사용자에게 선제적인 지원을 제공하고 혁신적인 건강 추적 기능을 도입합니다. 이 시계는 사용자의 일상적인 작업과 운동 요구에 대해 손을 사용하지 않고도 도움을 받을 수 있는 기능을 제공하며, 가장 정확한 GPS 추적 기능을 탑재하여 도시 환경이나 트레일에서도 뛰어난 위치 정확도를 보장합니다.

새롭게 추가된 '헬스 가디언' 기능은 생체 징후 추세를 모니터링하여 건강 문제를 미리 감지하는 데 중점을 둡니다. 구체적으로는 호흡 응급 상황 감지 기능과 혈압, 수면, 신진대사 건강에 대한 월별 웰니스 추세 요약을 제공하여 사용자가 자신의 건강 상태를 관리하는 데 도움을 줍니다.

배터리 수명과 관련하여 픽셀 워치 5는 모델에 따라 41mm는 최대 30시간, 45mm는 최대 40시간의 사용 시간을 제공하며, 실제 배터리 수명은 사용 환경과 기능 사용에 따라 달라질 수 있습니다. 충전은 30W 어댑터를 사용한 USB-C® 퀵 차지 도크를 통해 가능하지만, 배터리 노화 및 주변 온도 등 여러 요인에 따라 충전 속도가 달라질 수 있습니다.

사용자는 2026년 8월 12일부터 사전 주문을 시작하며, 8월 20일부터 일반 판매가 시작됩니다. 또한, 기기 수리 옵션은 지역별로 다를 수 있으며, 안전을 위해 자가 수리는 권장되지 않습니다.

SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index

SpaceXAI의 Grok 4.6이 인공지능 분석 지수(Artificial Analysis Intelligence Index)에서 61점을 기록하며 GPT-5.6 Sol과 함께 인텔리전스 최전선에 합류했습니다. 이는 Claude Opus 5(63점)와 Claude Fable 5(62점)에 뒤처지지만, 비용 효율성 측면에서 강력한 성과를 보이며 경쟁 우위를 점하고 있습니다.

Grok 4.6은 특히 에이전트 성능에서 두각을 나타내며 GDPval-AA v2 Elo 1753점을 달성했습니다. 이는 Claude Opus 5에 뒤처지며 Claude Fable 5 및 Qwen3.8 Max와 겹치는 신뢰 구간을 보여주어 실질적인 에이전트 지능 면에서 경쟁력을 입증했습니다.

모델 가격은 Grok 4.5와 동일하게 1M 토큰당 $2/$6로 유지되었으나, 작업당 비용은 $0.84로 측정되어 Kimi K3와 동일한 수준입니다. 이는 Grok 4.6이 인텔리전스 지수에서 5점의 향상을 달성하면서도 가격 인상 없이 비용 효율성을 극대화했음을 의미합니다.

또한 장기 에이전트 지식 작업 벤치마크인 AA-Briefcase에서는 Claude Opus 5 패밀리에 뒤처지지만, Claude Opus 5(max) 대비 약 103턴과 2.0B 입력 토큰을 사용하는 것에 비해 Grok 4.6은 평균 53턴과 0.5B 입력 토큰으로 작업을 완료하여 효율성이 매우 높습니다.