Crusoe reportedly raises $3B at a $30B valuation

데이터 센터 개발업체인 Crusoe가 300억 달러의 기업 가치로 30억 달러 규모의 신규 펀딩을 완료했다고 보도되었습니다. 이는 이 회사가 최근 양자 거래 회사인 Jane Street와 GPU 및 AI 인프라 공급을 위해 130억 달러 규모의 5년 클라우드 계약을 확보했기 때문입니다.

Crusoe는 Meta, Microsoft, OpenAI를 주요 고객으로 두고 있으며, Oracle과 OpenAI와 같은 고객을 위해 하이퍼스케일 데이터 센터 캠퍼스를 개발하는 AI 인프라 및 클라우드 제공업체로 자리매김했습니다. 이 펀딩은 아부다비 국부 펀드 Mubadala Capital 등 여러 투자자들이 참여했으며, Atreides Management와 Valor Equity Partners가 공동 주도했습니다.

이 자금 조달은 지난 10월에 100억 달러 가치로 13억 8천만 달러 규모의 라운드 이후 이루어졌으며, 회사는 현재 골드만삭스나 모건스탠리와 같은 투자 은행들과 잠재적인 단기 IPO에 대해 논의하고 있습니다. 이는 AI 시대의 지속 가능한 인프라 구축에 대한 투자자들의 관심을 반영하며, 데이터 센터 인프라의 중요성이 더욱 부각되고 있음을 시사합니다.

K2 Horizon, 학습 전 과정을 공개하는 6개 AI 모델 제품군

IFM이 0.9B부터 375B-A23B에 이르는 총 6개의 AI 모델 제품군을 공개하며 학습 전 과정을 투명하게 공개했습니다. 이 모델들은 웨어러블 기기, 스마트폰, 로컬 워크스테이션, 그리고 기업 서버에 이르기까지 하나의 제품군으로 연결하여 광범위한 기기에서 AI를 활용할 수 있도록 확장합니다.

이번 공개의 핵심은 최종 가중치만을 제공하는 것이 아니라 모델 학습에 필요한 모든 상세 정보에 접근할 수 있게 했다는 점입니다. 개발자들은 학습 데이터, 구축 방법, 코드, 설정, 중간 체크포인트, 로그 및 평가 결과까지 모두 제공받아 모델을 이해하고 재현할 수 있습니다.

이는 단순히 모델을 사용하는 것을 넘어 AI 개발의 전체 라이프사이클을 통합적으로 제공하여 개발자들이 모델을 실험하고 커스터마이징하는 데 필요한 투명성과 재현성을 극대화합니다. 개발자들은 이러한 상세 정보를 통해 특정 환경에 최적화된 모델을 구축하고 배포하는 데 큰 도움을 받을 수 있습니다.

Nvidia, Hugging Face를 약 19조원에 인수하기로 공식 합의

엔비디아(Nvidia)가 Hugging Face를 약 129억 달러에 인수하기로 공식 합의하며 인공지능 플랫폼 분야로 사업 영역을 확장합니다. 이 거래는 GPU 중심의 엔비디아가 AI 생태계의 핵심 인프라 플랫폼을 확보하려는 전략적 움직임으로 해석됩니다.

이번 인수를 통해 Hugging Face는 전체 AI 생태계를 위한 개방형 플랫폼으로서의 지위를 유지하게 됩니다. 이는 엔비디아의 컴퓨팅 자원을 사용하지 않더라도 개발자들이 모델과 서비스를 자유롭게 활용할 수 있는 환경을 보장한다는 점에서 개발자들에게 중요한 의미를 가집니다.

Hugging Face는 오픈 소스 모델과 데이터 공유를 촉진하는 데 중점을 두고 있으며, 엔비디아와의 합병은 이러한 개방형 플랫폼의 접근성과 확장성을 더욱 강화할 것으로 기대됩니다. 따라서 개발자들은 향후 AI 모델 개발 및 배포에 있어 엔비디아의 기술력과 Hugging Face의 개방형 생태계가 어떻게 통합될지 주목해야 합니다.

CLIProxyAPI - AI 구독 계정을 호환 API로 노출하는 프록시

CLIProxyAPI는 다양한 AI 구독 계정을 표준 API 형식으로 노출하는 프록시 시스템입니다. 이 시스템은 ChatGPT Codex, Claude Code, Gemini, Grok Build, Antigravity 등 여러 서비스의 OAuth 계정을 로컬 프록시에 연결하여 호환 가능한 API로 제공합니다.

이러한 접근 방식의 가장 큰 이점은 개발자들이 별도의 API 키를 발급받을 필요 없이 기존의 SDK, API 클라이언트, 그리고 코딩 에이전트를 사용하여 구독 계정의 모델을 호출할 수 있게 한다는 점입니다. 이는 AI 서비스 접근에 필요한 인증 절차를 단순화하고 통합하여 개발 환경을 간소화합니다.

결과적으로 개발자는 복잡한 API 키 관리 대신 프록시를 통해 통합된 방식으로 AI 모델에 접근할 수 있게 됩니다. 이는 AI 기반 애플리케이션을 구축하거나 코딩 에이전트를 활용하는 개발자들에게 구독 계정 활용의 진입 장벽을 낮추는 실질적인 해결책을 제공합니다.

The unusually muted Tesla Cybercab launch

테슬라가 오늘 텍사스 오스틴에서 미래의 자동차인 사이버캡을 공식적으로 공개하는 비공개 행사를 가졌습니다. 이는 인공지능, 자율 주행 차량, 휴머노이드 로봇에 회사의 미래를 걸어온 일론 머스크에게 엄청난 이정표가 됩니다.

이번 발표는 평소와 달리 매우 조용하게 진행되었는데, 라이브 스트리밍 없이 진행되었으며 X.com에서 테슬라 관련 계정들이 텍사스 내 테슬라 로보택시 수를 추적하는 웹페이지를 스트리밍했습니다. 이는 지난번 로보택시 출시 때와 마찬가지로 비판을 최소화하기 위해 초대 명단이 주로 테슬라 지지 인플루언서들로 구성되었기 때문입니다.

참석자 중 한 명인 척 쿡(Chuck Cook)은 이러한 방식으로 새로운 제품에 대한 잠재적인 비판을 완화하려는 의도를 시사했습니다. 이처럼 공개적인 이벤트가 아닌 폐쇄적인 방식으로 발표를 진행한 것은 테슬라의 자율 주행 및 로봇 기술에 대한 대중의 반응과 시장의 평가를 관리하려는 전략으로 해석됩니다.

브라우저의 메인 스레드는 비싸다

브라우저 성능의 핵심은 메인 스레드를 어떻게 사용하는가에 달려 있습니다. 프론트엔드에서 발생하는 성능 문제는 단순히 코드가 느려서 발생하는 것이 아니라, JavaScript 실행, 렌더링, 이벤트 처리가 메인 스레드를 장시간 점유하기 때문에 주로 발생합니다.

이러한 현상은 사용자 경험 저하로 이어지며, 개발자는 코드가 느리다는 이유만으로 성능 문제를 해결하기보다 메인 스레드 점유 시간을 줄이는 데 집중해야 합니다. 메인 스레드가 블로킹되면 브라우저의 반응성이 떨어지고 전체적인 프론트엔드 성능이 저하됩니다.

따라서 성능 개선을 위해서는 JavaScript나 렌더링 작업이 메인 스레드를 과도하게 점유하지 않도록 관리하는 것이 중요합니다. 해결책은 이러한 작업들을 메인 스레드 내에서 효율적으로 처리하고, 백그라운드 작업으로 분리하여 실행하는 방식으로 접근해야 합니다.

Jujutsu 0.45.0

Git 호환 버전 관리 시스템인 Jujutsu 0.45.0에 커밋을 결합하고 자동 해소하는 새로운 명령어 jj converge가 추가되었습니다. 이 명령어는 분기된 커밋들을 결합하여 자동으로 해소하는 기능을 제공합니다.

jj converge는 휴리스틱(heuristic) 방식을 사용하여 대체 커밋을 생성합니다. 이 과정에서 결과가 확정되지 않을 경우 사용자에게 확인을 요청하거나 비대화형 모드에서 작업을 중단할 수 있는 안전장치가 마련되어 있습니다.

이는 개발자들이 복잡한 커밋 히스토리를 관리하고 병합하는 작업을 더 효율적이고 안전하게 수행할 수 있도록 돕습니다. 사용자는 자동 해소 과정의 결과를 신중하게 검토하여 최종 커밋을 확정할 수 있습니다.

RenderFormer-V2: Neural Rendering with Heterogeneous Scene Primitives

RenderFormer-V2는 현대 물리 기반 렌더링 시스템을 보완하는 통합 학습 기반 트랜스포머 신경 렌더링 모델로, 장면별 학습이나 특수 코딩 없이도 역광, 체적 산란, 환경 조명, 질감 및 변위된 표면, 그리고 분포 외 재질까지 다양한 광선 전달 효과를 처리할 수 있습니다. 이 모델은 전역 광선 전달을 시퀀스-투-시퀀스 변환으로 모델링합니다.

RenderFormer-V2는 이전 모델과 마찬가지로 두 단계 프로세스를 사용하는데, 장면 독립적인 단계에서는 장면 내 기본 요소 간의 전달을 해결하고, 이후 시점 의존적인 단계에서 내부 신경 장면 표현을 이미지 픽셀로 변환합니다. 특히 장면 독립적인 단계에서는 렌더 정확도를 유지하면서 확장성을 개선하기 위해 새로운 윈도우드 어텐션과 렌더링 정보 기반 어텐션 싱크를 결합하여 사용합니다.

또한 이 모델은 환경 맵과 참여 매질을 포함하는 이질적인 장면 기본 요소를 지원하며, 기반 표면 반사 모델에 독립적인 새로운 신경 임베딩을 통해 재질 외관을 인코딩합니다. 이러한 개선된 어텐션 메커니즘에 대한 광범위한 절제 분석을 통해 RenderFormer-V2의 다재다능함을 입증했습니다.

Learning 3D Editing without Paired Supervision via Generative Prior Distillation

인스트럭션 기반 3D 편집은 상호작용 콘텐츠 제작에 필수적이지만 고품질의 쌍별 학습 데이터 부족이라는 심각한 병목 현상을 겪고 있습니다. 기존 접근 방식들은 느린 테스트 시간 최적화나 복잡한 파이프라인을 통해 생성된 가짜 쌍을 학습에 사용하는데, 이는 종종 구조적 표류와 기하학적 인공물(artifacts)을 발생시킵니다.

본 논문은 쌍별 3D 감독 없이도 피드포워드 3D 편집을 학습하기 위해 생성적 우선 분별(Generative Prior Distillation)이라는 새로운 프레임워크를 제안합니다. 핵심 아이디어는 실제 3D 쌍에 의존하는 대신, 강력한 기반 모델들로부터 시각, 의미, 기하학적 지식을 3D 편집 모델로 직접 추출하는 것입니다. 구체적으로, 미분 가능한 렌더링 파이프라인을 통해 주 편집 뷰의 이미지 편집 모델에서 얻은 2D 시각 사전 정보와 새로운 뷰에서의 시각-언어 모델에서 얻은 의미 사전 정보를 감독 신호로 사용하여 지침 준수와 원본 정체성 보존을 확보합니다.

특히 2D 투영 감독에서 발생하는 기하학적 붕괴와 다중 뷰 불일치를 해결하기 위해 3D 인식 분포 일치(3D-aware Distribution Matching) 정규화를 도입했습니다. 이 항은 기하학적 사전 정보 역할을 하며 3D 잠재 공간에서 작동하여 사전 학습된 이미지-3D 교사 모델이 정의한 현실적인 3D 에셋의 다양체 내에 편집된 출력이 머물도록 제약합니다.

광범위한 실험 결과, 이 방법은 최고 수준의 지침 충실도와 뷰 간 일관성을 달성하며, 기존의 최첨단 기준 모델들을 크게 능가하는 성능을 보였습니다. 이 연구는 3D 편집 분야에서 데이터 부족 문제를 우회하고 일관성을 높이는 데 중요한 기여를 합니다.

What Did I Just Say? Self-Listening for Full-Duplex Speech Models

풀-듀플렉스 음성 언어 모델은 동시에 듣고 말할 수 있어 인간 대화에서 중단이나 백채널을 처리할 수 있습니다. 하지만 텍스트 생성, 음성 합성, 오디오 재생이 비동기적으로 진행되기 때문에 모델이 말했다고 인식하는 내용이 사용자에게 실제로 재생된 내용과 일치하지 않을 수 있습니다. 이러한 문제를 해결하기 위해 연구진은 중단 상황에서 모델의 실제 발화 내용을 인지하면서 복구하는 문제를 '앵커 중단(anchor interruption)'이라고 정의했습니다.

이 문제를 해결하기 위해 연구진은 사용자 음성, 모델 텍스트, 모델이 재생한 음성을 교차 배치하는 풀-듀플렉스 모델링 접근 방식인 '셀프 리스닝(Self-Listening)'을 제안했습니다. 셀프 리스닝은 실제 음성 출력을 모델에 입력 스트림으로 피드백하여 중단 복구를 사용자가 실제로 들은 내용에 기반하도록 합니다.

또한, 연구진은 구조화된 순서 응답 중 실제로 발화된 항목을 추적하기 위한 동질적인 훈련 및 테스트 분할을 가진 데이터셋인 '앵커스피치(AnchorSpeech)'를 소개했습니다. 앵커스피치-테스트는 중단 직전에 완료된 마지막 항목에 대해 모델이 일관되게 응답할 수 있는지 평가합니다. 실험 결과, 셀프 리스닝 메커니즘을 갖춘 모델은 풀-듀플렉스 기준 모델에 비해 더 나은 앵커링 성능을 달성하는 것으로 나타났습니다.

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference

대규모 추론 모델(LRM)은 확장된 사고의 사슬(CoT) 생성을 통해 문제 해결 능력을 향상시키지만, 결과적으로 키-값(KV) 캐시가 시퀀스 길이에 선형적으로 증가하여 장거리 추론 시 GPU 용량을 초과하는 심각한 메모리 병목 현상을 발생시킵니다. 기존의 KV 캐시 압축 방법들은 미래 토큰 중요도를 추정하기 위해 최근 쿼리에 의존하는데, 이는 장기 추론에서 발생하는 특정 디코딩 단계가 이전의 광범위한 문맥을 다시 참조하는 사고 재방문 토큰(TRT)을 생성한다는 점을 간과합니다.

연구진은 이러한 TRT에 해당하는 쿼리들이 임베딩 공간에서 소수의 유사성 그룹으로 군집화된다는 것을 발견했습니다. 이 통찰을 바탕으로 전체 쿼리 기록을 저장하지 않으면서 어떤 KV 쌍이 재방문될지 예측하는 학습 불필요 압축 방법인 BeaconKV를 제안했습니다. BeaconKV는 비컨 쿼리와 각 글로벌 쿼리 클러스터의 압축된 대표값을 유지하여 메모리 효율성을 극대화합니다.

네 가지 오픈소스 LRM과 다양한 추론 벤치마크에서 BeaconKV는 기존 압축 방법들을 능가하는 성능을 보였습니다. 이 방법은 전체 캐시 정확도를 거의 유지하면서 메모리를 최대 5.8배까지 줄이고 처리량을 4.3배 이상 향상시켰습니다. 이는 장거리 추론 환경에서 메모리 효율성과 추론 속도를 동시에 개선하고자 하는 개발자들에게 중요한 시사점을 제공합니다.

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

로봇 조작을 위한 세계 행동 모델(WAM)은 미래 상태를 예측하여 로봇의 행동을 안내함으로써 행동 없는 비디오와 행동 레이블링된 상호작용 모두로부터 학습할 수 있게 합니다. 본 연구는 Genie Envisioner Act 2.0(GE-Act 2.0)이라는 세계 행동 모델을 소개하는데, 이는 조작 데이터에서 생성적 및 행동 구성 요소가 모두 처음부터 초기화된 모델입니다. 이 모델은 제어 지향 오토인코더(CoAE), 단일 단계 시각 플래너(SVP), 역동학 모델(IDM)을 결합하여 구성됩니다. CoAE는 공격적인 압축 하에서도 행동 및 지침 관련 정보를 유지하며, SVP는 단일 미분 가능한 통과에서 완전한 미래 상태를 생성하여 시각 계획과 역동학을 보완적인 데이터로 개별적으로 사전 학습할 수 있게 합니다.

이 구성 요소들은 지식 정렬 선택 최적화(KASO)와 공동으로 훈련되어 기록된 행동과 행동적으로 일치하는 예측된 미래만을 선택함으로써 불일치한 감독을 줄입니다. 연구진은 이 모델을 20개의 조작 기술 그룹에 걸쳐 100개 작업에 대해 평가했으며, 코어 훈련 데이터를 300시간에서 30,000시간으로 확장했을 때 성공률이 크게 향상되었습니다. 특히 G2-90D의 성공률은 13.4%에서 31.1%로 증가했으며, 이는 17.7포인트 향상되어 교차 체화 전이(cross-embodiment transfer)를 시사합니다.

이러한 성공률 증가는 19/20 및 18/20 기술 그룹에 걸쳐 나타났으며, 기술별 커버리지가 제로샷 외 분포(OOD) 성공과 강한 상관관계(Pearson r=0.80; Spearman rho=0.85)를 보였습니다. 또한 모델은 최소 90%의 시도에서 객체, 색상, 모양, 위치 참조를 확립하고 이미 확정된 행동이나 일반적인 장면 연관성과 상충하더라도 명시적인 지침을 따릅니다.

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets

자율 언어 모델 기반 트레이딩 에이전트의 실제 운영 기록에 대한 6개월, 인구 규모 측정 기록을 제시합니다. 이 기록은 두 시스템, 즉 실제 ETH를 베이스 메모코인 시장에서 거래한 DX Terminal Pro와 하이퍼리퀴드 선물 거래를 수행한 DXAP 라이브 알파 플리트에서 운영된 에이전트들을 포괄합니다. 측정 기간 동안 약 750만 건의 단일 모델 호출과 30만 건의 온체인 액션이 기록되었으며, 231,638건의 멀티툴 턴을 통해 14,596건의 체결이 발생했습니다.

연구 결과 네 가지 핵심 발견 사항 중 첫 번째는 운영 계층이 전략 텍스트보다 에이전트의 행동을 더 많이 결정한다는 점입니다. 리스크 슬라이더가 레버리지(+0.425/레벨)를 설명하고, 에이전트 고정 효과가 분산의 60%를 흡수하며, 리더보드 렌더 경계가 선택을 인과적으로 경로를 지정한다는 사실이 밝혀졌습니다. 두 번째로, 에이전트의 규모 설정은 변동성에 둔감하며, 모든 변동성 육분위수에서 중간 레버리지가 5.0배로 나타났습니다.

세 번째 발견은 에이전트가 도달한 상승분의 대부분을 포착하지 못한다는 것입니다. 포지션의 43.2%가 24시간 내에 최소 300bp의 유리한 이탈을 보였음에도 불구하고 49.3%는 마이너스 거래 수익으로 마감했으며, 기계적 브래킷은 포지션당 39.0bp의 수익을 회복시켰습니다. 네 번째로, 두 플리트 모두 방향성 우위를 보이지 않았는데, DXAP 플리트는 매칭된 하이퍼리퀴드 리테일 벤치마크(41% 대 50% 왕복 승률)를 뒤처었습니다.

결론적으로, 프론티어 모델들의 결정 품질은 이 시점에서는 통계적으로 구별할 수 없지만, 모델 패밀리별 선택 안정성은 크게 달라진다는 점이 확인되었습니다. 이 연구는 모든 헤드라인이 인과 추론 및 공통 수수료 재진술을 통과했으며, 17가지 규칙 방법론이 자체 철회와 함께 제시되었습니다.

SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution

대화형 AI 및 몰입형 AI를 위해서는 다양하고 시뮬레이션 준비가 된 실내 장면 생성 능력이 필수적이지만, 이를 확장 가능하게 생성하는 것은 여전히 어려운 과제입니다. 최근 비전-언어 모델(VLM)에 의존하는 에이전트 기반 텍스트-3D 장면 파이프라인은 높은 충실도를 가진 장면을 생성할 수 있지만, 객체의 반복적인 배치와 정제 과정이 비용이 많이 듭니다. 반면, 파라메트릭 이미지-투-3D 장면 모델은 2D 이미지로부터 강력한 사전 지식을 효율적으로 사용하여 장면을 생성하지만, 종종 부정확하고 물리적으로 유효하지 않은 장면을 만들어냅니다.

이러한 한계를 극복하기 위해 본 논문은 두 패러다임의 장점을 결합한 프레임워크인 SceneMosaic을 제안합니다. SceneMosaic은 학습된 이미지 기반 사전 지식에서 초기 후보를 얻은 후 VLM 에이전트를 통해 결과를 진화시켜 효율성과 물리적 타당성을 모두 보장합니다. 특히 SceneMosaic은 자연 장면의 국소성을 활용하여 장면을 독립적인 국소 단위로 분해하고 각 단위 내에서 별도로 진화시킨 다음 카르테시안 곱을 통해 전체 장면을 구성합니다.

SceneEval-100 평가에서 SceneMosaic은 가장 강력한 에이전트 기반의 의미적 레이아웃 품질 기준선과 24배의 속도로 일치하며, 물리적 위반을 크게 줄이고 가장 높은 인간 평가를 받았습니다. 이 연구는 장면 생성의 효율성과 물리적 정확성, 그리고 다양성을 동시에 달성하는 데 중요한 진전을 제공합니다. 관련 코드는 공개되어 있습니다.

Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

거대 언어 모델의 정렬 과정에서 유용성과 안전성 사이의 균형을 맞추는 것은 근본적인 도전 과제입니다. 모델은 "누군가를 어떻게 쏘는가"와 같은 유해한 질문에는 거부해야 하지만, "좋은 사진을 어디서 찍을 수 있나요"와 같이 표면적으로 위험해 보이는 입력에는 응답해야 합니다. 그러나 모델은 실제로 유해한 질문과 표면적으로 위험한 언어를 포함하는 무해한 질문을 구별하는 데 어려움을 겪어 잘못된 거부(false refusals)가 발생합니다.

본 논문에서는 안전 튜닝 데이터셋의 응답을 두 가지 구성 요소, 즉 (i) 정형화된 거부 진술과 (ii) 거부를 설명하는 근거(rationale)로 분해하여 이 문제를 다룹니다. 실험 결과, 거부 진술은 유해한 질문과 무해한 질문을 정확하게 구별하는 것을 방해하며 피상적인 단서에 의존하게 만듭니다. 반면, 오직 근거만을 사용하여 훈련하는 방식은 안전 성능을 유지하면서 잘못된 거부를 줄이는 데 효과적입니다.

이러한 근거 기반 접근 방식은 인컨텍스트 학습(ICL) 구성에서도 이점을 보였으며 평가된 추론 시점 완화 방법들과도 호환됩니다. 연구 결과는 정렬된 에이전트를 구축하기 위해서는 정밀하게 선별된 세분화된 안전 감독 데이터셋이 필수적임을 강조합니다. 이는 유용성과 안전성을 더 잘 조화시키는 방향으로 정렬된 에이전트를 구축하기 위한 방향을 제시합니다.

Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models

비전-언어 모델(VLM)은 적절한 요청에는 도움을 주지만, 부정확하거나 안전하지 않거나, 실행 불가능하거나, 답변할 수 없는 요청에는 준수를 거부할 것으로 예상됩니다. 하지만 기존 벤치마크들은 요청 전체 수준에서만 불준수를 평가하여 각 요청이 준수를 요구하거나 불준수를 요구한다고 가정합니다. 실제 환경의 질의는 답변 가능한 내용과 준수를 거부해야 하는 구성 요소가 혼합되어 있을 수 있습니다.

이러한 문제를 해결하기 위해 본 논문은 VLM에서 선택적 불준수를 평가하기 위한 벤치마크인 KoNA를 소개합니다. KoNA는 거짓 전제(False Premise), 시각적 접근 불가능성(Visual Inaccessibility), 보편적 미지(Universal Unknown), 작업 실행 가능성(Task Feasibility), 안전성(Safety)이라는 다섯 가지 범주에 걸쳐 선택적 불준수를 평가합니다. 각 작업은 단일 및 복합 질의 쌍을 사용하여 쿼리 수준 불준수와 구성 요소 수준 불준수라는 두 가지 능력을 평가합니다.

다양한 VLM에 대한 평가 결과는 모델들이 적절하게 거부하거나, 수정하거나, 삼가는 데 실패하며, 특히 선택적 불준수가 필요한 질의에서 이러한 실패가 더욱 두드러진다는 것을 보여줍니다. 연구진은 이러한 도전을 해결하기 위해 선택적 불준수가 필요한 KoNA 예제와 직접적인 답변을 받아야 하는 완전히 답변 가능한 데이터셋을 사용하여 VLM을 미세 조정했습니다.

이러한 미세 조정된 모델들은 불준수 정확도에서 상당한 개선을 달성하면서도 답변 가능한 작업에서의 성능을 대부분 유지했습니다. 이는 미세 조정된 모델이 답변 가능한 구성 요소와 불준수가 필요한 구성 요소를 구별하고 작업에 적합하게 응답할 수 있음을 시사합니다.

Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs

거대 언어 모델(LLM)에서의 추론 과정은 문제 공식화, 목표 분해, 연역과 같은 다양한 기능적 연산으로 이루어집니다. 이러한 연산들이 텍스트상에서 명확히 구분됨에도 불구하고, 이들이 은닉 표현 공간에서 어떻게 기하학적으로 조직되어 있는지에 대한 정보는 부족했습니다. 본 연구는 각 추론 연산이 은닉 표현에 상응하는 기하학적 구조를 가지는지 조사했습니다.

연구 결과, 추론 연산들은 홀드아웃 표현에서 분리 가능하며, 이러한 분리성은 중간 레이어에서 가장 두드러지게 나타났습니다. 또한 이러한 구조는 어휘적 또는 위치적 혼란으로 설명되지 않는 것으로 확인되었습니다. 레이어 전반에 걸쳐 토큰별 연산 정렬은 스팬에 걸쳐 더 분산되며, 동일한 표면 토큰들은 주변 청크의 연산에 따라 다르게 표현됩니다.

어텐션 마스킹 개입을 통해 확인한 바에 따르면, 청크 시작점에서의 연산 정렬된 표현은 선행 추론 맥락에 의존하는 것으로 나타났습니다. 이는 언어 모델이 언어적 추론 표현과 그 내부 기하학적 구조 사이에 표현적 대응 관계를 유지하고 있음을 시사합니다.

이 연구는 언어 모델이 추론 표현과 내부 기하학적 구조 사이에 표현적 일치를 유지한다는 것을 입증합니다. 관련 코드와 프로젝트 자료는 https://github.com/naver-ai/beneath-cot에서 확인할 수 있습니다.

τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction

LLM 에이전트는 고객 서비스 처리, 분쟁 조정, 내부 시스템 운영 등 실제 운영 소프트웨어로 빠르게 자리 잡고 있습니다. 그러나 이러한 에이전트를 구축하는 작업이 코딩 에이전트에게 위임되면서, 실제 고객과의 상호작용 조건에서 AI 시스템이 목표를 달성할 수 있는지에 대한 기존 벤치마크는 부족한 실정입니다. 이에 연구진은 에이전트 구성을 핵심 과제로 삼는 벤치마크인 $\tau^\tau$-bench를 소개합니다.

이 벤치마크는 개발자 에이전트에게 실제 업무 환경과 동일한 출발점을 제공합니다. 구체적으로, 에이전트는 실제 비즈니스가 보유한 기록, 요구사항을 가진 고객, 운영이 거쳐야 하는 생산 API, 상속할 코드베이스, 그리고 서비스 비용 및 모델에 대한 제한 사항을 부여받습니다. 에이전트는 이 모든 것을 바탕으로 완전한 고객 서비스 에이전트를 제공해야 하며, 이는 홀드아웃된 시뮬레이션 사용자에게 배포하여 평가됩니다.

53가지 작업과 네 가지 도메인을 포괄하는 평가 결과에서, 가장 강력한 구성인 Claude Opus 5를 Claude Code 하에서 실행했을 때 평가 시뮬레이션의 23.9%를 통과했습니다. 전문가가 작성한 참고 기준 상한선은 82.2점을 기록했습니다. 이러한 결과는 인간 에이전트 개발자가 겪는 실패 사례와 일치하는데, 모델이 기록에 대한 깊은 이해 대신 피상적인 질의를 하고, 고객에게 거의 소통하지 않으며, 에이전트 아키텍처와 서비스 비용에 대한 실험을 충분히 하지 않고 첫 번째 작동하는 디자인을 배포하는 경우가 많습니다.

연구진은 $\tau^\tau$-bench를 통해 협력적 에이전트 구축 작업을 코딩 에이전트를 위한 측정 가능한 목표로 전환하고자 합니다. 이는 실제 운영 환경에서 에이전트의 성능과 현실성을 측정하는 데 중요한 기준을 제시합니다.

Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization

거대 언어 모델(LLM)이 자연어 문제 설명으로부터 최적화 모델을 공식화하는 데 사용되고 있지만, 실제 운영 연구(OR) 요청은 종종 불완전합니다. 목표, 제약 조건 또는 비즈니스 규칙이 누락되어 수학 프로그램의 결과가 달라질 수 있습니다. 기존의 평가 방식들은 완전한 사양을 가정하기 때문에 에이전트가 모델링 전에 언제 명확화가 필요한지 아는지 여부를 간과합니다.

이에 연구진은 사전 공식화 명확화를 위한 벤치마크인 OR-Clarify를 소개합니다. 이 벤치마크는 부분적인 문제 설명과 숨겨진 구조화된 슬롯을 제시하며, 시뮬레이션된 사용자와의 제한된 상호작용을 통해 에이전트를 평가합니다. OR-Clarify는 슬롯 복구, 중지 행동, 암묵적 가정, 상호작용 비용을 측정하며 개방형 및 선택 기반 명확화를 모두 지원합니다.

나아가 연구진은 해결되지 않은 공식화에 결정적인 격차를 식별하고 다음 질문을 할지 또는 중지할지를 안내하는 2단계 프레임워크인 Interactive Optimization(InterOPT)을 제안했습니다. 선택 기반 실험에서 InterOPT는 정확한 슬롯 복구에서 모든 기준 모델을 크게 능가했으며, 개방형 설정에서는 강력한 선행 방법들과 경쟁할 만한 성능을 보였습니다.

결론적으로 OR-Clarify와 InterOPT는 OR 지원을 선택적 완전성 결정으로 재구성합니다. 즉, 필요할 때 명확화하고, 준비가 되면 중지하며, 부족한 부분을 정량화하는 방식으로 접근합니다.

WorldSculpt: Generating Compositional Worlds from Grounded Videos

수백 개의 객체가 밀집된 복잡한 장면에서 구성적인 3D 표현을 생성하는 문제를 연구합니다. 목표는 게임, AR/VR, 시뮬레이션, 로봇 공학 등 후속 응용 분야에 필요한, 공유된 월드 프레임에 배치된 개별 객체 메시들의 집합으로 장면을 표현하는 것입니다. 이러한 작업은 객체들이 서로 심하게 가려지고 각 시점에서 기하학의 일부만 드러나는 밀집된 장면에서 특히 어렵습니다.

기존의 기하학 기반 접근 방식은 장면 전체를 단일 표현으로 재구성하며 가려진 영역에 불완전한 기하학을 남기는 반면, 생성적 사전 지식을 활용한 기존의 구성적 방법들은 비교적 단순한 장면에 국한되어 적용이 제한적이었습니다. 본 연구는 강력한 단일 객체 3D 생성 사전 지식을 다중 시점 관찰에 적응시켜 수백 개의 객체가 포함된 복잡한 장면을 구성적으로 생성할 수 있음을 보여줍니다.

이러한 패러다임을 Pixal3D에 적용하고 다중 시점 조건화 경로를 확장하여 객체 생성을 여러 자세한 관찰에 기반하도록 구현했습니다. 모델은 정규 공간에서 단일 객체로 미세 조정되었지만, 장면 수준의 훈련 없이도 심한 가려짐이 있는 대규모 장면으로 일반화되어 이 패러다임의 실현 가능성과 확장성을 입증했습니다.

연구진은 수백 개의 객체와 개별 객체 주석, 실제 메시를 포함하는 포토리얼리즘 벤치마크인 UE-MeshyScene을 도입했습니다. 단일 객체, 제어된 다중 객체, UE-MeshyScene 평가에서 본 방법은 기존 접근 방식보다 일관되게 우수한 성능을 보였으며, 장면의 복잡성과 가려짐이 증가할수록 성능 향상이 더욱 커졌습니다. 또한, Marble이나 HY-World 2.0과 같은 생성된 3DGS 세계를 구성적인 메시 장면으로 변환하는 광범위한 적용 가능성도 입증했습니다.