Automata from Agent Traces: Failure and Next-Step Prediction

LLM 기반 에이전트는 다단계 작업을 수행하지만, 긴 비정형 추적(trace)은 배포에 필요한 안전 감사 및 런타임 모니터링을 어렵게 만듭니다. 기존 접근 방식들은 추적별 또는 성공만을 기반으로 작동하여 다음 단계 예측과 실패 예측을 연결하는 교차 런 토폴로지(cross-run topology)를 놓치고 있습니다.

이러한 공유 구조를 복구하기 위해 전체 추적 코퍼스를 단일하고 압축된 유한 상태 기계(FSM)로 압축하여 LLM 에이전트의 예측 불가능한 행동에 대한 구조적 기반을 제공합니다. 12개의 공개 데이터셋에서 테스트한 결과, 이 FSM은 7~43개의 상태로 매우 작으며, 홀드아웃 데이터를 0.997 이상의 적합도로 재현하고 분할 간에 거의 동일한 토폴로지를 보입니다.

이 구조적 기반은 예측 목표를 모두 해결합니다. 다음 단계 예측의 경우, FSM 상태 컨텍스트가 에이전트 워크플로우 메모리보다 모든 정답 데이터셋에서 더 우수한 성능을 보입니다. 또한 실패 예측에 있어서는 상태별 행동 특징이 홀드아웃 AUROC 0.94에 도달했으며, 온라인 모니터는 부분 추적에서 실패하는 실행을 성공하는 실행보다 순위를 매겨 완료 전에 조기 중단을 유발할 수 있습니다.

결론적으로, 행동 토폴로지는 LLM 자체보다는 배포 하네스에 의해 더 많이 형성되며, 이는 안전 감사 및 런타임 모니터링을 위한 모델에 구애받지 않는 구조적 원시(primitive)를 제공합니다.

AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

다중 에이전트 코딩은 모듈 간 노동 분담, 중복을 통한 견고성, 그리고 다중 파일 프로젝트의 자연스러운 세분화 수준에서의 병렬 탐색을 가능하게 합니다. 실시간 협업 편집 프로토콜은 충돌 없는 복제 데이터 타입(CRDT)을 통해 인간 팀을 위한 조정 문제를 해결하지만, 기반이 되는 LLM이 토큰을 하나씩 생성하기 때문에 기존의 다중 에이전트 코딩 시스템은 순차적 한계에 머무릅니다. 현재 시스템은 에이전트를 단계별로 순차 처리하거나 조정 없이 독립적인 샘플을 모으는 방식으로 작동하며, 단일 에이전트가 한 파일에 대해 절반의 어려운 작업을 포기하는 방식도 존재합니다.

AgentRoom은 동시 코딩 에이전트를 위한 실시간 협업 편집 프로토콜입니다. 이 시스템의 런타임 계층은 CRDT 병합된 공유 파일 시스템 위에서 파일 수준의 주장, 상태, 방송을 MCP 도구로 노출합니다. 이 시스템은 다섯 가지 최첨단 코딩 CLI 모델이 네 가지 백엔드 코딩 작업을 수행하고 Python DevBench 및 Rust+axum에서 교차 언어 검사를 진행하는 실험을 통해 검증되었습니다.

실험 결과, CLI 안정성이 높은 모델에서 AgentRoom은 Solo 모델보다 더 적은 작업을 포기했으며 실행 간 변동성도 더 적었습니다. 또한, 매치드 컴퓨트 환경에서 한 가지 긍정적인 평균 LLM-심사 대비 결과는 AgentRoom이 parallel-merge보다 우수함을 보여주었습니다. 다른 대비 결과인 번들 프로브는 전체 AgentRoom이 각 부분 사례보다 우수함을 나타냈는데, 이는 백분율 분할이 아닌 순서화의 차이로 나타났습니다. 결국 병렬 처리나 CRDT 병합이 아닌 조정이 전체 작업 부하를 담당한다는 결론이 도출되었습니다.

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

대규모 언어 모델(LLM)의 코딩 능력 발전과 함께 사이버 보안 분야에서의 잠재력에 대한 연구가 증가하고 있으며, 특히 폐쇄형 LLM(예: Mythos)이 고급 보안 기능을 제공하고 있습니다. 하지만 현재 오픈소스 노력은 제한적인데, 최첨단 오픈 가중치 모델은 재현 가능한 보안 훈련 솔루션을 제공하지 못하며, 오픈소스 훈련 솔루션은 고립된 작업에 초점을 맞추고 있어 확장 가능한 에이전트 데이터가 부족합니다.

이러한 한계를 극복하기 위해 본 연구는 데이터 구축, 궤적 합성, 모델 훈련을 증명 개념(PoC) 생성, 취약점 패치, 사이버 보안 질문 답변(CyberQA) 전반에 걸쳐 연결하는 통합 오픈소스 프레임워크인 CyberFactory를 소개합니다. CyberFactory는 야생의 CVE와 같은 공개 취약점 산출물을 실행 가능하고 검증 가능한 작업 인스턴스로 변환합니다. 또한 재사용 가능한 취약점 분석 기술을 사용하여 교사를 안내하고 도메인 사전 지식을 바탕으로 문제 해결 및 증거 기반 검증을 수행합니다.

이러한 과정을 통해 모델은 실행 피드백에 따라 도구와 대상 환경과 상호작용하며 해결책을 수정하는 에이전트 기반의 감독을 받습니다. 이 궤적을 사용하여 훈련된 모델인 Aegis를 출시했는데, 이 모델은 추론 시점에 기술 없이도 기술 가이드 절차를 내재화합니다. CyberGym 환경에서 Aegis는 한 시간 예산 내에 52.4%의 Pass@1을 달성했으며, 이는 Qwen~3.5 기반 모델보다 22.8%p 향상된 수치이며 평가된 일반 목적 백본 모델들보다도 우수한 성능을 보였습니다.

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

LLM 에이전트는 장기 과제에서 작은 국소적 실패가 누적되어 전체 작업 실패로 이어지기 때문에 신뢰성이 떨어진다는 문제가 있습니다. 외부 하네스(harness)를 사용하면 견고성을 크게 향상시킬 수 있지만, 하네스 설계는 프롬프트, 도구 구성, 제어 논리 등 광범위한 공간을 탐색해야 하는 수동적이고 비용이 많이 드는 과정입니다.

이에 연구진은 하네스 개선을 오프라인 학습 문제로 공식화하고 미니 배치에서 발생하는 실패 신호를 사용하여 하네스를 반복적으로 업데이트하는 자동 하네스 최적화 프레임워크인 AutoSaddler를 제안합니다. AutoSaddler는 실패 추적 진단, 하네스를 코드로 취급하는 구조화된 패치 생성, 그리고 검증 기반 업데이트 선택을 결합하여 작동합니다.

GAIA2, SWE-Bench Pro, Terminal-Bench 2.0 실험 결과, AutoSaddler는 해당 기본 하네스 대비 각각 9.0%, 9.6%, 10.0%의 성능 향상을 달성했습니다. 추가 분석 결과, 효과적인 하네스 최적화는 얕은 반성보다는 깊은 디버깅, 무제한적인 편집보다는 표적 수정, 그리고 궤적 특정 복구보다는 일반화 인식 선택이라는 세 가지 요소에서 비롯됨을 확인했습니다.

이러한 결과는 자동 하네스 최적화가 보다 성능이 좋고 신뢰할 수 있는 에이전트 시스템을 향한 유망한 경로임을 시사합니다.

The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models

어텐션, 상태 공간, 하이브리드 시퀀스 모델에서 접두사 불변성(prefix invariance)을 공식화합니다. 이는 특정 위치 t에서의 표현이 미래 입력에 의존해서는 안 된다는 것을 의미합니다.

연구진은 학습이나 기울기 없이 두 번의 순방향 패스로 구성된 경량 감사(lightweight audit)를 제공하여 인과관계가 깨지는 지점을 정확히 국소화합니다. 이는 어텐션 마스크 검사가 불완전하며, 올바른 마스크에도 불구하고 스캔이나 정규화 과정에서 누수가 발생할 수 있음을 지적합니다.

192개의 주입 결함 실험을 여덟 개의 체크포인트에서 수행한 결과, 마스크 검사로는 결함을 발견하지 못했지만, 연구진의 감사 방법은 모든 192/192의 결함을 국소화했습니다. 특히 Zamba2와 Nemotron-H에서 결함이 발견되어 모델의 인과성 문제에 대한 새로운 진단 방법을 제시합니다.

The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search

검색 증강 생성(RAG)이 다양한 포트폴리오 생성으로 확장될 때, 증거 활용 측정의 오류와 컨텍스트 예산 할당의 비효율성이 주요 병목으로 작용합니다. 연구진은 이 두 가지 문제를 해결하기 위해 순차적으로 접근했습니다. 먼저, 표준 관련성 프록시가 어려운 부정 사례에서 실패하는 '진단 환상'을 해결하기 위해 생성 의존성을 정확히 분리하고 LLM 주의의 구조적 희석을 공식적으로 보정하는 효율적인 인과적 leave-one-out 탐침을 도입했습니다.

다음으로, 이 인과적 탐침을 디컨포운드 팩토리얼 그리드에 적용하여 컨텍스트 할당 문제를 해결했습니다. 연구 결과, 단일 컨텍스트 확장 전략은 관련성 감소로 인해 패널티를 받는 구조적 함정임을 입증했습니다. 대신, 여러 순차적 생성에 걸쳐 컴퓨팅을 반복적으로 할당하는 것이 32B 모델까지 확장하여 포트폴리오 회상(portfolio recall)에서 16.7~20.5 절대 퍼센트 포인트의 혁신적인 이득을 가져온다고 밝혔습니다.

마지막으로, 이러한 해결책들을 배포 가능한 폐쇄 루프 서브모듈러 스케줄러로 통합했습니다. 여기에 주의 관성을 무시하고 새로운 증거 통합을 체계적으로 강제하는 속성 지향 대조 디코더를 추가하여 LLM 주의를 보강했습니다. 이 방법론은 고전적인 개방 루프 기준선을 압도하며, 생성 검색을 위한 최종 패러다임으로 순차적 피드백 기반 오케스트레이션을 확립합니다.

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

대규모 언어 모델이 복잡한 워크플로우를 실행할 때 성공적인 경험이 단일 실행 후 손실되어 모델이 전략과 실패 모드를 처음부터 재발견해야 하는 문제가 제기되었습니다. 연구진은 이러한 실행 경험을 EvoMap을 통해 외부화하고 재사용할 수 있는지 탐구했으며, 검증된 실행 경로를 구조화된 Gene으로 통합하는 방식을 제안했습니다.

이를 평가하기 위해 코드 생성, 에이전트-환경 합성, 수학적 추론, 규칙 준수 등 778개의 기계 검증 가능 작업을 포함하는 장기 워크플로우 벤치마크인 LongWoF-Bench를 도입했습니다. 검증된 Opus 실행 경로가 있는 252개 작업에서 진화된 EvoMap Gene은 Skill보다 8.7~15.5 퍼센트 포인트 더 나은 성능을 보였으며, 이러한 이점은 다양한 모델 패밀리의 소비자 모델까지 확장되었습니다.

하지만 압축된 표현만으로는 충분하지 않으며 Gene의 유용성은 검증된 경험의 출처와 밀접하게 관련되어 있음을 보여줍니다. Claude Opus의 경우, Gene 재사용은 Skill보다 39개의 작업을 더 완료했으며 해결 시간 토큰 소비를 9.9% 줄이는 효과를 가져왔습니다.

결론적으로, 검증된 실행 경험은 재사용 가능한 외부 자원으로 보존되고 공유될 수 있으며, 모델이 경험 발견에 드는 전체 비용을 반복적으로 지불하지 않고 장기 워크플로우 완료를 개선할 수 있게 합니다.

Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports

산업 기술 보고서는 유지보수, 문제 해결 및 제품 엔지니어링에 필수적인 고가치 지식을 담고 있지만, 이질적인 구조(밀집된 산문, 사양, 표) 때문에 표준 검색 및 질의응답 파이프라인으로 인덱싱하고 추론하기 어렵고, 이러한 문서에서 구축된 공개적인 지시 튜닝 또는 벤치마크 데이터셋은 존재하지 않았습니다. 이 문제를 해결하기 위해 연구진은 산업-지시(Industrial-Instruction) 프레임워크를 개발하여 실제 산업 기술 보고서에서 구축된 두 개의 공개 QA 데이터셋과 이를 생성하는 엔드투엔드 파이프라인을 기여했습니다.

연구진은 906개의 공개된 파나소닉 문서를 사용하여 레이아웃 인식 추출, 의미론적 검색 인덱스 구축, 그리고 검색된 증거에 기반한 다중 선택 QA를 합성했습니다. 이 과정에서 관련성 없는 검색, 단일/다중 문서 지원, 단일/다중 문서 답변 관계를 포함하여 5개 미만의 질의-문서 관계를 기반으로 데이터를 생성했습니다. 초기 생성된 샘플을 필터링한 후, 각 데이터셋은 소스 문서와 약 13.6k개의 QA 쌍과 홀드아웃 벤치마크 분할을 제공합니다.

이 데이터셋을 사용하여 소규모 오픈 LLM(10B 파라미터 미만)을 미세 조정했을 때, 파나소닉 벤치마크에서 Set-Match 정확도는 28.5%에서 42.0%로, F1 점수는 46.6%에서 63.5%로 향상되었습니다. 연구진은 동일한 파이프라인으로 생성된 오픈 가중치 Qwen3-30B-A3B-Instruct 모델과 폐쇄형 API 기반 Claude-Opus-4.6 모델의 두 가지 버전을 공개하여 오픈 모델 데이터와 최첨단 모델 데이터 생성 결과를 직접 비교할 수 있게 했습니다.

Claude-Opus-4.6 데이터셋은 더 깨끗한 원시 코퍼스와 더 큰 미세 조정 이득을 제공하지만, 비용은 약 두 자릿수 차이로 훨씬 높습니다. MMLU 평가 결과, Claude-Opus-4.6으로 훈련된 모델은 일반 지식을 거의 완벽하게 유지하는 반면, Qwen으로 생성된 데이터는 약간의 망각 효과를 보였습니다. 이 결과는 실제 문서를 기반으로 확장 가능한 산업 벤치마크 및 훈련 데이터를 확보하는 실용적이고 재현 가능한 경로를 제시합니다.

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

실제 산업 환경에서의 사용자 표현 학습은 사용자 수, 행동 시퀀스 길이, 모델 크기를 늘려 확장되어 왔습니다. 하지만 기존 방법들은 대규모 데이터 확장 시 성능 향상이 둔화되는 병목 현상을 겪으며, 이는 토큰화를 통해 완화될 수 있습니다. 또한 데이터 규모와 토큰화 구성 간의 관계에 대한 정량적 분석이 부족하다는 한계가 있습니다.

본 보고서는 데이터 규모와 최소한의 충분한 토큰화 용량 사이의 정량적 관계를 특징짓는 사용자 행동 덴싱 법칙(User Behavioral Densing Law)을 제안합니다. 대규모 알리페이 데이터셋에 대한 파일럿 연구를 통해 원시 데이터 확장 시의 병목 현상과 토큰화를 통해 얻을 수 있는 지속적인 이득을 확인했습니다.

이 법칙을 바탕으로 데이터 규모와 최소 토큰화 용량 사이의 스케일링 패턴을 도출했으며, 이는 최소한의 토큰화 용량의 로그 값과 입력 데이터 크기(토큰으로 측정) 사이에 대략 선형 관계가 있음을 보여줍니다. 이 스케일링 기울기는 토큰화 방법과 데이터 소스에 따라 체계적으로 달라지는데, 이는 표현 공간의 중복성과 소스 내 고유성 차이를 반영합니다.

제안된 법칙에 따라, 우리는 용량 할당을 개선하는 적응형 가변 길이 토큰화 방법인 ALGN을 개발했습니다. 다양한 데이터 소스, 토큰화 방법, 다운스트림 작업에 걸친 광범위한 실험 결과, 사용자 행동 덴싱 법칙의 일반성과 신뢰성이 입증되었으며, 이는 대규모 사용자 표현 학습에서 토큰화 구성을 선택하는 데 실질적인 지침을 제공합니다. 또한 ALGN은 기존 기준 모델들보다 우수한 성능을 보였습니다.

RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling

전체 길이의 RNA, 특히 mRNA는 기존 RNA 파운데이션 모델의 학습에 사용되는 컨텍스트 길이보다 길어 단일 뉴클레오타이드 해상도로 완전한 전사체 모델링에 한계가 있었습니다. 이에 연구진은 최대 10,240 nt의 컨텍스트 길이로 네이티브 사전 학습된 16억 파라미터 양방향 RNA 파운데이션 모델인 RIBOSPAN을 제안합니다. RIBOSPAN은 밀집된 양방향 자기 주의(self-attention), 단일 뉴클레오타이드 토큰화, 주의 분리 시퀀스 패킹을 결합하여 긴 RNA의 고해상도 모델링을 가능하게 합니다.

이 모델은 뉴클레오타이드 재구성, 제어된 장 컨텍스트 표현 벤치마크, 고정된 RNA 유형 표현 분석을 통해 평가되었습니다. 네이티브 10K 사전 학습은 10,240 토큰에서 강력한 재구성을 보존하며, 40% 마스킹을 통한 지속적인 사전 학습은 심한 손상 하에서도 표현 품질을 유지하며 복구를 개선합니다. 장 컨텍스트 벤치마크 결과, 네이티브 10K 모델은 강력한 컨텍스트 반응성과 컨텍스트별 표현 분리를 유지하면서 교란으로 인한 표현 변화를 고도로 국소화합니다.

추론 시 YaRN 스케일링은 단축 컨텍스트 모델에서 직접 외삽하여 손실된 컨텍스트 조직의 상당 부분을 회복시키지만, 훨씬 더 먼 표현 확산을 유발합니다. 또한, 고정된 표현 평가 결과 RIBOSPAN은 다양한 RNA 유형에서 최고의 전반적인 성능을 달성하며 긴 RNA에서 명확한 우위를 보입니다. 연구진은 이 기반을 바탕으로 동의 코돈 확산을 포함하는 다차원 조건화된 이산 확산 프레임워크를 개발하여 완전한 mRNA 생성 및 재설계를 위한 강력한 장 컨텍스트 기반을 확립했습니다.

From Generation to Simulation: How Far Are World Models from Being True Simulators?

확산 모델과 대규모 비디오 생성의 발전으로 생성적 월드 모델이 물리 엔진이나 게임 엔진 같은 전통적인 시뮬레이터의 역할을 대체할 것으로 기대됩니다. 하지만 생성에서 시뮬레이션으로의 간극에 대한 체계적인 평가는 부족한 실정입니다.

본 연구는 전통적인 시뮬레이터의 여덟 가지 능력, 즉 자산 구성, 물리 엔진, 상호작용, 제어 가능성, 안정성, 상태 피드백, 다양성, 평가 지표를 기준으로 능력 기반 연구를 수행했습니다. 연구진은 잠재 동역학, 비디오 생성, 조인 임베딩 예측이라는 세 가지 주요 기술 경로를 따라 2018년부터 2026년 6월까지 발표된 200개의 대표적인 연구를 이 능력들에 매핑했습니다.

분석 결과, 월드 모델은 특정 시나리오에서 상호작용과 제어 가능성 측면에서 기능적 대체는 달성했지만, 물리 법칙에 대한 형식적 보장, 구조화된 상태 피드백, 재현 가능한 장기적 진화 측면에서는 전통적인 시뮬레이터에 미치지 못합니다. 특히 상태 피드백은 가장 간과된 교차 경로의 단점으로, 163개의 구현 논문 중 단 6개만이 개체 상태나 물리 매개변수를 쿼리하기 위한 런타임 인터페이스를 노출하고 있습니다.

연구진은 이를 해결하기 위해 형식화된 물리, 통일된 행동 인터페이스, 선급 상태 피드백, 장기적 안정성, 다운스트림 유틸리티 평가, 교차 경로 혼합화라는 여섯 가지 연구 방향을 제시했습니다. 이러한 연구들은 월드 모델이 진정한 시뮬레이터로 나아가기 위한 필수적인 다음 단계가 될 것입니다.

EchoWM: Open and Enterable Omnimodal World Models

EchoWM은 연속적인 내비게이션에 반응하며 720p 비디오, 환경 음향, 음악, 음성 등을 공동으로 생성하는 입체적 세계 모델입니다. 이 모델은 카메라 의도를 중심으로 상호작용을 구성하는데, 1인칭 장면에서는 관찰자의 움직임을 지정하고 3인칭 장면에서는 뷰별 컨트롤러 없이 데이터로부터 카메라와 캐릭터의 역학 관계를 학습합니다.

이 모델은 이산 명령과 연속적인 자세를 공유된 메트릭 규모의 상대 6-DoF 궤적으로 매핑하며, 데이터셋 수준 보정을 통해 이질적인 데이터 간에도 움직임의 크기를 보존합니다. 이는 다양한 피사체에 걸쳐 1인칭 및 3인칭 상호작용을 모두 지원하는 기반이 됩니다.

오디오-비주얼 생성과 궤적 제어를 공동으로 학습하기 위해 보완적인 데이터 엔진을 구축하고 점진적 훈련 후 자기회귀 후처리를 통해 장거리 생성에 적합하게 학습합니다. 광범위한 평가 결과, EchoWM은 공개 세계 모델 벤치마크에서 강력한 궤적 추적과 높은 시각적 품질을 달성했으며, 장거리 생성 동안 환경 음향과 음성을 동기화하는 능력을 보여줍니다.

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

거대 언어 모델(LLM)의 정책 최적화(PO)는 안정성과 탐색 사이의 상충 관계에 직면해 있으며, 이는 현재 행동 측의 Policy-KL 정규화에 의해 완화되고 있습니다. Policy-KL을 유지하면 응답 행동이 제약되고 탐색 예산이 소모되지만, 이를 제거하면 명시적인 드리프트 제어 없이 최적화가 이루어집니다.

이러한 딜레마를 해결하기 위해 정규화를 입력 측으로 이동시키는 대안이 제시되었습니다. 환경 정규화 정책 최적화(ERPO)는 현재 정책이 유도하는 훈련 쿼리 분포의 이동을 제한하는 Query-KL(QKL) 항을 도입합니다. 또한 데이터셋에 고정된 참조에서 파생된 쿼리별 가중치를 사용하여 각 쿼리 업데이트를 참조하의 쿼리에 맞게 편향시킵니다.

QKL 기울기는 쿼리 가능도(query likelihood)를 통해 흐르며, 응답 점수 함수는 QKL 항에 포함되지 않아 응답 분포와 탐색이 보존됩니다. ERPO는 추가적인 순방향 계산 없이 GRPO, PPO, REINFORCE 스타일 파이프라인에 통합될 수 있습니다. 여섯 가지 수학적 추론 벤치마크에서 ERPO는 표준 Policy-KL 정규화를 대체하면서 쿼리 분포 드리프트를 효과적으로 제어하여 더 강력한 정확도와 안정적인 행동을 제공했습니다.

ERPO의 소스 코드는 https://github.com/alibaba/ERPO에서 확인할 수 있습니다.

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

온디바이스 LLM 에이전트가 개인 코파일럿으로 발전함에 따라 모바일 운영체제가 핵심 테스트베너가 되었으며, 이에 대한 엄격한 능력 평가가 필수적입니다. 기존 벤치마크들은 두 가지 유형으로 나뉘는데, GUI 중심 벤치마크는 화면 조작에만 초점을 맞추고 배경 도구 사용과 장기 계획을 간과하며, 정적인 함수 호출 벤치마크는 실제 런타임 제약 조건과 분리된 오프라인 API 매칭에 의존한다는 한계가 있습니다.

이러한 격차를 해소하기 위해 MobilePA-Bench라는 상호작용적이고 상태 기반의 도구 중심 벤치마크가 제시되었습니다. MobilePA-Bench는 실행 가능한 샌드박스 위에서 작동하며 실시간 애플리케이션 데이터베이스를 유지하고 구조화된 피드백을 반환합니다. 이 벤치마크는 13개의 기능 도메인과 212개의 현실적인 모바일 도구를 포괄하며, 중앙 계획 에이전트의 도구 호출 및 계획 능력을 평가합니다.

MobilePA-Bench는 기본적인 도구 사용을 넘어 세 가지 고급 차원에서 에이전트를 평가합니다. 첫째는 하위 에이전트 협업, 둘째는 메모리 사용량, 셋째는 스킬 사용으로, 복잡한 작업을 세분화하고 메모리를 회상하며 사전 패키지된 복합 스킬을 호출하는 능력을 측정합니다.

광범위한 실험 결과는 현재의 최첨단 LLM이 모바일 환경에서 여전히 신뢰할 수 없음을 보여줍니다. 특히 엄격한 도구 순서, 권한 제한, 예상치 못한 런타임 오류가 발생할 경우 성능이 급격히 저하됩니다. 따라서 MobilePA-Bench는 상호작용적인 함수 호출 샌드박스와 증거 기반 검증을 결합하여 에이전트 강화 학습을 위한 실용적인 진단 벤치마크이자 기반을 제공합니다.

One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders

검색 증강 LLM이 실시간 웹 콘텐츠를 통해 소비자 추천을 중개하면서 새로운 위험이 발생했습니다. 생성 엔진 최적화(GEO) 운영자에 의해 오염된 웹 콘텐츠를 LLM이 소비하여 사용자를 오도하는 가짜 제품을 추천할 가능성이 생기는 것입니다. 연구진은 LLM이 얼마나 많은 가짜 제품의 홍보자가 되는지 측정하기 위해 FORGE(Fake Online Recommendations in Generative Environments)라는 벤치마크를 도입했습니다.

FORGE는 검색된 웹 페이지 내의 실제 제품을 가짜 제품으로 국소적으로 재작성하고, LLM이 해당 가짜 제품을 추천하는 빈도를 측정합니다. 12개의 상업용 및 오픈 가중치 LLM 모델 모두 취약점을 보였는데, 단 하나의 오염된 페이지만으로도 최대 27%의 오도율이 발생했으며, 상위 3개 제품을 모두 대체했을 경우 이 수치는 73.8%까지 증가했습니다. 이러한 취약성은 모델이 제품에 대한 안정적인 사전 지식을 갖지 못할 때 더 커지며, 추론(Reasoning) 기능은 오도된 추천을 정당화하기 위해 허위의 사회적 증거를 생성할 뿐 위험을 완화하지 못합니다.

현재 제시된 네 가지 방어책 모두 충분하지 않습니다. 회의론 프롬프트(skepticism prompt)는 추론만큼 취약점을 악화시키고, 합의 필터(consensus filters)는 정당한 제품을 억제할 위험이 있으며, 신뢰도 재순위 지정(credibility re-ranking)은 모든 모델에 도움이 되지만 가짜 제품의 6분의 1만 제거합니다. 연구진은 FORGE 벤치마크와 평가 코드를 https://github.com/leoluolol/forge-benchmark에서 공개했습니다.

Better Retrieval, Worse Robustness:How Multi-hop RAG Amplifies Upstream ASR Errors

음성 기반 애플리케이션에서 자동 음성 인식(ASR) 오류가 검색 모듈에 들어가기 전 고정된 상류 제약 조건으로 작용합니다. 본 연구는 표준 검색 증강 생성(RAG)에 두 가지 확장 기능인 엔티티 그래프 연결(entity-graph linking)과 반복적 재구성(iterative reformulation)이 이러한 ASR 오류를 흡수하는지 증폭하는지를 실증적으로 테스트했습니다.

연구진은 신경 TTS를 사용하여 네 가지 영어 악센트를 생성하고 세 가지 멀티홉 QA 벤치마크(HotpotQA, 2WikiMultiHopQA, MuSiQue)에서 네 가지 RAG 구성을 깨끗한 텍스트 오라클과 비교했습니다. 구조적으로 풍부한 구성이 ASR 입력 하에서 더 높은 절대 F1 점수를 유지했지만, 두 확장 기능의 조합은 오류를 증폭시키는 것으로 나타났습니다. 깨끗한 텍스트와 최고 WER 악센트 간의 F1 격차는 단순한 밀집 검색(naive dense retrieval)보다 36~67% 더 커졌습니다.

주요 실패 모드는 쿼리 엔티티의 손상으로 밝혀졌으며, 이는 모든 네 가지 방법에서 2WikiMultiHopQA에서 87~96%의 저하 사례를 차지했습니다. 이는 다운스트림 검색 구조가 남아있는 엔티티 오류를 증폭시킨다는 것을 시사합니다. 경량의 표면 형식 완화 기법은 이러한 격차를 대부분 유지하여, 검색 구조가 엔티티 오류를 증폭시키는 핵심 원인임을 보여줍니다.

연구팀은 관련 코드와 데이터를 https://github.com/ZhenghuaBao/spoken-multihop-rag 에서 공개했습니다.

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

LLM 하네스 최적화에 있어 새로운 접근 방식인 Task-CoEvolve를 통해 효율성을 높이는 방법이 제시되었습니다. 하네스 최적화는 모델 가중치를 업데이트하지 않고도 검증 성능에 따라 하네스 코드를 반복적으로 재작성하여 상당한 성능 향상을 가능하게 합니다. 하지만 기존 방법들은 하네스가 진화함에 따라 덜 구별력이 있는 작업에 대해서도 매 반복마다 고정된 검증 세트를 전체적으로 평가하여 상당한 평가 비용을 발생시킵니다.

Task-CoEvolve는 이러한 문제를 해결하기 위해 검증 작업과 하네스를 공동으로 진화시키는 방법을 제안합니다. 이는 정보가 풍부한 작업을 선택하고 부분 평가로부터 전체 세트 성능을 추정하는 두 가지 과제를 해결합니다. 이 방법은 후보 하네스들이 의견이 다른 작업이 일관되게 해결되거나 실패한 작업보다 구별하는 데 더 유용하다는 관찰에 기반합니다.

Task-CoEvolve는 과거 결과를 기반으로 분산 가중 샘플링을 사용하여 평가를 능력 경계선 근처의 작업에 집중시키며, 샘플링 확률을 고려하여 전체 세트 점수를 추정함으로써 반복 간 일관된 비교를 가능하게 합니다. 온라인 텍스트 분류 및 Terminal-Bench 2.1 실험 결과, Task-CoEvolve는 부분 세트 기반 기준보다 일관되게 우수한 성능을 보였으며, 최적화 중 평가 횟수를 80% 줄이면서 전체 세트 탐색의 최종 성능과 일치시켰습니다. 코드는 https://github.com/Agent4Science-UTokyo/Task-CoEvolve에서 공개되었습니다.

Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA

검색 증강 질의응답(RAG) 시스템은 모델 식별자, 프롬프트, 검색 정책, 증거 깊이 등 설정이 고정되어 있음에도 인덱스 확장을 통해 다른 답변을 반환할 수 있다는 사실이 밝혀졌습니다. 이러한 변화는 정확도 변화가 상쇄될 경우 전체 정확도에서는 숨겨질 수 있으며, 일반적인 생성 변동성은 단일 시점 비교에서 업데이트 효과를 과장할 수 있습니다.

연구진은 이러한 숨겨진 현상을 정확도에 무관한 답변 변동성(accuracy-blind answer churn)이라고 명명하고, 동일 시점 반복 불일치와 교차 시점 불일치를 차감하여 과도한 답변 변동성을 추정하는 Snapshot Compatibility Audit를 제안했습니다. 이 실험은 FineWeb 접두사를 1개에서 7개 샤드로 확장하는 방식으로 진행되었습니다.

400개 질문의 Natural Questions 연구에서 정규화된 정확도 및 블라인드 의미론적 과도한 변동성은 각각 6.44%와 10.25% 포인트였으나, 정확 일치 정확도는 단지 -1.50 포인트만 변화했습니다. 추가 분석 결과, 400개 질문 중 40개에서 반복 안정적인 의미론적 전환이 발견되었으며, TriviaQA 연구에서는 더 작고 방향성이 일관된 과도한 변동성이 나타났습니다.

결과적으로, 답변 수준의 호환성은 눈에 띄거나 일관된 유틸리티 변화 없이도 실패할 수 있습니다. 따라서 검색 증강 관련 릴리스는 유틸리티와 함께 호환성을 감사해야 합니다.

Apodex 1.1: Scaling Agentic Intelligence for Complex Work

Apodex 1.1은 복잡한 작업을 위한 지속적이고 검증 가능한 진전을 가능하게 하는 에이전트 지능을 확장하는 연구를 제시합니다. 이는 단순히 지식을 추론하는 것을 넘어 파일, 정보 출처, 실행 가능한 코드를 지속적으로 상호작용하고 상태를 유지하며 실패를 복구하고 결과를 검증하여 실제 목표를 향해 나아가는 '작업 수행 능력(working capability)'을 개발하는 데 중점을 둡니다.

이러한 작업 수행 능력을 개발하기 위해 Apodex 1.1은 두 가지 상호 보완적인 차원을 통해 확장합니다. 환경 확장(Environment Scaling)은 실행 파일, 검색, 코드 환경의 다양성과 검증 가능성을 넓히는 데 중점을 두며, 에이전트 조정 확장(Agentic Coordination Scaling)은 에이전트가 장기 목표를 분해하고, 병렬 작업을 위임하며, 비동기 결과를 통합하고, 계획을 재수립하도록 훈련시킵니다.

이러한 시스템은 공유 실행 하네스(execution harness)와 AgentOS를 통해 도구와 에이전트 전반에 걸쳐 작업 상태와 출처를 유지합니다. 훈련 과정은 환경 궤적과 조정 흔적을 신뢰할 수 있는 행동으로 전환시켜 에이전트의 행동을 안정화시킵니다.

Apodex 1.1은 이러한 접근 방식을 통해 복잡한 전문 작업, 금융, 과학 연구, 코딩, 검색 등 광범위한 분야에서 최첨단 모델보다 훨씬 작은 모델을 사용함에도 불구하고 선도적인 성능을 달성했습니다. 특히 35B 매개변수를 가진 Apodex 1.1 Mini는 강력한 작업 수행 능력을 유지하며 로컬 배포가 가능하여, 장기 실행 작업에 대한 '중량 솔버(Heavy-Duty Solver)' 구축이라는 목표를 발전시키는 데 기여합니다.

IPFS Maintainers Winding Down

Protocol Labs가 Shipyard에 대한 자금 지원을 갱신하지 않기로 결정함에 따라 Shipyard는 IPFS 관련 엔지니어링, 유지보수 및 인프라 운영을 종료하게 되었습니다. Shipyard의 IPFS 관련 작업은 2026년 9월 30일을 마지막으로 마무리될 예정입니다.

이 결정으로 Shipyard가 관리하던 ipfs.io, dweb.link, check.ipfs.network 등 공개 인프라 운영이 중단되며, Kubo, Helia, Boxo와 같은 Shipyard가 유지보수하던 프로젝트들은 새로운 기능 수정이나 장기적인 관리를 담당할 전담 유지보수자를 잃게 됩니다. 또한 go-libp2p 및 js-libp2p와 같은 상위 프로젝트에 대한 기여도 중단이 발생합니다.

이는 IPFS 생태계의 기반 인프라와 핵심 구현체에 대한 개발자들의 접근성과 지속적인 관리에 영향을 미칩니다. Shipyard는 9월 말까지 전환을 돕기 위해 지원을 계속할 것이며, 관련 작업에 대해 궁금한 점이나 도움이 필요한 경우 연락할 수 있습니다.

Shipyard는 IPFS 생태계가 다음 단계로 나아갈 수 있도록 기반을 마련하는 데 집중하며, 개발자들은 향후 IPFS 관련 인프라와 프로젝트의 미래 방향을 Protocol Labs의 결정에 따라 주시해야 합니다.