EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

고해상도 이미지 편집에 대한 요구가 증가하고 있지만, 기존 확산 기반 모델들은 이차 어텐션 복잡성과 막대한 메모리 요구 사항으로 인해 1K 이하 해상도에 국한되어 있습니다. 현재 사용되는 해결책은 저해상도에서 편집한 후 독립적으로 초해상도를 수행하는 2단계 파이프라인을 사용하지만, 이 방식은 환각된 세부 정보가 원본 고해상도(HR) 소스와 모순되는 정보 분산과 과도하게 부드럽거나 선명해진 인공물로 나타나는 질감 저하라는 두 가지 심각한 문제를 안고 있습니다.

이에 연구진은 효율적인 초고해상도 편집을 위한 확산 브릿지 프레임워크인 EditBridge를 제안합니다. EditBridge는 노이즈에서 재생성하는 기존 확산 방식과 달리, 저해상도(LR) 편집 결과에서 고해상도(HR) 대응물로의 구조화된 데이터-투-데이터 변환으로 정제를 공식화하며, 원본 HR 소스를 명시적으로 조건화하여 실제 세부 정보를 보존합니다.

효율적인 HR 소스 가이드를 통합하기 위해, EditBridge는 첫 번째 단계 편집에서 얻은 의미론적 일치를 활용하여 교차 이미지 상호작용을 공간적으로 정렬된 영역으로 제한하는 사전 가이드 블록별 희소 어텐션 메커니즘을 도입하여 계산 오버헤드를 크게 줄입니다.

실험 결과, EditBridge는 최대 4K 해상도에서 높은 충실도와 우수한 지각적 품질을 달성했으며, 2K 해상도에서 3.6배에서 8.4배의 속도 향상을 제공하고 61초 만에 실용적인 4K 편집을 가능하게 했습니다.

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

비전 인코더는 비전-언어 모델의 핵심 구성 요소이지만, 용량을 효과적으로 확장하는 것은 컴퓨팅 비용과 추론 지연 시간을 증가시킵니다. 이에 대안으로 Mixture-of-Experts(MoE) 아키텍처가 제시되었으나, CLIP 스타일 비전 인코더에 대한 MoE 설계 공간은 아직 최신 기술 수준에서 충분히 탐구되지 않았습니다.

본 연구는 비전 인코더 확장을 위한 MoE 설계를 체계적으로 연구하여, 미세한 MoE 토폴로지가 밀집된 구조나 표준 MoE보다 상당한 성능 향상을 가져온다는 것을 발견했습니다. 또한, 전문가 활용도를 높이기 위한 보조 손실 없는 균형 조정 변형과 추론 지연 시간을 완화하기 위한 특수 MoE 커널을 제안했습니다.

나아가 이미지 지식을 보존하면서 비디오 능력을 향상시키기 위해 프레임 수준 증류(frame-level distillation)와 새로운 동결 메커니즘을 도입했습니다. 이 연구를 통해 사전 학습된 Mixture-of-Experts Vision Encoder(MoE-ViE) 모델들은 밀집된 모델들을 일관되게 능가하며, 가장 큰 모델은 크기의 1.7배에 해당하는 최신 인코더와 동일한 제로샷 성능을 76%의 지연 시간으로 달성했습니다.

MoE-ViE는 LLM과 정렬되었을 때 이미지 및 비디오 벤치마크에서 비교된 모든 인코더를 능가하며, 최대 5배 더 활성화된 파라미터를 가진 모델들까지도 뛰어난 성능을 보였습니다. 관련 코드는 GitHub에서 공개되어 있습니다.

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

인스트럭션 기반 비디오 편집 데이터셋의 품질과 다양성이 개선되고 있지만, 기존 데이터셋은 단일 편집 작업에 주로 초점을 맞추고 있어 구성적 인스트럭션 기반 비디오 편집을 지원하는 데는 한계가 있습니다. 특히 하나의 비디오 내에서 여러 편집 의도를 공동으로 이해하고 충실하게 실행해야 하는 요구사항이 있습니다.

이러한 문제를 해결하기 위해 대규모 고품질 데이터셋인 CoinVE-200K가 소개되었습니다. CoinVE-200K는 최대 201프레임의 1080p 비디오 편집 쌍을 포함하며, 각 샘플은 2에서 5개의 원자적 편집 작업을 포함하는 다양한 구성 시나리오를 다룹니다. 이 데이터셋은 인간, 객체, 배경을 대상으로 하며 추가, 제거, 수정, 스타일화와 같은 편집 유형을 포함하고 있습니다. 모든 샘플은 인스트럭션 충실도, 시각적 품질, 시간적 일관성, 구성적 다양성을 보장하기 위해 신중하게 설계된 생성 및 필터링 파이프라인을 통해 구축되었습니다.

또한, 다양한 주제, 작업 유형, 인스트럭션 복잡성을 아우르는 구성적 인스트럭션 비디오 편집을 위한 벤치마크인 CoinVE-Bench도 함께 제시되었습니다. 이와 더불어, Wan2.1-T2V-14B와 Qwen3-VL-8B-Instruct를 기반으로 구축된 220억 개의 파라미터를 가진 CoinVE-Edit 모델이 소개되었습니다. CoinVE-Edit은 다양한 편집 인스트럭션에 대해 영역 인식 주의(region-aware attention)를 분리하여, 관련 없는 콘텐츠와 시간적 일관성을 보존하면서 정밀한 다중 영역 편집을 가능하게 합니다. CoinVE-Bench 실험 결과는 CoinVE-Edit이 인스트럭션 준수, 구성적 편집 정확도, 시각적 품질, 시간적 일관성에서 강력한 성능을 달성했음을 보여줍니다.

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

대규모 언어 모델이 도구, 확장 기능, 지속적인 상태, 권한 및 외부 행동을 관리하는 에이전트 하네스(agent harnesses)를 통해 점점 더 많이 배포됨에 따라 안전성 평가의 필요성이 커지고 있습니다. 기존의 안전 벤치마크는 개별 공격 메커니즘이나 제한된 운영 설정에 초점을 맞추고 있어, 다양한 하네스 책임 전반에 걸쳐 안전 실패가 어떻게 발생하는지 비교하기 어렵다는 한계가 있었습니다.

이에 연구진은 에이전트 하네스 안전성을 여섯 가지 운영 단계, 즉 하네스 구성(Harness Configuration), 기능 확장(Capability Extension), 런타임 운영(Runtime Operation), 상태 지속성(State Persistence), 행동 제어(Action Control), 그리고 사고 복구(Incident Recovery)로 조직하는 생애주기 기반 벤치마크인 HarnessRisk를 제시했습니다. 이 벤치마크는 악의적인 지침이 포함된 워크플로우 아티팩트에 128개의 샌드박스 사례를 포함하며, 유용성(Utility), 공격 성공률(Attack Success Rate), 지속성(Persistence), 탐지(Detection)를 사용하여 각 경로를 평가합니다.

평가 결과, 공격 성공률은 12.6%에서 80.9%까지 나타났으며, 유용성은 75.0%에서 97.6% 사이를 유지했습니다. 특히 하네스 구성 단계가 세 가지 하네스 전반에서 가장 취약한 것으로 나타났는데, 이는 승인된 워크플로우 내의 보안 민감한 매개변수를 변경함으로써 공격이 성공할 수 있음을 보여줍니다. 또한, 명시적인 위험 인식이 안전한 행동으로 이어지지 않는다는 점도 발견되었습니다. 일부 구성은 실행의 90% 이상에서 위험을 탐지함에도 불구하고 상당한 공격 성공률을 유지하여, 에이전트 안전성을 배포된 모델과 하네스 구성 수준에서 다각도로 평가해야 할 필요성을 강조합니다.

Agent Lightning v1.0: Towards Harnessed Agentic RL

현대 에이전트는 도구, 컨텍스트, 흐름을 관리하는 에이전트 하네스(agent harness) 내에서 작동하며, 이 하네스는 에이전트 시스템의 핵심 요소입니다. Agent Lightning은 임의의 에이전트를 LLM 엔드포인트 프록시를 통해 RL 훈련에 연결하는 분리된 아키텍처를 도입했으며, 이는 verl Uni-Agent, AReaL 2.0 등 여러 프레임워크에서 채택되었습니다. 이러한 접근 방식을 포착하여 Harnessed Agentic RL이라는 패러다임을 제시했는데, 이는 배포 시점의 하네스가 모델 후 훈련에 직접 참여하는 방식입니다.

전통적인 에이전트 RL과 달리 Harnessed Agentic RL은 훈련 엔진이 아닌 하네스가 환경 상호작용 루프를 소유하고, 훈련자는 오직 LLM 요청-응답 쌍의 시퀀스만을 관찰합니다. 이러한 구조는 리토큰화, 샘플 병합, 이점 계산, 손실 정규화, 백엔드 스케줄링과 같은 여러 문제들을 야기하며 훈련의 안정성과 효과에 중대한 영향을 미칩니다.

이러한 도전 과제를 연구하기 위해 Agent Lightning v1.0을 발표했는데, 이는 약 3,500줄의 코드로 구현된 경량 프레임워크로 임의의 에이전트 하네스를 지원하며 실질적인 테스트베드를 제공합니다. 이 프레임워크는 지시 따르기, 검색, 코딩 에이전트를 평가하며 코딩 에이전트 RL에 대한 완전한 재현 가능한 파이프라인을 제공합니다.

6K개의 훈련 예제와 적절한 컴퓨팅 자원만을 사용하여 RL을 적용한 결과, Qwen3.5-9B 모델은 SWE-bench Verified 점수가 41.8%에서 56.4%로 향상되어 14.6점의 절대적인 이득을 얻었습니다. 연구의 재현성을 촉진하기 위해 전체 워크플로우와 훈련 스크립트를 공개하여 Harnessed Agentic RL에 대한 연구를 용이하게 합니다.

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

대규모 비전-언어 모델(VLM)은 전신 내비게이션 분야에서 상당한 발전을 이루었으나, 기존 방법들은 VLM을 부자연스러운 행동 공간으로 강제하고 경직된 추론 일정과 비효율적인 메모리 관리로 인해 직접적인 배포에 어려움이 있었습니다. 이러한 한계를 극복하기 위해 효율적인 전신 내비게이션을 위한 통합 프레임워크인 TAMP-Nav를 제안합니다.

TAMP-Nav는 세 가지 핵심 구성 요소를 통해 문제를 해결합니다. 첫째, 내비게이션을 2D 시각 프롬프팅으로 재구성하는 픽셀-투-3D 행동 공식화(Point)를 도입하여, VLM이 2D 픽셀을 선택하고 이를 3D 좌표로 투영하여 저수준 SLAM 컨트롤러에 전달함으로써 VLM의 내재된 2D 시각 능력과 실행을 자연스럽게 일치시킵니다. 둘째, 선택적 추론 및 앵커-궤적 메모리(Think and Memorize) 메커니즘을 통합하여, 중요한 노드에서만 체인-오브-사고(Chain-of-Thought)를 동적으로 촉발하고 중복 궤적을 경량의 공간-시간 지표(Space-Time Indicators)로 압축하여 중요한 역사적 정보를 보존합니다.

마지막으로, 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 통한 효율적인 두 단계 정렬 패러다임(Align)을 설계했습니다. 이는 전역 결과 보상과 세밀한 프로세스 보상을 중첩하여 모델의 인지 계획을 물리적 환경 피드백과 긴밀하게 정렬함으로써 적응적인 추론 능력을 부여합니다. 실험 결과 TAMP-Nav는 높은 런타임과 샘플 효율성(단 90k 훈련 궤적 요구)을 유지하면서 최고 수준의 성능(예: R2R-CE에서 66.2% SR)을 달성했습니다.

aDSL: Agentic 3D Creation via Joint Agent-Program Design

3D 콘텐츠 제작에서 프로그래밍 표현은 세밀한 편집, 해석 가능성, 명시적인 구조 제어를 가능하게 하는 강력한 패러다임입니다. 하지만 대규모 언어 모델(LLM)에 의존하는 에이전트 워크플로우는 종종 높은 수준의 의도를 일관된 저수준 기하학으로 번역하는 데 실패하여 취약한 문제가 발생합니다. 이러한 취약성은 기존 프로그래밍 인터페이스와 LLM의 추론 강점 사이의 불일치에서 기인하는데, LLM은 취약한 숫자 선택보다 의미론적 구조와 공간 관계를 선호하기 때문입니다.

이러한 격차를 해소하기 위해 본 논문에서는 에이전트 중심의 도메인 특화 언어(aDSL)와 역할 특화 멀티 에이전트 시스템을 공동으로 설계합니다. aDSL은 결합성과 공간 추론을 강조함으로써 의미론적 논리와 기하학적 제약을 연결하며, 에이전트가 취약한 절대 좌표 대신 관계 연산자를 통해 기하학을 조작할 수 있게 합니다.

aDSL을 기반으로, 연구진은 실행 피드백을 사용하여 요청을 분해하고 코드를 합성하며 실행 피드백을 통해 오류와 제약 조건 위반을 반복적으로 수정하는 계획-실행-비평(Plan-Execute-Critic) 루프를 따르는 학습 불필요 멀티 에이전트 시스템을 구축했습니다. 실험 결과, 이러한 공동 설계는 견고성, 제어 가능성, 사용자 의도에 대한 충실도를 개선했습니다.

이 방법은 텍스트-투-셰이프 및 이미지-투-셰이프 작업에서 기존 LLM 기반 기준 모델보다 우수한 성능을 보였으며, 명시적인 구조, 편집 가능성, 해석 가능성을 보존합니다. 또한 이 방법은 관절형 객체 생성 및 구조화된 장면 구성과 같은 다운스트림 애플리케이션을 가능하게 합니다. 관련 코드는 https://github.com/sig-pku/aDSL에서 확인할 수 있습니다.

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

최근 대규모 언어 모델(LLM)과 에이전트의 발전은 AI 시스템이 복잡한 작업을 수행하는 능력을 크게 향상시켰습니다. 하지만 기존 벤치마크들은 연구자가 선정한 작업에 주로 의존하여 실제 사용자들이 AI 시스템에게 요구하는 작업 범위까지 발전이 확장되었는지에 대해서는 불확실성이 존재합니다.

이러한 한계를 극복하기 위해 우리는 시장에서 검증된 AI 스타트업 제품에 기반한 E2E 에이전트 벤치마크인 StartupBench를 소개합니다. 이 벤치마크는 유용한 에이전트 능력에 대한 사전 가정 대신, 실제 채택된 AI 제품, 그 워크플로우, 그리고 사용자들을 체계적으로 연구하여 다양한 전문 분야에서 AI가 실질적인 수요를 갖는 실제 작업을 식별합니다.

StartupBench는 이러한 워크플로우를 완전한 결과물 지향적 작업으로 변환하고 복잡한 요구 사항을 포착하는 세밀한 기준을 사용하여 평가합니다. 하지만 대표적인 모델들을 통합된 에이전트 하네스 아래에서 평가했을 때, 가장 강력한 모델조차도 StartupBench 작업의 약 30%만을 성공적으로 완료했습니다.

분석 결과, 복잡한 지시 사항을 따르는 능력과 특정 도메인 전문성이 실패의 주요 원인으로 밝혀졌습니다. 이는 많은 시장에서 검증된 워크플로우가 현재의 범용 에이전트의 신뢰할 수 있는 능력을 넘어선다는 것을 보여줍니다. 따라서 StartupBench는 실제 사용자 작업의 E2E 완료에 대한 진전을 측정하는 경험적 척도로 자리매김합니다.

Abra: Scaling Diffusion Image Training

텍스트-이미지 확산 모델에 대한 계산 최적화 스케일링 법칙 연구가 제시되었습니다. 연구진은 Abra라는 제어된 흐름 일치 트랜스포머(flow-matching transformers)를 사용하여 $10^{19}$에서 $10^{22}$ FLOPs에 이르는 세 가지 규모의 컴퓨팅 자원으로 훈련을 진행했습니다. 이 연구는 확산 모델이 언어 모델과 마찬가지로 예측 가능하게 스케일링된다는 것을 보여주지만, 최적의 훈련을 위해서는 훨씬 더 많은 데이터가 필요함을 입증합니다.

계산 최적성은 파라미터당 약 200 이미지 토큰에서 달성되며, 이는 LLM에 대한 Chinchilla의 계산 최적화 제안보다 10배 더 많은 데이터 요구량을 의미합니다. 또한 확산 모델은 언어 모델과 달리 과훈련에 강하다는 점이 밝혀졌으므로, 실무자들은 더 큰 모델보다는 더 많은 데이터를 확보하는 방향으로 접근해야 합니다.

이러한 예측 가능성은 훈련 손실을 넘어 생성 품질 지표, 최적의 CFG 설정, 표현 품질, 심지어 훈련 곡선의 형태까지 보편적인 형태로 수렴한다는 것을 보여줍니다. 이는 확산 모델 훈련 과정 전반에 걸쳐 계산 효율성과 결과의 예측 가능성을 제공합니다.

ASI-Bench: At the Dawn of Artificial Superintelligence

인공초지능(ASI)은 기존 지식을 숙달하는 것을 넘어 미지의 영역을 탐색하고 새로운 지식을 창출하며 새로운 아이디어를 검증 가능한 결과로 전환하는 능력을 요구합니다. 하지만 현재의 AI 시스템 능력은 주로 기존 인간 지식을 학습하고 압축하며 적용하는 것에 기반하고 있습니다. 따라서 기존 벤치마크들은 AI가 학습된 지식을 바탕으로 정확한 답을 도출하거나 광범위한 인간의 지도 하에 작업을 완료할 수 있는지 여부를 주로 테스트해왔습니다.

이에 연구진은 혁신적인 탐색과 자율적인 과학적 실행 능력을 공동으로 평가하는 최초의 벤치마크인 ASI-Bench를 소개합니다. 이 벤치마크는 연구 프로젝트 내에서 인간의 방법론적 지도를 점진적으로 철회하여 AI가 스스로 얼마나 멀리 나아갈 수 있는지 테스트하는 데 중점을 둡니다. ASI-Bench는 40여 명의 전문가와 31,000시간 이상의 인력 비용으로 구축되었으며 11가지 과학 분야에 걸친 60개의 프로젝트 수준 연구 과제를 포함하고 있습니다.

이 벤치마크는 에이전트가 스스로 방법을 결정하고 연구를 수행하며 검증 가능한 결과를 도출할 수 있는지 평가합니다. 18가지 최첨단 에이전트-모델 구성에서, 방법론적 지도가 완전히 제공될 때 평균 점수는 50.91점에서 방법만 지정될 때 29.10점, 그리고 에이전트가 스스로 방법을 결정해야 할 때 26.62점으로 급격히 하락했습니다. 이러한 점수 하락은 현재 시스템이 여전히 인간의 지도에 크게 의존하며 종단 간 프로젝트 수준의 과학적 연구를 자율적으로 수행하는 데는 미치지 못함을 보여줍니다.

ASI-Bench는 전 세계 연구자와 개발자들을 위해 공개되어 있으며, 새로운 과제를 기여하고 오늘날 AI의 한계를 시험하며 인공초지능으로 향하는 인류의 집단적인 경로를 가속화하는 데 기여하도록 초대하고 있습니다.

Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection

DeepSeek Harness(DSH)에 대한 간접 프롬프트 주입 공격에 대한 보안 평가 연구 결과가 발표되었습니다. 연구진은 AI-Infra-Guard(A.I.G)를 사용하여 테스트 환경을 구축하고 통제된 오염(taint)을 전달하여 DSH를 실행하고 결과를 평가했습니다. 이 실험은 16개의 간접 콘텐츠 채널과 35개의 페이로드 목표에 걸쳐 총 14,560회의 통제된 실행을 포함하며, DSH의 에이전트 루프 및 도구 레지스트리 등 핵심 구조는 보존되었습니다.

평가 과정에서는 결정론적 규칙 기반 심판기(RuleJudge)와 의미론적 LLM 기반 심판기(LLMJudge)를 사용하여 각 실행 결과를 평가했습니다. 공격 성공률 측면에서 텍스트 모드에서 가짜 완료 공격(fake-completion attack)은 17.0%로 가장 높았으며, 파일 모드에서 숨겨진 유니코드(hidden Unicode) 공격은 25.5%로 가장 높은 성공률을 보였습니다. 또한 파일 모드에서 스킬 채널(skills channel)을 이용한 공격 성공률은 16.0%로 나타났습니다.

이러한 결과는 DSH가 도구 결과, 추가 컨텍스트, 도구 호출 정책 후크를 처리하는 방식과 관련하여 보안 통제를 식별하는 데 사용되었습니다. 연구는 신뢰할 수 없는 콘텐츠와 민감한 행동 사이에 어떤 제어 메커니즘이 위치해야 하는지를 밝혀냈습니다. 해당 연구 코드는 GitHub에서 공개되어 있습니다.

GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation

대규모 잠재 공간 생성에 있어 GS-Voxel이라는 새로운 구조화된 잠재 프레임워크가 제시되었습니다. 이는 구조화된 텐서를 사용하는 대부분의 잠재 3D 생성 모델과 달리, 사전 최적화된 3D Gaussian Splatting(3DGS) 재구성 데이터가 무질서하고 공간적으로 불규칙하며 다수의 기본 요소(primitive) 수에 따라 크게 달라진다는 문제를 해결하고자 합니다.

GS-Voxel은 피팅 프리(fitting-free) 구조화된 잠재 프레임워크로, 호환되는 사전 최적화된 3DGS 재구성을 추가적인 장면별 최적화 없이 희소 활성 복셀(sparse active voxels)로 결정적으로 변환합니다. 이 과정에서 선택된 기본 요소들의 서브 복셀 위치와 렌더링 속성을 보존합니다.

이후 GS-특화 분해된 VAE는 복셀 기하학과 국소 가우시안 속성을 별도로 인코딩하여 희소 3D 잠재 공간을 생성합니다. 이 잠재 공간의 크기는 고정된 장면 전체의 기본 요소 수에 의해 제한되는 것이 아니라 점유된 복셀의 수에 따라 증가합니다.

연구진은 이 GS-Voxel 잠재 공간에서 이미지 조건부 흐름 모델을 훈련하여 공중 3DGS 장면을 생성합니다. 특히 오버랩 인식 타일 추론(overlap-aware tiled inference)을 통해 GS-Voxel이 대면적 장면 생성에 활용될 수 있으며, 이는 단일 훈련 영역을 조건으로 하는 합성의 한계를 넘어섭니다. 결과적으로 GS-Voxel은 점유된 복셀 수에 따라 잠재 용량이 증가하는 사전 최적화된 공중 3DGS 재구성을 위한 구조화된 잠재를 제공함을 입증했습니다.

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

장기 에이전트 추론 환경에서 강화 학습(RL)은 분기된 상호작용과 희소한 보상 문제로 인해 여러 한계를 드러냅니다. 특히, 무거운 역전파 기반 훈련 스택은 대규모 LLM을 미세 조정하는 것을 비실용적으로 만들며, 긴 궤적은 RL에서 보상 귀인(credit assignment)을 상당히 어렵게 만듭니다. 이에 본 논문은 진화 전략(ES)이 장기 LLM 에이전트 미세 조정에 더 나은 선택이 될 수 있다고 주장합니다.

에이전트 RL과 비교했을 때 ES는 세 가지 주요 이점을 제공합니다. 첫째, 모델 확장성으로 최소한의 추론 수준 GPU 메모리만을 사용하여 전체 파라미터 최적화를 가능하게 하여 대규모 LLM을 미세 조정할 수 있습니다. 둘째, 경량의 블랙박스 피드백 인터페이스 덕분에 프롬프트 공간 진화와 미세 조정을 쉽게 결합할 수 있습니다. 셋째, 장기 확장성으로 보상을 시간 축을 따라 분해하지 않고 궤적 수준의 파라미터 귀인을 수행하여 에이전트의 길이(horizon)가 증가할수록 Agentic RL보다 더 나은 확장성을 제공합니다.

이러한 통찰을 바탕으로 본 연구는 유연한 파라미터-컨텍스트 공동 진화를 위해 맞춤화된 전체 파라미터 에이전트 미세 조정 프레임워크인 Agentic ESOpt를 제안합니다. Agentic ESOpt는 각 단계에서 현재 LLM 파라미터 주변의 교란을 샘플링하고, 결과 에이전트를 보상으로 평가하며, 온라인 보상 가중치 업데이트를 적용합니다. 또한 탐색-적응 트레이드오프를 개선하기 위해 교란 규모 $\sigma$에 코사인 감쇠 스케줄을 추가로 도입합니다.

실제 실험 결과, WebArena-Lite 환경에서 Qwen-3.5-27B의 전체 파라미터 최적화는 No Skill 기준 성능을 6.69% 향상시켰습니다. 또한, 테스트 시간 자동 휴리스틱 설계에서는 온라인 프롬프트-파라미터 공동 진화를 통해 36가지 설정 중 28가지에서 일치 기준 성능을 개선했습니다.

Babies born under sugar rationing grew into adults with lower cancer risk

설탕 배급제 하에 태어난 아기들이 성인이 되어 암 발생 위험이 낮고 생물학적 노화 속도가 느리다는 연구 결과가 발표되었습니다. 이 연구는 제2차 세계대전 이후 영국에서 시행된 설탕 배급제 기간 동안 태어난 64,000명 이상의 데이터를 분석했으며, 특히 출생 후 첫 1,000일 동안의 설탕 노출이 장기적인 건강에 영향을 미친다는 것을 확인했습니다.

연구 결과에 따르면, 초기 설탕 배급제를 경험한 사람들은 향후 몇십 년 동안 여러 종류의 암 발생률이 낮았으며, 특히 간암 발생률은 약 69% 낮았고 유방암 발생률은 36% 낮았습니다. 또한, 생물학적 노화 지표인 텔로미어 길이가 더 길었고, 면역 체계의 과부하를 나타내는 단백질인 그란자임 B 수치가 낮아 세포 수준에서 더 느린 노화가 관찰되었습니다.

더 놀라운 점은 초기 설탕 노출이 성인기까지 지속되어 식습관에 영향을 미쳤다는 사실입니다. 설탕 배급제를 일찍 경험한 사람들은 성인이 되어서도 더 적은 설탕을 섭취했으며, 전반적으로 더 건강하고 다양한 식단을 유지했습니다. 이러한 초기 경험은 생물학적 메커니즘과 행동적 선호도라는 두 가지 경로를 통해 장기적인 건강 결과를 형성하는 것으로 보입니다.

이러한 역사적 증거는 설탕 배급제가 바람직한 정책을 의미하지는 않지만, 초기 발달기에 경험한 환경적 요인이 수십 년 후의 신체 건강과 선호도에까지 영향을 미칠 수 있음을 시사합니다. 또한, 설탕 배급제가 끝난 후 연구들은 제2형 당뇨병, 고혈압, 치매, 알츠하이머병, 심장병 및 뇌졸중의 위험도 감소와도 관련이 있음을 보여줍니다.

My friends all hate AI; I just joined an AI startup

AI에 대한 대중의 반감과 기술의 과장된 주장에 지친 저자가 AI 분야로 복귀하여 교육에서의 AI 활용에 집중하고 있습니다. AI가 글쓰기, 독해, 비판적 사고 등 인간의 핵심 능력을 저하시키고 있으며, AI 기업들이 자원 무한성을 주장하는 것은 현실과 괴리되어 있다는 점이 주요 우려 사항입니다.

저자는 AI 개발에 대한 열정을 되찾고 인간의 창의성과 자율성을 보호하는 방향으로 AI를 사용하고자 합니다. 이를 위해 그는 Answer.AI에 합류하여 SolveIt과 같은 도구를 개발하고 있으며, 이는 AI를 오류 가능성이 있는 존재로 간주하고 인간이 직접 결과를 편집하고 다음 단계를 결정하도록 설계되었습니다.

SolveIt은 문제 해결 과정을 이해하고 계획을 세우며 실행하는 과정을 통해 인간의 판단과 숙고를 강조하며, 단순히 '도움이 되는' 챗봇이 아닌 비판적 사고를 촉진하는 방식으로 작동합니다. 이는 AI 기술이 단순히 자동화를 넘어 인간의 협업과 자율성을 중심으로 발전해야 한다는 관점을 반영합니다.

결론적으로 AI는 단일한 실체가 아니며, 기술의 발전 방향과 윤리적 프레임워크는 소수의 거대 기업이 아닌 다양한 주체들이 참여하여 결정해야 합니다. 이러한 접근 방식은 AI가 인간의 능력과 자율성을 침해하지 않고 긍정적인 방향으로 사용될 수 있는 길을 모색합니다.

Cursor Origin

Cursor Origin은 Cursor가 제공하는 코드 저장 및 공유를 위한 Git 포지(git forge)로, 현재 초기 베타 단계로 출시되었습니다. 이 기능을 통해 사용자는 Origin에서 저장소 생성, GitHub 저장소 미러링, Git을 사용한 푸시 및 풀 작업, 풀 리퀘스트 검토 및 병합, 그리고 팀원들과 코드 공유를 할 수 있습니다.

베타 단계에서 Origin을 사용하면 코드 저장소 외에도 코드베이스를 브라우저에서 탐색하고 검색할 수 있으며, 저장소 설정 및 코드베이스 설정을 관리할 수 있습니다. 또한 Vercel, Depot, Buildkite와 같은 외부 앱을 저장소 설정에서 연결하거나 자동화 및 클라우드 에이전트를 Origin 저장소에 연결하는 것도 가능합니다.

Origin에 대한 접근 권한은 Pro, Teams, Enterprise 플랜 사용자에게만 제공되며 무료 플랜에서는 사용할 수 없습니다. 저장소의 개인 정보 보호는 해당 저장소의 소유자, 즉 팀이나 개인이 설정한 개인 정보 보호 모드를 따르며, 팀은 접근을 위해 코드베이스 이름을 먼저 주장해야 합니다.

관리자는 대시보드를 통해 팀의 Origin 사용을 비활성화할 수 있으며, 팀이 레거시 개인 정보 보호 모드를 사용하는 경우 접근을 위해 개인 정보 보호 모드를 전환해야 합니다. 저장소 목록에서는 Origin에 호스팅된 저장소와 GitHub에서 동기화된 저장소를 구분하여 볼 수 있습니다.

Anthropic’s annualized revenue surges to $65B

Anthropic의 연간 매출이 650억 달러를 돌파하며 성장세를 가속화하고 있습니다. 블룸버그에 따르면, 이 모델 제작사의 연간 매출 추정치(run rate)는 7월 말에 650억 달러를 넘어섰으며, 이는 5월의 470억 달러와 작년 말의 90억 달러에서 크게 증가한 수치입니다.

경쟁사인 OpenAI 역시 매출을 두 배로 늘려 400억 달러를 기록하며 AI 분야의 경쟁이 치열해지고 있습니다. 투자자들은 양사의 성장이 비슷한 속도로 계속될 것으로 예상하며, Anthropic이 2026년 말에는 1,000억 달러에서 1,200억 달러 사이의 가치를 기록할 것으로 전망합니다.

Anthropic은 OpenAI보다 앞서 상장할 것으로 예상되며, 2조 달러 이상의 공모 가치를 목표로 하고 있어 역사상 가장 큰 시장 데뷔를 기록할 가능성이 있습니다. 이는 AI 기업들이 향후 시장에서 어떤 가치와 평가를 받게 될지에 대한 중요한 맥락을 제공합니다.

Reddit’s AI is turning posts into podcasts and short videos

레딧이 텍스트 게시물을 오디오 및 비디오 콘텐츠로 변환하는 새로운 실험을 진행하고 있습니다. 이 실험의 일환으로 일부 게시물은 AI 목소리를 사용하여 본문과 댓글의 텍스트를 읽는 비디오로 제작됩니다. 이 비디오는 AI 음성으로 읽히는 텍스트를 강조하며, 해당 콘텐츠가 "AI가 음성으로 표현한 실제 대화"임을 명시하고 있습니다.

이러한 실험은 커뮤니티 콘텐츠 소비 방식을 변화시키려는 시도입니다. 예를 들어, 8년 전 r/boardgames에서 진행된 101개의 답변이 달린 게시물이 AI를 통해 영상화된 사례가 있습니다. 기존의 텍스트 스레드 대신, 이 게시물은 질문을 상단에 두고 3분 분량의 비디오 형식으로 제공됩니다.

이는 텍스트 기반 커뮤니티 콘텐츠를 시각적이고 청각적인 형태로 변환하여 접근성을 높이려는 시도로 해석됩니다. 개발자 관점에서 볼 때, 텍스트 데이터를 AI 음성 및 비디오 포맷으로 변환하는 기술적 구현과 사용자 경험(UX) 설계 측면에서 흥미로운 사례를 제공합니다.

Repair Cafe – Fix Your Broken Items

전 세계적으로 진행되는 리페어 카페는 사람들이 고장 난 물건들을 함께 수리하고 고치는 것을 목표로 하는 국제적인 운동입니다. 이 활동은 유럽, 미국, 영국뿐만 아니라 인도와 일본 등 전 세계 수많은 국가에서 활발하게 이루어지고 있으며, 지역 사회 기반의 자원봉사 활동을 통해 진행됩니다.

리페어 카페는 커피 기계, 노트북, 가구, 자전거 등 다양한 물건들의 수리를 중심으로 진행되며, 연간 150만 명 이상의 방문객을 끌어들이며 큰 인기를 얻고 있습니다. 이러한 활동은 단순한 수리를 넘어 기술 공유와 커뮤니티 구축을 통해 지속 가능한 소비 문화를 장려하는 데 기여하고 있습니다.

국제적인 리페어 카페 운동은 리눅스 리페어 카페와 같은 기술 중심의 활동을 포함하며, 인공지능(AI)이 이러한 수리 커뮤니티에 어떤 영향을 미칠지에 대한 논의도 활발하게 이루어지고 있습니다. 리페어 카페는 지역 사회 내에서 기술 지식을 공유하고 DIY 정신을 함양하는 중요한 플랫폼으로 기능하고 있습니다.

California's new tire efficiency rules could save drivers $1B a year

캘리포니아주가 타이어 효율성 기준을 새롭게 도입하여 운전자들이 연간 10억 달러를 절약할 수 있게 되었다. 이 새로운 규정은 교체되는 타이어가 주 내에서 판매되는 순정 타이어와 최소한 동등한 에너지 효율을 갖도록 보장하는 것을 목표로 한다.

이 조치는 단순히 비용 절감에 그치지 않고 환경에도 긍정적인 영향을 미친다. 캘리포니아주는 이 변화를 통해 연간 2백만 톤의 이산화탄소 배출을 줄일 수 있으며, 이는 약 40만 대의 차량을 도로에서 제거하는 것과 동일한 효과를 가져온다. 또한 차량의 주행 거리를 연장하여 연료 효율성을 높이는 데 기여한다.

규정은 2029년부터 가장 비효율적인 타이어에 대해 적용되며, 2033년부터는 더욱 엄격한 기준이 시행될 예정이다. 다만, 일부 제조업체와 환경 정책 전문가들은 이 일정과 일부 면제 조치에 대해 우려를 표하고 있으며, 일부 주들이 캘리포니아의 사례를 따라 유사한 조치를 고려하고 있다.

타이어의 구름 저항을 줄이는 것은 기술적으로 가능하며, 이는 실리카 함량 증가 등을 통해 효율성과 접지력을 동시에 개선할 수 있다. 이 규제는 자동차 산업 내에서 타이어 효율성에 대한 논쟁을 촉발하며, 일부 기업들은 효율성 목표에 동의하고 있다.