Falstad Math and Physics Simulations

Falstad에서 제공하는 이 자료는 수학, 물리학, 공학 개념을 시각화하기 위한 교육용 앱릿 모음입니다. 이 시뮬레이션들은 파동, 진동, 전자기학, 양자 역학, 열역학 등 광범위한 주제를 다루며, 리플 탱크, 도플러 효과, 가우스 법칙, 수소 원자 오비탈 등 구체적인 물리 현상을 체험할 수 있도록 설계되었습니다.

앱릿들은 원래 자바(Java)로 작성되었으나 대부분 자바가 지원되지 않는 브라우저에서도 볼 수 있도록 자바스크립트로 변환되어 제공됩니다. 이는 복잡한 수학적 및 물리적 관계를 코드로 구현하고 시각화하는 방법에 대한 흥미로운 사례를 제공합니다.

시뮬레이션의 범위는 벡터 미적분학, 선형 대수학, 열역학, 중력, 회전 운동, 그리고 신호 처리와 같은 다양한 분야를 포괄합니다. 개발자들은 이러한 예시를 통해 복잡한 물리 방정식을 알고리즘으로 구현하고 사용자 인터페이스에 적용하는 데 영감을 얻을 수 있습니다.

Targeted marine cloud brightening weakens subsequent El Niño

해양 구름 밝히기(Marine Cloud Brightening) 기술이 이후의 엘니뇨 현상을 약화시킨다는 연구 결과가 발표되었습니다. 이 연구는 해양 구름 밝히기 기법이 대기 시스템에 미치는 영향을 분석하여 기후 변화 관련 현상에 대한 새로운 이해를 제공합니다.

해양 구름 밝히기 기술은 구름의 광학적 특성을 조절하여 태양 복사 에너지의 흡수 및 반사에 영향을 미치는 것을 목표로 합니다. 연구에 따르면 이러한 해양 구름 밝히기 조치가 엘니뇨와 같은 대규모 기후 현상의 발생 및 강도에 영향을 미칠 수 있음을 시사합니다.

이는 해양 환경 조작이 지구 전체의 기후 시스템에 미치는 복잡한 상호작용을 이해하는 데 중요한 단서를 제공합니다. 다만, 이 연구 결과가 실제 기후 예측 모델에 어떻게 적용될 수 있는지에 대한 추가적인 맥락과 장기적인 영향에 대해서는 더 깊은 분석이 필요합니다.

Government sponsored study on alcohol doesn't stand up to scrutiny: Nassim Taleb

나심 탈레브는 정부가 의뢰한 알코올 소비와 건강에 관한 연구가 통계적 검증을 통과하지 못했다고 지적합니다. 이 연구는 낮은 수준의 알코올 섭취에 건강에 대한 보호 효과가 없으며, 주당 14잔 섭취 시 사망 위험이 25분의 1에 달한다는 결론을 내렸습니다.

탈레브는 해당 연구의 핵심 결과와 통계적 방법론에 심각한 결함이 있다고 주장합니다. 특히 연구에서 사용된 신뢰 구간(CI)이 비대칭적이며, 로그정규분포나 몬테카를로(MC) 계산 방식에 대한 설명이 부족하여 의심스럽다고 지적합니다. 또한, 연구에서 제시된 총 위험 계산 방식과 연령대별 표준 오차의 불균형 등 방법론 자체가 미흡하며 통계적으로 이상하다는 것입니다.

더 나아가, 연구 결과는 특정 연령대, 특히 가장 확률적이고 취약한 집단에 의해 지배되고 있어 결론의 신뢰성이 떨어진다고 분석합니다. 따라서 수십 년간의 알코올 섭취 권고를 뒤엎는 주장을 뒷받침하기 위해서는 통계적 기반이 충분히 문서화되지 않았으며, 결론은 확정적이지 않다는 것입니다.

ProofRun – a local verification receipt for AI coding agents

AI 코딩 에이전트가 테스트 통과를 주장할 때 실제 코드가 변경되었는지 검증하는 문제를 해결하기 위해 ProofRun이라는 로컬 검증 영수증 시스템이 개발되었습니다. 이 시스템은 AI의 주장이 실제 코드 상태를 반영하는지 암호학적으로 증명하여, 에이전트가 단순히 추측하는 것이 아니라 실제 실행 결과를 기반으로 신뢰할 수 있는 결과를 제공합니다.

ProofRun은 코드의 정확한 상태를 Git 커밋 정보와 커밋되지 않은 파일의 해시값을 결합한 지문(fingerprint)에 묶어 모든 검사 결과를 기록합니다. 따라서 코드의 단 하나의 바이트가 변경되면 해당 검사 결과는 자동으로 STALE(오래됨) 상태로 표시되어, 에이전트나 인간이 수동으로 확인하지 않아도 변경 사항을 즉시 감지할 수 있습니다.

이 기술은 AI를 신뢰하는 대신 실제 실행 결과를 확인하는 방식으로 작동하며, 네트워크 호출이나 텔레메트리 없이 완전히 오프라인으로 작동합니다. GitHub Actions와 통합하여 CI/CD 파이프라인에서 ProofRun 상태를 기반으로 코드 병합을 통제할 수 있으며, 이는 코드 품질을 보장하는 데 중요한 역할을 합니다.

다만, 현재 ProofRun은 코드 변경으로 인해 `.proofrun.yml` 파일 자체가 약화되는 것을 완전히 방지하지는 못하며, 변경 사항에 대해 경고만 제공하고 차단하지는 않습니다. 향후에는 pytest, Jest 등 일반적인 테스트 러너에 대한 구조화된 출력 지원을 목표로 로드맵을 진행하고 있습니다.

Polaroid’s tiny instant camera is $72 and includes a free pack of film

아마존에서 폴라로이드 고(Polaroid Go) 2세대 인스턴트 카메라와 필름 팩을 묶어 $71.99에 판매하고 있습니다. 이는 일반적으로 $109.99에 판매되는 제품보다 저렴하며, 필름 팩 단독 가격($21.99)보다도 4달러가 저렴한 가격으로, 해당 번들 상품에 대해 지금까지 본 가장 낮은 가격입니다.

이 새로운 폴라로이드 고 카메라는 더 컴팩트한 크기로 제작되어 여행이나 모험 시 휴대하기에 용이합니다. 클래식 폴라로이드 사진 크기(88mm x 107mm)보다 작은 53.9mm x 66.6mm의 필름을 사용하며, 이는 게시판에 붙이거나 지갑에 보관하기 좋은 크기입니다.

카메라는 USB-C 포트를 통해 충전되며, 배터리는 필름 15팩까지 사용할 수 있어 사용 편의성이 높습니다. 이 제품은 스마트폰 카메라가 제공하지 못하는 아날로그 인스턴트 사진의 매력을 다시 경험하고 싶은 사용자들에게 매력적인 선택이 될 것입니다.

Patterns and problems in emerging multi-agent systems

멀티 에이전트 시스템에서 발생하는 패턴과 문제점을 연구한 결과, 에이전트 간의 실제 상호작용이 증가함에 따라 규모가 커질 때의 불확실성이 매우 크다는 점이 밝혀졌습니다. 현재의 시스템은 인간의 속도에 맞춰 감독되도록 설계되어 있어, 에이전트 간의 상호작용이 잘 이루어질 조건을 이해하기 전에 이러한 상호작용이 성공적으로 진행될지에 대한 불확실성이 존재합니다.

에이전트들은 인간과 달리 방대한 정보를 즉시 파악하고 장기간 작업할 수 있지만, 환각이나 보상 해킹과 같은 문제에 취약하며 복잡한 환경에서 어떻게 행동하는지에 대해서는 아직 충분히 알지 못합니다. 이러한 개별적인 행동 특성들이 합쳐져 원치 않는 전역적 결과로 이어질 수 있어, 에이전트 간의 조정(coordination) 능력을 확보하는 것이 중요합니다.

에이전트들이 도구 사용을 넘어 서로를 목표와 행동을 가진 동등한 동료로 인식하고 협력하도록 만드는 것이 핵심 과제입니다. 소프트웨어 취약점 탐지 같은 작업에서 에이전트들이 독립적으로 작업하는 방식과 조정하는 군집(swarms) 방식의 효율성을 비교한 실험 결과, 조정하는 군집 방식이 독립적인 에이전트 방식보다 훨씬 많은 취약점을 발견했습니다.

이는 에이전트 간의 상호작용이 잘 이루어질 조건이 개발 단계에서 의도적으로 설정되거나, 혹은 실제 운영 환경에서 에이전트 간의 상호작용이 우리보다 훨씬 많아질 때 발견될 것임을 시사합니다. 따라서 에이전트 시스템의 안전성과 효율성을 높이기 위해 새로운 조정 솔루션이 필요하다는 증거를 제공합니다.

Why your local LLM feels dumber than it is

로컬 LLM이 실제 성능보다 둔하게 느껴지는 현상은 구현상의 위험 때문에 발생합니다. 이는 모델의 가중치와 동일하더라도 사용자가 사용하는 하드웨어, 소프트웨어, 그리고 추론 과정에서 발생하는 구현별 차이 때문에 발생합니다. 예를 들어, 서로 다른 명령어 세트를 가진 GPU는 동일한 가중치를 실행할 때 수학 연산을 다르게 수행하여 결과에 차이를 만듭니다.

따라서 단순히 표준 벤치마크만으로는 시스템의 실제 성능을 측정하기 어렵습니다. 에이전트 작업이나 장문 컨텍스트 기반의 도구 호출과 같은 실제 사용 사례를 평가해야 하며, 모델의 로그잇(logits) 분포와 기준선 간의 차이를 측정하는 KL 발산(KLD)을 고려해야 합니다. 다만 KLD가 낮다고 해서 모델이 자동으로 더 똑똑해진다고 해석해서는 안 되며, 측정 방법론과 참조 체크포인트에 대한 정보가 명확해야만 수치를 해석할 수 있습니다.

추론 엔진에 사용되는 소프트웨어 스택, 예를 들어 vLLM과 같은 라이브러리 내부의 설정이나 구성 요소들이 이러한 성능 편차를 유발합니다. 이는 단순한 가중치 변경이 아닌, 운영 명령이나 코드 실행 과정에서 발생하는 미묘한 오류나 동작 변화로 나타날 수 있습니다. 결론적으로 중요한 작업에는 작은 모델을 사용하지 않도록 주의해야 합니다.

Show HN: Mic Drop, a real-time multiplayer karaoke game

실시간 멀티플레이어 노래방 게임인 마이크 드롭(Mic Drop)이 공개되었다는 소식입니다. 이 게임은 사용자들이 실시간으로 함께 노래를 부를 수 있는 멀티플레이어 노래방 경험을 제공하는 것을 목표로 합니다.

마이크 드롭은 실시간 상호작용을 기반으로 하여 여러 사용자가 동시에 참여하여 노래를 즐길 수 있도록 설계되었습니다. 이는 단순히 노래를 듣는 것을 넘어, 게임적인 요소를 결합하여 사용자 간의 소통과 재미를 극대화하는 데 중점을 둡니다.

개발자 커뮤니티에서 공개된 이 프로젝트는 실시간 통신과 멀티플레이어 환경 구축에 대한 흥미로운 구현 사례를 제공할 수 있습니다. 해당 게임의 기술적 구현 방식과 실시간 동기화 메커니즘에 대한 상세 정보는 공식 웹사이트를 통해 확인할 수 있습니다.

Show HN: I built a native app for coding agents with Rust and GPUI

코딩 에이전트를 위한 네이티브 애플리케이션인 Waku가 출시되었습니다. Waku는 기존에 사용하던 에이전트 CLI의 세션, 스크립트, 도구 활동, 체크포인트 등의 모든 정보를 하나의 빠른 그래피트 창에서 로컬 머신에서 관리할 수 있게 합니다.

Waku는 Rust와 GPUI를 기반으로 개발되어 GPU 가속 프레임워크인 Zed의 기반이 되는 기술을 사용합니다. 이는 Electron 기반의 앱과 달리 인스턴트 실행과 부드러운 스크롤링을 제공하며, 모든 에이전트의 타임라인을 통합하여 관리합니다.

이 앱의 핵심은 모든 에이전트가 스트림-json, JSON-RPC 등의 네이티브 인터페이스를 통해 연결되며, 모든 정보가 사용자 기기에 저장되는 로컬 아키텍처를 채택했다는 점입니다. 사용자는 숨겨진 git 참조를 통해 코드와 제공자 대화를 함께 되돌릴 수 있으며, 마우스 없이 키보드만으로 모든 제어를 수행할 수 있습니다.

Waku는 계정, 원격 측정, 클라우드 없이 모든 프로젝트, 세션, 트랜스크립트 정보를 로컬 디스크에 보관하며, Sparkle을 통해 서명되고 자동 업데이트되는 방식으로 유지됩니다.

ChatGPT lost 22 points of web share in a year

ChatGPT가 지난 1년간 웹 공유 점수를 22점 잃었다는 분석이 나왔습니다. 이는 전 세계 AI 챗봇 웹 방문 점수에서 ChatGPT가 76%에서 54%로 감소한 반면, Gemini는 6%에서 28%로, Claude는 1%에서 9%로 증가했다는 비교 결과입니다. 이 수치는 월간 사용자 수나 수익이 아닌 웹 방문 공유 비율을 나타내며, 2026년 5월 기준으로 측정된 데이터입니다.

이러한 변화는 AI 사용자들이 웹 인터페이스를 넘어 애플리케이션 내에서 AI를 사용하는 경향이 강해지고 있음을 보여줍니다. 특히 Gemini의 경우, 10억 사용자 월간 활성 사용자(MAU)가 웹 공유 점수 28%를 유지할 수 있는 이유는 많은 사용이 앱 내 또는 안드로이드 환경에서 이루어지기 때문입니다. 이는 AI 서비스의 사용 패턴이 웹 기반에서 모바일 앱 기반으로 이동하고 있음을 시사합니다.

해당 데이터는 Similarweb과 Momentic을 기반으로 하며, 2026년 8월 12일 기준으로 가장 최근의 비교 가능한 데이터입니다. 따라서 이 수치는 AI 서비스의 시장 점유율 변화를 이해하는 데 중요한 맥락을 제공합니다. 이 분석은 AI 시스템의 시장 연구와 잠재적 변화를 이해하는 데 도움이 되는 echohive의 브리핑입니다.

The complete AI SEO playbook: from zero to 4.6M impressions in 3 months

AI를 활용하여 검색 엔진 최적화(SEO)를 자동화하고 3개월 만에 460만 회 이상의 노출을 달성한 방법론과 시스템에 대한 내용입니다. 이 플레이북은 AI 에이전트 오케스트레이션, 구글 서치 콘솔(GSC) 피드백 루프, 품질 게이트, 빌드 비용 통제 등 실제 콘텐츠 엔진을 구축하는 데 필요한 방법론과 스크립트, 안전장치를 담고 있습니다.

이 시스템은 구글 검색 콘솔 데이터를 기반으로 주간 보고서, 제목 재작성 후보, 키워드 격차 분석 등을 수행하는 자동화된 피드백 루프를 핵심으로 작동합니다. AI 에이전트가 이 데이터를 분석하여 콘텐츠를 개선하고 품질 게이트를 통과하도록 하여, 반복적인 개선을 통해 순위를 향상시키는 구조입니다.

구체적으로 14가지 진단 스크립트와 9가지 검증된 구성(안전장치, 에이전트 조정, 품질 게이트 등)을 사용하여 콘텐츠의 품질을 보장하며, Git 기반의 안전장치와 CI 자동화를 통해 빌드 비용을 관리합니다. 이는 단순히 프롬프트를 사용하는 것을 넘어, 실제 검색 엔진의 요구사항을 반영하여 콘텐츠를 생성하고 관리하는 운영 체제 역할을 합니다.

이 방법론은 AI 모델(Opus, Fable, Haiku 등)을 계획, 작성, 작업에 분리하여 사용하고, 콘텐츠 감사, 출처 검증, 구조화된 데이터 유효성 검사 등의 품질 시스템을 통합하여 최종적으로 460만 회 노출을 달성하는 데 기여했습니다.

Graph 엔지니어링 vs Loop 엔지니어링: 실제로 달라진 것은 무엇인가

그래프 엔지니어링과 루프 엔지니어링은 경쟁 관계가 아니며, 서로 다른 목적을 가지고 있습니다. 그래프 엔지니어링은 완전히 새로운 개념이라기보다는 여러 에이전트 루프(Agent Loop)를 하나의 작업 흐름으로 연결하는 오케스트레이션에 가깝습니다. 이는 병렬 실행, 검증, 작업 인계, 공유 상태, 중단 조건 등을 명시적으로 구성하여 복잡한 작업 흐름을 관리하는 방식입니다.

반면 루프는 하나의 목표를 달성하는 데 초점을 맞춥니다. 따라서 두 개념은 상호 보완적인 관계를 가지며, 루프가 개별적인 목표 수행에 집중한다면 그래프 엔지니어링은 이러한 루프들을 통합하여 전체 시스템의 흐름을 관리하는 데 중점을 둡니다.

결론적으로, 개발자들이 복잡한 에이전트 시스템을 구축할 때 루프를 사용하여 개별 작업을 수행하고, 그래프 엔지니어링을 사용하여 이 루프들을 연결하고 관리하는 방식으로 접근할 수 있습니다. 이러한 구분을 이해하는 것은 에이전트 기반 워크플로우를 설계하고 구현하는 데 있어 효율적인 구조를 만드는 데 중요합니다.

Big Pickle on SWE Atlas – Codebase QnA

OpenCode Zen의 스텔스 모델인 big-pickle이 Scale AI의 SWE Atlas 코드베이스 QnA 벤치마크에서 50.8%의 점수를 기록하며 주목받고 있습니다. 이 결과는 mini-swe-agent 스캐폴드를 사용하여 평가되었으며, 공식 SWE Atlas 리더보드에 있는 다른 모델들보다 모든 항목에서 우위를 점했으며 Codex 기반 모델들 중에서도 최고 성능을 보였습니다.

big-pickle은 전체 124개의 코드베이스 QnA 작업을 평가했으며, 특히 TypeScript(58.1%)와 Python(55.2%)과 같은 언어별 해결률에서 높은 성능을 보였습니다. 코드 온보딩(60.7%)이나 아키텍처 및 시스템 설계(52.3%)와 같은 카테고리에서도 경쟁 모델들을 능가하는 결과를 달성했습니다.

이 점수는 Scale AI의 프로토콜을 최대한 준수하여 평가되었지만, 몇 가지 중요한 맥락을 고려해야 합니다. 평가 과정에서 발생한 기술적 문제와 설정상의 복잡성으로 인해 일부 실행이 실패하거나 재시도되었으며, 최종 점수는 이 모든 과정을 거친 후 산출되었습니다. 따라서 이 수치를 해석할 때는 평가 환경과 제약 조건을 염두에 두어야 합니다.

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

비전-언어-행동(VLA) 모델은 구조화된 환경에서 복잡하고 장기적인 작업을 수행하는 일반화된 임베디드 에이전트의 주요 패러다임이 되었지만, 효과적인 아키텍처 설계, 더 크고 이질적인 데이터 영역으로의 확장, 그리고 작업과 신체에 걸친 광범위한 일반화를 달성할 수 있는지에 대한 질문이 남아 있습니다. 이러한 문제를 해결하기 위해 GigaBrain-0.7은 다양한 로봇 신체에 걸친 일반화 능력이 크게 향상된 임베디드 파운데이션 모델을 제시합니다.

GigaBrain-0.7은 세 가지 시스템 아키텍처를 통해 이해, 예측, 행동을 통합하며, 37,000시간 이상의 이질적인 임베디드 데이터로 사전 학습을 확장했습니다. 또한 비전-언어 이해와 다중 신체 행동 생성을 동시에 최적화하는 단일 단계 정렬 학습을 도입하여 모델의 성능을 개선했습니다. 이는 이전 GigaBrain-0 시리즈와 $\pi_{0.5}$을 포함한 기존의 최첨단 모델 대비 파운데이션 제로샷 능력, 언어 조건부 지시 따르기, 그리고 훈련 후 작업 성공률에서 상당한 향상을 달성했습니다.

특히 이 모델은 자체 Maker H01 플랫폼과 주류 로봇 신체에서 가정 및 산업 시나리오 모두에서 강력한 작업 적응성과 완료 능력을 보여줍니다. 개발자들을 위해 모든 훈련 코드와 사전 학습된 모델 가중치가 공개될 예정입니다.

The Creation of Abulafia

1988년 움베르토 에코의 『추의 시계』에서 언급된 내용을 바탕으로, 프로그래밍과 해석의 관계에 대한 흥미로운 논의가 담겨 있습니다. 이 글은 13세기 카발리스트의 이름을 딴 개인 컴퓨터 '아불라피아(Abulafia)'라는 프로그램이 어떻게 무작위로 텍스트를 생성하고, 그 결과가 어떻게 의미를 획득하는지에 대한 과정을 탐구합니다.

이 논의는 단순한 BASIC 프로그램과 대규모 언어 모델(LLM)의 차이를 비교하며, 기계가 단순히 텍스트를 섞는 것(shuffler)을 넘어 어떻게 이론과 맥락을 기억하고 발전시키는지에 초점을 맞춥니다. LLM은 입력된 조각들을 바탕으로 패턴을 설명하고, 대화 과정에서 사용자의 어휘를 습득하여 논리적인 구조를 구축하는 능력을 보여줍니다.

특히, 모델의 출력물이 사실이 아니더라도 그 증거적 가치(evidential value)가 중요하며, 해석 과정에서 인간이 부여하는 의미가 핵심임을 강조합니다. 이는 우리가 기계의 결과물을 단순히 수용하는 것이 아니라, 그 결과물을 검증하고 연결하는 주체로서의 역할을 강조하는 것입니다.

결론적으로, 복잡한 이론을 다루는 과정에서 인간의 해석과 기계의 연산이 어떻게 상호작용하며 의미를 만들어내는지에 대한 통찰을 제공합니다. 이는 AI가 단순한 계산 도구를 넘어 지식과 맥락을 다루는 방식으로 발전할 때, 그 신뢰성과 독립성에 대해 우리가 어떤 관점을 가져야 하는지에 대한 중요한 질문을 던집니다.

TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity

TinyCast는 주기성을 계산하는 것을 학습하는 것보다 중요하다고 전제하여 146,505개의 파라미터로 예측 분포를 출력하는 어텐션 프리(attention-free) 제로샷 예측 모델을 소개합니다. 이 모델은 제로 파라미터 스펙트럼 검출기를 사용하여 지배적인 주기를 제공하고, 컨텍스트를 해당 위상에 따라 접어 넣은 다음, 확장된 컨볼루션 인코더와 블록 자기회귀 분위수 디코더를 사용하여 나머지 부분을 모델링합니다.

TinyCast는 GIFT-Eval 보드 상의 다른 제로샷 항목들보다 파라미터 수가 적으며, 확률적 정확도 측면에서 크기-정확도 경계를 정의합니다. 특히 테스트 데이터 누수가 없다고 선언하는 제로샷 항목 중 140만 파라미터 미만에서 예측 분포를 출력하는 유일한 모델이며, 더 나은 점수를 받은 모든 항목은 최소한 그 예산 이상을 필요로 합니다.

이 모델의 혼합 경로는 컨볼루션과 행렬 곱셈으로만 이루어져 있어 정적 INT8로 내보내며, 개별 신호 적합 없이 임베디드 장치에서 종단 간 예측을 수행할 수 있습니다. 이는 TinyCast가 엣지 디바이스 환경에서 효율적으로 작동할 수 있게 하며, 각 신호에 대한 개별 적합 과정이 필요 없다는 점에서 큰 이점을 제공합니다.

LLMs Get Smarter from Targeted Synthetic Multilingual Data

언어별 역량(LSC)은 언어 모델이 프롬프트 언어에 따라 성능이 달라지는 현상을 의미하며, 이는 동일한 의미의 질문에도 다른 언어로 요청할 경우 모델이 다르게 응답하거나 부정확한 결과를 내놓는 문제를 야기합니다. 기존 연구에서는 이 문제를 해결하기 위해 영어로 모든 질의를 라우팅하거나 언어 균형 데이터로 학습하는 두 가지 접근 방식이 제시되었으나, 각각 성능이나 표현력에 제약을 발생시켰습니다.

본 연구는 데이터 중심적 관점에서 HOTFIXR(Hardness Optimized Training data For Improving X-Lingual Reasoning)이라는 데이터 생성 프레임워크를 소개합니다. HOTFIXR은 모델을 사용하여 학생 모델의 다국어 약점을 탐색하고 학습한 뒤, 이를 완화하는 데이터를 생성하여 다국어 성능을 개선합니다. 이 프레임워크는 다국어 성능을 향상시키는 합성 학습 데이터를 생성할 수 있습니다.

실제 평가 결과, HOTFIXR은 세 가지 분포 내 성능을 평균 6.2% 향상시켰으며, 미세 조정으로 인해 발생하는 OOD(Out-of-Distribution) 작업에서의 파국적 망각(catastrophic forgetting)을 3.7% 감소시켰습니다. 또한, OOD 언어에서의 성능은 7.1% 향상되어 다국어 LLM을 실제 애플리케이션에 적용하는 데 기여합니다.

이 연구는 다국어 LLM을 만드는 노력에 기여하며, 많은 실제 애플리케이션이 다국어 능력을 요구하는 상황에서 모델의 다국어 숙련도를 높이는 데 중요한 방법론을 제시합니다. 연구팀은 승인 시 코드를 공개할 예정입니다.

Bounded Agents: Delegation Security for Multi-Agent AI Systems

LLM 기반 에이전트는 사용자를 대신하여 클라우드 서비스에 접근하거나 도구를 호출하는 등 광범위한 작업을 수행할 수 있어 보안 취약점을 야기할 수 있습니다. 에이전트가 권한 내에서 작업을 수행할 때, 이전 행동을 고려하지 않고 각 요청을 독립적으로 평가하기 때문에 권한 구조 자체가 문제의 원인입니다.

이러한 문제를 해결하기 위해 에이전트의 위임 권한을 추적하는 에이전트 주체 사슬(Agentic Principal Chain, APC)이 제안되었습니다. APC는 여섯 가지 권한 확인을 사용하여 누적된 세션 상태를 기반으로 각 요청을 평가하며, 위임된 범위와 예산을 전달하고 제한합니다. 또한, 구성 폐쇄(composition closure)를 사용하여 이전 행동에 대한 요청을 확인함으로써 금지된 조합을 방지하고 모델 외부에서 결정을 강제합니다.

연구진은 APC 구현에 대해 폭발 범위 단조성(Blast Radius Monotonicity)과 구성 건전성(Composition Soundness)을 증명했습니다. 실제 평가에서 AgentDojo 데이터 유출은 75-100%에서 0%로 감소했으며, InjecAgent의 데이터 절취 사례 544건을 모두 차단했습니다. 또한, 의도 바인딩(Intent binding)을 통해 파괴 및 조작 위험을 각각 38.6%에서 4.0%, 90.5%에서 12.1%로 크게 줄였습니다.

이러한 시스템은 99번째 백분위수에서 0.24ms의 낮은 권한 지연 시간(latency)을 보였으며, AgentDojo 작업 주입 쌍에서 유틸리티는 두 설정에서 각각 8.6%와 13.9% 포인트 낮게 나타났습니다. 구현, 평가 도구, 데이터는 공개되어 있어 개발자들이 이 보안 아키텍처를 검토하고 적용할 수 있습니다.

Dynamic Multi-Byte Prediction With Hierarchical Language Models

바이트 수준의 계층적 언어 모델(LM)이 서브워드 토큰화 기반 모델에 대한 강력한 대안으로 부상하고 있지만, 한 번에 한 바이트씩 생성하는 방식은 추론 속도의 병목 현상을 야기합니다. 이러한 문제를 해결하기 위해 다중 바이트 예측(Multi-Byte Prediction, MBP)이 도입되었는데, 이는 여러 바이트를 병렬로 생성하여 추가 파라미터 없이 최소한의 성능 영향으로 추론 속도를 높입니다.

MBP는 인기 있는 다중 토큰 예측(Multi-Token Prediction, MTP) 패러다임을 기반으로 두 가지 핵심 혁신을 포함합니다. 첫째, 계층적 LM의 잠재 토큰 또는 세그먼트에 맞춰진 가변 길이 예측 창을 도입했습니다. 둘째, 인과 관계를 위반하지 않으면서 병렬 바이트 예측을 가능하게 하는 새로운 어텐션 마스킹 방식을 구현했습니다.

연구 결과, 다중 바이트 예측은 생성 작업, 지시 따르기, 질문 응답, 요약, 기계 번역 등 다양한 생성 작업에서 성능과 추론 처리량 사이의 파레토 최적(Pareto-optimal) 균형점을 달성하며 최고의 균형을 이룬다는 것을 보여줍니다. 이는 효율성과 성능을 동시에 극대화하려는 개발자에게 중요한 진전입니다.

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

멀티모달 대규모 언어 모델은 공간적, 시간적, 체화된 환경에 대해 추론하기 위해 시각적 사고(Visual CoT)를 점점 더 많이 사용하고 있습니다. 시각적 CoT는 중간 추론 이미지를 생성하여 시각적 예측을 위한 직관적인 메커니즘을 제공하지만, 이는 추론 시 상당한 오버헤드를 발생시키며 특히 선제적 비디오 추론에는 문제가 됩니다.

연구진은 모델이 훈련 중에 시각적으로 생각하도록 학습하고 추론 시에는 직접 추론하도록 할 수 있는지에 대해 질문하며 내부 시각적 사고(Internalized Visual Thinking, IVT)라는 새로운 프레임워크를 제안했습니다. IVT는 레이블이 없는 비디오에 대해 텍스트 예측과 다음 임베딩 예측을 공동으로 최적화하는 훈련 후 프레임워크입니다.

IVT는 부분적으로 관찰된 비디오를 바탕으로 목표 텍스트 답변과 함께 미래 프레임의 잠재 표현을 예측하여 움직임, 객체 전환, 상호작용 및 잠재적 의도를 포착하도록 모델을 장려합니다. 추론 시 IVT는 미래 프레임을 합성하거나 다시 인코딩하지 않고 답변을 직접 생성합니다.

실험 결과, IVT는 명시적인 시각적 CoT와 비교하여 동등하거나 더 나은 성능을 달성했으며 평균 종단 간 지연 시간을 5배 이상 줄였습니다. 이는 추론 시점에 명시적인 픽셀 공간 생성이 필수적이지 않을 수 있으며, 예측 세계 모델링을 훈련 중에 내재화하여 더 정확하고 효율적인 멀티모달 추론기를 만들 수 있음을 시사합니다.