아직도 커밋 메시지를 직접 작성하는 이유

LLM이 커밋 메시지를 대신 작성할 수 있게 되면서 개발자들이 직접 커밋 메시지를 작성하는 행위의 가치에 대한 논의가 제기되고 있습니다. 이는 단순히 메시지의 내용을 생성하는 것을 넘어 변경의 이유와 맥락을 기록하고 개발자가 해당 내용을 제대로 이해했는지 확인하는 데 중요한 의미를 갖습니다.

커밋 메시지는 단순히 코드 변경의 내용을 나열하는 것을 넘어, 선행 작업, 발생한 버그 사례, 구현 실수, 그리고 여러 선택지 사이의 트레이드오프를 기록하는 역할을 합니다. 이러한 과정은 diff에서 확인할 수 있는 '무엇'보다 더 깊은 개발 맥락을 제공합니다.

따라서 LLM이 자동화된 도구를 제공하더라도, 개발자가 직접 커밋 메시지를 작성하는 과정은 코드 변경의 의도와 배경을 명확히 남기는 데 필수적입니다. 이는 프로젝트의 히스토리를 이해하고 협업의 효율성을 높이는 데 결정적인 가치를 제공합니다.

The Golden Rule for Becoming a Better Writer

글쓰기 실력을 향상시키는 황금률은 '최대한 많이 읽어라. 폭넓고 잘 읽어라'는 것이다. 작가에게는 정해진 하나의 공식이 없으며, 모든 작가는 자신만의 창작 경로를 갖기 때문에 다른 작가의 작품을 참고하는 것은 창작 과정을 이해하는 데 큰 도움이 된다. 하지만 많은 예비 작가들이 바쁘다는 이유로 독서를 소홀히 하는 경향이 있으며, 이는 글쓰기 능력 향상에 결정적인 장애물이 된다.

저자는 독서가 작가에게 왜 필수적인지 세 가지 이유를 제시한다. 첫째, 독서는 작가에게 글쓰기 기술 자체를 가르친다. 모든 책은 좋은 책이든 나쁜 책이든 글쓰기의 기술을 가르치며, 작가는 이를 통해 소설의 구조나 스타일 같은 패턴을 무의식적으로 습득하게 된다. 둘째, 독서는 작가에게 영감을 준다. 과학 소설, 범죄 소설, 시 등 다양한 장르의 독서는 이야기의 원천이 되는 재료와 주제를 제공하며, 언어를 우아하게 사용하는 방법을 가르쳐준다.

마지막으로 독서는 뇌의 구조를 변화시킨다. 독서는 작가의 사고방식과 관점을 확장시키며, 이는 창의적인 아이디어를 얻고 새로운 방식으로 세상을 바라보는 데 기여한다. 따라서 작가가 되기 위해서는 독서를 단순히 취미가 아닌 필수적인 작업으로 인식하고, 시간을 내어 읽는 습관을 들이는 것이 가장 중요하다.

Zuckerberg encouraged growth over child safety, ex-Meta executive testifies

마크 저커버그가 성장 우선 정책을 강조하며 아동 안전보다 성장에 중점을 두도록 장려했다는 내용으로 전직 메타 임원이 증언을 재개했습니다. 이는 소셜 미디어 관련 피해에 대한 획기적인 소송에서 중요한 증언으로 다뤄지고 있습니다.

이번 증언은 소셜 미디어 플랫폼의 성장 전략과 아동 안전 문제 사이의 윤리적 및 법적 책임에 대한 논쟁을 심화시킵니다. 소송의 핵심 쟁점은 플랫폼이 사용자 성장이라는 목표를 달성하는 과정에서 아동의 안전을 얼마나 고려했는지에 초점이 맞춰져 있습니다.

이 사건은 메타와 같은 거대 기술 기업들이 플랫폼 운영에 있어 사회적 책임과 사용자 보호를 어떻게 이행해야 하는지에 대한 중요한 선례를 제시합니다. 개발자와 사용자들은 이러한 법적 분쟁이 기술 기업의 정책 결정과 실제 사용자 경험에 미치는 영향을 이해하는 데 중요한 맥락을 제공합니다.

[팟캐스트] 개발자라면 알아야 할 암호학

개발자는 라이브러리에만 의존하지 않고 암호학 알고리즘과 설정을 올바르게 선택하고 운용해야 합니다. 이는 링크드인, 어도비, Heartbleed와 같은 실제 보안 사고 사례를 통해 개발자가 암호학적 기본 원리를 이해하고 적용해야 하는 이유를 보여줍니다.

이러한 보안 사고들은 단순히 라이브러리 사용의 문제가 아니라, 사용된 암호화 방식과 설정의 부적절함에서 비롯되었음을 시사합니다. 따라서 개발자는 단방향 암호화와 양방향 암호화의 근본적인 차이점을 이해하고 각 상황에 맞는 알고리즘을 선택해야 합니다.

단방향 암호화에는 해시, 솔트, bcrypt 또는 Argon2id와 같은 기술이 사용되며, 이는 데이터 무결성 보장에 중점을 둡니다. 반면, 양방향 암호화는 대칭키 AES 모드와 비대칭키 RSA를 포함하며, 이는 데이터의 기밀성과 인증을 동시에 확보하는 데 사용됩니다.

개발자는 이러한 암호화 원리와 차이점을 숙지하여 시스템 설계 단계부터 보안을 고려해야 합니다. 올바른 암호학적 알고리즘 선택과 설정 관리는 실제 보안 사고를 예방하고 안전한 시스템을 구축하는 데 필수적입니다.

There's no such thing as a small software team anymore

소프트웨어 팀의 크기에 제한은 더 이상 존재하지 않으며, 모듈화된 구조와 코딩 에이전트를 통해 대규모 병렬 개발이 가능해졌습니다. 과거에는 소규모 팀이 동시에 코드를 작성하는 데 한계가 있었지만, 오늘날에는 20~100개의 에이전트를 병렬로 실행하여 500개의 커밋과 100개의 PR을 생성할 수 있습니다. 이는 우버와 같이 수천 개의 마이크로서비스를 운영하는 환경에서 각 개발자가 독립적으로 작업할 수 있게 하며, 코드의 모듈성이 병렬 작업의 기반이 됩니다.

모놀리식 서비스의 경우 모든 변경 사항을 조정해야 하므로 병합 충돌이나 리팩토링 문제가 발생하기 쉽습니다. 반면, 모듈화된 코드에서는 각 모듈이 독립적으로 작업할 수 있는 '완전히 병렬적인' 작업 방식이 가능해집니다. 개발자는 각 모듈에 코딩 에이전트를 실행하여 성능 개선과 같은 작업을 동시에 수행함으로써 전체 시스템에 상당한 개선을 이룰 수 있습니다.

다만, 코딩 에이전트는 컨텍스트 제한이 있다는 점을 고려해야 합니다. 모듈이나 라이브러리가 컨텍스트 창에 들어갈 만큼 충분히 작을수록 에이전트의 성능이 크게 향상됩니다. 따라서 코드베이스를 설계할 때부터 이러한 모듈성을 고려하여 병렬 에이전트 활용을 극대화하는 것이 중요합니다.

Three ways to smuggle SQLite into Nix

Nix의 핵심인 nixpkgs-multiverse의 인덱스는 현재 JSON 파일 형태로 저장되어 있으며, 이 JSON 파일을 로드하는 과정이 비효율적이라는 문제가 제기되었습니다. 현재 인덱스는 305,492개의 패키지 버전을 포함하고 있으며, JSON 파싱 과정에서 모든 데이터를 메모리에 실체화해야 하므로 쿼리 성능에 병목 현상이 발생합니다.

이러한 비효율성을 해결하기 위해 SQLite 데이터베이스를 인덱스에 통합하는 세 가지 방법이 제시되었습니다. 첫 번째 방법은 `builtins.exec`를 사용하여 외부 프로그램인 SQLite를 실행하고 그 출력을 파싱하는 방식입니다. 이 방법은 각 쿼리마다 포크 및 Nix 파싱 오버헤드가 발생하여 성능 비용이 발생합니다.

두 번째 방법은 `builtins.importNative`를 활용하여 공유 객체를 직접 로드하는 방식인데, 이는 데이터베이스 핸들을 재사용하여 쿼리당 비용이 거의 들지 않는 가장 효율적인 방법입니다. 다만 이 방법은 C++ 구현과 공유 객체 관리가 필요하며, 현재 WASM 구현에서는 초기 로드에 약 2.5초의 고정 비용이 발생합니다.

결론적으로 현재 인덱스 크기에서는 JSON 방식이 여전히 유리하지만, SQLite를 도입할 경우 `builtins.importNative`를 통해 데이터베이스를 한 번만 열어두는 것이 가장 효율적입니다. 이 방식은 JSON 방식보다 훨씬 빠른 속도를 제공하며, 개발 경험 측면에서 잠재적인 이점을 제공할 수 있습니다.

Turns are Better than Radians

회전(Turns)이 라디안(Radians)보다 더 나은 이유를 설명하며, 코드를 더 단순하고 빠르며 정확하게 만들 수 있다고 주장합니다. 이는 코드를 작성할 때 흔히 발생하는 $\pi$나 $\tau$ 상수 사용으로 인해 불필요한 변환이 발생하기 때문입니다. 대부분의 경우, 코드가 삼각 함수 호출을 위해 라디안으로 변환하고 라이브러리 내부에서 다시 역변환하는 과정을 반복하며 불필요한 곱셈과 나눗셈이 발생합니다.

이러한 불필요한 변환을 제거하고 각도를 $[0, 1]$ 범위로 표현하는 회전 방식을 사용하면 코드가 더 간결해지며, 특히 일반적인 값들을 표현할 때 라디안보다 더 효율적이고 정확합니다. 예를 들어, $90$도와 같은 각도를 회전으로 표현하면 $0.25$가 되어 훨씬 적은 비트만으로도 정확하게 표현할 수 있어 데이터 표현이 더 압축적이고 정밀해집니다.

회전은 단순히 수학적 개념이 아니라 실제로 존재하는 수학적 구성이며, 이는 코드를 재매개변수화하는 합법적인 방법입니다. 이 방식을 적용하려면 삼각 함수를 라디안 대신 회전으로 작동하도록 변경하는 것만으로 충분하며, 이는 라이브러리 내의 단 하나의 상수를 조정하는 것으로 구현할 수 있습니다.

다만, 미적분학에서 유도된 공식이나 도함수 등을 다룰 때는 주의가 필요합니다. 표준 미적분학 공식은 인수가 라디안으로 표현된다고 가정하므로, $\pi$나 $\tau$를 단순히 제거할 경우 연쇄 법칙 등으로 인해 추가적인 인자가 누락될 수 있습니다. 따라서 수학적 맥락에서 코드를 수정할 때는 이러한 미적분학적 제약 조건을 고려해야 합니다.

OpenSandbox - AI 에이전트를 위한 샌드박스 런타임

AI 에이전트를 위한 안전하고 빠르며 확장 가능한 범용 샌드박스 플랫폼인 OpenSandbox가 공개되었습니다. 이 플랫폼은 코딩 에이전트, GUI 에이전트, 에이전트 평가 등 다양한 AI 애플리케이션을 안전하게 실행하고 관리할 수 있도록 설계되었습니다.

OpenSandbox는 개발자들이 AI 에이전트를 실험하고 배포할 수 있도록 도커와 쿠버네티스 런타임을 제공합니다. 이를 통해 로컬 환경에서의 실행은 물론 대규모 분산 스케줄링 환경에서도 에이전트를 효율적으로 관리할 수 있습니다.

플랫폼은 다중 언어 SDK를 지원하여 Python, Java, Kotlin, TypeScript, C#, .NET 등 다양한 언어로 에이전트를 개발할 수 있는 환경을 제공합니다. 이는 개발자들이 언어 제약 없이 AI 에이전트 시스템을 구축하고 평가하는 데 필요한 유연성과 확장성을 확보해 줍니다.

NASA calls off mission to rescue Swift gamma-ray observatory

NASA와 Katalyst Space Technologies는 Swift 감마선 망원경을 구출하기 위한 로봇 임무를 중단한다고 발표했습니다. 이 임무는 Swift가 궤도를 이탈하기 전에 대기권으로 재진입하는 것을 막기 위해 설계되었습니다.

구출 위성인 링크호(Link)는 7월 3일에 발사되어 로봇 팔로 Swift를 포획하고 궤도를 높여 재진입을 피하는 임무를 수행할 예정이었습니다. 링크호는 냉장고 크기로, 두 개의 태양광 패널과 세 개의 제논 추진기를 사용하여 Swift를 더 안전하고 높은 궤도로 이동시키도록 설계되었습니다.

하지만 Katalyst는 링크호의 지속적인 자세 제어 문제로 인해 구출 임무를 완료할 수 없다고 밝혔습니다. 링크호 자체는 여전히 작동 중이며, Katalyst는 링크호의 남은 능력을 최대한 활용하여 Swift에 충분히 근접하여 위성의 근접 항법 시스템을 시연할 수 있도록 할 계획입니다.

일반 텍스트 회계가 꽤 멋진 이유

계좌 연결이 불안정한 금융 서비스 대신 hledger 기반의 복식부기를 사용하여 거래를 직접 관리하고 순자산, 지출, 저축률 보고서를 생성하는 방법이 소개됩니다. 이 방식은 사용자가 금융 데이터에 대한 통제권을 확보하고 개인 재정 상태를 명확하게 파악할 수 있도록 돕습니다.

이러한 회계 데이터를 일반 텍스트 형태로 보관하면 편집기, Git, 자체 도구, Claude Code와 같은 다양한 개발 도구로 데이터를 다룰 수 있는 유연성이 생깁니다. hledger는 거래의 균형을 검사하고 CSV 파일을 가져오는 기능을 제공하여 데이터의 정확성과 관리 효율성을 높여줍니다.

결론적으로 이 접근 방식은 불안정한 금융 서비스에 의존하지 않고, 데이터를 텍스트 기반으로 관리하며 개발 도구를 활용하여 재정 데이터를 분석하고 자동화하는 데 중점을 둡니다. 이는 개인 재정 관리를 단순한 기록을 넘어 데이터 중심의 프로젝트로 전환하는 데 의미가 있습니다.

Kimi Code CLI - 터미널에서 사용하는 오픈소스 코딩 에이전트

Moonshot AI가 터미널 기반의 AI 코딩 에이전트인 Kimi Code CLI를 공개했습니다. 이 에이전트는 개발자가 터미널 환경에서 코딩 작업을 효율적으로 수행할 수 있도록 설계되었으며, 코드 읽기 및 수정, 쉘 명령 실행, 파일 검색, 웹페이지 조회 등의 복합적인 작업을 수행할 수 있습니다.

이 에이전트의 가장 큰 특징은 단순히 명령을 수행하는 것을 넘어, 작업 결과를 피드백으로 받아 다음 수행할 작업을 스스로 선택하고 진행한다는 점입니다. 이는 개발자가 복잡한 프로젝트 내에서 필요한 여러 단계를 AI 에이전트에게 위임하여 자동화할 수 있게 하여 생산성을 크게 향상시킬 수 있습니다.

Kimi 모델을 즉시 사용할 수 있으며, 호환되는 다른 모델 제공업체로도 설정이 가능하여 사용자가 원하는 환경에 맞춰 유연하게 모델을 선택할 수 있습니다. 따라서 개발자는 Kimi Code CLI를 통해 터미널 환경에서 다양한 코딩 및 정보 탐색 작업을 자동화하고 효율화할 수 있는 새로운 방법을 얻게 되었습니다.

Mastodon 5.0: 기반 다지기

Mastodon 5.0은 게시물 작성, 메시지, 탐색 구조를 재설계하여 공개 범위와 상호작용 대상을 더 명확하게 이해할 수 있도록 기반 사용자 인터페이스를 정비했습니다. 이번 업데이트는 사용자가 자신의 콘텐츠와 상호작용의 범위를 더 세밀하게 제어할 수 있도록 하는 데 중점을 두었습니다.

특히, 10년간 사이드바에 고정되어 있던 작성창을 오버레이 방식으로 변경하여 사용 편의성을 개선했습니다. 또한, 게시물의 공개 범위, 검색 노출 여부, 인용 허용 여부와 같은 설정 항목들을 단순한 선택 항목으로 통합하여 설정 과정을 간소화했습니다.

이러한 구조 변경은 사용자가 자신의 게시물에 대한 공개 범위와 타인과의 상호작용 대상을 명확하게 설정하고 관리할 수 있게 합니다. 이는 Mastodon 플랫폼 내에서 콘텐츠의 투명성과 사용자 통제권을 높이는 데 기여합니다.

Bun 1.4 Rust 재작성의 불안한 징후

Bun 1.4 출시와 관련하여 Rust 재작성 이후 개발자들 사이에서 불안한 징후가 나타나고 있습니다. 2022년부터 Bun을 사용해 온 개발자들은 Rust 재작성 과정에서 발생한 출시 지연과 소통 방식의 변화가 Bun 1.4에 대한 우려를 키우고 있다고 보고 있습니다.

특히 출시 예고 시점이 계속 바뀌는 등 소통에 혼란이 있었으며, 안정 버전 공백 기간은 Bun 역사상 가장 긴 3개월 이상에 달합니다. 이러한 상황은 개발자들이 Bun의 다음 버전 업데이트 일정과 안정성을 예측하는 데 어려움을 겪게 만듭니다.

개발자들은 이러한 변화가 Bun 생태계에 미치는 영향에 대해 깊은 우려를 표하고 있습니다. 따라서 Bun 1.4의 안정적인 출시와 명확한 소통 방식에 대한 추가적인 정보가 필요합니다.

HTML만으로 구현하는 동적 UI

JavaScript가 담당해왔던 다양한 동적 UI 기능을 HTML 속성만으로 구현할 수 있게 되었다는 내용입니다. 개발자들은 복잡한 동적 UI를 구현하기 위해 JavaScript 스크립트를 사용하는 대신, 내장된 HTML 요소인 dialog, popover, details 등을 활용하여 이러한 기능을 구현할 수 있게 되었습니다.

이는 동적 UI 구현에 필요한 복잡한 로직을 최소화하고 HTML 기반으로 UI를 선언적으로 구성할 수 있게 함을 의미합니다. 특히 command, commandfor, popovertarget과 같은 속성들은 대상 요소를 id로 연결하여 이러한 동적 상호작용을 구현하는 데 사용됩니다.

이러한 접근 방식은 기존에 JavaScript에 의존하여 구현되던 동적 UI 기능을 HTML 자체의 속성만으로 처리함으로써, 코드의 간결성과 유지보수성을 높이는 데 기여합니다. 개발자는 이제 HTML 속성만으로도 사용자 인터페이스의 동적인 변화를 효과적으로 제어할 수 있게 되었습니다.

Universality of Gradient Descent Neural Network Training

신경망 훈련의 보편성에 대한 연구는 신경망 설계 선택이 성공적인 최적화에 매우 중요하다는 점을 시사합니다. 이 논문은 특정 신경망에 대해 분류 작업의 좋은 네트워크 가중치를 찾는 알고리즘이 존재한다면, 그 가중치와 해당 순방향 출력을 단순한 경사 하강법 훈련만으로 재현하는 신경망 확장체가 항상 존재함을 보였습니다.

이는 신경망의 설계가 최적화 과정에 미치는 영향을 이론적으로 뒷받침하며, 경사 하강법과 같은 알고리즘이 신경망 훈련의 보편적인 메커니즘임을 강조합니다. 즉, 특정 문제에 대한 최적화 방법이 존재한다면, 그 결과를 재현하는 훈련 방법이 보편적으로 존재한다는 것입니다.

이 결과는 실제 계산을 위한 것이 아니라 메타 학습 및 관련 접근 방식의 가능성에 대한 방향성을 제시하는 데 중점을 두고 있습니다. 따라서 이 연구는 신경망 훈련의 근본적인 가능성과 메타 학습 분야에 대한 이론적 이해를 확장하는 데 중요한 맥락을 제공합니다.

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

스트리밍 자기회귀 확산 모델은 실시간 장기 비디오 생성을 가능하게 하지만, 훈련 목표가 일관된 세계의 기하학이나 역학보다는 국소 프레임 예측에 최적화되어 있어 긴 시퀀스에서 기하학적 표류가 누적되고 정적 또는 부자연스러운 움직임으로 저하되는 문제가 발생합니다. 최근 양방향 접근 방식은 3D 가우시안-스플래팅 재구성에 기반한 보상 신호를 사용하여 이 문제를 해결하려 합니다.

그러나 단일 경직된 3D 재구성은 동적인 장면을 모델링할 수 없기 때문에, 이 비평가는 실제 객체 움직임을 재구성 오류로 간주하여 움직임을 동결함으로써 최대화하는 단축 경로를 사용합니다. 이러한 방식은 각 청크가 이미 정적인 구성을 전파할 수 있는 AR 환경에서 특히 해롭습니다.

이에 본 연구는 정적인 비평가를 대체하여 장면 역학을 명시적으로 모델링하는 순방향 4D 재구성 보상을 제안하는 Stream4D를 제시합니다. 또한 움직임의 크기와 품질을 더 잘 안내하기 위해 자연스러운 장면 흐름의 크기를 보상하고 떨림과 비강체 인공물에 불이익을 주는 움직임 사전(motion prior)을 추가했습니다.

최종 레시피는 이 두 항과 경량의 지각적 앵커를 결합하여 움직임의 일관성을 높입니다. Stream4D는 다양한 자기회귀 비디오 백본과 생성 수평에 걸쳐 4D 재구성 품질을 개선하고 움직임을 더 효과적으로 보존하며 인간 선호도에 부합하는 결과를 달성합니다.

VGI-BENCH: Probing Visual Intelligence in Video Generation Models

비디오 생성 모델이 생성된 프레임을 통해 특정 형태의 제로샷 시각 추론을 보일 수 있다는 연구 결과가 발표되었습니다. 하지만 이러한 능력을 신뢰성 있게 평가하는 것은 여전히 어려운 과제로 남아 있습니다. 연구진은 신뢰할 수 있는 평가를 위해 벤치마크가 현재 비디오 모델의 시각적 사전 지식에 맞춰 입력 조건을 설정하고, 단순히 최종 상태가 아닌 유효한 발전 과정(evolving processes)을 요구해야 하며, 과제 난이도를 도전적이면서도 부분적으로 실현 가능하도록 조정해야 한다고 제안합니다.

이러한 목표를 위해 연구팀은 비디오 생성 모델의 시각 추론 능력을 세밀하게 평가하기 위한 VGI-bench를 소개했습니다. VGI-bench는 두 단계의 분류 체계와 기술 태그로 구성된 27개의 과제와 810개의 인스턴스를 포함하고 있습니다. 이 평가를 통해 현재 생성 시스템이 시각적으로 근거 있는 추론 과제의 일부를 해결할 수는 있으나 신뢰성은 매우 낮다는 사실이 드러났습니다.

평가 결과, 가장 강력한 모델인 Seedance~2.0조차도 VGI-bench 기준에서 51.0%만을 달성했습니다. 또한 연구진은 출력 실패 모드, 입력 조건 민감도, 합성 미세 조정으로부터의 성능 전이 경계, 그리고 내부 디노이징 관점을 분석했습니다. 이 분석 결과, 모델의 자기 수정 능력은 제한적이며 후속 단계가 추론 오류를 수정하기보다는 초기 가설을 다듬는 데 주로 사용된다는 것을 발견했습니다.

VGI-bench는 차세대 비디오 생성 모델의 발전을 촉진하는 데 기여할 것으로 기대됩니다. 연구팀은 이 벤치마크의 코드와 데이터를 공개할 예정입니다.

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

멀티모달 대규모 언어 모델(MLLM)이 비디오 인식의 주류 패러다임이 되었지만, 대규모 멀티태스크 데이터셋에 대한 학습 후 강화 학습(RL) 방법은 여전히 어려운 과제를 안고 있습니다. 기존의 RL 방법들은 비용이 많이 드는 체인-오브-사고(CoT) 생성에도 불구하고 소수의 고품질 롤아웃만을 샘플링하는 온-폴리시 그룹을 다루는 데 한계가 있습니다.

본 논문은 비디오 MLLM에 대한 RL 학습 후의 샘플 효율성과 확장성을 연구하며 OraRL이라는 새로운 방법을 제안합니다. 이 방법은 주석(annotations)의 역할을 확장하여, 롤아웃 점수 외에도 각 주석이 온-폴리시 그룹에 오라클 롤아웃으로 참여하여 직접적인 긍정 최적화 목표가 되도록 합니다.

OraRL의 핵심은 분리된 이점 추정기(decoupled advantage estimator)에 있으며, 정책 롤아웃이 오라클이 없는 기준선을 결정하고 오라클-정책 간의 격차가 방향성 이득과 별도의 오라클 이득을 조절합니다. 또한, Sign-balanced pruning 기법을 통해 효율성을 개선하여, CoT를 사용한 GRPO보다 절반 이하의 단계 시간으로 SFT의 2.2배 수준만 요구합니다.

이러한 접근 방식은 모델 크기와 데이터에 따라 확장되며, Video-ORA-9B 모델은 CoT 없이도 4,780ms 대신 130ms 만에 디코딩을 완료합니다. 결과적으로 시간적 mIoU는 62.5에서 66.0으로, AO는 73.0에서 78.2로 향상되었으며, 공간 지능 거시 평균은 51.0에서 56.1로 개선되었습니다. VSI-Bench에서는 GPT-5 대비 73.1점, Gemini-3-Pro 대비 55.1점을 기록했습니다.

Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection

얼굴 기반 프레젠테이션 공격 탐지(PAD)은 전통적으로 얼굴에 특화된 문제로 여겨져 왔으나, 인쇄, 재생, 재촬영 과정에서 발생하는 시각적 인공물은 얼굴 외적인 특성과도 관련이 있습니다. 본 연구는 다운스트림 PAD 훈련 시 얼굴을 사용하지 않고도 전이 가능한 PAD 표현을 학습할 수 있는지 탐구합니다. 이를 위해 연구진은 토마토, 감자, 양파를 대상으로 한 통제된 얼굴 없는 프레젠테이션 공격 데이터셋인 TPO를 도입했습니다. 이 데이터셋은 기존 얼굴 PAD 데이터셋과 유사한 프로토콜로 획득된 실제, 인쇄, 재생 녹화본으로 구성되어 있습니다.

기초 모델 기반 PAD 아키텍처를 사용하여 TPO로 훈련된 탐지기는 네 가지 표준 교차 데이터셋 벤치마크에서 평균 92.70%의 AUC를 달성했습니다. 이는 합성 얼굴로 훈련하거나 실제 얼굴 데이터셋으로 훈련한 모델보다 우수하며, 실제 얼굴 데이터셋으로 훈련된 모델과도 경쟁할 만한 성능을 보였습니다. 또한, 얼굴 PAD 데이터셋으로 훈련된 모델들이 TPO로 일관되게 우위를 보인다는 것은 학습된 표현이 객체의 의미론보다는 프레젠테이션 과정의 특성을 포착함을 시사합니다.

TPO를 기존 얼굴 PAD 훈련에 통합하면 고정된 최적화 예산 하에서 교차 데이터셋 성능이 지속적으로 향상됩니다. 이는 얼굴 없는 데이터가 단순히 추가적인 훈련 샘플을 제공하는 것을 넘어 보완적인 정보를 제공함을 의미합니다. 최종적으로 표현 및 주파수 분석 결과는 전이 가능한 PAD 표현이 단일 스펙트럼 인공물로 설명될 수 없으며, 객체 범주 전반에 걸쳐 공유되는 더 풍부한 프레젠테이션 단서를 인코딩한다는 증거를 제시합니다.

이러한 결과는 얼굴 내용과 독립적으로 전이 가능한 프레젠테이션 공격 표현을 학습할 수 있다는 실증적인 증거를 제공하며, 프라이버시 보호 및 신원 독립적인 PAD 개발에 새로운 기회를 열어줍니다.

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

최근 에이전트 벤치마크는 코드 수정이나 웹 탐색 같은 실행 가능한 환경에 기반하여 평가되고 있습니다. 그러나 코드 외의 실질적인 작업을 완료하기 위해서는 단순히 그럴듯한 응답이나 유효한 도구 호출을 넘어, 에이전트가 여러 차례에 걸쳐 누락된 정보를 수집하고, 도메인 정책을 준수하며, 종속된 도구를 조정하고, 부작용 없이 올바른 영구 상태 전환을 인식해야 합니다.

이 논문에서는 도구-에이전트-사용자 상호작용을 위한 샌드박스인 Thinkingbox를 소개합니다. Thinkingbox는 격리된 MCP 호환 도구 세션, 완전한 실행 추적, 그리고 최종 백엔드 상태에 대한 결과 평가를 제공합니다. 이 샌드박스를 기반으로 Thinkingbox-bench는 소매업, 숙박업, 자동차 보험, 핀테크 내부 IT 등 다양한 시나리오에서 507개의 정책 기반 워크플로우를 포함합니다.

각 시도는 작업별 실행 가능한 검사를 통해 평가되며, 유효한 궤적을 허용하면서 잘못되거나 누락되거나 추가적인 효과를 거부합니다. 이 벤치마크 결과, 가장 강력한 모델은 pass@1에서 65.36%를 달성했지만, pass^20에서는 25.25%에 불과했습니다. 또한, 많은 실패 사례는 깔끔한 종료와 유효한 상태 변경 동작을 보여주어 응답이나 도구 호출 수준의 신호가 엔드투엔드 작업 완료의 명확한 대리 지표가 아님을 시사합니다.

Thinkingbox-bench는 성공적인 궤적을 발견하는 것과 상태 기반 비즈니스 작업을 확실하게 완료하는 것 사이에 큰 격차가 있음을 드러냅니다. 개발자들은 Thinkingbox와 Thinkingbox-Bench를 GitHub에서 공개하여 이러한 상태 기반 작업의 신뢰성 문제를 해결할 수 있습니다.