Show GN: 내 GPU로 어떤 LLM을 돌릴 수 있는지 계산해주는 오픈소스 도구 만들었습니다

AI 인프라 관련 견적 및 자문 업무를 진행하면서 사용자가 "이 GPU로 어떤 LLM을 실행할 수 있을까"라는 질문에 대해 VRAM을 수동으로 계산하는 반복적인 과정을 자동화하는 계산기를 개발하여 오픈소스로 공개했습니다. 이 도구는 개발자들이 자신의 GPU 환경에서 실행 가능한 모델의 가능성을 예측하고 계획을 세우는 데 필요한 정보를 제공하는 것을 목표로 합니다.

해당 계산기는 사용자가 특정 GPU를 입력하면 해당 GPU에서 실행 가능한 모델의 양자화(quantization) 수준과 예상 실행 속도를 계산해 줍니다. 이 도구는 GPU 147종에 대한 정보를 포함하고 있으며, 실제 인프라 환경에서 모델 구동 가능성을 객관적으로 판단할 수 있도록 돕습니다.

이는 AI 인프라 구축 및 모델 배포를 고려하는 개발자들에게 GPU 자원을 효율적으로 활용하고 잠재적인 제약을 미리 파악하는 데 실질적인 도움을 줄 수 있습니다. 오픈소스 형태로 공개되어 누구나 접근하여 자신의 하드웨어 환경에 맞는 LLM 구동 계획을 수립할 수 있습니다.

agent.md로 LLM 생성 코드의 품질 높이기

LLM이 코드 생성 능력을 발전시켰음에도 불구하고 실제 프로덕션 환경에 적용하는 데는 품질 문제가 남아있습니다. 2025년에는 컴파일조차 불가능했던 LLM이 2026년에는 복잡한 구현과 버그 분석까지 수행할 수 있게 되었지만, 생성된 코드가 스파게티 코드 형태를 띠거나 주석과 구조가 부족하여 실제 사용하기 어려웠습니다.

이러한 문제점은 LLM이 생성하는 코드의 품질과 유지보수성을 크게 저해하는 주요 원인이었습니다. 개발자는 LLM이 생성한 코드를 바로 프로덕션에 적용하기 위해 추가적인 수정과 검토에 많은 시간을 할애해야 했습니다.

이러한 문제를 해결하기 위해 코드 리뷰 지침을 체계화하는 방법이 제시되었습니다. 세션마다 반복되던 코드 리뷰 지침을 agent.md 파일에 모아 프롬프트에 자동 주입하는 방식을 적용하자, LLM이 생성하는 코드의 품질이 직접적으로 향상되었습니다.

이는 LLM 기반 개발 환경에서 생성된 코드가 단순한 기능 구현을 넘어 실제 사용 가능한 고품질의 코드가 되도록 보장하는 방법입니다. agent.md를 활용하면 개발 과정에서 일관된 품질 기준을 유지하며 효율적으로 코드를 생성하고 관리할 수 있습니다.

Show GN: 매일 하나의 질문에 투표하고, 주제에 대해 토론하는 앱

매일 하나의 주제에 대해 두 가지 선택지 중 하나를 선택하고 토론하는 서비스가 제공됩니다. 이 서비스는 사용자들이 매일 특정 주제에 대해 의견을 나누고 투표하며 상호작용할 수 있도록 설계된 애플리케이션입니다.

사용자는 매일 아침 9시에 새로운 질문을 접하게 되며, 제시된 두 가지 선택지 중에서 자신의 의견에 가장 가까운 것을 선택하여 투표하게 됩니다. 투표가 완료되면 실시간으로 투표 결과가 출력되어 현재의 여론을 파악할 수 있습니다.

더 나아가, 사용자는 토론하기 기능을 통해 다른 사용자들과 선택지에 대한 의견을 자유롭게 나누며 심도 있는 대화를 진행할 수 있습니다. 이 앱은 단순한 투표를 넘어 커뮤니티 기반의 토론을 촉진하는 데 중점을 두고 있습니다.

Show GN: 카카오톡 테마 제작 툴을 만들었습니다

카카오톡 테마 제작 과정에서 필요한 이미지 소스에 대한 혼란을 해결하기 위해 Claude에게 테마 제작 툴을 만들도록 요청한 사례가 공유되었습니다. 이 글은 카카오톡 가이드를 기반으로 테마를 제작하는 과정에서 개발자들이 겪을 수 있는 작업 효율화에 대한 아이디어를 제시합니다.

테마 적용 방식은 운영체제에 따라 차이가 있습니다. iOS의 경우 웹에서 바로 이미지를 다운로드하여 카카오톡에 적용할 수 있는 편의성이 있습니다. 반면 안드로이드의 경우 폴더를 다운로드한 후 사용자가 직접 빌드하는 과정을 거쳐야 합니다.

이러한 플랫폼별 차이점은 테마 제작 툴을 개발할 때 각 환경에 맞는 접근 방식을 고려해야 함을 시사합니다. 개발자는 iOS와 안드로이드 환경에 따라 이미지 소스 확보 및 적용 방식의 차이를 인지하고 이에 맞는 자동화된 제작 툴을 구상할 필요가 있습니다.

SonicMoE로 보는 GPU 커널 최적화

SonicMoE를 예시로 효율적인 GPU 커널을 설계하는 개념에 대해 다루고 있습니다. 이는 GPU에서 실행되는 커널의 효율성을 높이는 방법에 대한 논의를 포함합니다.

효율적인 GPU 커널 설계는 연산의 병렬 처리와 메모리 접근 방식을 최적화하여 GPU 자원을 최대한 활용하는 것을 의미합니다. 이러한 최적화는 딥러닝 모델이나 고성능 컴퓨팅 작업에서 성능을 극대화하는 데 필수적입니다.

이 글은 SonicMoE와 같은 접근 방식을 통해 실제 GPU 커널을 어떻게 효율적으로 설계할 수 있는지에 대한 이론적 배경과 설계 원칙을 제시합니다. 개발자는 이를 통해 하드웨어의 잠재력을 최대한 발휘하는 커널을 구축할 수 있습니다.

GNU Emacs Canvas 입문: 픽셀 버퍼를 직접 다루는 새 이미지 기능

약 8개월간 개발된 Canvas 기능이 GNU Emacs 코어에 병합되어 Emacs 32 버전부터 이미지 데이터를 문자열로 전달하는 방식에서 벗어나 픽셀 버퍼를 직접 조작할 수 있게 되었습니다. 이는 Emacs 사용자들에게 이미지 처리 방식을 근본적으로 변화시키는 중요한 업데이트입니다.

기존의 이미지 API와 호환되는 새로운 이미지 유형인 Canvas는 개발자들이 이미지 데이터를 문자열 형태로 전달하는 대신 픽셀 버퍼를 직접 다룰 수 있도록 지원합니다. 이로 인해 이미지 처리의 효율성과 제어 능력이 크게 향상됩니다.

Emacs Lisp 환경에서는 Canvas가 이미지 객체로 사용되며, 동적 모듈에서는 이 새로운 기능을 활용하여 더 세밀하고 직접적인 이미지 조작이 가능해집니다. 이 기능은 기존 이미지 처리 방식에 대한 이해를 바탕으로 보다 낮은 수준에서 그래픽 데이터를 제어하고자 하는 개발자들에게 실질적인 이점을 제공합니다.

Anthropic의 최고 AI 모델, 저렴한 도구의 성장 속에서 사용자 확보에 고전

Anthropic의 최고 AI 모델이 저렴한 도구 시장의 성장 속에서 사용자 확보에 어려움을 겪고 있다는 내용이 보도되었습니다. 이는 AI 모델의 성능과 시장에서의 사용자 확보 전략 사이에 구조적인 괴리가 발생하고 있음을 시사합니다.

최근 시장에서는 저렴하고 접근성이 높은 도구들이 빠르게 성장하고 있으며, 이러한 환경 속에서 최고 수준의 AI 모델을 보유한 기업들은 사용자들을 효과적으로 끌어들이는 데 고전하고 있습니다. 이는 단순히 기술적 우위를 넘어, 실제 사용자들이 어떤 가치를 느끼고 어떤 방식으로 AI 서비스를 소비하는지에 대한 근본적인 질문을 던집니다.

따라서 AI 기업들은 단순히 모델의 성능을 개선하는 것을 넘어, 비용 효율성과 사용자 경험을 동시에 고려하는 새로운 사용자 확보 전략을 모색해야 하는 과제에 직면해 있습니다. 이러한 상황은 AI 기술이 대중화되는 과정에서 기술력과 시장 전략이 어떻게 조화되어야 하는지에 대한 중요한 맥락을 제공합니다.

내가 가진 모든 것, 모두 장악당하다

Claude Opus 5를 활용하여 주변기기 5종의 펌웨어를 역공학하는 과정에서 숨겨진 기능과 보안 취약점이 발견되었습니다. 연구팀은 제조사의 펌웨어와 업데이트 도구를 역공학 환경에 적용하여 업데이트 형식, 프로토콜, 보안 구조, 그리고 숨겨진 기능을 심층적으로 조사했습니다.

이러한 분석을 통해 마이크 명령 셸, 녹화 중 끌 수 있는 웹캠 LED, 그리고 Wi-Fi를 통한 비인증 메모리 쓰기 같은 잠재적인 제어 기능을 찾아냈습니다. 이는 일반 사용자에게 공개되지 않은 하드웨어 및 소프트웨어의 숨겨진 작동 방식을 파악하는 데 중요한 정보를 제공합니다.

연구팀은 이 과정을 2주간의 저녁 시간을 들여 진행했으며, 이는 펌웨어 수준의 보안과 프로토콜에 대한 깊은 이해를 가능하게 합니다. 개발자들은 이러한 역공학 결과를 통해 하드웨어 및 펌웨어 보안 취약점을 식별하고 시스템의 숨겨진 기능을 이해하는 데 참고할 수 있습니다.

AI가 인간의 실행력을 확장하려면 무엇이 필요한가

AI가 인간의 실행력을 확장하는 데 필요한 요소에 대한 논의가 진행되고 있습니다. 이는 단순히 AI 기술의 발전뿐만 아니라, AI가 인간의 의사결정 및 행동을 어떻게 보조하고 증폭시킬 수 있는지에 대한 근본적인 질문을 다룹니다.

Forerunner Ventures는 이 주제를 'The Human Bet'과 후속 글 'The Supply Side'라는 시리즈를 통해 탐구하고 있습니다. 이 논의는 AI가 인간의 실행력을 확장함으로써 우리가 목표를 설정하고 실행하는 방식에 어떤 변화를 가져오는지에 초점을 맞춥니다.

결국 이 논의는 AI 기술이 단순한 도구를 넘어 인간의 능력을 확장하는 파트너로서 어떤 역할을 해야 하는지에 대한 실질적인 방향을 제시합니다. 개발자와 사용자들은 AI가 제공하는 기능이 실제 실행력 향상에 어떻게 기여하는지, 그리고 그 과정에서 필요한 시스템적 조건은 무엇인지 이해하는 것이 중요합니다.

스태프 엔지니어로서 해결할 문제를 찾는 방법

스태프 엔지니어는 단순히 주어진 어려운 과제를 해결하는 역할에 머무르지 않고, 일상 업무 과정에서 발생하는 마찰을 흡수하여 조직이 아직 인식하지 못한 중요한 문제를 찾아내야 합니다. 이는 당면한 요구사항을 그대로 구현하는 것에 집중하기보다, 실제 목표와 기존 제품 간의 불일치 원인을 깊이 파고드는 접근 방식을 의미합니다.

이러한 접근 방식은 사용자의 요청을 그대로 구현하는 데 그치지 않고, 왜 그런 요청이 발생했는지, 그리고 기존 제품이 실제 목표와 맞지 않는 근본적인 이유가 무엇인지를 탐구하는 데 중점을 둡니다. 즉, 여러 팀에서 반복적으로 발생하는 문제의 패턴을 분석하고, 시스템 전반의 비효율성을 개선하는 데 집중해야 합니다.

결과적으로 스태프 엔지니어는 개별적인 기술적 과제를 해결하는 것을 넘어, 조직 전체의 목표와 실행 간의 괴리를 해소하고 시스템적인 마찰을 줄이는 역할을 수행하게 됩니다. 이러한 관점의 전환은 단기적인 결과물 제공을 넘어 장기적인 제품 및 서비스의 방향성을 설정하는 데 필수적입니다.

srelens - 엔지니어와 AI 에이전트 모두를 위한 쿠버네티스 컨트롤룸

엔지니어와 AI 에이전트 모두를 위한 쿠버네티스 컨트롤룸인 srelens가 여러 터미널, 대시보드, 로그, 클러스터 컨텍스트를 오가는 복잡한 트러블슈팅 과정을 하나의 로컬 우선 데스크톱 워크스페이스로 통합합니다. 이 도구는 개발자가 여러 도구를 전환할 필요 없이 리소스 탐색, 이벤트 및 YAML 확인, 로그 추적, 터미널 사용, 포트 포워드 관리, 클러스터 조치까지 모든 작업을 조사부터 실행까지 한 곳에서 처리할 수 있도록 설계되었습니다.

기존에는 쿠버네티스 환경에서 문제를 해결하기 위해 다양한 도구를 오가며 컨텍스트를 전환해야 하는 비효율성이 있었습니다. srelens는 이러한 도구 전환의 필요성을 제거하여 엔지니어들이 단일 환경에서 전체 클러스터 상황을 파악하고 즉각적인 조치를 취할 수 있게 합니다. 이는 복잡한 쿠버네티스 환경에서 발생하는 문제 해결 시간을 크게 단축하고 작업 효율성을 높이는 데 중점을 둡니다.

사용자는 이 통합된 워크스페이스를 통해 리소스 탐색부터 로그 분석, 설정 변경에 이르는 일련의 과정을 끊김 없이 수행할 수 있습니다. 특히 AI 에이전트가 이 워크스페이스를 활용하여 복잡한 클러스터 환경을 이해하고 자동으로 조치를 실행하는 데도 활용될 수 있어, 개발 및 운영 환경 모두에서 강력한 통제력을 제공합니다.

Hister - 직접 통제하는 비공개 전체 콘텐츠 검색 인덱스

Hister는 사용자가 선택한 웹페이지와 파일의 전체 내용을 자체 서버에 저장하고 검색 결과에서 읽기 쉬운 미리보기를 제공하는 시스템입니다. 이 서비스는 사용자가 직접 통제하는 비공개 콘텐츠를 관리하고 검색 인덱스를 구축하는 데 중점을 둡니다.

Hister는 다양한 방법을 통해 자료를 수집하여 하나의 통합된 인덱스를 검색할 수 있도록 합니다. 구체적으로는 브라우저 확장 프로그램, 로컬 폴더 감시, 방문 기록 가져오기, 웹사이트 크롤링 등의 기능을 활용하여 필요한 자료를 모읍니다.

이렇게 수집된 자료는 웹, 터미널, CLI, HTTP API, MCP 등 여러 인터페이스에서 검색이 가능하도록 인덱싱됩니다. 이는 개발자들이 웹 콘텐츠와 로컬 파일에 접근하고 이를 시스템적으로 관리하며 검색할 수 있는 통합된 환경을 제공한다는 점에서 의미가 있습니다.

프로덕트 엔지니어의 사고방식 - 태스크 수행자에서 문제 해결의 주체로

인공지능(AI)이 명확한 명세를 코드로 빠르게 옮기는 작업을 수행하면서, 개발자에게 요구되는 차별점도 변화하고 있습니다. 이제 엔지니어의 핵심 역량은 주어진 태스크를 얼마나 잘 구현하는가보다, 실제로 무엇을 해결해야 하는지 정의하고 찾아내는 문제 해결 능력으로 이동하고 있습니다.

이러한 변화는 제품 엔지니어(Product Engineer)의 역할에 더욱 집중됩니다. 제품 엔지니어는 특정 기술 스택에 대한 깊은 지식보다는 제품과 사업에 대한 깊은 관심을 바탕으로 업무를 수행합니다. 이는 단순히 코드를 작성하는 것을 넘어, 기술적 제약을 이해하고 비즈니스 목표를 달성하기 위한 최적의 해결책을 모색하는 능력을 의미합니다.

결국 엔지니어는 기술 구현자에서 벗어나 비즈니스 문제를 정의하고 해결하는 주체로 포지셔닝해야 합니다. AI가 반복적인 구현 작업을 대체함에 따라, 엔지니어는 제품의 성공과 성장에 직접적으로 기여하는 전략적 사고를 통해 가치를 창출해야 합니다.

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

비전-언어-행동(VLA) 모델은 멀티모달 컨텍스트를 로봇 행동으로 전환할 수 있지만, 행동 디코더는 여전히 행동 복제(behavior cloning)를 통해 학습됩니다. 이는 시연된 운동 명령을 학습하는 데 중점을 두어 지시 사항 하에서 행동이 수행하는 국소 목표를 암묵적으로 남겨둡니다. 향후 기반 지도 학습은 프레임, 잠재 관측치, 궤적 또는 동작 표현을 통해 행동 학습을 풍부하게 하지만, 이러한 신호는 다가올 행동의 공유된 의미적 목표보다는 발생할 수 있는 특정 실현에 초점을 맞춥니다.

이에 연구진은 행동 수준의 의도를 행동 디코더로 압축하는 인텐션 증류(Intention Distillation, INDI)를 제안합니다. 학습 과정에서 고정된(frozen) 교사 VLM이 현재 관측치, 지시 사항, 대략적인 행동 요약 및 해당 실행 비디오에서 시연된 세그먼트를 해석합니다. 이 정보를 바탕으로 배포된 VLA 모델은 중간 디코더 레이어에서 결과적인 멀티모달 의도 표현을 복구하고 이를 사용하여 행동 예측을 행동의 전개 방식과 달성 목표 표현과 함께 조직합니다.

INDI를 적용한 결과, SimplerEnv-Bridge에서는 GR00T-N1.7이 64.3%에서 84.7%로, RoboCasa Kitchen에서는 제어된 GR00T-N1.7이 64.1%에서 70.3%로 향상되었습니다. 실제 환경 작업에서는 평균 성공률이 62.0%에서 68.7%로 개선되었으며, 장기 예측 작업에서는 최대 12.0% 포인트의 이득을 보였습니다.

분석 결과, 복구된 잠재 표현은 디코더에 의해 사용되며 행동 목표와 실행 진행 상황을 포착하고 다운스트림 예측을 목표 의존적인 방식으로 정리합니다. 이는 행동 디코더가 생성하는 행동의 의미적 목표를 명시적으로 모델링함으로써 이점을 얻는다는 것을 보여줍니다.

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

대규모 비전-언어 모델(VLM)은 다양한 멀티모달 작업에서 뛰어난 다재다능함을 보여주지만, 유머 이해는 이미지와 텍스트 양식 간의 개체, 사건, 맥락, 암묵적 관계 간의 미묘한 상호작용에 의존하기 때문에 여전히 어려운 과제로 남아 있습니다. 이러한 상호작용은 기존의 프롬프팅이나 선형 사고의 사슬 추론으로는 포착하기 어려운 복잡한 추론 체인을 포함합니다.

본 연구는 이러한 문제를 해결하기 위해 멀티모달 유머의 근본적인 인과적 및 맥락적 관계를 경량 그래프 기반 추론 구조로 나타내는 추론 프레임워크인 CaRGo-T(Causal Reasoning Graph-of-Thought)를 제안합니다. 이 그래프는 VLM에 의해 코드 기반 표현으로 직렬화되며, 이는 동일하거나 다른 VLM에 의해 해석되어 제로샷 또는 인컨텍스트 학습 환경에서 최종 예측을 생성할 수 있게 합니다.

다양한 형태의 코미디 콘텐츠(풍자, 반어법, 밈 등)에 걸쳐 CaRGo-T를 평가한 결과, 최신 상업용 및 오픈소스 VLM 실험에서 기존의 추론 기반 기준선보다 일관되게 성능을 향상시켰습니다. 구체적으로 유머 이해에서 약 1~20%, 유머 감지에서 약 1~3%의 성능 향상을 달성했습니다. 또한 상호 정보량 분석을 통해 CaRGo-T가 생성하는 추론 표현이 기준선 접근 방식보다 목표 출력과 관련된 더 많은 정보를 포함한다는 것을 확인했습니다.

CaRGo-T의 코드는 GitHub에서 공개되어 있으며, 이는 복잡한 멀티모달 추론을 그래프 기반으로 구조화하여 VLM의 성능을 개선하는 실질적인 방법을 제시합니다.

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

장기적인 오디오-비주얼 생성은 캐릭터의 정체성을 유지하고 사용자 제어를 따르며 확장된 시퀀스에서 안정성을 유지해야 하는 과제를 안고 있습니다. 이를 해결하기 위해 JoyAI-Echo-1.5라는 통합 오디오-비주얼 생성 시스템이 제시되었으며, 이는 두 가지 목적에 맞게 설계된 변형 모델을 포함합니다.

장편 비디오 변형은 여러 이전 샷의 시각적 증거와 음성 필터링된 오디오에서 파생된 화자 단서를 통합하는 조합 가능한 크로스샷 메모리를 도입합니다. 이를 통해 텍스트, 이미지, 메모리 조건의 유연한 조합 속에서 캐릭터의 지속적인 외모와 목소리 정체성을 가능하게 합니다. 세계 모델 변형은 이질적인 내비게이션 입력을 보정된 미터 6-DoF 카메라 궤적으로 변환하고 이를 기하학적으로 인식하는 조건 경로를 통해 주입하여 컨트롤러에 구애받지 않는 다양한 시점에서의 상호작용을 가능하게 합니다.

효율적인 장기 생성 지원을 위해 양방향 오디오-비주얼 백본을 점진적 교사 강제 및 자체 생성 롤아웃을 이용한 자기 기울기 강제(Self-Gradient Forcing)를 사용하여 인과적 몇 단계 생성기로 변환했습니다. 실험 결과, JoyAI-Echo-1.5는 크로스샷 일관성, 시각적 품질, 텍스트 정렬, 음성 충실도 면에서 기존 장편 비디오 기준선보다 향상된 성능을 보였습니다.

특히 세계 모델 변형은 WBench에서 평균 81.7점으로 1위를 차지했으며 SANA-WM-Bench에서 선도적인 시각적 품질과 장기 지속성을 달성했습니다. 이는 메모리, 기하학적 제어, 롤아웃 인식 훈련이 일관성 있는 스토리와 지속적으로 진화하는 인터랙티브 세계를 생성하기 위한 실용적인 기반을 제공함을 시사합니다.

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

최근 연구는 명시적인 사고 과정(CoT) 주석이 없는 자료, 예를 들어 풀이 과정이나 교과서 유도 과정을 활용하기 위해 다음 청크 추론 강화 학습(next-chunk reasoning RL) 방법을 제안합니다. 이 방법은 모델이 암묵적인 추론 흔적을 생성하고 다음 텍스트 청크를 예측하는 능력으로 보상받도록 훈련합니다.

기존 연구들은 주로 전통적인 지도 미세 조정(SFT) 기준과 비교하여 평가했는데, 이로 인해 성능 향상이 RL 공식 자체에서 비롯된 것인지 아니면 모델이 no-CoT 데이터에 더 효과적으로 노출된 결과인지 불분명하다는 질문이 제기되었습니다. 연구진은 이 질문에 답하기 위해 다음 청크 추론 RL과 함께 no-CoT 및 긴 CoT 데이터를 동시에 훈련하는 단순하지만 간과되었던 대안인 혼합 SFT(Mixed SFT)를 비교 분석했습니다.

혼합 SFT는 단순함에도 불구하고 다음 청크 추론 RL보다 훨씬 높은 후처리(post-RLVR) 성능 한계를 달성하면서도 훈련 컴퓨팅 자원을 60배 이상 절감할 수 있었습니다. 이러한 이점은 도메인 내 수학적 추론과 도메인 외 추론 작업 모두에서 일관되게 나타났습니다.

또한 연구는 사전 RLVR 정확도가 반드시 후처리 RLVR 정확도의 향상으로 이어지지 않는다는 점을 보여주며, no-CoT 훈련 전략을 전체 후처리 파이프라인의 맥락에서 평가해야 할 필요성을 강조합니다.

Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning

힌트 기반 강화 학습은 장기 에이전트 작업에서 보상 희소성 문제를 해결하기 위해 롤아웃 전에 전문가 궤적의 접두사를 유지하여 정책이 성공에 더 가까운 상태에서 탐색하도록 돕습니다. 이러한 방법의 효과는 가이드 깊이, 즉 유지할 궤적의 길이에 달려 있습니다. 기존 방법들은 이 깊이를 결정론적 스칼라로 취급하거나, 샘플 간 이질성을 무시하거나, 추가 롤아웃 비용을 감수하는 샘플별 탐색을 사용했습니다.

연구진은 유용한 가이드는 단일 최적점보다는 가우시안 분포의 밴드 내에 존재하며, 이 밴드의 중심과 퍼짐이 정보량 프로파일을 나타낸다고 발견했습니다. 이에 따라 연구팀은 Agent-G²라는 가우시안 가이던스 프레임워크를 제안했습니다. 이 방법은 정책 최적화를 위해 이미 수집된 롤아웃으로부터 온라인으로 중심과 퍼짐을 추정하여 각 작업별 깊이를 도출하며, 별도의 탐색 롤아웃이나 학습된 깊이 예측기가 필요 없습니다.

Agent-G²는 중심을 전역 기준선과 클러스터별 난이도를 결합하고, 퍼짐은 클러스터 내 분산을 추적하여 깊이를 결정합니다. 이 방법은 ALFWorld와 WebShop 환경에서 Qwen2.5-1.5B 및 7B-Instruct 모델에 대해 평가되었습니다. Agent-G²는 샘플별 탐색의 1/3 미만 비용으로 샘플별 프로빙보다 ALFWorld에서 2.3점, WebShop에서 3.9점, Qwen2.5-1.5B/7B-Instruct에서 7.4점의 성능 향상을 보였습니다.

MARS: Multi-Specialist LLM Relay System for Competitive Programming

대규모 언어 모델은 코드 생성에 능숙하지만, 경쟁 프로그래밍 환경에서는 기존의 멀티 에이전트 파이프라인이 일반적인 계획가, 코더, 디버거 역할로 작업을 분배하고 알고리즘 선택을 백본에만 위임하는 근본적인 실패 모드를 드러냅니다. 이에 따라 본 연구는 MARS(Multi-Agent Relay of Specialized LLMs)라는 프롬프팅 기반의 시스템을 제시합니다.

MARS는 각 에이전트가 동적 계획법, 그래프, 문자열, 기하학 등 특정 주제의 전문가 역할을 수행하며, 알고리즘 이론 코퍼스에 대한 검색 증강 생성(RAG)을 통해 지식을 확보합니다. 문제에 직면했을 때 검색 기능이 관련 전문가 팀을 선택하고, 시작 에이전트가 초기 C++17 솔루션을 작성한 후, 각 단계에서 샌드박스 환경에서 공개 예제와 비교하며 전문가가 초안을 유지, 수정 또는 인계하는 과정을 거칩니다.

이러한 프로세스는 최종적으로 단일 인프라 수정 단계를 통해 보일러플레이트를 정규화하며, 코딩 과정에서 발생하는 비용과 효율성을 크게 개선합니다. Gemma 4를 사용한 CodeContests 테스트 분할에서 MARS는 0.624%의 통과율을 달성했으며, 이는 직접 프롬프팅 대비 2.3회 기록된 파이프라인 단계로, CodeSIM(0.731) 대비 3.3배 낮은 벽시계 비용과 작업당 토큰 사용량의 현저한 분산을 보였습니다.

MARS의 소스 코드는 GitHub에서 공개되어 있습니다.

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

AI 에이전트들이 중앙 조정 없이 자율적으로 수학적 발견을 수행한 연구 결과가 발표되었습니다. 이 연구는 서로 다른 모델 계열의 AI 에이전트들이 'Station'이라는 개방형 멀티 에이전트 환경에서 공동의 연구 목표를 추구하며 실험하고 협력하여 과학 문헌을 구축하는 과정을 다룹니다.

Station 환경에서 에이전트들은 알파이볼브(AlphaEvolve) 카탈로그의 12가지 구성 문제와 추가 사례 연구를 통해 기존 문헌에 비해 다섯 가지 문제에 대해 새로운 결과를 얻었습니다. 구체적으로 유한체체 카케야 집합의 새로운 무한족, 11차원에서의 새로운 정확한 604점 키싱 구성, 이산화된 카케야 바늘 및 부호 불확실성 문제에 대한 새로운 기록, 그리고 에르도스 최소 중첩 문제에 대한 상당히 개선된 하한 경계가 발견되었습니다. 또한 에이전트들은 북 램지 수의 새로운 무한족도 발견했습니다.

이 연구의 중요한 점은 에이전트들이 단순히 수치적 구성만을 도출한 것이 아니라, 이러한 구성이 작동하는 방식을 설명하는 정리와 분석까지 생성했다는 것입니다. 이는 발견된 결과를 수학자들이 더 쉽게 이해하고 후속 연구를 진행할 수 있도록 해석 가능성을 높입니다. 연구팀은 이러한 발견의 과정을 투명하게 공개하기 위해 모든 원시 에이전트 대화, 증명, 검증 코드를 공개했습니다.