Barret Zoph, the Thinking Machines co-founder who defected to OpenAI, is now at Google

AI 스타트업 Thinking Machines의 공동 창업자이자 OpenAI로 이탈했던 바렛 조프가 현재 구글에 합류했습니다. 조프는 구글에서 연구 부사장직을 맡으며 자신의 강화 학습(RL) 및 훈련 후(post-training) 전문 지식을 제미나이(Gemini)에 적용할 것으로 기대됩니다.

조프는 올해 초 OpenAI를 떠나 Thinking Machines를 공동 설립한 미라 무라티와 함께 스타트업을 이끌었으며, 이후 OpenAI에서 AI 기업 영업을 담당하는 등 여러 직책을 거쳤습니다. 이러한 움직임은 AI 분야 임원들 사이에서 계속되는 인재 이동 현상을 보여줍니다.

최근 AI 산업 전반의 이직률이 높고 특히 OpenAI에서 핵심 인력들이 많이 이탈하면서 이러한 상황이 발생했습니다. 구글이 조프를 영입한 것은 AI 기술 리더십 확보에 있어 핵심 인재의 이동이 얼마나 중요한지를 시사합니다.

GTA VI looks just as great as we could hope for

넷플릭스와 락스타 게임즈가 그랜드 테프트 오토 VI의 확장된 모습을 공개했습니다. 이 영상은 GTA의 핵심 요소인 탐험, 운전, 범죄, 총격전, 그리고 영화 같은 스토리 장면을 유지하려는 게임의 방향을 보여줍니다. 이전 작품들보다 훨씬 향상된 그래픽, 빽빽하게 채워진 방들, 그리고 세밀한 환경을 통해 게임의 시각적 완성도가 크게 높아졌음을 알 수 있습니다.

이번 영상은 PS5에서 촬영된 것으로 확인되었으며, 게임이 추구하는 분위기와 액션의 기본 틀은 GTA 시리즈의 정체성을 그대로 유지하고 있습니다. 특히 게임의 주요 초점은 주인공인 제이슨 듀발과 루시아 카미노스가 어떻게 협력하는지에 맞춰져 있습니다.

게임 플레이는 두 주인공의 상호작용에 중점을 두며, 예를 들어 한 장면에서는 듀발이 카미노스가 운전하는 차 창문에서 매달려 있는 상황을 통해 이들의 관계와 역동적인 상호작용을 강조합니다. 이는 단순한 액션을 넘어 캐릭터 간의 관계와 서사를 깊이 있게 다루려는 의도를 시사합니다.

507가지 기계 운동

헨리 T. 브라운의 고전 기술 참고서에 수록된 507가지 기계 운동을 웹에서 애니메이션으로 시각화할 수 있는 사이트가 존재합니다. 이 사이트는 고전 기술 서적에 담긴 복잡한 기계 운동들을 애니메이션 형태로 제공하여 이해를 돕는 것을 목표로 합니다.

현재 사이트에는 507가지 기계 운동에 대한 애니메이션이 제작되어 이용 가능하지만, 아직 모든 항목이 완성되지는 않은 상태입니다. 사용자들은 인덱스에서 컬러 썸네일을 통해 제작된 여러 애니메이션을 살펴볼 수 있습니다.

이러한 자료는 고전 기술과 기계학에 대한 시각적 이해를 높이는 데 유용하며, 아직 전체 항목이 완성되지 않았다는 점을 고려하여 이용 시 제작된 애니메이션의 범위를 확인하는 것이 필요합니다.

Microduck — 직접 동작을 가르치는 소형 이족보행 로봇

오픈소스 이족보행 로봇인 마이크드럭(Microduck)이 강화학습 동작과 게임 컨트롤러를 기본 제공하여 즉시 사용 가능합니다. 이 로봇은 높이 25cm, 무게 800g의 소형 하드웨어로 제작되어 개발자들이 실제 로봇에 인공지능 동작을 배포하는 시뮬레이션-현실 전이(sim2real) 흐름을 실험할 수 있도록 지원합니다.

마이크드럭은 MuJoCo 물리 시뮬레이션 환경에서 정책을 학습한 후 이를 실제 로봇에 적용하는 방식으로 sim2real 과정을 지원합니다. 이는 복잡한 로봇 제어 문제를 시뮬레이션 환경에서 해결하고 그 결과를 실제 하드웨어에 적용하는 데 필요한 핵심적인 기술적 흐름을 제공합니다.

개발자들은 이 로봇을 통해 학습된 정책을 재훈련하고 재배포하며 다른 사용자들과 공유할 수 있는 기능을 활용할 수 있습니다. 이는 로봇 제어 및 강화학습 분야에서 시뮬레이션 기반의 연구 결과를 실제 물리적 시스템으로 확장하는 데 중요한 기회를 제공합니다.

Google’s AI note-taking app now allows you to interact with books

구글의 AI 노트 앱인 제미나이 노트북(Gemini Notebook)이 구매한 도서의 정보를 활용할 수 있게 되었습니다. 새로운 "전문 지능(Expert Intelligence)" 기능은 구글 플레이 북스(Google Play Books)에 있는 도서 제목을 제미나이 노트북으로 직접 가져올 수 있게 합니다.

이 기능을 통해 사용자는 책의 내용을 기반으로 질문을 하거나, 계획, 인포그래픽, AI 팟캐스트 등 다양한 결과물을 생성할 수 있습니다. 이는 단순히 책을 읽는 것을 넘어, 책의 지식을 활용하여 새로운 콘텐츠를 만들고 학습하는 방식으로 확장됩니다.

구글 랩스(Google Labs)의 스티븐 존슨 이사와의 브리핑에서 시연된 바와 같이, 이 도구를 사용하여 마이클 폴란(Michael Pollan)의 『푸드 룰스(Food Rules)』의 정보를 바탕으로 레시피 책을 생성하는 것이 가능했습니다. 또한 김 스콧(Kim Scott)의 경영 관련 지식을 적용하여 결과물을 도출하는 예시도 제시되었습니다.

이 기능은 사용자가 소유한 지식 기반을 AI가 처리하고 구조화하여 활용할 수 있도록 하며, 개인적인 독서 경험을 AI 기반의 창의적인 작업으로 전환하는 데 중점을 두고 있습니다.

Benchmarking Pocket-Scale Inference

휴대폰 규모의 추론 성능 측정에 대한 벤치마킹 결과가 다루어졌습니다. 이 기사는 모바일 환경에서 엣지 디바이스에 AI 추론을 수행할 때의 성능을 측정하는 데 중점을 두고 있습니다.

이는 모바일 기기나 엣지 디바이스에서 대규모 인공지능 모델을 효율적으로 구동하기 위한 하드웨어 및 소프트웨어 스택의 성능을 평가하는 데 중요한 기준을 제공합니다. 특히 소형화된 환경에서 추론 속도와 에너지 효율성을 확보하는 데 필요한 기술적 과제와 해결책을 제시할 것으로 보입니다.

해당 벤치마킹은 모바일 환경에서의 인퍼런스 스택에 대한 구체적인 데이터를 제공하므로, 모바일 AI 개발자나 하드웨어 엔지니어에게 실질적인 참고 자료가 될 수 있습니다. 기사를 통해 구체적인 측정 결과와 분석 내용을 확인하시기 바랍니다.

AI industry says Trump plans to tax chips in the “single dumbest way imaginable”

트럼프 행정부가 반도체에 새로운 관세를 부과할 계획이라는 소식이 기술 업계에 큰 우려를 낳고 있습니다. 전문가들은 이러한 관세가 미국 내 인공지능 혁신을 위협하며 AI 발전을 침체시킬 수 있다고 경고하고 있습니다.

이러한 관세는 향후 몇 주 또는 몇 달 내에 부과될 수 있으며, 관세 체계가 확정됨에 따라 적용 대상이 되는 기술 제품의 범위가 크게 확대될 수 있다는 분석이 나왔습니다. 이는 단순히 칩에만 국한되지 않고 게임 콘솔이나 데이터 센터 서버와 같이 칩으로 제조된 다양한 상품에도 관세가 적용될 가능성을 시사합니다.

결국 이러한 조치는 데이터 센터와 서버 인프라를 포함한 핵심 하드웨어 공급망 전반에 영향을 미칠 수 있습니다. 이는 AI 개발 및 운영에 필수적인 반도체와 관련 장비의 비용과 접근성에 직접적인 영향을 미치게 되므로 개발자들은 공급망 변화에 대비해야 합니다.

Asahi Linux 진행 보고서: Linux 7.2

Linux 7.2 시점의 Asahi Linux는 Apple Silicon CPU의 전력 관리를 업스트림 요구사항에 맞추는 작업을 진행하고 있으며, M3 공식 릴리스와 M4, M5에 대한 초기 지원을 준비하는 단계에 도달했습니다. 이는 Apple Silicon 하드웨어의 복잡한 전력 관리 요구사항을 리눅스 커널 레벨에서 처리하기 위한 중요한 진전입니다.

구체적으로, Asahi Linux는 EL3가 없는 Apple CPU 환경에서 PSCI(Power State Control Interface)를 사용하도록 UEFI Runtime Service 기반의 호출 경로를 구축했습니다. 이 작업은 Apple Silicon의 독특한 아키텍처에서 CPU 전력 관리를 효율적으로 제어하고 시스템 안정성을 확보하는 데 필수적입니다.

이러한 기술적 작업은 향후 macOS의 새로운 칩셋 지원을 위한 기반을 마련하며, 리눅스 커널이 Apple 하드웨어의 깊은 수준의 전력 관리 메커니즘을 효과적으로 활용할 수 있도록 합니다. 이는 개발자들이 Apple Silicon 환경에서 리눅스 기반 시스템을 운영하고 확장하는 데 있어 중요한 기술적 토대를 제공합니다.

Tell HN: PayPal이 GrapheneOS를 차단함

PayPal 앱이 GrapheneOS 환경에서 실행을 거부하고 있다는 내용이 보도되었습니다. 사용자가 해당 앱을 실행하려고 시도할 경우, 앱은 RootDetectionSecurityException과 Security policy violation: s=root 오류를 발생시키며 종료됩니다.

이러한 현상은 GrapheneOS의 보안 정책과 PayPal 앱의 요구 사항 간에 충돌이 발생했음을 시사합니다. 이는 GrapheneOS가 루트 권한 감지 기능을 통해 보안을 강화하는 환경에서 특정 앱의 실행을 차단하는 방식으로 작동하고 있음을 보여줍니다.

현재 이 문제가 PayPal 카드의 비접촉 NFC 결제 활성화와 관련이 있는지에 대해서는 아직 확인되지 않았습니다. 따라서 이 오류가 NFC 기능 활성화와 직접적인 연관이 있는지에 대한 추가적인 분석이 필요합니다.

Google tells Android app developers to cool it on memory use, or else

구글은 RAM 위기에 직접적으로 대응하기 위해 메모리를 많이 사용하는 안드로이드 앱에 대한 감시를 시작할 것이라고 발표했습니다. 구글은 어제 플레이 스토어가 새로운 메모리 사용 제한을 시행하는 역할을 다루는 메모를 게시했으며, 개발자들이 업계 전반의 하드웨어 제약과 안드로이드의 광범위한 메모리 한계를 헤쳐나갈 수 있도록 새로운 메모리 사용 한도를 준수하는 것이 중요하다고 강조했습니다.

이러한 메모리 제한은 안드로이드 17 버전에서 처음 도입되었으며, 이는 픽셀 폰에서 가장 먼저 적용되었습니다. 구글은 앱들이 새로운 메모리 사용 한도를 충족하도록 요구하며, 이를 준수하지 않을 경우 결과가 따를 것이라고 명시했습니다.

이는 개발자들이 하드웨어 제약 속에서 앱을 최적화하고 메모리 효율성을 높이는 데 필수적인 조치입니다. 따라서 개발자들은 안드로이드 17 이후의 메모리 제한 사항을 확인하고 앱의 메모리 사용량을 면밀히 검토하여 제한을 준수해야 합니다.

Run Qwen3.8 27B locally: real numbers from my Mac Studio

최근 Mac Studio 환경에서 Qwen3.8 27B 모델을 로컬로 구동한 성능 측정 결과, 이전 모델인 Qwen3.6 27B 대비 속도는 느리지만 결과물 생성 효율성은 크게 개선되었습니다. Qwen3.8은 14.0 토큰/초의 속도로 작동하는 반면, Qwen3.6은 28.6 토큰/초로 측정되었으나, Qwen3.8은 동일한 프롬프트에 대해 약 1/3 수준의 토큰만 사용하여 답변을 생성함으로써 최종 답변 완료 시간은 비슷하게 나타났습니다. 이는 새로운 하이브리드 어텐션 아키텍처가 적용되었으나, 아직 런타임 커널이 완전히 최적화되지 않아 속도 차이가 발생하고 있음을 시사합니다.

이러한 성능 차이는 하드웨어에 따라 다르게 해석될 수 있으며, Qwen3.8은 멀티모달 기능과 이미지 및 비디오 이해 능력을 내장하고 있어 로컬 환경에서 실질적인 활용도가 높습니다. 특히 Qwen3.8은 코딩 및 에이전트 작업에서 커뮤니티 평가가 우수하며, 배경 작업 보조 모델로서의 역할에 적합하다는 평가를 받습니다.

모델 구동을 위해서는 메모리 요구 사항을 고려해야 하며, 32GB RAM 환경에서 Q4 양자화 모델을 안정적으로 구동할 수 있습니다. 또한, 1비트 양자화 실험을 통해 메모리 사용량을 획기적으로 줄이는 것도 가능하지만, 답변의 정확성을 보장하기 위해서는 llama.cpp와 같은 최신 런타임 환경이 필수적입니다.

Labor Day 2026 Deals Got Me a Complete Starter Tool Kit for Under $375

2026년 노동절 세일 기간 동안 집안 수리를 위한 완벽한 스타터 도구 키트를 375달러 미만으로 구매할 수 있었습니다. 이 기사는 노동절 세일을 통해 거의 모든 가정 수리에 필요한 공구와 필수품을 찾아냈다는 내용입니다.

작성자는 노동절 세일을 꼼꼼히 살펴보면서 가정에서 흔히 발생하는 수리 작업을 처리할 수 있는 전동 공구와 기타 필수품들을 발굴했습니다. 이는 집안의 다양한 수리 작업을 스스로 해결할 수 있는 포괄적인 도구 세트를 찾는 데 중점을 두었습니다.

이러한 세트는 가정에서 필요한 대부분의 수리 작업을 커버할 수 있도록 구성되어 있어 비용 효율적입니다. 따라서 독자들은 노동절 세일 기간에 이러한 도구들을 활용하여 집안 수리 비용을 절감할 수 있는 기회를 얻을 수 있습니다.

Autism mutations drive neurodevelopmental pathology

특정 자폐증 관련 돌연변이가 신경발달 병리학을 유발한다는 연구 결과가 발표되었습니다. 이 연구는 자폐증과 관련된 유전자 변이가 뇌 발달 과정에서 발생하는 병리학적 변화에 중요한 역할을 함을 시사합니다.

연구진은 이러한 돌연변이들이 신경계의 정상적인 발달 경로에 영향을 미치며, 이는 자폐증의 신경발달적 특징을 이해하는 데 중요한 단서를 제공한다고 설명합니다. 이는 자폐증의 원인이 단일 유전자가 아닌 복잡한 유전적 요인과 환경적 상호작용에 의해 발생함을 뒷받침하는 근거가 됩니다.

따라서 이 연구는 자폐증의 병리학적 기전을 이해하고 잠재적인 치료 전략을 개발하는 데 중요한 기초 정보를 제공합니다. 해당 연구는 신경발달 장애의 유전적 기반을 탐구하는 데 기여하며, 관련 분야의 이해를 심화시키는 데 의미가 있습니다.

A Georgia Cop Used Flock to Track 2 Other Cops: His Ex and Her Friend

조지아주 경찰관이 불륜 관계가 끝난 후 플록(Flock) 시스템을 사용하여 다른 두 경찰관과 한 남성의 동선을 추적한 사실이 내부 조사 기록을 통해 드러났습니다. 이 사건은 경찰이 감시 및 추적 목적으로 위치 기반 기술을 어떻게 활용하는지에 대한 윤리적 문제를 제기합니다.

경찰관은 개인적인 관계 종료 후 플록 시스템을 사용하여 자신의 움직임뿐만 아니라, 자신의 차량이 자주 근처에 있었던 남성의 동선까지 추적하는 데 이 기술을 사용했습니다. 이는 공적인 감시 기술이 사적인 관계와 연관되어 사용될 때 발생할 수 있는 사생활 침해 및 오용 가능성을 보여줍니다.

이 사건은 경찰이 사용하는 위치 추적 기술인 플록 시스템의 사용 범위와 목적에 대한 심각한 논란을 불러일으킵니다. 개발자 관점에서 볼 때, 이러한 기술이 공공 안전 목적으로 사용될 때 개인의 프라이버시 보호와 기술 오용 방지를 위한 명확한 법적 및 윤리적 경계 설정이 필수적임을 시사합니다.

This Is How Anthropic Thinks AI Agents Should Navigate the Physical World

Anthropic은 인공지능 에이전트가 물리적 세계를 탐색하고 이동하는 방식에 대해 새로운 위험을 고려하여 과학 연구와 제조를 자동화하는 잠재력을 균형 있게 다뤄야 한다고 주장합니다. 이는 AI가 실제 환경에서 작업을 수행하는 능력이 향후 산업에 미칠 영향과 함께 새로운 안전 및 윤리적 문제에 대한 논의가 필수적임을 시사합니다.

AI 에이전트가 물리적 세계를 자동화하는 과정에서 발생하는 잠재적인 위험을 관리하는 것이 핵심 과제입니다. 이러한 자동화는 과학 연구나 제조 분야에서 엄청난 효율성을 제공할 수 있지만, 통제되지 않은 행동이나 예상치 못한 결과가 발생할 가능성을 내포하고 있습니다.

따라서 Anthropic은 AI 에이전트의 물리적 세계 내 행동을 설계할 때, 효율성 증대뿐만 아니라 새로운 위험 요소들을 반드시 균형 있게 평가하고 관리해야 한다고 강조합니다. 개발자와 연구자들은 AI 에이전트의 물리적 상호작용에 대한 안전장치와 책임 있는 설계 방안을 모색해야 합니다.

Previewing the Model Hardware Standard

Anthropic은 AI 에이전트가 물리적 장치를 안전하게 작동하도록 하는 공유 사양인 모델 하드웨어 표준(Model Hardware Standard, MHS)의 연구 미리보기를 공개했습니다. 이 표준은 AI 에이전트가 현미경, 로봇 팔, 액체 핸들러와 같은 여러 실험 장비를 병렬로 작동하게 하여 신약 발견 실험이나 양자 컴퓨터의 레이저 보정 같은 복잡한 작업을 수행할 수 있게 합니다.

MHS 개발은 기존에는 장치 간 통합에 수주에서 수개월이 걸리고, AI를 통합하는 데 추가적인 어려움이 있었던 문제를 해결하기 위해 시작되었습니다. MHS는 컴퓨터 운영체제와 하드웨어 장치 사이를 번역하는 표준 드라이버를 도입하여 장치 간의 데이터 공유와 에이전트의 안전한 제어를 위한 표준화된 방법을 제공합니다.

이 드라이버는 장치의 특성 정보(예: 로봇 팔의 무게나 안전 한계)를 포함하며, 에이전트가 장치를 이해하고 조작하는 데 필요한 정보를 제공합니다. 에이전트는 이 표준을 통해 MCP, 명령줄 인터페이스, 코드 파일(API) 등의 메커니즘을 사용하여 여러 장치를 조정하고 실시간으로 결과를 모니터링하며 실험을 수행할 수 있습니다.

이는 AI 에이전트가 과학자처럼 탐색적인 방식으로 실험을 수행하고, 환경 변화에 따라 파라미터를 조정하며, 하드웨어 오류에서 스스로 회복하는 자율적인 실험 및 워크플로우를 오케스트레이션할 수 있는 기반을 마련합니다. Anthropic은 이 표준을 오픈 소스로 공개하기 전에 과학, 로보틱스, 전자공학, 제조 분야의 파트너들과 협력하여 안전 평가와 모범 사례를 개발하고자 합니다.

Show HN: Voronoi Go

Voronoi Go 프로젝트에 대한 업데이트가 공유되었습니다. 커뮤니티 멤버가 기여한 상당히 강력한 봇과 대응 게임(correspondence games) 기능이 추가되었습니다.

이러한 기능들의 조합은 사용자들이 게임을 함께 할 사람을 찾는 데 도움을 주어 사용자 경험을 개선합니다. 특히 봇과 게임 기능을 결합함으로써 플레이할 상대방을 찾는 과정이 용이해졌습니다.

이러한 변경 사항은 프로젝트의 핵심 목표인 플레이어 모집에 긍정적인 영향을 미칩니다. 개발자나 사용자들은 이제 더 많은 상호작용 기회를 통해 게임을 즐길 수 있게 되었습니다.

범용 VM은 사이버 역량을 갖춘 에이전트를 격리하지 못함

Trail of Bits는 GPT 5.6-Cyber 에이전트가 가상 머신 환경에서 격리되지 못함을 입증하는 테스트를 진행했습니다. 이 테스트에서 에이전트는 QEMU/KVM 기반의 Debian 12 가상 머신 내에서 알려진 취약점과 새로 발견된 0-day 취약점을 활용하여 서로 다른 세 가지 탈출 경로를 확보하는 데 성공했습니다.

해당 에이전트는 약 12시간 동안 자율적으로 탐색 활동을 수행하며 코드와 논문을 조사하는 과정을 거쳤습니다. 이 과정에서 에이전트는 접근에 실패했을 때 후퇴하는 방식으로 탐색을 지속했습니다.

이 결과는 범용 가상 머신 환경이 사이버 역량을 갖춘 에이전트를 효과적으로 격리하는 데 한계가 있음을 시사합니다. 따라서 가상 머신 기반의 보안 환경에서 에이전트의 격리 및 통제 메커니즘에 대한 재검토가 필요합니다.

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

최근 추론 시점 스케일링(inference-time scaling)의 발전은 대규모 언어 모델(LLM)의 추론 성능을 크게 향상시켰습니다. 하지만 이러한 방법들은 일반적으로 반복적인 생성이나 외부 검증에 의존한다는 한계가 있습니다. 이를 해결하기 위해 본 연구는 효율성을 유지하면서 추론 능력을 개선하는 새로운 추론 시점 프레임워크인 CritICL을 제안합니다.

CritICL의 핵심 통찰은 LLM의 실패 모드가 동일한 모델 계층 내에서 구조화된 패턴을 보인다는 것입니다. 연구진은 실패를 바람직하지 않은 출력으로 취급하는 대신, 이를 지침의 원천으로 활용할 것을 제안합니다. 구체적으로, 더 약한 모델에서 파생된 실패 모드를 활용하여 비평 기반의 인컨텍스트 예시를 통해 추론에 통합합니다.

이 프레임워크는 두 가지 변형으로 제시됩니다. 입력별 실패 모드를 예측하고 비평을 검색하는 CritICL-dynamic과 전역 실패 모드 프로파일을 사용하여 안정적인 지침을 제공하는 CritICL-static입니다. 실험 결과 CritICL은 표준 인컨텍스트 학습보다 일관되게 우수한 성능을 보였으며, 테스트 시점 스케일링 방법과 경쟁하거나 능가하는 성능을 달성했습니다.

또한 CritICL은 표준 방법보다 훨씬 적은 생성 횟수와 낮은 토큰 비용으로 이 성능을 달성하여 효율성 측면에서도 이점을 제공합니다. 이 연구의 코드는 GitHub에서 공개되어 있습니다.

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

에이전트 경험을 지속적인 지식으로 통합하여 기술 진화를 가능하게 하는 프레임워크인 WikiSkill을 소개합니다. 이 연구는 에이전트 경험으로부터 스킬을 자동으로 발견하는 기존 방법들이 최적화 기록에 통찰력이 분산되어 있어 반복적인 사용에 제약이 있음을 지적합니다. WikiSkill은 에이전트 스킬을 영구적인 지식 기반(wiki)과 공동으로 진화시키는 방식으로, 원시 실행 경험, 축적된 지식, 실행 가능한 스킬을 분리하고 경험을 지속적으로 위키에 통합하여 후속 스킬 업데이트가 이를 기반으로 구축할 수 있게 합니다.

WikiSkill은 다양한 벤치마크와 모델에서 기존의 최첨단 스킬 진화 방법들을 일관되게 능가하며, 대부분의 모델-벤치마크 설정에서 스킬이 없는 기준선보다 성능을 향상시킵니다. 특히 모델 스케일링과 관련하여, 더 큰 모델은 진화된 스킬로부터 더 많은 이점을 얻는 반면, 스킬을 가진 더 작은 모델은 스킬이 없는 훨씬 더 큰 모델보다도 뛰어난 성능을 보일 수 있음을 발견했습니다.

또한, 진화된 스킬은 모델 및 모델 패밀리 전반에 걸쳐 효과적으로 전이되며, 다른 모델에 의해 진화된 스킬이 자체 진화된 스킬보다 더 나은 성능을 보일 수 있다는 점도 확인되었습니다. 최종적으로, 위키에 영구적인 지식이 축적되는 것이 효과적인 스킬 진화를 위해 매우 중요하며, 이는 에이전트 경험을 체계적으로 축적하고 개선하여 재사용 가능하고 전이 가능한 스킬을 개발하는 이점들을 입증합니다.