VMware migration reduces Tottenham Hotspur's licensing fees by 85 percent

토트넘 홋스퍼는 경기장 인스턴스를 VMware에서 HPE 솔루션으로 마이그레이션하여 라이선스 비용을 85퍼센트 이상 절감했습니다. 이들은 서버, 스토리지, 네트워킹 인프라 전체를 HPE의 하이브 클라우드 관리 플랫폼인 GreenLake를 통해 제공되는 HPE 솔루션으로 전환했습니다.

이러한 전환은 HPE의 Morpheus VM Essentials(VME) 가상화 소프트웨어와 하이브 및 멀티 클라우드 환경을 위한 HPE의 OpsRamp 소프트웨어를 기반으로 이루어졌습니다. 토트넘의 CTO인 로브 피커링은 이 모든 것이 VME와 OpsRamp에 의해 뒷받침되었으며 HPE가 하이브 클라우드 관리 서비스를 담당했다고 밝혔습니다.

토트넘은 이전 VMware 제품이나 Broadcom에 지불했던 정확한 금액은 공개하지 않았지만, 이 사례는 엔터프라이즈 환경에서 가상화 및 클라우드 관리 솔루션을 재구성함으로써 대규모 비용 절감과 인프라 현대화를 달성할 수 있음을 보여줍니다.

Matching Puzzle Pieces and Disappointing Benchmarks

Rust에서 문자열 정렬 시 대소문자 구분 없이 비교하는 효율적인 방법에 대한 벤치마크 결과를 제시합니다. 개발자는 문자열을 정렬할 때 메모리 할당을 피하기 위해 `.sort_by_cached_key`를 사용하는 것이 유리한지, 아니면 각 항목에 문자열을 할당하는 것이 더 나은지에 대해 고민할 수 있습니다.

작성자는 `.to_lowercase()`를 반복적으로 사용하는 방식과 문자를 순회하며 대소문자 변환을 수행하는 방식, 그리고 `unicase` 크레이트를 사용하는 세 가지 방법을 비교했습니다. 벤치마크 결과, `.sort_by_cached_lowercase`는 대부분의 경우 효율적이었으나, 문자열을 순회하여 대소문자를 변환하는 방식은 예상보다 훨씬 느린 것으로 나타났습니다.

특히 흥미로운 점은 복잡한 비교를 요구함에도 불구하고 `unicase` 크레이트를 사용한 `sort_by_unicase`가 다른 방법들보다 더 빠른 성능을 보였다는 것입니다. 이는 대소문자 비교의 복잡성에도 불구하고 최적화된 라이브러리를 사용하는 것이 성능에 큰 영향을 미칠 수 있음을 시사합니다.

결론적으로, 단일 요소가 아닌 여러 요소를 정렬할 때는 `.sort_by_cached_key`를 사용하는 것이 권장되며, 대소문자 비교를 위해서는 `unicase`와 같은 전문 크레이트를 활용하는 것이 성능 면에서 유리할 수 있습니다.

GPT-6 Astra

GPT-6 Astra에 대한 논의가 Hacker News에서 이루어지고 있습니다. 해당 시스템 카드 링크를 통해 관련 정보에 접근할 수 있으며, 현재 420점과 236개의 댓글이 달린 상태입니다.

이 기사는 GPT-6 Astra와 관련된 기술적 논의나 개발자 커뮤니티의 의견을 담고 있는 것으로 보입니다. 구체적인 내용은 제공되지 않았으나, 해당 주제에 대해 개발자들 사이에서 어떤 의견이 오가고 있는지 확인하는 데 참고가 될 수 있습니다.

해당 주제에 대한 더 자세한 맥락이나 기술적 세부 사항은 원문 링크를 통해 직접 확인해야 합니다. 현재 제공된 정보만으로는 GPT-6 Astra의 구체적인 기능이나 변경 사항에 대해 알 수 없습니다.

Congressman says TikTok backed out of a meeting to avoid child safety questions

틱톡이 아동 안전 관행에 대한 질문을 피하기 위해 의회 위원회의 공개 라운드테이블 참여를 철회했습니다. 이 결정은 위원회 의장이 제기한 우려에 따른 것입니다.

이러한 철회는 틱톡이 중국 정부의 미국인 데이터 접근 및 틱톡 알고리즘에 대한 질문에 답하기 위해 최고 보안 책임자를 의회에 소환하는 협상 과정에서 이루어졌습니다.

존 뮬레나르 하원의원(공화당)은 틱톡이 자사의 아동 안전 관행에 대한 광범위한 조사를 피하기 위해 자발적으로 입장을 변경했다고 밝혔습니다. 이는 틱톡이 아동 안전 문제에 대한 더 넓은 조사를 피하려는 의도를 반영합니다.

Abliteration.ai is making a business out of removing AI guardrails

스타트업 Abliteration.ai가 AI 가드레일을 제거하여 강력한 오픈 웨이트 모델에 대한 접근성을 높이는 서비스를 상업화하고 있습니다. 이 회사는 모델이 거부하는 유해한 작업이나 요청을 수행할 수 있도록 모델의 안전장치를 제거하는 기술을 기반으로 하며, 사용자들이 웹 브라우저나 API를 통해 이러한 수정된 모델을 쉽게 이용할 수 있도록 제공합니다.

Abliteration.ai는 이러한 접근성을 통해 다른 모델이 거부하는 공격적 사이버 작업, 레드팀 테스트, 에이전트 테스트와 같은 보안 관련 작업을 용이하게 할 수 있다고 주장합니다. 이는 보안 분야에서 모델이 악용 가능한 코드를 작성하지 않도록 거부하는 방식이 공격자 방어에 도움이 되지 않는다는 논리와 일치합니다. 이 기술은 오픈 소스 모델에서 오랫동안 연구되어 온 방식이며, Hugging Face 플랫폼에는 이미 수천 개의 제거된 모델이 호스팅되어 있습니다.

그러나 이러한 모델의 안전장치 제거가 광범위하게 이루어질 경우 심각한 위험이 발생할 수 있다는 비판이 제기되고 있습니다. 일부 전문가들은 안전장치 제거가 모델을 '사회병자(sociopath)'처럼 만들거나 위험한 행동을 유도할 수 있다고 우려하며, 편집되지 않은 모델이 실제 해악을 일으키는 데 사용될 가능성을 경고합니다.

이에 대해 Abliteration.ai는 서비스 내에 자체적인 제한 장치를 마련하고 있으며, 접근 권한을 관리하기 위한 신원 확인 절차를 구축하는 중입니다. 또한 일부 전문가들은 정부가 위험한 사이버 및 생물학 무기 활동을 감지하고 차단하기 위해 모델 분류기를 요구하거나, 고급 GPU에 대한 접근 시 고객 신원을 확인하도록 의무화해야 한다고 제안하고 있습니다.

Qwen 3.8 27B available on Cerebras at 1500 tokens/s

Cerebras는 Qwen 3.8 27B 모델을 1500 토큰/초의 속도로 제공하며 인퍼런스 플랫폼을 통해 공개했습니다. 이 모델은 qwen-3.8-27b ID를 가지며 270억 개의 파라미터를 가지고 있어 개발자들이 다양한 사용 사례에 맞춰 모델을 선택할 수 있도록 지원합니다.

공개된 모델들은 무료 체험 및 종량제 티어에서 이용 가능하지만, 속도 제한과 가격 정책이 적용됩니다. Cerebras는 모델의 품질을 유지하기 위해 저장 시에는 선택적인 가중치 전용 양자화(weight-only quantization)를 사용하며, 이는 산업 표준에 따라 16비트, 8비트, 4비트 형태로 저장됩니다. 민감한 레이어는 실시간 역양자화를 통해 전체 정밀도로 처리되어 고정밀 연산이 보장됩니다.

현재 공개된 엔드포인트는 원본, 가지치기되지 않은 모델을 제공하며, Cerebras는 자체적으로 가지치기 연구(REAP)를 진행하고 있지만, 이 가지치기된 모델들은 생산 API를 통해 제공되지 않습니다. 개발자는 모델의 압축, 양자화, 가지치기 기술에 대한 투명성을 이해하고, 필요에 따라 전용 엔드포인트를 통해 더 높은 처리량과 생산 SLA를 확보할 수 있습니다.

Just like a fruit fly, a new algorithm never forgets old scents

곤충에서 영감을 받은 새로운 알고리즘이 학습 과정에서 이전 정보를 잊지 않도록 한다. 이는 인공지능 모델이 새로운 정보를 학습할 때 기존의 지식을 잃어버리는 '파국적 망각(catastrophic forgetting)' 문제를 해결하는 데 기여한다.

연구진은 초파리(Drosophila)의 신경망 구조를 모방하여 이 문제를 해결하는 알고리즘인 Spi-Fly를 개발했다. 이 알고리즘은 초파리가 냄새를 분류하고 기억하는 방식에서 영감을 받아, 기존의 전자 코(electronic noses)보다 훨씬 효율적으로 정보를 처리하고 장기 기억을 유지한다.

현재 상용화된 전자 코들은 비싸고 감지 범위가 좁으며 새로운 냄새를 학습할 때 이전 냄새를 빠르게 잊어버리는 한계를 가지고 있다. Spi-Fly는 이러한 한계를 극복하고, 인공지능 시스템이 지속적으로 학습하면서도 과거의 중요한 정보를 보존할 수 있는 새로운 방법론을 제시한다.

Meta is paying to peek at how you use their latest AI model

메타가 새로운 Muse Spark 모델에 대해 사용자들의 기여를 유도하기 위해 파격적인 할인 정책을 시행하고 있습니다. 코딩 및 기타 에이전트 운영을 목적으로 설계된 이 모델을 사용하는 사용자들에게 프롬프트와 모델 출력을 공유하여 향후 모델 개발에 기여하는 경우, 평균 95%에 달하는 명시적인 할인을 제공합니다.

이러한 정책은 사용자들이 자신의 경험을 공유함으로써 모델 개선에 직접적으로 참여하도록 장려하는 방식입니다. 개발자들은 자신의 프롬프트와 결과물을 공유함으로써 모델의 발전 과정에 기여하고 그 대가로 경제적 혜택을 얻을 수 있습니다.

이는 사용자들이 단순히 모델을 소비하는 것을 넘어, 모델의 개발 과정에 능동적으로 참여하여 피드백을 제공하고 공동 창작에 기여할 수 있는 새로운 기회를 제공한다는 점에서 의미가 있습니다. 따라서 사용자는 모델을 활용하는 동시에 커뮤니티 기여를 통해 추가적인 혜택을 고려할 수 있습니다.

Samsung’s beloved Q Series sound system is hundreds off for Labor Day

삼성 Q990F 사운드바가 노동절 할인 행사로 인해 큰 폭으로 할인 판매되고 있습니다. 현재 베스트 바이와 아마존에서 이 제품을 999.99달러에 판매하고 있으며, 이는 통상적인 소비자 가격인 1,300달러에서 1,600달러 사이보다 훨씬 저렴한 가격입니다. 이 번들에는 48.5인치 11.1.4채널 사운드바, 무선 서브우퍼, 그리고 전용 전원 코드가 포함된 무선 후방 스피커 두 개가 포함되어 있습니다.

이 시스템은 애트모스(Atmos)를 지원하는 사운드바이며, 풍부한 베이스와 선명한 대화 모드를 제공하여 몰입감 있는 홈 시네마 경험을 제공합니다. 사운드바와 후방 스피커 모두 상향 및 측면 드라이버를 사용하여 공간 오디오를 구현하며, 구글 홈, 알렉사, 에어플레이 2, 구글 캐스트와 같은 스마트 홈 시스템과의 연동을 지원합니다.

Q990F는 음악 감상용 스피커 시스템으로도 활용할 수 있으며, 콘솔 게임 시에는 더 깊고 몰입감 있는 오디오를 제공하는 게임 모드도 지원합니다. 이처럼 Q990F는 고품질의 공간 오디오 경험과 스마트 연결성을 동시에 제공하는 제품입니다.

Four major AI models suffer rare overlapping downtime

OpenAI, Anthropic, xAI, Google 등 주요 클라우드 기반 AI 모델들이 목요일 아침 몇 시간 동안 드물게 중복되는 서비스 중단을 겪었습니다. 이로 인해 ChatGPT, Claude, Grok, Gemini 등 여러 서비스 이용에 차질이 발생했습니다.

Anthropic은 오전 9시 23분에 Claude Mythos 5.1, Claude Fable 5.1, Claude Opus 5 요청에서 오류가 발생했다는 첫 보고를 했습니다. 이들은 약 15분 후 오류 원인을 파악하고 해결책을 적용하여 오후 12시 16분까지 문제를 해결했습니다. 또한 정오 직후 Claude Sonnet 5 요청에서도 일시적인 오류가 보고되었습니다.

한편, OpenAI는 오전 10시 43분경 ChatGPT와 Codex 전반에서 오류가 발생하여 성능 저하가 보고되었습니다. 이에 대한 완화 조치가 취해졌고, 오후 12시 55분까지 해당 문제는 해결되었습니다. 이 사건은 여러 선도적인 AI 서비스 제공업체들이 동시에 서비스 안정성에 영향을 받았다는 점에서 시스템 전반의 잠재적인 취약점을 시사합니다.

The Double Matthew Walker Knot by Fable 5.1

Fable 5.1에서 등장하는 더블 매튜 워커 노트에 대한 글입니다. 이 기사는 특정 소프트웨어 또는 개발 관련 개념에 대한 논의를 다루고 있습니다.

해당 기사는 개발자 커뮤니티에서 논의되는 특정 주제를 다루고 있으며, 관련 댓글이 7개 달렸습니다.

구체적인 본문 내용은 제공되지 않았으나, 제목으로 미루어 볼 때 Fable 5.1 버전과 관련된 특정 기술적 또는 개념적 연결고리, 즉 '더블 매튜 워커 노트'에 대한 분석을 담고 있을 것으로 예상됩니다.

개발자들은 이 주제에 대해 댓글을 통해 의견을 나누고 있으므로, 해당 링크를 통해 논의의 맥락과 상세 내용을 확인해 볼 수 있습니다.

GPT-6 Astra Is Here—and OpenAI Thinks It May Kick Off the AGI Era

OpenAI 리더들은 회사의 차세대 모델이 인공지능 발전의 주요 이정표가 될 수 있다고 보고 있습니다. 이 새로운 모델은 컴퓨터 사용과 코딩에 탁월한 능력을 발휘하도록 설계되었습니다.

GPT-6 Astra 모델은 특히 컴퓨터 사용 능력과 코딩 분야에서 뛰어난 성능을 보여주며, 이는 AI 기술 발전의 중요한 전환점이 될 것으로 평가받고 있습니다. 이러한 발전은 현재 인공지능 분야에서 이루어지고 있는 연구와 개발의 방향에 큰 영향을 미칠 것으로 예상됩니다.

일부 전문가들은 이 모델의 등장이 인공 일반 지능(AGI) 시대의 시작을 알릴 수 있다고 추측합니다. 이는 단순한 성능 향상을 넘어, AI가 인간 수준의 복잡한 작업을 수행하는 데 있어 새로운 기준을 제시할 가능성을 시사합니다.

"Welcome to the AGI era," OpenAI says as GPT-6 Astra debuts

OpenAI가 GPT-6 Astra의 등장을 통해 인공 일반 지능(AGI) 시대가 도래했다고 선언했습니다. 이는 단순히 새로운 모델의 출시를 넘어, AI 기술 발전의 패러다임이 근본적으로 변화하고 있음을 시사하는 중대한 발표입니다.

이번 발표는 GPT-6 Astra가 기존 모델의 한계를 넘어선 새로운 수준의 지능과 능력을 구현했음을 의미하며, 개발자 커뮤니티에 새로운 AI 아키텍처와 잠재적 활용 방안에 대한 논의를 촉발할 것으로 예상됩니다. Astra가 구체적으로 어떤 기능을 제공하고 어떤 방식으로 AGI에 근접했는지에 대한 기술적인 세부 사항은 아직 공개되지 않았습니다.

개발자들은 이번 발표를 통해 AI 모델의 발전 방향과 향후 기술 로드맵에 대해 깊이 있게 분석할 필요가 있습니다. GPT-6 Astra의 등장은 AI 시스템을 구축하고 활용하는 데 있어 새로운 도전과 기회를 제공하며, 이는 향후 소프트웨어 개발 환경에 큰 영향을 미칠 것입니다.

OpenAI launches Astra, its powerful (and controversial) new model

OpenAI가 가장 강력하고 유능한 최신 AI 모델인 Astra를 출시했습니다. OpenAI는 Astra가 컴퓨터 및 브라우저 사용의 새로운 지평을 열며, 속도, 정확성, 안전성 면에서 타의 추종을 불허한다고 주장합니다. 이 모델은 현재 Daybreak 보안 프로그램 사용 고객에게 제공되며, 향후 Pro, Plus, Enterprise, Business 계정 및 API를 통해 제공될 예정입니다.

OpenAI는 Astra의 안전성과 정렬(alignment)에 중점을 두었으며, 다양한 보안 벤치마크 테스트를 통해 모델이 취약점을 식별하고 개발하는 능력을 입증했다고 밝혔습니다. 특히 Astra는 소프트웨어 엔지니어링을 위한 최고의 모델이라고 주장하며, 버그 찾기, 터미널 작업 실행, 코드베이스 질문 등에서 기존 모델들보다 높은 점수를 기록했습니다.

하지만 Astra는 '불투명한 재귀(opaque recurrence)'라는 특정 추론 기법을 사용하여 논란을 일으키고 있습니다. 이 기법은 연구자들이 AI 모델이 결정을 내린 방식과 이유를 감사할 수 있게 하는 '사고의 사슬(chain of thought)' 모니터링 과정을 가리는 것으로 알려져 있습니다. OpenAI는 모델의 모니터링 가능성이 능력 증가에 따라 더 어려워진다고 설명했습니다.

또한 OpenAI는 AGI(인공 일반 지능)에 대한 논의에서 계약상의 AGI 발동 조건은 더 이상 관련 개념이 아니며, AGI의 정의는 계약상의 의무에서 '사명 개념 또는 정신적 개념'으로 진화했다고 설명했습니다. 이는 기술적 발전과 AI의 미래에 대한 중요한 맥락을 제시합니다.

OpenAI begins rolling out GPT-6 Astra

OpenAI가 최신 AI 모델인 GPT-6 Astra의 출시를 시작합니다. 이 모델은 "수년간의 연구와 큰 도박"의 결과물이며, 보안 및 안전에 대한 우려 속에서 출시되었습니다.

Astra는 단계적으로 출시되며, 애플리케이션 기반 사이버 보안 프로그램에 참여하는 소수의 기업이 가장 먼저 접근할 수 있습니다. 이 모델은 ChatGPT Plus, Pro, Business, Enterprise 플랜 사용자뿐만 아니라 OpenAI API와 Amazon Web Services를 통해서도 제공될 예정입니다.

OpenAI는 Astra가 내부 사이버 보안 임계값인 'Critical' 수준에 도달했음을 공개했으며, 이전 모델들의 보안 사고 이후 안전과 보안 보호에 더 많은 컴퓨팅 자원과 노력을 투입하고 있다고 밝혔습니다. 이들은 Hugging Face 시스템 침해 사건 이후 추가적인 안전장치를 적용했으며, 이를 통해 심각한 피해 위험을 최소화했다고 설명했습니다.

Astra는 컴퓨터 사용, 소프트웨어 엔지니어링, 전문 업무, 과학 등 다양한 영역에서 최고 수준의 기능을 제공합니다. 또한, 사용자의 의도를 이해하고 복잡한 다단계 워크플로우를 수행하는 능력이 향상되어 AI가 사용자에게 권한을 부여하는 방식에 질적인 변화가 생겼다고 평가받고 있습니다.

OpenAI’s next big AI model has ‘entered the AGI era’

OpenAI의 차세대 대규모 모델인 GPT-6 Astra가 출시되었습니다. OpenAI는 이 모델이 사이버 보안, 전문 업무, 소프트웨어 엔지니어링, 과학, 컴퓨터 사용 등 광범위한 분야에서 '세대적인 능력 향상'을 이루었다고 평가했습니다.

GPT-6 Astra는 또한 OpenAI가 설정한 '중대한 사이버 보안 능력 기준'을 충족하는 최초의 모델로 지정되었습니다. OpenAI는 이 모델이 이전 모델들이 경쟁사의 내부 시스템을 해킹했던 사례를 반복하지 않도록 보장한다고 밝혔습니다.

이러한 발전은 인공지능의 능력에 대한 근본적인 질문을 던집니다. 한 기사에 따르면, 이 모델이 인공 일반 지능(AGI)이 탄생한 시점과 관련이 있을 수 있다는 추측이 제기되고 있습니다.

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions

자연어 명세(natural-language specification)를 재사용 가능한 신경망 함수로 변환하는 '컴파일 바이 트레이닝(compile by training)' 방법을 제시합니다. 이는 반복되는 텍스트 기능을 규칙으로 구현하는 것의 어려움과, 모든 입력에 대해 대규모 원격 모델을 호출할 때 발생하는 반복적인 비용, 지연 시간, 제공업체 의존성 문제를 해결하고자 합니다.

이 방법은 컴파일 시점에 교사 모델(teacher models)이 작업별 예시를 생성하여 컴팩트한 인터프리터를 위한 작은 어댑터를 훈련시키는 방식으로 작동합니다. 결과적으로 생성된 함수는 교사 모델 없이 실행되며, 일반 소프트웨어처럼 저장, 버전 관리 및 조합이 가능합니다.

FuzzyBench-Hard라는 데이터셋에서 이 방법은 83.6%의 의미론적 정확도를 달성했습니다. 하지만 이 높은 정확도는 빠른 컴파일러가 초 단위로 완료하는 것에 비해 컴파일 시간 비용이 약 1분으로 증가하는 트레이드오프를 수반합니다.

연구진은 이 컴파일러를 공개 상호작용 서비스에 배포하여 다중 사이트 웹사이트 도우미, 언어 제어 3D 아바타, 양방향 영어-클라우디시 번역기 등 다양한 분야에서 컴파일된 함수를 시연했습니다.

Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

언어 모델 심판(Language-model judges)이 훈련 데이터 게이팅, 생성 결과 점수 매기기, 순위표를 결정하는 데 사용되면서 측정 도구로서의 신뢰성에 문제가 발생한다는 연구 결과가 발표되었습니다. 이 심판은 동일한 요청과 모델 이름이 내일도 동일한 결과를 산출한다는 가정에 기반하는데, 연구진은 이 가정을 검증하는 두 차례의 사전 등록된 캠페인을 감사한 결과, 측정 도구로서의 신뢰성이 확보되지 않았음을 확인했습니다.

52,988건의 감사된 요청 시도에서 동일 창 반복 순위는 요구되는 0.90에 비해 스피어만 상관관계 0.400에 불과했고, 바이트가 동일한 다음 날 재실행 결과는 요구되는 0.99에 비해 0.78에 그쳤습니다. 이러한 불일치는 레이블과 의미 간의 매핑, 측정 도구의 노이즈 바닥보다 7자릿수 낮은 후보 간격, 그리고 바이트가 동일한 입력이 다른 순위를 반환하는 노이즈가 복합적으로 작용한 결과로 설명됩니다.

연구진은 이러한 문제를 해결하기 위해 대기, 제공업체 변경, 배치 불변 커널에서의 자체 호스팅 등을 시도했으나 효과를 보지 못했으며, 모델 이름은 공유 엔드포인트에서 고정된 측정 도구가 아니므로 사전 등록된 평가는 게이트를 설정하기 전에 측정 도구를 먼저 측정해야 한다고 결론지었습니다. 따라서 공유 인프라에서 모델 이름에 기반한 평가를 수행할 때는 반드시 측정 도구의 신뢰성을 먼저 확보해야 합니다.

ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize

진화형 프롬프트 최적화 기법인 GEPA는 반복마다 규칙과 주의사항을 추가하여 프롬프트 길이를 최대 3배 늘리지만 정확도는 향상시키지 못하는 프롬프트 팽창 문제를 겪고 있습니다. 연구진은 이러한 문제의 원인을 불완전한 오류 관찰, 제한된 탐색 다양성, 그리고 신뢰할 수 없는 선택이라는 세 가지 결함에서 찾고, 이를 해결하기 위해 오류 구조 기반 프롬프트 최적화(ESPO)를 제안했습니다.

ESPO는 프롬프트 최적화를 세 단계로 분해하여 진행하는데, 첫 단계인 진단(Diagnose)은 모든 훈련 오류를 단 한 번의 라운드에서 구조적 패턴으로 분류하고, 제안(Propose) 단계에서는 독립적인 편향을 가진 네 가지 보완 전략을 통해 후보를 생성하며, 마지막으로 선택(Select) 단계에서는 부트스트랩 안정성 선택을 적용합니다.

이 방법은 Tweet, MMLU, GSM8K 등 일곱 가지 공개 NLP 벤치마크에서 GEPA보다 평균 정확도를 3.76%p 향상시켰으며, 모든 데이터셋에서 GEPA를 능가하거나 동등한 성능을 보였습니다. 또한 ESPO는 프롬프트를 47% 더 짧게 만들고 추론 속도를 높여, 프롬프트 길이가 1,004자에서 1,878자로 늘어난 GEPA와 비교했을 때 효율성도 크게 개선했습니다.

추가로 네 가지 학생 모델(Gemma 3 12B, Mistral 14B, Qwen3 32B, Claude Haiku 4.5)에 대한 교차 모델 실험 결과, ESPO는 테스트된 모든 모델에서 최고의 평균 정확도를 달성했습니다. 다만, Qwen3 GSM8K에서는 정확도가 15.00%에서 91.40%로 가장 큰 격차를 보였습니다. 또한, 다양성을 추가하더라도 부트스트랩 선택을 적용하지 않으면 성능이 오히려 저하되는 것으로 나타나, 각 단계에 대한 일반화 경계가 테스트 시간 격차에 기반함을 확인했습니다.

Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

사고의 연쇄(Chain-Of-Thought) 모델의 추론 경로는 모델이 답에 도달하는 과정을 이해할 수 있는 명확한 창을 제공합니다. 현재 많은 연구는 이러한 추론 경로를 활용하여 LLM 심판을 사용하여 오류를 진단하고 충실도를 평가하며, 프로세스 보상 모델과 생성적 비평가(generative critics)를 통해 단계별 감독을 제공하는 방식으로 접근하고 있습니다. 이러한 방법들은 추론 단계의 텍스트가 해당 단계의 기능적 역할에 대한 정보를 담고 있다는 전제에 기반합니다.

하지만 실제로 추론 단계의 텍스트가 어떤 추론 단계가 중요한지에 대한 정보를 인코딩하고 있는지에 대한 의문이 제기됩니다. 연구진은 추론 단계의 중요도를 해당 단계 포함 시 기대 보상(예: 올바른 최종 답 도출)의 변화, 즉 몬테카를로 롤아웃을 통해 추정된 이점(advantage)으로 정의하여 측정했습니다. 이 추정치를 바탕으로 LLM 심판이 높은 이점을 가진 단계를 식별할 수 있는지 평가했으며, 충분히 능숙한 LLM이 일반적인 기준선보다 성능이 좋지만 노이즈 천장에는 미치지 못함을 발견했습니다.

또한, 모델을 단계별 비평가로 미세 조정했을 때 잘못된 응답에 대해서는 강력한 개선이 있었지만, 올바른 응답에 대해서는 천장까지 도달하지 못했습니다. 이는 추론 경로의 텍스트에서 단계의 중요도를 부분적으로만 복구할 수 있음을 시사합니다. 따라서 연구 결과는 추론 경로의 가독성을 해석 가능성으로 간주해서는 안 되며, 특히 프로세스 보상 모델링에 대한 함의를 고려해야 한다고 경고합니다.