OpenAI 윤리 책임자, 합류 1년도 안 돼 퇴사

OpenAI의 윤리 책임자가 합류한 지 1년도 채 되지 않아 퇴사했다는 소식이 보도되었습니다. 이 인물은 OpenAI 내에서 윤리 및 안전 관련 정책을 총괄하는 중요한 역할을 맡고 있었기 때문에 이번 사임은 조직 내부의 윤리적 방향성과 리더십에 대한 질문을 던지고 있습니다.

이러한 인사의 갑작스러운 변화는 OpenAI가 AI 개발 과정에서 윤리적 책임을 어떻게 관리하고 있는지에 대한 논의를 촉발할 수 있습니다. 특히 대규모 언어 모델을 개발하는 과정에서 윤리적 고려 사항이 점점 중요해지고 있는 상황에서, 책임자의 교체는 조직의 우선순위와 내부 문화에 어떤 영향을 미치는지 주목하게 만듭니다.

이번 사임은 OpenAI가 AI 안전 및 윤리 문제에 대한 내부 구조와 정책을 재검토하고 있는지에 대한 맥락을 제공합니다. 개발자 커뮤니티에서는 이러한 리더십 변화가 향후 OpenAI의 제품 개발 방향과 윤리적 기준에 어떤 영향을 미칠지 관심이 집중되고 있습니다.

The Human Is the Loop

최근 인공지능(AI) 사용에서 잠시 벗어났던 경험을 통해 AI를 활용하는 과정에서 형성된 비건강적인 습관에 대해 성찰하게 되었다. AI를 사용하면서 많은 시간을 할애했지만, 이는 오히려 지적 능력과 자신감을 약화시키고 불안감을 키우는 습관 형성의 도구로 작용했다는 깨달음을 얻었다.

작성자는 AI를 활용하는 과정에서 수많은 에이전트 대화와 작업 분할을 통해 비효율적인 압박감을 느꼈다고 설명한다. 예를 들어, 여러 작업에 대한 자동화나 외주를 추구하는 과정에서 실제 필요한 효율성 증대보다는 도구를 최대한 활용하려는 반사적인 욕구가 생겼다. 이러한 습관은 실제 업무나 개인적인 성장에 도움이 되지 못하고, 결과적으로 불필요한 스트레스와 죄책감을 유발하는 원인이 되었다.

AI 도구를 업무에 도입하면서 사용자는 단순히 작업을 처리하는 것을 넘어, 인간이 해야 할 사색과 성찰의 시간을 빼앗기는 경향이 있다. 작성자는 AI를 인간과 작업 사이의 중개자 역할로 사용하며 스트레스를 회피하려 했으나, 이는 실질적인 결과물보다는 단순한 기록이나 텍스트로 남는 결과를 낳았다.

결론적으로 AI 기술 자체가 본질적으로 중독성이 있는 것은 아니지만, 사용자가 도구를 어떻게 설계하고 사용하는지에 따라 의존성과 습관화 효과가 발생한다. 따라서 AI를 사용할 때에는 사용자가 주도권을 잃지 않도록 사용의 목적을 의도적으로 설정하고, 인간이 루프(loop) 안에 머물도록 통제하는 것이 중요하다.

Gen Z has rediscovered the joy of going to the movies

젠지 세대가 영화 관람의 즐거움을 재발견했다는 내용의 기사가 보도되었습니다. 이 기사는 문화적 트렌드 변화에 초점을 맞추고 있으며, 젊은 세대 사이에서 영화 관람이 다시 인기를 얻고 있는 현상을 다루고 있습니다.

기사는 이러한 변화가 어떻게 발생했으며, 구체적으로 어떤 요인들이 영향을 미쳤는지에 대한 분석을 제공합니다. 이는 단순히 영화 소비 행태를 넘어, 세대 간의 문화적 경험과 여가 활동의 변화를 이해하는 데 중요한 시사점을 제시합니다.

해당 기사는 문화적 현상을 심층적으로 탐구하며, 현대 사회에서 미디어가 개인의 경험과 정서에 미치는 영향을 탐색합니다. 독자들은 이 기사를 통해 현재의 문화적 흐름과 세대별 소비 패턴의 변화를 파악할 수 있습니다.

LLM Evals에 대해 알아야 할 모든 것

AI 응답의 품질을 실무적으로 평가하는 방법에 대한 실질적인 지침이 정리되었습니다. 700명 이상의 엔지니어와 PM에게 AI 평가 방법을 가르쳐 온 Hamel Husain 팀이 강의에서 반복적으로 받은 질문들을 모아 정리한 FAQ 문서입니다.

이 문서는 단순히 벤치마크 점수를 제시하는 것이 아니라, 사용자가 AI 응답이 실제로 좋은지 나쁜지를 어떻게 확인해야 하는지에 대한 실무적인 답변을 모았습니다. 이는 AI 평가에 대한 이론적인 접근을 넘어 실제 제품이나 서비스에 적용할 수 있는 구체적인 기준을 제공한다는 점에서 실무자들에게 큰 도움이 될 것입니다.

따라서 이 문서를 통해 개발자와 PM들은 벤치마크 점수에만 의존하지 않고, AI 응답의 품질을 객관적으로 판단하고 평가하는 실질적인 방법을 습득할 수 있습니다. 이는 AI 시스템을 설계하고 개선하는 과정에서 정확하고 효과적인 평가 기준을 수립하는 데 필수적인 맥락을 제공합니다.

Saber denies replacing Rideshare Stimulator’s writers with ChatGPT

Unigine이 개발한 라이드쉐어 게임인 라이드쉐어 스티뮬레이터에 대해 Saber가 AI를 사용했는지에 대한 논란이 제기되었습니다. 전 라이드쉐어 스티뮬레이터의 리드 작가였던 스텔라 사코(Stella Sacco)는 Saber가 개발 도중에 ChatGPT로 작가를 대체했으며 모든 승객 목소리도 AI로 만들어졌다고 주장했습니다.

이에 대해 Saber의 CEO 매튜 카르크(Matthew Karch)는 Saber나 Unigine 모두 AI를 사용하여 작가를 대체하지 않았다고 반박했습니다. 하지만 사코는 Bluesky에 글을 통해 자신이 리드 작가였으며 개발 도중에 ChatGPT로 대체되었다고 주장하며, 승객 목소리 역시 AI로 제작되었다고 밝혔습니다.

사코는 이러한 내용이 Steam에서 공개되지 않았거나 개발 방향이 변경되었을 가능성을 시사했습니다. Saber는 라이드쉐어 스티뮬레이터를 운전 시뮬레이션 게임으로 설명하고 있습니다.

이 논란은 게임 개발 과정에서 AI 기술이 콘텐츠 제작에 어떻게 사용되었는지에 대한 투명성과 공개 여부에 대한 질문을 던집니다. 개발자들이 AI를 활용할 때 콘텐츠 제작 과정과 결과물에 대한 명확한 공개 기준이 필요함을 보여줍니다.

Xirp - Spotify가 만든 조직 컨텍스트 기반 AI 코딩 환경

AI 코딩 도구를 사용하면 코드 생성 속도는 빨라졌지만, 에이전트가 시스템의 전체 배경을 이해하지 못하여 운영상 잘못된 결정을 내릴 수 있다는 문제가 제기되었습니다. 이는 기술적으로는 정확할지라도 실제 운영 환경에서는 오류를 발생시킬 수 있는 문제입니다.

이러한 문제는 단순히 문서가 부족해서 발생하는 것이 아니라, 필요한 정보를 검색하고 가져오는 검색(retrieval)의 문제에서 기인합니다. 시스템의 배경 지식과 코드가 Slack 대화 기록, 담당자의 기억, 오래된 README 파일, Confluence 문서 등 여러 곳에 분산되어 있기 때문에 AI 에이전트가 일관되고 정확한 컨텍스트를 확보하기 어렵습니다.

따라서 AI 코딩 도구의 성능을 높이기 위해서는 코드 생성 속도 개선뿐만 아니라, 분산된 조직 지식과 문서를 통합적으로 검색하고 활용할 수 있는 시스템 구축이 필수적입니다. 에이전트가 정확한 의사결정을 내릴 수 있도록 모든 관련 정보를 체계적으로 연결하는 것이 중요합니다.

Show GN: BuildIt – Forces you to explain every line an AI writes before you merge

개발 워크플로우에서 인공지능을 활용하는 방식에 대한 새로운 접근법이 제시되었습니다. 저자는 자신이 경험한 "바이브 코딩"이라는 패턴을 발견했는데, 이는 Claude Code나 Codex 같은 AI 에이전트가 코드를 빠르게 작성하고 사용자가 실행하여 작동을 확인한 후 병합하는 방식입니다.

하지만 이러한 방식은 코드가 작동하는 이유나 다음 버그가 숨어있는 위치를 설명할 수 없다는 한계를 가집니다. 즉, 코드를 작성하고 병합한 후 시간이 지난 뒤에 그 결과에 대한 이해가 부족해지는 문제가 발생합니다.

이러한 문제점을 해결하기 위해 저자는 BuildIt을 개발했습니다. BuildIt은 AI가 작성한 모든 줄을 병합하기 전에 사용자가 그 코드가 작동하는 이유를 설명하도록 강제하는 도구입니다. 이는 AI 기반 코딩 작업에서 투명성과 설명 가능성을 확보하여 개발자가 코드의 맥락을 완전히 이해하고 유지보수할 수 있도록 돕는 것을 목표로 합니다.

5th Heat Dome Expands Across Europe: 40°C+ Target Western and Central Europe

이번 여름의 다섯 번째 열돔이 유럽 전역으로 확장되면서 서유럽과 중앙 유럽 지역의 최고 기온이 40°C를 넘어서는 상황입니다. 강력한 북쪽의 따뜻한 기류가 상층 대기 열 이상 현상을 유발하며, 프랑스, 영국, 이탈리아, 중앙 유럽, 발칸 반도에 걸쳐 극심한 고온 현상이 발생하고 있습니다.

이러한 열돔은 대륙 중앙에 자리 잡은 고기압 능선이 형성되어 따뜻한 공기를 가두는 방식으로 작동하며, 하층 대기가 압축되고 가열되어 지표면 온도가 40°C에서 43°C에 육박하게 만듭니다. 특히 열돔이 지속되면서 야간 기온이 22°C에서 26°C 이하로 떨어지지 않아 인체에 심각한 생리적 스트레스를 가중시키고 에너지 그리드 수요를 급증시키고 있습니다.

이러한 극심한 고온은 건설 노동자나 농부 등 야외에서 일하는 사람들의 열 관련 질병 위험을 높이며, 특히 취약 계층에게는 열사병이나 열탈진의 위험을 증가시킵니다. 또한 고온과 높은 습도는 체감 온도를 높여 열지수(Heat Index)를 통해 실제 위험도를 파악해야 하며, 이는 심장마비나 호흡기 질환 증가와 같은 건강 문제로 이어질 수 있습니다.

이번 주말 동안 이베리아 반도에서는 최고 기온이 42~44°C에 달할 것으로 예상되며, 독일과 벨기에 등 중앙 유럽 지역도 금요일과 토요일에 36°C에서 40°C에 이르는 기온을 기록할 전망입니다. 기상 패턴의 장기적인 변화에 대한 예측도 함께 모니터링할 필요가 있습니다.

CFTC declares market emergency, orders Kalshi to continue to operate in New York

상품선물거래위원회(CFTC)는 시장 안정성을 확보하기 위해 비상 권한을 행사하여 KalshiEX, LLC의 시장 비상 상황 통보에 응하고 해당 거래소가 계속 운영되도록 명령했습니다. 이러한 조치는 뉴욕 주 법무장관이 해당 거래소에 대해 제기한 소송과 관련하여 이루어졌습니다.

뉴욕 주 법무장관은 7월 31일에 KalshiEX, LLC가 전국적으로 이벤트 계약을 제공하는 것을 금지하고 360억 달러의 손해배상을 요구하는 소송을 제기했습니다. 이 소송은 상품거래법(CEA)이 요구하는 파생상품 거래에 대한 통일된 전국 시장 제공 의무와 관련되어 있습니다.

CFTC는 이러한 의무를 이행하고 시장의 질서와 신뢰를 보장하기 위해 행동했습니다. 위원장은 파생상품 거래소는 주별 게임법의 패치워크 아래 규제되어서는 안 되며 주 경계를 넘어 운영되는 금융 시장임을 강조했습니다. 따라서 뉴욕 주가 이러한 주 경계를 넘는 금융 시장을 규제할 권한이 없다고 밝혔습니다.

CFTC는 이러한 관할권을 보호하기 위해 여러 주에 대해 소송을 제기했으며, 이는 연방 법원의 권한을 지키기 위한 조치입니다. 이 사건은 주 정부가 CFTC 규제 대상 상품 거래소에 대해 연방 차원에서 집행 조치를 취하려는 시도와 맞물려 진행되고 있습니다.

코드 리뷰도 배워야 하는 기술이다

코드 리뷰는 단순히 결함을 탐지하는 것을 넘어 교육, 규범 유지, 변경 통제, 사고 예방, 그리고 지식 전달까지 담당하는 기술입니다. 이는 개발자들이 연습과 교육을 통해 지속적으로 향상시킬 수 있는 역량입니다.

실제 코드 리뷰 과정에서 발견된 문제들은 단순한 버그를 넘어 시스템 안정성과 관련된 심각한 이슈를 포함합니다. 예를 들어 세 건의 PR에서 동시 파일 쓰기 문제, 구형 aws CLI와 새 옵션 간의 비호환성, 그리고 tarball과 checksum의 비원자적 갱신과 같은 기술적인 결함들이 발견되었습니다.

이러한 발견들은 코드 리뷰가 기술적 깊이를 요구하며, 단순한 문법 검사를 넘어 시스템의 변경 통제와 안전성을 확보하는 데 필수적인 과정임을 보여줍니다. 따라서 코드 리뷰는 결함 탐지를 넘어 개발 지식과 규범을 공유하는 중요한 교육적 역할도 수행합니다.

DEF CON crowd suspected in fake-hotspot attack on Delta flight

델타 항공 591편 승객들이 기내 와이파이를 위조하여 법 집행 기관의 주목을 받았습니다. 이 사건은 라스베이거스에서 종료된 DEF CON 보안 컨퍼런스 직후 발생했으며, 항공기 내 통신 시스템에 대한 보안 취약점을 시사합니다.

사건은 항공기에서 발송되는 ACARS(항공기-지상 메시지)를 통해 공표되었는데, 조종사들은 승객들이 와이파이를 방해하고 신호를 방송할 수 있었다고 언급했습니다. 이는 무선 통신 채널을 이용한 스푸핑 공격이 실제 항공기 운영 환경에서 발생할 수 있음을 보여줍니다.

FBI 애틀랜타는 이 사건을 조사하고 있지만 현재까지 아무도 체포되지 않았습니다. 이 사례는 항공기 통신 시스템과 같은 무선 통신 인프라의 보안에 대한 개발자 및 보안 전문가들에게 중요한 맥락을 제공합니다.

GNOME Shell이 꿈꾸는 차세대 디자인

GNOME Shell 디자인 팀은 최근 릴리스에서 소폭 개선에 집중한 가운데, 검색, 창 관리, 시스템 상태 UI를 포괄하는 장기적인 디자인 개편안을 준비하고 있습니다. 이 개편안은 사용자 경험을 향상시키기 위해 핵심적인 UI 요소들을 통합하는 것을 목표로 합니다.

구체적으로는 검색창에서 펼쳐지는 결과 오버레이, 편집 가능한 빠른 설정, 알림 기능을 하나의 설정 패널로 통합하는 방향으로 진행되고 있습니다. 이는 사용자가 시스템 상태와 상호작용을 더 효율적으로 관리할 수 있도록 하는 차세대 디자인을 지향합니다.

하지만 이러한 장기 개편안의 실제 구현 여부는 개발 역량, 커뮤니티의 관심도, 그리고 필요한 자금 지원에 달려 있습니다. 따라서 디자인 팀이 제시한 비전이 실제 소프트웨어에 반영되기 위해서는 개발자들의 참여와 지원이 필수적인 상황입니다.

A Three-Layer Caching Architecture for Low-Latency LLM Web Search on Commodity CPU Hardware

LLM 기반 검색 시스템의 지연 시간을 줄이기 위해 범용 CPU 하드웨어에서 작동하는 세 층 캐싱 아키텍처를 제시합니다. 이 시스템은 자동화된 브라우저 에이전트와 제공자 라우팅 LLM 추론을 사용하는 오픈 소스 답변 엔진인 OreoLook을 기반으로 하며, 사용량이 증가함에 따라 세션 컨텍스트 손실, 중복 작업 발생, URL 반복 임베딩 등의 문제를 해결하고자 합니다.

제안된 아키텍처는 세 가지 캐싱 계층으로 구성됩니다. 첫째, Redis에 최근 메시지 롤링 윈도우를 유지하고 디스크 아카이브로 자동 오버플로우하는 세션 컨텍스트 윈도우가 있습니다. 둘째, 임베딩 벡터의 코사인 유사도를 통해 재구성을 포착하여 중복 LLM 호출을 제거하는 의미론적 쿼리 캐시가 있습니다. 셋째, 세션 간 임베딩 계산을 중복 없이 처리하는 URL 임베딩 캐시가 있습니다.

이 시스템은 단일 8-vCPU Intel Cascade Lake 서버(2 GHz, 32 GB RAM)에 배포되었으며, 30개의 Hypercorn 워커 프로세스를 통해 평가되었습니다. 결과적으로 시스템은 89.3%의 Redis 키스페이스 히트율과 0.1ms의 읽기 지연 시간, 그리고 1.38MB의 메모리 오버헤드로 평가되었습니다.

또한, 백그라운드 LRU 제거 데몬은 유휴 세션을 Redis에서 디스크로 이동시켜 필요할 때 다시 불러올 수 있게 함으로써, 설정된 보존 정책 하에서 몇 시간 또는 며칠 후에 대화를 재개할 수 있도록 지원합니다.

Grep beats LSP? Why coding agents ignore your fancier tools

코딩 에이전트가 더 정밀한 결과를 제공하는 검색 인터페이스를 무시하는 이유에 대한 연구 결과가 나왔습니다. 텍스트 검색 방식인 grep과 LSP 기반의 의미론적 탐색(semantic navigation)을 비교한 결과, 도구의 성능뿐만 아니라 모델 친화성(LLM-friendliness)이 중요함을 시사했습니다. 에이전트가 더 정확한 결과를 반환하는 인터페이스를 사용하지 않는 현상은 도구가 제공하는 맥락을 다음 단계에 사용할 수 있도록 모델에게 제시하는 방식과 관련이 있습니다.

실험 결과는 작업 유형과 코드베이스의 특성에 따라 크게 달라졌습니다. 단순한 코드 위치 찾기 작업에서는 두 방식 모두에서 의미론적 탐색을 선택하는 비율이 낮았으나, 참조 완성 작업에서는 의미론적 탐색이 45%에서 57%의 확률로 더 높은 정확도를 보였습니다. 이는 의미론적 탐색이 단순히 더 많은 토큰을 사용하더라도 실제 호출을 더 잘 찾았기 때문이며, 검색의 정밀도보다는 에이전트가 코드를 얼마나 철저하게 처리했는지에 따라 결과가 결정되었습니다.

또한, 코드베이스의 노이즈 수준도 중요한 예측 변수로 작용했습니다. 깨끗한 TypeScript 저장소에서는 LSP 기반 탐색이 추가적인 성능 향상을 가져오지 않았지만, 노이즈가 많은 저장소에서는 의미론적 탐색이 F1 점수를 개선하고 토큰 사용량을 줄이는 효과를 보였습니다. 이는 의미론적 탐색의 가치가 언어의 정적 타입 여부가 아니라 grep의 정밀도가 해당 코드베이스에서 얼마나 저하되는지에 달려 있음을 보여줍니다.

결론적으로, 더 나은 검색 인터페이스를 평가하려면 전체 에이전트 시스템을 고려해야 합니다. 도구의 정밀도와 토큰 사용량만으로 평가할 수 없으며, 모델이 도구를 사용하는 방식과 인터페이스의 출력 형태가 에이전트의 행동에 미치는 영향을 함께 평가해야 합니다. 에이전트 플랫폼을 구축하는 팀은 더 정교한 추상화가 도움이 될 것이라고 가정하기 전에 실제 작업에 대해 변화를 테스트해야 합니다.

Accuracy and Order Sensitivity Diverge Under Label-Free Strategies

다지선다형 벤치마크는 대규모 언어 모델을 평가하는 데 널리 사용되지만, 선택지 순서에 대한 민감도가 모델의 지식과 혼재되어 모델 지표로서 신뢰하기 어렵다는 문제가 있습니다. 본 연구는 모델이 정답을 선택하는 동안 선택지 레이블을 보지 못하게 하여 위치적 영향(positional influence)을 제거하고 성능을 개선할 수 있는지 테스트했습니다.

연구진은 편향을 완화하기 위한 두 가지 전략을 평가했는데, 첫 번째는 생성 후 매칭(generation-then-matching) 접근법이고, 두 번째는 선택지를 분리하여 개별적으로 점수 매기는 방법으로, 후자는 구조적으로 위치적 편향이 없었습니다. 그러나 두 전략 모두 정확도를 안정적으로 개선하지는 못했습니다.

분석 결과, 병목 현상은 매칭 단계가 아니라 선택지를 숨기는 것 자체에 있음을 보여줍니다. 모델이 모든 선택지를 LLM 매처와 쌍으로 보여주는 구성만이 기준선과 일치하는 것으로 나타났습니다. 또한 위치적 영향을 완전히 제거하더라도 정확도가 안정적으로 향상되지는 않지만, 순환 치환(cyclic permutation)은 성능을 개선하는 경향이 있습니다.

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

멀티모달 대규모 언어 모델(MLLM)의 능력을 평가하는 데 있어 비디오 이해는 근본적인 과제입니다. 현재 선도적인 모델들은 기존의 단일 턴 비디오 이해 작업에서 이미 약 90%의 정확도를 달성했기 때문에, 고급 MLLM의 지능을 평가하기에는 기존의 단일 턴 비디오 이해 방식은 포화 상태이며 불충분하다는 지적이 제기되고 있습니다.

이러한 한계를 극복하기 위해 일반 인공지능(AI) 비서에 초점을 맞춘 에이전트형 비디오 이해 벤치마크인 VideoGAIA가 소개되었습니다. VideoGAIA는 단순히 한 번의 비디오 질문 응답을 넘어, 모델이 비디오를 반복적으로 인식하고 외부 도구를 호출하며, 보완적인 정보를 수집하고, 여러 턴에 걸쳐 멀티모달 증거를 통합하는 다중 턴 도구 증강 상호작용 프로세스로 비디오 이해를 정립합니다.

VideoGAIA는 다양하고 복잡한 실제 시나리오를 다루는 271개의 모델-인간 공동 설계 작업을 포함하고 있으며, 각 질문-응답 인스턴스는 정확성과 적절한 난이도를 보장하기 위해 세 명의 인간 전문가에 의해 독립적으로 검증되었습니다. GPT-5.5나 Kimi-K3와 같은 최첨단 모델들을 포함한 모든 평가 대상 MLLM은 VideoGAIA에서 60% 미만의 정확도를 기록했는데, 이는 VideoGAIA가 차세대 MLLM을 평가하기 위한 고품질의 시의적절한 벤치마크로서의 가치를 입증합니다.

VideoGAIA는 기존의 비디오 이해에서 에이전트형 비디오 이해로의 전환을 촉진할 것으로 기대됩니다.

Is this Citation on Point?

2023년 뉴욕 법원에서 ChatGPT가 생성한 환각성 인용으로 인해 변호사 두 명이 제재를 받은 사례가 있습니다. 이 연구는 LLM이 법률 문서에서 인용의 적절성을 판단하는 데 있어 놓치는 부분을 탐구하며, 기존의 LLM 평가 방식이 간과하는 더 어려운 문제에 초점을 맞춥니다. 연구진은 실제 법률 인용을 조작하여 명제 수준의 인용 지원을 검증하는 방법을 사용했습니다.

연구 결과, 모델들은 잘못된 사례(wrong-case)는 93~100% 포착했지만, 특정 페이지(wrong-pinpoint) 오류에 대해서는 법원 의견에서 37~61%, 법률 서면에서 52~83%만 포착했습니다. 모델이 페이지 수준의 오류를 놓칠 경우, 단순히 주제적 중복에 의존하여 인용을 수용하는 경향을 보였습니다.

규모와 확장된 추론 능력은 이러한 격차를 좁히지만 해소하지 못했습니다. GPT-5.4와 같은 고성능 모델도 여전히 법원 의견에서 특정 페이지 불일치를 40%, 법률 서면에서 18%를 놓쳤습니다. 또한, 모델에게 인용된 페이지의 지원을 검증하도록 프롬프팅하면 재현율은 향상되지만 오탐률이 증가하는 상충 관계가 발생합니다.

결론적으로, 현재 모델들은 올바른 법률 주제를 인식하고 인용의 지원을 검증하는 능력을 혼동하고 있습니다. 이는 LLM이 법률 맥락에서 인용의 정확성을 판단하는 데 있어 주제 인식과 페이지별 지원 검증을 별개의 능력으로 취급해야 함을 시사합니다.

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

멀티모달 대규모 언어 모델(MLLM)은 발전했지만 시각 이해와 생성은 종종 분리된 목표로 취급되어 왔습니다. 기존의 통합 프레임워크들은 이산적인 시각 토큰화나 확산 목표에 의존하는데, 이는 시각 이해 모델이 소비하는 연속적인 표현과 생성 목표가 달라 기존 사전 학습된 MLLM에 직접 적용하기 어렵습니다.

이 연구는 이러한 문제를 해결하기 위해 생성 가이드 훈련 프레임워크인 GAS를 제시합니다. GAS는 시각 생성을 표현 학습을 위한 보조 감독으로 재해석하여 멀티모달 이해를 향상시킵니다. 구체적으로 GAS는 분리된 혼합-트랜스포머(MoT) 아키텍처 내에서 Next Embedding Prediction(NEP)을 교차 모달 생성 패러다임으로 활용합니다. 공유된 하위 트렁크와 병렬 상위 레이어를 유지함으로써, 생성 손실이 공유 시각 경로를 더 미세한 공간 정밀도와 강력한 시각 보존으로 풍부하게 만들면서 상위 이해 레이어를 직접적인 생성 기울기에서 보호합니다.

이러한 접근 방식은 모델 규모와 훈련 단계 전반에 걸쳐 집합적인 멀티모달 이해를 개선하며, 특히 지각 및 공간 이해에서 가장 신뢰할 만한 이점을 제공합니다. 결정적으로, 보조 생성 분기는 훈련 후 폐기되므로 추론 오버헤드가 전혀 발생하지 않습니다. 광범위한 통제된 비교 분석을 통해 생성 가이드 훈련이 이해도를 향상시키는 시점과 이유를 명확히 밝히고, 생성 가이드 훈련이 더 강력한 멀티모달 이해로 가는 실용적인 경로임을 입증했습니다.

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

추론 과정의 효율적인 테스트 시간 확장을 위해 주장 수준의 허위 판별(claim-level falsification)을 원칙으로 하는 Claim-Level Reliability Assessment(CLR) 프레임워크를 제안합니다. CLR은 추가적인 솔루션 샘플링에서 테스트 시간 컴퓨팅을 목표 지향적인 검증으로 재할당하는 훈련 불필요 프레임워크입니다. 전체 추론 경로 평가는 일상적인 토큰으로부터의 신호 희석 때문에 결정적인 오류를 가리는 경우가 많기 때문에, CLR은 각 추론 경로를 의사 결정에 결정적인 주장들의 압축된 세트로 요약하여 논리적 닻을 분리합니다.

또한, 고정된 모델 능력 하에서 완전히 정확한 솔루션을 생성하는 것의 본질적인 어려움을 인식하여 CLR은 의미론적 허위 판별(semantic falsification)에 초점을 맞춥니다. 이 접근 방식은 솔루션 구성과 주장 반박 사이의 근본적인 비대칭성을 활용합니다. 유효한 솔루션을 구성하려면 완벽한 추론 경로가 필요하지만, 잘못된 주장을 반박하려면 단 하나의 결정적인 결함만 식별하면 됩니다.

이러한 부정적 증거에 대한 표적 탐색은 고신뢰도 오류 추론의 생존 공간을 체계적으로 압축하여 비선형 신뢰도 점수를 통해 오류된 합의를 효과적으로 억제합니다. 네 가지 LLM과 네 가지 추론 벤치마크에서 일치된 예산 하에 CLR은 일반적으로 pass@1과 자기 일관성(self-consistency)을 개선합니다. 예를 들어 GPT-OSS-20B/CMIMC25의 경우 CLR은 pass@1을 27.15 퍼센트 포인트 초과하고 자기 일관성 정확도를 77.50%에서 82.19%로 높이며 토큰 수를 37.0% 줄였습니다.

Dion3: Full-Stack Orthogonal Updates

Muon 옵티마이저의 뉴턴-슐츠 직교화 단계는 세제곱 시간 복잡도로 인해 상당한 오버헤드를 발생시킵니다. 특히 가중치가 분할(sharded)될 경우 통신 오버헤드가 이 계산 비용을 증폭시켜 많은 설정에서 Muon의 이점을 약화시킵니다. 이에 따라 연구진은 모든 계층에서 이러한 오버헤드를 해결하는 Muon의 개선 버전인 Dion3를 제시합니다.

Dion3는 Gram Newton-Schulz 알고리즘을 사용하여 직교화의 FLOP 비용을 줄이고, 대칭성을 활용하여 CuteDSL 커널을 가속하며, megabatching 전략으로 통신 오버헤드를 감소시킵니다. 또한, 각 단계에서 모멘텀 행렬의 일부 행만 직교화하도록 업데이트 규칙을 단순하게 변경하여 비용을 추가로 절감합니다.

이러한 개선을 통해 Dion3는 Muon이 달성한 손실(loss)과 동등하거나 더 나은 성능을 보이며 옵티마이저 단계 시간을 최대 6배까지 단축합니다. Dion3는 Muon의 대체재로 사용될 수 있으며, microsoft의 dion 패키지를 통해 Muon과 교체하여 사용할 수 있습니다.