GLM-5.3, 오픈 웨이트로 공개

GLM-5.3 모델이 오픈 웨이트로 공개되었습니다. 이 모델은 GLM-5.2와 동일한 기반 모델을 사용하며, 성능 향상은 모두 후속 학습을 통해 달성되었습니다.

GLM-5.3은 코딩 성능 면에서 눈에 띄는 발전을 이루었습니다. 자체 Z.ai Code Bench에서 GLM-5.2 대비 코딩 성능이 50% 향상되었으며, Terminal Bench 3.0과 Agent's Last Exam에서는 오픈소스 모델 중 최고 수준의 결과를 기록했습니다.

이러한 성능 향상은 모델 자체의 개선보다는 후속 학습의 규모와 방식에 의해 결정되었음을 시사합니다. 후속 학습의 구체적인 규모와 방법론에 대한 추가 정보가 필요합니다.

Isitdoneyet.gg is a website I made to figure out if games are complete

게임의 완성도에 대한 질문에 답하는 웹사이트 Is It Done Yet?에 대한 내용입니다. 이 사이트는 단순히 게임이 출시되었다는 사실과 게임이 완전히 끝났다는 사실을 구분하여, 게임의 콘텐츠가 실제로 완료되었는지 여부를 확인하는 데 초점을 맞춥니다.

사이트는 "출시되었다고 해서 끝난 것은 아니다"라는 철학을 바탕으로 운영되며, 플레이어와 개발자 모두에게 게임의 최종 콘텐츠 완성도를 판단하는 기준을 제시하고자 합니다. 예를 들어, Planet Zoo, The Children of Clay, Resident Evil Requiem, Kingdom Rush Vengeance, Cyberpunk 2077, Hollow Knight: Silksong 등 다양한 게임들을 대상으로 콘텐츠 완결 여부를 탐색할 수 있습니다.

이러한 접근 방식은 출시된 게임에 대해 플레이어들이 느끼는 만족도와 개발자가 목표로 하는 최종 콘텐츠 상태 사이의 간극을 이해하는 데 중요합니다. 개발자들은 출시 이후에도 추가적인 콘텐츠나 개선 작업이 필요할 수 있다는 점을 인지하고, 게임의 진정한 완결 상태를 평가하는 데 이 정보를 활용할 수 있습니다.

결론적으로 Is It Done Yet?는 게임의 출시와 실제 완료 사이의 차이를 명확히 보여주며, 게임 콘텐츠의 완성도를 객관적으로 판단하는 데 도움을 주는 참고 자료로 기능합니다.

An Anthropic researcher just gave us a peek at self-improving AI

Anthropic 연구원이 자가 개선 AI에 대한 통찰을 제공하며 AI 정렬(alignment) 분야의 새로운 가능성을 제시했습니다. 이들은 "자동화된 연구원(Automated Researchers, AAR)"이 특정 정렬 실패 행동에 대한 10가지 벤치마크를 통해 모델 성능을 전체 성능 저하 없이 개선할 수 있음을 상세히 설명하는 논문을 발표했습니다.

이 시스템은 기존 연구 방식을 모방하여, 자동화된 시스템이 문헌을 검색하고 방법을 제안한 뒤 모델을 30분 동안 훈련하여 벤치마크를 점진적으로 개선하는 방식으로 작동합니다. 이 접근 방식은 비효율적인 방법은 제거하고 효과적인 방법은 보존함으로써 시스템이 빠르고 광범위하게 작동할 수 있게 합니다. 연구 결과에 따르면, 자동화된 정렬 후 훈련이 가까운 시일 내에 실용화될 수 있다는 초기 증거를 제공하며, 이는 모델이 자체적으로 정렬 훈련을 개선하는 재귀적 자가 개선의 다음 단계로 여겨집니다.

실제로 이 자동화된 연구원 시스템은 숙련된 인간 연구원이 제안하는 방향보다 평균적으로 6시간 이내에 더 나은 성능을 달성했습니다. 비용 측면에서도 주목할 만한데, AAR은 인간 연구원에게 시간당 150달러를 지불하는 것에 비해 API 추론에 약 4달러를 소요하여 비용 효율적입니다.

다만 이 접근 방식에는 몇 가지 한계가 존재합니다. 자동화된 시스템이 작동하기 위해서는 벤치마크가 실제 정렬 목표를 정확하게 반영해야 하며, 자동화된 연구원이 참고하는 문헌을 유지하고 확장하는 작업 역시 상당한 노력이 필요합니다.

25,000 Lbs. Of Chicken Products Recalled in 5 States: USDA

미국 농무부(USDA)에 따르면 5개 주에서 총 25,000파운드의 닭고기 제품이 리콜되었습니다. 이 소식은 소비자들에게 해당 제품에 대한 주의를 요구하며 식품 안전 문제와 관련된 상황임을 시사합니다.

이번 리콜은 특정 제품이나 원인에 대한 구체적인 정보가 기사에 명시되어 있지 않으므로, 현재로서는 리콜된 제품의 정확한 종류나 리콜의 구체적인 원인에 대해서는 알 수 없습니다.

개발자나 관련 산업 종사자는 이 리콜이 식품 안전 규정 준수 및 공급망 관리 측면에서 어떤 영향을 미치는지 확인해야 합니다. 해당 정보를 바탕으로 관련 규제 변화나 시장 반응을 추적하는 것이 중요합니다.

Show HN: Conduct, open-source guardrails for LLM and MCP tool calls

AI 에이전트 거버넌스를 위한 오픈소스 프로젝트인 Conduct AI가 공개되었습니다. 이 프로젝트는 LLM 및 MCP 도구 호출에 대한 안전장치(guardrails)를 제공하여 팀 환경에서 AI 에이전트의 행동을 통제하고 관리하는 것을 목표로 합니다.

핵심 기능인 Conduct Guard는 정책 엔진 역할을 하며, 서명된 정책과 검증된 체인을 통해 AI 액션이 실행되기 전에 차단, 경고, 감사 또는 주입을 결정합니다. 이는 기본적으로 실패 시 닫힘(fail-closed) 원칙을 적용하여 보안을 강화합니다.

시스템은 Conduct Router라는 LLM 프록시와 Runtime 방화벽을 통해 작동하며, 모든 요청은 Guard를 거쳐 상위 제공업체로 전달됩니다. 이 구조는 암호화된 증명과 해시 체인 감사 로그를 통해 모든 AI 액션에 대한 무결성을 보장합니다.

이러한 접근 방식은 AI 에이전트의 행동을 관찰하는 런타임 방화벽과 달리, Conduct Guard는 AI가 무엇을 할 수 있는지 통제하는 데 중점을 둡니다. 모든 작업은 서명된 구성과 해시 체인 감사 로그에 의해 보호되어, 잠재적인 보안 위험을 사전에 방지하고 신뢰성을 확보합니다.

Aspirational Clownmaxxing and Joey's cadillac todo list

개발자가 추구하는 미학적 목표와 인공지능의 한계에 대한 실험적인 시도가 담겨 있습니다. 이 글은 파이썬과 PySide6를 사용하여 '미드 센추리 컨트리 클럽 코어' 미학을 구현하려던 과정에서 발생한 개발자와 디자이너 간의 갈등과 그 결과물을 다룹니다.

개발자는 LLM을 활용하여 복잡한 미학적 요구사항을 코드로 변환하려 했으나, 이 과정에서 개발자와 디자이너 간의 관계 악화와 물리적 사건이 반영된 혼란스러운 결과물이 나타났습니다. 특히, 개발자가 '작은 녹색 그렘린'이 되어 애플리케이션 내에서 장난을 치고 유령 디자이너가 디자인 원칙을 적용하는 등, 내러티브적 요소가 UI에 새겨진 상황을 묘사합니다.

이러한 실험은 LLM이 디자인 바이블이나 철학적 에세이 같은 복잡한 요구사항을 처리하는 데 얼마나 효과적인지를 보여줍니다. 프롬프트를 통해 미학적 배경을 주입하려 해도 LLM은 단순히 색상 팔레트나 폰트 정도만 선택할 뿐, 추상적인 개념을 알케미적으로 융합하는 데는 한계가 있음을 시사합니다.

결국 이 프로젝트는 코드를 작성하기 전에 모든 디자인 및 철학적 요구사항을 논리적으로 확립해야 하며, LLM에게는 구체적이고 명확한 지침을 제공하는 것이 중요함을 강조합니다. 이는 AI를 활용한 창작 과정에서 구체적인 제약 조건과 논리적 기반이 얼마나 필수적인지를 보여주는 사례입니다.

Show HN: Sesame - a local-first, open-source password manager

로컬 우선의 오픈 소스 비밀번호 관리 프로그램인 Sesame이 공개되었습니다. 이 프로그램은 사용자의 볼트(vault)를 기본적으로 로컬에 보관하며, 호스팅 서비스는 볼트 자체를 수신하지 않아 보안을 극대화합니다. 사용자는 비밀번호, 2FA 코드, 복구 세부 정보 등을 한 곳에 모아 관리할 수 있으며, 15가지 형식으로 볼트를 가져오고 내보낼 수 있습니다.

Sesame은 사용자에게 코드 공개를 통해 직접 검토하고 구축할 수 있도록 AGPL-3.0-or-later 라이선스로 배포됩니다. 데스크톱 애플리케이션은 Rust 코어를 기반으로 하며, 서버 API와 관리 인터페이스는 Go로 구현되어 있으며 PostgreSQL을 사용합니다. 이 모든 구성 요소는 단일 저장소에서 관리되어 사용자가 직접 빌드하고 호스팅할 수 있도록 설계되었습니다.

현재 Sesame은 베타 단계이며 독립적인 보안 검토가 완료되지 않았기 때문에 실제 비밀 정보 대신 테스트 데이터를 사용해야 합니다. 2026년 8월 22일 기준으로 최근 30일 동안 147개의 커밋이 이루어졌으며, Windows용 데스크톱 앱과 브라우저 확장 프로그램이 공개되었습니다. 사용자는 이 오픈 소스 프로젝트를 통해 직접 코드를 검토하고 테스트하며 소프트웨어를 개선할 수 있습니다.

The Analytical AI Handbook

분석형 AI는 무언가를 생성하는 것이 아니라 결정을 내리는 AI를 의미하며, 이는 최근 거대 언어 모델(LLM)의 활용 패턴 중 덜 논의되었던 사용 방식입니다. 분석형 AI는 작업이 측정 가능하고 구체적이며 변별적이라는 특징을 가지기 때문에, 생성형 AI와는 다른 최적의 접근 방식이 필요합니다.

분석형 AI의 작업은 일반적으로 정확성을 검증할 수 있는 전문가 주석을 사용하여 정답 데이터셋을 만들 수 있어 측정 가능합니다. 또한, 일관성을 위해 창의성보다는 일관성에 중점을 두므로, 가장 큰 모델 대신 작업 정확도에 대해 평가된 가장 작은 모델을 사용하여 작업을 수행할 수 있습니다. 이러한 특성 덕분에 분석형 AI는 낮은 지연 시간(latency)을 허용하며 배치(batch) 또는 오프라인 워크로드 처리가 가능하여 비용과 처리 시간을 크게 절감할 수 있습니다.

이러한 배경을 바탕으로 분석형 AI는 데이터 과학자, 엔지니어, 운영팀, 제품 분석가 등 다양한 팀이 비정형 데이터를 구조화하고 운영상의 결정을 내리는 데 LLM을 활용하는 데 중점을 둡니다. 이 핸드북은 이러한 시스템을 구축하고 개선하는 데 필요한 핵심 원리(Primitives), 구현 모범 사례(Patterns), 시스템 설계(Architectures), 운영 고려 사항(Deployment)을 제공하여 개발자들이 신뢰할 수 있는 의사결정 모델을 구축하도록 돕는 살아있는 참고 자료 역할을 합니다.

Nancy Grace Roman Space Telescope Launches this Sunday

낸시 그레이스 로먼 우주망원경이 이번 주 일요일에 발사됩니다. 이 우주망원경은 암흑 에너지와 초신성 연구를 목표로 하며 우주의 근본적인 구조를 이해하는 데 중요한 데이터를 제공할 것으로 기대됩니다.

로먼 우주망원경은 암흑 에너지의 분포를 측정하고 초신성 사건을 관찰함으로써 우주 진화의 역사를 밝히는 데 중점을 둡니다. 이는 현재 우주론에서 가장 큰 미스터리 중 하나인 암흑 에너지의 본질을 이해하는 데 결정적인 단서를 제공할 수 있습니다.

이 발사는 천문학 분야에 새로운 관측 기회를 제공하며, 개발자나 과학 커뮤니티에게 우주 데이터 분석 및 시뮬레이션에 대한 새로운 자료를 제공할 수 있습니다. 앞으로 이 망원경이 제공할 데이터는 암흑 에너지와 같은 미지의 현상에 대한 우리의 이해를 근본적으로 변화시킬 잠재력을 가지고 있습니다.

Brave’s browser one-ups Chrome with its new support for email aliases

Brave 브라우저가 이메일 별칭(alias) 기능을 지원하며 크롬에 대항하는 새로운 프라이버시 기능을 추가했습니다. 이 기능은 사용자가 개인 이메일 주소를 공유하지 않고도 웹사이트나 온라인 서비스에 가입할 수 있도록 해줍니다. 별칭을 사용하려면 먼저 Brave 계정을 생성하고 실제 이메일 주소를 제공해야 하며, 이후 웹사이트에서 이메일 필드를 클릭하면 별칭을 사용할 수 있는 옵션이 나타납니다.

이메일 별칭을 사용하면 웹사이트가 사용자의 이메일을 개인 식별자로 사용하여 광고를 타겟팅하거나 구매 내역을 추적하는 것을 방지하여 개인 정보를 보호할 수 있습니다. Brave는 이메일 내용을 읽지 않고 스팸 및 바이러스 필터링 목적으로만 처리하며, 이메일이 포워딩된 후에는 Brave 서버에서 삭제한다고 설명합니다.

사용자의 Brave 계정 데이터는 저장 시 암호화되어 있으며, 별칭과 함께 저장된 메모는 동기화 옵션을 켜지 않는 한 기기에 로컬로 저장됩니다. 만약 동기화 옵션을 활성화하면 모든 데이터는 종단 간 암호화됩니다. 현재 Brave 사용자에게는 다섯 개의 무료 이메일 별칭이 제공되며, 프리미엄 사용자에게는 더 많은 별칭이 향후 제공될 예정입니다.

Zohran과 짧은 링크

시민 참여가 필요한 프로젝트나 행사의 영상 콘텐츠는 짧고 최상위 링크 형태로 마무리하는 것이 권장됩니다. 이러한 링크는 nyc.gov/{initiative}와 같은 형태로 구성되어 사용자가 쉽게 접근하고 기억할 수 있도록 설계되었습니다.

기억하기 쉬운 URL을 제공함으로써 시민 참여와 후속 행동을 취하는 데 필요한 문턱을 낮추는 것이 핵심 목표입니다. 이는 복잡한 웹 환경에서 사용자가 정보를 소비하고 다음 단계로 나아가는 과정을 간소화하는 데 중점을 둡니다.

또한 뉴욕시(NYC)는 소셜 미디어 이용자들을 위해 직접 소유하고 운영하는 단일 웹사이트를 관리하고 있습니다. 이는 시민 참여와 정보 공유를 위한 플랫폼을 통합적으로 운영하고 관리하는 맥락에서 중요한 배경이 됩니다.

트럼프 행정부의 Anthropic 블랙리스트 지정은 불법이라는 판결

트럼프 행정부가 Anthropic을 블랙리스트에 지정한 조치가 불법이라는 판결이 나왔습니다. 이 판결은 해당 행정 조치의 법적 근거에 중대한 문제가 있음을 시사하며, AI 기업의 규제 및 정책 적용에 있어 중요한 선례를 남깁니다.

이번 판결은 특정 행정부의 정책적 결정이 법적 절차를 준수했는지에 대한 법원의 판단을 담고 있습니다. 이는 향후 정부가 AI 관련 기업에 대해 블랙리스트와 같은 제재를 가할 때 법적 기준을 더욱 엄격하게 적용해야 함을 의미합니다.

따라서 AI 기술 개발자와 기업들은 정부의 규제 정책이 법적 테두리 내에서 이루어지는지 지속적으로 확인해야 합니다. 이러한 판결은 AI 관련 정책과 규제가 법적 안정성을 확보하는 것이 필수적임을 강조합니다.

Open-weight AI companies are the Valley’s hottest acquisition targets

오픈 웨이트 AI 기업들이 실리콘밸리의 가장 뜨거운 인수 대상이 되고 있습니다. 현재 엔비디아가 Hugging Face에 대한 130억 달러 규모의 인수를 보고하며, 이는 오픈 웨이트 AI 모델과 벤치마크를 공유하는 플랫폼의 가치를 반영합니다. 이러한 움직임은 AI 분야에서 모델을 공유하고 배포하는 비즈니스에 막대한 자본이 유입되고 있음을 보여줍니다.

이러한 자본 흐름은 엔비디아와 같은 하드웨어 기업에게 중요한 전략적 의미를 가집니다. 엔비디아는 주요 AI 모델 개발사들이 자체 추론 칩을 개발하는 상황에서, 오픈 모델 시장을 장악함으로써 사용자들을 자사의 칩과 표준으로 유도할 수 있는 기회를 확보하고자 합니다. 이는 주요 AI 모델 빌더들과의 의존도를 줄이고 경쟁 우위를 확보하려는 움직임입니다.

개발자들은 비용 절감보다는 모델의 통제력과 구성 가능성에 더 큰 관심을 보이고 있습니다. 실제로 오픈 웨이트 모델은 고객 서비스 채팅과 같이 반복적인 추론 작업에 비용 효율적으로 조정될 수 있어 기업들이 채택하고 있습니다. 하지만 코딩이나 에이전트 작업처럼 복잡한 추론이 필요한 영역에서는 여전히 독점적인 접근성과 보조금 때문에 프론티어 모델이 우위를 점하고 있습니다.

앞으로 AI 워크플로우가 성숙해짐에 따라 기업들은 자체 모델을 구축하고 전문화하는 방향으로 나아갈 것입니다. 모든 기업이 각 사용 사례에 맞는 자체 모델을 갖는 것이 미래의 지능이라는 관점에서 중요해지고 있습니다.

Trump blacklisting of "woke" Anthropic deemed illegal by federal judge

연방 판사가 트럼프 행정부가 앤트로픽(Anthropic)을 블랙리스트에 올린 조치가 위법하다고 판결했습니다. 이 판결은 해당 AI 기술 사용에 대한 정부 지침을 취소하는 명령을 내렸습니다.

정부는 앤트로픽이 미국인에 대한 치명적 자율 무기 사용 및 대규모 감시에 제품 사용 제한을 철회하기를 거부했다는 이유로 앤트로픽에 대해 국가 안보 공급망 위험으로 지정하며 보복 조치를 취했습니다.

판사는 이러한 조치들이 수정헌법 제1조를 위반하는 불법적인 보복에 해당한다고 판시하며, 이는 앤트로픽 측의 소송 요구를 일부 수용하는 결정이었습니다.

이 판결은 AI 기술 개발과 정부 정책 간의 관계에 중요한 법적 선례를 남기며, AI 기업이 정부의 규제 및 요구에 어떻게 대응해야 하는지에 대한 중요한 맥락을 제공합니다.

QGPINNs: A Physics-Informed Neural Network Framework for Nonlocal Differential Equations on Quantum Graphs

물리학 기반 신경망 프레임워크인 QGPINNs를 통해 양자 그래프 상의 비국소 미분 방정식을 수치적으로 해결하는 방법이 제안되었습니다. 이 프레임워크는 그래프의 각 모서리 솔루션을 신경망으로 근사화하고, 이를 통합하는 그래프 기반 손실 함수를 사용하여 초기 조건, 경계 조건, 꼭짓점 전달 조건을 함께 강제합니다. 특히 연속성과 키르히호프-노이만 꼭짓점 조건, 디리클레 경계 조건을 학습 과정에 통합하여 국소적인 신경망 근사치를 그래프 전체의 해로 연결합니다.

QGPINNs는 다중 차수 분수 타원 문제와 양자 그래프 상의 시간 분수 진화 방정식 등 두 가지 대표적인 비선형 모델에 적용될 수 있습니다. 정확도와 학습 안정성을 높이기 위해 이 프레임워크는 부드러운 제약 조건 적용, 동적 손실 균형, 푸리에 특징 임베딩 등 그래프에 적응된 여러 학습 전략을 통합합니다. 또한, 문제에서 발생하는 약하게 특이한 해를 처리하기 위한 학습 가능한 특이점 포착 특징도 포함하고 있습니다.

이 프레임워크는 노이즈가 있는 관측 데이터로부터 분수 연산자의 차수나 물리적 매개변수를 식별하는 것과 같은 역문제에도 자연스럽게 확장됩니다. 연구진은 이 프레임워크의 정확성, 계산 효율성, 물리적 일관성을 검증하기 위해 IEEE 14-버스 시스템과 개방 채널 농업 배수 네트워크와 같은 실제 네트워크를 포함한 벤치마크 구조에 대한 수치 실험을 수행했습니다.

Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning

텐던 구동 손은 액추에이터를 관절 밖으로 이동시켜 힘을 케이블로 전달함으로써 제작 비용을 절감하고 모터 크기를 줄일 수 있어 저렴하게 만들 수 있습니다. 이 방식은 하나의 모터가 여러 관절을 구동할 수 있게 하여 필요한 모터 수를 줄이며, 직접 구동 방식의 손보다 학습하기 더 어렵다는 특징이 있습니다.

하지만 이러한 절감 효과를 내는 언더액추에이티드 전달 방식은 시뮬레이션에서 표현하기 어렵고, 하나의 케이블로 구동되는 관절들은 독립적으로 명령할 수 없다는 기술적 한계가 있습니다. 이에 저자들은 시뮬레이션 준비가 완료된 인체공학적 텐던 구동 손인 Aero Hand Open을 제시합니다.

이 연구는 케이블 전달 자체를 재현하는 시뮬레이션 모델, 모터 명령과 모델을 연결하는 작동 맵, 그리고 손을 위한 강화 학습 패키지를 함께 제공합니다. 이를 통해 정책을 시뮬레이션 내에서 완전히 훈련하고, 추가적인 미세 조정이나 상태 추정 없이 실제 손에서 실행할 수 있게 됩니다.

연구팀은 기계 설계, 시뮬레이션 모델, 작동 맵, 훈련 환경, 배포 스택을 모두 공개하여 개발자들이 시뮬레이션 기반의 복잡한 조작 학습을 실제 하드웨어에 적용할 수 있는 기반을 제공합니다.

Learning a Size-Weight Frontier for Synthetic-Augmented Inference

실제 데이터가 부족할 때 합성 데이터는 통계적 추론을 개선할 수 있지만, 합성 샘플을 실제 데이터처럼 취급하면 편향이 발생하여 신뢰할 수 없는 추론을 초래할 수 있습니다. 이에 본 연구는 관련 작업 집합 전반에 걸친 합성 증강 추론을 위한 일반적인 프레임워크를 개발했습니다.

이 프레임워크는 합성 증강을 합성 관측치 수와 가중치로 특징짓습니다. 핵심은 크기-가중치 경계선(size-weight frontier)으로, 각 가중치에 대해 모든 더 작은 크기가 목표 작업 주변 분할(target task-marginal coverage)을 달성할 수 있는 최대 합성 샘플 크기를 지정합니다. 연구진은 이 경계선을 과거 작업으로부터 추정하고, 추정된 경계선 이하의 모든 크기-가중치 구성에 대해 유한 표본 커버리지 보장을 동시에 확립했습니다.

실제로 대규모 언어 모델(LLM) 응답을 사용하여 의견 조사 데이터를 증강하는 실험에서 이 절차는 목표 커버리지를 달성하고 신뢰 구간을 상당히 좁히는 결과를 보였습니다. 이는 데이터가 부족한 상황에서 합성 데이터를 활용하여 통계적 추론의 정확성과 신뢰성을 높이는 구체적인 방법을 제시합니다.

On two proofs of $d^2$ mixing of weighted Dikin walks

연구진은 다면체와 절단된 양의 준정부호(PSD) 영역에서 지수 분포로부터 샘플링하는 것에 대한 가중 Dikin 워크의 혼합 시간(mixing time)을 연구했습니다. 첫 번째 결과는 국소 측정에 대한 혼합 시간 상한을 강력한 자기 일관성(self-concordance), $\bar{\nu}$-대칭성, 그리고 혼합-흔적 규칙성(mixed-trace regularity) 하에서 일반적인 총 변동(total-variation) 혼합 상한을 제공합니다. 이는 메트로폴리스-해스트링 수용 확률을 모든 지점에서 제어하는 대신 고확률 영역에서 제어하는 핵심 아이디어를 기반으로 합니다.

이 프레임워크를 리-시드포드(Lee-Sidford), 루이스-가중(Lewis-weight), 존(John) 측정에 적용하면 다면체에서 $\widetilde O(d^2)$ 혼합 상한을 얻을 수 있습니다. 또한 하이브리드 장벽(hybrid barrier)에 적용하면 절단된 PSD 영역에서 $\widetilde O(d^4)$ 혼합 상한을 얻는 것으로 나타났습니다. 이는 샘플링 효율성을 크게 개선하는 결과입니다.

두 번째 결과는 새로운 4차 부트스트랩 조건을 사용하여 더 강력한 $\chi^2$-발산 보장과 점별 수용 확률 제어를 확립했습니다. 특히 적절히 스케일된 리-시드포드 측정에 대해 이는 $\chi^2$-발산 하에서 $\widetilde O(d^2)$ 혼합 상한을 제공하며, 이전의 $\widetilde O(d^{9/4})$ 상한을 개선합니다. 이 연구는 샘플링 알고리즘의 이론적 성능을 향상시키는 데 중요한 기여를 합니다.

Learning between the peaks: sharp asymptotics for kernel ridge regression under power-law anisotropy

커널 리지 회귀를 비등방성 가우시안 데이터 하에서 연구한 결과는 입력 기하학이 학습 곡선과 일반화 성능에 미치는 영향을 명확히 보여줍니다. 연구진은 입력 공분산이 지수 $\alpha$를 갖는 거듭제곱 법칙으로 감소하는 비등방성 데이터에서 커널 스펙트럼과 일반화 오차에 대한 점근적으로 날카로운 표현을 도출했습니다.

약한 비등방성($0 < \alpha < 1$)의 경우, 문제는 여전히 고차원적으로 남아있지만 등방성 경우와는 다른 특징을 보입니다. 분산은 여전히 정수 샘플 복잡도 $\kappa$에서 최고점을 보이지만, $\alpha$가 증가함에 따라 이 최고점은 점차 약해집니다. 특히 타겟이 데이터의 주 방향과 강하게 정렬될 경우, 편향은 분수 샘플 복잡도에서도 감소하여 보간 피크와 편향 전환이 분리됩니다.

강한 비등방성($\alpha > 1$)에서는 문제의 유효 차원이 일정해지며, 분산은 샘플 크기에 전혀 의존하지 않고 평탄화되거나 명시적인 비율로 소멸합니다. 또한, 편향은 타겟의 감쇠율에 의해 결정되는 날카로운 전환을 겪는데, 임계값 이하에서는 학습이 점진적이지 않고 급격하게 이루어집니다.

최종적으로 연구는 단일 인덱스 타겟에 특화되어, 인덱스가 데이터의 주 방향과 정렬되는 것이 비등방성이 학습에 미치는 영향을 결정함을 보여줍니다. 이는 입력 기하학이 커널 특징을 형성하고 일반화 속성을 근본적으로 변화시킨다는 것을 명확히 설명합니다.

A Formal Limitation on Learning Human Language From Textual Corpora

언어학적 관점에서 화자의 의도를 발화의 형식만으로 완전히 복구할 수 있는지에 대한 질문에 정보 이론적 접근을 통해 답을 제시합니다. 이 연구는 텍스트의 숨겨진 상태를 포함하여 최신 대규모 언어 모델(LLM)의 특징 추출기까지 모든 수신자를 고려하여 분석합니다.

연구진은 언어 사용을 의미, 맥락, 발화의 결합 분포로 모델링하여 디코더가 발화 표현으로부터 화자의 의도를 복구할 확률에 대한 상한선을 도출했습니다. 이 상한선은 의미에 대해 발화가 남기는 불확실성이 결정하며, 이 불확실성은 환원 불가능한 부분과 오직 (외언어적) 맥락만이 해결할 수 있는 부분으로 나뉩니다.

이러한 양들은 언어의 본질적인 속성이기 때문에, 아무리 많은 텍스트나 지도 학습을 통해 생성된 어떤 표현도 이 한계를 넘어설 수 없습니다. 이는 의미 공간이 이산적이든 연속적이든 상관없이 성립하는 근본적인 한계입니다.

이 이론적 경계는 억지 언어 실험, 만다린 제로 대명사 해결, 색상 참조 등의 경험적 증거를 통해 뒷받침됩니다. 따라서 텍스트 표현이나 지도 학습이 아무리 발전하더라도 언어 이해의 근본적인 한계는 존재함을 시사합니다.