Meta’s AI agent Muse is now the No. 2 app in the US

메타의 AI 에이전트 뮤즈가 미국에서 앱 순위 2위를 차지하며 투자자들의 주목을 받고 있습니다. 센서 타워의 데이터에 따르면 뮤즈는 미국 iOS 사용자들 사이에서 83,000회 이상의 다운로드를 기록했으며 앱스토어 인기 차트에서 2위를 기록했습니다. 하지만 이러한 성과는 메타의 다른 앱들인 스레드나 메타 AI의 출시 성과와 비교했을 때 상대적으로 느린 출발로 보입니다. 예를 들어 스레드는 출시 당일 430만 회 이상 다운로드되었고 메타 AI는 108,000회의 다운로드를 기록했습니다.

뮤즈의 성과는 다른 주요 소비자 AI 앱인 챗지피티와 비교하면 더욱 그렇습니다. 챗지피티는 출시 후 일주일 만에 미국에서 50만 회 이상의 설치 수를 기록했으며, 이는 뮤즈가 도달한 수치보다 훨씬 높은 수치입니다. 이는 뮤즈가 출시 속도 면에서 경쟁 앱들보다 느리게 성장하고 있음을 시사합니다.

앱 플랫폼별로도 차이가 나타나고 있는데, iOS에서는 뮤즈가 순위를 올리며 4위에서 2위로 상승했지만, 안드로이드에서는 구글 플레이 마켓의 생산성 카테고리에서 338위라는 낮은 순위에 머물고 있습니다. 이러한 상황에서 메타는 소비자 대상 에이전트 AI 시장을 선점하려는 큰 베팅을 하고 있으며, 이는 페이스북에서 메타버스로의 전환과 유사한 중요한 움직임입니다.

현재 소비자 대상 에이전트 AI 분야에서는 메타의 뮤즈와 텍스트 메시지를 기반으로 한 새로운 소셜 그래프 구축에 중점을 둔 인스팅트가 주요 경쟁자로 부상하고 있습니다. 인스팅트는 스트라이프나 1패스워드와의 통합 및 위치 공유 기능 등을 제공하며 빠르게 기능을 확장하고 있습니다.

한편, 뮤즈의 출시 시점은 메타가 소셜 미디어 소비자 피해 소송에서 180억 달러 합의에 동의한 이후에 이루어졌으며, 메타가 과거 데이터 스캔들과 개인 정보 보호 위반으로 인해 여러 법적 제재를 받은 이력과도 연관되어 있습니다.

Schools are catching on to Big Tech’s playbook

기술 분야의 최신 트렌드인 인공지능 교육은 모든 직업이 집중되는 핵심 영역입니다. 따라서 학생들이 이 기술을 배우지 못하면 뒤처지게 되며, 이에 따라 AI 개발 기업들은 종종 자발적으로 리소스와 교육 과정을 제공하며 이를 해결하려는 움직임을 보이고 있습니다.

이러한 접근 방식은 AI 기업들이 학교에 제시하는 주요 서사이며, 이는 지난 15년간 기술 산업이 교실 내에서 영향력을 구축해 온 방식이기도 합니다. 이는 기술 기업들이 교육 시스템에 깊숙이 관여하여 코딩 및 컴퓨터 과학 기술을 장려해 온 역사와 연결됩니다.

나타샤 싱어(Natasha Singer) 교육 기술 기자에 따르면, 기술 회사들은 책 『코딩 키즈(Coding Kids)』를 통해 교육에서 컴퓨터 과학과 코딩 기술을 홍보하며 중심적인 역할을 수행했습니다. 이는 기술 기업들이 교육 분야에서 어떻게 영향력을 행사해 왔는지 구체적으로 보여줍니다.

Proof of Capture: Apple Reference Image, but open source and using steganography

사진 캡처 증명 기술인 Proof of Capture가 등장하여 인공지능으로 생성된 이미지를 구별하는 문제를 해결하려는 시도가 이루어지고 있습니다. 이 기술은 사진이 실제로 카메라에 의해 캡처된 순간에 그 진위 여부를 증명하는 것을 목표로 하며, 기존의 탐지 방식이 생성 기술의 발전을 따라잡지 못하는 한계를 극복하고자 합니다.

이 프로젝트는 이미지 편집이나 메타데이터 삭제에 대응하기 위해 스테가노그래피와 지각적 해시(perceptual hash)를 활용합니다. 사진의 서명은 이미지 픽셀 자체에 숨겨진 워터마크 형태로 삽입되며, 이는 JPEG 재압축이나 크기 조정에도 살아남도록 주파수 영역 워터마킹(DWT + DCT) 기법을 사용합니다. 이 서명은 ATECC608 암호 칩에 저장되어 있어, 소유자만이 접근할 수 있는 보안 영역(secure element)에서 관리되며 위변조 시 칩이 잠기도록 설계되었습니다.

애플 역시 유사한 접근 방식을 취하고 있지만, 그 방식에는 차이가 있습니다. 애플은 센서가 캡처 시마다 픽셀에 서명을 삽입하는 방식을 사용하며, 이를 통해 사진 옆에 '디지털 네거티브'를 생성하는 Private Cloud Compute를 개발했습니다. 하지만 애플의 방식은 기존의 개방형 표준인 C2PA를 사용하지 않으며, 신뢰의 근원(root of trust)이 애플의 Private Cloud Compute 내부에 남아 있다는 비판이 제기됩니다.

결론적으로 Proof of Capture와 C2PA 모두 모든 이미지 조작 공격을 완전히 해결하지는 못하지만, 오픈 소스 프로젝트로 공개되어 누구나 100달러 미만으로 자체 카메라를 구축할 수 있게 하여 이 문제에 대한 관심과 해결 노력을 촉진하고 있습니다.

OpenAI Agents API

OpenAI Agents API는 대화의 흐름을 유지하는 세션 상태를 보존하여 사용자가 대화의 턴을 넘나들면서 작업을 계속할 수 있도록 지원합니다. 이 기능을 통해 개발자는 복잡한 에이전트 워크플로우를 구축하고 관리할 수 있습니다.

이 API는 멀티 에이전트 기능을 지원하며, 에이전트가 외부 도구(Tools)나 MCP 서버와 연동하여 작업을 수행할 수 있도록 설계되었습니다. 예를 들어, 에이전트는 프로그래밍 도구 호출, MCP 연결, 웹 검색 기능을 활용하여 독립적인 연구 작업을 위임할 수 있습니다. 개발자는 에이전트의 환경을 자체 호스팅 샌드박스로 설정하여 작업 공간과 기능 디렉토리를 구성할 수 있습니다.

다만, 데이터 관련하여 중요한 제약 사항이 존재합니다. 현재 Agents API는 미국 내 데이터 거주만 지원하며 제로 데이터 보존(Zero Data Retention, ZDR)을 지원하지 않습니다. 또한, 자체 호스팅 샌드박스를 선택하더라도 이 API가 ZDR 자격을 얻는 것은 아닙니다. 따라서 데이터 거주 및 보존에 대한 세부 사항은 OpenAI 플랫폼의 데이터 통제 설정을 확인해야 합니다.

에이전트 구축 시에는 이러한 데이터 제약 조건과 안전성 가이드라인을 고려하여 시스템을 설계해야 합니다. 에이전트의 안전성 및 거버넌스를 위해 안전 점검, 안전 분류기, 그리고 오용 모니터링 기능이 통합되어 있습니다.

Cognition, Fable 5.1·GPT-Astra에 필적하는 코딩 모델 SWE-2 출시

코딩 모델 SWE-2가 출시되어 Fable 5.1 및 GPT-Astra에 필적하는 성능을 보이며 주목받고 있습니다. 이 모델은 2조 8천억 매개변수를 가진 Kimi K3를 후속 학습하여 개발되었으며, FrontierCode 1.1 Main에서 50.0%의 성능을 기록했습니다.

SWE-2는 성능뿐만 아니라 비용 효율성 면에서도 큰 이점을 제공합니다. 이 모델은 Fable 5.1과 0.9%p의 차이를 보였음에도 불구하고 기존 모델 대비 비용이 64% 낮습니다. 이는 개발자들이 고성능 코딩 모델을 훨씬 경제적인 비용으로 활용할 수 있게 함을 의미합니다.

또한 SWE-2는 추론 노력 수준에 따라 기반 모델의 비용 및 성능 곡선 기울기에 맞춘 선형 비용 페널티를 적용하는 방식을 채택했습니다. 이러한 비용 페널티 적용은 모델의 효율성과 정확도를 동시에 관리하여, 사용자가 요구하는 추론 수준에 따라 최적화된 자원 사용을 가능하게 합니다.

소프트웨어가 사람들을 미치게 만든다는 가설

소프트웨어에 내재된 속도, 돈, 복잡성, 추상화, 그리고 거의 무제한적인 변경 자유가 평범한 사람들의 균형 감각을 무너뜨릴 수 있다는 가설이 제기되었습니다. 이는 소프트웨어의 설계와 변경 방식이 사용자에게 미치는 심리적 영향에 대한 탐구입니다.

변경 비용이 눈에 띄지 않거나 때로는 실제로 저렴하기 때문에, 사용자는 단순히 “할 수 있다”는 가능성에서 벗어나 “반드시 해야 한다”는 긴급함으로 전환하게 됩니다. 이러한 환경은 아이디어마다 즉각적이고 긴급한 실행을 요구하며, 이는 사용자의 의사 결정 과정에 큰 영향을 미칩니다.

결국 소프트웨어의 유연성과 변경 용이성이 사용자에게 제공하는 자유가 오히려 과도한 선택의 압박과 균형 상실을 초래할 수 있다는 것입니다. 개발자와 디자이너는 이러한 자유로운 변경 환경이 사용자에게 미치는 심리적 부담과 그로 인해 발생하는 행동 변화를 고려해야 합니다.

The Deathray: A simple way for an untrusted site to freeze a Mac

웹GPU 셰이더를 이용해 Mac을 일시적으로 멈추게 하는 취약점인 데스레이(Deathray)가 발견되었습니다. 이 취약점은 신뢰할 수 없는 사이트에서 실행되는 웹GPU 셰이더가 GPU를 점유하여 시스템의 그래픽 처리를 마비시키고 데스크톱 UI를 사용 불가능하게 만듭니다. 사용자는 링크 클릭만으로도 Mac이 멈추는 현상을 경험할 수 있으며, 이는 macOS 환경에서 Chrome, Firefox, Safari 등 여러 브라우저에서 재현되었습니다.

이 문제는 웹GPU 기술의 컴퓨트 셰이더에서 무한 루프를 발생시켜 GPU 자원을 과도하게 점유함으로써 WindowServer 프로세스가 응답하지 않게 만드는 방식으로 작동합니다. 이로 인해 시스템 전체가 멈추는 현상이 발생하며, 때로는 마우스 움직임이 불가능해지거나 화면에 이상한 그래픽이 나타나기도 합니다.

이러한 문제는 Apple이 과거 WebGL 기반의 유사한 악성 셰이더(ShadyShader) 문제를 해결하기 위해 입력 유효성 검사를 추가한 선례가 있음에도 불구하고, WebGPU 환경에서는 무한 루프를 더 쉽게 악용할 수 있다는 점에서 보안 연구자들 사이에서 논란이 있습니다. Apple은 이 보고서에 대해 보안상의 영향을 발견하지 못했으며 제품 변경으로 이어지지 않았다고 밝혔으나, 많은 사용자는 이 현상을 보안 문제로 인식하고 있습니다.

개발자들은 비응답 셰이더에 대한 선제적 중단 메커니즘이 필요하며, 특히 신뢰할 수 없는 코드가 실행될 때 이에 대한 대응이 중요하다고 지적합니다. 이는 M-시리즈 칩의 GPU 처리 아키텍처와 관련하여 운영체제 커널이 GPU를 직접 제어하지 못하고 ASC라는 코프로세서를 통해 처리하는 구조적 한계에서 비롯된 것으로 보입니다.

Europe will go it alone on Venus mission after NASA yanks radar instrument

유럽우주국(ESA)은 NASA가 달 표면 탐사 임무에 필요한 레이더 장비 제공 약속을 철회함에 따라 금성 탐사 임무를 단독으로 진행하기로 결정했습니다. 이 임무의 프로젝트 과학자는 미국산 레이더 장비 제공이 어려워지면서 유럽이 독자적인 방식으로 임무를 추진하게 되었다고 밝혔습니다.

유럽의 궤도선인 엔비전(Envision)은 금성 표면을 이전 NASA 레이더 임무보다 10배 높은 해상도로 지도화할 예정입니다. 금성은 황산의 두꺼운 구름에 덮여 있어 광학 카메라로는 표면을 볼 수 없기 때문에 레이더가 구름을 뚫고 지형을 드러내는 가장 효과적인 방법입니다. 과학자들은 엔비전을 사용하여 금성의 활발한 화산 활동 징후를 찾을 계획입니다.

이전에는 NASA와 ESA는 2024년에 엔비전 파트너십에 대한 양해각서에 서명했으며, NASA는 미국산 합성 개구 레이더 장비를 제공하고 ESA는 미국 연구원을 과학팀에 포함하는 방식으로 협력했습니다. 이제 유럽은 엔비전 우주선과 나머지 과학 장비를 직접 제작하고 아리안 6 로켓을 통해 발사하는 책임을 지게 되었습니다.

Genuine Creativity Is Your New Moat (2026)

진정한 창의성이 새로운 경쟁 우위가 되는 시대입니다. 인공지능이 기존 콘텐츠를 쉽게 복제할 수 있게 되면서, 제품이나 사업을 운영하는 데 있어 경쟁력은 더 이상 기능이나 가격에만 있지 않고 새로운 아이디어를 발명하는 습관에 달려 있습니다.

이러한 창의적 사고의 중요성은 웹 개발 초기 시대의 경험을 통해 이해할 수 있습니다. 플래시(Flash) 시대는 웹 디자인의 창의적 폭발기였으며, 비록 기술적으로는 불편했지만, 사용자들이 드래그 앤 드롭 상호작용, 애니메이션 메뉴 등 기존에 불가능했던 새로운 아이디어를 실험하고 발견하게 만들었습니다. 이러한 실험 과정에서 실패를 두려워하지 않고 "만약에(What if)?"라는 질문을 던지는 것이 새로운 아이디어를 발견하는 핵심이 됩니다.

현재 웹 환경은 훨씬 표준화되고 기능적이지만 지루해졌기 때문에, 우리는 과거의 창의적인 실험 과정을 통해 새로운 아이디어를 발견하는 습관을 되찾아야 합니다. 성공적인 결과물을 만들기 위해서는 경쟁사의 웹사이트를 참고하여 '전문적인' 수준을 목표로 삼기보다, 고객이 원하는 것을 찾아내고 그 과정에서 가치 있는 것을 발견하는 데 집중해야 합니다.

결국 중요한 것은 실험을 멈추지 않고, 이상한 아이디어에 신뢰를 부여하며 그것이 작동하는지 확인하는 것입니다. 우리는 강력한 도구를 가지고 있으므로, 다른 사람들이 아직 시도하지 않은 기발한 아이디어를 탐구하고 그 가치를 찾아내는 데 집중해야 합니다.

Android can now securely migrate your logins between password managers

안드로이드에서 이제 비밀번호 관리자 간에 로그인 정보를 안전하게 마이그레이션할 수 있게 되었습니다. 더 길고 복잡한 비밀번호를 관리하는 것이 필수적이 되면서, 사용자들이 다른 로그인 관리 도구로 이동할 때 수동으로 정보를 입력해야 하는 번거로움을 해결하기 위해 구글이 새로운 로그인 이전 프로세스를 설계했습니다.

이 새로운 이동 과정은 사용자의 휴대폰 내에서 완전히 이루어지도록 설계되었으며, 이를 위해서는 해당 자격 증명이 동기화된 앱들이 설치되어 있어야 합니다. 마이그레이션을 시작하려면 사용자가 원하는 앱에서 가져오기 옵션을 찾아야 하며, 구글 비밀번호 관리자에서는 설정 탭 아래에 해당 기능이 위치합니다.

구글 비밀번호 관리자의 가져오기 기능은 새로운 마이그레이션 시스템에 연결되지만, 내보내기는 여전히 비밀번호가 포함된 암호화되지 않은 CSV 파일로 생성되어 모든 앱에 덤프할 수 있습니다. 현재 이 기능은 구글 앱, 1Password, Bitwarden, Dashlane 등 여러 앱에서 작동하고 있습니다.

Proxima Fusion bets €140M on a critical fusion ingredient dominated by Asian suppliers

프리마 퓨전(Proxima Fusion)이 핵융합 발전 설계에 필수적인 핵심 부품인 핵융합 등급 고온 초전도(HTS) 테이프 생산을 위해 1억 4천만 유로(약 1억 6,260만 달러) 규모의 공장을 건설할 계획입니다. 이 투자는 스타트업의 원자로 설계에 핵심적인 구성 요소를 제공하는 데 중점을 두고 있습니다.

이 공장은 핵융합 기술 개발에 필수적인 고온 초전도 테이프를 생산하는 데 사용될 예정이며, 이는 핵융합 발전 시스템의 효율성과 설계에 직접적인 영향을 미칩니다. 고온 초전도 물질은 핵융합로의 효율적인 작동을 위해 매우 중요한 역할을 하므로, 이 생산 능력 확보는 핵융합 기술의 상업화에 중요한 진전을 의미합니다.

다만, 이 핵심 재료의 공급망은 아시아 공급업체에 의해 주로 지배되고 있어, 생산 시설 구축과 관련하여 공급망 안정성과 비용 측면에서 고려해야 할 맥락이 있습니다. 따라서 프리마 퓨전의 대규모 투자는 기술 개발뿐만 아니라 글로벌 공급망의 역학 관계에도 영향을 미칠 수 있습니다.

Show HN: Two small Chrome extensions for Hebrew text and dates

Chaim Weiss가 개발한 Chaim's Apps는 일상적인 웹 브라우징을 돕기 위해 제작된 무료 크롬 확장 프로그램 모음입니다. 이 확장 프로그램들은 주로 히브리어 텍스트와 날짜 관련 기능을 제공하여 사용 편의성을 높이는 데 중점을 두고 있습니다.

제공되는 두 가지 주요 확장 프로그램은 히브리어 날짜 버블과 복사 없이 니쿠드 제거 기능입니다. 히브리어 날짜 버블은 웹상의 날짜를 마우스 오른쪽 버튼으로 클릭하면 히브리력 등 해당하는 히브리어 달력 등가치를 아름다운 버블 형태로 볼 수 있게 해줍니다. 또한 복사 없이 니쿠드 기능은 선택한 히브리어 텍스트에서 니쿠드(모음 표시)를 제거하고 텍스트만 즉시 복사할 수 있도록 합니다.

이러한 도구들은 히브리어 사용자들이 웹 환경에서 날짜 변환이나 텍스트 정리와 같은 특정 작업을 더 쉽게 수행할 수 있도록 돕는 실용적인 기능을 제공합니다. Chaim Weiss는 이러한 확장 프로그램 외에도 내부 도구부터 공개 제품까지 집중적이고 세련된 크롬 확장 프로그램과 소형 앱을 설계하고 구축하는 서비스를 제공하고 있습니다.

미공개 수학 연구를 OpenAI에 믿고 맡길 수 있는가, 추가 의문

Andreas Thom은 동료와 ChatGPT를 통해 논의했던 미공개 수학 연구가 OpenAI의 새로운 수학적 결과 도출에 활용되었는지에 대해 질문했습니다. 그러나 그는 답변에서 학습 데이터 편입과 풀이 과정에서의 접근을 구분하지 못했다는 점을 비판했습니다.

이러한 의문은 OpenAI가 최근 비소픽 군(non-sofic group)을 발견했다고 발표한 사건과 관련하여 제기되었습니다. Thom은 AI 모델이 어떤 방식으로 외부 연구나 정보를 활용하여 결과를 도출했는지에 대한 투명성이 부족하다고 지적했습니다.

이는 AI 시스템이 기반으로 하는 수학적 연구의 출처와 활용 방식을 명확히 구분해야 할 필요성을 시사합니다. 즉, AI 모델의 결과가 학습 데이터에 포함된 정보와 실제 문제 풀이 과정에서 접근한 정보 중 어느 것에 기반하는지 명확히 밝혀야 한다는 것입니다.

Panic builds over bankrupt Spirit’s looming data sale to Google

구글이 스피릿 항공(Spirit Airlines)의 파산 절차 과정에서 운영 데이터를 대량으로 인수하는 경매에서 승리했다는 보도가 나왔습니다. 이는 항공 데이터와 관련된 데이터 소유권 및 지적 재산권(IP) 문제로 인해 개발자 커뮤니티 내에서 우려를 낳고 있습니다.

이 데이터는 크루즈캄프(Doug Kreuzkamp)가 2011년에 설립한 스프링샷(Springshot)이라는 플랫폼이 항공 효율성과 물류 문제를 해결하기 위해 개발한 독점적인 기술 스택의 일부를 포함하고 있습니다. 스프링샷은 지난 3년간 스피릿의 기술 기반을 지원했으며 전 세계 수백 개의 공항에서 사용되고 있습니다.

문제는 스피릿이 데이터 판매를 준비하는 과정에서 스프링샷이 소유한 상당한 양의 데이터와 지적 재산권이 포함되어 있을 가능성이 있음에도 불구하고 스프링샷 측에 사전 통보가 없었다는 점입니다. 구글이 이 데이터를 확보함으로써 데이터 소유권과 AI 시대의 데이터 활용에 대한 새로운 논쟁이 발생할 수 있다는 점이 주목됩니다.

Amazon makes it easier to buy what you see on Prime Video

아마존이 프라임 비디오 전반에 걸쳐 쇼핑 통합을 확장하여 시청자들이 수천 개의 쇼, 영화, 라이브 스포츠와 연결된 제품을 발견할 수 있도록 기능을 제공합니다. 이 새로운 기능은 아마존의 쇼핑 앱인 X-Ray와 렌즈 기반의 새로운 “Shop the Scene” 기능을 통해 구현됩니다.

이러한 통합은 시청 경험을 확장하여 콘텐츠 소비와 상품 구매 과정을 직접 연결하는 것을 목표로 합니다. 사용자는 프라임 비디오 콘텐츠를 시청하는 도중에 해당 콘텐츠와 연관된 상품을 즉시 탐색하고 구매할 수 있게 됩니다.

특히 렌즈 기반의 “Shop the Scene” 기능은 시각적 정보를 활용하여 화면 속의 특정 물건이나 장면을 인식하고 관련 상품을 제안하는 방식으로 작동합니다. 이는 단순한 추천을 넘어 시청 환경 내에서 쇼핑 경험을 몰입감 있게 만드는 데 중점을 둡니다.

이러한 확장된 쇼핑 통합은 스트리밍 플랫폼과 이커머스 간의 경계를 허물며 사용자에게 새로운 상호작용 방식을 제시합니다. 개발자 관점에서 이는 콘텐츠 메타데이터와 상품 데이터 간의 연동 및 사용자 인터페이스 설계에 있어 새로운 통합 패턴을 보여줍니다.

GPU-CFR: 80x Faster Counterfactual Regret Minimization by Compiling the Game to Static Dataflow and CUDA Graph Replay

반사실적 후회 최소화(CFR)는 여전히 GPU보다 CPU에서 더 빠르게 실행되는 몇 안 되는 대규모 수치 작업 중 하나입니다. 기존 GPU 구현은 커널 실행 및 프레임워크 디스패치가 실행 시간의 대부분을 차지했기 때문에 최적화된 CPU 코드에 밀리는 경우가 많았습니다. 이에 저자들은 CFR 반복 과정에서 수치 값 외의 모든 정보가 첫 반복 전에 알려져 있다는 관찰을 바탕으로 GPU-CFR이라는 컴파일러 및 런타임을 제안했습니다.

GPU-CFR은 게임을 정적 데이터 흐름으로 컴파일하여 전체 연산 순서를 고정하고, 정적 확률 접기, 깊이 수준 실행 블록, 듀얼 레인 도달 버퍼 등의 기법을 사용하여 프레임워크 연산 횟수를 최대 18.1배까지 줄입니다. 또한 CUDA 그래프 리플레이를 통해 반복을 한 번 기록하고 단일 그래프 실행으로 재현함으로써 오버헤드를 최소화합니다.

이러한 최적화 결과, GPU-CFR은 동일한 A100 가속기에서 이전 GPU CFR보다 29.8배에서 80.4배, 그리고 가장 빠른 오픈소스 CPU 구현체인 LiteEFG보다 14배에서 258배 더 빠르게 실행됩니다. 심지어 가속기 없이 8개의 CPU 스레드에서 실행할 경우 GPU 기준보다 2.2배에서 51.1배 더 빠른 성능을 보입니다.

GPU-CFR은 업데이트 규칙을 변경하지 않고도 중대형 게임에서 모든 CPU 및 GPU 기준을 능가하며, 이는 CFR 작업의 실행 효율성을 획기적으로 개선할 수 있음을 의미합니다.

General Quantification of Covariate and Concept Shifts

현대 머신러닝에서 분포 변화 하에서의 일반화는 여전히 핵심적인 도전 과제이지만, 기존 학습 경계 이론은 좁고 이상적인 설정에 국한되어 있으며 샘플로부터 추정 불가능하다는 한계가 있습니다. 이 논문은 이론과 실제 응용 사이의 격차를 해소하는 것을 목표로 합니다.

연구진은 소스 및 타겟 지원이 불일치할 때 기존의 개념 변화 정의가 무너진다는 것을 보였습니다. 이를 해결하기 위해 엔트로피 최적 수송(entropic optimal transport)을 활용하여 $γ^*$-개념 변화라는 새로운 개념을 제안하고, 공변량 변화와 $γ^*$-개념 변화를 통합하는 일반적인 오차 경계를 도출했습니다. 이 경계는 광범위한 손실 함수, 레이블 공간, 확률적 레이블링에도 적용될 수 있습니다.

나아가 연구는 이러한 변화를 농축 보장(concentration guarantees)을 갖는 추정량과 DataShifts 알고리즘으로 발전시켰습니다. DataShifts 알고리즘은 대부분의 응용 분야에서 분포 변화를 정량화하고 오차 경계를 추정할 수 있는 엄밀하고 일반적인 도구입니다. 이는 분포 변화 하에서의 학습 오차를 분석하는 데 있어 강력한 도구가 될 것입니다.

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

인간이 작성한 텍스트 공급이 고갈됨에 따라 언어 모델 학습 데이터 반복이 표준 관행이 되었습니다. 기존 연구는 밀집 활성화 트랜스포머에서 데이터 반복을 연구했지만, 계산 효율성이 증가했음에도 불구하고 최근 지배적인 희소 아키텍처인 전문가 혼합(Mixture-of-Experts, MoE)에 대한 데이터 반복의 영향은 거의 탐구되지 않았습니다.

연구진은 단일 및 다중 도메인 데이터 혼합, 전문가 수 및 세분화 수준을 포함한 다양한 MoE 설정에서 데이터 반복률을 변화시키며 실험을 진행했습니다. 80M에서 1B 활성 파라미터를 가진 모델(총 85억 개)에 대해, MoE는 데이터 반복 하에서 밀집 모델보다 더 빠르게 성능이 저하됨을 발견했습니다. 이러한 효과는 활성 파라미터가 아닌 전체 파라미터에 의해 결정되는 희소성(sparsity)이 증가함에 따라 더욱 심화됩니다.

밀집 모델은 데이터를 8배까지 최소한의 성능 저하로 반복할 수 있는 반면, MoE는 4배 반복에서 이미 성능이 저하되기 시작하며, 모든 고유 데이터 설정에서 32배 반복 후에는 밀집 모델보다 성능이 뒤처집니다. 연구는 MoE 라우팅이 훈련 초기에 안정화되며, 전문가 특화가 반복된 데이터에 대한 과적합과 상관관계가 있음을 밝혀냈습니다.

이러한 과적합을 완화하기 위해 드롭아웃과 같은 기존 정규화 방법을 실험한 결과, 일부 방법은 과적합을 줄이는 데 도움이 되었습니다. 특히 강력한 마스킹 기반 정규화를 사용하면 MoE가 데이터가 64배 이상 반복될 때도 밀집 모델보다 더 나은 성능을 보일 수 있습니다. 최종적으로 연구는 희소성과 데이터 반복 사이의 상호작용을 다루며, 메모리 패턴을 방해하여 모델 파라미터의 과분업화를 줄이는 미래 방법론에 대한 가능성을 제시합니다.

Can Edge-Deployable Vision-Language Models Identify Species?

엣지 환경에서 카메라 트랩이 운영되는 상황을 고려할 때, 실제 종 식별에 적용 가능한 것은 거대 모델이 아닌 소형으로 현장 배포가 가능한 비전-언어 모델(VLM)이다. 본 연구는 이러한 VLM들이 실제 분류학적 지식을 가지고 있는지 평가하기 위해, 네 가지 VLM(Qwen3-VL 2B/4B/8B, Gemma3 4B)을 도메인 특화 모델인 BioCLIP(300M 파라미터)과 비교했다.

연구진은 깨끗한 iNaturalist 사진과 6개 LILA.science 컬렉션의 카메라 트랩 이미지를 비교하여 96종의 종 식별 과제를 수행했다. 모든 모델은 우연보다 훨씬 높은 정확도를 보였지만, 현장 이미지에 적용했을 때 모든 모델은 급격히 성능이 저하되었다. 이는 미세한 식별 실패가 아니라 일반적인 이미지 가독성의 변화 때문에 성능이 저하됨을 나타내며, 도메인 간 격차는 9.6%에서 26.6% 사이로 나타났다.

BioCLIP은 모델 크기가 훨씬 작음에도 불구하고 모든 VLM보다 현저히 우수한 성능을 보였는데, 이는 성능 격차가 모델 크기보다는 전문적인 훈련 데이터의 차이에서 비롯됨을 시사한다. 흥미롭게도 BioCLIP의 도메인 격차(18.0점)는 최고 VLM의 격차(22.3점)와 통계적으로 구별할 수 없는데, 이는 깨끗한 이미지에서 현장 이미지로의 성능 저하 자체가 이미지 품질 변화의 속성임을 의미한다.

또한, 오픈셋 프롬프팅 환경에서 모델들은 문법적으로는 유효하지만 분류학적으로 존재하지 않는 종 이름을 5.9%에서 9.6%까지 생성했다. 이러한 허위 생성률 순위는 모든 평가 세트에서 동일하게 재현되었는데, 이는 단일 점수 추정치보다 더 강력한 발견이다.

Generative Marketing Mix Modeling: A Causal Inference Framework Linking GEO and GEM to Business Impact

생성형 인공지능이 고객에게 도달하는 방식이 변화하고 있지만, 표준 마케팅 데이터는 사용자가 생성된 답변에서 기업 이름을 얼마나 자주 보고 인지하는지에 대한 정보를 기록하지 못합니다. 이에 연구진은 생성 엔진 최적화(GEO)와 생성 엔진 마케팅(GEM)의 인과적 효과를 추정하기 위해 생성형 마케팅 믹스 모델링(GMMM)을 개발했습니다.

GMMM은 GEO와 GEM의 효과를 측정하는 프레임워크로, GEO에 대해서는 반복된 생성된 답변, 질문 횟수, 생성 시스템 전반의 사용 공유 비율, 인지 확률을 결합하여 데이터를 구축합니다. 또한 GEM의 경우, 스폰서 배치 기록과 인지 확률을 결합하여 마케팅 활동의 영향을 분석합니다.

이 모델은 대안적인 처리 순서 하에서 예상되는 비즈니스 반응을 비교하여 결과적인 효과를 식별하는 방법을 제시합니다. 연구진은 이 방법의 실증적 성능을 영어와 일본어로 된 제품 추천에 대한 시뮬레이션 답변을 사용하여 조사했습니다.

이 연구는 생성형 AI 환경에서 마케팅 활동이 실제 비즈니스 성과에 미치는 인과 관계를 정량화하는 데 필요한 충분 조건을 확립한다는 점에서 중요합니다. 이는 생성형 AI를 활용하는 기업들이 마케팅 전략을 수립하고 최적화하는 데 필요한 새로운 측정 기준을 제공합니다.