스트라이프가 페이팔 추구에 대한 5000억 달러 규모의 노력을 포기한다고 발표했습니다. 이는 스트라이프와 파트너들이 참여했던 컨소시엄이 페이팔을 인수하려는 노력을 중단한다는 내용입니다.
이러한 결정은 스트라이프가 페이팔과의 경쟁 구도를 재정립하고 새로운 전략에 집중하겠다는 의지를 보여줍니다. 페이팔은 온라인 결제 시장에서 중요한 위치를 차지하고 있으며, 이 추구는 두 거대 금융 기술 기업 간의 경쟁에 큰 영향을 미쳤습니다.
이번 포기는 대규모 자원을 투입했던 경쟁 노력이 종료됨을 의미하며, 향후 스트라이프와 페이팔 간의 시장 전략 및 기술 협력 관계에 어떤 변화가 생길지 주목됩니다. 이는 결제 시스템 시장의 역학 관계에 중요한 변화를 가져올 수 있습니다.
Hacker News
뉴스
피드 등록 2026-08-28
1986
수집 2026-08-28 03:22
연방 판사가 트럼프 행정부가 인공지능 스타트업 앤트로픽(Anthropic)을 블랙리스트에 올린 조치가 위헌적이었다고 판결했습니다. 이 판결은 앤트로픽이 자사의 기술이 미국인의 대규모 감시나 자율 살상 무기에 사용되지 않도록 요구한 '헌법적으로 보호받는 표현 활동'에 대해 정부가 보복 조치를 취한 것이 부당했다고 보았습니다.
이러한 판결은 정부가 AI 기술 개발 및 사용에 대해 규제하거나 제한하는 방식에 대한 중요한 선례를 남겼습니다. 앤트로픽은 이 판결을 환영하며, 앞으로도 정부와 협력하여 AI를 국가 안보에 활용하는 데 집중하겠다는 입장을 밝혔습니다.
이번 판결은 앤트로픽이 트럼프 행정부의 조치에 대해 제기한 소송 중 첫 번째 소송을 종결시켰으며, 앤트로픽이 제기한 두 건의 소송 중 하나가 마무리된 것입니다. 앤트로픽은 현재 두 번째 소송을 진행 중이며, 행정부가 이 판결에 대해 항소하거나 두 번째 소송 결과가 나올 때까지 조치를 보류할 수 있습니다.
Hacker News
뉴스
발행 2026-08-28
jbegley
수집 2026-08-28 03:22
구글의 안티그래비티 팀워크 기능은 여러 AI 에이전트가 장기적인 연구 및 엔지니어링 문제를 함께 해결하도록 설계되었습니다. 이 기능은 수 시간에서 수일에 걸쳐 해법을 제안하고, 서로 비판하고 검증하며 개선하는 과정을 통해 복잡한 엔지니어링 문제를 해결하는 데 중점을 둡니다.
사용자는 특정 과제에 맞춰 코딩, 증명, 자체 검증, 문서 검토와 같은 다양한 패턴을 선택하여 에이전트의 역할을 지정할 수 있습니다. 또한, 연구 과정이 실행되는 도중에도 사용자는 에이전트의 수와 팀 구조를 조정하여 작업의 효율성과 방향성을 관리할 수 있습니다.
이는 개발자들이 복잡하고 장기적인 연구 개발 과정에서 필요한 엔지니어링 문제를 AI 에이전트 팀을 통해 체계적으로 해결할 수 있는 새로운 접근 방식을 제공합니다. 안티그래비티는 단순한 코드 생성을 넘어, 다중 에이전트 협업을 통해 깊이 있는 연구와 검증이 필요한 작업에 적용될 수 있습니다.
GeekNews
분석
피드 등록 2026-08-28
xguru
수집 2026-08-28 03:22
Route 53 Files는 Route 53의 공개 및 비공개 호스팅 영역을 NFS 파일 시스템으로 마운트하여 AWS 컴퓨팅 자원에서 표준 UNIX 도구를 사용하여 DNS 레코드를 편집할 수 있게 하는 비공식 무료 서비스입니다. 이 서비스는 개발자들이 AWS 환경에서 보다 효율적이고 표준화된 방식으로 DNS 관리를 수행할 수 있도록 돕는 것을 목표로 합니다.
Route 53 Files를 사용하면 DNS 레코드의 구조가 파일 시스템 형태로 표현됩니다. 구체적으로 레코드 이름은 디렉터리로, 레코드 세트는 파일로 표현되며, Alias는 심볼릭 링크로 표현되어 계층적인 구조를 쉽게 관리할 수 있습니다. 이러한 파일 기반 접근 방식은 기존의 복잡한 콘솔 인터페이스 대신 익숙한 UNIX 명령어를 통해 DNS 설정을 변경할 수 있게 합니다.
이는 AWS 환경에서 DNS 관리를 자동화하고 표준화하는 데 중요한 의미를 가집니다. 개발자는 NFS 마운트를 통해 Route 53 영역에 직접 접근하여 파일 시스템처럼 레코드를 관리할 수 있으며, 이는 대규모 인프라 환경에서 DNS 설정을 더욱 유연하게 조정할 수 있는 기회를 제공합니다.
GeekNews
튜토리얼
피드 등록 2026-08-28
xguru
수집 2026-08-28 03:22
구글이 배경 소음, 전문 용어, 말더듬, 자기 수정까지 처리하여 정돈된 텍스트로 변환하는 고정밀 음성-텍스트 모델을 공개했습니다. 이 새로운 모델은 음성 인식의 정확도를 크게 높여 개발자들이 실시간 음성 처리 애플리케이션을 구축하는 데 중요한 기반을 제공합니다.
특히, gemini-3.5-transcribe-live 모델은 Live API 환경에서 1초 미만 지연 시간으로 양방향 스트리밍을 지원하는 것이 특징입니다. 이는 실시간 음성 변환이 필수적인 서비스에서 지연 없이 고품질의 텍스트를 즉시 제공할 수 있게 하여 실시간 인터페이스 개발에 큰 이점을 제공합니다.
개발자들은 gemini-3.5-transcribe와 gemini-3.5-transcribe-live 모델을 활용하여 복잡한 음성 데이터를 처리하고 스트리밍하는 새로운 API 기능을 탐색할 수 있습니다. 이 기술은 음성 기반 애플리케이션의 성능과 사용자 경험을 향상시키는 데 기여할 것으로 기대됩니다.
GeekNews
출시
피드 등록 2026-08-28
xguru
수집 2026-08-28 03:22
토스에서 출퇴근길에 부담 없이 AI 기초를 학습할 수 있도록 미니앱 ‘퇴근이’를 출시했습니다. 이 서비스는 긴 강의나 교재 때문에 AI 학습을 시작하기 어려웠던 사용자들의 부담을 줄여주기 위해 기획되었습니다.
사용자들은 출퇴근길처럼 짧은 시간에 한 장씩 이어서 학습할 수 있도록 설계되었습니다. 이는 바쁜 일상 속에서 AI 기초 지식을 꾸준히 쌓고자 하는 학습자들에게 실질적인 도움을 제공하는 것을 목표로 합니다.
‘퇴근이’는 짧은 시간을 활용하여 AI에 대한 기초 지식을 단계적으로 익힐 수 있게 함으로써, 학습의 진입 장벽을 낮추는 데 중점을 두고 있습니다. 개발자나 학습자들이 일상 속에서 효율적으로 지식을 습득할 수 있는 새로운 학습 방식을 제시합니다.
GeekNews
출시
피드 등록 2026-08-28
rivolt2022
수집 2026-08-28 01:21
락스타 게임즈가 약속대로 그랜드 테프트 오토 VI의 확장된 미리보기 영상을 유튜브와 공식 웹사이트에 공개했습니다. 이 심층적인 프리뷰는 게임의 플레이스테이션 5 버전에서 캡처된 영상만을 사용하여 제작되었으며, 처음에는 미국 동부 시간 오후 3시에 넷플릭스에서 공개되었습니다.
이 영상은 전체적으로 게임의 분위기, 주인공인 제이슨 듀발과 루시아 카미노스, 그리고 게임 내 장소들을 강조하는 데 중점을 두고 있습니다. 구체적인 게임 메커니즘을 깊이 있게 다루기보다는 게임의 분위기를 전달하는 데 초점을 맞춘 내용입니다.
락스타 게임즈는 크리에이터들이 반응 영상을 게시할 수 있도록 허용했기 때문에, 공식 업로드 이전에 사용자들이 유튜브를 통해 해당 영상을 시청할 수 있는 상황이 발생했습니다. 따라서 공식 발표 외에 다양한 경로를 통해 확장된 미리보기를 접할 수 있게 되었습니다.
The Verge
뉴스
발행 2026-08-28
Jay Peters
수집 2026-08-28 01:21
터미널 환경에서 파일을 탐색하고 조작할 수 있는 현대적인 TUI 파일 관리자 superfile이 소개되었습니다. 이 도구는 터미널 내에서 화려한 사용자 인터페이스를 제공하여 파일 복사, 이동, 삭제 등의 작업을 직관적으로 수행할 수 있게 합니다.
superfile은 사용자가 사이드바, 파일 목록, 작업 진행 상황, 파일 정보, 클립보드, 명령 실행창을 하나의 화면에 통합하여 표시하는 것이 특징입니다. 이를 통해 사용자는 터미널 환경을 벗어나지 않고도 효율적으로 파일 작업을 처리할 수 있습니다.
특히 여러 개의 파일 패널을 동시에 열어 서로 다른 디렉터리를 쉽게 오갈 수 있는 멀티 패널 기능을 지원하여 복잡한 디렉터리 탐색과 작업 흐름을 개선합니다. 이는 개발자가 터미널 기반 작업 시 여러 경로를 동시에 관리해야 할 때 큰 이점을 제공합니다.
GeekNews
출시
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
Google이 프로덕션용 생성형 영상 모델인 Gemini Omni 1.1 Flash를 Gemini API를 통해 공개했습니다. 이 모델은 장면 연장, 키프레임 전환, 영상 참조, 고해상도 출력 기능을 지원하여 영상 생성 및 제어의 능력을 크게 강화했습니다.
이번 공개를 통해 개발자들은 영상 생성 작업에서 더 정교한 제어가 가능해졌습니다. Gemini Omni 1.1 Flash는 최대 10초의 이전 문맥을 분석하여 영상을 10초 단위로 누적하여 최대 40초까지 연장할 수 있습니다. 이는 기존 방식이 마지막 1초만 참조하던 한계를 극복하고 영상의 일관성과 연속성을 높이는 데 기여합니다.
특히, 모델은 영상의 연속성을 유지하면서도 필요한 정보를 효율적으로 참조할 수 있도록 설계되었습니다. 개발자들은 이 새로운 API를 활용하여 복잡한 영상 시퀀스를 생성하고 편집하는 데 있어 더욱 강력하고 세밀한 제어권을 확보할 수 있습니다.
GeekNews
출시
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
gpt-5.6-luna 모델은 약 100tps의 처리 속도로 코드베이스, 이메일, 지식 기반을 처리할 수 있습니다. 이 모델은 복잡한 조사나 수천 개의 이메일을 검색하는 작업도 수십 센트 수준의 비용으로 실행할 수 있는 능력을 보여줍니다.
이러한 소형 모델의 등장은 AI 기반 서비스의 비용 구조에 큰 변화를 가져오고 있습니다. 특히 개인화된 일일 뉴스 사이트를 생성하는 비용이 Sonnet급 모델의 약 1달러에서 luna 모델의 평균 10센트 수준으로 크게 낮아졌습니다.
이는 개발자와 사용자에게 AI 서비스를 훨씬 더 저렴하고 효율적으로 제공할 수 있는 기회를 제공합니다. gpt-5.6-luna와 같은 소형 모델은 고성능 작업을 낮은 비용으로 수행할 수 있게 하여, 복잡한 데이터 처리와 개인화된 콘텐츠 생성의 접근성을 높일 것입니다.
GeekNews
뉴스
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
장시간 동작하며 수백 번의 판단을 거치는 AI 에이전트를 최종 결과 하나만으로 평가하기는 어렵습니다. 따라서 에이전트가 작업 과정에서 반복적으로 보여야 할 행동을 문서화하는 개방형 포맷이 새로운 평가 기준으로 제시됩니다.
이러한 방법은 에이전트가 어떤 정보를 확인하고, 무엇을 판단하며, 어떻게 실행하는지에 대한 과정을 투명하게 기록하는 데 중점을 둡니다. 특히 정보가 부족하거나 작업이 실패했을 때 에이전트가 어떻게 복구하는지에 대한 메커니즘을 문서화하는 것이 중요합니다.
개발자들은 이러한 행동 기록을 통해 단순히 최종 결과뿐만 아니라 에이전트의 추론 과정과 실패 처리 방식을 객관적으로 평가할 수 있게 됩니다. 이는 복잡한 AI 시스템의 신뢰성과 안정성을 확보하는 데 필수적인 표준을 제공합니다.
GeekNews
분석
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
AI 스타트업 생태계에서 제품과 경쟁 구도가 매일 변화함에 따라 창업자와 투자자들은 테크 트위터의 뉴스 및 여론을 상시 추적해야 하는 압박을 받고 있습니다. 이러한 환경은 스타트업들이 빠르게 변화하는 시장에서 생존하기 위해 실시간 정보에 의존하게 만드는 주요 요인입니다.
특히 AI 기업의 제품 시장 적합성(PMF)은 과거와 달리 6개월에서 12개월만 지속될 수 있다는 점이 주목됩니다. 과거에는 시장 우위를 확보하는 데 더 오랜 시간이 걸렸으나, 현재는 제품의 적합성이 매우 짧은 기간 내에 결정되는 상황입니다.
이러한 불확실성 속에서 창업자와 투자자들은 시장의 미묘한 변화와 여론을 파악하기 위해 소셜 미디어를 중요한 정보원으로 활용하고 있습니다. 이는 단순히 정보를 얻는 것을 넘어, 경쟁 우위를 확보하고 제품을 지속적으로 개선해야 하는 현실적인 압박으로 작용합니다.
GeekNews
분석
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
최근 인터랙티브 생성 UI 아티팩트(Interactive Generative UI Artifacts) 기능이 추가되어 마크다운, 이미지, Mermaid만으로는 설명하기 어려운 아이디어를 직접 조작 가능한 UI로 생성할 수 있게 되었습니다. 이는 사용자가 복잡한 개념을 시각화하고 상호작용하며 탐색하는 방식을 혁신적으로 변화시킵니다.
이 새로운 기능은 에이전트가 단순한 텍스트 생성을 넘어 동적 데이터 시각화와 대시보드부터 3차원 설명용 시뮬레이션까지 생성할 수 있는 능력을 확장합니다. 에이전트는 대화 과정이나 아티팩트 패널 내에서 이러한 복잡한 시각화 결과물을 직접 만들고 조작할 수 있게 됩니다.
개발자들은 이 기능을 통해 데이터 분석이나 복잡한 시스템 설계를 위한 시뮬레이션 및 대시보드 제작에 있어 AI 에이전트의 활용 범위를 크게 넓힐 수 있습니다. 특히 3D 시뮬레이션과 같은 고차원적인 시각화가 자연어 기반의 대화와 통합되어 더욱 직관적이고 상호작용적인 방식으로 구현될 수 있게 되었습니다.
GeekNews
출시
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
Omarchy 4.0은 신뢰할 수 없는 입력을 안전하게 처리하지 못하는 여러 취약점을 포함하고 있어 임의의 Bash 명령 실행으로 이어질 수 있습니다. 이는 개발 관행상의 문제로 인해 발생한 보안 위험이며, 입력 검증 원칙을 따르지 않은 상태에서 사용자가 입력한 내용을 그대로 처리하는 구조적 결함이 존재합니다.
특히 동영상 제목이나 알림을 통한 Bash 주입 취약점은 이러한 문제의 구체적인 사례입니다. 개발자들이 AI가 생성한 Bash 스크립트를 충분히 검토하지 않고 입력 검증 원칙을 무시했을 때 이러한 취약점이 악용될 수 있습니다.
따라서 개발자는 신뢰할 수 없는 입력을 처리할 때 입력 검증 원칙을 철저히 준수해야 하며, AI 생성 코드를 시스템에 통합하기 전에 보안 검토 절차를 반드시 거쳐야 합니다. 이러한 개발 관행의 부재는 예측 가능한 보안 문제로 이어지므로 안전한 시스템 구축을 위해 입력 처리와 코드 검토에 더욱 주의를 기울여야 합니다.
GeekNews
분석
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
인공지능(AI)이 인간의 인지를 대체하거나 능가하며 빠르게 확산되고 있어 세계는 이 전환에 충분히 대비하지 못하고 있습니다. AI는 역사상 가장 큰 평등화 수단이 될 수도 있지만, 동시에 최악의 불평등 원인이 될 수도 있는 양면성을 가지고 있습니다.
기존 기기와 자연어를 이용하고 스스로 작업을 검토하고 개선하는 AI 기술이 PC보다 훨씬 빠른 속도로 도입되고 있습니다. 이러한 기술의 급속한 확산은 개발자와 사용자 모두에게 새로운 패러다임의 변화를 요구하고 있습니다.
AI의 발전 속도는 사회적 평등과 불평등이라는 중대한 문제와 직결되어 있으며, 기술 도입에 따른 윤리적, 사회적 대비가 시급합니다. 따라서 기술적 진보와 함께 이러한 전환에 대한 충분한 논의와 대비가 필요합니다.
GeekNews
뉴스
피드 등록 2026-08-28
xguru
수집 2026-08-28 01:21
GitHub 기여 기록이 채용 과정에서 평판 자산으로 활용되면서, 이를 부풀리기 위해 LLM을 사용하는 사례가 증가하고 있습니다. 개발자들이 LLM을 활용하여 PR(Pull Request)이나 보안 보고서를 손쉽게 생성함으로써 실제 활동보다 더 많은 기여를 한 것처럼 보이게 만드는 행태가 늘고 있습니다.
최근 외부 기여는 심각한 이슈 보고서보다는 PR 형태로 들어오는 경우가 많아졌습니다. 이러한 추세에 따라 이슈나 취약점 보고서에도 AI가 생성한 분석 및 수정안이 자주 첨부되고 있습니다.
이는 개발 활동의 진정성과 신뢰성에 영향을 미칠 수 있습니다. 채용 과정에서 기여 기록이 평판 자산으로 평가되는 상황에서, AI 생성 콘텐츠의 사용은 실제 기술 역량과 활동을 왜곡할 위험을 내포하고 있습니다.
따라서 개발자들은 AI를 활용하더라도 기여의 진정성을 확보하고, 생성된 콘텐츠가 실제 기술적 깊이를 반영하도록 신중하게 검토해야 합니다.
GeekNews
분석
피드 등록 2026-08-28
neo
수집 2026-08-28 01:21
Terminal-Bench-Science 0.1 릴리즈가 발표되었으며, 이는 AI 에이전트의 과학 연구 워크플로우 수행 능력을 평가하는 새로운 벤치마크입니다. 이 벤치마크는 모델 개발자나 데이터 공급자가 아닌 과학자들이 AI의 과학적 역량을 설정하고 측정할 수 있도록 설계되었으며, 스탠퍼드 대학교 연구진과 다양한 과학 분야 전문가들이 협력하여 구축했습니다.
Terminal-Bench-Science 0.1은 생명과학, 물리, 지구과학, 수학, 공학 등 5개 과학 분야에서 총 70개의 전문가가 선별한 도전적인 워크플로우를 포함하고 있습니다. 이 벤치마크의 목표는 AI 에이전트가 연구 보조원으로서 기능하여 과학적 발견을 가속화할 수 있도록 하는 과학적 역량을 개발하는 것입니다. 즉, 에이전트가 연구 질문 정의, 가설 형성, 결과 해석 및 검증과 같이 인간의 판단이 중요한 영역에 집중할 수 있도록 기술적으로 까다롭고 시간이 많이 소요되는 워크플로우를 실행하도록 하는 것입니다.
평가 결과, 가장 강력하게 평가된 모델인 Claude Opus 5는 Terminal-Bench-Science 0.1에서 30%의 해상도율을 달성했습니다. 이는 AI 에이전트의 능력을 실제 과학적 관행에 기반하여 측정하고, AI 발전의 최전선과 함께 진화하는 지속적인 벤치마크를 제공한다는 점에서 중요합니다. 과학적 역량은 교과서 문제나 표준화된 연습이 아닌 실제 연구 관행을 통해 평가되어야 하며, 이를 통해 AI의 한계를 명확히 파악하고 과학적 발견을 가속화할 수 있는 피드백 루프를 구축하고자 합니다.
Hacker News
논문
피드 등록 2026-08-28
matt_d
수집 2026-08-28 01:21
SourceHut이 커뮤니티 논의와 내부 검토를 거쳐 생성형 AI를 이용한 원본 콘텐츠 작성 및 사용을 금지하는 방향으로 서비스 약관을 변경했습니다. 이 새로운 약관은 소스 코드, 에셋, 티켓, 이메일 등 다양한 콘텐츠 생성 및 작성 보조에 LLM을 사용하는 것을 명시적으로 금지합니다.
변경된 약관은 2주 공지 기간을 거친 후 9월 10일부터 신규 프로젝트에 적용됩니다. 이는 개발자들이 플랫폼 내에서 콘텐츠를 생성하거나 기존 자료를 보조하는 과정에서 생성형 AI의 사용 범위를 엄격하게 제한한다는 의미입니다.
따라서 개발 프로젝트를 진행할 때 소스 코드나 에셋 생성 과정에 LLM을 활용하는 방식에 대해 신중하게 검토해야 합니다. 플랫폼은 AI를 활용한 콘텐츠 생성을 제한함으로써 원본 콘텐츠의 품질과 사용 방식을 보호하고자 합니다.
GeekNews
뉴스
피드 등록 2026-08-28
neo
수집 2026-08-28 01:21
LLM의 효율성과 정확도를 동시에 개선하기 위해 하이브리드 정밀도 양자화 프레임워크인 HyQuant가 제안되었습니다. 기존의 어텐션 모듈 저비트 양자화는 낮은 비트 폭에서 큰 오류를 발생시켜 성능 저하를 초래하는 문제가 있었습니다. HyQuant는 이러한 문제를 해결하기 위해 대부분의 어텐션 상태를 저비트 형식으로 양자화하면서도 정확도가 중요한 수직선 토큰(vertical-line tokens)과 국소 윈도우 상태(local-window states)는 고정밀도로 유지하는 하이브리드 방식을 채택합니다.
이러한 정확도에 민감한 영역은 가벼운 수직선 인식 어텐션 패턴 신호를 사용하여 선택하며 양자화 오류를 최소화합니다. 특히 추론 과정에서 HyQuant는 효율성을 극대화합니다. 프리필(Prefill) 단계에서는 수직선 토큰과 국소 슬라이딩 윈도우를 전체 정밀도로 보존하면서 나머지 컨텍스트를 양자화하는 하이브리드 정밀도 어텐션 연산자를 사용합니다.
디코드(Decode) 단계에서는 KV-캐시 압축에도 동일한 원리를 적용하여 메모리와 하드웨어 효율성을 높입니다. 구체적으로 KV 역양자화와 어텐션 연산을 융합하여 메모리 효율을 개선합니다. HyQuant는 다양한 작업, 모델, 데이터셋 전반에서 거의 손실 없는 정확도를 유지하며, LLM 어텐션에 대한 하이브리드 양자화의 효율성과 실용적인 가능성을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-28
Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin Ouyang, Feihu Zhou, Kun Zhang, Zhenyu Guo, Hao Pan, Guangtao Xue, Yiming Zhang
수집 2026-09-11 03:21
대화하는 아바타는 말하면서 동시에 움직임을 결정해야 하지만, 현재의 모델들은 음성 대화 모델과 동시 발화 동작 모델이 분리되어 있어 두 모델 간의 공동 최적화가 불가능합니다. 표준적인 해결책인 순차적 방식은 음성 응답을 먼저 생성한 후 동작 모델을 실행해야 하므로 두 번의 전체 추론 과정을 필요로 하며 상호 최적화를 막습니다.
본 논문은 이러한 문제를 해결하기 위해 Motion-Omni라는 종단 간 프레임워크를 제시합니다. 이 프레임워크는 음성 대화 모델이 음성에서 나오는 숨겨진 상태로부터 얼굴 표정과 손, 상체, 하체의 움직임을 직접 생성하도록 하여, 음성 경로를 고정하더라도 동작이 오디오와 일치하도록 공동 적응을 통해 정렬을 회복시킵니다.
연구진은 이 프레임워크를 위해 모델에 대한 감독을 제공하는 확장 가능하고 모델에 구애받지 않는 파이프라인을 사용했으며, 이를 통해 422,856개의 품질 평가 쌍(1,402시간)을 확보했습니다. 또한, 확률적 오픈 엔드 풀 바디 음성 대화에 대한 최초의 공개 평가 프로토콜인 SwDA-500을 발표했습니다.
Qwen2.5-7B-Instruct 백본을 사용하여 구현된 Motion-Omni-Q7은 참조 없는 동작 측정 지표에서 교사 캐스케이드와 2% 이내로 일치하며, 실시간보다 5.4배 빠른 속도(RTF=0.78)로 응답하고, 비교 대상 시스템 중 가장 낮은 2.62%의 단어 오류율을 달성했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-28
Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo
수집 2026-09-07 03:12