.env 파일을 .gitignore에 포함시키는 방식은 비밀값을 Git에 커밋하는 것을 방지할 수는 있지만, 로컬 프로젝트 파일에 평문으로 남아 있는 비밀값을 AI 에이전트가 읽는 것을 막지는 못합니다. 이러한 보안 문제는 이제 Git 커밋을 넘어 프로젝트 파일과 명령 실행 환경에 접근할 수 있는 AI 에이전트의 등장으로 인해 더욱 심각해졌습니다.
개발자들이 흔히 사용하는 .env 파일이나 셸 기록, MCP 설정 등 민감한 정보가 프로젝트 내에 평문으로 노출되어 AI 에이전트에게 유출될 위험이 존재합니다. 이는 단순히 버전 관리 시스템을 통한 유출 방지를 넘어, AI 에이전트가 시스템 환경에 접근하여 민감한 정보를 취득하고 명령을 실행할 수 있는 새로운 위협을 의미합니다.
따라서 개발 환경에서 민감한 정보가 AI 에이전트에게 노출되지 않도록 하기 위해서는 파일 시스템 접근과 명령 실행 환경에 대한 통제 방안을 추가적으로 고려해야 합니다. 이러한 환경적 접근 통제 없이는 기존의 .gitignore 방식만으로는 AI 에이전트의 잠재적 위협을 완전히 차단하기 어렵습니다.
GeekNews
분석
피드 등록 2026-08-26
xguru
수집 2026-08-26 02:52
OpenAI가 Broadcom과 공동 설계한 범용 LLM 추론 ASIC인 Jalapeño가 엔비디아 Blackwell보다 높은 전력당 처리량을 기록하며 주목받고 있습니다. 이 칩은 초기 A0 실리콘만을 사용하여 여러 오픈 모델에서 뛰어난 효율성을 입증했으며, Rubin의 공개 결과까지 앞서는 성과를 보였습니다.
Jalapeño는 HBM4와 단순화된 메모리 및 네트워크 구조를 채택하여 작은 행렬에서도 매우 효율적인 코어 연산을 가능하게 합니다. 이러한 설계는 LLM 추론 작업에서 전력 효율성을 극대화하는 데 중점을 두었으며, 이는 대규모 모델 운영에 있어 중요한 이점을 제공합니다.
이러한 기술적 진보는 LLM 추론 칩 설계에서 새로운 효율성 기준을 제시하며, 향후 AI 하드웨어 경쟁에 중요한 영향을 미칠 것으로 예상됩니다. Jalapeño는 고성능과 전력 효율성이라는 두 마리 토끼를 모두 잡으려는 노력을 보여줍니다.
GeekNews
뉴스
피드 등록 2026-08-26
xguru
수집 2026-08-26 00:51
iMessage 기반 개인 비서인 Poke는 사용자가 문자로 요청한 웹사이트를 생성하여 Vercel에 배포하고, 생성된 각 웹사이트마다 별도의 데이터베이스를 자동으로 제공합니다. 이러한 시스템은 AI 비서가 생성한 웹사이트의 데이터 관리 요구사항을 충족시키기 위해 각 사이트별로 전용 DB를 제공하는 것을 목표로 합니다.
이때 사용되는 데이터베이스 플랫폼은 Turso입니다. Turso는 SQLite 호환 데이터베이스를 클라우드 환경에서 생성하고 원격으로 사용할 수 있게 만든 플랫폼입니다. 이는 개발자가 웹사이트를 구축할 때 각 프로젝트에 독립적이고 효율적인 데이터 저장 공간을 자동으로 확보할 수 있도록 지원합니다.
Turso를 활용함으로써 Poke는 사용자가 요청한 웹사이트의 데이터가 분리되어 관리되며, 각 웹사이트가 독립적인 데이터베이스를 통해 운영될 수 있게 됩니다. 이는 AI가 생성한 웹사이트의 데이터 무결성과 확장성을 보장하는 데 중요한 역할을 합니다.
GeekNews
뉴스
피드 등록 2026-08-26
neo
수집 2026-08-26 00:51
MNT Station은 데스크톱 PC, 홈랩 서버, 라우터, 엣지 장치, NAS, 미디어 및 레트로 게임기 등 다양한 장치를 구성할 수 있는 저전력 팬리스 플랫폼입니다. 이 플랫폼은 모듈식 설계를 통해 사용자가 필요에 따라 하드웨어 구성을 유연하게 변경할 수 있도록 설계되었습니다.
MNT Station은 MNT Reform 메인보드 2.0, 2.5, 3.0을 지원하며 교체형 프로세서 모듈을 통해 확장성을 제공합니다. 이는 기존 노트북 메인보드를 재사용하면서도 새로운 기능을 추가하거나 서버 환경을 구축하는 데 유용합니다.
특히, MNT Station은 NXP, Amlogic, Qualco 등 다양한 제조사의 프로세서 모듈을 지원하여 폭넓은 하드웨어 선택권을 제공합니다. 따라서 기존에 보유하고 있던 노트북 메인보드를 활용하여 저전력 환경에서 홈 서버나 특수 목적의 장치를 구축하고자 하는 개발자나 홈랩 사용자에게 실질적인 대안을 제시합니다.
GeekNews
출시
피드 등록 2026-08-26
neo
수집 2026-08-26 00:51
EVE Online이 20년 이상 운영해 온 파이썬 코드베이스를 파이썬 3로 단계적으로 전환하는 작업을 시작했습니다. 이 과정에서 Singularity의 검증을 거친 첫 변경 사항들이 Tranquility에 배포되었습니다.
이번 전환 작업은 대규모 코드베이스를 다루는 데 있어 중요한 기술적 과제를 제시합니다. 개발팀은 240만 줄에 달하는 코드와 약 2만 개의 파일에 대해 파이썬 2.7과 파이썬 3 환경 모두에서 실행 가능하도록 만드는 것을 목표로 했습니다.
이러한 작업을 통해 버전별로 동작이 달라지는 부분을 관리하며 코드베이스의 안정성을 유지하는 것이 핵심이 되었습니다. 이는 오랜 기간 운영된 대규모 프로젝트에서 레거시 코드를 최신 환경으로 마이그레이션할 때 필요한 복잡한 호환성 문제를 해결하는 데 중요한 사례가 됩니다.
GeekNews
뉴스
피드 등록 2026-08-26
neo
수집 2026-08-26 00:51
OpenAI는 데이터 센터 전략을 총괄했던 핵심 임원인 크리스 말론을 잃으면서 고위급 경영진의 이탈이 계속되고 있습니다. 말론은 지난주 회사를 떠났으며, 이는 AI 인프라 구축 경쟁이 치열한 상황에서 데이터 센터 전략의 변화가 주목받는 가운데 더욱 놀라운 일로 평가됩니다.
OpenAI는 말론의 퇴사에 대해 인프라 조직을 재편하여 작업의 규모와 속도를 지원하기 위해 조직을 개편했다고 밝혔습니다. 이 과정에서 말론은 OpenAI 사장인 그렉 브록먼이 아닌 부사장인 사친 카티에게 직접 보고하게 되었습니다. 이는 데이터 센터 팀의 리더십이 재조정되었음을 의미하며, 유다 라드라주, 브렌트 메이오, 스파스 라자로프 등 다른 임원들이 데이터 센터 전략을 감독하고 있습니다.
이러한 이탈은 최근 몇 달간 발생한 다수의 고위 임원 퇴사와 맞물려 AI 기업 내부의 인재 유출 현상을 보여줍니다. 회사는 현재 IPO를 2027년으로 연기하고 있으며, 막대한 투자 대비 수익성 및 가치에 대한 의문이 제기되고 있습니다. 따라서 OpenAI의 인재 유출과 재정적 불확실성은 향후 AI 산업의 성장과 기업 가치에 어떤 영향을 미칠지 주목할 필요가 있습니다.
TechCrunch
뉴스
발행 2026-08-26
Lucas Ropek
수집 2026-08-26 00:51
Rust 언어의 `never` 타입이 10년 만에 안정화되었습니다. 이 타입은 값이 절대 생성되지 않는 상황을 나타내며, 함수 호출자에게 값을 반환하지 않는 코드 상황을 정확하게 표현할 수 있게 해줍니다.
이전에는 이러한 상황을 표현하기 위해 `panic!()`이나 무한 루프와 같은 방식으로 코드를 처리해야 했기 때문에 타입 시스템이 이를 명확하게 구분하지 못했습니다. 이제 `never` 타입을 사용함으로써 개발자는 함수가 어떤 값도 반환하지 않음을 명시적으로 표현할 수 있게 되었습니다.
구체적으로 `never` 타입은 프로세스 종료, 무한 루프, 또는 패닉 상황처럼 호출자에게 값을 반환하지 않는 코드 흐름을 타입 레벨에서 표현하는 데 사용됩니다. 이는 컴파일러가 코드의 흐름과 반환 값의 부재를 더 정확하게 추론하고 안전성을 보장하는 데 기여합니다.
이 안정화는 Rust의 타입 시스템을 더욱 강력하고 정확하게 만들어, 복잡한 비동기 또는 오류 처리 상황에서 발생할 수 있는 논리적 오류를 줄이는 데 중요한 진전을 의미합니다.
GeekNews
뉴스
피드 등록 2026-08-26
neo
수집 2026-08-26 00:51
Qwen3.8 27B 모델의 양자화 성능을 벤치마킹한 결과, 4비트 양자화는 성능 저하 없이 대부분의 벤치마크에서 안정적인 결과를 유지하는 것으로 나타났습니다. 특히 1비트 양자화는 추론 능력에서 급격한 성능 저하를 보이며 결과가 무너지는 현상이 관찰되었습니다.
이러한 비교는 GPQA Diamond, IFBench, Terminal-Bench 2.1과 같은 인기 있는 벤치마크를 통해 측정되었으며, 모델의 양자화 수준이 실제 문제 해결 능력에 미치는 영향을 구체적으로 보여줍니다. 4비트 양자화 Q4_K_M(17GB)은 전체 BF16 모델과 유사한 결과를 보였으며, 이는 모델을 구동하는 데 필요한 GPU 메모리 요구 사항을 크게 줄이면서도 품질을 희생하지 않는다는 것을 의미합니다.
다만, 양자화의 효과는 사용된 벤치마크와 설정에 따라 달라지며, 특히 추론 과정에서 설정값(예: xhigh)이 결과에 큰 영향을 미쳤습니다. 또한, 토큰 예측 차이 외에 실제 작업 수행 능력에 대한 평가가 중요하며, KV 캐시 양자화 역시 결과에 영향을 줄 수 있다는 점을 고려해야 합니다.
결론적으로, 대부분의 작업에서는 Q4_K_M 양자화를 사용하는 것이 충분하며, 양자화에 대한 우려보다는 이를 적극적으로 수용하는 것이 효율적이라는 결론을 내릴 수 있습니다.
Hacker News
분석
발행 2026-08-26
stared
수집 2026-09-08 16:37
온폴리 자기 증류(On-Policy Self-Distillation, OPSD)는 언어 모델이 자체 생성물을 학습하면서 교사(teacher)의 역할을 모델 자신이 수행하게 하여 별도의 대형 모델을 사용하는 비용을 제거하는 방법입니다. 교사는 테스트 시점에 학생이 갖지 못할 참조 해답이나 계획 같은 특권 정보로 조건화되며, 모델 자체보다 더 잘 정보를 갖게 되는 역할만 합니다. 초기 결과는 생성된 토큰의 일부만으로 강화 학습과 유사한 정확도를 달성하여 유망함을 보였습니다.
하지만 이 신호가 생성하는 비대칭성 때문에 결과가 편향될 수 있으며, 현재 분야에서 가장 지배적인 실패 모드는 모델이 생성할 수 있는 추론 경로의 집합을 점진적으로 좁히는 '붕괴(collapse)'입니다. 붕괴는 특권 정보가 가중치를 부여하는 방식, 교사의 역학 및 안내의 감쇠, 그리고 교사가 보여주는 특권 정보의 성격이라는 세 가지 레버에 의해 통제됩니다.
연구진은 방법론이 기원하고 실패 모드가 가장 잘 문서화된 수학적 추론에 초점을 맞추어 분석했습니다. 이 연구는 새로운 실험 결과를 보고하지는 않았지만, 논문들 전반에 걸쳐 다르게 명명된 현상들에 대한 공유된 어휘를 제공하며 무엇이 확정되었고 무엇이 여전히 논쟁 중인지를 명확히 구분하는 구조적인 기여를 합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Justin Robert, Raheel Qader
수집 2026-09-08 07:32
멀티모달 에이전트 평가가 정적인 QA에서 외부 도구를 사용하는 에이전트 환경으로 전환됨에 따라, 모델이 시각적 증거로부터 도구 매개변수를 추론하고 이를 최종 결과에 직접 적용하는 정교한 시각적 도구 사용 능력에 대한 평가가 중요해지고 있습니다. 기존 벤치마크들이 웹 탐색이나 GUI 조작에 초점을 맞춘 반면, 시각적 증거와 실행 정밀도 간의 결합을 측정하는 이 능력을 다루는 경우는 드물었습니다.
연구진은 이러한 미탐색된 능력을 평가하기 위해 EASEL이라는 벤치마크를 제안했습니다. EASEL은 참조 기반 시각 재구성을 주요 과제로 채택하여 에이전트가 참고 이미지를 맞추기 위해 캔버스를 점진적으로 칠하는 방식으로 시각적 도구 사용을 평가합니다. 이 벤치마크는 영역 주석, 필기, 경로 계획을 포함하는 의미론적 과제들을 추가하며, 경로 감독을 위한 44만 샘플의 2단계 커리큘럼 데이터셋인 EASEL-Data와 EASEL-9B를 제공합니다.
25개 모델에 대한 평가 결과, 현재의 멀티모달 에이전트들은 EASEL에서 체계적으로 어려움을 겪는 것으로 나타났습니다. 재구성 유사도는 낮은 수준에서 병목 현상(0.40~0.54)을 보였으며, 경로 진단은 폐쇄 루프 불안정성을 드러내 모델들이 조기에 포화되거나 최고점 이후 성능이 저하됨을 보여줍니다. 또한 의미론적 과제들은 정밀한 주석 및 경로 계획에서 뚜렷한 능력 경계를 드러냈습니다. EASEL-Data로 훈련된 EASEL-9B 모델은 기본 모델보다 상대적으로 6.3% 향상되어 전체 평가 모델 중 세 번째 순위를 차지했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu
수집 2026-08-31 06:10
거대 언어 모델(LLM)에 다층 방어 체계가 적용되고 있음에도 악의적인 프롬프트가 이를 우회할 수 있다는 문제가 제기되고 있습니다. 해석 가능성 방법은 생성 경로를 따라 모델 내부 신호를 노출하여 강제 조치를 위한 정보를 제공할 수 있지만, 이러한 신호 자체는 보안 통제 수단이 아닙니다. 안전을 위해 이러한 신호를 적용하는 배포 방식은 각 신호를 자체 보정, 정책 논리, 개입 코드와 결합하여 새로운 결과물을 만들 뿐, 공유된 방어를 강화하지 못하는 통합 작업만 발생시킵니다.
이에 연구진은 리눅스 보안 모듈(LSM)의 분리 개념을 LLM 서비스에 적용한 보안 프레임워크인 언어 모델 보안 모듈(LMSM)을 제시합니다. LMSM은 선택된 보안 백엔드를 통해 보정된 증거를 노출하고, 신뢰할 수 있는 요청별 컨텍스트에 대한 활성 규칙을 평가하는 버전화된 정책을 사용하며, 별도의 게이트를 통해 버퍼된 출력을 승인하는 방식으로 설계되었습니다. 이 디자인은 중재의 정확성과 정책의 효과성을 분리하여 백엔드, 규칙 또는 스케줄 변경 시 요청 처리나 강제 조치를 다시 구축할 필요 없이 변경을 허용합니다.
프로토타입은 Hugging Face Transformers와 vLLM을 사용하여 구현되었으며, 동일한 기저 위에서 희소 오토인코더(SAE) 및 트랜스코더 배포와 작업에 맞춘 밀집 탐침을 호스팅합니다. 이 시스템은 스케줄 변경 하에서도 요청별 결정을 보존하며 요청당 여러 규칙을 선택적으로 강제하고 조합할 수 있습니다. Qwen3-4B 모델에 적용한 LMSM-Checkpoint는 HarmBench 공격 성공률을 39.20%에서 3.32%로 감소시켰으며, XSTest의 허위 거절률은 2.40%에서 4.40%로 증가했지만, 32개의 활성 시퀀스에서 모니터링 작업을 수행하지 않는 일치하는 서비스 경로의 처리량은 98.14%를 유지했습니다.
LMSM은 해석 가능성과 모델 내부 분석의 발전을 런타임 강제 조치로 연결하는 공통 경로를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang
수집 2026-08-31 02:08
Dactyl은 크로스 플랫폼 앱 개발 시 발생하는 타협점을 제거하고 네이티브 앱을 구축할 수 있도록 돕는 프레임워크입니다. 기존의 Expo, React Native, Flutter 등의 접근 방식이 플랫폼 호환성, 네이티브 위젯, 성능 등을 희생시킨다는 문제점을 해결하기 위해 Dactyl은 SwiftUI를 기반으로 하는 브라우저 내 렌더링 엔진을 개발했습니다.
이 엔진은 iOS 시뮬레이터의 Wasm 포트를 기반으로 하며, SwiftUI의 레이아웃을 효율적으로 처리하고 브라우저에서 직접 렌더링합니다. 렌더링 과정에서 레이아웃은 명령이 작성되기 전에 완전히 해결되며, 리컨실레이터는 애니메이션이나 스크롤과 같이 실시간으로 변경되는 부분만 표시하도록 관리합니다. 이를 통해 설치나 추가 장치 없이 복잡한 SwiftUI 레이아웃을 브라우저에서 부드럽고 효율적으로 구현할 수 있습니다.
Dactyl은 iOS 생태계를 Android와 웹으로 확장하는 데 중점을 두며, Android 환경에서는 Swift를 네이티브로 컴파일하고 JNI를 통해 Jetpack Compose의 Material 컴포넌트로 매핑합니다. 또한, 엔진 개발은 에이전트를 사용하여 실제 iOS 시뮬레이터와 엔진 출력을 비교하고 차이점을 분석하는 방식으로 자동화되어 있습니다.
이러한 자동화된 과정은 새로운 iOS가 출시될 때마다 엔진을 재렌더링하고, 시각적 대규모 언어 모델을 통해 차이를 식별하여 프레임워크 소스 코드를 수정하는 방식으로 작동합니다. 이는 SwiftUI와 같은 지속적으로 변화하는 프레임워크를 구현하는 데 매우 효과적인 프로세스이며, 개발자가 플랫폼 간의 차이를 최소화하면서 앱을 개발할 수 있는 기반을 제공합니다.
Hacker News
튜토리얼
발행 2026-08-26
anorak27
수집 2026-08-28 16:30
접촉 기반 조작은 행동 예측 시간 내에 변화하는 접촉 상태에 적응해야 하는 과제를 안고 있습니다. 그러나 현재의 청크 기반 비전-언어-행동 모델은 실행 전에 수집된 관찰을 기반으로 전체 행동 청크를 예측하기 때문에, 실행 중에는 촉각 조건화 정보가 오래되어 정확성이 떨어지는 문제가 발생합니다. 기존의 촉각 반응 접근 방식들은 별도의 고주파 컨트롤러에 의존하여 아키텍처와 훈련 복잡도를 증가시키는 한계가 있었습니다.
본 논문은 이러한 문제를 해결하기 위해 실행 시간 촉각 피드백을 효과적으로 통합하는 스트리밍 행동 생성 프레임워크인 TacForcing을 제안합니다. TacForcing은 별도의 반응형 컨트롤러 대신 표준 행동 전문가를 스트리밍 행동 전문가로 대체하여 실행 중에 획득되는 변화하는 촉각 관찰에 기반하여 행동을 생성합니다.
또한 TacForcing은 실행에 가까운 행동에만 촉각 조건화를 제한하는 실행 인식 촉각 주의(Execution-Aware Tactile Attention, EATA)를 도입하여 촉각 획득과 행동 실행 간의 시간 불일치를 줄입니다. 이 방법은 6개의 시뮬레이션된 UniVTAC 작업과 3개의 실제 접촉 기반 조작 작업에서 각각 평균 65%와 69%의 성공률을 달성하며 강력한 기준 모델들을 능가하는 성능을 보였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue Li, Xiangyang Gu, Yuhan Cao, Xiao Xia, Yanzhe Hu, Zhijie Deng
수집 2026-08-28 14:29
AI 공동 과학자들이 우리가 훈련한 노동을 수행하는 데 능숙해지고 있지만, 지식 추구는 제로섬 게임이 아닙니다. 과학적 경계가 확장함에 따라 탐험할 수 있는 공간은 에이전트의 집단보다 훨씬 빠르게 폭발적으로 증가합니다. 과거 기술 발전이 노동 이동을 야기했던 것처럼, AI가 과학 분야에 깊숙이 관여하면서 과학자들 사이에는 역할과 미래에 대한 불안감이 커지고 있습니다.
일부 과학자들은 AI가 데이터 처리와 계산을 돕는다는 점에는 동의하지만, 편향, 사기, 피상적인 이해와 같은 문제에 대해 우려합니다. 수학 분야의 전문가들은 기계의 능력보다 가치(values)가 더 중요하며, AI는 증명과 검증을 가속화할 뿐, 어떤 수학적 작업이 가치 있는지를 결정하는 것은 공동체의 역할이라고 주장합니다.
과학 분야의 경계는 노동의 양처럼 고정된 것이 아니라 무한히 확장될 수 있습니다. AI와 같은 도구는 지식 탐색의 반지름을 확장하며, 이는 새로운 영역을 발견할 수 있는 공간을 넓힙니다. 따라서 AI가 확장하는 지식의 부피는 기계가 채울 수 있는 공간보다 더 빠르게 증가할 수 있습니다. 이는 과학적 노동의 양이 고정된 것이 아니라, 과학자들과 그들의 도구가 함께 성장하는 영역 안에서 무한한 기회가 발생한다는 것을 의미합니다.
Hacker News
분석
발행 2026-08-26
joshbloom
수집 2026-08-28 07:25
최신 3D 생성 모델들은 단일 이미지에서 인상적인 메쉬 형상을 복구할 수 있지만, 결과물은 정밀한 기계 부품이 필요한 부분에서 부드럽고, 부품 분해 기능이 없으며, 사용자가 편집할 수 있는 매개변수를 제공하지 않는 한 한계가 있습니다. 이러한 문제를 해결하기 위해 본 연구는 3D 형태를 코드로 간주하는 패러다임을 탐구하며, LLM의 코딩 능력을 활용하여 3D 모델링을 확장합니다.
이를 위해 연구진은 Procedura라는 새로운 3D 모델링 에이전트 프레임워크를 소개하는데, 이는 객체를 절차적 조립(procedural assembly)으로 작성하는 파라메트릭 프로그램으로 정의합니다. 이 프로그램은 이름이 지정된 부품들이 유형화되고 기계적으로 검사 가능한 매트(mates)로 연결되어 구성됩니다. 에이전트는 텍스트 프롬프트로부터 객체를 조립 그래프로 계획하고, 추측 대신 연결된 프레임으로부터 배치를 해결하며, 부품이 컴파일, 매트 및 연결성 검사를 통과했을 때만 인정하는 방식으로 작동합니다.
또한, 이 프레임워크는 각 부품별 재료와 시뮬레이터 검증된 관절(articulation) 정보를 그래프에 포함하며, 분리된 비전 크리틱이 조립을 진단하고 한 번에 수정하는 방식으로 정제합니다. Procedura는 P3D-Bench와 MechBench-36과 같은 하드 서페이스 벤치마크에서 기존의 최첨단 3D 생성 모델과 모든 이전 3D 코드 에이전트보다 평가된 품질에서 우수하며, 평가 대상 중 가장 날카로운 모서리를 생성합니다.
결과적으로 Procedura는 출력물이 편집 가능하고 부품 구조화된 프로그램이라는 점에서 독보적이며, 3D 모델링에 있어 코드를 통한 제어와 편집 가능성을 제공하는 새로운 길을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao, Jiaheng Liu, Yao Yao
수집 2026-08-28 05:24
월드 모델을 확장하는 일반적인 전략인 더 많은 컴퓨팅으로 더 많은 비디오를 학습하는 방식은 비효율적입니다. 월드 모델을 확장하기 위해서는 현실에 기반한 보상 신호를 제공하는 재귀 데이터 엔진이 필요합니다. 코드 에이전트의 성공 사례는 이러한 보상 신호의 중요성을 보여줍니다. 코드는 실행 가능하기 때문에 컴파일러와 런타임이 LLM의 강화 학습(RL) 후처리 학습을 위한 고품질 보상을 제공할 수 있습니다.
반면, 공간 생성은 여전히 CLIP 점수와 같은 모호한 대리 지표에 크게 의존합니다. 이러한 신호들은 모호하고 편향되어 있어 RL 후처리 학습을 지원하기 어렵습니다. 이와 비교하여 게임 개발은 공간 월드 모델을 위한 필수적인 보상 환경을 제공합니다. 게임 엔진으로 인코딩된 장면은 실행 가능한 월드 사양이며, 엔진은 충돌, 물리, 항법성 및 경계 플레이 가능성을 효율적으로 확인할 수 있습니다.
개발자는 장면을 수용할지 여부를 판단하여 전역 검증 신호를 제공합니다. 또한 게임 개발은 RL 후처리 학습을 위한 실제 장기 궤적 데이터도 제공합니다. 따라서 본 연구는 엔진 신호와 개발 과정에서 얻은 암묵적인 인간 수용 피드백을 결합하는 강화 학습과 인간-엔진 검증(RLHEV)이라는 후처리 패러다임을 제안합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You
수집 2026-08-28 05:24
로봇 학습에서 훈련 시 보지 못한 조작 작업을 수행하는 제로샷 교차 작업 일반화는 여전히 핵심적인 과제로 남아 있습니다. 대규모 언어 모델에서 문맥을 통해 새로운 작업을 수행하는 것처럼, 인컨텍스트 학습(ICL)은 파라미터 업데이트 없이 작업 일반화를 작업 명세화의 문제로 전환합니다. 연구진은 이 패러다임을 로봇 조작에 적용하여, 조작에 대한 자연스러운 작업 명세는 언어보다 의도된 작업 변화에 대한 풍부한 시각적 단서를 제공하는 인간 비디오라고 주장합니다.
이를 바탕으로 연구진은 인컨텍스트 인간 비디오 지침을 따름으로써 보지 못한 작업을 실행하는 인과적 비디오-액션 모델인 Zero-WAM을 제시했습니다. 작업 풍부한 인간-로봇 쌍 데이터의 부족 문제를 해결하기 위해, 작업 샘플링된 로봇 궤적을 의미적으로 일치하는 인간 비디오로 변환하여 8.6K 작업에 걸쳐 74.2K개의 인간-로봇 ICL 쌍으로 구성된 HumanGen 데이터셋을 자동 파이프라인을 통해 생성했습니다.
모델 훈련을 위해 추가적으로 인컨텍스트 미래 청크 예측(IFP) 목표를 도입하여 이전에 본 작업에서 학습된 지름길을 억제하고 정책이 비디오 프롬프트에서 작업 정보를 추출하도록 강제합니다. RoboTwin 2.0 시뮬레이션에서 일곱 가지 보지 못한 작업에 대해 Zero-WAM은 평균 47.0%의 성공률을 달성했으며, 이는 가장 강력한 비디오-액션 기준선 대비 29.5% 포인트의 절대적인 개선을 의미합니다.
실제 환경 평가에서 Zero-WAM은 인간 비디오 지침을 따라 다중 객체 장면, 장거리 조작, 세밀한 삽입을 포함하는 보지 못한 작업 구성으로 일반화하는 능력을 보여주었습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu
수집 2026-08-28 03:23
LLM 에이전트가 재사용 가능한 기술 라이브러리를 활용할 때 메모리 접근이 어려운 검색 문제로 발생합니다. 기존 방법들은 전체 라이브러리 프롬프팅은 높은 컨텍스트 비용을 요구하고, 벡터 검색은 기술을 독립적인 텍스트로 취급하며, 그래프 기반 검색은 관련성이 확실한 엣지가 있을 때만 워크플로우 컨텍스트를 복구할 수 있다는 한계가 있었습니다.
이에 본 연구는 검색 전에 절차적 관계를 보정하는 카운터팩추얼 인과 스킬 그래프 프레임워크인 CaSKG를 제안합니다. CaSKG는 의미론적, 구문적, 입력/출력 및 구조적 증거를 기반으로 고정밀 방향 후보 그래프를 구축하고, LLM 심판을 통해 후보 점수를 정제하며, 베이즈 평활화를 통해 증거를 통합하여 상태 필터링된 가중 그래프를 발행합니다.
이 방법은 ALFWorld ID-140 및 ScienceWorld U211 벤치마크에서 여섯 가지 LLM 백본에 걸쳐 테스트되었으며, 기존 그래프 기반 방법인 Graph-of-Skills(GoS) 대비 성능을 크게 개선했습니다. CaSKG는 ScienceWorld 점수를 72.62점에서 80.50점으로, ALFWorld 성공률을 80.01%에서 86.79%로 향상시켰으며, 두 벤치마크 모두에서 평균 환경 단계를 줄였습니다.
추가적인 질적 분석과 절제 분석 결과, 보정된 엣지는 선행 조건, 상태 변경 행동, 검증 루틴, 최종 완료 단계를 보존하는 데 도움을 줍니다. 이는 엣지 신뢰도 보정이 대규모에서 실행 가능하고 압축된 스킬 검색을 위한 효과적인 경로임을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang
수집 2026-08-28 03:23
구글은 가장 정확하고 지능적인 음성 상호작용을 위해 최신 음성 인식 모델인 Gemini 3.5 Transcribe를 공개했습니다. 이 모델은 기존 음성 인식 모델이 어려움을 겪던 배경 소음, 복잡한 전문 용어, 말더듬 등을 처리하며 원시 오디오를 정확하고 다듬어진 텍스트로 직접 변환하는 데 중점을 둡니다.
Gemini 3.5 Transcribe는 구글의 Antigravity에서 제공하는 화면 컨텍스트를 활용하여 정확도를 높이며, 사용자의 자연스러운 말하는 스타일을 포착하여 의도를 더 잘 이해하고 맞춤 어휘를 인식합니다. 또한, "음", "어"와 같은 필러 단어를 제거하고 자기 수정(예: "화요일이 아니라 수요일")을 처리하며 텍스트를 자동 형식화하는 스마트 전사 기능을 제공합니다.
개발자들은 Gemini 3.5 Transcribe를 Gemini API를 통해 Google AI Studio와 Gemini Enterprise Agent Platform에서 활용할 수 있습니다. 실시간 스트리밍을 위한 Live API와 기록된 오디오 처리 및 화자 귀속 정보가 포함된 전사를 위한 Interactions API를 통해 두 가지 API로 제공됩니다.
이 모델은 Agora, LangChain, LiveKit과 같은 개발 플랫폼을 통해 고성능 음성 기반 인터페이스를 구축하는 데 사용되며, vivo, Intellitek Health 등 여러 기업으로부터 낮은 지연 시간과 정확성, 광범위한 언어 지원에 대한 긍정적인 피드백을 받았습니다.
Hacker News
출시
발행 2026-08-26
k9294
수집 2026-08-27 21:19
거대 언어 모델이 여러 언어에서 지식에 접근할 때, 언어에 따라 그들의 기술 수준이 얼마나 차이가 나는지 연구한 결과가 발표되었습니다. 이 연구는 지식 및 일반 벤치마크 성능과 독립적으로 교차 언어 기술 불일치(cross-lingual skill inconsistency)를 정량화합니다.
연구진은 다국어 셀프 플레이 방식을 통해 이 불일치를 측정했는데, 이는 동일한 모델의 두 인스턴스가 서로 다른 언어 인터페이스를 통해 텍스트 기반 게임을 경쟁하도록 설정하여 언어가 모델의 실제 행동에 미치는 영향을 분리합니다. 이 실험에서는 TextArena의 다국어 확장을 구축하고 세 개의 오픈 웨이트 모델을 여덟 개 언어와 여섯 가지 게임(공간 추론, 불완전 정보, 자원 할당, 반복 상호작용)에 걸쳐 평가했습니다.
분석 결과, 동일한 모델이라도 언어에 따라 플레이 강도에서 현저한 차이를 보였으며, 승패 마진, 유효하지 않은 행동, 전략적 경향 등에서 체계적인 변화가 관찰되었습니다. 특히 공간 추론, 카드 조건부 결정, 최적 이동 선택과 같은 영역에서 언어별 실패가 구체적으로 드러났습니다.
흥미로운 점은 중간 추론 언어만 변경해도 손실된 성능의 상당 부분을 회복할 수 있다는 것입니다. 이는 언어가 의사 결정 과정의 다른 단계에 영향을 미칠 수 있음을 시사합니다. 이러한 기술적 불일치는 진정한 다국어 모델 개발의 주요 장애물이며, 이러한 차이를 더 잘 이해하는 것은 언어 전반에서 더 공평하게 작동하는 모델을 설계하는 데 도움이 될 것입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-26
Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen
수집 2026-08-27 15:15