엔화가 달러당 160엔을 넘어 약세를 보이며 시장에 영향을 미치고 있습니다. 이는 일본 정부의 외환 시장 개입 노력으로 얻었던 이익이 잠식되고 있음을 의미합니다.
최근 엔화 가치는 달러 대비 160엔 선을 넘어섰으며, 이는 시장 참여자들이 주목하는 주요 변동 요인입니다. 이러한 엔화 약세는 과거에 시행된 외환 개입 정책으로 인해 발생했던 환율상의 이점을 감소시키는 결과를 초래했습니다.
따라서 시장 참여자들은 엔화의 향후 움직임과 이에 따른 외환 정책의 변화에 주목해야 합니다. 엔화 약세는 글로벌 금융 시장의 역학 관계에 영향을 미치므로 향후 통화 정책 및 시장 반응을 분석하는 데 중요한 맥락을 제공합니다.
Hacker News
뉴스
피드 등록 2026-08-31
rguiscard
수집 2026-08-31 02:07
유럽 전역에서 발생하고 있는 극심한 여름 가뭄과 폭염이 생태계와 수산업에 심각한 타격을 주고 있습니다. 이로 인해 강과 호수, 양식장이 말라가고 있으며 수온 상승과 산소 부족 현상이 발생하여 생태계 전반에 걸쳐 복합적인 영향을 미치고 있습니다.
특히 헝가리 국토의 약 99%가 심각하거나 극심한 가뭄 상태에 놓여 있습니다. 고온과 강수량 부족은 식생을 감소시키고 사막화를 촉진하여 헝가리 대평원 상당 부분이 사막화 위협에 직면하게 만들고 있습니다.
이러한 기후 변화는 단순한 환경 문제를 넘어 물 자원 관리와 생물 다양성 보존에 대한 중대한 도전 과제를 제시합니다. 개발 및 인프라 관점에서 볼 때, 이러한 환경적 압력은 수자원 접근성, 농업 생산성, 그리고 생태계 기반의 시스템 안정성에 장기적인 영향을 미칠 수 있음을 고려해야 합니다.
GeekNews
뉴스
피드 등록 2026-08-31
neo
수집 2026-08-31 02:07
IKEA 가구를 개조하여 실용적인 사무용 작업대를 만드는 방법이 소개되었습니다. 이 방법은 작업대의 실용성과 거실 가구의 외관을 동시에 얻고자 하는 니즈를 충족시키기 위해 IKEA Kallax 2x2와 남은 책상 상판을 조합하여 사무실용 작업대 두 개를 제작하는 것을 목표로 합니다.
이 프로젝트는 깊이가 40cm 이하인 일반 수납장이나 산업적인 작업대를 만드는 데 적합하며, 개당 약 1,000유로에 달하는 맞춤 가구를 직접 제작하는 사례를 보여줍니다. 특히 디자인과 마감이 맞지 않는 주방 수납장 대신 이러한 방식으로 직접 제작하는 것이 가능합니다.
이는 단순히 가구를 재활용하는 것을 넘어, 기존의 대량 생산된 가구에서 벗어나 개인의 공간과 기능에 완벽하게 맞춘 맞춤형 가구를 제작할 수 있다는 점을 강조합니다. 사용자는 IKEA 제품을 기반으로 원하는 기능과 미적 요소를 결합하여 비용 효율적이면서도 독특한 사무 공간을 구현할 수 있습니다.
GeekNews
튜토리얼
피드 등록 2026-08-31
neo
수집 2026-08-31 02:07
AI 에이전트가 내장된 개인 서버를 하나의 Go 바이너리로 직접 운영하는 시스템이 소개되었습니다. 이 서버는 메일, 채팅, 파일, 노트, 캘린더, 연락처, 셸 기능은 물론 AI 에이전트까지 통합하여 관리할 수 있게 합니다.
해당 시스템은 뉴스, 웹 검색, 날씨, 시장, 영상, 장소, 파일, 문서 등 30여 개의 서비스와 100여 개의 도구를 제공합니다. 이러한 모든 기능은 웹, REST API, CLI, MCP를 통해 동일하게 접근 가능하도록 제공됩니다.
이는 복잡한 개인 서버 환경에서 다양한 AI 에이전트와 외부 도구를 효율적으로 통합하고 관리할 수 있는 방법을 제시합니다. 개발자들은 Go 바이너리를 활용하여 개인 서버의 기능을 확장하고 AI 에이전트 기반의 자동화된 작업을 구현하는 데 이 구조를 참고할 수 있습니다.
GeekNews
튜토리얼
피드 등록 2026-08-31
xguru
수집 2026-08-31 02:07
Gemini 3.6 Flash 모델이 가짜 화장품을 식별하는 테스트에서 오류를 보였습니다. 이 테스트는 Rhode Peptide Lip Tint 세 가지 제품의 포장 사진을 각각 6장씩 제공하여 진행되었습니다. 모델은 가품 2개를 정확하게 식별했지만, 정품 1개까지 가품으로 잘못 판정하는 실수를 저질렀습니다.
이러한 결과는 AI가 시각 정보를 분석할 때 사람이 놓치기 쉬운 미묘한 포장 불일치에 취약함을 보여줍니다. 구체적으로 상자와 튜브의 유통업체 불일치, 잘못된 아일랜드 우편번호, 성분명 오탈자 등 사소한 포장 불일치 정보가 가품 여부를 판단하는 데 결정적인 단서로 작용했습니다.
이는 AI 기반의 품질 검사 시스템이 실제 환경에서 복잡하고 미묘한 데이터 불일치를 정확하게 포착하는 데 어려움을 겪을 수 있음을 시사합니다. 따라서 AI가 실제 제품의 진위 여부를 판단하기 위해서는 단순한 시각적 패턴 분석을 넘어, 이러한 세부적인 포장 정보의 일관성을 통합적으로 고려하는 학습이 필요합니다.
GeekNews
분석
피드 등록 2026-08-31
xguru
수집 2026-08-31 02:07
Linux 환경에서 macOS의 Continuity 기능이 제공하던 다양한 연동 기능을 구현하는 기술이 개발되었습니다. 이 기술은 iMessage 및 SMS 송수신, 알림, 연락처, 파일, 클립보드, OTP 연동 등 macOS Continuity가 제공하던 핵심 기능을 Linux에서도 사용할 수 있도록 구현합니다.
이러한 연동은 iOS와 Linux가 처음부터 상호 TLS(mTLS) 방식으로 연결되어 있으며, 통신을 위해서는 양쪽 기기의 모두가 승인해야만 연결이 성립된다는 점이 특징입니다. 이는 두 운영체제 간의 보안 및 인증 메커니즘을 통해 안전하게 데이터를 주고받는 기반을 마련합니다.
개발자들은 이 기술을 통해 Mac 프록시 없이도 Bluetooth 등을 활용하여 이러한 크로스 플랫폼 연동을 구현할 수 있게 되었습니다. 이는 운영체제 간의 경계를 넘어선 통합된 사용자 경험을 제공하는 데 중요한 기술적 진전을 의미합니다.
GeekNews
튜토리얼
피드 등록 2026-08-31
xguru
수집 2026-08-31 02:07
AI 도구만 도입한다고 해서 엔지니어의 생산성이 2배나 10배로 향상되지는 않습니다. 진정한 생산성 향상은 사람들이 협력하고 의사결정하는 조직 환경이 먼저 갖춰질 때 발생합니다.
AI 도구는 생산성을 높이는 수단일 뿐이며, 이 도구의 효과를 극대화하기 위해서는 팀 내에서 활발한 협업과 신뢰를 기반으로 한 의사결정 구조가 필수적입니다. 조직 문화가 이러한 협력과 안전감을 제공할 때, AI는 단순한 도구를 넘어 팀 전체의 역량을 증폭시키는 핵심 동력이 됩니다.
반면, 경영진이 경쟁사의 AI 성과에 조급해져 사용을 강요하거나 인력 대체를 언급하는 등의 행동은 심리적 안전감과 조직 내 신뢰를 무너뜨립니다. 이러한 압박은 도구 도입으로 얻는 이익보다 더 큰 조직적 비용을 발생시킬 수 있습니다.
따라서 AI 도입 시 기술적 측면뿐만 아니라, 팀원들이 심리적으로 안전하게 의견을 교환하고 협력할 수 있는 조직 환경을 조성하는 것이 생산성 향상의 선행 조건이 됩니다.
GeekNews
분석
피드 등록 2026-08-31
neo
수집 2026-08-31 02:07
CPython이 64비트 RISC-V Linux를 PEP 11의 Tier 3 공식 지원 플랫폼으로 추가했습니다. 이는 특정 아키텍처와 구현체를 공식적인 지원 체계로 편입하여 개발 환경의 신뢰성과 확장성을 높이는 데 기여합니다.
Tier 3 플랫폼은 신뢰할 수 있는 빌드봇과 담당 코어 개발자를 갖춘 단계이지만, 이 단계에서는 장애 대응 시간은 보장되지 않습니다. 또한 빌드 실패가 Python 릴리스를 막는 것은 아니므로, 개발 과정에서 발생하는 빌드 실패가 최종 릴리스에 직접적인 영향을 미치지는 않는다는 점을 이해해야 합니다.
이러한 지원 추가는 RISC-V 기반 환경에서 CPython 사용을 더욱 용이하게 하며, 커뮤니티가 실제 RISC-V 환경에서 개발을 진행할 수 있는 기반을 강화합니다. 이는 특정 하드웨어 아키텍처를 지원하는 소프트웨어 생태계의 성숙도를 높이는 중요한 진전입니다.
GeekNews
뉴스
피드 등록 2026-08-31
xguru
수집 2026-08-31 02:07
Rust 프로젝트가 FFI 바인딩에서 외부 오버로드 함수를 자연스럽게 호출할 수 있도록 nightly Rust의 splat 기능을 공개하고 관련 실험을 요청했습니다. 이는 컴파일러 및 상호운용 도구 개발자들이 Rust의 기능 활용에 대한 실험을 진행할 수 있도록 하기 위함입니다.
이번 기능은 Rust 환경에서 외부 함수 호출 시 오버로딩을 더 자연스럽게 처리할 수 있게 하여 FFI(Foreign Function Interface) 바인딩의 복잡성을 줄이는 데 중점을 둡니다. 특히 외부 오버로드 함수를 Rust 코드 내에서 보다 직관적으로 다룰 수 있는 환경을 제공함으로써 상호운용성 도구의 개발에 긍정적인 영향을 미칠 것으로 기대됩니다.
2026년 7월 31일 이후 nightly Rust 버전에서는 #[rustc_splat] 어트리뷰트를 사용하여 hypot((2.0, 3...))와 같은 호출이 가능해집니다. 이 기능을 통해 개발자들은 복잡한 함수 오버로딩 상황을 FFI 환경에서 더 효율적으로 처리할 수 있게 됩니다.
이 실험은 Rust 컴파일러와 상호운용 도구 개발자들에게 새로운 기능을 테스트하고 Rust 생태계의 확장 가능성을 탐구할 기회를 제공합니다. 이는 FFI를 사용하는 프로젝트의 효율성과 안정성을 높이는 데 기여할 것입니다.
GeekNews
뉴스
피드 등록 2026-08-31
neo
수집 2026-08-31 02:07
도구는 사용자의 능력을 확장하는 것을 넘어 사용자의 행동과 사고방식까지 변화시키기 때문에 중립적인 수단이 아니라는 내용입니다. 이는 도구가 단순히 결과와 분리된 중립적인 도구가 아니라, 사용자가 어떤 행동을 쉽게 선택하고 무엇을 자연스럽다고 느끼는지에 영향을 미친다는 의미를 담고 있습니다.
손에 익어 의식하지 않고 사용하는 도구일수록 사용자 자신과 하나처럼 결합하게 되며, 도구가 허용하고 제한하는 범위 안에서 사용자의 판단이 이루어집니다. 즉, 사용자는 도구의 제약과 허용 범위 내에서 사고하고 행동하게 되는 것입니다.
이러한 맥락에서 개발자와 사용자들은 도구가 제공하는 기능뿐만 아니라, 그 도구가 사용자의 인지적 과정과 행동에 미치는 영향을 고려해야 합니다. 도구의 설계가 사용자의 판단과 행동에 어떤 영향을 미치는지에 대한 깊은 이해가 필요합니다.
GeekNews
분석
피드 등록 2026-08-31
neo
수집 2026-08-31 02:07
광고 영상 생성은 단순히 비디오 합성 작업을 넘어 온라인 비즈니스 지표로 성공 여부가 측정되는 제품 조건부 추론 문제라는 점이 중요합니다. 최근 비디오 기반 파운데이션 모델들은 멀티모달 조건으로부터 사실적인 클립을 생성할 수 있지만, 제품이 효과적인 광고로 변환되는 방식이나 온라인 비즈니스 피드백을 통해 향후 생성이 어떻게 개선되어야 하는지에 대해서는 최적화하지 못합니다.
이러한 문제를 해결하기 위해 연구진은 보상 기반 에이전트 프레임워크인 AgenticGen을 제안했습니다. AgenticGen은 광고 영상 생성을 전략 선택과 초안 생성이라는 두 가지 학습 가능한 추론 단계로 분해하여 온라인 비즈니스 피드백이 감독할 수 있는 최적화 목표를 노출합니다. AgenticGen은 축적된 온라인 피드백으로부터 성능 기반 보상과 인간 품질 기준에 맞춘 보조적인 기준 기반 보상을 학습하여 정책 최적화를 감독합니다.
DPO(Direct Preference Optimization)를 통해 에이전트 정책을 온라인 선호도에 맞추고, GRPO(Generalized Reward Policy Optimization)를 사용하여 프로세스 및 결과 보상을 통해 두 단계를 추가로 정제합니다. 이러한 오프라인 실험을 통해 보상 모델과 연속적인 정책 최적화가 유효함을 입증했습니다.
실제로 틱톡 광고 시스템에서 온라인 A/B 실험을 진행한 결과, DPO와 GRPO를 거친 AgenticGen은 SFT 기준선 대비 CTR을 2.72%, CVR을 2.63%, Advv를 9.61% 향상시켰습니다. 이는 광고 영상 생성의 품질과 비즈니스 성과를 온라인 피드백을 통해 직접 최적화할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Xingyuan Bu, Chengru Song, Hao Zhou, Tao Zhou, Dong Li, Wei Li, Shilong Li, Hao Shi, Yongxin Guo, Donghao Zhou, Qiangpeng Yang, Shilei Wen
수집 2026-09-10 03:05
발화와 시간적으로 일관되며 주변 객체에 기반을 둔 몸짓을 생성하는 것은 여전히 어려운 과제입니다. 기존의 음성 기반 몸짓 모델들은 오디오와 몸짓의 정렬에 중점을 두었을 뿐 자세 제약이나 주변 객체를 명시적으로 고려하지 않아 신체 몸짓과 물리적 공간 사이의 내재적 상관관계를 포착하지 못했습니다.
이에 연구진은 자세를 인지하고 객체에 기반한 코-스피치 몸짓 확산 모델인 Puppeteer를 제안합니다. Puppeteer는 인과적 잠재 공간에서 작동하며, 긴 몸짓을 구조화된 기본 요소로 분해하고 이를 시간 순서대로 인코딩하는 인과적 변이형 오토인코더를 학습합니다. 이를 통해 음성 신호, 움직임 기록, 초기 자세 참조, 객체 기하학을 조건으로 사용하여 물리적으로 일관된 몸짓을 합성할 수 있습니다.
이러한 시간 순서형 잠재 표현 방식은 몸짓 사이의 간극 채우기나 몸짓 완성과 같은 작업을 가능하게 합니다. 또한 연구진은 객체 기반 몸짓 생성을 가능하게 하는 최초의 큐레이션된 합성 3D 데이터셋인 SceneGes를 구축했습니다. 실험 결과, Puppeteer는 기존 방법보다 더 다양하고 시간적으로 동기화된 몸짓을 생성하며 객체에 기반한 몸짓 합성을 가능하게 했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Vida Adeli, Soroush Mehraban, Jacob Rommann, Harrison Sanborn, Cole Clifford, Babak Taati
수집 2026-09-10 03:05
명령줄 코딩 에이전트가 파일 읽기 및 쓰기, 장시간 세션 유지는 가능함에도 불구하고, 연구 과정 전체가 채팅 도구, IDE, 터미널, 작성 환경에 분산되어 있어 의사결정 과정을 추적하고 보존하기 어렵다는 문제가 제기됩니다. 이 연구는 이러한 문제를 해결하기 위해 기존 코딩 에이전트 실행기(executor)를 제어 가능하고 감사 가능한 인간 개입(human-in-the-loop) 워크플로우로 감싸는 오픈 소스 작업 공간인 Dr. Claw를 제시합니다.
Dr. Claw는 추가적인 자율 에이전트를 도입하는 대신, 지속적인 상태 객체, 재사용 가능한 기술 라이브러리, 다중 실행기 조정 기능을 통해 인간의 의사결정과 AI 실행을 연결합니다. 이를 통해 계획, 실행, 작성을 하나의 추적 가능하고 복구 가능한 루프로 전환하여 연구 과정을 투명하게 만듭니다.
연구진은 Dr. Claw를 인터랙티브 시나리오와 실패 복구 과정을 통해 시연하고, 동일한 백엔드 실행기를 공유하는 순수한 명령줄 에이전트와 비교했습니다. 이 비교 결과, Dr. Claw는 실행기를 고정했을 때 연구 완성도가 더 높았으며, 감사 가능하고 복구 가능한 프로세스 흔적을 보존한다는 점이 입증되었습니다.
Dr. Claw는 전체 오케스트레이션 계층(작업 그래프, 상태 객체, 기술 라이브러리)을 에이전트가 감싸는 방식과 비교하여, 연구의 완전성과 과정의 추적 가능성을 동시에 확보하는 실질적인 방법론을 제공합니다. 데모 접근은 GitHub 저장소에서 가능합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Dingjie Song, Hanrong Zhang, Dawei Liu, Yixin Liu, Zongxia Li, Zhengqing Yuan, Siqi Zhang, Henry Peng Zou, Zhiling Yan, Yuxuan Zhang, Yanfang Ye, Philip S. Yu, Lichao Sun
수집 2026-09-07 17:21
강화 학습을 통한 검증 가능한 보상(RLVR)에서 그룹 상대 정책 최적화(GRPO)는 일반적으로 모든 롤아웃에 걸쳐 고정된 중요도 샘플링(IS) 비율 클리핑 경계를 사용합니다. 하지만 이는 어려운 문제에 대한 드문 정답 롤아웃과 쉬운 문제에 대한 풍부한 정답 롤아웃이 서로 다른 학습 신호를 제공함에도 불구하고 동일한 비율로 클리핑되어 학습 신호에 불균형을 초래하는 한계를 보입니다. 특히 그룹 성공률이 낮은 롤아웃은 탐색과 새로운 문제 해결에 더 강력한 기울기 신호를 가지지만 고정된 클리핑에 의해 불균형적으로 억제됩니다.
이러한 문제를 해결하기 위해 우리는 롤아웃의 이점(advantage)에 따라 클리핑 경계를 조정하는 GRPO 방법론에 플러그인 수정인 그룹 적응형 클리핑 정책 최적화(GAPO)를 제안합니다. GAPO는 역-KL 신뢰 영역 관점에서 롤아웃의 학습 신호가 클리핑 경계에 비례하여 더 큰 업데이트 여유를 받아야 함을 시사하는 이론적 배경을 가집니다. GAPO는 보상 형성 없이 표준 PPO/GSPO 대리 모델을 보존하면서 오직 클리핑 임계값만 조정합니다.
Qwen 및 Llama 모델에 적용한 결과, GAPO는 수학 추론 및 코딩 벤치마크에서 기본 모델의 통과율이 비교적 낮은 영역에서 고정 클리핑 및 이점 조정 기준선보다 Pass@1과 Pass@k를 일관되게 개선했습니다. 이는 GAPO가 학습 신호의 차이를 반영하여 롤아웃의 잠재력을 더 잘 활용함으로써 모델 성능을 향상시킬 수 있음을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan, Rein Houthooft
수집 2026-09-07 02:11
에이전트의 행동을 이해하기 위해서는 수천 개의 궤적에 확장 가능하며 사전 구축된 분류기가 부족한 장기적이고 낯선 작업에서 새로운 패턴을 발견할 수 있는 방법이 필요합니다. 연구진은 사회과학에서 유래한 60년 된 질적 방법론인 근거 이론(Grounded Theory)을 에이전트 궤적 분석에 도입할 것을 제안합니다. 이는 데이터에서 이론으로 이어지는 검증 가능한 경로와 충분성 기준을 제공합니다.
이를 위해 연구진은 에이전트 궤적에 근거 이론을 자동화하는 최초의 멀티 에이전트 파이프라인인 AutoTraceGT(Automated Trace analysis through Grounded Theory)를 제안했습니다. AutoTraceGT는 개방 코딩, 축 코딩, 이론 코딩을 반복적으로 수행하여 포화 상태에 도달할 때까지 진행하며 각 작업에 맞춰진 행동 분류 체계를 생성합니다.
여섯 개의 궤적 코퍼스를 분석한 결과, AutoTraceGT는 인간이 주석을 단 분류 체계에서 발견된 실패 모드의 73~91%를 복원하고 기존 분류 체계가 놓치는 추가적인 패턴을 발견하는 코드북을 생성했습니다. 이처럼 도출된 이론적 서사는 기존 전문가들의 설명과 일치합니다.
나아가 이 코드북을 연역적 특징 공간으로 사용하여 다운스트림 실패 예측에서 제로샷 및 퓨샷 LLM 기준 모델보다 우수한 성능을 보였습니다. 이러한 결과는 근거 이론이 에이전트가 실제로 무엇을 하는지 연구하는 머신러닝 연구자와 에이전트 개발자를 위한 확장 가능한 분석 도구를 제공함을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang, Chengxi Zang, Jie Gao, Ziang Xiao
수집 2026-09-04 09:24
에이전트 성능은 모델 파라미터와 컨텍스트 및 제어 흐름을 관리하는 실행 가능한 하네스 코드에 의해 공동으로 결정됩니다. 개별적으로 이 두 구성 요소만 최적화할 경우 시스템이 고정된 다른 구성 요소에 의해 병목 현상을 일으킬 수 있습니다. 가중치 업데이트는 효과적인 하네스를 변경할 수 있으며, 하네스 업데이트는 노출되는 모델 기능을 변경할 수 있기 때문입니다.
이에 본 연구는 가중치-하네스 교대 학습(Weight-Harness Alternating Learning, WHALE)이라는 간단한 레시피를 제안합니다. WHALE는 두 단계를 교대로 수행하는데, 현재 하네스 하에서 모델을 업데이트한 다음, 업데이트된 모델 하에서 더 나은 하네스를 탐색합니다. 이 두 단계는 각각 온라인 거부 샘플링 미세 조정과 Meta-Harness를 사용하여 구현됩니다.
Qwen3.5-2B/4B 에이전트를 세 가지 도메인(검색 질문 응답, 수학적 추론, 체스 퍼즐)에서 테스트한 결과, WHALE는 가중치만 사용하거나 하네스만 사용하는 방법, 그리고 Fast-Slow Training보다 최대 4.15~24.38 퍼센트 포인트 더 높은 평균@8 정확도를 달성했습니다. 하네스 검색은 SearchQA에서 가장 적은 롤아웃으로 최대 가중치만 사용하는 정확도에 근접하지만, 수학적 정확도는 가중치 업데이트 후에만 향상됩니다.
또한, 작은 간격으로 번갈아 업데이트하는 방식은 순차적인 가중치-하네스 최적화보다 정확도와 롤아웃 비용 모두에서 더 우수한 성능을 보였습니다. 이 연구의 코드는 https://github.com/krafton-ai/WHALE에서 확인할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Haechan Kim, Yoonho Lee, Gisang Lee, Chelsea Finn, Kangwook Lee
수집 2026-09-03 21:15
FoldingAgent는 오리가미 시연 비디오에서 명시적인 매개변수 기반 접기 프로그램을 추론하는 에이전트 프레임워크입니다. 이 프레임워크는 사전 학습된 비전-언어 모델(VLM)의 추론 능력을 활용하며, 기하학적 전환 시뮬레이션, 물리적 타당성 검증, 시각 콘텐츠 검색 및 비교, 예측 평가를 가능하게 하는 전문 도구 세트를 장착하고 있습니다.
이 에이전트는 시각 콘텐츠를 접기 프로그램으로 변환하기 위해 종이의 기하학과 매개변수 접기 동작으로 구성된 매개변수 공간을 정의합니다. 기존 모델들이 정적인 주름 패턴을 예측하는 것과 달리, FoldingAgent는 순차적으로 작동하며 행동을 재계획할 수 있어 다단계 접기에서 발생하는 누적 오류를 효과적으로 완화합니다.
이 접근 방식은 주로 비구조화된 시각적 시연을 통해 공유되는 인간의 오리가미 지식과 주름 패턴이나 실행 가능한 매개변수 계획과 같은 구조화된 계산 방법 사이의 격차를 좁히는 데 기여합니다. 연구진은 다양한 Pureland 오리가미 비디오와 정답 기하학 및 동작 레이블을 포함하는 새로운 벤치마크인 PurelandFold에서 이 방법을 평가했습니다.
그 결과, VLM 추론과 전문 도구 및 물리 시뮬레이션을 결합함으로써 비구조화된 시각적 시연을 실행 가능하고 물리적으로 타당한 접기 절차로 성공적으로 변환할 수 있음을 입증했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Maya Moriya, Sigal Raab, Yael Vinker, Tali Dekel
수집 2026-09-03 11:08
새로운 멀티모달 및 다국어 양방향 인코더인 NeoMME가 발표되었습니다. 이 모델은 다국어 텍스트와 원본 이미지 패치를 단일 양방향 트랜스포머 인코더에서 처리하여 효율적인 미세 조정과 추론을 가능하게 합니다. NeoMME는 260M 및 800M 파라미터 크기로 제공되며, 마스크된 이산 확산 텍스트 목표를 통해 이미지 패치를 조건으로 처음부터 사전 학습되었습니다.
NeoMME는 최대 16,384 토큰의 컨텍스트를 지원하여 표준 4K UHD 이미지 두 개를 인코딩할 수 있는 충분한 길이를 제공합니다. 이를 활용하여 문서 검색을 위해 미세 조정된 NeoMME-Retriever 모델은 ViDoRe v3 벤치마크에서 뛰어난 성능을 보였습니다. 특히 260M 모델은 0.523의 nDCG@10 점수를 달성하며 800M 파라미터 이하 모델들을 능가했으며, 800M 모델은 0.556의 nDCG@10을 기록했습니다.
효율성 측면에서 NeoMME-260M은 NVIDIA L40S에서 2048x2048 이미지 입력 크기에 대해 ColModernVBERT보다 약 2배 높은 처리량을 보였습니다. 또한 계층적 토큰 풀링과 비대칭 양자화를 통해 후속 상호작용 멀티모달 문서 임베딩을 255배 압축하면서도 기준 nDCG@10의 95% 이상을 보존했습니다.
개발자들은 NeoMME를 Hugging Face Transformers에 기여했으며 사전 학습된 백본과 검색 호환 체크포인트를 Apache 2.0 라이선스로 공개했습니다. 이 모델은 효율적인 멀티모달 인코딩 및 문서 검색 작업에 대한 새로운 접근 방식을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Aurélien Lac, Tony Wu
수집 2026-09-03 11:08
전문 에이전트 작업은 공개된 코퍼스에는 없는 관습에 의존하지만, 벤치마크는 에이전트가 이러한 관습에 접근할 수 있는지 여부를 통제하지 못합니다. 이에 본 연구는 작업 지시와 사적인 관습, 참조 테이블, 유틸리티 연산자를 포함하는 압축된 결과물인 아티팩트(artefact)를 분리하는 지식 게이팅 작업 구성 프로토콜을 소개합니다.
이 프로토콜은 구축 시점의 출처(provenance), 제공된 아티팩트와 제외된 아티팩트 조건에서 바이트가 동일한 작업 지시, 누수 감사(leak audits), 실행 가능한 증인(executable witnesses) 등을 통해 아티팩트에 대한 의존성을 명확하고 테스트 가능하게 만듭니다. 15개의 보정 작업에서 한 프론티어 에이전트 구성은 아티팩트와 함께 68.0%의 통과율을 달성했으며, 아티팩트 없이 시도했을 때는 0%였습니다. 또한, 그럴듯하지만 부정확한 아티팩트 역시 다섯 번의 시도에서 0%의 결과를 보였습니다.
구조화된 작업을 위한 결정론적 솔버와 규칙 코퍼스는 정확한 기준을 제공하며, 명명된 기준 수준의 루브릭은 단일 실행 가능한 오라클로 확인할 수 없는 결과물도 지원합니다. 이 실험을 통해 구성 상대적인 보정 화면은 다섯 번의 경험적 지식 게이팅 화면을 만족하는 일곱 가지 작업을 유지했습니다. 다만, 이러한 실험은 프로토콜의 동작을 검증할 뿐, 보존된 작업들이 훈련 후 성능을 개선한다는 것을 입증하지는 않습니다.
연구팀은 작업 세트와 지원 도구의 일부를 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction에서 공개했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Hanlin Tian, Minhao Li, Yu Mi, Sihan Zhu, Zhao Yang, Yuxiang Wang, Hongquan Zhu, Qiufei Hu
수집 2026-09-03 10:07
거대 언어 모델(LLM)이 외부 환경과 상호작용하며 행동 경험을 축적하고 있지만, 기존의 에이전트 벤치마크는 이를 고정된 정책으로 평가하는 경향이 있습니다. 따라서 에이전트가 자신의 행동을 능동적으로 테스트하고, 그 결과를 판단하며, 이 경험을 미래 결정에 활용하여 스스로 개선할 수 있는지에 대한 의문이 남아 있습니다.
이러한 문제를 해결하기 위해 연구진은 LLM의 자기 개선을 평가하는 상호작용 벤치마크인 S3Gym을 소개합니다. S3Gym은 자기 테스트(Self-Testing), 자기 판단(Self-Judging), 자기 개선(Self-Improvement)이라는 세 가지 능력을 통해 LLM의 자기 개선을 평가합니다. 이 프로토콜은 실행 가능한 환경 검증기가 포함된 일곱 가지 텍스트 기반 게임을 통해 구현되었으며, 탐색과 엄격한 평가를 분리하여 진행합니다.
연구는 상호작용 경험을 통합하는 세 가지 경로, 즉 직접적인 History ICL, 점수 조건부 요약 메모리, 그리고 파라미터 훈련을 평가했습니다. 실험 결과, 자기 개선은 자동적이거나 균일하지 않으며, 경험의 수준에 따라 성능이 향상됩니다. 특히 요약은 경험을 재사용 가능한 전략 규칙으로 압축할 수 있을 때 성능을 개선하지만, 정확한 상태 의존적 정보가 필요할 때는 원시 기록보다 성능이 떨어집니다.
또한 파라미터 훈련은 일부 작업에서 상당한 이득을 제공하지만, 다른 작업에서는 불안정한 개선과 심각한 부정적 전이를 보였습니다. 이는 에이전트가 성공적인 행동을 인식하는 것만으로는 부족하며, 피드백을 실행 가능하고 전이 가능한 정책으로 변환해야 함을 시사합니다. S3Gym은 이러한 과정을 진단하고 상호작용 경험을 신뢰할 수 있는 자기 개선으로 전환하는 데 방해 요소가 되는 병목 현상을 식별하는 통합 프레임워크를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-31
Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang
수집 2026-09-03 04:01