방문했던 웹페이지와 로컬 파일의 본문 전체를 색인하여 검색할 수 있는 개인 검색 엔진인 히스터(Hister)에 대한 내용입니다. 기존의 브라우저 기록이 제목과 URL만을 남기는 것과 달리, 히스터는 사용자가 페이지 내에서 실제로 읽었던 문장과 정보를 다시 검색할 수 있는 기능을 제공합니다.
이 검색 엔진은 단순한 링크 기록을 넘어 사용자가 특정 웹페이지에서 어떤 정보를 습득했는지에 초점을 맞춥니다. 따라서 사용자는 단순히 방문 기록을 확인하는 것을 넘어, 과거에 읽었던 구체적인 내용이나 보관 중인 로컬 파일 속의 세부 정보를 효율적으로 찾아낼 수 있게 됩니다.
이러한 기능은 Firefox나 Chrome 확장 프로그램 형태로 제공되어 사용 편의성을 높입니다. 확장 프로그램은 새로 방문한 페이지를 자동으로 색인하고 관리하는 기능을 수행하며, 이를 통해 사용자는 복잡한 웹 콘텐츠 속에서 필요한 정보를 즉각적으로 재검색할 수 있습니다.
GeekNews
뉴스
피드 등록 2026-09-01
xguru
수집 2026-09-01 01:23
macOS Dock 옆에 항상 표시되는 터미널을 제공하는 Starboard에 대한 소식입니다. 이 도구는 일반적인 단축키를 통해 불러오는 드롭다운 터미널과는 달리, Dock의 위치와 높이를 실시간으로 따라가며 모든 Space 및 전체 화면 앱 위에서도 터미널을 표시합니다.
이러한 설계는 사용자가 다른 앱을 사용하는 도중에 터미널에 접근할 때 포커스를 빼앗지 않고 필요할 때 즉시 명령을 입력할 수 있도록 돕습니다. 이는 개발 작업 중 컨텍스트 스위칭을 최소화하여 작업 흐름을 유지하는 데 매우 유용합니다.
Starboard는 Dock과의 연동을 통해 터미널을 항상 시각적으로 접근 가능하게 함으로써, 개발자가 여러 애플리케이션을 동시에 사용할 때 효율적인 명령 입력 환경을 제공합니다. 따라서 이 기능은 macOS 환경에서 터미널 사용의 접근성과 편의성을 크게 향상시키는 데 중점을 두고 있습니다.
GeekNews
뉴스
피드 등록 2026-09-01
xguru
수집 2026-09-01 01:23
투자자 라키 그룸이 인도 스타트업 알테온에 투자하여 비행기를 1년 이상 공중에 띄우는 것을 목표로 하는 프로젝트를 지원했습니다. 알테온은 20세의 삼아이 상스휘가 설립했으며, 알바트로스가 바람에서 에너지를 추출하는 기술인 다이내믹 소어링(dynamic soaring)에서 영감을 받은 자율 항공기를 개발하고 있습니다. 이들은 해양 바람으로부터 에너지를 수확하여 연료나 배터리 없이 비행을 지속하는 것을 목표로 합니다.
알테온은 초기에는 해상 감시를 위해 이 항공기를 사용할 계획이며, 이는 정부에 해역 활동에 대한 실시간 시야를 제공할 수 있습니다. 이 항공기는 해수면 위에서 바람의 난류를 이용해 에너지를 추출하는 방식으로 작동하며, 궁극적으로 프로펠러를 터빈으로 전환하여 에너지를 전기 에너지로 변환하려는 계획입니다.
하지만 이 기술은 아직 실현되지 않았으며, 항공기가 다이내믹 소어링을 통해 지속적으로 비행할 수 있음을 입증하지는 못했습니다. 연구 결과는 저고도 비행이 유망한 첫 결과라는 평가를 받았으나, 실제 바람에서 충분한 에너지를 안정적으로 추출하여 장기간 비행을 유지하는 것이 가장 큰 도전 과제입니다.
특히 항공기가 난류, 파도, 물보라 등 실제 환경 조건 속에서 지속적으로 에너지를 수확하고 반응해야 하는 점이 기술적 난이도를 높입니다. 전문가들은 실제 비행 테스트를 통해 이러한 도전 과제들이 해결될 수 있을 것으로 보지만, 이는 기술적 위험을 수반하는 야심 찬 목표임을 인정하고 있습니다.
TechCrunch
뉴스
발행 2026-09-01
Jagmeet Singh
수집 2026-09-01 01:23
UCLA RePL이 개발 중인 Prela는 데이터를 이항 관계로 표현하고 합성하여 복잡한 SQL 질의를 더 짧고 읽기 쉽게 작성할 수 있도록 돕는 시스템입니다. 이 기술은 기존의 긴 SQL 코드를 간결하게 만들고 데이터 관계를 명확하게 표현하는 것을 목표로 합니다.
Prela는 넓은 테이블을 6NF 방식으로 분해하는 접근 방식을 사용합니다. 이 방식은 각 열을 행 번호와 값의 쌍으로 변환하여 데이터의 이항 관계를 명확히 정의합니다. 이를 통해 데이터 관계를 여러 출력을 가질 수 있는 비결정적 함수처럼 다루어 복잡한 데이터 연산을 효율적으로 처리할 수 있게 됩니다.
이러한 접근 방식은 데이터베이스 설계와 쿼리 작성의 복잡성을 줄여 개발자들이 더 직관적이고 효율적인 SQL을 작성할 수 있도록 지원합니다. Prela는 데이터의 구조적 관계를 SQL 표현에 직접 반영함으로써 데이터 분석 및 조작의 생산성을 높이는 데 기여할 것으로 기대됩니다.
GeekNews
분석
피드 등록 2026-09-01
neo
수집 2026-09-01 01:23
조정의 역풍이라는 제목의 기사는 조직의 역동성과 점균류의 생장 방식을 비교하며 조직이 어떻게 성장하고 변화하는지에 대한 비유적인 분석을 제시합니다. 이는 조직 내에서 발생하는 조정 과정이 예상치 못한 역풍을 맞을 때 내부 구조가 어떻게 반응하고 적응하는지를 탐구하는 내용입니다.
이 글은 단순히 조직 구조를 설명하는 것을 넘어, 생물학적 시스템인 점균류의 성장 패턴을 통해 복잡한 조직 시스템의 역학을 이해하는 통찰을 제공합니다. 조직이 외부 환경 변화에 어떻게 반응하며 내부적으로 균형을 맞추는지에 대한 새로운 관점을 제시합니다.
이러한 비교는 조직 관리나 시스템 설계에 있어 외부의 압력과 내부의 성장 사이의 관계를 이해하는 데 도움을 줍니다. 조직이 외부의 역풍에 맞서 생존하고 발전하기 위해 필요한 적응 메커니즘에 대한 깊이 있는 논의를 담고 있습니다.
GeekNews
분석
피드 등록 2026-09-01
xguru
수집 2026-09-01 01:23
OpenClaw가 역사상 가장 큰 업데이트인 버전 2.0을 출시하며 설치부터 메모리, 브라우저 제어에 이르는 전반적인 기능을 대대적으로 개편했습니다. 이번 업데이트는 933명의 기여자가 16,000개 이상의 PR을 반영하여 진행되었으며, 설치, 메시징, 메모리, 스킬, 자동화, 앱, 플러그인, 보안 등 플랫폼 전반이 재정비되었습니다.
이번 개편의 핵심은 기존 ChatGPT나 Claude 구독, API 키, 로컬 모델을 재사용하는 설치 과정을 간소화하고 대화 중심으로 기능을 재구성한 점입니다. 개발자들은 복잡한 설정 없이 기존 자원을 활용하여 OpenClaw 환경을 더 쉽게 구축할 수 있게 되었습니다.
사용자들은 이제 더욱 간소화된 설치 과정을 통해 외부 서비스와 로컬 모델을 효율적으로 통합할 수 있으며, 대화 중심의 환경에서 더욱 강력한 기능을 활용할 수 있습니다. 이는 기존 OpenClaw 사용자들에게 새로운 방식으로 플랫폼을 활용하고 확장할 수 있는 기회를 제공합니다.
GeekNews
출시
피드 등록 2026-09-01
xguru
수집 2026-09-01 01:23
AI가 생성했지만 인간이 제대로 읽지 않았을 법한 코드를 위한 풍자적인 라이선스인 VibeCoded AI-Slop License v1.0이 등장했습니다. 이 라이선스는 코드의 사용, 수정, 판매, 재배포, 그리고 AI 학습을 포함하여 모든 행위를 허용하는 극도로 자유로운 조건을 제시합니다.
이 라이선스의 핵심은 저작권이나 저작자 표시와 같은 전통적인 법적 의무를 완전히 배제한다는 점입니다. 사용자는 수정본 공개나 사용 이유 설명 등을 제공할 필요가 없으며, 이는 "아무도 신경 쓰지 않기 때문"이라는 풍자적인 논리를 바탕으로 합니다.
따라서 개발자들은 이 라이선스가 실제 법적 효력을 갖는지 여부와 관계없이, AI가 생성한 코드에 대해 어떠한 제약 없이 자유롭게 접근하고 활용할 수 있는 환경을 제공한다는 점에 주목해야 합니다. 이는 AI 생성 콘텐츠의 소유권과 활용에 대한 기존의 논의에 새로운 관점을 제시합니다.
GeekNews
뉴스
피드 등록 2026-09-01
neo
수집 2026-09-01 01:23
curl은 인증 기관(CNA)으로서 직접 CVE를 발급해 왔으나, 특정 조건에서 발생하는 인증서 호스트명 검사 버그는 CVE 대상이 아니라는 판단이 내려졌습니다. 이는 여러 극단적인 조건에서만 발생하는 버그이므로 CVE로 다루지 않는 것이 적절하며, MITRE 역시 이에 동의했습니다.
이러한 판단은 특정 취약점이 발생하기 위한 복합적인 조건에 초점을 맞춥니다. 즉, 점(.)으로 시작하는 불법 DNS 호스트명, 와일드카드 인증서, 그리고 특정 TLS 백엔드가 동시에 결합될 때에만 해당 호스트명 검사 버그가 발생합니다.
개발자는 이러한 맥락을 이해해야 합니다. 해당 취약점은 일반적인 환경에서는 발생하지 않으며, 특정 구성 요소들이 결합될 때만 위험이 발생한다는 점을 인지해야 합니다.
구체적으로 curl의 `Curl_cert_hostcheck()...` 함수와 관련된 문제는 이러한 복합적인 조건이 충족될 때에만 나타나므로, 시스템 구성 시 이러한 조건들을 고려하여 보안을 확보해야 합니다.
GeekNews
뉴스
피드 등록 2026-09-01
neo
수집 2026-09-01 01:23
애플이 OpenAI를 상대로 제기한 소송에서 전직 직원으로부터 회사 데이터를 훔쳤다는 충격적인 증거를 공개했습니다. 애플은 이 새로운 세부 사항을 통해 전직 직원인 창 류(Chang Liu)가 OpenAI에서 애플의 영업 비밀을 훔쳤다고 주장하며 주장을 강화했습니다.
애플은 류가 OpenAI에서 근무할 당시 기밀 애플 회로 도면과 내부 애플 엔지니어링 애플리케이션 도구에 접근했으며, 애플이 그를 조사하는 동안 증거를 파괴하기 위해 OpenAI 동료인 유팅 펑(Yu-Ting Peng)을 동원했다고 주장합니다. 애플은 류가 "드문, 이전에 알려지지 않았던 인증 버그"를 악용하여 계속 접근을 유지했다고 주장하며, 이는 퇴사 후 시스템 접근 관리가 제대로 이루어지지 않아 발생하는 흔한 문제라고 덧붙였습니다.
이러한 주장에 대해 OpenAI는 류가 동료들의 요청에 따라 퇴사 후에 파일을 접근했다고 방어해 왔습니다. 하지만 애플은 류가 "잔여 접근 권한"을 통해 접근을 지속했으며, 이는 시스템 접근 관리가 미흡했던 애플의 일반적인 문제라고 주장합니다. 애플은 이 소송을 통해 잠재적으로 더 많은 전직 직원들이 연루되었을 가능성을 제기하며 예비 금지 명령과 신속한 증거 발견 절차를 요구하고 있습니다.
TechCrunch
뉴스
발행 2026-09-01
Amanda Silberling
수집 2026-09-01 00:23
한 학회 발표 후 질의응답 세션에서 패널들 중 한 명을 제외한 전원이 질문을 녹음하고 인공지능(AI)을 사용하여 답변을 생성하는 모습이 목격되었습니다. 이는 학술 발표와 전문적인 질의응답 과정에서 AI 기술이 얼마나 광범위하게 활용될 수 있는지 보여주는 사례입니다.
논평을 맡은 교수가 2시간 동안 발표를 들으며 메모하고 깊이 있는 질문을 준비했음에도 불구하고, 패널들은 자신의 전문 분야에 관한 답변까지 AI에 의존하여 얻었습니다. 이러한 현상은 AI가 단순한 정보 제공을 넘어 전문적인 지식과 맥락을 이해하고 생성하는 능력이 향상됨에 따라, 학술적 환경에서 지식 생산 및 전달 방식에 근본적인 변화를 가져올 수 있음을 시사합니다.
이러한 AI 활용은 발표자의 역할과 답변의 진정성에 대한 윤리적 논쟁을 야기합니다. AI가 전문 지식을 대체하거나 보조하는 방식으로 사용될 때, 학술적 결과물의 출처와 책임 소재에 대한 새로운 기준이 필요해집니다. 따라서 AI를 활용한 지식 생성의 효율성과 학문적 진실성 사이의 균형을 어떻게 설정할 것인지에 대한 논의가 중요해지고 있습니다.
GeekNews
분석
피드 등록 2026-09-01
neo
수집 2026-09-01 01:23
자체 진화(self-evolution) 방법이 훈련 자료를 문제 해결 능력으로 얼마나 효율적으로 전환하는지 직접 측정하는 새로운 벤치마크인 StudyBench가 소개되었습니다. 이 벤치마크는 학습 효율성을 측정하기 위해 테스트 세트를 두 가지로 구성하는데, 어려운 교과서 문제를 평가하는 응용 세트(Application Set)와 올림피아드 수준 문제를 평가하는 전이 세트(Transfer Set)로 구성됩니다.
연구 결과, 대표적인 자체 진화 방법들을 세 가지 기본 모델에 걸쳐 평가한 결과, 응용 세트에서의 개선이 더 어려운 전이 세트로 거의 이어지지 않는다는 사실이 밝혀졌습니다. 이는 모델이 학습 자료를 흡수하는 능력과 실제 문제 해결 능력 간에 큰 격차가 있음을 보여줍니다.
또한, 가이드 제거 실험을 통해 인컨텍스트 가이드(in-context guidance)를 제공했을 때 동일한 자료가 해제하는 잠재력에 비해 가장 강력한 방법론도 작은 부분만을 해제하는 가이드 격차(Guidance Gap)가 존재함을 드러냈습니다. 모든 방법은 컴퓨팅 예산을 소진하기 훨씬 전에 컴퓨팅 평탄화(Compute Plateau)에 도달하는 것으로 나타났습니다.
결론적으로, 남아있는 격차는 데이터나 컴퓨팅 문제가 아니라 방법론 자체의 문제임을 시사하며, StudyBench는 자체 진화의 발전을 개방적인 추구에서 측정 가능한 목표로 전환하는 데 기여합니다. 이 벤치마크 코드는 https://github.com/thunlp/StudyBench에서 공개되었습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Yinghao Chen, Zixi Chen, Bingxiang He, Ziqing Qiao, Huan-ang Gao, Yinuo Xu, Yuxin Zuo, Zeyuan Liu, Yuhao Zhan, Chaojun Xiao
수집 2026-09-10 02:04
비전-언어-행동(VLA) 모델은 시각적 관찰과 언어 지시를 로봇 행동으로 직접 매핑하지만, 장기 목표를 달성하기 위해서는 단순히 행동 예측을 넘어 인식, 계획, 실행, 진행 검증, 복구를 조정해야 합니다. 모델이 제시하는 행동이나 스킬 결정이 현재 상태에서 유효한지, 그 결과가 검증되었는지를 보장하지 않기 때문에 에이전트는 물리적 상태가 변화함에 따라 이를 관리해야 합니다.
이에 연구진은 각 스킬 결정을 실행 제안으로 간주하는 통합 프레임워크인 EmbodiedSkills를 제안했습니다. 이 프레임워크는 런타임에 실행 전 선행 조건을 확인하고 실행 후 결과를 검증하는 방식으로 각 스킬 결정을 처리합니다. 고수준 스킬 선택, 제한된 저수준 VLA 실행, 실행 후 검증을 단일 에이전트 루프 내에서 연결하는 공유 실행 가능 스킬 인터페이스를 통해 이를 구현합니다.
이 인터페이스는 고정되어 있어 저수준 VLA 정책을 에이전트 루프를 변경하지 않고 교체하거나 적응시킬 수 있게 합니다. 또한 이 인터페이스는 계획, 실행, 검증, 복구 이벤트를 구조화된 궤적으로 기록하여 개별 구성 요소에 대한 감독을 제공하고 상호 작용 피드백이 있을 경우 온라인 적응을 지원합니다.
Qwen3-VL과 OpenPI/pi0.5를 RoboTwin 2.0 및 LIBERO 환경에 적용한 결과, 작업에 적응된 저수준 VLA 정책은 50개의 RoboTwin 2.0 작업에서 평균 86.20%의 성공률과 네 가지 LIBERO 스위트에서 97.40%의 성공률을 달성했습니다. 이는 EmbodiedSkills에서 사용된 작업 적응형 저수준 VLA 정책의 실행 성능을 입증하며, 메모리 의존적인 RMBench 작업에서는 평균 12.5%의 성공률을 보였습니다. 이 프레임워크는 이러한 정책을 폐쇄 루프 임베디드 시스템으로 전환하기 위한 학습 가능하고 검사 가능한 에이전트 계층을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang
수집 2026-09-08 07:32
LatentPress는 대화 기록과 긴 문서를 연속 메모리 토큰이라는 세 번째 표현으로 작성하여 텍스트 재구성 없이 고정된 디코더가 입력 임베딩 인터페이스를 통해 직접 읽을 수 있게 하는 방법을 제시합니다. 이 기술은 소규모 리더 매칭 라이터만으로 4배에서 16배까지 압축이 가능하며, 디코더의 0.1%에 불과한 어댑터만 훈련하여 효율성을 높입니다.
이 압축된 컨텍스트는 LongMemEval에서 압축률 7.70배 기준으로 비압축 증거의 0.490 정확도보다 높은 0.504의 정확도를 달성하여 텍스트 요약(0.184)이나 OCR 기반 압축(0.312~0.426)보다 우수한 성능을 보였습니다. 또한 LongBench-QA에서는 도메인 내 라이터가 4배에서 8배 압축 시 원본 컨텍스트 읽기와 동등하거나 능가하는 결과를 보였으며, 이는 16배 압축에서는 원본보다 성능이 떨어지는 것으로 나타났습니다.
LatentPress는 쓰기 작업에 43ms가 소요되어 텍스트 요약이나 OCR 복원보다 약 10배 빠르며, 읽기 작업은 원본 컨텍스트나 캐시된 OCR보다 5배에서 9배 더 빠르게 수행됩니다. 연구진은 이 인터페이스를 텍스트와 비전 외에 실용적인 기계 대면 컨텍스트 인터페이스로 확립하며, UltraChat에서 LongMemEval 메모리 QA로의 제로샷 및 LongMemEval 기반 QA에서 보지 못한 LongBench 문서 도메인으로의 전이 설정 모두에서 이 접근 방식을 검증했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Zhengze Zhou, Hejian Sang
수집 2026-09-04 02:18
최신 텍스트-투-SQL 시스템은 여러 후보 쿼리를 생성한 후 최적의 쿼리를 선택하는 generate-execute-select 파이프라인을 따르는데, 목록별 선택(listwise selection) 방식이 널리 채택되었으나 선택기(selector)를 미세 조정하는 것은 비용이 많이 듭니다. 이에 연구진은 미세 조정 없이 목록별 선택을 수행할 수 있는 방법을 제안합니다.
이들은 미세 조정 목표 두 가지를 추론 시점에 적용하는 방식을 사용하는데, 이는 선택 기준을 순서로 학습하고 위치 편향(positional bias)을 완화하는 것입니다. 이를 위해 모델 파라미터로 선택 행동을 학습하는 대신 재사용 가능한 구조화된 메모리(structured memories)를 구축합니다. 질문이 주어지면 MaP-SQL은 훈련 데이터에서 추출된 메모리를 검색하여 자연어와 스키마 요소, SQL 연산, 예상 출력 간의 매핑을 인코딩합니다. 이 메모리는 목록별 평가를 위한 명시적인 결정 기준으로 사용됩니다.
또한 목록별 선택기의 순서 편향을 완화하기 위해 실행 결과와 점수 계산을 통해 여러 입력 순열에 걸친 순위를 집계합니다. 이 접근 방식은 기존 대규모 언어 모델과의 호환성을 유지하면서 선택 정확도를 향상시키고 효율성을 유지합니다. 텍스트-투-SQL 벤치마크 전반에서 미세 조정 없이 더 안정적인 선택을 수행하며 불필요한 비교 횟수를 줄였습니다.
BIRD-dev 벤치마크에서 이 방법은 기존의 최첨단 선택기 기반 방법인 R^3-SQL보다 평균적으로 2.02 실행 정확도 포인트를 더 높은 성능을 보였으며, 동일한 후보 세트를 사용하여 토큰 수를 2.92배 적게 사용했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Yeonseok Jeong, Soyoung Yoon, Seongjun Lee, Seung-won Hwang
수집 2026-09-04 01:18
언어 모델의 다음 토큰 예측은 레이어별로 발전하며, 렌즈 방법은 중간 은닉 상태를 토큰으로 디코딩하여 이 과정을 추적합니다. 그러나 렌즈 읽기는 은닉 상태뿐만 아니라 이를 디코딩하는 데 사용된 출력(unembedding matrix)에도 의존합니다. 연구진은 여러 코퍼스에 맞춰진 렌즈들이 동일한 은닉 상태에 대해 서로 다른 토큰을 보고할 수 있음을 발견했는데, 이를 의존 코퍼스 조건성(dependence corpus conditionality)이라고 명명했습니다.
이러한 코퍼스 의존성을 배제하고 출력 구조를 독립적으로 검토하기 위해 희소 출력 프리즘(Sparse Readout Prism, SRP)을 도입했습니다. SRP는 출력의 가중치만을 사용하여 출력 구조를 분해하고, 토큰 로짓 또는 로짓 차이를 희소 출력 특징들의 합으로 표현합니다. 이는 토큰 정체성이 가릴 수 있는 출력 구조를 드러내고 토큰, 컨텍스트, 레이어, 렌즈 전반에 걸친 비교를 가능하게 합니다.
SRP를 사용하여 원래의 출력을 대체하면, 여섯 가지 기준선(baseline)보다 테스트된 로짓 차이의 8.9~17.3퍼센트를 더 재구성할 수 있습니다. 또한 SRP는 구축 시 코퍼스를 전혀 사용하지 않기 때문에 렌즈 분석에 대해 코퍼스와 독립적인 통제 변수를 제공합니다. 비록 토큰 읽기는 코퍼스에 따라 달라지지만, 지배적인 출력 특징은 안정적으로 유지됩니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Matteo He, William F. Shen, Xinchi Qiu, Nicholas D. Lane
수집 2026-09-03 21:15
거대 언어 모델(LLM)이 텍스트와 코드로만 학습되었음에도 인식 가능한 이미지를 생성할 수 있다는 사실이 있지만, 이것이 2차원 공간 레이아웃에 대한 내부 표현을 반영하는지 아니면 단순히 공간적 설명을 코드로 번역하는 능력에 불과한지는 불분명합니다. 연구진은 이러한 요소를 분리하기 위해 오토회귀 모자이크(Autoregressive Mosaics, AM-Bench)라는 벤치마크를 도입했습니다.
AM-Bench는 두 가지 과제를 통해 이를 구분합니다. 첫 번째는 모델에게 단어 프롬프트로 주어진 그림의 완전한 기하학적 구조를 코드로 변환하도록 요청하는 번역 과제입니다. 이 과제에서 여덟 개의 오픈 웨이트 텍스트-코드 전용 모델 모두 지정된 기하학적 구조를 코드로 신뢰성 있게 변환하지만, 개방형 레이아웃 성능은 크게 달라 코드 생성 능력만으로는 이러한 차이를 설명할 수 없음을 보여줍니다.
두 번째는 불완전한 프롬프트로부터 이미지를 구성하도록 요구하는 레이아웃 과제입니다. 이 연구는 출력 매체의 중요성도 보여주는데, 절차적 코드 대신 원시 SVG(raw SVG)를 사용했을 때 모든 모델에서 레이아웃 점수가 향상되었습니다. 또한, 모델 활성화 분석 결과 생성 전에 대략적인 레이아웃 계획이 존재하지만 이는 프롬프트가 암시하는 레이아웃만을 반영하며, 생성 중에는 초기 고정된 계획을 실행하는 대신 진화하는 기하학적 상태를 추적한다는 사실이 밝혀졌습니다.
결론적으로 텍스트 전용 LLM에서 2차원 공간 성능은 코드 생성 능력뿐만 아니라 모델 자체와 출력 매체에 따라 달라지며, 공간적 이해는 코드 생성 능력만으로 설명되지 않는다는 것을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Ashwin Nedungadi, Stefan Oehmcke, Stefan Lüdtke
수집 2026-09-03 09:07
효율적인 3D 생성에 필수적인 압축된 토큰 시퀀스를 다루는 새로운 방법인 ZipTok3D를 제안합니다. 기존의 3D 토크나이저는 잠재 표현을 공간 영역이나 고정된 크기의 글로벌 토큰 세트로 조직하는데, 이는 토큰 예산을 극단적으로 줄일 경우 재구성 품질이 급격히 저하되는 문제가 있었습니다. ZipTok3D는 극도로 짧은 토큰 시퀀스에서 고충실도 재구성을 목표로 설계된 3D 토크나이저입니다.
이 방법의 핵심 아이디어는 객체 기하학을 점진적으로 정보가 풍부한 글로벌 토큰 접두사(prefix)로 조직하고 반복적인 디코딩을 통해 이 압축된 표현을 펼치는 것입니다. 학습 중 중첩 드롭아웃(nested dropout)을 사용하여 잠재 시퀀스를 인코딩 후 무작위로 잘라내고, 각 접두사가 전체 객체를 재구성하도록 요구함으로써 필수적인 기하학적 정보를 선행 토큰에 우선적으로 배치합니다.
디코더는 별도의 생성 샘플링 단계 없이 각 접두사로부터 미세한 기하학을 복구하기 위해 매번 파라미터 공유 트랜스포머 블록을 반복적으로 적용합니다. 그 결과, ZipTok3D는 동일한 토큰 차원에서 ShapeNet에서는 단 1개의 토큰, TRELLIS에서는 4개의 토큰만을 사용하여 32 토큰 COD-VAE 기준과 유사한 재구성 품질을 달성했습니다. 이는 토큰 시퀀스를 각각 32배 및 8배 더 짧게 만들 수 있음을 의미합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Mingda Lin, Weijie Wang, Zeyu Zhang, Bowen Cui, Yefei He, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang
수집 2026-09-03 08:06
장문 컨텍스트 LLM 추론에서 어텐션 프리필링 단계는 제곱으로 확장되어 셀프 어텐션을 심각한 계산 병목으로 만듭니다. 기존의 희소 어텐션 방법들은 고정된 패턴이나 오프라인 프로파일링을 통해 이를 완화하지만, 입력에 따라 달라지는 어텐션 구조에 적응하는 유연성이 부족합니다. 최근의 동적 방법들은 실시간으로 헤드를 희소 패턴에 라우팅하지만, 이는 오버헤드가 있는 간접 라우팅 프록시와 예산 할당 메커니즘을 사용하며 포스트-소프트맥스 질량 계층을 간과합니다.
본 논문은 이러한 동적 라우팅 패러다임의 두 가지 구조적 문제를 해결하기 위해 CRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)를 제시합니다. 첫째, 라우팅 결정이 프록시 어텐션 맵의 구조로부터 직접 읽을 수 있음을 보여줍니다. 이는 젠센-섀넌 발산(JSD) 라우팅을 대체하여 수직 슬래시 호환 위치에서 질량을 측정하는 구조적 프록시인 C_struct를 사용함으로써 풀링 매트멀(pooled matmul) 및 후속 KL 발산 오버헤드를 제거합니다. 둘째, 포스트-소프트맥스 질량 절벽(post-softmax mass cliff)을 형식화하고 엄격한 누적 커버리지 임계값이 장거리 컨텍스트에서 O(n) 배경 노이즈를 축적한다는 것을 이론적으로 입증합니다.
CRISP는 노이즈 바닥에 기반한 싱크 인식 임계값을 통해 이를 해결합니다. 경험적으로 InfiniteBench, RULER, LongBench에서 두 가지 모델 패밀리에 걸쳐 CRISP는 전체 희소 방법 중 가장 강력하며, 검색 중심 벤치마크에서 정확한 밀집 어텐션과 일치하거나 능가합니다. 특히 검색 작업에서 기준선 대비 최대 28.0 pp의 성능을 회복하며, 512k 토큰에서 최대 5.30배의 어텐션 속도 향상을 달성했습니다. 이는 선택 과정에서 O(n) 노이즈를 제거하면서 구조적 무결성을 보존하는 데 중점을 두었기 때문입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt, Ryan A. Rossi, Linh Ngo Van, Jieyang Chen, Thien Huu Nguyen
수집 2026-09-03 05:04
최신 비전-언어 모델은 유창한 고수준 캡션을 생성하지만, 이미지의 시각적 특성(속성, 수량, 질감, 재료, 공간 관계)과 같은 세밀한 세부 사항을 놓치는 경우가 많습니다. 기존의 다단계 시스템은 이러한 세부 사항을 복구하지만 추론 지연 시간이 상당히 길다는 단점이 있습니다.
이에 연구진은 단일 패스(single-pass) 세밀 이미지 캡셔닝을 위한 참조 없는 임베딩 공간 목표인 SimLoss를 제안했습니다. SimLoss는 텍스트 디코딩 이전에 밀집된 시각적 감독 신호를 제공하여, 비전-언어 모델이 고정된 이미지 임베딩과 숨겨진 상태 표현을 정렬하도록 학습시킵니다. 이 방법은 인간이 작성한 세밀 캡션이나 다단계 파이프라인의 가짜 캡션이 필요하지 않습니다.
SimLoss는 SimLoss FFT와 SimLoss GRPO라는 두 가지 형태로 구현되었습니다. 완전히 미분 가능한 미세 조정 변형인 SimLoss FFT는 다단계 방법의 F1 점수를 거의 따라잡으면서도 단일 패스 추론을 유지하며 다단계 파이프라인보다 약 20배 빠른 속도로 실행됩니다. 반면, 보상 기반 변형인 SimLoss GRPO는 가장 강력한 재현율을 달성했습니다.
이러한 결과는 임베딩 공간 감독이 다단계 검증의 품질을 단일 패서의 지연 시간 내에서 복구할 수 있음을 보여줍니다. 즉, SimLoss를 통해 속도와 정확도 모두를 확보하며 세밀한 이미지 캡셔닝의 품질을 향상시킬 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Suryaansh Jain, Rahasya Barkur, Vishal G, Ryan Rossi, Franck Dernoncourt, Jack Wang, Koustava Goswami, Nedim Lipka, Puneet Mathur, Samyadeep Basu, Seunghyun Yoon
수집 2026-09-03 05:04
에이전트가 연구 프로토타입에서 실제 도구로 발전함에 따라 모델의 능력은 에이전트 하네스(agent harness)라는 모델 외부 실행 인프라에 크게 의존합니다. 모델 가중치를 고정한 상태에서 이 하네스를 변경하면 작업 성능이 크게 달라질 수 있습니다. 기존 에이전트 평가는 선택된 하네스 하에서 다운스트림 성능을 보고하는 데 그쳐 모델이 하네스를 자체적으로 개발하는 능력은 충분히 탐구되지 않았습니다.
이에 연구진은 작업 결과물 대신 실행 가능한 인프라를 평가 단위로 전환하는 벤치마크인 HarnessDev를 소개합니다. 이 벤치마크는 두 단계로 구성됩니다. 생성(Creation) 단계에서는 에이전트가 최소한의 시드와 몇 가지 사례에서 시작하여 완전한 실행 시스템을 구축합니다. 진화(Evolution) 단계에서는 에이전트가 자체 생성한 하네스를 기반으로 다운스트림 실행 피드백을 반복적으로 수정하여 벤치마크 성능을 개선하는 것을 목표로 합니다.
각 구축된 하네스는 능력(홀드아웃 벤치마크에서의 작업 성공 여부)과 효율성(실행 토큰 비용)을 기준으로 평가됩니다. 생성 결과는 코드 및 검색/연구 분야의 성숙한 인간 공학적 참조 자료에 비해 상당히 뒤처지지만, 글쓰기와 머신러닝 실험 분야에서는 선택된 참조 자료와 일치하거나 능가하는 결과를 보였습니다. 그러나 진화 과정에서 얻은 성능 향상은 불안정하며 홀드아웃 작업으로의 전이가 부분적에 불과합니다. 또한, 고정된 런타임 모델 실험 결과는 성능 향상이 하네스를 실행하는 모델에 강하게 의존함을 보여주어 모델 간의 제한적인 전이를 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-09-01
Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan, Wenhao Huang, Ge Zhang, Wenxuan Zhang
수집 2026-09-03 04:01