코드명 Vanessa인 Squeak 6.1이 30주년 기념 릴리스로 출시되었습니다. 이 버전은 지난 4년간 통합된 1,700개 이상의 패치와 9,000개 이상의 메서드 변경 사항을 포함하고 있어 개발자들에게 중요한 업데이트를 제공합니다.
이번 업데이트의 핵심은 새로운 Tree Browser를 중심으로 드래그 앤 드롭 기능과 Inspector, Debugger, Profiler, 버전 관리 도구들이 대폭 확장되었다는 점입니다. 개발자는 이 새로운 도구들을 활용하여 코드 탐색과 디버깅 작업을 더욱 효율적으로 수행할 수 있게 되었습니다.
특히 Tree Browser의 확장 기능은 프로젝트 구조를 시각적으로 관리하고 복잡한 변경 사항을 추적하는 데 큰 도움을 줄 것입니다. 이는 Squeak 사용자들이 대규모 프로젝트를 다룰 때 필요한 고급 개발 도구의 접근성과 기능을 크게 향상시킵니다.
GeekNews
출시
피드 등록 2026-08-11
neo
수집 2026-08-12 05:01
Antirez의 MiniMax H3 추론 엔진은 Mac 컴퓨터를 위한 H3 기반 추론 엔진으로 개발되었습니다. 이 프로젝트는 결정론적 호스트/모델 메타데이터부터 포터블 Metal 블록 패리티, 프롬프트 인코딩, 프롬프트-비디오/오디오 생성, 그리고 프레임 조건화 및 순서 참조에 이르는 일련의 수직적 단계로 구축되었습니다. 현재 작업은 M3 Max 및 M5 Max 칩에서 H3에 특화된 Metal 성능과 메모리 최적화를 점진적으로 수행하는 데 중점을 두고 있습니다.
최근의 최적화 작업은 메모리 관리와 커널 효율성에 초점을 맞추고 있습니다. 예를 들어, H3 어텐션 출력 투영은 7,168x5,376 형태를 TensorOps 커널로 컴파일하여 바이트 동일성을 유지하면서도 성능을 개선했습니다. 또한, 모델 단계들을 분리하여 로드하고 해제함으로써 33B 트랜스포머, Qwen 인코더, 디코더가 통합 메모리에서 공존하는 것을 방지했습니다.
성능 향상을 위해 특정 옵션이 제공되며, 예를 들어 `--use-slower-uncached-int8-scales` 플래그는 직접적인 장치 규모 로드를 복원하여 성능을 개선합니다. 이 최적화는 FC1 및 FC2 활성화 양자화 과정에서도 적용되어, 일부 측정에서 최대 0.2~0.8%의 성능 향상을 달성했습니다.
이러한 최적화는 개발자가 Apple Silicon 환경에서 대규모 모델 추론을 수행할 때 메모리 효율성과 Metal 성능을 극대화하는 데 직접적인 도움을 줍니다.
Hacker News
피드 등록 2026-08-11
swyx
수집 2026-08-11 02:46
프로그래밍 언어가 코딩 에이전트의 토큰 효율과 정확성에 미치는 영향에 대한 평가 결과가 발표되었습니다. Zstd와 Pandoc 구현 평가에서 동적 언어가 정적 언어보다 토큰 효율적이라는 기존의 강한 관계가 재현되지 않았습니다. 이는 언어 선택이 에이전트의 효율성에 미치는 영향에 대한 기존의 가설이 모든 상황에 적용되지 않을 수 있음을 시사합니다.
실제로 에이전트의 정확도, 비용, 시간 순위는 수행하는 과제와 추론 노력 수준에 따라 달라지는 것으로 나타났습니다. 즉, 단순히 언어의 효율성만으로 성능을 예측하기는 어렵고, 작업의 복잡도에 따라 최적의 언어 선택이 달라질 수 있습니다.
또한, 70~109토큰으로 해결되는 Rosetta Code와 같은 소형 문제들은 실제 작업 환경으로 일반화하기가 어렵습니다. 따라서 소규모 작업에서는 언어 효율성보다는 추론 노력과 과제의 특성이 에이전트의 성능을 결정하는 더 중요한 요소로 작용합니다.
GeekNews
피드 등록 2026-08-11
neo
수집 2026-08-11 01:46
AI 스타트업 투자에서 ARR의 의미가 과거와 달라지고 있다는 평가가 나오고 있습니다. 과거에는 ARR이 실제 반복 매출을 의미했지만, 현재는 월별 또는 일별 매출의 단순 연환산, GMV, 계약 예정 매출까지 포함하는 방식으로 사용되는 경우가 늘고 있습니다.
이러한 변화로 인해 15명의 벤처 캐피탈(VC)들은 숫자 자체를 그대로 신뢰하기 어려워하며, 투자 평가에 있어 ARR만으로는 충분하지 않다는 인식이 확산되고 있습니다.
따라서 투자자들은 ARR 외에도 CARR(연간 반복 매출), NRR(순 매출 성장률), 그리고 총마진과 같은 지표들을 함께 고려하여 계약이 실제 매출로 전환되는지 여부를 판단하려 합니다. 이는 스타트업의 실제 수익성과 성장 잠재력을 더 정확하게 측정하기 위한 움직임입니다.
GeekNews
피드 등록 2026-08-11
neo
수집 2026-08-11 01:46
플록 카메라가 미국 내 모든 차량을 추적할 수 있다는 보도가 나왔습니다. 이 기술은 경찰이 범죄 수사 및 교통 관리를 위해 광범위하게 활용하고 있어 경찰 측에서는 이 시스템에 대해 긍정적인 평가를 내리고 있습니다.
하지만 이러한 광범위한 추적 능력은 시민들의 사생활 침해 우려를 낳으며 큰 논란을 일으키고 있습니다. 시민들은 공공 안전이라는 명분 아래 개인의 이동 정보가 무분별하게 수집되고 사용되는 것에 대해 강한 불만을 표하고 있습니다.
결국 플록 카메라 기술은 공공의 안전과 개인의 프라이버시라는 두 가지 가치가 충돌하는 지점을 보여줍니다. 개발자 및 기술 커뮤니티에서는 이러한 대규모 감시 기술의 도입과 사용에 따른 윤리적, 법적 경계 설정이 중요한 과제로 부각되고 있습니다.
Hacker News
피드 등록 2026-08-11
pseudolus
수집 2026-08-11 01:46
엔지니어링 리더의 업무는 코드나 기능과 같은 눈에 보이는 산출물보다는 대화, 결정, 조율, 개입을 통해 나타납니다. 리더의 역할은 실제 결과물보다는 팀과 조직 내의 복잡한 상호작용과 의사결정 과정에 집중되어 있습니다.
리더는 하루 대부분을 정보 수집, 정보 공유, 의사결정, 의사결정에 영향, 실행 주도, 계획의 순환으로 구성된 순환 과정 속에서 보냅니다. 이는 단순히 작업을 지시하는 것을 넘어 팀과 조직의 현실을 정확히 이해하고 관리하는 데 초점을 맞추어야 함을 의미합니다.
팀과 조직의 현실을 정확히 이해하기 위해서는 엔지니어뿐만 아니라 관리자, 그리고 리더가 이러한 정보 흐름과 의사결정의 순환을 깊이 있게 이해해야 합니다. 이러한 관점을 통해 리더는 눈에 보이는 산출물 관리뿐만 아니라 팀의 역량과 환경을 이해하고 효과적으로 조율하는 데 집중할 수 있습니다.
GeekNews
피드 등록 2026-08-11
neo
수집 2026-08-11 01:46
AI 제품의 가격 책정 방식이 사용량 기반으로 변화하고 있습니다. AI 제품은 사용자가 행동할 때마다 토큰 비용이 발생하기 때문에 비용이 사용량에 따라 증가하며, 이는 기존 SaaS의 좌석 기반 가격제보다 사용량 및 성과 기반 모델이 더욱 중요해지고 있습니다.
이러한 변화는 AI 우선 기업의 수익 구조에 큰 영향을 미칩니다. AI 우선 기업의 총마진은 전통적인 SaaS 기업의 총마진인 80~90%보다 낮은 50~60% 수준에 머물고 있습니다.
따라서 AI 제품을 개발하고 운영하는 기업들은 비용 효율성과 고객 가치를 동시에 고려하여 새로운 가격 책정 모델을 구축해야 합니다. 이는 단순히 사용량에만 초점을 맞추는 것이 아니라, 고객에게 제공하는 성과와 비용 구조를 정확히 반영하는 것이 중요합니다.
GeekNews
피드 등록 2026-08-11
neo
수집 2026-08-11 01:46
일리노이주에서 통과된 법안 HB5511은 인터넷 연결 운영체제 제공자에게 연령 신고 기능과 API 구축을 의무화합니다. 이 법은 소셜미디어 보호 규정과 별개로 운영체제 제공자에게 연령 확인 기능을 부과하며, 오픈소스에 대한 예외를 두지 않는다는 점이 핵심입니다.
이 규정에 따라 운영체제 제공자는 사용자가 생년월일이나 나이를 입력할 수 있도록 시스템을 구축해야 합니다. 구체적으로 운영체제는 2028년 1월 1일까지 사용자가 자신의 나이를 입력할 수 있는 기능을 제공해야 합니다.
이는 오픈소스 프로젝트와 개발자들에게 중요한 영향을 미칩니다. 운영체제 제공자는 이 의무를 충족하기 위해 기술적 구현 방안을 마련해야 하며, 이는 오픈소스 소프트웨어의 구현 방식과 API 설계에 영향을 줄 수 있습니다. 개발자들은 2028년까지 이 요구사항을 충족하기 위한 기술적 준비를 고려해야 합니다.
GeekNews
뉴스
피드 등록 2026-08-11
neo
수집 2026-08-12 04:00
Instatic은 웹플로우, 프레이머, 워드프레스를 대체할 수 있는 오픈소스 셀프호스팅 비주얼 CMS를 제공합니다. 이 시스템의 핵심은 비주얼 에디터, 콘텐츠 엔진, 퍼블리셔 기능을 단일 Bun 서버에 통합하여 운영하는 것입니다.
기존에는 헤드리스 CMS, 프레임워크, 호스팅, 폼 서비스, 애널리틱스, 이미지 CDN 등 여러 서비스를 개별적으로 조합해야 하는 복잡한 방식이 일반적이었습니다. 하지만 Instatic은 이러한 분산된 시스템 대신 하나의 서버가 캔버스 에디터, 콘텐츠, 미디어, 인증, 폼 기능을 모두 처리할 수 있도록 설계했습니다.
이러한 통합 구조는 개발자들이 복잡한 인프라를 구축하는 대신 단일 서버 기반으로 모든 기능을 셀프호스팅할 수 있게 합니다. 데이터 백엔드로는 SQLite나 Postgres를 사용하여 안정적인 데이터 관리를 수행하며, 이는 개발자들이 인프라 구성의 복잡성을 줄이고 효율적으로 애플리케이션을 배포할 수 있도록 돕습니다.
GeekNews
피드 등록 2026-08-11
xguru
수집 2026-08-11 01:46
call-cc.org에서 Chicken Scheme 6.0 관련 정보가 게시되었습니다. 이 게시물은 특정 소프트웨어 또는 프로젝트의 버전 6.0 업데이트에 대한 내용을 담고 있습니다.
해당 게시물은 2026년 8월 11일에 게시되었으며, 개발자 커뮤니티에서 논의될 수 있는 새로운 정보가 포함되어 있습니다. 자세한 내용은 해당 링크를 통해 확인할 수 있습니다.
현재 제공된 정보는 해당 릴리스에 대한 링크와 메타데이터만을 포함하고 있어 구체적인 변경 사항이나 기술적 세부 정보는 포함되어 있지 않습니다. 따라서 이 게시물을 통해 Chicken Scheme 6.0의 구체적인 내용이나 영향에 대해 알기 위해서는 원본 기사를 직접 참조해야 합니다.
Hacker News
피드 등록 2026-08-11
eatonphil
수집 2026-08-11 01:46
최근 한 기고문에서 저자는 생성형 인공지능(AI) 사용을 기타 히어로(Guitar Hero)를 플레이하는 것과 비교하는 것에 반대하며 기타 히어로를 옹호합니다. 저자는 AI를 옹호하는 것이 아니라, AI가 기타 히어로를 폄하했기 때문에 이 비유를 받아들이지 않는다고 주장합니다.
저자는 기타 히어로와 생성형 AI를 비교하는 것은 근본적으로 불가능하다고 설명하며, 기타 히어로가 실제 기타 연주 기술을 가르치지 않으며 그 기술이 실제 악기로 전이되지 않는다는 점을 강조합니다. 기타 히어로는 리듬, 타이밍, 손과 눈의 협응력과 같은 능력을 요구하는 활동이며, 이는 뇌에 새로운 신경 경로를 만들고 훈련하는 경험을 제공합니다.
반면 생성형 AI는 이러한 기술 습득과는 무관하며, 오히려 인지 기능과 문제 해결 능력을 해치고 기억을 손상시킨다는 연구 결과가 있습니다. 또한 기타 히어로는 실제 라이선스 음악과 실제 예술가들의 참여를 통해 인간의 의도와 사랑이 담긴 창의적인 프로젝트인 반면, AI는 예술을 훔치고 일자리를 위협하며 사람들을 고립시키는 존재라는 차이가 있습니다.
결론적으로 기타 히어로는 인간이 참여하여 창조한 활동이라는 점에서 생성형 AI와는 정반대의 의미를 가지며, 이는 AI가 예술을 훔치고 사람들을 고립시키는 것과는 완전히 대조됩니다.
Hacker News
발행 2026-08-11
Tomte
수집 2026-08-11 04:48
Firefox 153 버전에서 업무, 쇼핑, 개인, 은행 활동을 같은 브라우저 창 내에서 분리하는 내장 컨테이너 기능을 미리보기로 제공합니다. 이 기능은 사용자가 각 활동에 대해 독립적인 탐색 맥락을 유지하고 쿠키와 광고 추적을 격리하여 서로의 활동이 보이지 않도록 설계되었습니다.
컨테이너를 사용하면 각 환경별로 로그인 계정과 탐색 맥락을 유지할 수 있어 여러 개의 계정을 동시에 관리하는 데 용이합니다. 이는 사용자가 민감한 정보나 특정 환경에 따라 쿠키와 추적 데이터를 분리하여 개인 정보 보호를 강화하는 데 중점을 둡니다.
개발자나 고급 사용자는 이러한 컨테이너 기능이 브라우저 내에서 활동의 격리를 어떻게 구현하는지 확인하고 이를 기반으로 새로운 웹 애플리케이션이나 서비스를 구축할 때 프라이버시와 사용자 경험을 개선하는 데 활용할 수 있습니다. 이 기능은 약 10년간 제공되어 온 Firefox의 기능 확장 역사에 중요한 진전을 의미합니다.
GeekNews
출시
피드 등록 2026-08-11
neo
수집 2026-08-12 03:00
OpenAI가 직원들을 대상으로 70억 달러 규모의 주식 매수 제안(tender offer)을 완료했다는 보도가 나왔습니다. 이는 직원들에게 자금 유동성을 제공하기 위한 목적으로 이루어졌으며, OpenAI의 가치는 8,520억 달러로 평가되었습니다. 이 거래는 회사가 지난 3월에 모금했던 라운드와 동일한 가치로, 회사 자본을 1,220억 달러 증가시켰습니다.
이러한 직원 대상의 사모 제안은 상장(IPO) 과정에서 발생할 수 있는 복잡한 어려움 없이 직원들이 주식 보상을 실현할 수 있게 해주는 유용한 방법으로 작용합니다. OpenAI는 올해 상반기에 잠재적인 IPO를 위해 증권거래위원회에 기밀로 신청했으나, 이번 매수 제안은 IPO가 곧 이루어지지 않을 수 있음을 시사합니다.
최근 OpenAI는 내부 재정 목표를 달성하지 못했으며, 경쟁사인 Anthropic의 성과를 고려할 때 회사는 현재 경영 전략을 재조정하고 엔터프라이즈 사업에 집중해야 하는 상황입니다. 따라서 이번 주식 제안은 OpenAI가 새로운 전략을 통해 시장의 관심을 확보하고 경쟁 우위를 점하기 위한 움직임으로 해석될 수 있습니다.
TechCrunch
발행 2026-08-11
Tim Fernholz
수집 2026-08-11 00:45
macOS 대화상자에 사용된 불리언 토글의 시각적 표현 방식이 현재 상태를 직관적으로 구분하기 어렵다는 한계를 드러냈습니다. 구체적으로 네 가지 회색 음영으로 표시된 사례는 토글 UI가 상태 구분에 있어 직관성을 확보하지 못하고 있음을 보여줍니다.
토글 디자인은 iOS 환경에서 체크박스를 대체하며 등장한 것으로 보이며, 넓은 터치 영역과 물리적 스위치를 닮은 스큐어모픽 디자인을 채택했습니다. 이러한 디자인은 터치 인터페이스에 적합하지만, 시각적 피드백의 명확성 측면에서 개선이 필요하다는 지적이 나오고 있습니다.
결론적으로 토글 UI는 넓은 터치 영역과 물리적 스위치 형태를 도입했음에도 불구하고, 상태를 명확하게 구분하는 데 어려움을 겪는 UI의 한계를 가지고 있습니다. 개발자는 사용자 경험을 개선하기 위해 토글의 시각적 피드백과 상호작용 방식을 재고할 필요가 있습니다.
GeekNews
피드 등록 2026-08-11
neo
수집 2026-08-11 01:46
기업 질의응답은 내부 문서를 검색하고 근거 있는 답변을 생성하는 것으로 정의되지만, 실제 기업 기록은 이질적인 출처에 걸쳐 필요한 조직 관계가 암묵적으로 남아있는 결과물입니다. 기존 벤치마크들은 현실적인 다중 출처 증거를 제공하지만, 종종 미리 정의된 답변 경로를 제시하여 사실의 조합을 테스트할 뿐, 코퍼스에 없는 목표 관계를 복구하는 능력을 테스트하지는 못합니다. 이러한 후자의 능력을 잠재적 조직 추론(latent organizational reasoning)이라고 정의하며, 연구진은 이를 측정하기 위한 새로운 벤치마크 구축 프레임워크인 ENTLORE를 소개합니다.
ENTLORE는 일상적인 문서, 권위 있는 조직 테이블, 운영 기록으로부터 감사된 기업 세계를 재구성하는 그래프 기반 벤치마크 구축 프레임워크입니다. 이 프레임워크는 버전화된 조직 관습을 사용하여 진실 그래프 내에서 파생된 관계를 인증함으로써 완전한 정답과 증명서를 가능하게 합니다. ENTLORE는 세 가지 출처 유형에서 2,341개의 문서를 포함하며 명시적 검색, 교차 출처 조합, 그리고 잠재적 조직 추론을 포괄하는 907개의 질문을 포함하고 있습니다.
연구 결과에 따르면, 공개된 문서만으로는 잠재적 질문의 30.4%가 여전히 해결되지 않는 것으로 나타났습니다. 이는 명시적 질문의 경우 12.6%와 조합적 질문의 경우 6.2%에 비해 현저히 높은 수치입니다. 따라서 기업 질의응답은 문서 검색 능력뿐만 아니라 암묵적인 조직 관계가 실제로 사용 가능한지에 달려있습니다.
이 벤치마크, 데이터, 코드는 ENTLORE를 통해 공개되어 있으며, 이 세계를 유도된 엔티티 그래프나 탐색 가능한 지식 기반으로 구조화하는 것이 가장 강력한 배포 결과를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-11
Akrin Zheng, Alexander Wu, Alaia Liu
수집 2026-08-18 03:43
인공지능이 현실 세계의 난제를 해결하기 위해 명확한 목표와 검증 가능한 과정을 필요로 한다는 점을 Apodex Discovery 프레임워크는 제시합니다. 이 프레임워크는 기초 모델, 하네스, 도구, 제어 정책으로 구성된 헤비 듀티 솔버를 통해 확장되고 상태를 가지며 검증 가능한 조사를 추구합니다.
Apodex Discovery는 세 가지 핵심 구성 요소를 갖습니다. 첫째, 문제 발굴 과정은 16개 부문 561개 산업을 조사하여 423개의 고가치 실제 문제를 수집하고 초기 공개를 위해 20개를 선정했습니다. 둘째, 공통 환경-과제-에피소드 추상화는 데이터, 도구, 제약 조건, 피드백, 궤적 기록 및 중간 결과물과 최종 제출물의 검증을 제공합니다. 셋째, HDS6 평가는 최종 과제 성공 여부와 관계없이 도구, 수리, 대안, 일관성, 증거, 범위를 독립적으로 평가합니다.
이러한 접근 방식은 구체적인 성과로 이어졌는데, AAV 캡시드 설계 분야에서는 Apodex가 생존력, 표적성, 구조 예측 및 생성 설계에서 기존 최고 수준을 7% 상회했습니다. 또한 약물 재배치 및 재정립 분야에서는 특정 과제별 생물의학 환경이 GPT-5.5와 GPT-5.6 솔버의 평균 정규화 예측 점수를 동일한 폐쇄형 백본에서 각각 2.5점과 7.6점 향상시켰습니다.
추가적으로, 고정된 TRACES 에피소드 인터페이스는 성능 차이를 특정 솔버 구성 요소에 귀속시키는 것을 가능하게 하여, AI 평가를 사전 정의된 벤치마크를 넘어 진정한 발견을 목표로 하는 검증 가능한 조사로 전환시킵니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-11
Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang, Gongbo Sun, Lingfeng Shen, Ning Wang, Handuo Zhang, Feng Chen, Fuchao Yang, Xiang Wang, Jiacheng Lin, Siting Li, Zixuan Liu, Chi Han, Zhenhailong Wang, Kunlun Zhu, Lawrence Zhao, Yueqi Guo, Kailong Wen, Feng Xing, Yiling Guo, Lidong Bing, David Tan, Bo An, Heng Ji, Sheng Wang
수집 2026-08-17 15:35
차세대 AI 에이전트는 고립된 질문에 답하는 시스템을 넘어 사용자의 경험을 이해하고 기억하며 지속적으로 학습하는 지속적인 개인 비서로 발전하고 있습니다. 이러한 비서 역할을 수행하기 위해서는 시간 경과에 따라 사용자별 경험을 축적하고 활용할 수 있는 장기 기억이 필수적입니다. 하지만 현실적인 모바일 환경에서 경험이 이질적이고, 다중 양식적이며, 진화하고, 매우 개인적이라는 점을 고려할 때 기존의 벤치마크는 현실성이 부족합니다.
이에 연구진은 모바일 경험을 일 년 분량으로 수집하여 온디바이스 장기 기억을 연구하기 위한 벤치마크이자 프레임워크인 MobileMem을 소개합니다. MobileMem은 사용자 앱 세션으로부터 일관되고 시간적으로 일관된 장기 궤적을 구성하기 위해 지식 기반 합성 파이프라인을 사용합니다. 이 프레임워크는 다단계 추론과 시간 추론, 지식 업데이트, 암묵적 선호 추론을 포괄하는 텍스트 및 다중 양식적 설정을 제공합니다.
MobileMem은 에이전트가 과거를 기억하고 현재를 이해하며 미래에 적응할 수 있도록 합니다. 이는 단순히 사실 검색을 넘어 경험을 모델링함으로써 기억을 지속적인 개인 학습을 위한 경험적 지능으로 발전시킵니다. 따라서 MobileMem은 모바일 환경에서의 장기 기억 연구에 있어 새로운 기준을 제시하며 개인화된 학습 능력을 향상시키는 데 기여합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-11
Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang
수집 2026-08-17 04:27
거대 추론 모델(LRM)에서 성능은 테스트 시 컴퓨팅 스케일링에 의해 크게 좌우되지만, 현재 접근 방식은 비효율성으로 인해 한계에 부딪혔습니다. 연구진은 테스트 시 추론을 부분 궤적에 대한 제약된 컴퓨팅 할당 문제로 공식화하며, 고정된 하드웨어 예산 내에서 컴퓨팅을 가장 유망한 부분 진행에 능동적으로 할당하는 방법을 모색했습니다. 기존의 병렬 샘플링은 궤적을 독립적으로 처리하여 심각한 메모리 병목 현상을 유발하며, 차감적 가지치기(subtractive pruning)는 하드웨어를 고갈시키고 출력 분포를 충분히 이동시키지 못하는 한계를 보였습니다.
이러한 문제점을 극복하기 위해 연구진은 사고 수준의 빔 서치(thought-level beam search)를 실행하는 추론 알고리즘인 Gambit을 제안했습니다. Gambit은 부적합한 궤적을 주기적으로 가지치기하고 고품질 접두사로부터 즉시 분기함으로써, 은닉 상태를 탐색하는 경량 점수기(light-weight scorer)를 통해 가장 유망한 추론 궤적에 컴퓨팅을 동적으로 집중시킵니다. 이 과정에서 지속적으로 높은 하드웨어 활용도를 유지할 수 있습니다.
다양한 모델과 벤치마크에 걸친 광범위한 평가 결과, Gambit은 기존 기준선들을 명확하게 능가하는 것으로 나타났습니다. 동일한 하드웨어 제약 조건 하에서 Gambit은 가지치기 기준선 대비 HMMT-24에서 최대 6.7%의 절대 정확도 향상과 AIME-25에서 3.3%의 정확도 향상을 달성했습니다. 또한, 트레이스 완료에 있어서 2배 이상의 처리량 향상을 제공하며 표준 병렬 샘플링 대비 총 토큰 소비량을 최대 68.5%까지 줄였습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-11
Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali
수집 2026-08-14 23:49
에이전트 스킬은 절차적 지식과 도메인 전문성을 패키징하는 표준 형식으로, 에이전트 하네스 시스템 내에서 언어 모델의 행동 공간을 지속적으로 제약하여 반복적이고 고품질의 작업 실행을 가능하게 합니다. 하지만 강력한 폐쇄형 모델을 사용하면 추론 비용이 높아 현재 인기 있는 에이전트 하네스인 Codex나 OpenClaw를 실세계 작업에 적용할 때 비용이 과도하게 발생합니다. 따라서 소비자 등급 GPU에서 배포 가능한 오픈 소스 모델의 빠른 능력 향상을 활용하여 스킬 기반 행동 제약을 통해 비용을 획기적으로 줄일 기회가 있습니다.
그러나 이러한 소형 모델에 특화된 효과적인 스킬을 자동으로 생성하는 것은 여전히 중요한 실질적인 과제입니다. 이를 해결하기 위해 본 연구는 자연어 기반 강화 학습 프레임워크인 SKILLER를 제안했습니다. SKILLER는 강력한 모델을 액터와 크리틱으로 사용하고 소형 모델 에이전트 시스템을 환경으로 취급하며, 모든 강화 학습 신호를 자연어를 통해 전파하여 실행자별 스킬을 자동으로 생성하도록 설계되었습니다.
Qwen3.5-9B 및 Qwen3.5-4B 모델을 사용하여 다섯 가지 관련 벤치마크에 걸쳐 광범위한 실험을 진행한 결과, SKILLER는 세 가지 오픈 소스 방법과 하나의 폐쇄형 방법보다 우수한 성능을 보였습니다. 특히 9B 모델에서는 4.3%에서 20.4%의 절대적인 성능 향상을, 4B 모델에서는 1.8%에서 13.3%의 절대적인 성능 향상을 달성했습니다. 이는 SkillsBench에서 단일 스킬 작업에 대한 강력한 폐쇄형 모델의 성능과 놀랍도록 일치하는 결과입니다.
SKILLER 프로젝트는 GitHub에서 공개되어 있으며, 개발자들은 https://github.com/DANG-ai/SKILLER를 통해 접근할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-11
Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li
수집 2026-08-14 06:39
ReRound는 표준 반올림 근사(round-to-nearest, RTN) 방식이 양자화 구간의 중심 근처에서 발생하는 중간값 모호성 문제를 해결하는 후처리 양자화 방법입니다. 이 방법은 사전 학습된 대규모 언어 모델(LLM)에서 시작하여 조건부 확산 모델(conditional diffusion model)을 훈련시켜 LLM의 저비트 가중치에 대한 연속적인 재구성을 생성합니다. 이 재구성된 가중치는 구간 중간값 근처에 있는 가중치의 반올림 방향을 명확히 하는 안내 신호로 작용합니다.
ReRound는 이 재구성 기반 반올림을 기존 RTN과 통합하기 위해 허용 오차 측정 기준을 도입합니다. 이 기준은 양자화된 가중치(최종 양자화 정수가 아닌)가 중간값으로부터 얼마나 떨어져 있는지를 측정합니다. 중간값 주변의 가중치는 확산 기반 재구성을 사용하여 양자화하고, 양자화 경계에 더 가까운 가중치는 RTN을 사용하여 양자화합니다. 이 허용 오차 매개변수를 조정하여 여러 후보 양자화 정수 가중치 행렬을 생성한 후, 원래의 전체 정밀도 가중치의 특이값과 가장 잘 일치하는 후보를 선택합니다.
이러한 전략을 통해 ReRound는 3비트 및 4비트 가중치 양자화에서 표준 RTN보다 일관되게 우수한 성능을 보입니다. ReRound는 보정 불필요 양자화 방법들보다 뛰어난 정확도를 달성하며, 보정 의존적 접근 방식과 경쟁할 수 있는 수준을 유지합니다. 또한, ReRound는 오프라인으로 완전히 작동하여 저비트 추론 중에 추가적인 오버헤드를 발생시키지 않습니다.
ReRound는 저비트 양자화에 대한 새로운 접근 방식을 제시하며 LLM을 넘어선 AI 모델에도 적용될 수 있습니다. 이 연구는 특히 소형 LLM에 대한 적용에 초점을 맞추고 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-11
He-Yen Hsieh, H. T. Kung
수집 2026-08-13 23:02