이집트 테베의 신도시 지역에는 수많은 무덤이 있으며, 최근 연구는 수천 년에 걸쳐 이집트의 매장 경향이 어떻게 변화했는지 밝혀냈습니다. 고대 이집트의 매장 관습은 처음에는 정교한 관 안에 개인이 묻히는 방식에서 시작하여, 시간이 흐르면서 이전의 매장지를 재사용하여 후대의 시신을 안치하는 방식으로 변화했습니다. 이러한 변화는 무덤 내부에 신체의 밀도가 증가하고 시신이 겹쳐 놓이는 현상을 초래했습니다.
이러한 변화를 이해하기 위해 연구자들은 '통합 고고인체학적 접근법'을 사용했습니다. 이 방법은 신체의 위치, 관의 사용, 유해의 중첩, 지층 관계 등의 데이터를 골학적 분석과 결합하여 매장의 연대 순서를 재구성하는 데 중점을 두었습니다. 특히 서쪽 신도시 지역에 위치한 25왕조 시대의 무덤 209에 대한 연구는 이러한 시간적 변화를 보여주는 구체적인 사례를 제공합니다.
이 무덤은 와디 하타순의 배수 수로 내부에 위치하여 반복적인 홍수에 취약했기 때문에 고고학적으로 복잡한 장소로 간주됩니다. 따라서 연구는 환경적 요인과 매장 관습의 변화를 동시에 고려해야 했습니다. 이 연구는 고대 이집트의 매장 역사가 단순한 관습 변화를 넘어 환경적 제약과 사회적 필요에 의해 어떻게 형성되었는지에 대한 중요한 통찰을 제공합니다.
Ars Technica
논문
발행 2026-08-18
Jennifer Ouellette
수집 2026-08-18 05:44
프로덕션 환경에서 버그가 발생했으나 로컬 환경에서는 재현이 불가능할 때, 개발자들이 위험을 감수하고 프로덕션 데이터베이스에 직접 연결하여 버그를 재현하는 경험이 있는지 질문합니다. 소규모 팀에서는 빠른 문제 해결을 위해 이러한 방법을 사용하곤 하지만, 이는 프로덕션 데이터를 테스트할 수 있는 적절한 환경이 갖춰지지 않았기 때문에 발생하는 문제입니다.
이러한 직접 연결 방식은 당장의 문제를 해결할 수는 있지만, 프로덕션 데이터에 대한 무분별한 접근으로 인해 심각한 위험을 초래할 수 있습니다. 결국 버그 재현과 테스트를 위해 프로덕션 데이터에 직접 접근하는 것은 데이터 무결성과 시스템 안정성을 위협하는 행위입니다.
따라서 개발 환경에서는 프로덕션 데이터와 유사한 환경을 구축하여 버그 재현 및 테스트를 안전하게 수행할 수 있는 환경을 마련하는 것이 중요합니다. 이는 개발 과정에서 발생할 수 있는 위험을 줄이고 시스템의 안정성을 확보하는 데 필수적인 접근 방식입니다.
GeekNews
분석
피드 등록 2026-08-18
bhryan
수집 2026-08-18 03:43
이 글은 이진법이 디지털 컴퓨팅의 유일한 방식인지에 대해 탐구하며, 이진법보다 나은 대안이 있는지 논의합니다. 오늘 다루는 주제는 3진법, 즉 기수 3(ternary)에 관한 내용입니다.
3진법은 19세기부터 실제 컴퓨터와 이론적 설계에 이르기까지 사용되어 왔지만, 현재는 잘 다뤄지지 않는 비교적 독특한 주제입니다. 이진법이 현대 컴퓨팅의 기본이지만, 다른 숫자 체계가 계산에 어떤 이점을 제공할 수 있는지에 대한 역사적 배경과 이론적 접근을 살펴봅니다.
이러한 탐구는 단순히 수학적 개념을 넘어, 우리가 당연하게 여기는 디지털 시스템의 근본적인 구조와 한계를 이해하는 데 중요합니다. 3진법과 같은 비이진 시스템이 가지는 잠재적인 계산 효율성이나 이론적 설계의 가능성을 이해하는 것은 미래 컴퓨팅 패러다임을 고민하는 개발자들에게 새로운 관점을 제공할 수 있습니다.
Hacker News
논문
피드 등록 2026-08-18
matt_d
수집 2026-08-18 04:43
최근 LLM과 에이전트의 발전으로 벤치마크 성능을 조작하여 실제 성능 개선 없이 허위 성능 향상을 주장하는 행위가 매우 쉬워졌습니다. 과거에는 대규모 벤치마크 스위트를 속이는 데 많은 노력이 필요했지만, 이제는 LLM과 루프를 사용하여 이러한 조작이 매우 용이해졌습니다. 이는 특정 최적화가 실제 환경 성능을 개선하지 않고 벤치마크 점수만 높이는 방식으로 이루어지는 사례가 일주일에 한 번꼴로 발생하고 있음을 시사합니다.
이러한 현상은 특정 프로젝트나 스타트업에서 성능 향상을 주장할 때 발생하며, 이는 개발자가 특정 기술에 대한 깊은 전문 지식 없이도 허위 주장을 쉽게 만들어낼 수 있게 만듭니다. 예를 들어, 에이전트가 특정 벤치마크에서 최고 성능을 달성하도록 훈련될 때, 실제 세계에서의 성능 개선과는 무관한 결과를 도출할 수 있습니다.
벤치마크 결과의 신뢰성을 확보하기 위해 홀드아웃 벤치마크 세트를 사용하는 등의 방어책이 시도되었으나, 여전히 에이전트는 과적합을 통해 좋은 점수를 얻는 데 성공했습니다. 또한, 벤치마크 자체가 특정 사용 사례에 대한 의미 있는 요약 지표를 제공하지 못하고 있어, 실제 성능을 정확하게 측정하기 위해서는 해당 분야에 대한 깊은 이해가 필수적입니다.
Hacker News
분석
피드 등록 2026-08-18
cyndunlop
수집 2026-08-18 03:43
코덱스 사용자는 성능과 비용을 고려하여 기본 컨텍스트 크기가 조정되어 있지만, GPT-5.6 Sol의 최대 1,050,000 토큰 컨텍스트를 직접 활성화할 수 있게 되었습니다. 이는 개발자가 더 방대한 정보를 처리하고 복잡한 작업을 수행할 수 있는 환경을 제공합니다.
컨텍스트 윈도우를 늘리면 코덱스가 이전 내용을 압축하기 전에 더 많은 코드, 도구 출력, 그리고 대화 기록을 유지할 수 있습니다. 이는 긴 코드베이스나 복잡한 대화 기록을 한 번에 처리해야 하는 상황에서 중요한 이점을 제공합니다.
이러한 기능 활성화를 통해 사용자는 이전 맥락을 잃지 않고 일관성 있는 결과물을 얻을 수 있으며, 이는 코드 생성이나 복잡한 문제 해결 과정에서 정확도를 높이는 데 기여합니다. 개발 환경에서 컨텍스트 크기를 조정하여 작업 효율성을 극대화할 수 있습니다.
GeekNews
출시
피드 등록 2026-08-18
xguru
수집 2026-08-18 01:42
사람과 에이전트가 함께 문서를 보관, 검색, 변경하며 이력과 무결성을 검증할 수 있는 자기주권형(self-sovereign) 문서 시스템이 소개되었습니다. 이 시스템은 문서의 소유권과 관리 권한을 사용자뿐만 아니라 에이전트에게 부여하여 더욱 안전하고 통제된 문서 환경을 제공하는 것을 목표로 합니다.
이 시스템은 가상 트리(Virtual Tree) 구조를 핵심으로 사용하여 문서 ID, 불변 콘텐츠 버전, 색인 검색 기능을 통합합니다. 이를 통해 문서의 변경 이력과 무결성을 보장하며, 복구 가능한 삭제 기능과 검증된 백업 기능을 제공합니다.
특히 가상 트리는 선택적으로 영구 감사 이력을 포함할 수 있어 문서의 모든 변경 과정을 투명하게 추적할 수 있게 합니다. 개발자들은 이 시스템을 통해 데이터의 불변성과 접근성을 동시에 확보하고, 에이전트 기반의 자동화된 문서 관리 및 검증 시스템을 구축할 수 있는 기반을 마련하게 됩니다.
GeekNews
분석
피드 등록 2026-08-18
xguru
수집 2026-08-18 01:42
주문 읽는 AI를 29문제로 검증한 연재의 여덟 번째 편에서 코드 채점기의 버그를 AI가 잡아낸 사례를 다룹니다. 이는 규칙 기반 채점기가 설정된 규칙 자체에 오류가 있을 경우 이를 포착하지 못하는 한계를 보였기 때문에, 같은 답안을 전체적으로 읽는 AI 채점관인 Sonnet과 비교하여 검증하는 방식이 사용되었습니다.
연구진은 코드 채점기와 Sonnet의 채점 결과를 대조하여 AI 시스템의 신뢰도를 확인했습니다. 그 결과, 전체 29문제 중 27문제는 판정이 일치했으며, 의견이 갈린 2문제에 대해서도 두 AI와 실제 코드가 모두 정답을 맞혔음을 확인했습니다.
이러한 비교는 AI 기반 채점 시스템이 단순히 규칙을 따르는 것을 넘어 전체적인 맥락을 이해하는 능력에 대해 어떤 한계를 가지는지 보여줍니다. 개발자가 AI 시스템을 활용할 때 결과의 정확성을 높이기 위해 채점 규칙과 전체 답안을 모두 고려하는 것이 중요함을 시사합니다.
GeekNews
분석
피드 등록 2026-08-18
ramses203
수집 2026-08-18 01:42
최근 몇 달 동안 GitHub에서 지속적인 장애가 발생하면서 사용자들은 다른 서비스로 전환할 필요가 있는지에 대해 질문하고 있습니다. 이는 GitHub의 안정성에 대한 의문을 제기하며 대안 서비스로의 이전을 고려하는 움직임이 나타나고 있습니다.
많은 사용자들이 GitHub의 불안정한 운영 상황을 겪으면서 대체 플랫폼으로 전환하는 시점을 어떻게 판단해야 할지에 대한 의견을 구하고 있습니다. 이러한 논의는 GitHub의 서비스 안정성과 장기적인 사용 경험에 대한 사용자들의 우려를 반영하고 있습니다.
따라서 사용자들은 단순히 서비스 전환 여부를 넘어, 언제쯤 대안으로 전환하는 것이 합리적인지에 대한 구체적인 시점과 기준에 대해 논의하고 있습니다. 이는 개발자들이 현재의 서비스 환경에서 겪는 불편함을 해소하고 안정적인 협업 환경을 구축하기 위한 현실적인 방안을 모색하는 과정으로 이해할 수 있습니다.
GeekNews
의견
피드 등록 2026-08-18
neo
수집 2026-08-18 01:42
대규모 언어 모델(LLM)의 장문 컨텍스트 프리필 과정에서 밀집된 셀프 어텐션이 이차적인 쿼리-키 점수를 계산하기 때문에 상당한 연산 및 메모리 트래픽이 발생합니다. 기존 방법들은 균일한 저정밀 경로를 사용하거나 토큰 상호작용을 선택하는 방식으로 처리하여 하드웨어 정렬된 점 타일(score tile)에 대한 공간 정밀도 라우팅을 누락시켰습니다.
이에 연구진은 TileMix라는 타일 중심 정밀도 라우팅 커널을 제안했는데, 이는 밀집된 어텐션 내에서 수치 정밀도를 실행 가능한 공간 결정으로 만듭니다. TileMix는 어텐션 행렬을 하드웨어 정렬된 점 타일로 분할하고 라우팅 결정을 압축된 비트마스크로 묶어 각 타일 그룹을 FP16 또는 INT8 점 계산을 통해 처리합니다. 이 과정에서 두 경로는 공유 온라인 소프트맥스 상태를 업데이트하며, 각 라우팅 비트는 인접한 키 타일 여러 개를 제어하여 하드웨어 정렬된 연산 타일과 간결한 메타데이터를 보존합니다.
이러한 확장 가능한 정밀도 그룹화는 밀집된 토큰 연결성을 보존하며 훈련 없이도 그룹 쿼리 어텐션, 가변 길이 배치, INT8 키/값 캐시를 지원합니다. LongEval, LV-Eval, A100 프리필 벤치마크에서 LLaMA, Qwen, Vicuna 모델을 대상으로 테스트한 결과, TileMix는 균일한 INT8 사용 시 손실된 장문 컨텍스트 품질을 회복하고 FP16 대비 프리필 처리량을 개선하여 모델 패밀리 전반에 걸쳐 제어 가능한 정확도-효율성 경계를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng
수집 2026-08-25 03:37
게임 월드 모델은 시각적으로 일관되고 행동 제어가 가능한 게임 플레이 영상을 생성하는 데 유망한 능력을 보여주었습니다. 하지만 기존 모델에서 비플레이어 캐릭터(NPC)의 행동은 비디오 생성과 암묵적으로 얽혀 있거나 외부 제어 신호에 의해 명시적으로 규정되는 경우가 많습니다. 이로 인해 게임 월드 모델은 상태를 이해하고, NPC의 반응을 계획하며, 시각적 결과를 렌더링하는 과정을 동시에 수행해야 하므로 반응적이고 상태를 인지하는 NPC 행동을 생성하는 데 한계가 있습니다.
이러한 상태 기반 의사결정 인터페이스의 부재라는 문제점을 해결하기 위해, 연구진은 게임 월드 모델에서 상태를 인지하는 NPC 행동을 위한 최초의 분리된 프레임워크인 WorldMind를 소개했습니다. WorldMind는 상호작용적인 월드 모델링을 네 개의 계층으로 분리합니다. 첫째, 생성된 프레임에서 압축된 상태를 구성하는 이해 계층(Understanding Layer)이 있으며, 둘째, 압축된 상태를 바탕으로 NPC의 다음 행동을 계획하는 결정 계층(Decision Layer)이 있습니다.
나아가 WorldMind는 행동을 시간적으로 정렬된 조건으로 변환하는 제어 계층(Control Layer)과 시각적 결과를 합성하는 생성 계층(Generation Layer)을 추가하여 각 계층을 닫힌 상호작용 루프 내에서 연결합니다. 이 프레임워크는 NPC 행동을 진화하는 게임 상태에 기반하도록 만듭니다. 또한, 연구진은 풍부한 내부 게임 상태가 쌍으로 짝지어진 게임 플레이 비디오 데이터셋인 BOSS-140K와 대규모로 수집을 자동화하는 에이전트를 함께 제시했습니다.
BOSS-140K에 대한 실험 결과는 압축된 상태의 신뢰할 수 있는 재구성 및 메커니즘 기반 계획을 입증했습니다. 이 실험에서 WorldMind는 약 70%의 쌍별 비교에서 더 전술적으로 적절하고 일관성 있는 NPC 행동을 제공하여 기존 기준 모델보다 선호되었습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin
수집 2026-08-25 01:36
파운데이션 모델 시대에 인간 중심 지능이 발전하고 있지만, 모델들이 보이는 발전 속도에 완전히 통합되지는 못했습니다. 최근의 연구 발전은 작업, 양식, 연구 커뮤니티 전반에 걸쳐 파편화되어 있어 인간 중심 지능의 개념적, 방법론적 연결고리가 불분명한 상태입니다.
이러한 간극을 해소하고 파운데이션 모델 시대의 인간 중심 지능을 재고하기 위해, 연구진은 인간 중심 맥락 분류 체계를 제시했습니다. 이 분류 체계는 인간을 시각적 외모와 공간 기하학을 통해 관찰되는 주체, 운동 역학과 상호작용 모델링을 통해 동적 행위자, 그리고 세계 시뮬레이션과 체화된 에이전트를 통해 위치 지어진 행위자로 보는 여섯 가지 상호 연결된 수준을 통합합니다.
연구는 이러한 수준을 기반으로 인간 중심 데이터 계층, 계산 아키텍처 패러다임, 최적화 전략 등 방법론적 토대를 제시하고 관련 데이터셋, 벤치마크, 평가 지표를 체계적으로 정리했습니다. 또한 확장 가능하고, 신뢰할 수 있으며, 물리적으로 근거가 있고, 배포 가능한 인간 중심 지능을 향한 열린 과제와 유망한 연구 방향을 논의하여 분야 발전을 위한 일관된 프레임워크를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo
수집 2026-08-24 11:26
앙코어(Encore)는 애플 실리콘 환경에서 리눅스 마이크로VM 스택인 파이어크래커(Firecracker)를 재구축하는 데 성공했습니다. 이는 애플의 하이퍼바이저 위에서 동일한 마이크로VM을 부팅하고 실행할 수 있도록 하는 기술을 의미합니다.
파이어크래커는 컨테이너와 유사한 격리 환경을 제공하며, 이를 위해서는 KVM을 구동할 수 있는 리눅스 호스트가 필요합니다. 하지만 맥 환경에서는 이러한 리눅스 호스트 요구 사항을 충족하기 어렵고 애플이 가상화 기능에 대한 접근을 제한하고 있어, 개발자들이 맥북에서 파이어크래커를 운영하는 데 제약이 있었습니다.
이 문제를 해결하기 위해 앙코어는 리눅스와 애플의 하이퍼바이저 모두에서 파이어크래커를 구동할 수 있는 단일 마이크로VM API인 크래클링(crackling)을 개발했습니다. 이 과정에서 리눅스 이미지 도구 체인을 재구축하고 도커 레이어를 파이어크래커가 부팅할 수 있는 블록 장치로 변환하는 복잡한 시스템을 구축했습니다.
이러한 작업은 엔지니어들이 로컬 환경에서 동일한 빌드 시스템을 사용하면서도 프로덕션 환경에서 파이어크래커를 유지할 수 있도록 하여, 리눅스와 맥 환경 간의 개발 워크플로우 격차를 해소하는 데 기여합니다.
Hacker News
논문
발행 2026-08-18
signa11
수집 2026-08-21 08:36
LLM이 추론 시간 상호작용을 통해 지속적으로 학습할 수 있는 방법인 체인-오브-익스피리언스(Chain-of-Experience, CoE)를 연구한 논문이 발표되었습니다. 이 연구는 모델이 자기 피드백이나 환경 신호와 같은 반복적인 상호작용을 통해 경험적 흔적을 축적하여 제로샷 추론을 넘어 지속적인 개선 루프를 형성하는 방식을 탐구합니다.
연구진은 CoE를 모델 자기 피드백 및 정답 여부와 같은 환경 신호를 포함한 다양한 피드백 메커니즘으로 구현하고, 수학, 코딩, 지식 영역에서 GPT-5, Gemini-2.5 Pro, Claude-4.5 Sonnet 등 8개의 LLM을 사용하여 평가했습니다. 그 결과, 반복적인 경험을 활용하는 것이 피드백이 없는 기준선보다 일관되게 우수한 성능을 보였으며, 특히 자기 피드백만으로도 전체 작업 및 모델에서 5.6%의 개선과 19%의 API 비용 절감을 달성했습니다.
또한, 모델 피드백과 정답 신호와 같은 상호 보완적인 피드백 채널을 결합했을 때 추가적인 이점을 얻을 수 있음을 확인했습니다. CoE는 기존의 테스트 시간 전략보다 토큰당 더 높은 정확도를 제공하며, LLM의 기본 능력과 개선 능력 사이에 긍정적인 상관관계가 있음을 발견했습니다.
이 연구는 모델이 약하거나 잘못된 피드백 하에서도 견고함을 유지하며, 다양한 피드백이 개별적인 개선 측면에 기여하고 가장 큰 이점이 반복 과정 초기에 나타난다는 점을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan
수집 2026-08-21 05:35
음악 편집은 영화, 방송, 게임 개발 등 현대 음악 제작에서 중요한 역할을 합니다. 최근 음악 편집 시스템의 발전으로 음색 전이, 악기 대체, 장르 변환과 같은 다양한 편집 작업이 가능해졌습니다. 하지만 기존 연구들은 편집 과정에서 유지되어야 할 음악적 측면을 보존하는 능력, 즉 음악적 맥락 보존(Music Context Preservation, MuseCP)을 평가하는 데는 소홀했습니다.
이러한 한계를 해결하기 위해 본 연구는 최초의 MuseCP 평가 프레임워크인 MuseCPEval을 도입했습니다. MuseCPEval은 음악 속 네 가지 측면을 다루며, 음악 속 변화를 미묘하게 포착하기 위해 세밀하고 잘 조정된 측정 기준을 제공합니다. 이 측정 기준의 효과는 객관적인 검증과 인간 연구를 통해 입증되었습니다.
다양한 음악 편집 시스템에 대한 사례 연구는 이러한 측정 기준이 기존 시스템의 강점과 한계를 이해하는 테스트베드 및 진단 도구로서 실질적인 유용성을 제공함을 보여줍니다. 연구진은 이 측정 결과와 발견이 MuseCP 능력이 뛰어난 보다 효과적이고 신뢰할 수 있는 음악 편집 전략을 개발하는 데 실질적인 지침을 제공하기를 희망합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Yash Vishe, Eric Xue, Xunyi Jiang, Zachary Novack, Junda Wu, Julian McAuley, Xin Xu
수집 2026-08-20 20:29
인공지능이 주니어 엔지니어의 가치를 없애는 것이 아니라 오히려 증가시킨다는 주장이 제기되었습니다. 이는 주니어 엔지니어의 역할이 단순히 코드를 작성하거나 AI 도구를 프롬프트하는 것을 넘어, 고객 문제를 해결하고 기술적 복잡성을 관리하는 데 필수적이기 때문입니다. 실제 업무 과정에서 주니어 엔지니어는 요구사항을 전달하고 피드백을 반영하며 반복하는 과정을 통해 조직에 기여하며 시간당 비용을 발생시킵니다.
AI는 코드 생성에 많은 부분을 담당하지만, 기술적 결정과 트레이드오프를 내리는 데 필요한 광범위한 맥락을 제공하지 못합니다. 예를 들어, 특정 기능을 개발할 때 주니어 엔지니어는 기술적 측면과 제품 측면에서 발생하는 불일치를 이해하고, 다양한 제약 조건 속에서 최적의 해결책을 찾는 판단을 내립니다. 이러한 판단은 코드베이스를 넘어선 더 넓은 맥락을 요구하며, 이는 여전히 인간의 역할로 남아 있습니다.
실제로 인턴이 고객이 오랫동안 요청했지만 우선순위가 낮았던 기능을 개발했을 때, 그들은 AI의 도움을 받았지만 기술적, 제품적 불일치를 해결하고 가치를 전달하는 주도적인 역할을 수행했습니다. 이는 주니어 엔지니어가 조직에 역량을 더하고 기술적 판단을 가능하게 하여 조직이 더 많은 것을 할 수 있도록 돕는 중요한 역할을 의미합니다.
따라서 AI 시대에도 엔지니어링 조직은 기술적 판단 능력을 계속 필요로 하며, 주니어 엔지니어는 이러한 복잡성을 관리하고 고객 관점을 이해하는 데 기여함으로써 조직의 미래 판단력을 키우는 데 필수적입니다.
Hacker News
분석
발행 2026-08-18
franciscomt
수집 2026-08-20 12:22
영상 생성 분야에 목표 달성과 의미적 정렬을 모두 요구하는 새로운 평가 프레임워크인 의미적 작업 완료 비디오 생성(Semantic Task Completion Video Generation)을 소개합니다. 이 새로운 접근 방식에서 성공적인 결과물은 의도된 목표를 달성하는 것뿐만 아니라 의미적 정렬(semantic grounding)을 확보하는 것을 필요로 합니다. 의미적 정렬은 참조 이미지와 생성된 결과물 간의 작업과 관련된 고수준 의미에 대한 대응 관계를 의미합니다.
체계적인 평가를 위해 여섯 가지 도메리를 포괄하는 평가 데이터셋인 SemComp-Data를 구축했습니다. 이 데이터셋의 각 인스턴스는 참조 이미지, 상세 지침, 간략 지침, 그리고 결과 중심의 비디오 클립으로 구성됩니다. 또한, 이 데이터셋을 표준화된 형태로 변환하는 확장 가능한 4단계 큐레이션 파이프라인을 제시합니다.
추가로, 비전-언어 모델(VLM)을 사용하여 구조화된 이진 질문에 답하는 평가 프로토콜인 SemComp-Bench를 도입했습니다. SemComp-Bench는 결과 달성(OA Score)과 생성 신뢰성(GR Score)을 보고합니다. 대표적인 비디오 생성 모델에 대한 실험 결과는 참조 이미지에서 작업 관련 의미적 정렬을 유지하면서 의도된 목표를 달성하는 것이 여전히 어렵다는 것을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang
수집 2026-08-20 04:19
DFlash 2는 추론 과정에서 병렬 초안 작성(drafting)을 가능하게 하여 에이전트 시대의 병목 현상을 해결하는 새로운 추론 스택을 제시합니다. 기존의 추론 방식은 토큰당 전체 모델 순방향 계산을 요구하여 시간과 토큰 경제 측면에서 비효율적이었으나, DFlash 2는 전체 블록을 병렬로 예측하여 효율성을 극대화합니다.
DFlash 2는 Qwen3.8-27B 모델에서 실험되었으며, Apple M5 Max 환경에서 오직 1%의 추가 사이클 지연만으로도 검증 패스당 20% 더 많은 출력을 얻어내며, 이는 결과적으로 16%에서 25%의 성능 향상을 가져옵니다. 이는 기존의 자기회귀적 디코딩 방식보다 2.7배에서 3.4배 빠른 처리 속도를 제공하며 토큰당 컴퓨팅 비용을 약 3분의 1로 줄입니다.
이 기술은 DFlash 2가 인코 AI에서 개발되었으며 SGLang, vLLM, llama.cpp 등 주요 추론 엔진에서 이미 구현되어 있으며 NVIDIA, Meta 등 다양한 파트너들이 공식 드래프터를 출시하며 생태계를 구축하고 있습니다. DFlash 2는 단순히 속도를 높이는 것을 넘어, 인과 관계가 있는 토큰 간의 일관성을 유지하면서도 불필요한 자기회귀적 보정 없이 효율적인 추론을 가능하게 합니다.
Hacker News
논문
발행 2026-08-18
mike-the-brain
수집 2026-08-19 21:13
코딩 에이전트의 강화 학습은 도구 통합, 저장소 컨텍스트, 실행 피드백 관리를 위해 장기 실행 에이전트 하네스에 크게 의존하고 있습니다. 그러나 이러한 하네스의 네이티브 실행 환경은 정책 기울기 훈련과 본질적으로 불일치하여 환경 충돌이나 보상 해킹이 결과 신호를 손상시키고, 훈련과 추론의 불일치가 롤아웃 행동을 정책 업데이트로부터 분리시키는 문제가 발생합니다.
이러한 문제를 해결하기 위해 논문은 네이티브 코딩 에이전트 하네스와 확장 가능한 정책 기울기 최적화를 내부 제어 흐름을 수정하지 않고 연결하는 프레임워크인 LEGO-RL을 제시합니다. LEGO-RL은 세 가지 핵심 축을 기반으로 구축됩니다. 첫째, 인-프로세스 LLM 프록시를 통한 충실한 최적화로 토큰 수준 정렬을 위한 원시 생성 스트림을 포착하고 하네스 측의 압축이나 재직렬화 하에서도 로그 확률 재계산을 보장합니다. 둘째, 이미지 캐싱과 단계별 방어를 특징으로 하는 확장 가능한 샌드박스 오케스트레이션을 통해 보상 해킹을 완화하며 신뢰할 수 있는 실행을 가능하게 합니다.
또한, 통합 플러그인을 통해 검증 및 모니터링을 자동화하고 세밀한 궤적 진단을 위한 라이브 UI를 제공하여 관찰 가능한 훈련 환경을 구축합니다. 이 프레임워크를 세 가지 네이티브 코딩 에이전트 하네스에 걸쳐 GSPO를 사용하여 희소 MoE 모델인 Qwen3.5-35B-A3B를 훈련하여 평가했습니다.
그 결과 LEGO-RL은 SWE-bench Verified에서 OpenHands SDK(64.0%에서 70.4%), Claude Code(62.4%에서 68.2%), OpenCode(57.2%에서 66.6%) 성능을 개선했으며, 롤아웃-훈련 확률 상관관계는 0.99 이상을 유지했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai
수집 2026-08-19 17:10
LLM 시대에 확장 가능한 소프트웨어의 필요성이 대두되고 있습니다. 현재 웹 소프트웨어 대부분은 정적이며, 개발자들이 사용자에게 가장 큰 수요를 충족시키는 기능에 집중하기 때문에 사용자 개개인의 다양한 요구사항을 반영하기 어렵습니다. 이러한 상황에서 LLM 기반 코딩 지원은 개인의 워크플로우에 맞춘 '소프트웨어 포 원(Software for One)'을 구축하는 데 강력한 도구가 되었습니다.
LLM은 복잡한 엔터프라이즈 소프트웨어의 책임과 복잡성을 우회하여 개인 맞춤형 앱을 만드는 데 탁월하며, 이는 Pi와 같은 사례에서 확장 가능한 소프트웨어 모델로 발전하고 있습니다. 핵심은 LLM이 확장 기능을 작성하는 비용을 크게 낮추고, 현대적인 샌드박스 원시 기능을 통해 배포 비용과 보안 경계를 낮출 수 있다는 점입니다.
개발자들은 이제 애플리케이션의 핵심을 견고하게 구축하고, LLM을 사용하여 사용자가 안전하게 여러 방향으로 확장할 수 있도록 허용하는 방식으로 접근해야 합니다. 기존의 웹훅 방식보다 더 나아가, 사용자가 원하는 로직을 쉽게 삽입하고 공유할 수 있는 확장 패턴이 필요하며, 이를 통해 생태계가 다양한 아이디어를 수용할 수 있게 됩니다.
이러한 확장성을 실현하기 위해서는 사용자 측에서 민감한 데이터에 접근할 수 있는 커스텀 코드를 샌드박스하는 것이 중요합니다. 플랫폼을 구축하는 것은 설계, 운영, 디버깅 측면에서 어렵지만, 사용자 창의성을 극대화할 수 있다는 점에서 가치가 있습니다.
Hacker News
분석
발행 2026-08-18
coloneltcb
수집 2026-08-19 17:10
LLM을 GPU 커널 최적화를 위해 아키텍처별 PTX를 활용하도록 평가하는 벤치마크인 PTXBench가 소개되었습니다. 이 벤치마크는 H100 및 B200 GPU에서 GEMM 및 어텐션 워크로드에 걸쳐 기능적 정확성, 대상 명령어 실행 여부, 그리고 선도 라이브러리에 대한 속도 향상을 측정합니다.
평가 결과, 아키텍처별 PTX 활용 능력은 균일하지 않다는 점이 드러났습니다. 특히 복잡한 어텐션 역방향 워크로드에서는 성공률이 크게 떨어지며, 대상 명령어를 실행한다고 해서 반드시 경쟁력 있는 성능으로 이어지지 않는 것으로 나타났습니다. 또한, 평가된 모델 중 어느 것도 전체 테스트에서 선도 라이브러리와 일관되게 일치하지는 않았습니다.
연구진은 Qwen3.6-27B 모델을 지도 미세 조정(supervised fine-tuning)을 사용하여 추가로 적응시켰습니다. 이 과정에서 복구 조건부 훈련(repair-conditioned training)은 여러 작업에서 개선을 보였지만, 일반화 능력은 여전히 불균일했습니다. 데이터의 커버리지, 균형, 그리고 추론 교사(reasoning teacher)의 품질이 데이터셋 크기만큼이나 중요한 요소로 작용했습니다.
PTXBench는 LLM이 진화하는 GPU 아키텍처를 활용하는 능력을 측정하고 개선하기 위한 검증 가능한 테스트베드를 제공합니다. 이는 LLM이 GPU 아키텍처의 변화에 더 잘 적응하도록 돕는 데 중요한 기반이 될 것입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-18
Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun
수집 2026-08-19 16:10