대화형 LLM을 위한 메모리 시스템 평가는 기존의 직접적인 사실 탐색 질문(Direct QA)에 의존해 왔습니다. 이는 모델이 이전 대화에서 특정 사실 X를 얼마나 잘 회상하는지를 측정하는 방식입니다. 연구진은 4개월간의 배포에서 사용자 만족도와 직접 QA 정확도 간의 상관관계를 테스트했으며, 기존 벤치마크인 직접 QA 정확도가 19.7%에서 70.1%까지 다양했음에도 사용자 만족도는 변하지 않았음을 발견했습니다.
연구진은 기존 벤치마크와 사용자 만족도가 서로 다른 능력을 측정하고 있다고 가정합니다. 즉, 벤치마크는 질문에 대한 회상(elicited retrieval)을 측정하는 반면, 실제 대화는 관련성을 감지하고 이전 맥락을 자연스럽게 응답에 통합하는 자연스러운 통합(natural integration) 능력을 요구합니다. 이 간극을 조사하기 위해 연구진은 배포에서 추출한 실제 사용자 기반의 메모리 순간들을 점수화하는 MemUse를 도입했습니다.
MemUse는 자연스러운 대화 응답에 대한 통합 인식 기반 판단을 통해 메모리 순간을 평가합니다. 흥미로운 점은 모델과 맥락을 고정했을 때, 직접 QA에서 78.8%를 기록한 시스템이 실제 대화에서는 해당 사실의 7.9%만을 참조한다는 것입니다. 이는 71점의 격차를 의미하며, 자연스러운 통합 능력은 사용자 만족도와 관련이 있지만 직접 QA 정확도는 만족도와는 관련이 없음을 보여줍니다.
연구진은 이 배포 코퍼스와 MemUse 점수 및 평가 프롬프트를 GitHub에서 공개했습니다. 이는 메모리 시스템 평가가 단순한 사실 회상에서 실제 대화 맥락 통합으로 확장되어야 함을 시사하며 개발자들이 메모리 시스템의 실제 성능을 평가하는 데 새로운 기준을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Ryuichi Sumida, Koji Inoue, Tatsuya Kawahara
수집 2026-08-27 01:07
거대 언어 모델(LLM) 에이전트는 다중 역할 및 다단계 워크플로우를 통해 복잡한 작업을 조정합니다. 이 과정에서 상위 상태는 요약, 계획, 메모, 전달 노트와 같은 중간 언어 아티팩트로 반복적으로 변환되어 하위 구성 요소가 작동하는 데 사용됩니다. 연구는 이러한 상태 보존을 운영 상태 보존(operational state preservation)으로 정의하며, 이는 행동 제약 상태를 유지하는 역할을 의미합니다.
안전 차단기(Safety blockers)는 각 소스 상태가 명시적인 전제 조건, 권한, 대체 경로 및 실행 결과를 갖도록 하여 통제된 인스턴스를 제공합니다. 실험 결과, 직접 전달 제어는 모든 차단기를 보존하지만, 압축, 계획 동화, 수렴 등의 변환은 제약 상태를 단순한 주의 사항이나 비구속적인 고려 사항으로 반복적으로 바꿉니다.
일반적인 전달 압축은 100.0% 비활성화와 54.2% 금지된 행동을 초래합니다. 모든 네 가지 상태 필드를 복원하면 보존율이 100.0%로 증가하고 금지된 행동이 0.0%로 감소합니다. 이는 정보 추출과 행동 사이에 상태 전송 실패가 있음을 시사하며, 의미적 가용성이 운영 상태 보존을 보장하지는 않는다는 것을 보여줍니다.
결론적으로, 전달 변환은 상태 내용을 유지하면서 하위 행동에 대한 제약을 약화시킬 수 있습니다. 따라서 LLM 에이전트 시스템에서 정보 추출과 행동 간의 상태 전송 실패를 인지하고, 상태 보존과 안전 차단기 내포를 분리하는 것이 중요합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Yiheng Sun, Huifei Wang, Yancheng Zhu, Zhenyu Li, Zebin Zhao, Yifan Yuan
수집 2026-08-26 20:04
절차적 비디오-언어 모델은 행동 인식, 예측, 절차 예측 등 동일한 시각적 증거로부터 이질적인 작업을 해결해야 합니다. 현재의 밀집 트랜스포머 디코더는 모든 작업에 걸쳐 동일한 피드포워드 네트워크를 공유하기 때문에 작업 간의 행동이 얽히고 제어된 능력 확장이 어려워집니다.
희소 혼합 전문가(MoE) 디코더는 조건부 계산을 제공하지만, 토큰 수준으로 학습된 라우팅이 작업 수준의 절차적 목표와 자연스럽게 정렬되지 않는 한계가 있습니다. 이에 연구진은 대규모 언어 모델의 피드포워드 네트워크를 작업별 전문가로 변환하면서 멀티모달 백본은 공유하는 디코더 아키텍처인 MoTE(Mixture of Task Experts)를 제안했습니다.
MoTE는 각 예제가 하나의 샘플 수준 작업 경로를 따르도록 설계되어, 활성화되는 작업-전문가 계산이 저장된 작업 전문가의 수와 독립적으로 유지됩니다. VideoLLM-MoTE로 구현된 이 모델은 다섯 가지 COIN 벤치마크에서 명시적인 작업 경로를 사용하여 평가되었습니다.
이 다섯 전문가 모델은 샘플당 약 20억 개의 LLM 파라미터를 활성화하며 최근 VideoLLM 기준선보다 더 높은 평균 top-1 정확도를 달성했습니다. 또한 동일한 전문가 토폴로지 하에서 밀집한 전체 전문가 활성화 및 학습된 희소 라우팅 제어보다 성능이 향상되었습니다. 이는 작업 구조화된 라우팅이 멀티태스킹 비디오-언어 학습을 위한 해석 가능하고 계산 효율적인 디코더 대안을 제공함을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker
수집 2026-08-26 12:58
월 액션 모델(WAM)은 관측의 변화를 모델링하여 로봇 제어를 개선하지만, 테스트 시 미래 관측을 생성하는 과정에서 상당한 지연 시간이 발생합니다. 이러한 비효율성을 해결하기 위해 Fast-WAM은 이 과정을 제거하지만, 희소한 로봇 시연이나 분포 외(out-of-distribution) 시나리오에서 미래 인식에 대한 일반화 성능이 미래를 고려하는 대안보다 낮다는 문제가 있습니다.
이러한 격차를 해소하고자 연구진은 **LAWA**라는 WAM 아키텍처를 제안했습니다. LAWA는 미래 관측을 생성하지 않고도 효율적인 테스트 시간 미래 상상(future imagination)을 가능하게 하기 위해, 압축된 잠재 행동(latent actions)을 미래 의도의 작동 표현으로 사용합니다. 구체적으로, 행동 없는 사전 학습으로 향상된 이산 토크나이저를 통해 조작 중심의 코드북 목표를 생성하며, 추론 시 미래 비디오 브랜치를 생략하고 실행 가능한 행동 청크와 연결된 연속 잠재 상태를 정제합니다.
RoboCasa 환경에서 LAWA는 이 목표를 달성했습니다. LAWA는 몇 가지 시연 데이터와 전체 데이터 설정 모두에서 최고 수준의 평균 성공률 65.6%와 80.8%를 달성하며, Fast-WAM 기준 대비 각각 9.6%와 4.5%p 향상되었습니다. 또한 LAWA는 42.9% 낮은 추론 지연 시간을 요구하면서도 일치하는 Joint-WAM 변형 모델의 성능 수준을 유지합니다.
LAWA는 LIBERO-Plus에서 경쟁력 있는 제로샷 견고성을 입증하고 실제 작업에서 우수한 성능을 보여줍니다. 이는 미래 상상을 포기할 필요가 없으며, 압축된 잠재 행동을 통해 성능, 일반화 능력, 지연 시간 사이에 효과적인 균형점을 찾을 수 있음을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding
수집 2026-08-26 09:56
소프트웨어 개발자로서 인공지능(AI)의 급증은 기술적, 철학적 차원에서 강한 우려를 낳고 있습니다. 개발자들은 문제를 해결하는 과정에서 얻는 성취와 즐거움을 중요하게 여기는데, AI가 이러한 독립적인 사고 과정을 대체할 위험이 있다는 점이 핵심적인 문제로 지적됩니다. AI는 단순히 코드를 생성하는 것을 넘어, 개발자가 스스로 문제를 해결하고 사고하는 과정을 생략하게 만들어 인간의 독립적인 사고 능력을 위협할 수 있습니다.
AI 기술은 막대한 에너지와 자원을 소모하며 기후 변화와 같은 환경 문제와 깊이 연결되어 있습니다. 저자는 AI가 자원 소비의 측면에서 인류와 지구 전체가 감당할 수 없는 수준이며, 이는 인간 중심의 경제 시스템이 자연 환경과 자원을 무시하고 효율성과 이윤만을 추구하는 방식으로 설계되었기 때문이라고 주장합니다. 이러한 AI의 발전은 환경 파괴의 근본 원인인 인간의 행위와 밀접하게 연결되어 있습니다.
현대 사회는 협력과 관용 대신 경쟁과 개인적 이익을 우선시하며 권력이 부와 이윤을 추구하는 자들에게 집중되는 방식으로 변화했습니다. 저자는 AI가 이러한 권력 집중의 궁극적인 표현이며, 시장과 세계 질서를 인간 중심이 아닌 이윤 중심으로 재편해야 한다고 강조합니다. 따라서 개발자와 사회는 AI가 초래하는 이러한 모순을 인식하고, 기술의 방향을 재설정하며 생태학적 우선순위를 확보해야 합니다.
Hacker News
의견
발행 2026-08-25
alesrosa
수집 2026-08-26 09:56
비디오 게임 영상은 다양한 환경과 복잡한 상호작용을 제공하여 비디오 월드 모델 훈련을 위한 확장 가능한 데이터 소스를 제공합니다. 하지만 원본 게임 플레이 영상에는 화면 공간 인터페이스가 포함되어 있어 게임 고유의 편향과 관련 없는 동역학이 도입되어 월드 모델 훈련을 방해합니다.
이 문제를 해결하기 위해 연구진은 게임 UI의 접지 및 제거를 형식화하는 전체 스택 프레임워크인 GameUI-Taxonomy와 G2WEngine을 제안했습니다. G2WEngine은 실제 게임 플레이 영상에서 재사용 가능한 UI 에셋을 자동으로 추출하고 깨끗한 영상에 시간적으로 일관성 있는 UI 오버레이를 합성합니다. 이를 통해 303개 게임의 1,079개의 실시간 클립과 96K개의 합성 쌍 비디오로 구성된 Game2World를 구축하여 현실적인 평가를 가능하게 했습니다.
Game2World를 기반으로 제안된 GameCleaner는 멀티모달 의미론적 이해와 비디오 편집 기능을 결합하여 마스크 없는 게임 플레이 UI 제거 모델입니다. 이 모델은 마스크 기반 방법과 달리 배경 장면 내용과 시간적 동역학을 보존하면서 다양한 HUD 요소를 직접 식별하고 제거합니다. UI가 제거된 게임 플레이로 훈련된 월드 모델은 UI가 오버레이된 데이터로 훈련된 모델보다 전체 VideoReward를 6.83% 향상시켰습니다.
UI 제거 평가에서 GameCleaner는 합성 비디오에서 평균 AAR 95.36을 달성했으며, 이는 가장 강력한 시간적 마스크 기준선보다 57.3% 높은 수치입니다. 또한 실시간 평가에서는 배경 보존율 99.8%와 함께 가장 우수한 AAR 80.05를 얻었습니다. 이 결과는 인터넷 게임 플레이 영상을 고품질 월드 모델 훈련 데이터로 변환할 수 있는 확장 가능한 잠재력을 보여줍니다. 관련 코드, 데이터셋, 모델은 GitHub에서 공개되어 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Wenxuan Shen, Dongna Jin, Dongping Chen
수집 2026-08-26 05:54
모폴로지 변환은 형태 및 마스크 처리를 위한 오랜 도구이지만, 파이썬 생태계의 사실상의 참조 구현체인 scipy.ndimage는 CPU 전용이며 단일 배열로 구성되어 있어 GPU 훈련 루프 내에서 비용이 많이 드는 장치-호스트 왕복 과정 없이 사용하기 어렵습니다. 기존 PyTorch 기반 GPU 비전 라이브러리들은 이러한 연산 중 좁은 범위만 다루며, 일반적으로 두 차원의 공간과 평탄한 구조화 요소로 제한됩니다.
이러한 격차를 해소하기 위해 TorchMorph라는 경량 PyTorch 확장이 발표되었습니다. TorchMorph는 22개의 공개 연산자를 노출하며 이진 모폴로지, 그레이스케일 모폴로지, 거리 변환, 엔트로피 정규화 최적 수송 등 다양한 변환을 포함합니다. 이 모든 연산은 (B, C, Spatial...) CUDA 텐서에 직접 작동하는 융합된 CUDA 커널로 구현되어 최대 여덟 개의 공간 차원을 처리할 수 있습니다.
TorchMorph의 API는 scipy.ndimage와 동일하게 인자별로 설계되어 있어 기존 파이프라인을 쉽게 포팅할 수 있습니다. 성능 측면에서 TorchMorph는 단일 스레드 CPU 참조 대비 그레이스케일 모폴로지에서 최대 1,100배, 정확한 유클리드 거리 변환에서 최대 350배의 처리량을 달성합니다. 또한 Sinkhorn 솔버는 POT 대비 최대 42배 빠르게 실행됩니다.
이진 및 참퍼 연산자는 SciPy의 대응물과 정확히 일치하며, 모든 부동 소수점 연산자는 CPU 참조와 1.8e-6의 절대 오차 이내에서 일치합니다. TorchMorph는 MIT 라이선스로 공개되어 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Kai Zhao
수집 2026-08-26 03:53
범용 멀티모달 임베딩은 검색, 추천, 분류, 에이전트 시스템 등 다양한 애플리케이션에서 이질적인 콘텐츠를 공유된 공간에 표현할 수 있게 하여 현대 AI 시스템의 핵심 요소가 되고 있습니다. 본 보고서는 텍스트, 이미지, 비디오, 시각 문서 등 다양한 멀티모달 입력을 지원하는 WeMM-Embedding 모델 패밀리를 소개하며, 이는 유연한 출력 차원을 제공합니다.
이 모델 패밀리는 2B, 4B, 9B 변형으로 구성되어 있으며, 대규모 멀티모달 정렬 단계와 정제 단계(큐레이션 데이터, 세밀한 관련성 감독, 스케일 간 지식 전이 사용)의 두 단계로 훈련되었습니다. 광범위한 평가 결과, WeMM-Embedding은 여러 공개 벤치마크에서 선두적인 성능을 달성했습니다. 특히 2B 변형은 MMEB-v2에서 기존 선두 모델인 8B 오픈소스 기준을 능가했으며, 9B 변형은 새로운 최고 점수인 80.6의 전체 점수를 기록했습니다.
또한 WeMM-Embedding은 위챗 애플리케이션 전반에서 강력한 실용적 성능을 입증했습니다. 이는 자체 26개 태스크 벤치마크에서 상당한 개선을 보였으며 14개의 온라인 A/B 테스트에서 일관된 향상을 보였습니다. 이 모델은 위챗 채널, 공식 계정, 모먼트, 전자상거래 서비스를 포함한 추천 및 검색 애플리케이션에 대규모로 배포되었습니다.
연구를 촉진하기 위해 모델 가중치와 코드가 공개되었으며, 자세한 내용은 https://github.com/Tencent/WeMM-Embedding에서 확인할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu
수집 2026-08-26 03:53
스마트 글래스는 단순한 캡처 및 디스플레이 액세서리를 넘어 인간의 지각, 지속적인 맥락, 그리고 디지털 또는 물리적 행동을 연결하는 일인칭 지능 플랫폼으로 발전하고 있습니다. 이러한 장치는 착용자의 시각, 청각, 움직임, 손-물체 상호작용에 맞춰 신체에 위치하지만, 에너지, 열, 개인 정보 보호, 피드백 제어라는 엄격한 제약 조건 하에서 작동해야 합니다.
최근 증강 현실, 시점 기반 시각, 멀티모달 모델, 그리고 체화된 지능 분야에서 빠르게 발전하고 있음에도 불구하고, 관련 연구는 장치, 작업, 벤치마크에 따라 파편화되어 있습니다. 핵심 과제는 모델이 고립된 상태에서 인식, 답변, 기억, 행동을 수행할 수 있는지 여부가 아니라, 완전한 시스템이 신뢰할 수 있고 시간적으로 유효하며 수정 가능하고 통제 가능한 지각-상태-상호작용-행동 루프를 지속할 수 있는지 여부입니다.
본 연구는 이러한 스마트 글래스를 통일된 프레임워크를 통해 체계적으로 연구하는 최초의 사례입니다. 연구진은 일인칭 데이터 흐름과 제약된 작업 유용성을 정식화하고, 장치의 여덟 가지 검증 가능한 하드웨어 능력 축을 따라 장치를 특성화하며, 캡처, 반응적 지각, 맥락적 지원, 지속적인 상태, 통제된 행동, 체화된 결합을 포괄하는 L0에서 L5까지의 프레임워크를 도입했습니다.
또한 연구는 아홉 가지 응용 시나리오를 통해 작업과 데이터셋, 시스템, 제품, 이해관계자, 실패 결과, 증거 격차를 연결하며, 아홉 차원 배포 프레임워크, 주장 조건화 평가 프로토콜, 그리고 통제된 측정부터 장기적인 현장 검증 및 감사에 이르는 증거 사다리를 제시합니다. 이 모든 요소는 스마트 글래스를 더욱 비교 가능하고 배포 가능하며 재현 가능하게 만들고, 신뢰할 수 있는 일인칭 지능을 향한 로드맵을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Jiangning Zhang, Haojun Chen, Yong Liu
수집 2026-08-26 03:53
결과 기반 탐색 에이전트는 증거를 검색하는 방법을 학습하지만, 최종 보상은 중간 오류를 국소화하거나 오류가 누적되기 전에 진행 중인 궤적을 수정하지 못하는 한계를 가지고 있습니다. 이 문제를 해결하기 위해 본 연구는 교정 피드백을 학습된 궤적 개입으로 간주하여 에이전트와 비평가 역할을 결합하는 CAFE(Coupled Agent--Feedback Evolution) 프레임워크를 제안합니다. CAFE는 공유 파라미터 모델이 탐색 에이전트와 비평가 역할을 번갈아 수행하도록 설계되었으며, 에이전트의 실패를 기반으로 피드백 조건화 복구를 초기화한 후 온라인 및 오프라인 최적화를 결합합니다.
온라인 강화 학습 과정에서 CAFE는 프롬프트 수준의 호출-건너뛰기 성공 격차를 사용하여 요청 반환을 조정하는 비교 피드백 추정치를 사용하며, 피드백 인식 이점 형성(feedback-aware advantage shaping)을 통해 토큰 이점을 재가중합니다. 또한 오프라인에서는 성공적 및 실패한 궤적을 학습하여 피드백을 학습하는 방식으로 선호도 기반 최적화를 수행합니다.
일곱 가지 에이전트 탐색 벤치마크에서 CAFE는 평가된 강화 학습 기반 탐색 에이전트보다 평균적으로 우수하며, 여섯 가지 도메인 외 벤치마크 전반에서 이 이점을 유지하고 답변 수준의 환각 현상을 감소시킵니다. 단측 제거 분석 결과, 에이전트나 비평가 중 하나만 개선하는 것은 성능이 정체되는 반면, 두 역할을 번갈아 업데이트하는 것이 지속적으로 성능을 향상시킵니다. 이러한 결과는 자기 개선형 탐색 에이전트가 자신이 안내하는 정책과 함께 진화하는 피드백을 필요로 한다는 점을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Boyang Liu, Senjie Jin, Peixin Wang, Zhangyue Yin, Yibo Wang, Yuhao Zhou, Xinbing Liang, Shizheng Zhu, Yuhui Wang, Jingqi Tong, Zhiheng Xi, Jiazheng Zhang, Clive Bai, Clarenceai, Blaze Chen, Tao Gui, Qi Zhang, Xuanjing Huang
수집 2026-08-26 02:52
자기 개선 LLM 에이전트는 결과물 자체를 정제하는 것이 아니라 그 결과를 도출하는 과정을 개선하는 방식으로 발전하고 있습니다. 기존의 시스템들은 안정성을 유지하기 위해 자체 편집 메커니즘의 일부를 보존해야 했기 때문에, 달성할 수 있는 메타 깊이(meta-depth)는 대략 두 수준으로 제한되었습니다.
이에 따라 연구진은 메타 연산($\Omega$)을 고정하고 입력에 대해 재귀적으로 작동하는 Meta^n을 제시했습니다. 이 $\Omega$ 연산은 자신의 산출물에 반복적으로 적용되며, 아래에 있는 솔버 스택의 흔적과 해당 코드를 읽은 다음, 다음 레이어를 전략적 전처리 및 호출 가능한 도우미 라이브러리로 작성합니다. $\Omega$가 변경되지 않기 때문에 시스템을 불안정하게 만들지 않으며, 입력이 엄격하게 증가함에 따라 각 레이어는 이전 레이어보다 더 높은 관점에서 추론하게 됩니다.
깊이는 미리 고정되는 것이 아니라 수렴을 통해 설정되며, 진화 아카이브는 레이어 체인을 탐색합니다. 이 접근 방식은 두 개의 백본을 통해 Meta^n이 이전의 자기 개선 에이전트들보다 여덟 가지 벤치마크 패밀리 모두에서 더 우수한 성능을 보였습니다. 특히 기술 습득에 저항하도록 구축된 ARC-AGI-2 사례에서 Meta^n은 단독으로 0 이상의 점수를 기록했습니다.
분석 결과에 따르면 재귀를 통해 얻는 대부분의 이득은 각 레이어가 다음 레이어에 전달하는 조건화에서 나오며, 깊이가 증가함에 따라 프롬프트에 의해 명시되지 않았음에도 불구하고 뚜렷한 레이어 역할이 나타납니다. 이 연구는 자기 개선 시스템의 깊이를 확장하고 안정성을 확보하는 새로운 방법을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Zae Myung Kim, Young-Jun Lee, Seungyeon Jwa, Dongyeop Kang
수집 2026-08-26 02:52
확산 모델에서 강화 학습을 사용하여 인간 선호도와 특정 목표에 모델을 정렬할 수 있지만, 최종 보상(endpoint rewards)은 중간 노이즈 제거 예측이 어떻게 변화해야 하는지를 명시하지 못한다는 한계가 있습니다. 이에 연구진은 이미지 수준의 보상 지침을 샘플링된 쿼리에 대한 깨끗한 출력 예측을 위한 명시적인 목표로 변환하는 온-폴리 정책 자기 증류 프레임워크인 DiffusionOPSD를 제안합니다.
DiffusionOPSD는 각 외부 반복에서 고정된 행동 정책이 궤적과 쿼리 상태 및 앵커를 생성하고, 보상 기울기를 사용하여 각 앵커 주변에 유한한 양의 양수 및 음수 목표를 구성합니다. 이후 학습 가능한 정책은 이 목표들을 분리된 감독(detached supervision)으로 적분하여 행동 정책을 업데이트합니다. 이 설정은 목표 구성과 실제 구현을 분리하여 측정할 수 있게 합니다.
실험 결과, 더 큰 목표 구성 이득이 단일 적합 업데이트 후 실제 이득 증가로 반드시 이어지지 않는다는 점을 확인했습니다. 이 방법은 SD 3.5-M 및 Z-Image-Turbo에서 DiffusionNFT 대비 훈련 GPU 시간을 각각 40% 및 63% 절감하며, 가장 강력한 경쟁 방법보다 최대 44.0% 더 나은 성능을 달성했습니다. 이는 이미지 수준의 보상 지침을 명시적이고 지속적으로 새로 고쳐지는 중간 감독으로 변환함으로써 확산 모델의 훈련 후 정렬을 위한 효율적이고 분석 가능한 접근 방식을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang, Yongyuan Liang, Xiaoxia Hou, Ye Tian, Xian Sun, Yingshuo Wang, Linfeng Li, Shengqiong Wu, Leigang Qu, Feng Li, Wei Liu, Julian McAuley, Tat-Seng Chua
수집 2026-08-26 02:52
강화 학습과 검증 가능한 보상(RLVR) 및 온-폴리 학습 증류(OPD)는 사전 학습된 대규모 언어 모델을 위한 두 가지 널리 채택된 패러다임입니다. 하지만 RLVR은 희소한 작업 수준 피드백의 한계를 가지며, OPD는 밀도 높은 토큰 수준 지침을 제공하지만 궤적의 정확성을 무시하여 교사 모델의 성능에 국한됩니다. 따라서 이 둘을 결합하는 것이 유망한 방향이지만, 기존의 통합 방식은 가중치 조합이나 휴리스틱 전환에 의존하여 추가적인 하이퍼파라미터와 트레이드오프를 발생시킵니다.
이에 연구진은 하이퍼파라미터를 추가하지 않고 OPD와 RLVR을 원활하게 결합하는 간단하면서도 효과적인 방법인 온-폴리 증류와 검증 가능한 보상(OPDVR)을 제안합니다. 이 방법은 샘플링된 토큰 OPD의 암묵적 보상을 궤적 정확도에 기반하여 재정의하고, ReLU 게이팅 메커니즘을 적용하여 정확한 궤적에는 비음수 보상을, 부정확한 궤적에는 음수 보상을 부여합니다. 이는 증류 신호를 작업 성공과 일치시키면서 교사 모델의 분포적 지침을 보존합니다.
또한, 이 수정은 샘플링된 토큰 OPD를 적절한 RLVR 방법으로 변환하여 GRPO와 같은 모든 정책 경사 알고리즘과 쉽게 결합할 수 있게 합니다. 여섯 가지 추론 벤치마크에 대한 실험 결과, OPDVR은 표준 OPD보다 일관되게 더 우수한 성능을 보였습니다. 관련 코드는 https://github.com/LeapLabTHU/OPDVR에서 확인할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-25
Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang
수집 2026-08-26 02:52
실행 가능한 실행 파일이 SQLite 데이터베이스로 작동할 수 있다는 개념이 개발자들 사이에서 주목받고 있습니다. 이는 프로그램이 실행되는 동안 자신의 상태를 파일 내에 저장하고 트랜잭션 방식으로 관리할 수 있게 하여, 별도의 파일 시스템 공간 없이 모든 애플리케이션의 상태를 단일 파일에 압축할 수 있게 합니다.
이러한 아이디어는 SELF라는 개념으로 구현되었는데, 이는 웹 서버인 self-httpd가 실행 파일 자체를 SQLite 데이터베이스로 사용하여 웹사이트 정보, 라우트, 방문 기록, 버튼 누름 기록 등 모든 상태를 저장하는 증명 개념입니다. 실행 파일이 데이터베이스가 됨으로써, 프로그램은 자신의 상태를 파일 내에서 직접 읽고 쓸 수 있게 되어 /var나 /tmp와 같은 별도의 공간이 필요 없어집니다.
핵심은 커널의 binfmt_misc 지원을 통해 실행 파일이 인터프리터를 실행하고 프로그램이 자신의 파일에 접근하여 쿼리할 수 있도록 허용하는 데 있습니다. 이는 프로그램이 실행 파일 자체를 데이터베이스로 인식하고 자신의 세그먼트 테이블이나 새로운 테이블을 읽고 쓸 수 있게 하여, 배포 시 데이터 마이그레이션까지도 파일 내의 INSERT 문으로 처리할 수 있게 합니다.
결론적으로 실제 쿼리 가능한 실행 파일은 배포를 단일 파일 복사(scp)로 단순화하고, 프로그램과 데이터가 동일한 파일에 묶여 있어 시스템 전체를 더 효율적으로 관리할 수 있는 미래의 실행 파일 형태로 주목받고 있습니다.
Hacker News
논문
발행 2026-08-25
rguiscard
수집 2026-08-26 01:51
레노보가 레지온 고(Legion Go) 장치에서 발생한 기기 고장 문제를 공식적으로 인정했습니다. 게이머들이 바이오스 업데이트 이후 기기가 벽돌(bricked)이 되거나 높은 수리 비용을 지불해야 하는 상황을 보고한 데 이어, 레노보는 해당 문제에 대해 공식 입장을 밝혔습니다.
이는 사용자가 소프트웨어 업데이트로 인해 기기가 손상되었을 때 제조사가 책임지고 수리 비용을 부담해야 하는지에 대한 논쟁을 촉발시킵니다. 레딧 사용자들은 바이오스 업데이트 후 기기 손상 및 높은 수리 비용에 대한 보고를 했으며, 이에 대해 레노보는 고객 지원팀에 연락하고 전원 버튼을 길게 누르는 방법을 시도해 보라고 안내했습니다.
레노보는 이 문제를 인지하고 있으며, 사용자들에게 해결 방법을 제시했지만, 기기 고장 발생 시 소프트웨어 업데이트의 책임 소재와 보상 범위에 대한 구체적인 정책은 여전히 불분명한 상태입니다. 따라서 사용자는 공식적인 지침을 따르면서도 기기 안정성과 소프트웨어 업데이트 정책에 대해 추가적인 정보를 확인해야 합니다.
The Verge
뉴스
발행 2026-08-24
Sean Hollister
수집 2026-08-25 00:35
극지방을 제외한 전 세계 해양의 평균 수온이 토요일 21.1°C에 도달하여 관측 사상 최고치를 기록했습니다. 이러한 기록은 인간이 초래한 기후변화와 엘니뇨의 영향이 복합적으로 작용하고 있음을 보여줍니다.
이번 기록은 Copernicus가 부표, 선박, 위성을 통해 측정한 수심 10m 자료를 종합하여 도출되었습니다. 이처럼 광범위한 해양 데이터를 결합함으로써 해양 온도 변화에 대한 보다 정확한 이해를 돕고 있습니다.
해양 온도 상승은 기후변화의 심각성을 나타내는 중요한 지표이며, 이는 해양 생태계와 전 지구적 시스템에 광범위한 영향을 미칩니다. 특히 엘니뇨와 같은 자연적 기상 현상과의 결합은 해양 시스템의 복잡성을 더욱 증가시키고 있습니다.
이러한 기록은 2024년 3월에 세 차례 반복되어 발생한 것으로, 해양 온도 변화 추이를 지속적으로 모니터링하는 데 중요한 참고 자료가 됩니다.
GeekNews
뉴스
피드 등록 2026-08-24
neo
수집 2026-08-25 01:35
스마트 링 제조사인 오라(Oura)가 9월에 기업공개(IPO)를 추진하며 160억 달러 이상의 가치를 기대하고 있다는 보도가 나왔습니다. 블룸버그에 따르면 오라는 향후 한 달 내에 30억 달러를 모금할 계획이며, 이를 통해 900명 이상의 직원을 보유한 회사의 가치를 160억 달러 이상으로 평가받고자 합니다. 이는 지난 9월 피델리티 등으로부터 8억 750만 달러의 시리즈 E 라운드를 마쳤을 때의 109억 달러 가치에서 엄청난 상승을 의미합니다.
웨어러블 기기 시장이 빠르게 포화됨에 따라 오라의 경쟁 구도가 더욱 치열해지고 있습니다. 오라의 주요 경쟁자로는 자체적으로 진화하여 호르몬 추적 및 혈액 패널 테스트 기능을 추가하며 가치를 100억 달러로 끌어올린 핏빗(Whoop)과 삼성의 갤럭시 링 등이 있습니다. 오라는 바이오해킹 CEO를 위한 틈새시장에서 벗어나 수면 및 회복 브랜드로 확장하는 데 성공했습니다.
하지만 오라의 최근 행보에는 논란도 함께 따라왔습니다. 최근 샌프란시스코에서 제기된 집단 소송은 오라가 수면 추적 기능의 정확성에 대해 소비자들을 오도했다고 주장하며 제기되었습니다. 소송에서는 오라가 수면 단계 측정에 대해 병원이나 임상 환경에서만 가능한 전극과 센서를 사용하지 않고 있다고 비난했습니다.
이에 대해 오라 측은 반박하며 수면 단계 측정은 다중수면검사(polysomnography)와 비교하여 여러 연구에서 입증되었으며 제3자 연구를 통해 정확성이 입증되었다고 주장했습니다. 오라는 이러한 주장에 대해 법적 절차에서 방어할 것이라고 밝혔습니다.
TechCrunch
뉴스
발행 2026-08-24
Connie Loizos
수집 2026-08-24 23:34
Bookshelf는 객체 스토리지 위에서 실행되는 자체 호스팅 전자책 라이브러리로, 데이터베이스 없이 EPUB 및 PDF 파일을 관리하고 브라우저에서 직접 읽을 수 있게 해주는 프로젝트입니다. 이 라이브러리는 Cloudflare Worker를 이용한 R2 스토리지 기반 또는 디스크의 디렉토리를 이용하는 Node 서버 기반으로 구현될 수 있어 다양한 환경에서 배포가 가능합니다.
이 프로젝트의 핵심은 파일 시스템(FS) 제공자를 스토리지 공급자로 활용하는 데 있습니다. 개발자는 R2와 같은 객체 스토리지나 로컬 디렉토리를 저장소로 사용하여 책 파일과 읽기 기록을 관리하며, 이는 확장성과 비용 효율성을 높이는 아키텍처를 제시합니다. 사용자는 프로필 기능을 통해 북마크를 관리할 수 있지만, 인증은 제공되지 않으며 동시 읽기는 마지막 쓰기 승리(last-write-wins) 방식으로 처리됩니다.
Bookshelf는 Docker를 사용하거나 호스트 시스템의 디렉토리를 직접 바인드 마운트하여 실행할 수 있는 유연한 배포 방식을 제공합니다. 개발자는 저장소 제공자로서의 계약을 통해 다양한 스토리지 옵션을 탐색하고, 테스트 및 빌드 과정을 통해 라이브러리를 배포하는 전체 워크플로우를 경험할 수 있습니다.
Hacker News
튜토리얼
피드 등록 2026-08-24
arbayi
수집 2026-08-25 00:34
시스템 설계 흐름을 실제로 따라갈 수 있는 다이어그램 도구인 Flostep이 공개되었습니다. 이 도구는 프론트엔드, 서비스, 데이터베이스 등의 구성 요소를 드래그 앤 드롭으로 연결하고 각 상호작용을 단계별로 표시하여 시스템 디자인 흐름을 빠르고 명확하게 스케치하고 공유할 수 있게 합니다. 사용자는 POST /login과 같은 구체적인 액션 라벨링을 통해 시스템의 작동 방식을 시각화하고, 다음 단계로 넘어가는 방식으로 설계 과정을 실제로 걸어볼 수 있습니다.
Flostep은 단순한 다이어그램을 넘어 설계 검토, 신규 엔지니어 온보딩, 그리고 비동기 설계 리뷰에 최적화되어 있습니다. 공유 링크는 계정 없이도 누구나 따라갈 수 있으며, Notion이나 Confluence 같은 곳에 iframe 형태로 삽입하여 전체 상호작용 흐름을 임베드할 수 있습니다. 또한 다이어그램 옆에 트레이드오프나 발견 사항을 기록할 수 있는 노트 패널이 있어 설계 맥락을 보존하는 데 도움을 줍니다.
특히 Flostep은 AI 통합을 지원하는 MCP(Model Context Protocol) 서버로 작동하여 개발 생산성을 높입니다. Claude, Cursor, VS Code와 같은 AI 도구들이 코드나 설명만으로 시스템 다이어그램을 생성하고 편집할 수 있게 하며, 사용자는 AI에게 특정 기능의 흐름을 요청하거나 중간 단계를 추가하도록 지시할 수 있습니다. 이는 시스템 설계 인터뷰나 아키텍처 스파이크 작업 시 빠르고 정확한 시각화와 협업을 가능하게 합니다.
Flostep은 무료 플랜을 제공하며, 사용자는 별도의 계정 없이 즉시 시작하여 시스템 설계 흐름을 구축하고 공유할 수 있습니다. 이 도구는 복잡한 시스템 디자인을 단계별로 이해하고 팀원들과 효율적으로 소통해야 하는 개발자들에게 실질적인 가치를 제공합니다.
Hacker News
튜토리얼
피드 등록 2026-08-24
pandurang90
수집 2026-08-25 01:35
Apple은 Sign in with Apple을 위한 새로운 도메인을 도입하며 이메일 전달 시스템에 업데이트를 제공합니다. 2026년 8월 24일부터 기존에 `privaterelay.appleid.com`에서 발급되던 새로운 Sign in with Apple 주소는 `private.icloud.com`에서 발급될 예정입니다.
이러한 변경은 Private Email Relay Service와 관련이 있으며, 기존 주소는 중단 없이 사용자에게 메일을 전달하는 기능을 계속 유지합니다. 다만, iCloud+ Hide My Email 주소는 `icloud.com`에 그대로 유지되므로 이 부분에 대해서는 변경 사항이 없습니다.
앱이나 웹사이트에서 Sign in with Apple을 사용하는 개발자는 이 변경 사항을 반영해야 합니다. 따라서 계정 시스템, 이메일 유효성 검사 로직, 그리고 허용 목록이 새로운 `private.icloud.com` 도메인뿐만 아니라 기존의 `privaterelay.appleid.com` 도메인 주소도 모두 수용하도록 설정해야 합니다.
Hacker News
뉴스
피드 등록 2026-08-24
K7PJP
수집 2026-08-24 22:33