컴퓨터 브랜드 코모도어의 소유권과 역사는 복잡한 법적 분쟁과 변화를 겪어왔습니다. 코모도어는 1976년 잭 트라미엘과 어빙 굴드에 의해 설립되었으며, 코모도어 64와 아미가 시스템을 통해 큰 인기를 얻었으나, 1995년 ESCOM을 거쳐 게이트웨이, 아미가 인크 등 여러 회사에 의해 소유권이 변경되었습니다. 이 과정에서 아미가 운영체제(AmigaOS)의 라이선스 및 상표권 관련 법적 분쟁이 지속적으로 발생했습니다.
이러한 소유권의 혼란 속에서 코모도어는 2010년 코모도어 USA를 통해 하드웨어를 출시했으나 짧은 기간 운영되었고, 이후 아미가 시스템 기반의 레트로 게임 제품들이 라이선스되어 생산되었습니다. 특히 아미가 법인인 클로안토(Cloanto)는 에뮬레이션 패키지 등을 제작하며 브랜드의 여러 측면을 관리해왔습니다.
최근 코모도어는 유튜버 크리스티안 심슨이 주도하는 코모도어 인터내셔널을 통해 브랜드 부활을 시도하고 있습니다. 이들은 향수와 미래를 두 축으로 삼아 FPGA 프로세서를 이용해 원본 하드웨어를 에뮬레이션하는 C64 얼티밋과 같은 제품을 출시했습니다.
현재 코모도어는 이름의 적법성 문제로 이탈리아 회사와 소송을 제기하는 등 법적 이슈를 겪고 있으며, 향후 소셜 미디어 사용을 차단하는 전화기 등 새로운 제품 출시를 계획하고 있습니다.
Hacker News
뉴스
발행 2026-08-17
theanonymousone
수집 2026-08-17 13:32
에어비앤비는 로그인 간격이 길고 사용 환경이 다양한 서비스에서 인증 실패가 예약 및 매출 손실로 이어진다는 문제를 해결하기 위해 인증 방식을 재설계했습니다. 이들은 지난 10년간 누적된 로그인 방식을 'Flexible Authentication'으로 개선하여 사용자 경험과 시스템 안정성을 동시에 확보하고자 합니다.
이 인증 재설계의 핵심 원칙은 'Identify first, then Challenge'입니다. 이는 사용자를 식별하는 과정을 먼저 수행한 후, 필요한 경우에만 추가적인 인증 절차를 요구하는 방식으로 시스템의 효율성과 사용자 편의성을 높이는 데 중점을 둡니다.
이러한 변경은 장기간에 걸쳐 다양한 환경에서 발생하는 인증 실패 문제를 줄이고, 사용자에게 더 매끄러운 인증 경험을 제공함으로써 예약 및 매출 손실을 최소화하는 데 기여할 것입니다. 개발자 관점에서 이는 인증 시스템 설계 시 로그인 간격과 환경 다양성을 고려하여 인증 흐름을 최적화하는 데 중요한 사례를 제공합니다.
GeekNews
분석
피드 등록 2026-08-17
neo
수집 2026-08-17 01:25
AI가 생성하는 랜딩 페이지에서 반복되는 획일적인 디자인 관습을 풍자적으로 다루고 있습니다. 이 글은 AI가 만들어내는 웹사이트들이 사용하는 디자인 패턴과 요소들을 비판하며, 그 안에 내재된 획일성을 지적합니다.
구체적으로는 Instrument Serif, 무작위 이탤릭체, 그리고 과도하게 사용된 긴 대시(em dash)를 전형적인 요소로 꼽아 분석합니다. 이는 AI가 생성한 콘텐츠에서 흔히 발견되는, 의미 없이 사용되는 시각적 장치들을 포착하여 풍자하는 내용입니다.
또한, 이러한 페이지들에서 나타나는 아무 의미 없는 실시간 상태 표시나 `Three · Words · I guess`와 같은 모호한 인터랙션 요소들도 함께 다룹니다. 이는 AI 기반 디자인이 실제 사용자 경험보다는 형식적인 관습에 치우쳐 있음을 보여줍니다.
GeekNews
분석
피드 등록 2026-08-17
neo
수집 2026-08-17 01:25
C3의 목표는 단순히 오늘날 C가 사용되는 영역만을 대체하는 것이 아니라, C의 단순성과 성능에 현대적인 편의성을 더하여 범용 애플리케이션을 만드는 언어를 제공하는 데 있습니다. 이는 C가 주로 운영체제나 임베디드 시스템과 같은 특정 분야에 국한되어 사용되어 왔던 한계를 극복하려는 시도입니다.
과거 1980년대와 90년대에는 C와 Pascal이 애플리케이션 언어로 자리 잡았으나, 당시의 C 대체재들은 주로 운영체제나 임베디드 시스템 개발에 집중되어 있었습니다. 하지만 C3는 이러한 제한적인 사용 범위를 넘어, C의 핵심적인 장점인 단순성과 높은 성능을 유지하면서도 현대 개발 환경에서 요구되는 편의성을 통합하는 것을 목표로 합니다.
따라서 C3는 특정 도메인 대체재를 넘어, 개발자들이 더 넓은 범위의 범용 애플리케이션을 효율적으로 개발할 수 있도록 지원하는 새로운 패러다임을 제시합니다. 이는 C의 강력한 기반 위에서 현대적인 개발 경험을 제공함으로써 소프트웨어 개발의 접근성과 생산성을 향상시키는 데 중점을 둡니다.
GeekNews
분석
피드 등록 2026-08-17
neo
수집 2026-08-17 01:25
독립 위키에 대한 새로운 구글의 ‘감옥’이 생겼습니다. 2024년 3월 구글 코어 업데이트 이후, 신규 도메인으로 시작된 위키들은 구글 검색 결과에서 메인 페이지 외에는 다른 페이지가 노출되지 않는 현상을 겪고 있습니다. 이는 신규 도메인에 대한 구글의 색인 및 크롤링 방식이 변경되면서 발생한 현상으로, 대부분의 신규 위키(약 90%)가 이 문제의 영향을 받고 있습니다.
이러한 현상은 콘텐츠의 중복 문제라기보다는 구글이 신규 도메인의 SEO 스로프를 효과적으로 식별하고 제거하는 데 어려움을 겪는 결과로 보입니다. 결과적으로 신규 도메인의 메인 페이지만이 검색 결과에 노출되어 다른 페이지들이 검색에 제대로 반영되지 않는 상황이 발생합니다.
이러한 ‘구글 감옥’을 우회하기 위해 기존 도메인의 서브도메인을 사용하는 전략이 효과적인 것으로 나타났습니다. 예를 들어, wiki.leagueoflegends.com과 같은 기존 도메인의 서브도메인 위키는 메인 페이지 외의 다른 페이지들이 구글에 성공적으로 색인되는 것을 확인했습니다. 따라서 신규 위키를 운영할 때 도메인 자체보다는 이미 권위가 있는 도메인의 서브도메인을 활용하는 것이 검색 노출에 유리한 전략이 될 수 있습니다.
Hacker News
분석
발행 2026-08-17
pizzaiolo
수집 2026-09-08 06:31
기존 이미지 편집 프레임워크는 텍스트-이미지 확산 모델의 훈련 패러다임을 따르지만, 편집 개념의 세밀함 부족과 희소한 지도 신호로 인한 훈련 비효율성이라는 두 가지 근본적인 문제점을 안고 있습니다. 이 문제를 해결하기 위해 연구진은 1,000개 이상의 세분화된 편집 개념을 포함하는 포괄적인 계층 분류 체계를 구축하고, 개선된 합성 프레임워크를 통해 1200만 개의 고품질 편집 쌍으로 구성된 방대한 데이터셋인 ConceptEdit-12M을 구축했습니다. 이 라이브러리 기반 접근 방식은 생성된 데이터의 분포 붕괴를 효과적으로 해결하면서도 높은 데이터 충실도를 보장합니다.
또한, 연구진은 여러 비간섭 개념을 단일 이미지 쌍으로 합성하는 밀집 지도 학습 전략을 제안했습니다. 이 전략은 모델에 더 풍부한 학습 신호를 제공하여 훈련 효율성과 전체 모델 성능을 크게 향상시킵니다. 실제 훈련 결과는 기존 연구들을 크게 능가하며 이 전략의 효과를 입증했습니다.
마지막으로, 모델의 능력을 광범위한 실제 시나리오에서 진단하도록 설계된 세밀한 평가 모음인 ConceptEdit-Bench를 제시합니다. 이 평가 도구는 이미지 편집 모델의 성능을 정량적으로 분석하는 데 사용될 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang
수집 2026-08-25 03:37
온폴리 정책 증류(OPD)는 학생 정책에서 샘플링된 궤적을 감독하여 교사의 능력을 전달하지만, 그 일반화 행동은 여전히 잘 이해되지 않았습니다. 본 연구는 도메인 분포 변화부터 교차 도메인 전이, 그리고 다중 교사 설정에 이르기까지 여러 일반화 요소를 변화시키며 통제된 연구를 수행했습니다.
연구 결과에 따르면 OPD는 특정 문제에 대한 교사의 답변보다는 교사의 추론 행동을 전달하는 것으로 나타났습니다. 훈련의 어려움은 중요하지 않으며, 심지어 교사가 해결하지 못한 문제도 유용하게 활용될 수 있습니다. 이러한 지식 전이는 교사와 학생 간의 기원 관계에 크게 의존합니다. 동일 기원 쌍은 언어, 추론 지평, 심지어 다른 도메인 전반에 걸쳐 학생을 교사에 가깝게 만듭니다. 반면 교차 기원 쌍은 주로 훈련된 분포에 부합합니다.
이러한 광범위한 도달 범위는 양날의 검과 같습니다. 도메인 전문가에게 프롬프트를 라우팅하여 각 교사의 영향을 제한할 수 없기 때문에, 여러 교사를 결합하면 그들의 능력 사이에 혼합에 따른 시소 현상이 발생합니다. 이 결과는 OPD가 언제 일반화되는지를 명확히 하며 다중 교사 OPD를 진단하는 데 유용한 관점을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian
수집 2026-08-24 05:22
하이브리드 사고(Hybrid-thinking) 멀티모달 대규모 언어 모델(MLLM)은 단일 모델이 숙고적 사고와 지연 효율적인 비사고 추론 사이를 전환할 수 있게 합니다. 이러한 두 모드는 추론 예산이 다르지만, 사용자에게 제공되는 응답은 동일한 기준을 충족해야 합니다. 따라서 단순히 정확성만으로는 응답 품질을 완전히 측정하기 어려우며, 작업 정확도와 응답 패턴 실패를 함께 평가해야 합니다.
연구진은 사고 모드와 비사고 모드가 최종 응답 행동을 유지하는지 확인하는 응답 패턴 정렬을 통해 이 격차를 연구했습니다. 이를 위해 시각 인식, 접지, 구조화된 이미지 이해 및 멀티모달 지식 추론을 포괄하는 2,415개의 멀티모달 프롬프트를 포함하는 실패 기반 진단 벤치마크인 PatternEval을 도입했습니다. PatternEval은 사고 과정 누수, 응답 반복, 논리적 모순, 수행적 추론과 같은 네 가지 반복적인 실패를 테스트합니다.
비사고 추론에서 응답 패턴 실패가 광범위하게 발생하며 이는 사고 모드와 비사고 모드 간의 체계적인 불일치를 야기합니다. 이러한 진단을 바탕으로 응답 수준 보상 모델인 PatternRM과 강화 학습 중 패턴별 패널티를 도입하는 PatternRL을 개발했습니다. Qwen3-VL-4B 및 Qwen3-VL-8B에 대한 실험 결과, 강화 학습에 패턴별 패널티를 통합하면 작업 성능의 약간의 상충 관계를 감수하면서도 모드 간 불일치를 완화할 수 있음이 나타났습니다.
결론적으로 PatternEval과 PatternRL은 하이브리드 사고 인터페이스 전반에서 사용자에게 보이는 응답 패턴을 정렬하기 위한 평가 및 훈련 프레임워크를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang
수집 2026-08-24 02:20
장기적인 로봇 조작은 개별 기술을 안정적으로 실행하고 이를 확장된 작업에서 일관성 있게 순차적으로 배열할 수 있어야 합니다. 하지만 대부분의 계층적 비전-언어-행동(VLA) 모델은 각 결정을 단일 순방향 실행으로 처리하여 어렵거나 중요한 선택에 추가적인 연산을 할당할 메커니즘이 부족합니다.
이에 연구진은 세계 모델 기반 테스트 시간 연산(world-model-guided test-time computation)을 통해 고수준의 하위 작업 생성을 계산 가능한 추론 문제로 공식화하는 계층적 로봇 파운데이션 모델인 $\tau_0$-VLA를 소개합니다. 이 모델은 추론 단계마다 실행 메모리를 사용하여 하위 작업을 생성하고 필요할 경우 대안을 탐색한 후 결정함으로써 계산 효율성을 높입니다.
또한, 낮은 수준의 정책은 생성된 하위 작업을 여러 로봇 구현체에 걸쳐 실행합니다. 이 모델은 다중 모달 공동 훈련을 통해 40,115시간의 이질적인 실제 데이터를 학습했습니다. 결과적으로, 도메인 내 및 분포가 변화된 설정에서 추가적인 테스트 시간 연산을 할당하면 다음 하위 작업 예측 정확도가 크게 향상되며, 이는 장기적인 로봇 조작 작업에서 폐쇄 루프 성공률을 높이는 것으로 나타났습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou
수집 2026-08-21 16:42
자율 주행에서 LiDAR 장면 완성은 실시간으로 이루어져야 하므로 3D 인식의 핵심 요소입니다. 기존 접근 방식은 장면의 초기화를 먼저 구성한 후 정제하는 방식으로 진행되는데, 생성 모델은 느리고 비생성 방식은 노이즈 스케일 고정으로 인해 큰 간격이나 가려진 영역의 커버리지가 제한되어 수동 보정이 필요했습니다.
본 논문은 초기화 자체를 학습 기반 데이터로 간주하는 LiDAR 장면 완성 방법인 RapidLiDAR를 제안합니다. 이 방법은 각 부분 입력 지점에 대해 공간적으로 변화하는 변위를 예측하는 적응형 초기화 모듈을 통해 부분 관측을 국소 기하학에 맞게 확장하여 수동 노이즈 조정 없이 초기 장면을 구성합니다.
이러한 초기화를 완전하고 일관성 있는 장면으로 정제하기 위해 다중 스케일 재구성 모듈을 추가했습니다. 이 모듈은 입력 스캔에서 구성된 다중 스케일 3D 복셀 및 2D BEV 특징 맵을 쿼리하여 점 위치를 정제합니다. 특히, 가장 가까운 점 샘플링이나 k-최근접 이웃 검색과 같은 점 인접성 연산을 복셀 및 BEV 기반 특징 추출로 대체함으로써 아키텍처의 속도를 높이고 다양한 입력 해상도를 처리할 수 있게 되었습니다.
SemanticKITTI 및 KITTI-360 실험 결과, RapidLiDAR는 최신 기술 수준의 완성 성능을 달성하면서도 전체 장면을 0.1초 만에 완성합니다. 이는 가장 빠른 이전 방법보다 2.3배 빠른 속도로, 일반적인 자동차 LiDAR 센서의 10Hz 획득 속도에 맞춰 실시간 LiDAR 장면 완성에 한 걸음 다가섰습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Azhar Hussian, Martin Vossiek, Vasileios Belagiannis
수집 2026-08-20 20:29
물리적 실행에서 에이전트가 폐쇄 루프 학습을 실현하지 못하는 문제를 해결하기 위해 Zetta라는 폐쇄 루프 임베디드 하네스를 제시합니다. 기존의 하네스는 롤아웃 동안 고정된 기술을 따르는 개방 루프 방식이어서 에피소드가 끝난 후에만 반영이 가능하며, 이는 실시간으로 변화하는 로봇 환경 상태를 추적하는 데 필요한 속도를 따라가지 못합니다.
Zetta는 기본 정책을 고정한 채 코드 기반 런타임 비평가와 복구 기술을 온라인으로 진화시키는 폐쇄 루프 하네스입니다. 세 가지 시간 규모가 분리된 루프를 통해 행동 빈도 거버넌스, 롤아웃 수준의 비평가 복구 제안, 검증 기반 기술 업데이트를 제공합니다. 또한 Z-Infra와 결합하여 에이전트 로직을 이기종 실행 리소스에서 분리함으로써, Zetta는 LIBERO-Pro와 RoboCasa에서 최고 수준의 성공을 달성했습니다.
이러한 결과는 현재 롤아웃 예산 내에서 90.8%와 93.6%의 성공률을 기록했으며, 추론 속도는 11.1배 향상되었습니다. 학습된 기술은 제로샷으로 전이되며 자가 탐색 경험에 따라 성공이 계속 확장되고 명확한 로봇의 "아하 모먼트"가 나타났습니다. 이는 폐쇄 루프 하네스의 자체 진화가 신뢰할 수 있는 물리적 지능을 위한 확장 경로를 열어준다는 것을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao
수집 2026-08-20 04:19
루프드 언어 모델은 추론 벤치마크에서 유망한 결과를 보였지만, 에이전트 시스템을 위한 도구 사용 능력에 대한 잠재력은 아직 충분히 탐구되지 않았습니다. 본 연구는 모델이 여러 API 호출을 조정하고, 중간 상태를 유지하며, 도구 상호작용 간의 종속성을 보존해야 하는 구성적 도구 호출 환경에서 이러한 질문을 탐구합니다.
연구진은 API-Bank, BFCL, NESTful 데이터셋에서 네이티브 및 후행 적용된 루프드 언어 모델을 평가했으며, 추론 시점의 순환 깊이를 변화시키면서 루프드 모델과 비루프드 모델을 비교했습니다. 실험 결과, 순환 계산은 구성적 및 종속성 인식 도구 사용에 일반적으로 이점을 제공하지만, 개별 API 호출에는 더 작고 모델 의존적인 이득만을 제공합니다.
다만, 적응형 추론은 필요한 경우에만 추가 계산을 할당함으로써 더 유리한 컴퓨팅 성능 균형을 달성합니다. 이는 다단계 도구 사용의 정확도가 순환 깊이에 따라 증가함을 시사하며, 적응형 추론은 계산 효율성과 정확도 사이의 균형을 개선합니다.
이러한 결과는 루프드 언어 모델이 신뢰할 수 있는 계획, 조정 및 구성적 도구 사용 워크플로우 실행을 필요로 하는 에이전트 시스템을 위한 유망한 아키텍처임을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò
수집 2026-08-20 02:18
AI 시스템이 수학 연구에 기여하는 능력이 증가함에 따라, 최전선 모델 추론과 전문가 수학 검토는 제한된 자원이 되었습니다. 따라서 AI를 활용한 수학 발견을 효율적으로 만들기 위해서는 이러한 희소한 자원을 잘 배분하는 것이 핵심입니다. 기존의 AI 기반 수학 워크플로우에서는 인간의 노력이 연구 문제 선택과 결과물 검토에 집중되어 있어 이 두 단계가 연구 수준의 수학에서 병목 현상을 일으키고 있습니다.
이 문제를 해결하기 위해 연구진은 새로운 인간-AI 발견 패러다임을 제안했습니다. 인간의 입력은 미리 선택된 단일 문제가 아니라 전문가들이 관심과 전문성을 가진 연구 방향이 됩니다. 시스템은 이 방향에 맞춰 광범위한 문헌 코퍼스를 검색하여 후보 문제를 찾고, 검색 및 추천 시스템에서 영감을 받아 찾고 시도하고 추천하는(Find, Attempt, Recommend, FAR) 문헌 검토 연쇄 과정을 구축했습니다.
실제 조합론 파일럿에서 이 파이프라인은 5,245편의 조합론 논문에서 6,453개의 후보 추측 또는 미해결 문제를 복구하고 이를 4,717개의 명확하게 설정되었으며 아직 열려 있는 추측으로 걸러냈습니다. 이후 추론 및 자동 분류 단계는 598개의 잠재적 해결책을 제시하고 저자 팀 검토를 위해 77개의 항목을 선택했습니다. 이 과정에서 다비즈-옌센-퍼킨스-로버츠, 에르도스-스트라우스, 이켄마이어-팍-파노바, 룬드-사라프-울프 등의 추측 및 질문에 대한 흥미로운 발견들을 식별했습니다.
이러한 결과는 수학 발견을 위한 새로운 인간-AI 협업 방식이 매우 효과적임을 입증합니다. 이는 AI가 단순한 도구를 넘어 연구 과정의 병목 현상을 해소하고 새로운 발견을 촉진하는 데 중요한 역할을 할 수 있음을 보여줍니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Zeyu Zheng, Shengtong Zhang, Jeremy Avigad, Prasad Tetali, Sean Welleck
수집 2026-08-19 21:13
텍스트-이미지 생성 모델이 발전함에 따라 폭력이나 노출과 같은 부적절한 콘텐츠(NSFW) 생성 문제가 심화되고 있으며, 이는 적대적 공격(red-teaming adversarial attacks)에 의해 더욱 악화되고 있습니다. 기존의 방어책들은 주로 모델 내부 접근이 가능한 화이트박스 가정에 의존하여 텍스트 인코더 최적화나 가중치 편집 등을 사용하지만, 독점 모델에는 적용하기 어렵다는 한계가 있습니다.
LLM 프롬프트 재작성을 기반으로 한 블랙박스 대안들도 존재하지만, 모델이 학습한 데이터 분포 때문에 언어적으로 안전한 프롬프트임에도 유해한 생성을 유발하는 '양성 적대적 문제(benign adversarial problem)'에서는 효과를 보지 못합니다. 이에 연구진은 모델의 내부 접근 없이 프롬프트 수준에서 작동하는 제로샷 블랙박스 방어책인 DiSCO를 제안했습니다.
DiSCO는 모델 재학습이나 내부 정보 접근 없이 프롬프트 레벨에서 플러그 앤 플레이 모듈로 작동하며, 분포 가이드된 접미사 확장을 빔 서치(beam search)를 통해 수행합니다. DiSCO는 모델이 생성한 안전 및 비안전 이미지 풀에 대한 대조적 점수를 통해 반복적인 적응형 피드백을 거쳐 안전한 콘텐츠가 생성될 때까지 과정을 반복합니다.
실험 결과, DiSCO는 다중 적대적 공격 하에서 I2P 벤치마크에서 방어된 모델과 방어되지 않은 모델 모두의 안전성을 일관되게 향상시켰으며, 각각 37.7%와 25.13%의 ASR(Adversarial Safety Reduction) 감소를 달성했습니다. 이 과정에서 의미적 충실도를 유지하고 이미지 일관성을 개선했습니다. DiSCO는 모델 자체에 어떠한 변경도 필요 없이 모든 텍스트-이미지 시스템에 적용 가능한 아키텍처에 구애받지 않는 블랙박스 모듈입니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem
수집 2026-08-19 09:05
거대 언어 모델에서 지식 활용을 개선하는 방법은 크게 비매개적 검색, 매개변수 적응, 그리고 엔그램 스타일의 해시 메모리 세 가지 방식으로 나뉩니다. 엔그램 스타일 메모리는 외부 주소 지정 가능한 테이블에 학습된 정보를 저장하고 작은 학습된 리더를 통해 이를 소비하는 중간 영역에 속합니다. 연구는 이러한 메모리를 다른 백본으로 이동할 때, 고정된 메모리 자체와 대상 측 리더 중 무엇이 더 중요한지에 대한 질문을 탐구합니다.
연구진은 소스 모델에서 학습된 메모리를 고정하고 경량 리더만을 학습시켜 다른 대상 모델에 연결하는 크로스-모델 고정 메모리 추출 방법을 사용했습니다. 실험 결과, 학습된 메모리 내용과 올바른 주소 지정 모두 중요하지만, 전송된 테이블은 대상 모델에 정렬된 리더를 통해서만 유용하다는 것을 보여줍니다.
이러한 접근 방식을 통해 이중 레이어 네 갈래 리더를 사용한 결과, 동일 모델 및 크로스-모델 재사용 간의 격차를 거의 해소하며 평균 38.8점을 달성했습니다. 또한, 제공자 리더가 대상 인터페이스와 직접 호환될 경우 대상 측 학습 없이도 고정된 결과물을 상당한 유용성을 제공할 수 있습니다.
결론적으로 엔그램은 호환되는 리더 인터페이스에 대상이 접근할 수 있다면 재사용 가능한 외부 지식 자산으로 기능할 수 있습니다. 직접적인 리더 재사용이 불충분할 경우 대상 측 적응을 통해 정렬을 더욱 개선할 수 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji
수집 2026-08-19 08:04
통합 이미지 복원(UIR)은 다양한 손상 정도를 가진 저품질(LQ) 이미지에서 고품질(HQ) 콘텐츠를 단일 모델로 복원하는 것을 목표로 합니다. 기존의 많은 방법들은 강력한 용량과 생성적 사전 지식을 활용하기 위해 대규모 사전 학습된 텍스트-이미지(T2I) 잠재 확산 모델을 사용하지만, 잠재 T2I 모델의 VAE는 복원 민감한 세부 정보를 버릴 수 있으며, 개방형 합성 사전 지식은 내용 불일치한 인공물(artifact)을 도입할 수 있습니다.
이에 본 논문은 T2I 사전 학습에 의존하지 않고 확산 백본을 완전히 처음부터 훈련하는 VAE-프리 픽셀 공간 확산 트랜스포머(DiT)인 PixRestore를 제안합니다. PixRestore는 패치화된 픽셀에 직접 흐름 매칭을 수행하여 세밀한 디테일을 보존하면서 토큰 시퀀스를 관리하기 용이하게 합니다. 또한, 다양한 손상에 적응하기 위해 LQ-HQ DINO 특징 유사도를 사용하여 레이어 특징의 신뢰도를 예측하고, 신뢰도가 높은 레이어의 특징을 융합하거나 손상 제거를 장려하기 위해 덜 신뢰할 수 있는 레이어에 더 강한 HQ 특징 감독을 제공합니다.
PixRestore는 대규모의 다양한 장면 및 손상 코퍼스를 사용하여 훈련되었으며, DINO 기반 적대적 목표를 통해 효율적인 추론을 위해 단일 단계 생성기로 추가 미세 조정되었습니다. 실험 결과, PixRestore는 약 50M개의 파라미터와 단일 단계 추론만으로도 경쟁 UIR 모델들 중에서 최고의 전반적인 충실도, 지각적 품질, 손상에 대한 견고성을 달성하며 훨씬 더 효율적입니다. 더 큰 PixRestore 변형 모델은 성능을 더욱 향상시켜 픽셀 공간 설계의 확장 가능성을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang
수집 2026-08-19 08:04
프론티어 오픈 웨이트 모델이 증가하고 있음에도 불구하고, 모델 서빙은 여전히 데이터센터 인프라에 크게 의존하고 있습니다. 이에 FreeToken은 개인 기기를 단순한 GPU가 아닌 통일되고 탄력적인 추론 플랫폼으로 간주하는 엣지 네이티브 MoE 서빙 시스템을 제시합니다.
FreeToken은 모델 레이아웃, 로딩, 전문가 거주(expert residency), CPU-GPU 실행, 에이전트 상태 재사용, 런타임 메모리 관리 등 전체 서빙 스택을 공동 설계합니다. 이는 에이전트 작업 부하가 지속적으로 변화하고 기기마다 이질적인 자원의 균형이 달라지는 로컬 AI 환경이라는 두 가지 현실을 반영합니다.
이 시스템은 고정된 오프로딩 전략 대신, 계산과 모델 상태를 실제로 사용 가능한 자원에 지속적으로 매핑하여 처리합니다. FreeToken은 8GB 노트북 GPU부터 단일 워크스테이션 GPU까지 다양한 하드웨어에서 20개 이상의 MoE 모델과 실제 코딩 및 도구 사용 에이전트를 지원합니다.
가장 중요한 점은 이 기술이 기기가 실제로 제공할 수 있는 것을 변화시킨다는 것입니다. 이를 통해 노트북에서 35B 모델을, 게이밍 데스크톱에서 284B 모델을, 심지어 단일 워크스테이션 GPU에서 753B GLM-5.2 모델을 구동할 수 있게 됩니다. FreeToken은 오픈 웨이트 모델을 배포 가능한 로컬 소프트웨어로 전환하여 사용자가 소유한 기기를 프론티어급 지능을 위한 실용적인 플랫폼으로 만듭니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu, Ion Stoica
수집 2026-08-19 04:01
그래프 신경망을 통일된 레이어 방정식으로 통합하여 다양한 구조적 차이와 공유 계산을 명시적으로 표현하는 새로운 프레임워크를 제안합니다. 이 방정식은 업데이트 도메인, 채널 집합, 전파 뱅크, 채널별 메시지 맵, 채널 융합 연산자, 에고/잔차 맵, 업데이트 맵 등 총 일곱 가지 구성 요소로 이루어져 있습니다.
중심적인 분해는 정보가 이동하는 위치를 인코딩하는 전파 뱅크와 실제로 이동하는 정보를 인코딩하는 메시지 맵을 분리하여 표현합니다. 이 방정식은 국소 메시지 전달, 어텐션, 스펙트럼 필터링, 전역 통신, 관계별 채널, 고차원 도메인, 기하학적 메시지 등 다양한 개념으로 확장될 수 있습니다.
연구진은 이 통합을 일곱 가지 비독점적인 아키텍처 패밀리에 걸쳐 표준 레이어의 작업된 축소 및 구성 요소 할당을 통해 검증했습니다. 이 프레임워크는 200개 이상의 아키텍처를 공통 설계 공간으로 정리하며, 구성 요소별 비교 및 구조적으로 일관된 아키텍처 생성 능력을 제공합니다.
나아가 이 방법은 전파 선택을 오버스무딩, 오버스퀘이싱, 이질성, 표현력과 연결하고, 측정 가능한 그래프 및 작업 속성을 검증된 구성 요소 선택으로 매핑하는 경험적 역문제도 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Sai Karthik Navuluru, Siddhartha Shankar Das, Bo Ni, Hongjie Chen, Yu Wang, Baris Coskunuzer, Nesreen K. Ahmed, Franck Dernoncourt, Mahantesh Halappanavar, Tyler Derr, Ryan A. Rossi, Lakshman Tamil
수집 2026-08-19 04:01
대규모 언어 모델(LLM) 에이전트를 복잡한 상호작용 환경에 배포하기 위해서는 신뢰할 수 있는 불확실성 정량화(UQ)가 필수적입니다. 기존의 UQ 방법들은 토큰 확률, 예측 엔트로피, 단계별 신뢰도와 같은 국소적인 신호에 주로 의존하여 실행 궤적 전반에 걸쳐 오류가 누적되는 장거리 의존성을 간과합니다. 이로 인해 에이전트의 실패 원인이 최종 답변보다 여러 추론 또는 상호작용 단계 전에 발생했을 경우 이를 식별하지 못하는 한계를 가집니다.
이에 연구진은 LLM 에이전트를 위한 궤적 수준의 UQ 프레임워크인 RUPA(Relational Uncertainty Propagation for Agents)를 제안했습니다. RUPA는 실행 이력을 방향성 궤적 그래프로 표현하며, 추론 상태, 도구 상호작용, 환경 피드백을 노드로 하고 시간적 및 의미적 의존성 간선으로 연결합니다. 이 프레임워크는 그래프 전체에 불확실성을 전파하여 실행 위험이 상호작용 단계 전반에 걸쳐 어떻게 축적되고 전달되는지를 포착합니다.
RUPA는 전파된 신호를 궤적 수준의 행동 특징 및 목표 정렬 정보와 결합하여 전체 에이전트 궤적에 대한 신뢰도 추정치를 산출합니다. 6개의 오픈소스 LLM을 사용하여 τ-2, Terminal-Bench-2, GAIA 등 대표적인 에이전트 벤치마크에서 평가한 결과, RUPA는 기존의 UQ 방법들보다 더 정확한 불확실성 추정치를 제공하며, 조기 실패 감지를 가능하게 하고 다양한 에이전트 작업에서 불확실성 기반 에이전트 실행을 개선했습니다.
이러한 실험 결과는 장기 에이전트에게 신뢰할 수 있는 UQ를 위해서는 관계적 의존성을 명시적으로 모델링하는 것이 결정적으로 중요함을 보여줍니다. 이는 신뢰할 수 있는 에이전트 실행을 위한 실용적인 기반을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun
수집 2026-08-19 03:00
스트리밍 비디오 이해는 영상이 전개되는 원인적으로 관찰된 접두사로부터 직접적인 응답을 요구합니다. 기존 시스템들은 추론 시 메모리, 검색, 압축을 추가하지만, 이미 학습 없이 슬라이딩 윈도우 기반의 기준선이 이를 따라잡고 있습니다. 연구진은 이러한 배경에서 메모리 없는 최근 윈도우 프로토콜을 고정하고, 학습 후 성능 향상을 측정하는 방법을 탐구했습니다.
이러한 관찰을 바탕으로 연구진은 검증 가능한 스트리밍 비디오 데이터, 생각 모드(thinking mode)의 온-폴리 디스틸레션(OPD), 그리고 지시 모드(instruct mode) 배포를 결합한 StreamOPD라는 레시피를 제시했습니다. StreamOPD는 StreamingBench 점수를 77.9%에서 83.9%로, 9B 교사 모델 대비 0.3점 이내로 향상시켰으며, 환각 탐지 하위 작업(HLD)를 제외한 OVO-Bench 점수를 9.1점 향상시켰습니다.
특히 Spatio-Temporal CueGate(ST-CueGate)라는 교사 특권 확장 기능을 통해 신호 대 무신호 교사 가능성 비율을 그룹 상대 응답 점수로 집계하여 OPD를 재가중합니다. 이 방법은 OVO-Bench(HLD 제외)에서 71.9%, Video-MME에서 64.9%의 성능을 달성하며, 네 가지 벤치마크 모두에서 기본 모델보다 높은 성능을 유지하는 유일한 변형이 되었습니다.
또한, 교사를 학생 정책의 고정 복사본으로 대체하는 온-폴리 자기 디스틸레션(on-policy self-distillation)을 적용하면 대부분의 성능 향상을 유지하면서 HLD 점수를 57.0%로 끌어올려, 이 레시피가 추론 과정에서 발생한 손실에 내재되어 있지 않음을 입증했습니다. 이는 오픈 소스 스트리밍 비디오 연구를 위한 투명하고 재현 가능한 참조를 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-17
Keming Wu, Baoyi Wang, Kaichen Zhang, Xiang An, Zuhao Yang, Sudong Wang, Haowei Zhu, Tingxuan Huang, Hongcheng Gao, Bin Wang
수집 2026-08-18 16:53