회사 내에서 IT 부서 외부의 사람들이 기술이나 분석 역량을 개발하는 '시민 개발자(Citizen Developer)'의 역할이 급증하고 있습니다. 과거에는 IT 부서가 모든 기술을 통제했지만, 이제는 영업팀이나 운영 관리자 등 다양한 직군에서 업무를 진행하며 시스템을 우회하는 경우가 흔해졌습니다. 이러한 활동은 종종 '섀도 IT'로 간주되지만, 이는 직원들이 비즈니스 목표를 달성하기 위해 자율성을 발휘하는 과정에서 발생하는 현상입니다.
시민 개발자는 코드를 작성하는 전문 개발자와는 다른 맥락에서 이해되어야 합니다. 이들은 자신의 업무 영역을 벗어나 중요한 목표를 달성하기 위해 도구를 사용하며, 이는 개발자나 운영팀이 시스템의 안정성을 유지해야 하는 상황과 겹쳐집니다. 따라서 운영 관점에서 볼 때, 시민 개발자와 전문 개발자는 모두 프로덕션 시스템에 변화를 가하는 주체이며, 이는 일종의 데브옵스(DevOps) 활동으로 볼 수 있습니다.
이러한 흐름 속에서 AI와 같은 도구는 시민 개발자의 역량을 더욱 확장시키고 있습니다. 과거에는 시스템의 배포 횟수를 통제하는 것이 중요했다면, 이제는 도구가 안전성을 보장하고 자동화하는 데 중점을 두게 되었습니다. 결국 조직은 누가 시스템을 사용하느냐보다 그들이 만들어내는 가치를 어떻게 안전하고 예측 가능하게 관리할지에 집중해야 합니다.
Hacker News
분석
발행 2026-08-19
metal13
수집 2026-08-20 22:30
객체 탐지기는 훈련 데이터 범위를 벗어난 객체에 대해 과도하게 자신감 있는 예측을 생성하여 외 분포(Out-of-Distribution, OoD) 환각을 유발하는 문제가 있습니다. 기존의 환각 탐지 또는 완화 방법들은 학습된 객체 탐지 표현 위에서 점수 함수를 구성하거나 객체 탐지기 자체를 수정하는 방식에 머물러 있습니다.
하지만 이러한 표현에 내재된 잠재적 사전 지식(latent priors)은 여전히 탐구되지 않았으며 OoD 탐지를 위해 명시적으로 디코딩되지 않았습니다. 이 잠재적 사전 지식을 발견하고 활용하기 위해 본 연구는 구조적 사전 지식(Structured Prior Knowledge, SPK)이라는 환각 지향 프레임워크를 제안합니다. SPK는 사전 훈련된 객체 탐지기에서 OoD 관련 사전 지식을 명시적으로 추출하는 것을 목표로 합니다.
구체적으로 SPK는 분포 내 데이터와 환각을 유발하는 샘플을 진단 감독으로 활용하여 객체 탐지 결정의 근간이 되는 부분 수준의 의미론적 개념을 추출합니다. 추출된 의미론적 사전 지식은 기하학적 및 맥락적 사전 지식과 통합되어 OoD 탐지를 위한 간결한 5차원 SPK 표현을 형성합니다.
광범위한 실험 결과 SPK는 다양한 객체 탐지 아키텍처와 여러 OoD 벤치마크에서 최고 수준의 OoD 탐지 성능을 달성했습니다. 이는 사전 훈련된 객체 탐지기가 OoD 탐지에 일반적으로 활용되는 것보다 훨씬 더 풍부한 잠재 지식을 인코딩하고 있음을 보여줍니다. 이 지식을 명시적으로 추출하여 구조화하고 해석 가능한 지식 공간으로 정리함으로써 예측 신뢰도를 개선하는 선제적인 경로를 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Changshun Wu, Weicheng He, Xiaowei Huang, Saddek Bensalem
수집 2026-08-20 18:28
2026년 6월, 필자는 새롭게 제작한 풍선에 UpLink라는 페이로드를 싣고 몬태나를 가로질러 비행하는 실험을 진행했습니다. 이 페이로드는 3D 프린팅 필라멘트의 단열 특성을 테스트하고 무선 링크를 통해 고해상도 이미지를 전송하는 것을 목표로 했습니다.
UpLink 페이로드는 491그램의 무게로 제작되었으며, 특히 발포 PLA 필라멘트와 일반 PLA 필라멘트의 단열 성능 차이를 검증하는 데 중점을 두었습니다. 실험 결과, 발포 PLA가 일반 PLA보다 단열 성능이 좋다는 가설은 명확한 결론을 내리지 못했지만, 맞춤형 외피를 3D 프린팅하는 과정 자체가 센서의 온도 변화를 줄이는 데 도움이 된다는 점을 확인했습니다.
이 프로젝트는 기계 설계, 펌웨어, 이미지 전송 등 전반적인 엔지니어링 과정을 포함하며, 모든 하드웨어, 소프트웨어, 펌웨어, CAD 파일은 GitHub에 공개되어 있습니다. 또한, 무선 통신 대역을 33cm에서 70cm로 변경하는 등 통신 효율성 실험도 진행되었으며, 수집된 데이터와 이미지는 공개되어 있습니다.
Hacker News
튜토리얼
발행 2026-08-19
radeeyate
수집 2026-08-20 18:27
리눅스 7.2 버전이 정기적으로 출시되었습니다. 이번 커널은 CPU 및 GPU 스케줄링에 중점을 둔 여러 중요한 개선 사항을 포함하며, 캐시 인식 스케줄링, sched_ext를 위한 서브 스케줄러 개념, 다중 크기 투명 Hugepage 자동 생성 등의 기능을 도입했습니다.
특히 DRM 스케줄러 공정 정책(fair policy)이 도입되었으나, 최종 단계에서 보고된 회귀(regression) 문제로 인해 기본 정책은 기존의 선입선출(FIFO) 스케줄러로 유지됩니다. 이는 여러 클라이언트가 GPU를 공유하거나 경쟁하는 환경에서 성능 균형을 개선하기 위한 기능이지만, 해당 회귀 수정은 다음 커널 릴리스에서 재활성화될 것으로 기대됩니다.
또한, Raspberry Pi 4 및 5 GPU에 대한 런타임 전력 관리(Runtime Power Management) 지원이 추가되어 GPU가 실제로 작업을 처리할 때만 전력을 소비하고 유휴 상태에서는 클럭을 비활성화할 수 있게 되었습니다. 이 기능은 시스템의 전력 소비를 줄이는 데 기여합니다.
이 외에도 GPU 드라이버 버그 수정, futex 개선, 그리고 HDMI 2.1 지원 관련 작업이 이루어졌습니다. 특히 Raspberry Pi 3 GPU 드라이버의 메모리 처리 버그가 수정되어 RetroPie 사용자가 겪던 시스템 충돌 문제가 해결되었으며, GPU 리셋 과정의 안정성도 향상되었습니다.
Hacker News
출시
발행 2026-08-19
mariuz
수집 2026-08-20 17:26
에이전트 프레임워크에서 절차적 지식(procedural knowledge)이 스킬(skill) 형태로 패키징되면서 에이전트가 필요할 때마다 지침 파일을 읽는 것이 중요한 결정이 되었습니다. 그러나 현재의 보상 기반 강화 학습(outcome-rewarded RL)으로는 이러한 스킬 선택 과정을 훈련시키기 어렵다는 구조적 문제가 지적되었습니다. 연구진은 이 문제를 선택 신호 결핍(selector credit starvation)이라고 명명하며, 시퀀스 수준의 이점(sequence-level advantage) 하에서 선택된 스킬을 명명하는 토큰들이 손실의 소실된 부분을 차지하며, 궤적이 길어질수록 이들이 물려받는 신호가 잘못된 부호로 변한다는 것을 밝혀냈습니다.
정확한 선택이 이루어졌음에도 불구하고 그 이후의 실행이 실패하면 선택 자체가 처벌받는 상황이 발생하며, 이는 훈련 과정에서 모순을 야기합니다. SkillGate는 이러한 실패를 구조적으로 제거하기 위해 토큰 지원을 두 개의 분리된 신호 채널로 나눕니다. 하나는 실행 토큰에만 도달하는 결과 신호이고, 다른 하나는 오직 스킬 명명 토큰에만 도달하는 행동 국소 이점입니다. 이 행동 국소 이점은 궤적의 단일 읽기가 정확할 때만 긍정적으로 부여됩니다.
이러한 접근 방식을 통해 SkillGate는 16개의 후보 스킬 슬레이트 하에서 다섯 가지 에이전트 벤치마크에서 9B 규모의 정책의 성공률을 40.8%에서 53.2%로 향상시켰습니다. 이는 동일한 예산을 결과 보상만 사용하는 것보다 훨씬 앞선 결과이며, 잘못된 후보에 대한 노출을 3분의 2로 줄이고 읽는 스킬의 수를 감소시키는 효과도 가져왔습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Qingyao Li, Wenxiang Jiao, Shuai Shao, Kangning Zhang, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang, Yong Yu
수집 2026-08-20 09:21
강화 학습(RL)은 언어 및 비전-언어 모델의 추론 능력을 향상시키는 강력한 접근법이지만, 그 성공은 여전히 정답 레이블(ground-truth supervision)에 크게 의존합니다. 이러한 주석은 얻기 어렵고, 인간이 신뢰할 수 있는 수준을 넘어선 추론 능력에서는 더욱 희소해집니다. 자기 보상 강화 학습(Self-rewarding RL)은 모델이 자체 완성으로부터 보상 신호를 도출하게 함으로써 이러한 의존성을 줄이지만, 자기 생성 피드백만으로 학습할 경우 기존 편향과 비최적 행동을 강화하고 응답 다양성을 감소시켜 결국 훈련 붕괴(training collapse)를 초래할 수 있습니다.
본 연구는 협력적 다중 에이전트 훈련을 통해 지도 없이도 추론이 자연스럽게 나타날 수 있음을 보여주는 Co-RL 프레임워크를 소개합니다. Co-RL은 파라미터를 공유하지 않는 여러 모델이 동료로부터 도출된 보상을 사용하여 동시에 강화 학습을 통해 최적화되는 방식입니다. 특히, 이 연구는 이질적인 모델 계열, 크기, 재구성된 훈련 샘플을 통해 코호트 다양성(cohort diversity)을 높이면 자기 강화 피드백 루프를 유발하는 상관 오류(correlated errors)를 줄일 수 있음을 입증했습니다.
이러한 다양성 증가는 추론 성능을 지속적으로 향상시키고 행동 다양성을 유지하며 훈련 붕괴를 완화합니다. Co-RL은 텍스트 전용 및 멀티모달 도메인 모두에서 모든 정답 레이블 없이도 기본 모델 및 기존의 레이블 없는 접근 방식보다 일관되게 우수한 성능을 보이며, 지도 학습 방법과 동등하거나 능가하는 결과를 달성했습니다. 구체적으로 Co-RL은 LLM의 일곱 가지 텍스트 전용 벤치마크에서 평균 3.0~8.6%의 성능 향상과 VLM의 네 가지 멀티모달 벤치마크에서 2.3~7.2%의 성능 향상을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li
수집 2026-08-20 05:19
물체 변형 조작에서 물리적 상호작용의 품질은 핵심이지만, 대부분의 벤치마크는 단순히 작업 성공만을 평가합니다. 정책이 미끄러짐을 허용하거나 과도한 압축을 유발하면서 작업을 완료할 수 있기 때문에, 정책이 보이는 접촉 관찰과 독립적인 물리적 실제값을 쌍으로 하는 시각-촉각 데이터셋이 부족한 것이 주요 병목 현상입니다.
이에 연구진은 물리적 상호작용을 고려한 변형 조작을 위한 시각-촉각 데이터셋인 SoftVTBench를 소개합니다. 이 데이터셋은 4,000개의 전문가 시연과 볼류메트릭 변형 물체 및 시각적으로 일치하는 강체 쌍을 포함한 50개 이상의 에셋으로 구성되어 있습니다. 각 에피소드는 20Hz로 멀티뷰 RGB, 듀얼 핑거 촉각 RGB 및 마커 움직임, 고유 감각, 언어, 이진 및 연속 그리퍼 동작과 평가자 전용 유한 요소(FEM) 상태를 동기화하여 수집되었습니다.
이 데이터셋을 기반으로 고정된 물체별 보정(calibration)을 사용하여 변형 인식 성공률(Deformation-aware Success Rate, DSR)을 정의하는 폐쇄 루프 벤치마크를 구축했습니다. 분포 변화 상황에서 시각-촉각 변형은 여섯 가지 정책 모음 비교에서 더 높은 작업 성공과 다섯 가지 비교에서 더 높은 DSR을 달성했지만, 분포 내 이점은 혼재되어 나타났습니다.
이러한 결과는 접촉을 제공하는 것만으로는 효과적인 멀티모달 융합을 보장하지 않는다는 것을 보여줍니다. 따라서 SoftVTBench는 정책의 성공 여부뿐만 아니라 물체가 어떻게 물리적으로 상호작용하는지, 그리고 촉각이 이러한 상호작용을 언제 개선하는지를 연구하기 위한 공통된 시각-촉각 자원을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu
수집 2026-08-20 04:19
잠재 세계 모델(Latent World Models)에서 결정 지표 정렬(Decision-Metric Alignment)의 중요성이 제시되었습니다. JEPA 스타일의 잠재 세계 모델은 목표 잠재 공간에 대한 유클리드 거리를 모델 예측 제어(MPC)의 비용으로 사용할 수 있지만, 이는 실제 작업 진행에 따른 후보 행동 시퀀스를 순위화한다는 것을 보장하지 않습니다.
연구진은 이러한 불일치를 측정하기 위해 무작위 계획에 대한 잠재-실제 순위 일치도를 측정하는 Plan-Real Spearman과 CEM 탐색이 제안을 집중시키는 경우의 일치도를 측정하는 CEM-stage Spearman을 도입했습니다. 이들은 잠재 거리가 실제 비용 순위를 보존하는 충분 조건에 대해 인코더 왜곡, 최종 롤아웃 오류, 후보 마진을 주요 통제 변수로 식별했습니다.
이러한 실증적 정렬 격차를 바탕으로 DA-LeWM을 제안했는데, 이는 역동학(inverse-dynamics)과 시연 조건부 목표-행동 헤드를 LeWM에 추가하여 모델을 확장합니다. 실험 결과, DA-LeWM은 LeWM보다 수렴 속도를 높이고 온라인 성공률을 향상시켰으며, 탐침 점수는 유사하게 유지되었습니다.
이 결과는 행동 조건부 목표가 유클리드 비용 및 CEM 기반 잠재 MPC에 사용되는 기하학을 개선한다는 것을 보여줍니다. 즉, 행동 조건부 목표를 통해 잠재 MPC의 기하학이 향상되어 더 나은 성능을 달성할 수 있음을 시사합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li
수집 2026-08-20 04:19
프로그래머블 로직 컨트롤러(PLC)는 산업 플랜트를 운영하며, 대규모 언어 모델(LLM)이 이미 PLC를 위한 독립적인 프로그램 조직 단위(POU)를 생성할 수 있지만, 이러한 로직이 기존 프로젝트에 통합되어 실제로 작동하는지 여부는 제한적인 테스트에서만 확인되었습니다. 이에 따라 본 연구는 SemaPLC를 제시하는데, 이는 기존 도구들을 조합하여 구성되었지만 엄격한 완료 규칙에 의해 통제되는 프로젝트 기반의 검증 게이티드 에이전트 하네스입니다.
SemaPLC는 모델이 자체적으로 결과가 충분하다고 판단할 때 멈추는 대신, 외부 확인을 통해 완료가 로그된 후에만 작업을 완료로 선언합니다. 이 외부 확인은 명세, 컴파일, 그리고 실제 런타임에서의 동작을 포함합니다. 기존 벤치마크와 일치하는 117개의 독립적인 POU 작업에서 SemaPLC는 7가지 모델 모두에서 가장 높은 엄격한 검증 통과율(평균 72.6%)을 달성했습니다.
특히 실제 프로젝트 환경에서 생성된 로직이 컴파일되고 실행되어야 하는 65개의 프로젝트 컨텍스트 작업에서는 통합 컴파일, 정적 동작, 동적 동작 측면에서 가장 높은 평균 성능을 보였습니다. 이는 생성된 제어 로직이 실제로 작동하는지를 확인하는 실행(Execution)이 정적 점수보다 더 정확한 테스트임을 입증합니다.
실제 PLC 런타임에서 생성된 로직의 실행 흔적을 비교하는 동적 동작 측정에서 SemaPLC는 기준 모델 대비 52.2점을 기록하며, 기존 기준 모델들(22.4점에서 31.4점)보다 훨씬 높은 점수를 기록했습니다. SemaPLC는 모든 계층에서 평균을 높이고 특히 런타임에서 가장 큰 개선을 이루어냈습니다. 이 연구 결과는 SemaPLC가 공개된 GitHub 저장소에서 공개되어 있습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi Chen, Tengfei Zhou, Yifan Zhou, Dasheng Yang, Xiaofeng Mou, Hui Zhang, Yi Xu
수집 2026-08-20 03:18
단일 단계 역합성(single-step retrosynthesis)은 컴퓨터 지원 합성 계획의 핵심 요소이지만, 본질적으로 일대다(one-to-many)의 특성 때문에 단일 답변 평가 및 벤치마킹 프로토콜로는 다양한 타당한 반응 예측을 충분히 포착하지 못합니다. 이러한 문제를 해결하기 위해 본 연구는 다양한 타당한 반응 예측을 더 잘 포착할 수 있는 강력한 훈련 및 추론 패러다임으로 Top-K 프롬프팅을 도입합니다.
연구진은 약 4560만 건의 검증된 반응으로 구성된 CREED-CCV-2+USPTO-XL이라는 초거대 데이터셋을 컴파일하여 C3LM(Chemistry Constraint-Consistent Language Model)을 훈련시켰습니다. 여기에 ChemCensor 기반 및 새로움 지향 보상을 통합하여 미세 조정함으로써, 모델은 OOD URSA-expert-2026 벤치마크에서 최고 수준의 성능을 달성했습니다.
또한 반응의 고유성에 대한 추가 분석 결과, LLM과 기존 모델이 상호 보완적인 반응 공간을 탐색한다는 사실이 밝혀졌으며, 이는 앙상블 기반 역합성 시스템을 촉진하는 동기가 됩니다. 결과적으로, Top-K 기반의 타당성 인식 훈련은 향후 LLM 기반 합성 계획을 위한 강력하고 실용적인 새로운 방향을 제시합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov
수집 2026-08-20 03:18
언어 모델 에이전트가 장기적인 시간 범위에서 누적된 결과를 고려하며 효과적인 의사 결정을 지속할 수 있는지에 대한 측정 방법이 부족했습니다. 이러한 문제를 해결하기 위해 FM-Bench(Football Management Benchmark)라는 벤치마크가 도입되어 LLM 에이전트의 장기 관리 능력을 측정합니다. 이 벤치마크에서 LLM 에이전트는 26가지 도구를 사용하여 20년의 축구 클럽을 운영하며 약 340~400회의 의사 결정을 수행합니다.
에이전트는 경쟁팀과 동일한 예산으로 스쿼드를 구성하고, 선수 거래를 하고, 계약을 협상하며, 시설과 유소년에 투자하고, 라인업을 설정하며, 해고할 수 있는 이사회에 답변하는 등의 행동을 수행합니다. 이 모든 과정은 LLM 심사관이나 인간 평가자 없이 결정론적 엔진을 통해 매년 누적되어 최종 점수를 산출합니다.
이 연구는 15개의 최첨단 모델을 스크립트화된 세계 또는 공유된 20년 세계에서 평가하는 단독 트랙과 아레나를 통해 모델 간의 직접적인 비교를 가능하게 했습니다. 결과적으로 모델 간의 순위는 예측되지 않으며, 최고의 첫 플레이는 모델 보드 하단에 위치하는 경우가 많습니다. 이는 모델의 성능이 계산 능력보다는 관리적 행동에 달려 있음을 보여줍니다.
고득점 모델들은 마감 시점에 느린 보상 투자를 줄이고 현금을 유휴 상태로 두지 않으며, 기한보다 훨씬 전에 갱신을 시작하는 등 관리적 행동을 보였습니다. 반면 토큰 사용량은 아무것도 예측하지 못했으며, 자기 관리 메모리는 성장하는 아카이브 모드와 매 시즌 계획을 재작성하는 모드에서 모두 실패했습니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li
수집 2026-08-20 02:18
터미널 에이전트를 훈련시키기 위해서는 확장 가능한 실행 감독이 필요하지만, 고품질의 터미널 작업을 합성하는 것은 여전히 어려운 과제입니다. 각 작업은 지침, 초기화된 환경, 참조 솔루션, 실행 검증기 등을 결합하는데, 이들이 일관성 없는 가정에서 생성되면 결과적으로 해결 불가능하거나 잘못 평가될 수 있습니다. 또한 다단계 합성은 원본 소스에 인코딩된 목표, 의존성, 상태 전환 및 절차적 제약 조건을 버릴 수 있습니다.
이에 본 연구는 정보 보존과 다중 항목 일관성을 모두 해결하는 프레임워크인 FACET(Fine-grained Agentic Construction of Executable Tasks)을 제시합니다. FACET은 관련 에이전트 기술을 일관성 있는 정보가 풍부한 시나리오로 재구성한 다음, 실행 환경을 실현하고 수리한 후 최종 작업 산출물을 생성합니다. 이 과정에서 생성된 컨테이너 상태는 지침, 솔루션, 검증기의 공유된 기준점으로 사용되며, 실행 기반 검증과 표적 수리를 통해 불필요하게 유효한 구성 요소를 재생성하지 않고도 산출물별 실패를 수정합니다.
FACET은 실행 가능한 검사를 포함하는 복잡한 터미널 작업을 생성하며, 이 작업들에서 수집된 성공적인 궤적은 효과적이고 데이터 효율적인 감독을 제공합니다. 여러 스케일에 걸쳐 모델을 미세 조정하면 Terminal-Bench 2.1에서 일관되게 성능이 향상되며, 대안적인 생성 방식에 대한 분석은 작업의 유효성과 솔루션-검증기 정렬을 위해 환경 기반 구성의 중요성을 뒷받침합니다. 이 연구 결과는 확장 가능한 터미널 작업 합성을 위한 핵심 원칙으로 소스 의도 보존과 공유 실행 상태 접지(shared executable-state grounding)를 확립합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan Ren, Jin Liu, Yu Zeng, Yiming Zhao, Lin Chen, Zehui Chen, Feng Zhao
수집 2026-08-20 01:17
거대 언어 모델(LLM) 기반 에이전트는 소프트웨어 문제 해결에 뛰어난 능력을 보이지만, 프로젝트별 특화 지식이 부족하여 특정 저장소 내의 문제를 해결하는 데 어려움을 겪습니다. 기존의 자기 진화 접근 방식은 저장소의 이력이나 온라인 복구 경로에서 지식을 습득하지만, 이는 기존의 문제 해결 신호에 의존하거나 테스트 시간 탐색 비용이 상당히 발생한다는 한계가 있습니다.
이에 본 논문은 저장소 자체로부터 프로젝트별 지식을 선제적으로 획득하는 자기 증류 프레임워크인 SkillForge를 제안합니다. SkillForge는 실제 문제가 지식 격차를 드러내기를 기다리는 대신, 저장소의 테스트된 핵심 기능을 재구현하여 프로젝트별 합성 문제를 생성합니다. 이 합성 문제를 해결함으로써 SkillForge는 재사용 가능한 프로젝트별 지식을 개체 기반 기술(entity-grounded skills)로 증류하고 관련 저장소 개체와 연관시켜 향후 문제 해결에 활용합니다.
오픈소스 및 클로즈소스 모델을 사용한 광범위한 실험 결과, SkillForge는 강력한 기준 모델보다 문제 해결 성능을 지속적으로 향상시켰습니다. 이는 실제 문제를 해결하기 전에 프로젝트별 지식을 선제적으로 획득하는 것이 다운스트림 소프트웨어 문제 해결 능력을 실질적으로 향상시킨다는 것을 입증합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-19
Silin Chen, Han Li, Xiaodong Gu, Yuling Shi, Haibing Guan
수집 2026-08-20 01:17
인공지능 모델 학습 과정에서 인간의 모든 쓰여진 결과물이 어떻게 활용되는지에 대한 내용을 다룹니다. 글쓴이는 현재 수많은 로봇들이 인터넷을 통해 대규모 데이터 센터로 이동하며 AI 연구에 참여하고 있으며, 이 과정에서 인간의 텍스트가 어떻게 처리되는지 설명합니다.
이 과정에서 모든 인간의 글은 작은 조각으로 잘린 후 수천 차원에 걸쳐 늘어나고 여러 변환 과정을 거쳐 LLM(거대 언어 모델)에게 먹이가 됩니다. 이는 단순히 데이터를 입력하는 것을 넘어, 텍스트가 모델의 가중치(weights)에 반영되어 AI 시스템의 기반이 되는 방식입니다.
글쓴이는 자신이 AI가 비소픽 그룹의 존재를 입증하거나 HuggingFace 서버를 해킹하는 데 기여한 블로그 게시물이 모델의 가중치를 구축하는 데 도움을 주었다고 언급합니다. 따라서 글쓴이는 자신이 앞으로 만들어질 모든 모델의 가중치에 통계적으로 스며들어 있다는 점을 지적하며, 이러한 현상에 대한 인식을 독자들에게 전달합니다.
Hacker News
논문
발행 2026-08-19
matthewsharpe3
수집 2026-08-19 23:15
OpenRouter가 금융 인프라 플랫폼인 Stripe와 합병을 발표하며 AI 모델 시장의 새로운 흐름을 만들고 있습니다. OpenRouter는 가장 크고 첫 번째 모델 마켓플레이스이자 게이트웨이로서, 개발자들이 다양한 AI 모델을 하나의 인터페이스에서 발견하고 사용할 수 있도록 하며 비용 관리, 성능, 가용성을 개선하는 라우팅 기능을 제공합니다. 현재 OpenRouter는 400개 이상의 AI 모델로부터 하루 10조 개 이상의 토큰을 처리하며 1,000만 명 이상의 개발자와 기업 커뮤니티를 지원하고 있습니다.
이번 합병은 OpenRouter가 AI 생태계의 중립성과 다중 모델의 자유라는 핵심 미션을 더욱 빠르게 실현하기 위한 전략적 결정입니다. Stripe는 최고의 금융 인프라 플랫폼으로서 개발자 제품들이 측정하는 표준을 제시했으며, OpenRouter와 Stripe는 복잡한 인프라와 시장 역학을 사용자 친화적인 API로 추상화한다는 공통된 DNA를 공유합니다. 이는 개발자들이 모델에 관계없이 공정하게 경쟁하고, AI 신경다양성이 강점으로 작용하는 건강한 AI 생태계를 구축하는 데 기여할 것입니다.
사용자 입장에서는 OpenRouter의 제품, 미션, 로드맵은 그대로 유지되며 통합에 따른 변경 사항은 없습니다. OpenRouter는 여전히 모든 모델을 동등하게 제공하고, 사용자가 최적의 결과를 얻도록 라우팅 결정을 내리는 데 집중할 것입니다. Stripe와의 결합은 OpenRouter가 더 빠르고 강력하게 이 비전을 추구할 수 있도록 재정적, 인프라적 지원을 제공하여, 앞으로 AI 경제에서 개발자들에게 필수적인 중립적이고 신뢰할 수 있는 레이어를 제공할 것입니다.
Hacker News
뉴스
발행 2026-08-19
rvz
수집 2026-08-19 19:11
쿠버네티스에서 프로브가 어떻게 작동하는지 이해하는 것은 애플리케이션의 복원력과 실수를 예방하는 데 필수적입니다. 프로브는 컨테이너의 상태를 주기적으로 확인하여 애플리케이션의 건강 상태를 판단하는 역할을 하며, 이는 재시작 루프나 롤아웃 중 요청 누락과 같은 문제를 방지하는 데 도움을 줍니다.
프로브는 크게 세 가지 유형으로 나뉘는데, 시작 프로브는 애플리케이션이 시작되었는지 확인하고, 준비 상태 프로브는 트래픽을 수신할 준비가 되었는지 확인하며, 생존성 프로브는 컨테이너가 재시작되어야 하는지 판단합니다. 각 프로브는 설정과 조합에 따라 배포 속도와 서비스 안정성에 직접적인 영향을 미치므로 적절한 구성이 중요합니다.
특히 준비 상태 프로브는 데이터베이스 서버나 외부 API와 같은 공유 종속성의 상태에 기반하여 실패하지 않도록 설정하는 것이 좋습니다. 또한, 높은 CPU나 메모리 상태에 반응하여 준비 상태를 실패시키는 것을 피해야 하며, 리플리카를 제거하는 것이 연쇄적인 실패를 유발할 수 있다는 점을 고려해야 합니다.
프로브를 설정할 때는 자원 소비를 최소화하고 실패 임계값을 신중하게 설정해야 합니다. 시작 프로브는 다른 프로브보다 약간 더 유연하지만 여전히 클러스터 자원을 소모하므로, 트래픽 제공에 필요한 자원을 고려하여 프로브를 경계 내에서 관리해야 합니다.
Hacker News
튜토리얼
발행 2026-08-19
cyndunlop
수집 2026-08-19 18:10
농담으로 시작된 도메인 구매가 지정학적 전쟁으로 이어진 사례를 다룬 기사입니다. 이 이야기는 기상 관측용 라디오손더 추적 시스템을 구축하던 프로젝트가 어떻게 정부 기관과 군사 활동에 연루되게 되었는지 설명합니다. 2017년, 기상 풍선 추적을 시작했던 개발자들은 초기에는 취미 활동으로 시작했으나, 점차 라디오손더 데이터를 프록시하고 분석하는 시스템을 구축했습니다.
이 과정에서 SondeHub는 단순한 데이터 플랫폼을 넘어 군사적 맥락을 갖게 되었습니다. 개발자들은 라디오손더 데이터를 역추적하여 발사 위치를 예측하는 '역 예측(reverse predictions)' 시스템을 개발했는데, 이는 군사 활동에서 사용되는 바람 모델을 활용하여 발사 위치를 추정하는 데 사용될 수 있었습니다. 이 시스템은 군사 시설 위치를 무심코 지도화하는 결과를 낳았으며, 이후 미군 및 정부 기관으로부터 민감한 데이터 요청을 받게 되었습니다.
SondeHub는 2023년 미국에서 민간 라디오 풍선을 요격하는 사건과 같은 실제 사건에 연루되면서 엄청난 트래픽을 처리하게 되었고, .mil, .gov 주소에서 지원 요청을 받았습니다. 이는 플랫폼이 민감한 정보와 군사적 데이터 흐름에 노출되었음을 의미하며, 데이터 수집과 관련된 윤리적 및 보안적 문제에 대한 논의를 촉발했습니다.
결론적으로 이 사례는 취미 프로젝트가 어떻게 민감한 데이터 인프라로 변모하며 지정학적 갈등의 중심에 놓일 수 있는지 보여줍니다. 특히 군사 활동과 관련된 데이터가 환경 및 기상 예측에 사용되는 과정에서 발생하는 데이터의 사용 목적과 보안에 대한 중요한 맥락을 제시합니다.
Hacker News
분석
발행 2026-08-19
kareiva
수집 2026-08-19 14:08
HuggingFace 모델의 상호작용적이고 애니메이션화된 아키텍처를 보여주는 새로운 프로젝트가 공개되었습니다. 이 프로젝트는 사용자가 HuggingFace 모델의 구조를 시각적으로 탐색하고 애니메이션으로 확인할 수 있도록 설계되었습니다.
해당 사이트는 복잡한 딥러닝 모델의 내부 구조를 직관적으로 이해하는 데 도움을 주며, 개발자들이 모델의 작동 방식을 더 깊이 분석할 수 있는 환경을 제공합니다. 이를 통해 모델의 구성 요소와 데이터 흐름을 애니메이션으로 확인하며 아키텍처를 학습할 수 있습니다.
이러한 시각화 도구는 모델 개발 및 디버깅 과정에서 모델의 구조적 이해도를 높이는 데 중요한 역할을 합니다. 특히, HuggingFace 생태계 내에서 다양한 모델의 아키텍처를 비교하고 분석하는 데 유용합니다.
개발자들은 이 링크를 통해 HuggingFace 모델의 복잡한 구조를 애니메이션으로 확인하고 상호작용하며 모델에 대한 이해를 높일 수 있습니다.
Hacker News
출시
피드 등록 2026-08-18
lizhaoliu
수집 2026-08-19 00:58
Solo는 정적 리눅스 바이너리를 위한 .so 로더로, 시스템의 기존 GPU 드라이버를 런타임에 로드할 수 있게 하여 포팅 문제를 해결합니다. 기존의 정적 바이너리는 단일 파일로 배포가 간편하지만, 하드웨어에 종속된 드라이버를 사용해야 할 때 시스템 전체를 배포해야 하는 비효율성이 발생합니다. Solo는 컨테이너나 두 번째 libc 없이, 호스트 시스템의 공유 객체(shared objects)와 하드웨어 드라이버를 로드하는 기능을 제공합니다.
이 로더는 musl 기반의 환경에서 dlfcn 스타일의 소스 API를 제공하며, glibc ABI 브리지를 통해 호스트의 glibc 환경과 상호작용합니다. 이를 통해 사용자는 여전히 하나의 정적 실행 파일을 사용하면서도 시스템에 설치된 그래픽 드라이버를 활용할 수 있습니다. Solo는 x86-64와 aarch64 아키텍처에서 테스트되었으며, CI 환경에서는 1,000개 데비안 패키지의 공유 라이브러리를 로드하여 호환성을 검증합니다.
이 기술은 "완전히 정적"인 실행 파일과 "시스템 GPU를 사용하는" 실행 파일 사이의 경계를 테스트 가능한 호환성 계층으로 전환하는 것을 목표로 합니다. Solo는 하드웨어 종속적인 코드를 호스트 시스템에 남겨두고 나머지 모든 것을 배포함으로써, 소프트웨어의 이식성을 크게 향상시킵니다.
Hacker News
튜토리얼
피드 등록 2026-08-18
zX41ZdbW
수집 2026-08-19 00:58
캔자스주 가드너 시는 개인 정보 및 데이터 접근 문제에 대한 우려가 커지면서 플록 안전(Flock Safety) 번호판 카메라 시스템을 중단하고 계약을 취소하기로 결정했습니다. 시의 의회는 이 결정에 따라 즉시 카메라를 끄고 계약 갱신을 하지 않기로 합의했으며, 가드너 경찰국도 모든 플록 카메라를 중단하고 제공업체에 계약 취소를 통보했습니다.
이러한 결정은 자동 번호판 판독 시스템이 개인의 이동 경로를 포함한 상세한 정보를 수집하고 저장한다는 점에 대한 대중의 감시가 증가하는 상황에서 나왔습니다. 이 시스템은 범죄나 실종 사건과 관련된 차량을 찾는 데 사용되지만, 비판론자들은 이 기술이 개인의 움직임에 대한 광범위한 기록을 생성하며 데이터 접근성이 문제된다고 지적했습니다.
시 당국은 이 조치가 가드너 시가 소유하고 운영하는 카메라에만 적용되며, 존슨 카운티나 주 정부가 운영하는 카메라에는 영향을 미치지 않는다고 밝혔습니다. 또한 플록 회사 자체도 이 논란에 대응하여 데이터 보존 기간을 30일에서 7일로 단축하고 데이터베이스 검색 시 형사 사건 번호를 요구하는 등 시스템 변경을 발표했습니다.
Hacker News
뉴스
발행 2026-08-18
cocacola1
수집 2026-08-20 00:16