Scanning 7.6 Petabytes of HuggingFace Training Data for Secrets

트러플 시큐리티가 Hugging Face의 공개 학습 데이터 7.6 페타바이트를 스캔하여 221,303개의 유효한 자격 증명을 발견하는 대규모 보안 취약점을 공개했습니다. 이 스캔 결과는 AI 학습 데이터 내에 클라우드 계정, 호스팅된 데이터베이스, 스토리지 버킷 접근 권한 등 실제 운영에 사용되는 민감한 자격 증명이 광범위하게 노출되어 있음을 보여줍니다.

발견된 자격 증명 중 일부는 심각한 공급망 위험을 내포하고 있으며, 특히 소프트웨어 설치 권한을 부여하는 GitHub 개인 액세스 토큰이나 Docker Hub 토큰이 다수 포함되어 있습니다. 예를 들어, 전체 저장소 쓰기 권한을 가진 토큰이나 CI 워크플로우를 재작성할 수 있는 토큰들이 발견되어, 공격자가 다른 사용자가 실행하는 소프트웨어를 변경할 수 있는 잠재적 경로를 제공합니다.

이러한 자격 증명은 단순히 데이터 접근을 넘어 클라우드 계정이나 데이터베이스에 대한 접근 권한을 포함하고 있어, 잠재적인 클라우드 계정 탈취 및 데이터 유출로 이어질 수 있습니다. 스캔 결과는 이러한 자격 증명이 여러 데이터셋에 걸쳐 존재하며, 일부는 최대 1,131개의 채팅 로그에까지 연결되어 있어 유출 경로가 더욱 복잡함을 시사합니다.

따라서 AI 학습 데이터와 같은 공개 데이터셋을 활용할 때는 자격 증명 회전(Rotation)이 필수적이며, 데이터셋을 학습시키기 전에 보안 검사를 수행하고 노출된 모든 자격 증명을 즉시 취소해야 합니다. 트러플 시큐리티는 이러한 문제를 해결하기 위해 Hugging Face와 협력하여 스토리지 버킷 스캔 기능을 통합하는 등 공급망 보안 강화에 기여하고 있습니다.

Here's how engineers plan to save the satellite sent to save NASA's Swift mission

NASA의 스위프트 감마선 관측소를 구출하기 위해 파견된 링크(Link) 위성이 통제력을 잃고 궤도에서 회전하는 사고가 발생했습니다. 이 위성은 지상과의 안정적인 통신을 유지하지 못했으며, 자세 제어에 사용되는 반응 휠 중 두 개가 작동을 멈추는 심각한 문제를 겪었습니다.

링크 위성은 NASA의 5억 달러 규모 스위프트 관측소를 포획하고 대기권 마찰로 소멸하기 전에 궤도를 변경하기 위해 NASA로부터 3천만 달러 계약을 받은 위성 서비스 스타트업인 카탈리스트 스페이스 테크놀로지스(Katalyst Space Technologies)가 소유하고 운영하고 있었습니다.

엔지니어들은 이 위성을 구출하기 위해 여러 가지 방법을 계획하고 있으며, 특히 미세한 자세 제어를 위해 사용되는 냉가스 추진기에서 문제가 발견되었습니다. 현재 엔지니어들은 이 문제를 해결하고 위성을 안전하게 구출하기 위한 구체적인 계획을 수립하고 있습니다.

Is this Billboard Hot 100 hit AI slop?

래퍼 Fenix Flexin이 발표한 곡 "Rubberz"가 빌보드 핫 100 차트에서 58위에 오르며 주목받고 있습니다. 이 곡은 로스앤젤레스의 래퍼 듀오 Shoreline Mafia의 일원인 Fenix Flexin의 솔로 성공을 알렸지만, 동시에 곡의 기원에 대해 인공지능(AI)이 생성했을 것이라는 의혹이 제기되었습니다.

많은 사람들은 이 노래가 대부분 또는 완전히 AI에 의해 만들어졌다고 추측하고 있으며, 심지어 앨범 커버 아트 역시 AI로 생성된 것으로 보인다는 의혹이 제기되었습니다. 이러한 의혹은 곡의 음악적 스타일 변화에서 비롯되었는데, Fenix Flexin이 주로 트랩 영향을 받은 웨스트 코스트 랩을 다루는 반면, "Rubberz"는 80년대 영국 사운드에 크게 영향을 받은 것으로 분석됩니다.

Fenix Flexin은 이러한 의혹에 대해 부인했지만, 의혹을 해소하기에는 별다른 조치를 취하지 않았습니다. 따라서 이 논란은 음악 산업 내에서 AI 생성 콘텐츠의 출처와 진정성에 대한 논의를 촉발하는 사례로 볼 수 있습니다.

How Google helped destroy adoption of RSS feeds (2023)

구글이 RSS 피드의 채택을 어떻게 파괴했는지에 대한 기록을 살펴보면, 소수의 인기 기술 기업들이 오픈 웹 RSS 프로토콜을 활용하여 시장 점유율과 영향력을 얻었지만, 결국 사용자들을 묶어둔 후 지원을 철회하는 행태를 보였습니다. 구글은 RSS를 기반으로 제품을 구축하고 확장한 뒤 사용자들의 불만이나 요청에도 불구하고 지원을 제거함으로써 오픈 웹의 자유와 개방성에 심각한 위협을 가했습니다.

구체적으로 구글은 FeedBurner를 인수하여 RSS 피드를 광고 및 추적 메커니즘을 포함하도록 수정했고, 이후 개발자들이 외부 RSS 통합을 할 수 있도록 FeedBurner API를 차단했습니다. 또한, 2005년에 개발한 웹 기반 RSS 리더 애플리케이션인 Google Reader를 2013년에 사용량 감소를 이유로 종료시켰으며, Google Alerts에서도 RSS 기능을 제거하고 이메일만 남겼습니다. 이러한 일련의 조치들은 사용자들에게 RSS 피드를 계속 사용하기 위한 대안이나 교육을 제공하지 않아 많은 사용자들이 RSS 피드를 포기하게 만드는 결과를 낳았습니다.

구글은 Chrome 브라우저의 RSS 버튼이나 Chrome 확장 프로그램 등 다양한 접점에서 RSS 기능을 제거하거나 일시적으로 복구하는 행동을 반복했습니다. 이러한 역사는 구글이 RSS를 통해 성장했음에도 불구하고, 결국 RSS 지원을 철회함으로써 사용자 신뢰를 훼손했다는 것을 보여줍니다. 따라서 구글이 향후 제품에 RSS 기능을 통합할 경우, 이는 사용자 인식과 신뢰에 부정적인 영향을 미치지 않도록 지속적으로 지원하고 우선순위를 유지해야 할 것입니다.

죽어가던 소프트웨어: relayd(8)와 httpd(8)의 지속적인 진화

기존 OpenBSD 개발자들의 관심이 줄어들면서 정체되었던 relayd(8)와 httpd(8)의 개발이 실제 운영 수요를 가진 기여자들의 참여로 다시 활발해지고 있습니다. 이는 과거에는 특정 커뮤니티에 국한되었던 소프트웨어 개발이 실제 운영 환경에서 필요한 수요에 의해 재점화되고 있음을 의미합니다.

이러한 재활성화는 LLM이 코딩 지식을 대체하는 시대에 직접 C 언어를 익히고 도전해야 한다는 인식에서 출발합니다. 개발자들은 단순한 지식 습득을 넘어 시스템의 근본을 이해하고 직접 구현하는 경험의 중요성을 강조하며, relayd(8)의 수제 imsg 체계와 같은 깊이 있는 시스템 개발에 다시 주목하고 있습니다.

결국 relayd(8)와 httpd(8)의 지속적인 진화는 단순히 레거시 소프트웨어를 유지하는 것을 넘어, 운영체제 및 네트워크 시스템의 핵심을 직접 다루는 실질적인 개발 역량을 강화하는 데 기여합니다. 이는 미래의 소프트웨어 개발자들이 LLM에 의존하기보다 직접 시스템을 이해하고 개선하는 능력을 갖추도록 독려하는 중요한 움직임입니다.

NetBSD 11.0 Released

NetBSD 프로젝트가 2026년 8월 1일에 NetBSD 11.0 버전을 공식적으로 발표했습니다. 이번 릴리스는 CD-ROM 미디어용 ISO 이미지를 700MB 미만으로 분할하고 DVD 이미지로 제공하며, 플래시 기반 미디어 사용자는 .img 파일을 사용하도록 안내하고 있습니다. 설치 및 테스트를 위해서는 아키텍처별 설치 참고 자료를 확인하고 CDN에서 설치 이미지를 다운로드해야 합니다.

ARM 기반 장치를 사용하는 경우 U-Boot가 사전 구성된 netbsd-11 이미지를 별도로 확보해야 합니다. 시스템 사용 중 설치 문제나 오류가 발생하면 메일링 리스트를 통해 문의하거나 문제 보고서를 제출할 수 있습니다.

이번 릴리스는 AI 도구의 등장으로 인해 증가한 보안 문제들을 해결하기 위해 출시가 지연된 배경이 있습니다. 개발팀은 사용자들에게 테스트 시간을 제공하기 위해 릴리스 후보 버전을 거쳤으며, 전체 프로세스는 자동화되었으나 보안 책임자의 서명과 같은 수동 개입이 여전히 필요합니다.

현재 열려 있는 보안 관련 풀 리퀘스트들은 11.0 릴리스 직후 안정화 브랜치에 커밋되어 11.1 릴리스에 포함될 예정입니다. 이 중에는 hdaudio(4), ipfilter, pf와 관련된 수정 사항들이 포함되어 있으며, NetBSD 팀은 향후 두 달 이내에 11.1 버전을 출시하는 것을 목표로 하고 있습니다.

가짜 저자를 신고한 연구 논문 두 편이 모두 구두 발표로 채택됨

NeurIPS, WACV, ECCV, TerraBytes 등 주요 학회에서 심사된 논문 중 15편, 즉 전체의 68%에서 조작된 인용이나 저자 목록, 또는 명백한 LLM 생성 문장이 발견되었습니다. 이러한 문제점을 신고한 두 논문이 참고문헌 수정 조건을 걸고 구두 발표로 채택되는 결과를 얻었습니다.

이는 학술 문헌 내에서 인공지능 모델이 생성한 내용이나 조작된 정보가 광범위하게 사용되고 있음을 보여줍니다. 특히 2025년 학술 문헌에서는 약 14만 6,900건의 환각 인용이 발견되어 학계의 데이터 신뢰성에 대한 심각한 우려를 제기하고 있습니다.

연구자들이 인용 및 저자 정보의 정확성을 확보하는 것이 학술 커뮤니케이션의 중요한 과제가 되고 있음을 시사합니다. 따라서 AI 생성 콘텐츠의 출처와 정확성을 검증하는 기술과 방법론에 대한 논의가 더욱 중요해지고 있습니다.

Sam Altman is still making the case for parenting via ChatGPT

OpenAI의 CEO 샘 알트만은 ChatGPT를 활용한 육아에 대한 논의를 계속하고 있습니다. 그는 부모들이 가족 캘린더를 연결하고 자녀들의 관심사를 설명할 수 있으며, 매일 아침 등원길에 자녀들의 축구 경기나 생일 등에 대한 팟캐스트를 만들 수 있다는 '멋진 사용 사례'를 제시했습니다. 이러한 제안은 사용자들 사이에서 큰 반응을 얻었으며, 일부에서는 "아이들과 그냥 대화하면 되지 않느냐"는 질문이 확산되기도 했습니다.

알트만의 이러한 발언은 AI가 인간 경험의 복잡한 현실에서 사용자들을 보호할 수 있다는 주장을 뒷받침합니다. 실제로 마이크로소프트의 CEO 사티아 나델라 역시 아침 운전 중 좋아하는 팟캐스트를 듣는 대신 AI 챗봇에게 질문하는 방식을 도입한 바 있습니다. 알트만은 과거에도 ChatGPT가 신생아를 키우는 과정에 도움이 되었다고 언급한 바 있습니다.

OpenAI는 부모들을 대상으로 신뢰 기반의 경험을 구축하는 것을 우선순위로 삼고 있으며, 이를 위해 부모와 가족을 위한 경험 구축 경험을 쌓은 제품 관리자 채용 공고를 게시했습니다. 하지만 이러한 안전 기능에도 불구하고, ChatGPT가 사랑하는 사람들의 망상 및 자살에 어떤 영향을 미쳤다는 부모들과 가족들의 여러 소송에 직면하고 있습니다. 이에 대해 회사는 민감한 상호작용에서 모델의 응답 방식을 지속적으로 개선하고 있다고 밝혔습니다.

Spider-Man: Brand New Day leak racks up millions of views

스파이더맨: 브랜드 뉴 데이의 불법 복제본이 소셜 미디어에서 유출되어 큰 화제가 되었습니다. 해당 영상은 X에서 7시간 이상 노출되었으며 590만 계정에 도달하고 14만 3천 개의 좋아요를 기록했습니다. 다른 계정들이 이 유출된 영화를 재게시했지만 디즈니가 삭제 요청을 내리면서 게시 기간은 길지 않았습니다.

이러한 유출에도 불구하고 영화의 흥행세는 둔화되지 않을 것으로 보입니다. 이 영화는 이미 기록적인 박스오피스 성적을 달성하고 있으며 이번 주 프리뷰 기간 동안 7200만 달러를 벌어들였습니다. 이는 이전 기록 보유작인 어벤져스: 엔드게임이 2019년 프리뷰 기간 동안 6000만 달러를 기록한 것을 뛰어넘는 수치입니다.

결론적으로, 불법 유출은 영화의 흥행에 영향을 미치지 않았으며, 디즈니가 공식적으로 대응하면서 논란이 일단락되었습니다. 이 사건은 영화의 성공과 관련된 소셜 미디어의 확산력과 대중의 관심을 보여주는 사례입니다.

I ♥ RSS – A directory of people who love RSS

Andrew Shell이 RSS를 사랑하는 사람들을 위한 디렉토리인 I ♥ RSS를 출시했습니다. 이 사이트는 개인 웹사이트를 모아놓은 곳으로, Shell은 자신의 사이트에 배지를 추가하고 디렉토리에 사이트를 제출했습니다.

I ♥ RSS는 홈페이지에 FeedLand를 통해 구동되는 라이브 블로그롤을 보여주며, RSS에 관심 있는 다른 개발자들이 자신의 웹사이트를 추가할 수 있도록 초대하고 있습니다. 이는 RSS 피드 기반의 콘텐츠 집계 및 공유 플랫폼에 대한 관심과 커뮤니티 구축을 보여줍니다.

이 프로젝트는 RSS를 활용한 콘텐츠 관리 및 디렉토리 구축의 가능성을 제시하며, 개발자들이 피드 기반의 연결성을 어떻게 활용할 수 있는지에 대한 아이디어를 제공합니다. 관심 있는 개발자들은 이 디렉토리를 방문하여 자신들의 웹사이트를 추가할 수 있습니다.

Kaisel – Routes as Values. Dart 3 Native Router for Flutter

kaisel은 Dart 3 기반의 Flutter 네이티브 라우터로, 문자열 경로나 코드 생성 없이 라우팅을 값(Values)으로 처리하는 새로운 접근 방식을 제시합니다. 이 시스템은 Sealed Class와 Exhaustive Switch를 활용하여 라우팅을 값으로 다루기 때문에 컴파일 타임에 모든 경로를 처리해야 함을 보장하여 런타임에 발생할 수 있는 '알 수 없는 경로' 문제를 근본적으로 해결합니다.

kaisel은 내비게이션을 Sealed Type에 대한 스위치로 정의하며, 이는 라우팅의 안전성과 예측 가능성을 극대화합니다. 사용자의 이동 기록은 라우트 객체의 리스트로 관리되어 테스트가 용이하며, 프로세스 사망 후에도 복원 가능하도록 설계되었습니다. 이는 위젯 트리 없이도 테스트가 가능하고 상태를 보존할 수 있는 강력한 내비게이션 모델을 제공합니다.

또한 kaisel은 build_runner나 마법의 문자열 없이도 코드를 생성하지 않는 제로 코드젠 방식을 채택합니다. 라우트는 이미 개발자가 익숙한 Dart 클래스로 정의되며, 단일 NavigatorObserver만 등록하여 탭 전환이나 적응형 레이아웃 변경과 같은 모든 내비게이션 이벤트를 관찰할 수 있습니다.

이러한 설계는 기존의 go_router나 auto_route와 같은 라우터에서 제공하는 기능들을 계승하면서도, 타입 안전성과 런타임 안정성을 향상시키는 데 중점을 둡니다. kaisel은 Flutter 개발자가 더 안전하고 테스트하기 쉬우며 복원 가능한 라우팅 시스템을 구축할 수 있도록 돕습니다.

Franken.domains: Stitched-Together Domains, Because Every .com Is Taken

도메인(.com)이 모두 소진됨에 따라 franken.domains라는 서비스가 등장하여 연결되지 않는 인터넷 환경에서 새로운 도메인을 생성하고 있습니다. 이 서비스는 사전 속의 단어들을 사용하여 실제 국가 코드와 일반적인 TLD(최상위 도메인)에서 가져온 '기증 부위'들을 이어 붙여 새로운 도메인을 만드는 방식으로 작동합니다.

이들은 실제 단어들을 분리하여 다른 국가 코드와 TLD에서 가져온 도메인 조각들을 이어 붙여 새로운 도메인을 만들고 이를 등록 기관에 검증하는 과정을 거칩니다. 예를 들어, drangsalie.ren이나 monta.is와 같이 실제 단어와 다른 국가 코드를 결합하여 새로운 도메인을 생성하는 것입니다.

이러한 방식으로 생성된 도메인들은 아직 활성화되지 않은 상태이며, 등록 기관에 따라 거주 규칙이나 최소 길이 등의 제약이 있을 수 있습니다. 또한, 일부 등록 기관은 제휴 링크를 통해 거래를 중개하므로 프리미엄 가격이 적용될 수 있으며, 다른 사용자가 더 빠르게 도메인을 재활성화할 수도 있다는 점을 고려해야 합니다.

수학과 이론 컴퓨터 과학의 10가지 진전

OpenAI의 차기 주요 모델인 Astra 내부 버전이 최소 10년간 핵심 진전이 없었던 공개 문제 10가지에서 새로운 결과를 생성했습니다. 이 모델은 고차원 기하학부터 양자 복잡도, 격자 암호에 이르기까지 매우 광범위한 수학 및 이론 컴퓨터 과학 분야를 다루는 능력을 보여주었습니다.

이러한 결과는 기존 연구의 한계를 넘어선 새로운 지식 탐색을 가능하게 한다는 점에서 큰 의미를 가집니다. Astra는 단순히 기존 정보를 요약하는 것을 넘어, 난해한 이론적 문제에 대한 해법을 탐색하고 새로운 연결고리를 발견하는 데 기여했습니다.

해법 탐색 과정에서는 Sol API 요금 기준 약 2,000달러 상당의 토큰이 사용되었습니다. 이는 복잡한 이론적 문제를 해결하기 위해 대규모 언어 모델이 얼마나 많은 계산 자원을 필요로 하는지를 보여주는 구체적인 사례입니다.

결론적으로 Astra의 성과는 AI 모델이 순수 수학 및 이론 컴퓨터 과학 분야에서 얼마나 깊고 폭넓은 지식을 통합하고 새로운 발견을 생성할 수 있는지에 대한 중요한 시사점을 제공합니다.

Pgtestdb's template cloning approach to testing is fast

pgtestdb의 템플릿 복제 방식은 테스트를 수행하는 데 매우 빠르다는 연구 결과가 나왔습니다. 이 방식은 기존 테스트 데이터베이스를 처음부터 마이그레이션하거나 일부 프로젝트에서 사용하는 무거운 Docker 기반 기법보다 훨씬 빠르게 테스트 환경을 구축할 수 있습니다.

Postgres는 템플릿의 관계(relations)와 물질화된 힙(materialized heap), 인덱스, 카탈로그 파일을 8KB 페이지 청크 단위로 복사함으로써 이 속도를 달성합니다. pgtestdb의 복제와 River의 스키마 기반 테스트 방법론을 비교한 결과, 두 접근 방식의 설정 시간은 약 100ms로 놀라울 정도로 유사한 것으로 나타났습니다.

하지만 전체 테스트 스위트 실행 시간 측면에서는 스키마 기반 접근 방식이 더 유리합니다. 스키마 기반 방법은 테스트 상태를 보존하여 실패 시 검증이 용이하며, 전체 테스트 스위트 실행 시간을 pgtestdb 방식보다 약 3.5배 빠르게 만듭니다.

이러한 속도 향상을 극대화하기 위해 테스트 스키마 재사용을 통한 최적화가 가능합니다. 테스트 케이스가 완료된 후 사용하지 않는 스키마를 정리하고 재사용함으로써 테스트 환경 설정 시간을 10~20ms 수준으로 줄일 수 있으며, 이는 테스트 트랜잭션과 유사한 속도를 제공합니다. 다만 스키마 버전을 테스트할 때는 각 테스트 케이스가 예상하는 버전의 스키마만 재사용해야 하는 제약 조건이 있습니다.

Scope of Hacks on U.S. Water Supply Widens as Evidence Points to Iran

미국 수자원 시스템에 대한 해킹 범위가 확대되었으며, 이는 이란과의 연관된 증거들을 바탕으로 제기되고 있습니다. 이 사건은 사이버 공격이 물리적 인프라에 미치는 심각한 영향을 보여주는 사례로 주목받고 있습니다.

이번 보고는 이란이 미국 수자원 시스템을 대상으로 사이버 공격을 감행했다는 증거들을 제시하며, 공격의 범위가 점차 넓어지고 있음을 시사합니다. 이는 단순한 사이버 활동을 넘어 국가 간의 안보 문제와 인프라 보안에 대한 중대한 우려를 야기합니다.

해당 사건은 사이버 위협이 국가 간 관계와 핵심 기반 시설에 어떻게 영향을 미치는지에 대한 중요한 맥락을 제공합니다. 개발자 및 보안 전문가들은 이러한 사례를 통해 실제 공격이 시스템의 취약점을 어떻게 악용하고 피해를 확대하는지 이해하는 데 참고할 수 있습니다.

Kenji/Serious Eats – 30-Min Pressure Cooker Pho Ga

30분 압력솥으로 만드는 포가(Pho Ga) 레시피에 대한 기사가 소개되었습니다. 이 레시피는 복잡한 요리인 베트남식 소고기 국수 요리인 포가(Pho Ga)를 압력솥을 사용하여 단 30분 만에 완성하는 방법을 다룹니다.

이 방법은 시간 복잡도와 효율성을 중시하는 개발자들에게 흥미로운 접근 방식을 제공합니다. 일반적인 조리 과정보다 훨씬 짧은 시간 내에 재료의 맛과 깊은 풍미를 구현해내는 압력솥의 효율성을 극대화하는 데 초점을 맞추고 있습니다.

압력솥을 활용하면 재료가 빠르게 익으면서도 깊은 맛을 내는 것이 가능하며, 이는 복잡한 시스템을 최적화하여 최소한의 자원으로 최대의 결과를 얻으려는 기술적 접근 방식과 유사한 맥락을 가집니다.

이 레시피는 단순히 음식을 만드는 것을 넘어, 제한된 시간 내에 최적의 결과를 도출하는 효율적인 프로세스를 탐구한다는 점에서 주목할 만합니다. 압력솥을 활용하여 조리 시간을 단축하고 맛의 품질을 유지하는 방법을 이해하는 것은 새로운 요리 기술을 탐구하는 데 유용한 통찰을 제공합니다.

Indexing the Data Lake for Online Point Queries

Spotify와 같은 회사들은 온라인 서비스와 AI 에이전트를 위해 대규모 데이터를 낮은 지연 시간으로 접근할 수 있어야 합니다. 사용자의 청취 기록과 같은 개인화된 데이터에 대해 상호작용적인 속도로 데이터를 조회하고 페이지를 넘기는 것이 필수적입니다. 이러한 요구사항은 데이터 레이크에 저장된 페타바이트급 데이터에서 키를 기반으로 한 빠른 포인트 쿼리를 필요로 합니다.

현재 데이터 레이크는 GCS나 S3와 같은 빠른 스토리지 기술을 사용하지만, Trino나 BigQuery와 같은 분산 SQL 엔진은 분석 처리량에 중점을 두기 때문에 단일 행 조회에 대해 추가적인 작업 스케줄링 및 쿼리 계획 오버헤드를 발생시킵니다. 이는 데이터 접근의 병목 현상을 야기합니다.

이러한 문제를 해결하기 위해 랜덤 액세스 Parquet(RAP) 접근 방식이 제안됩니다. RAP는 외부 인덱스를 사용하여 키를 파일 위치에 직접 매핑함으로써, 데이터 레이크 내의 기존 Parquet 파일에 대해 중복된 읽기 작업 없이 필요한 데이터만 정확하게 가져올 수 있습니다. 이 방식은 여러 번의 종속적인 읽기 작업으로 인해 발생하는 지연 시간과 대역폭 문제를 해결합니다.

RAP는 데이터 레이크의 경제성을 변화시킵니다. 과거에는 데이터베이스에 보관해야 하는 이유가 있었지만, RAP를 사용하면 포인트 쿼리의 비용이 클라우드 스토리지 읽기 비용으로 줄어듭니다. 이를 통해 AI 에이전트가 KV 스토어에 제한되지 않고 수개월 또는 수년간의 데이터를 탐색할 수 있게 되며, 데이터 레이크가 배치 작업뿐만 아니라 상호작용적인 워크로드도 처리할 수 있게 됩니다.

그저 존재하는 법

인간은 아무것도 하지 않고 현재의 경험에 머무르는 상태, 즉 그저 존재하는 상태를 견디기 어려워합니다. 이러한 상태에서는 움직이거나 생각하려는 충동이 즉시 나타나기 때문에, 인간은 현재의 존재 상태를 지속하기를 힘들어합니다.

이러한 불편함은 일상생활에서 다양한 도피 행동으로 나타납니다. 물건을 구매하거나 다투거나 불필요한 식사를 하거나 무의미한 스크롤을 하거나 반추하는 행위는 현재의 순간에서 벗어나고자 하는 도피 행동으로 이어질 수 있습니다.

결국 이러한 행동들은 현재의 경험으로부터 벗어나려는 심리적 기제로 작용하며, 이는 인간이 '존재하는 상태'를 회피하려는 본능적인 반응임을 시사합니다. 이는 우리가 일상에서 경험하는 많은 행동들이 단순히 습관이 아니라 존재의 상태에 대한 불편함을 해소하려는 시도임을 보여줍니다.

Trump blames Tim Walz for water hacks even though it’s probably Iran

미국 미네소타주의 수자원 시스템을 대상으로 한 일련의 사이버 공격에 대해 FBI, EPA, 사이버보안 및 인프라 보안국(CISA)은 이란을 공식적으로 비난하지는 않았지만 이란이 공격의 배후일 가능성이 높다는 데 의견을 모았습니다. 이러한 상황에서 도널드 트럼프 전 대통령은 주지사 팀 월즈에게 책임을 돌리는 자신의 이론을 공유하며 "이란 사이버 공격은 없었다"고 주장했습니다.

이러한 트럼프의 발언은 FBI가 미국 인프라에 대한 사이버 공격이 다른 주들로 확산되고 있다는 경고를 발표한 직후에 나왔습니다. 미네소타 주에서만 최소 30개의 지역 수자원 시스템이 표적이 되었으며 이는 광범위한 인프라 보안 문제임을 시사합니다.

공식 기관들은 이란을 배후로 추정하고 있지만 정치적 논쟁은 계속되고 있습니다. 따라서 사이버 공격의 원인과 책임 소재에 대한 공식적인 판단과 정치적 주장이 공존하고 있음을 이해해야 합니다.

Explorative modeling: Train on the best of K guesses

탐색적 모델링(Explorative Modeling)은 기존 생성 모델에 세 번째 사전 학습 축을 추가하고 종단 간(end-to-end) 생성을 가능하게 하는 새로운 패러다임입니다. 이 모델링은 이미지, 비디오, 언어 전반에서 탐색을 증가시킴으로써 기존 모델의 일반화 능력을 향상시키며, 데이터와 매개변수를 확장할 때 성능 향상이 기하급수적으로 이루어집니다. 탐색적 모델은 샘플 효율성, FLOP 효율성, 매개변수 효율성에서 각각 6.2배, 4.1배, 47%의 개선을 달성합니다.

이 접근 방식은 모델이 데이터를 직접 예측할 때 발생하는 근본적인 문제, 즉 예측에 여러 유효한 답(모드)이 존재하여 평균값(blur)으로 수렴하는 문제를 해결합니다. 탐색적 모델은 생성을 여러 작은 단계로 나누어 각 단계가 하나의 정답만을 갖도록 학습함으로써 이 문제를 극복합니다. 예를 들어, 자기회귀 모델은 한 번에 전체를 예측하는 대신, 한 번에 한 부분씩 예측하는 방식으로 작동하며, 확산 모델은 노이즈에서 데이터로 수백 번의 작은 단계를 거치며 가능성을 좁혀 나갑니다.

이러한 분할된 생성 과정은 LLM이나 이미지 모델뿐만 아니라 MeanFlow와 같은 최신 모델에서도 적용되며, 이를 생성 과정을 분할하는 것으로 간주합니다. 이는 모델의 크기와 학습 데이터의 규모를 확장하는 것만으로는 생성 능력을 확장할 수 없다는 점을 시사하며, 모델이 평균을 취하는 대신 모드를 포착하도록 학습하는 것이 생성 모델의 핵심 능력임을 보여줍니다.