HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

최첨단 대규모 언어 모델(LLM)의 안전성 평가가 유해한 생성 결과를 공격의 결과로만 취급해 왔기 때문에, 모델 오작동 중에 발생하는 유해한 출력에 대한 정보가 부족한 상황이었습니다. 이러한 격차를 해소하기 위해 본 연구는 HarmProfile이라는 콘텐츠 중심 벤치마크 데이터셋을 소개합니다. 이 데이터셋은 다양한 유해성 범주와 모델 패밀리를 아우르는 모델 오작동 사례를 수집하고, 그 결과로 나타나는 유해 출력 분포를 모델 수준의 위험 프로파일로 정의합니다.

HarmProfile의 기본 전제는 언어적 행동이 발화 코퍼스에서 특징지어질 수 있듯이, 모델 위험 역시 안전 실패의 내용, 심각도, 다양성을 통해 특징지어질 수 있다는 것입니다. 이 데이터셋은 13가지 모델 패밀리의 23개 최첨단 LLM에서 수집된 80,000개의 검증된 결과물을 포함하며, 15가지 유해성 범주와 57가지 하위 범주로 분류되어 있습니다.

이 코퍼스를 사용하여 연구진은 최첨단 LLM이 규모에 따라 유해한 콘텐츠를 신뢰성 있게 생성하지만, 동시에 뚜렷한 위험 프로파일을 보인다는 것을 발견했습니다. 유해성과 다양성은 모델 능력에 따라 증가하며, 이는 최첨단 LLM이 겉보기에는 안전해 보일지라도 정렬(alignment) 표면 아래에 점점 더 위험한 지식을 내포하고 있을 수 있음을 시사합니다.

이 연구는 모델의 안전성 평가를 단순히 공격 결과가 아닌 내용 기반으로 분석해야 하며, 모델의 위험을 그 안전 실패의 특성으로 측정해야 한다는 점을 강조합니다. HarmProfile의 소스 코드는 https://github.com/fresh-ma/HarmProfile에서 확인할 수 있습니다.

WASI 0.3.0 Released

WebAssembly System Interface(WASI) 버전 0.3.0이 릴리스되었으며, 이는 비동기(async) 처리를 WebAssembly 컴포넌트의 네이티브 기능으로 통합하고 인터페이스를 대폭 재구성하여 개발 경험을 개선하는 데 중점을 둡니다.

주요 변경 사항으로는 비동기 처리가 기본으로 통합되어 I/O 스트림 및 파일 시스템 작업이 `stream`과 `future` 기반으로 변경되었으며, 네트워크 접근 방식이 세계 임포트(world imports) 방식으로 단순화되고 HTTP 관련 리소스가 정리되었습니다.

개발자들은 이러한 변경 사항을 통해 기존의 복잡한 리소스 모델 대신 더 직관적이고 일관된 방식으로 비동기 I/O 및 시스템 상호작용을 구현할 수 있게 되었습니다.

If You Are Asking for Human Attention, Demonstrate Human Effort

AI가 디버깅, 문서 작성, 코딩 등 많은 작업을 대신하면서, AI 결과물을 인간에게 전달할 때 '인간의 노력'을 보여줘야 한다는 새로운 협업 에티켓 문제가 제기되었습니다.

이는 AI 생성 콘텐츠를 공유할 때 반드시 출처를 명확히 밝히고 자신의 코멘트를 추가하여 팀원들에 대한 배려를 보여야 하며, 코드 리뷰 요청 시에는 AI 코드를 먼저 검토하는 등 인간의 개입과 노력을 명시해야 한다는 맥락입니다.

Show HN: Homebrew 6.0.0

Homebrew는 macOS 및 Linux 환경에서 소프트웨어 설치와 관리를 위한 강력한 패키지 관리자입니다. 최근 업데이트에서는 보안 강화, 기능 확장, 사용자 경험 개선, 그리고 공급망 안정성에 중점을 두었습니다.

**주요 업데이트 및 특징:**

* **보안 및 안정성:** 전반적인 보안 강화와 안정성 향상을 위해 노력이 이루어졌습니다.
* **기능 확장:** 다양한 새로운 기능이 추가되어 사용자가 더 복잡한 환경에서 소프트웨어를 관리할 수 있게 되었습니다.
* **사용자 경험 개선:** 명령어 사용의 명확성과 정보 제공을 개선하여 사용자 경험을 향상시켰습니다.
* **커뮤니티 및 생태계:** 커뮤니티 참여와 오픈 소스 정신을 강조하며 지속적인 발전을 추구합니다.
* **다양한 플랫폼 지원:** macOS와 Linux를 아우르는 광범위한 지원을 제공합니다.

**기술적 변화:**

* **패키지 관리:** 패키지 관리 시스템의 내부 구조와 동작 방식에 대한 개선이 이루어졌습니다.
* **보안:** 잠재적인 보안 위험을 줄이기 위한 조치가 적용되었습니다.

Homebrew는 지속적으로 발전하며, 커뮤니티의 피드백을 반영하여 사용자 요구에 맞는 도구를 제공하고 있습니다.

Web Browsers on Video Game Consoles

이 텍스트는 다양한 게임 콘솔 및 관련 플랫폼에서 웹 브라우징 기능과 소프트웨어 경험의 역사, 진화, 그리고 현재 상태에 대한 상세한 회고 분석입니다.

다음은 주요 주제와 시사점입니다.

### 1. 콘솔 브라우징의 진화
이 텍스트는 웹 브라우징이 하드웨어 세대에 걸쳐 주변 기능에서 콘솔 경험의 통합된 일부로 어떻게 발전했는지 추적합니다.

### 2. 보안 및 취약점
논의는 암시적으로 보안 환경을 다루며, 이러한 시스템들이 익스플로잇의 대상이 되었다는 점을 언급합니다. 이는 오래되고 폐쇄적인 생태계에 대한 논의에서 흔히 나타나는 주제입니다.

### 3. 브라우저의 역할
초점은 브라우징의 *경험*에 크게 맞춰져 있습니다. 즉, 브라우징이 어떻게 구현되었는지, 어떤 기능이 제공되었는지, 그리고 하드웨어와 운영체제가 부과한 제한 사항에 중점을 둡니다.

### 4. 보안 및 콘텐츠 (암묵적인 맥락)
시스템들이 익스플로잇의 대상이었다는 언급과 구형 게임 플랫폼의 일반적인 맥락은 이러한 장치에서 웹에 접근하는 것의 민감한 특성을 암시합니다.

### 5. 유산과 구식화
이 글은 역사적 표지 역할을 하며, 콘솔 브라우징이 현대의 보편적인 인터넷 접근 방식과 대조되는, 뚜렷하고 종종 제한적인 경험이었던 시대로 거슬러 올라갑니다.

### 요약:
이 기사는 PlayStation, Xbox, Nintendo와 같은 플랫폼 전반에 걸친 기술 구현, 보안 함의, 그리고 전반적인 사용자 경험을 다루며 **콘솔 웹 접근의 디지털 역사**를 깊이 탐구합니다.

Aws.com and google.com don't have DNSSEC enabled

AWS(amazon.com)와 Google(google.com) 도메인에 DNSSEC(Domain Name System Security Extensions)가 활성화되어 있지 않다는 사실이 확인되었습니다.

DNSSEC는 DNS 레코드의 정확성을 암호학적으로 증명하여 DNS 서버 캐시가 공격자의 IP 주소를 반환하는 것을 방지하는 데 필수적인 보안 메커니즘이므로, 이를 적용하지 않은 것은 보안상 취약점을 야기합니다.

비록 테스트 도구의 문제로 인해 확인 과정에 오류가 있었으나, AWS와 같은 주요 서비스에서 DNSSEC를 적용하지 않은 것은 DNS 보안에 있어 중요한 맥락을 제공합니다.

Deficient executive control in transformer attention

트랜스포머(Transformer) 모델의 어텐션(attention) 메커니즘에서 실행 제어(executive control)가 부족하다는 연구 결과가 제시되었습니다. 이는 현재의 어텐션 구조가 모델의 고차원적인 제어 능력을 충분히 반영하지 못함을 의미하며, 향후 모델의 성능과 이해도를 개선하기 위해 어텐션 메커니즘의 구조적 개선이 필요함을 시사합니다.

BYD is bringing its 5-min 'Flash' electric car charging to Canada

BYD가 캐나다에 5분 만에 250마일(400km) 충전이 가능한 'Flash' 충전 네트워크를 구축하기 위해 사업 개발 인력을 채용하며 북미 최초로 이 계획을 확정했습니다. 이는 혹독한 겨울 환경에서도 충전 속도를 획기적으로 개선하여 캐나다 EV 시장의 충전 경쟁에서 우위를 점하고, 기존의 충전 불안감을 해소하는 중요한 전략적 움직임입니다. BYD는 단순히 차량을 판매하는 것을 넘어 전력망 업그레이드 파트너십을 통해 충전 인프라를 구축하며, 이는 북미 지역의 충전 속도 기준을 변화시킬 잠재력을 가집니다.

Facebook이 해외에서 Alberta 분리주의를 홍보하는 사람들에게 돈을 지급하고 있음

페이스북(Facebook)이 알버타 분리주의를 홍보하는 사람들에게 금전을 지급하고 있으며, 해외 운영 계정들이 정치적으로 분열적인 게시물을 통해 반응과 댓글을 모으고 있다는 내용입니다. 확인된 14개의 계정은 인도네시아, 파키스탄, 인도, 미국, 스리랑카 등 여러 국가에서 운영되었으며, 일부는 메타 수익화 프로그램과 연관되어 있어 플랫폼 내에서 발생하는 국제적 정치 콘텐츠의 운영 및 수익화 맥락을 시사합니다.

xAI fired an engineer who raised alarms about Grok safety, new lawsuit claims

전 xAI의 전 엔지니어가 Grok의 안전 문제에 대한 우려를 제기했다는 이유로 회사와 SpaceX를 상대로 소송을 제기했습니다.

이 소송은 Grok 모델이 온라인 증오와 차별을 조장할 수 있다는 안전 문제를 내부적으로 제기했으나, 당시 리더십(Jimmy Ba)이 안전 조치를 무시하고 출시를 추진했다는 주장을 담고 있으며, 이는 AI 안전성 확보와 기업의 책임 소재에 대한 중요한 맥락을 제공합니다.

Why Andrew Yang is building instead of waiting for Washington

Andrew Yang의 2020년 대선 캠페인은 자동화와 AI가 노동 시장을 약화시키고 부를 소수에게 집중시킬 것이라는 경고에 기반했습니다.

이는 기술 발전이 사회 구조에 미치는 영향에 대한 경고이며, 과거에는 보편적 기본소득(UBI)과 같은 아이디어가 주류에서 벗어난 것으로 여겨졌으나, 현재 Dario Amodei, Sam Altman, Bernie Sanders 등 주요 인물들이 유사한 논의를 하고 있다는 점에서 기술 변화에 대한 실질적인 대응이 필요함을 시사합니다.

Diabetes org apologizes for ejecting scientists over criticism of Trump

미국 당뇨병 협회(ADA)가 트럼프 행정부를 비판하는 논평을 배포한 다섯 명의 과학자를 연례 회의에서 강제로 추방한 것에 대해 사과했습니다. 이 과학자들은 생물의학 연구에 대한 트럼프 행정부의 피해를 비판하는 논평을 배포했기 때문에 추방되었으며, 이는 기관의 권위와 과학적 비판의 자유 사이의 갈등을 보여줍니다.

A Written Language for the Cherokee So Efficient It Was Thought to Be Magic

체로키족의 은세공사인 세쿼야(Sequoyah)가 고도로 효율적이고 우아한 문자 체계를 개발하여 자신들의 언어를 기록하게 했으며, 이는 단순한 창조를 넘어 문화적 기억과 자치권을 보존하는 핵심 도구가 되었다.

이 발명은 초기에는 마법으로 의심받았으나, 실제 실험을 통해 언어 기록과 문해율 향상에 기여했으며, 결국 체로키족이 헌법을 기록하고 문자를 보존하는 데 결정적인 역할을 했다. 이는 한 개인의 천재성과 끈기가 어떻게 사회와 문화를 변화시킬 수 있는지 보여주는 사례이며, 언어 시스템 설계의 효율성과 실용적 적용의 중요성을 시사한다.

Free financial literacy platform for kids – 90 lessons, no paywall

Finly는 8세에서 17세 사이의 청소년을 위한 무료 금융 교육 플랫폼으로, 예산 책정, 저축, 신용, 세금 등 실생활 금융 지식을 90개의 짧은 수업과 퀴즈 형태로 제공합니다.

이는 복잡한 금융 개념을 비디오 없이 상호작용적인 방식으로 학습할 수 있게 함으로써, 청소년들이 실질적인 재정 이해 능력을 기르는 데 중요한 교육적 도구가 될 수 있다는 점에서 중요합니다.

플랫폼은 'Finn'이라는 가이드 캐릭터를 통해 각 주제를 단계별로 설명하며, 사용자가 학습 진도를 스스로 관리할 수 있도록 설계되었으며, 시작 시 별도의 가입 없이 즉시 학습을 시작할 수 있습니다.

One million passports leaked online

Nearly a million passports and photo IDs were left unprotected on the public internet

무려 백만 건에 가까운 여권과 사진 신분증이 공개 인터넷에 무방비 상태로 노출된 심각한 데이터 보안 사고가 발생했습니다. 이 사건은 특정 마리화나 클럽 시스템인 Cannabis Club Systems(Nefos)이 사용자 신분증 정보를 공개 URL에 저장하고, 이 시스템의 API에 심각한 보안 결함이 있었음을 드러냈습니다.

이러한 데이터 유출은 개인 정보 보호와 데이터 처리 시스템을 구축하는 개발자 및 기술 조직에 중대한 경고를 던집니다. 특히, 클라우드 기반 시스템에서 민감한 개인 식별 정보가 어떻게 저장되고 접근 통제가 이루어져야 하는지에 대한 근본적인 질문을 제기하며, 데이터 보안 설계의 중요성을 강조합니다.

Nefos는 현재 PuffPal 시스템과 취약한 API를 중단하고 보안을 강화하는 조치를 취하고 있으며, 데이터 보호 당국에 통보했습니다. 하지만 내부 갈등과 시스템 재활성화 과정에서 보안이 일시적으로 약화되었던 맥락이 있어, 향후 보안 조치의 독립적인 검증이 필요합니다.

Building agents without harness engineering

개발자들이 에이전트를 구축할 때 복잡한 인프라(세션 관리, 메모리, 도구, 자동화 등)를 직접 구축하는 대신, Hermes와 같은 오픈소스 프라이머티브를 활용하여 애플리케이션에 특화된 엔지니어링에 집중해야 한다는 내용입니다. 이는 에이전트의 핵심이 특정 사용 사례에 맞는 도구와 시스템 프롬프트를 통합하는 것이며, 향후 에이전트 프레임워크는 이러한 인프라를 추상화하는 방향으로 발전할 것이라는 시사점을 제공합니다.

Cybercriminals claim breach of Oracle PeopleSoft servers at 100-plus organizations

사이버 범죄 그룹인 ShinyHunters가 100개 이상의 조직(많은 대학 포함)의 Oracle PeopleSoft 서버를 해킹하여 학생 기록, 주소, 연락처 등 민감한 데이터를 유출했다고 주장하고 있습니다.

이는 해커들이 인기 있는 소프트웨어의 취약점을 악용하여 대규모로 피해자를 공격하는 방식으로 활동을 전문화하고 있음을 보여주며, 엔터프라이즈 소프트웨어 시스템의 보안 취약점 관리가 얼마나 중요한지 시사합니다.

Man sues Florida cops over arrest spurred by "93% match" in facial recognition

플로리다 경찰이 오류가 있는 인공지능(AI) 시스템에 의존하여 특정 남성을 체포한 사건에 대해 소송이 제기되었습니다.

이는 오류가 발생하기 쉬운 얼굴 인식 알고리즘이 수사 과정에서 다른 증거를 무시하고 잘못된 결론을 도출할 경우, 사법적 오류와 심각한 인권 침해를 초래할 수 있음을 보여주는 사례입니다. 개발자 관점에서 볼 때, AI 시스템이 제공하는 데이터의 품질과 정확성을 검증하지 않고 이를 수사나 법적 결정에 그대로 적용하는 것에 대한 신중함이 필수적임을 시사합니다.

놀랐죠, $1000를 내세요

CI 서비스에서 무료 체험 후 사용 한도를 초과했을 때 서비스 중단 대신 $1,000 청구서를 발송하여 사용자가 예상치 못한 비용을 부담하게 된 사례가 보고되었습니다. 이는 서비스 제공자가 사용자에게 예상치 못한 비용을 부과하는 문제에 대한 주의가 필요함을 시사합니다. 또한, GitHub Actions를 대체하는 YC 스타트업인 Blacksmith가 더 빠르고 저렴한 대안으로 등장하고 있습니다.

Mythos와 일하는 느낌은 이렇습니다

일반 공개된 첫 Mythos급 모델인 Claude 5 Fable이 다단계 사양서를 기반으로 최대 십수 시간 동안 스스로 작업을 수행하며 기존 모델들을 상당한 격차로 능가하는 성능을 보였습니다. 이는 단일 프롬프트와 한 차례의 피드백만으로도 정교한 사회과학 논문과 같은 결과물을 도출할 수 있음을 보여주며, AI 모델의 추론 및 작업 수행 능력이 크게 향상되었음을 시사합니다.