D2의 다이어그램 자동 배치 엔진 TALA, 오픈소스로 공개

소프트웨어 아키텍처 다이어그램의 자동 배치를 위한 TALA가 오픈소스로 공개되었습니다. TALA는 텍스트를 기반으로 다이어그램을 생성하는 D2와 동일한 MPL-2.0 라이선스로 배포되었으며, D2 버전 0.9.0에 기본으로 포함되어 제공됩니다.

TALA의 핵심은 소프트웨어 구성 요소의 자동 배치를 담당하는 것으로, 기존의 한 방향으로 뻗는 DAG 중심 배치 방식에서 벗어나 화이트보드 그림에 가까운 직교 배치를 지향합니다. 이는 복잡한 시스템 아키텍처를 시각화할 때 보다 직관적이고 유연한 배치 방식을 제공하여 개발자들이 아키텍처를 더 쉽게 이해하고 표현할 수 있도록 돕습니다.

이러한 직교 배치는 기존의 DAG 중심 배치 방식보다 더 유연한 레이아웃을 가능하게 하여, 소프트웨어 구조를 표현하는 데 있어 시각적 명확성을 높이는 데 중점을 둡니다. TALA는 D2의 기능을 확장하여 자동 배치 엔진을 제공함으로써, 개발자들이 소프트웨어 아키텍처를 설계하고 문서화하는 데 필요한 도구를 더욱 강화할 것으로 기대됩니다.

DHS ‘예측 치안’ 부서, 미국인의 금융 습관 분석

미국 국경순찰대(Border Patrol)는 미국인의 데이터를 분석하여 지역 경찰의 차량 정차 단속으로 연결하는 비밀스러운 예측 치안 부서를 운영하고 있습니다. 이 부서는 미국인의 금융 활동과 기타 데이터를 분석하여 치안 예측에 활용하고 그 정보를 지역 경찰에 전달하는 방식으로 작동합니다.

이러한 예측 치안 시스템은 금융 활동과 기타 데이터를 광범위하게 분석하여 특정 지역의 치안 위험을 예측하는 데 사용됩니다. 분석을 통해 얻은 정보는 실제 경찰 활동, 특히 차량 정차 단속과 같은 현장 단속으로 이어지게 됩니다.

이러한 데이터 흐름은 연방 기관이 수집한 민감한 개인 정보가 지역 법 집행 기관에 전달되는 구조를 보여줍니다. 따라서 데이터 수집, 분석, 그리고 법 집행 간의 연계 과정에서 개인 정보 보호 및 데이터 사용의 윤리적 측면에 대한 논의가 필요합니다.

Paramount, 약 167조원 합병 지지 여론 조성에 ‘위장 풀뿌리’ 단체 활용하다 적발

파라마운트가 약 1,110억 달러 규모의 워너 브라더스 합병에 대한 대중의 지지를 부풀리기 위해 비영리단체인 네이버스 포 스트롱 커뮤니티스(Neighbors for Strong Communities)를 활용한 사실이 드러났습니다. 이 단체는 합병에 대한 지지 여론을 조성하는 데 사용되었습니다.

이 비영리단체는 이러한 목적을 달성하기 위해 캘리포니아 주민들에게 문자를 발송하는 방식으로 활동을 진행했습니다. 이 활동은 로브 본타 주 법무장관이 제기한 반독점 소송 철회에 영향을 미치려는 의도를 가지고 이루어졌습니다.

결과적으로 이 단체의 활동은 주 법무장관의 소송 철회 논의에 간접적인 영향을 미치려 시도되었습니다. 이는 거대한 기업 합병에 대한 대중 여론을 조작하려는 시도가 법적 절차에 영향을 미치려는 시도로 연결된 구체적인 사례입니다.

fnprint - 실행 동작을 비교해 바이너리 속 함수를 식별하는 도구

fnprint는 소스 코드가 없고 함수 이름도 제거된 실행 파일에서 실행 동작을 비교하여 바이너리 내의 함수를 식별하는 역공학 도구입니다. 이 도구는 이름이 알려지지 않은 함수를 분석하여 알려진 함수들과의 동작 유사성을 대조함으로써 해당 함수가 어떤 역할을 하는지 추론할 수 있게 해줍니다.

예를 들어, 사용자는 이름이 없는 함수를 분석했을 때, 그 함수의 실행 패턴이 zlib 라이브러리의 압축 함수인 compress2와 유사하다는 결과를 얻을 수 있습니다. 이는 개발자가 소스 코드가 없는 바이너리 내부에서 숨겨진 함수나 라이브러리 호출의 기능을 역으로 파악하는 데 도움을 줍니다.

이러한 접근 방식은 복잡한 바이너리 분석 환경에서 명시적인 이름 정보가 부족할 때도 함수 수준의 기능을 식별하는 데 유용합니다. fnprint는 실행 동작이라는 객관적인 데이터를 활용하여 코드의 내부 구조를 이해하는 데 중요한 단서를 제공합니다.

극단적인 서버 사이드 렌더링 (2025)

HTTP 응답을 끝내지 않고 HTML과 CSS를 계속 전송하면 프론트엔드 JavaScript 없이도 화면을 동적으로 변경할 수 있다는 발상에서 출발한 실험입니다. 이 기술은 브라우저가 도착한 내용을 즉시 렌더링하는 특성을 활용하여 서버 사이드 렌더링을 극단적으로 활용하는 방식입니다.

실험의 핵심은 사용자 입력이 숨겨진 iframe으로 폼을 제출하는 방식으로 이루어지며, 이를 통해 메인 페이지로 이동하거나 화면을 동적으로 조작하는 데 사용됩니다. 이는 전통적인 프론트엔드 JavaScript의 개입 없이 서버 측에서 HTML과 CSS를 지속적으로 전송함으로써 화면 변화를 구현하는 방법론을 제시합니다.

이러한 접근 방식은 서버 사이드 렌더링의 특성을 이용하여 동적인 UI 변경을 가능하게 한다는 점에서 주목할 만합니다. 개발자는 HTTP 응답의 완료 여부와 브라우저 렌더링 사이클을 이해하고 이를 활용하여 새로운 상호작용 방식을 탐색할 필요가 있습니다.

Qwen-Drive-1.0 - 도로 상황을 이해하고 주행 경로까지 계획하는 자율주행 AI 모델

Qwen-Drive-1.0은 주변 환경의 3차원 인식, 주행 상황에 대한 질의응답, 그리고 차량의 이동 경로 계획 기능을 하나로 결합한 자율주행 AI 모델입니다. 이 모델은 도로 상황을 이해하고 주행 경로까지 계획하는 것을 목표로 개발되었습니다.

이 모델은 Qwen3.5-4B의 기본 구조를 유지하면서 주변 공간을 인식하는 모듈과 주행 경로를 생성하는 모듈을 추가하여 기능이 확장되었습니다. 이를 통해 주변 물체의 위치와 공간 점유 상태, 그리고 도로 구조에 대한 정보를 종합적으로 처리할 수 있게 되었습니다.

Qwen-Drive-1.0은 주변 환경에 대한 3D 인식을 기반으로 주행 상황을 분석하고 이에 따른 최적의 이동 경로를 계획하는 데 중점을 둡니다. 이는 단순히 환경을 인식하는 것을 넘어 실제 주행 경로를 생성하는 자율주행 시스템의 핵심 기능을 구현하는 데 기여합니다.

2026년 유럽 클라우드 제공업체의 현황

2026년 유럽 클라우드 제공업체 현황에 대한 비교 분석 결과, 개인용 공개 서버를 찾고 VPS가 없는 bunny.net을 기준으로 시간 단위 과금과 실제 이용 가능성을 충족하는 네 곳이 선정되었습니다. 비교 대상은 Hetzner, UpCloud, Leafcloud, 그리고 Exoscale 네 곳입니다.

이 네 제공업체는 월 10유로에서 20유로 예산 범위 내에서 가격, 실제 CPU 성능, Geekbench 점수, 네트워크 성능 등을 종합적으로 비교하여 평가되었습니다. 이는 예산 제약이 있는 개발자들이 유럽 내에서 개인 서버를 운영할 때 어떤 선택지가 현실적인지 판단하는 데 중요한 기준이 됩니다.

해당 분석은 단순히 가격만을 비교하는 것이 아니라 실제 사용 가능성과 성능 지표를 고려하여 서버 운영 환경의 실질적인 가치를 평가하는 데 중점을 두었습니다. 따라서 서버 구축 시 비용뿐만 아니라 하드웨어 성능과 네트워크 안정성까지 고려해야 합니다.

결론적으로 이 비교는 유럽 클라우드 시장에서 특정 예산 범위 내에서 개인 개발자가 서버를 운영하기 위해 고려할 수 있는 구체적인 옵션을 제시합니다.

2026년, 비밀번호 관리자 전환하기

iPhone과 iPad에서 지원되는 앱들 간에 비밀번호, 패스키, 인증 코드, 메모 등의 정보를 한꺼번에 이전할 수 있게 되어 비밀번호 관리자를 전환하는 것이 훨씬 쉬워졌습니다. 이러한 기능은 사용자가 여러 서비스에 분산된 정보를 통합하여 비밀번호 관리자를 변경하는 과정을 간소화합니다.

이러한 데이터 이전은 Credential Exchange Format과 운영체제의 보안 전송 기능을 결합하여 이루어집니다. 이를 통해 사용자는 복잡한 수동 작업 없이 안전하게 정보를 이동할 수 있게 되었습니다.

실제로 1Password에서 Apple Passwords로 100개의 항목을 성공적으로 옮긴 사례가 있으며, 이는 이러한 통합 기능이 실제 환경에서 어떻게 활용될 수 있는지 보여줍니다. 개발자 관점에서 볼 때, 운영체제 수준에서 보안 전송 기능을 활용하여 이러한 민감한 정보를 효율적으로 관리하고 이전하는 방식은 향후 보안 시스템 설계에 중요한 맥락을 제공합니다.

내 소프트웨어의 기본 라이선스를 MIT에서 EUPL로 바꿨다

소프트웨어 개발자가 기본 라이선스를 MIT에서 EUPL-1.2로 변경하고 최근 공개한 소프트웨어에 적용했습니다. 이는 28년간 소프트웨어를 공개하며 LGPLv2와 MIT 라이선스를 사용해 온 개발자가 라이선스 정책에 대한 근본적인 변화를 시도한 사례입니다.

이러한 전환의 동기는 허용적 라이선스가 사용자나 개발자의 이익보다는 대기업의 개발 비용 절감과 부의 축적에 더 기여했다는 판단에서 비롯되었습니다. 즉, 기존 라이선스 체계가 개발자 커뮤니티의 이익에 충분히 기여하지 못했다는 문제의식에서 비롯된 결정입니다.

개발자들은 소프트웨어 라이선스가 단순히 사용 허가를 넘어 커뮤니티와 개발자의 이익을 보호하는 방향으로 변화해야 한다고 주장해 왔습니다. 따라서 기본 라이선스를 EUPL로 변경함으로써 소프트웨어의 사용과 배포에 대한 책임과 이익의 분배 방식을 재고하고자 합니다.

이러한 변화는 소프트웨어 라이선스 정책이 단순한 법적 규제를 넘어 개발 생태계 내에서 공정한 가치 분배를 실현하는 도구가 될 수 있음을 시사합니다. 향후 다른 개발자들도 라이선스 선택에 있어 이러한 사회적, 경제적 관점을 고려할 필요가 있습니다.

AI Responsibility – OpenAI and Anthropic

야콥 콕슨이 앤스로픽(Anthropic)을 퇴사하며 AI 책임에 대한 심각한 우려를 제기했습니다. 그는 지난 3년간 오픈AI와 앤스로픽 양사에서 사전 학습 연구를 수행했으며, 두 회사 모두 책임감 있게 행동하고 있지 않다고 지적했습니다.

콕슨은 이들이 스스로 개선하는 초지능을 향해 질주하며 우리의 삶을 도박하고 있다고 주장했습니다. 그는 AI 개발자들이 10년 말까지 인류를 멸망시킬 수 있다고 믿는 경향이 있으며, 이러한 경쟁에 참여하는 것은 오만하고 위험한 도박이라고 강조했습니다.

그는 정렬(alignment)을 가속화하는 과정에서 더 나은 경로가 없다는 확신 없이 경쟁을 시작하는 것은 부적절하다고 말했습니다. 하지만 그는 협력의 가능성도 언급하며 Hugging Face 공격과 같은 사건들이 미국 연구소 간의 속도 조절 합의를 가능하게 했을 수 있다고 보았습니다.

결론적으로 그는 연구자들이 초지능의 마음을 충분히 이해하지 못한 채 초지능 강화 학습(RL)를 시작하는 것에 대해 숙고해야 한다고 촉구했습니다. 이는 단순히 기술적 경쟁을 넘어 인류의 생존과 관련된 중대한 문제임을 시사합니다.

NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

NCP-ArchPreview는 표준 다음 토큰 예측(NTP)을 넘어 잠재 공간 언어 모델을 발전시키는 새로운 방식인 다음 개념 예측(NCP)을 도입한 모델입니다. 이 모델은 여러 토큰에 걸친 이산적인 개념을 예측함으로써 명시적이고 더 도전적인 개념 수준의 목표를 제시하면서도 표준 토큰 수준의 자기회귀 생성 능력을 유지합니다. NCP-ArchPreview는 은닉 상태에서 직접 제품 양자화된 개념 어휘를 구성하여 잠재 공간을 구축하고 전용 개념 모듈을 통해 미래 개념을 예측합니다.

이 아키텍처는 89억 개의 파라미터로 확장되었으며 Dolma-3 데이터셋의 5조 7300억 토큰으로 학습되어 현재까지 가장 큰 잠재 공간 언어 모델 시연을 달성했습니다. 놀랍게도 전체 학습 토큰의 51.3%만을 사용하여 이 목표를 달성했으며, 표준 계산의 85%만을 소비함으로써 엄격하게 파라미터 정렬된 89억 파라미터 기준 모델의 학습 손실에 근접합니다.

사전 학습 후에도 학습된 잠재 공간은 매우 유용하며, 17백만 파라미터의 VQ 모듈만 업데이트해도 도메인 적응을 위한 새롭고 경량의 인터페이스를 제공합니다. 또한, 개념 표현을 DFlash2 드래프터에 간단히 주입하는 것만으로도 평균 수용 길이를 4.17% 개선하면서 무시할 만한 오버헤드를 보입니다.

An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

모델의 후처리 및 테스트 시간 추론 설계가 난해한 올림피아드 수학에 대한 자연어 증명 생성에 미치는 영향을 연구했습니다. 연구팀은 Nemotron 3 Ultra를 기반으로 지도 미세 조정(SFT)과 강화 학습(RL)을 사용하여 두 개의 전문가 체크포인트를 훈련하고, 체크포인트 선택, 검증, 개선 과정을 평가했습니다.

이러한 연구 결과를 바탕으로 공식적인 증명기, 외부 도구, 인터넷 접근 없이 순수 자연어 환경에서 작동하는 오픈 모델 테스트 시간 컴퓨팅 파이프라인을 제시합니다. 이 시스템은 일반 사용 모델과 두 전문가 체크포인트로 구성된 세 개의 Nemotron 3 Ultra 체크포인트를 활용하여 후보 증명을 생성, 검증, 개선하는 반복 검색을 수행합니다.

최종적으로 고성능 컴퓨팅 단계가 각 최종 제출물을 선택하며, 이 시스템은 IMO 2026에서 42점 만점에 30점을 획득하여 금메달 기준을 달성했습니다. 연구팀은 훈련 데이터, 코드, 제출 솔루션과 함께 새로운 200개의 올림피아드 수준 문제로 구성된 벤치마크인 Nemotron-IMO-Bench를 공개합니다.

Native Python and TypeScript Drivers for ArcadeDB, from OpenAPI and Protobuf

ArcadeDB를 위한 Python 및 TypeScript 네이티브 드라이버가 HTTP와 gRPC를 통해 공개되어 개발자들에게 제공됩니다. 이 새로운 드라이버들은 ArcadeDB가 공개하는 계약(contracts)을 기반으로 생성되었으며, HTTP 및 gRPC라는 두 가지 통신 방식을 지원하여 사용자가 애플리케이션 요구사항에 따라 최적의 트랜스포트를 선택할 수 있게 합니다.

개발자는 HTTP 드라이버를 사용하여 프록시나 게이트웨이와 같은 기존 인프라를 재사용하거나 일반적인 요청/응답 트래픽을 처리할 수 있습니다. 반면, gRPC 드라이버는 처리량에 민감한 서버 간 통신이나 양방향 스트리밍이 필요한 경우에 적합합니다. 예를 들어, 서버리스 함수 환경이나 대용량 결과 스트리밍 시 gRPC를 사용하는 것이 효율적입니다.

현재 드라이버는 Python과 TypeScript/JavaScript 언어를 지원하며 0.1.0 버전으로 공개되었고, ArcadeDB 서버 26.9.1을 대상으로 합니다. 이 드라이버들은 CI를 통해 관리되며, 보안을 위해 모든 릴리스는 인간이 트리거한 워크플로우를 통해 이루어집니다. 향후 더 많은 언어를 지원할 계획이며, 드라이버의 API는 지속적으로 개발될 예정입니다.

The Semantic Bottleneck: Leveraging Semantic Representations for Non-Invasive Speech Decoding

비침습적 음성 디코딩은 신경 기록의 낮은 신호 대 잡음비로 인해 음소나 개별 단어를 세밀하게 재구성하는 데 제약이 있습니다. 연구진은 고차원적인 의미론적 표현이 피질 영역에 걸쳐 분포하며 느린 시간 척도로 진화한다는 신경과학적 증거를 바탕으로, 의미론적 내용이 저수준 음향 또는 어휘 특징보다 비침습적 디코딩에 더 적합한 목표가 될 수 있다고 가정했습니다.

이러한 가설을 바탕으로 연구팀은 중간 의미론적 임베딩 공간을 통해 텍스트를 재구성하는 방법인 Brain2Semantics2Text를 제안했습니다. 이 모델은 문장 수준의 MEG 반응을 의미론적 다양체(semantic manifold)로 매핑한 다음, 예측된 임베딩을 자연어로 역변환하여 텍스트를 복원합니다.

이러한 의미론적 병목 현상은 단어 수준 정렬 없이도 고차원적인 의미를 복구할 수 있게 해줍니다. 연구는 이 접근 방식의 핵심 원리, 구현 방법, 그리고 신뢰할 수 있는 신경-의미론 매핑 학습의 어려움을 완화하기 위한 전략들을 설명합니다. 최종적으로 이전의 비침습적 Brain2Text 방법들과 비교하여 문장 수준에서 향상된 결과를 입증했습니다.

Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States

최근 연구는 모델 출력에 의존하는 기존의 편향 감사 방법이 내부적인 표현 변화를 놓칠 수 있다는 문제점을 지적하며, 은닉 상태 표현(hidden-state representations)을 통한 참조 기반 편향 감지 방법을 제안합니다. 이 방법은 파인튜닝 전후와 같이 관련 모델 변이 간의 은닉 상태 표현에서 편향을 감사하여 모델 내부의 변화를 포착하는 것을 목표로 합니다.

파인튜닝 과정에서 표현 기하학이 재형성되기 때문에 절대적인 은닉 상태는 직접 비교하기 어렵습니다. 따라서 각 문장을 고정된 앵커 문장 세트와의 유사도를 통해 인코딩하여 공유 비교 공간에서 상대적인 표현을 얻습니다. 이를 통해 목표 그룹이 긍정 및 부정 속성과 맺는 연관성이 어떻게 변화하는지를 측정하는 표현 편향 변화량(Representational Bias Shift, $\Delta B$)을 정의합니다.

연구진은 세 가지 모델 패밀리와 WildGuardMix, DecodingTrust, ToxiGen 벤치마크에서 $\Delta B$가 출력 수준의 편향 변화와 강한 상관관계($|r|=0.84$, $p<0.001$)를 보임을 확인했습니다. 또한 $\Delta B$를 임계값 처리하여 ROC AUC가 0.65에서 0.99 사이인 체크포인트를 탐지할 수 있으며, 이는 SEAT 기반 기준선보다 세 패밀리 모두에서 더 나은 성능을 보입니다.

이 방법은 작업별 평가 데이터가 필요 없으며 모델을 약 3분 만에 감사할 수 있고, 출력 기반 벤치마크보다 3~50배 적은 컴퓨팅 자원을 사용합니다. 이 방법은 출력 기반 감사 방법의 대체재가 아닌 보완재로 간주되며, 앵커 세트나 속성 세트 변경에도 $\Delta B$가 안정적으로 유지된다는 장점을 가집니다.

Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?

거대 언어 모델(LLM)은 추론 및 코드 생성에서 뛰어난 능력을 보여주며, 스스로 작동하는 인프라를 개발하고 최적화하는 데 기여할 수 있다는 가능성을 제시합니다. 하지만 현재 존재하는 벤치마크들은 주로 개별 커널, 사전 정의된 연산자, 또는 미리 지정된 최적화 목표에 초점을 맞추고 있어, LLM이 장기적이고 개방적인 LLM 인프라 엔지니어링을 수행하는 능력을 평가하지 못하는 한계가 있습니다.

이러한 격차를 해소하기 위해 본 연구는 LLM이 LLM 인프라 스택을 엔지니어링하는 능력을 체계적으로 평가하기 위한 벤치마크인 Φ-Bench를 제시합니다. Φ-Bench는 최전선 연구에서 연구된 최적화 문제에서 파생되었으며 실제 코드 저장소에 기반하여 LLM 인프라 스택 전반을 광범위하게 다룹니다.

이 벤치마크는 국소적인 커널 수준 함수 완성부터 장기적인 구현 및 엔드투엔드 시스템 최적화에 이르는 다양한 복잡성의 작업을 포괄합니다. 최전선 LLM에 대한 광범위한 실험 결과는 복잡한 LLM 인프라를 엔지니어링하는 LLM의 현재 능력과 한계를 보여주며, 미래 AI 인프라의 자율적인 최적화를 향한 과제를 통찰해 줍니다.

RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems

기존의 감정 지원 대화 시스템은 주로 일대일 구도와 개인의 감정 상태에 초점을 맞추고 있어 다자간 관계 상황에서의 상호작용을 충분히 탐구하지 못하고 있습니다. 이 연구는 LLM이 관계의 변화하는 역동성을 포착하고 이를 활용하여 보다 효과적인 감정 지원을 제공할 수 있는지 평가하는 새로운 과제인 관계 인식 감정 지원 대화(relation-aware emotional support conversation)를 소개합니다.

연구진은 실제 커플 및 가족 인터뷰 대화에서 구축된 RESCUE(관계 인식 감정 지원 대화 이해 및 평가 벤치마크)를 사용합니다. 이 벤치마크는 사회정서적 및 지원 관련 역동성에 대한 풍부한 주석을 바탕으로 관계 인식 지원에 필요한 두 가지 핵심 능력인 관계 이해(Relational Understanding)와 관계 민감 지원(Relation-Sensitive Support)을 평가하는 여섯 가지 과제를 정의합니다.

열 가지 LLM을 대상으로 한 실험 결과, 현재 모델들은 국지적인 감정이나 개입 신호에 의존하는 과제에서는 비교적 좋은 성능을 보였으나, 관계 패턴 예측, 관점 예측, 지원 전략 예측과 같은 관계 집약적 과제에서는 어려움을 겪는 것으로 나타났습니다. 이러한 발견은 현재 LLM이 대인 관계를 모델링하고 관계에 민감한 지원 결정을 내리는 데 있어 근본적인 한계를 가지고 있음을 시사합니다.

Programmable World Model

최근 비디오 월드 모델은 현실적이고 상호작용적인 시각 경험을 생성하지만, 장시간 상호작용에서 지속적인 세계 상태를 유지하고 프로그래밍 가능한 규칙을 적용하는 신뢰할 만한 메커니즘이 부족합니다. 이에 연구진은 세계 상태의 진화와 시각 관측 생성 과정을 분리하는 프레임워크인 프로그래밍 가능한 월드 모델(Programmable World Model)을 제안합니다.

이 모델은 에이전트가 자연어 지시를 실행 가능한 프로그램으로 변환하여 개별 엔티티와 상호작용에 대한 상태 및 상태 전이 규칙을 명시하도록 합니다. 경량 엔진은 이러한 프로그램을 실행하여 화면 밖에 있는 엔티티와 비시각적 속성을 포함하는 명시적이고 지속적인 전역 세계 상태를 업데이트하고 유지합니다.

세계 상태와 시각 생성을 연결하기 위해 상태 증강 3차원 방향 경계 상자(OBBs)를 중간 표현으로 도입합니다. 이 표현과 목표 카메라 궤적은 사전 학습된 비디오 모델에 대한 공간-시간 조건화 신호로 결정론적으로 컴파일되어 생성 렌더러 역할을 수행합니다. 이 설계는 미리 정의된 메커니즘, 개별 엔티티에 대한 직접 제어, 그리고 게임 플레이 전반에 걸친 지속적인 세계 상태를 갖춘 플레이 가능한 게임을 만드는 것을 가능하게 합니다.

연구진은 프로그래밍 가능한 월드 모델을 평가하기 위한 벤치마크인 CombatStateBench를 도입했습니다. 이 벤치마크에서 해당 방법은 기존의 상호작용 비디오 월드 모델보다 월등히 뛰어난 94%의 카운트 정확도와 98%의 상태 정확도를 달성하며 일관성 있는 장기 생성도 지원합니다. 이는 명시적인 상태 진화와 생성 렌더링을 분리하는 것이 지속적이고 프로그래밍 가능한 세계를 구축하는 데 효과적임을 입증합니다.

Show-Harness: Just a VLM Agent Can Play Robots

기반 비전-언어 모델(VLM)은 광범위한 세계 지식을 가지고 있지만, 이 지식을 로봇 제어로 전환하는 것은 여전히 어려운 과제입니다. 이에 본 연구는 의도와 행동을 연결하는 간결한 의미론적 인터페이스를 통해 VLM이 로봇을 "플레이"할 수 있게 하는 신체화 하네스인 Show-Harness를 제시합니다. Show-Harness는 VLM이 자연스럽게 추론할 수 있는 이산적인 의미론적 행동 단위(semantic action units)를 노출하며, 이를 신체화별 해석기(embodiment-specific interpreters)가 로컬 로봇 행동으로 결정론적으로 구체화하여 VLM이 세밀한 물리적 결정에 직접 책임을 지도록 합니다.

이러한 인터페이스를 통해 Show-Harness는 폐쇄형 최첨단 VLM을 제로샷 로봇 제어로 직접 해제하는 것과 소규모 오픈소스 VLM을 몇 시간의 파인튜닝만으로 저비용 배포에 적응시키는 것이 가능함을 입증합니다. 또한, 인간과 에이전트가 특수 원격 조작 하드웨어 없이 다양한 신체화에 걸쳐 로봇을 플레이할 수 있도록 GUI 기반 시연 수집을 허용하는 GUI 조작 인터페이스(GUMI)를 추가로 개발했습니다.

광범위한 실험 결과는 Show-Harness가 장착된 VLM 에이전트가 작업, 신체화, 환경 전반에 걸쳐 강력하게 일반화되며, 대표적인 에이전트 및 VLA 패러다임을 능가함을 보여줍니다. 이는 추가적인 모델 용량이나 비용이 많이 드는 신체화별 사전 학습 없이도 올바른 인터페이스가 기반 VLM으로부터 상당한 신체화 능력을 해제할 수 있음을 시사합니다.

White House takes down ‘Build the Wall’ game after the Tetris Company complains

트럼프 행정부 웹사이트에서 'Build the Wall' 게임이 테트리스 회사(Tetris Company)의 항의로 삭제되었습니다. 이 게임은 테트리스와 유사한 형태로 블록을 쌓는 게임이었으며, 인종차별적이라는 비판을 받으며 '좀비 국경 봉쇄'를 막기 위해 벽을 쌓는 것을 목표로 했습니다.

이 게임의 존재가 공개된 직후, 원작인 테트리스의 권리를 소유한 테트리스 회사는 자신들이 해당 게임 제작에 관여하지 않았음을 밝히며 저작권 침해에 대해 매우 심각하게 받아들이겠다고 입장했습니다. 이로 인해 해당 게임 페이지는 현재 404 오류를 표시하며 웹사이트에서 사라졌습니다.

한편, 정부 웹사이트에는 'Rio Run'이라는 다른 게임이 여전히 게시되어 있으며 플레이어는 흰색 남성 캐릭터를 조종하여 최대한 많은 이민자 캐릭터를 추방하는 것을 목표로 합니다. 이 사건은 정부 플랫폼에서 콘텐츠를 게시할 때 저작권 및 지적 재산권 문제를 신중하게 고려해야 함을 보여줍니다.