Databasus - 실제 복원까지 검증하는 셀프 호스팅 데이터베이스 백업 도구

셀프 호스팅 데이터베이스 백업 도구인 Databasus는 백업된 데이터가 실제로 복원되는지까지 자동으로 확인하는 기능을 제공합니다. 이 도구는 백업 일정, 저장 위치, 보관 기간을 관리할 수 있어 데이터 관리의 효율성을 높여줍니다.

Databasus는 PostgreSQL, MySQL, MariaDB, MongoDB 등 다양한 데이터베이스에 대한 논리 백업을 지원합니다. 특히 PostgreSQL 환경에서는 전체 백업과 증분 물리 백업은 물론 특정 시점 복구(PITR) 기능까지 지원하여 데이터 복구의 신뢰도를 높입니다.

PostgreSQL의 경우 WAL 변경 사항을 활용하여 특정 시점 복구를 가능하게 하며, 이는 데이터 손실 위험을 최소화하고 복구 프로세스의 정확성을 보장합니다. 개발자는 이 도구를 통해 백업 데이터의 무결성을 자동으로 검증받으며 안정적인 데이터 관리 환경을 구축할 수 있습니다.

브라운필드의 코끼리: AI로 개인은 빨라졌는데, 조직은 왜 그대로인가

기존 시스템과 조직 구조가 자리 잡은 브라운필드 기업의 AI 전환은 기술적인 측면뿐 아니라 조직 내에서 자신의 역할과 팀의 권한을 정체성으로 여기는 근본적인 문제에 직면해 있습니다. AI 도입이 개인의 업무 처리 속도를 빠르게 만들었음에도 불구하고, 조직 구조가 그대로 유지되면서 발생하는 비효율성이 핵심 과제로 떠오르고 있습니다.

AI를 통해 담당 업무를 신속하게 처리할 수 있게 되었더라도 다른 팀의 승인이나 백로그를 기다려야 하는 상황이 발생하면 조직 경계를 넘는 순간 병목 현상이 발생합니다. 이는 개인의 생산성 향상과 조직의 프로세스 제약 사이의 괴리를 보여주는 사례입니다.

따라서 성공적인 AI 전환을 위해서는 단순히 기술을 도입하는 것을 넘어, AI가 조직 내에서 어떻게 작동하고 권한을 행사할지에 대한 명확한 정체성과 프로세스 재정립이 필수적입니다. 조직 구조와 AI 워크플로우 간의 불일치를 해소해야만 AI가 진정한 의미의 조직 효율성을 높이는 데 기여할 수 있습니다.

M3 Mac을 지원하는 Asahi Linux

Asahi Linux의 M3 지원 코드가 설치 프로그램에 병합되어 M3, M3 Pro, M3 Max 기반의 MacBook과 iMac에서 사용 가능해졌습니다. 이로써 M3 기반 Apple Silicon 기기에서도 Asahi Linux를 구동할 수 있는 환경이 확장되었습니다.

이 업데이트를 통해 M1 및 M2에서 지원되던 대부분의 기능들이 M3 환경에서도 정상적으로 작동합니다. 특히 웹캠, 내장 마이크, WiFi, Bluetooth 연결 기능은 물론 최대 USB 3 10Gb/s 속도 지원이 가능해졌습니다.

또한, AV1 하드웨어 가속 디코딩 기능도 지원 범위에 포함되었습니다. 이는 하드웨어 레벨의 미디어 처리 성능을 Linux 환경에서 활용할 수 있게 함을 의미합니다.

LLGo - C와 Python 라이브러리를 활용하는 LLVM 기반 Go 컴파일러

Go 소스를 LLVM으로 컴파일하여 C 및 Python 생태계의 라이브러리를 함께 사용할 수 있도록 만든 새로운 컴파일러인 LLGo가 소개되었습니다. 이 컴파일러는 Go 개발자가 C와 Python 라이브러리를 효율적으로 활용할 수 있도록 설계되었습니다.

LLGo는 Go 소스를 LLVM 기반으로 컴파일하며, C 라이브러리와는 C ABI 공통 호출 규약(C ABI common calling convention)을 통해 연결하는 방식으로 작동합니다. 이를 통해 개발자는 C 함수를 직접 호출할 수 있게 되어 일반적인 Go의 cgo에서 발생하는 스택 관련 문제들을 해결할 수 있습니다.

이러한 개선은 Go 환경에서 C 및 Python 라이브러리와의 상호 운용성을 크게 향상시켜, 복잡한 시스템 프로그래밍 환경에서 라이브러리 통합의 효율성을 높이는 데 기여합니다. LLGo는 Go 개발자가 C와 Python 생태계의 강력한 기능을 더 쉽게 통합할 수 있도록 돕는 것을 목표로 합니다.

GPT-6 Astra: 하네스가 곧 제품이다

GPT-6 Astra는 ARC-AGI-3의 동일한 High 추론 설정에서 하네스(Harness)를 적용했을 때 54.8%와 99.9%의 결과를 기록했습니다. 이는 장기 실행 에이전트의 성능을 평가할 때 단순히 모델 자체의 능력뿐만 아니라 시스템 전체를 고려해야 함을 시사합니다.

이러한 결과는 장기 실행 에이전트가 모델 성능 외에도 메모리, 도구, 문맥 관리, 제어 루프를 포함하는 통합 시스템으로 평가되어야 함을 의미합니다. 요청 사이에 이전 추론 상태를 보존하는 기능은 이러한 시스템적 관리가 필수적임을 보여줍니다.

따라서 개발자들은 에이전트 시스템을 구축할 때 모델 성능뿐만 아니라 메모리 관리와 문맥 보존 메커니즘을 핵심적인 평가 요소로 포함해야 합니다. 이는 실제 환경에서 안정적이고 장기적으로 작동하는 에이전트를 설계하는 데 중요한 맥락을 제공합니다.

216M Spy TVs – The LG Smart TV Problem [video]

LG 스마트 TV와 관련된 216M 스파이 TV 문제에 대한 논의가 올라왔습니다. 이 영상은 LG 스마트 TV에 내재된 특정 문제에 대해 개발자 커뮤니티에서 제기된 이슈를 다루고 있습니다.

해당 논의는 LG 스마트 TV 시스템에서 발생하는 특정 기술적 문제와 관련된 것으로 보입니다. 구체적으로 어떤 기술적 결함이나 구현상의 문제가 스마트 TV 기능에 영향을 미치는지에 대한 내용이 포함되어 있을 것으로 예상됩니다.

개발자들은 이 문제를 통해 하드웨어와 소프트웨어 간의 상호작용 또는 펌웨어 수준의 구현 오류가 스마트 TV 경험에 미치는 영향을 분석하고 있습니다. 따라서 해당 영상을 통해 스마트 TV 관련 시스템의 안정성과 구현 방식에 대한 심도 있는 논의를 확인할 수 있습니다.

MathKernel: An evidence-aware multi-engine mathematics kernel and MCP server

MathKernel은 LLM을 위한 증거 인식 다중 엔진 수학 런타임으로, 정확한 계산뿐만 아니라 기호적, 형식적, 인증된 구간 및 수치 계산을 지원합니다. 이 시스템은 타입이 지정된 MathIR, 신뢰 레이블, 그리고 전체 출처(provenance)를 통해 수학적 증거를 보존하는 것을 목표로 합니다. 이는 LLM이 수학적 의도를 해석하는 데 강점을 보이지만 실제 산술 계산에는 취약하다는 점을 보완하며, 수학적 결과에 명시적인 신뢰 수준과 엔진 태그, 그리고 도출 경로를 부여합니다.

MathKernel의 핵심은 수학적 증거를 계산과 분리하는 데 있습니다. 모델이 의도를 해석하는 반면, 커널은 실제 수학적 증거를 계산하고 기록하는 역할을 수행합니다. 이는 단일 신뢰 레이블만으로는 충분하지 않으며, 독립적인 인증이나 교차 확인을 통해 증거 묶음을 관리합니다. 다양한 수학 분야를 처리하기 위해 미분 경로, 기하학, 통계, 편미분 방정식(PDE) 등 여러 엔진을 통합하여 사용합니다.

아키텍처 측면에서 MathKernel은 단일 솔버가 아닌 타입이 지정된 오케스트레이션 계층으로 설계되었습니다. 이 계층은 구문 분석, 컨텍스트, 객체 식별, 출처 구성, 리소스 정책 및 도출 추적을 관리하며, 실제 수학 계산은 도메인 어댑터가 담당합니다. 이러한 분리는 결과가 제시되는 표현 계층이 주장하는 내용을 조용히 변경하는 것을 방지하며, 시스템의 안전성과 무결성을 보장합니다.

또한, 시스템은 강력한 안전 경계를 포함하고 있습니다. 제한된 문법과 알 수 없는 함수는 거부되며, 결과는 경계가 설정된 샌드박스 환경에서 실행됩니다. SQLite 영속성 체크와 SHA-256 검증을 통해 데이터 무결성을 유지하며, 멀티 테넌트 격리는 외부 워커 또는 샌드박스 계층에 위임됩니다.

코드가 나빠지는 데는 한계가 없다

소프트웨어는 건물과 달리 물리적인 붕괴 한계가 없기 때문에 시스템이 계속 작동하는 동안에도 복잡성과 성능 저하가 끝없이 누적될 수 있습니다. 이러한 특성 때문에 코드가 나빠지는 데에는 실질적인 한계가 없다는 점이 중요합니다.

실제로 Amazon 주문 처리 조직과 같은 대규모 시스템에서는 지식 소실과 미완료 재설계가 반복되는 악순환이 발생합니다. 이 과정에서 기존 구조에 새로운 계층과 인력이 계속 남게 되면서 시스템의 복잡성이 더욱 심화됩니다.

이러한 현상은 시스템이 지속적으로 운영되는 과정에서 발생하는 구조적 문제와 관리의 어려움을 보여줍니다. 따라서 개발자와 시스템 설계자는 단순히 기능 구현을 넘어, 시스템의 복잡성과 성능 저하가 어떻게 누적되는지 인지하고 구조적인 개선 방안을 모색해야 합니다.

CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation

관상동맥 조영술(CAG) 해석은 관찰자에 따라 해석이 크게 달라지기 때문에 진단에 있어 일관성이 부족하다는 문제가 있습니다. 기존 인공지능 시스템은 일관성을 개선할 수 있지만, 의사 결정 과정이 추적 가능하지 않고 포괄적인 개방형 평가에 한계가 있어 임상 적용 준비가 미흡합니다. 이에 연구진은 CAG 파이프라인의 추론 핵심으로 사용되는 통합 대규모 시각-언어 모델인 CARDEA를 개발했습니다.

CARDEA는 공개 데이터셋과 폐쇄형 작업을 세 단계로 훈련시켰는데, 이는 시각적 특징 정렬, 자체 압축된 Chain-of-Box(CoB) 콜드 스타트, 그리고 검증 가능한 보상을 사용한 강화 학습(RLVR)을 포함합니다. 특히 CoB 보상은 추론 과정에서 바운딩 박스 사용을 장려하여 공간적 증거를 명확히 드러냅니다. 이 모델은 두 가지 연구 수준 진단, 즉 지배 분류와 복잡성 평가를 통해 전용 분류기 및 두 명의 중재 시술 전문의와 비교 평가되었습니다.

CARDEA는 최종 보고서 생성 과정을 훈련에서 제외하고 외부 코호트에서 평가했으며, RLVR을 통해 도출된 결과는 기존 모델보다 향상되었습니다. 특히 보고서 생성 능력은 감독 모방 방식으로는 달성할 수 없었던 개방형 보고 능력을 보여주었으며, 용적 심각도 macro-F1 점수는 0.686으로 조정되지 않은 기본 모델(0.513)보다 높고 항상 정상 범위(0.312)보다 두 배 이상 높았습니다.

CARDEA는 원시 멀티뷰 비디오에서 연구 수준 진단까지의 전체 CAG 파이프라인을 수행하면서 결론 뒤에 추적 가능한 공간적 증거를 노출합니다. 그러나 임상적 사용을 위해서는 전문가 심장 전문의와의 전향적 검증이 반드시 필요합니다.

SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem

대규모 시각-언어 모델(LVLM)은 다양한 시각 작업에서 강력한 성능을 보였지만, 2D 이미지에 담긴 장면의 3차원 구조를 재구성하고 추론하는 능력, 즉 공간 지능(spatial intelligence)은 여전히 제한적입니다. 기존 접근 방식들은 실제 장면 공간 질문 응답 데이터셋을 사용하지만, 이러한 데이터셋을 구축하기 위해서는 조밀한 기하학적 주석이 필요하여 비용이 많이 들고 노이즈가 발생하기 쉽습니다.

이에 본 연구는 인간의 인지 발달에서 영감을 받아 구조화된 블록 조작 과제를 통해 기본적인 공간 기술을 학습하는 새로운 패러다임을 제안합니다. 이를 위해 3차원-2차원 투영, 시점 변환, 구조 결합을 다루는 15,000개의 블록 쌓기 문제로 구성된 합성 데이터셋인 SpatialBlock-15k를 도입했습니다. 이 데이터셋은 시각적으로 복잡한 조건에서 앵커 기반 추론을 장려하기 위해 제어된 색상 변조를 시각적 단서로 추가했습니다.

실험 결과, 이 데이터셋으로 학습된 LVLM은 직접적인 답변이나 추론 기반 예측을 통해 기존 모델들보다 현저히 우수한 성능을 보였으며, 합성적이고 간결한 데이터셋임에도 불구하고 실제 세계의 공간 작업에 일반화되는 능력을 입증했습니다. 이 연구는 LVLM이 실제 공간 지능을 갖추도록 훈련하는 데 있어 비용 효율적이고 구조화된 학습 방법이 효과적임을 보여줍니다. 관련 코드와 데이터는 GitHub에서 공개되어 있습니다.

DF26: We Cannot Tell Fake From Real Anymore

최근 텍스트-투-비디오 및 이미지-투-비디오 모델로 생성된 완전히 합성된 클립을 탐지하기 위한 새로운 벤치마크인 DF26이 소개되었습니다. 이 벤치마크는 직접 카메라 녹화, 공식 성명, 스튜디오 인터뷰 등 단일 인물의 공개 연설 시나리오를 포함하는 비디오를 다루며, 총 271개의 실제 비디오와 2,420개의 합성 비디오로 구성되어 있습니다.

이 연구 결과는 일곱 가지 최신 비디오 모델로 생성된 비디오를 사용하여 진행되었으며, 현재의 평가 프로토콜과 인간의 탐지 능력, 그리고 최첨단 딥페이크 탐지기의 성능이 무작위 추측과 거의 같다는 것을 보여줍니다. 이는 현재의 평가 방식이 생성 모델의 분포 변화에 대한 견고성을 측정하는 데 한계가 있음을 시사합니다.

따라서 연구진은 현대적인 생성 모델의 분포 변화에 대한 견고성을 명시적으로 측정하는 벤치마크의 필요성을 강조하고 있습니다. DF26은 현재의 평가 한계를 극복하고 AI 생성 비디오 탐지의 신뢰성을 높이기 위한 새로운 기준을 제시합니다.

Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents

AI 연구 에이전트는 사전 지식, 공개 출처, 실험적 피드백을 결합하여 유용한 결과를 도출합니다. 이 발견 인증 프로토콜(DCP)은 이러한 결과에 대한 주장을 실행 가능한 복구 및 피드백 테스트로 전환합니다.

DCP는 여러 단계의 게이트를 통해 연구 결과의 신뢰성을 검증합니다. 첫 번째 게이트는 봉인된 평가에서 유용한 개선을 검증하며, 두 번째 게이트는 일치하는 에이전트에게 등록된 시작 정보와 관찰된 웹 콘텐츠를 제공하면서 목표 연구 기록은 숨깁니다. 유효한 방법이 수치적 목표에 도달하면 복구 증거를 제공하고 핵심 거부(Core veto)를 촉발합니다.

핵심(Core) 요구 사항은 적절한 통제, 관찰된 복구 없음, 그리고 한 번의 새로운 등록된 에피소드에서 복구에 대한 유한 샘플 경계를 요구합니다. 선택적 게이트 3은 공유 체크포인트에서 지정된 중립 정책에 대한 진실된 피드백의 평균 효과를 측정합니다.

두 번의 통제된 감사에서 SQLite 최적화 및 가상 촉매 제어 하에 전체 프로토콜이 실행되었으며, 각 감사에서 96 에피소드 동안 복구는 0건이었고 상한값은 0.0468이었습니다. 또한, 쌍별 연구는 30건의 진실된 복구와 0건의 중립 복구를 산출했으며, 60쌍의 무효 연구를 통과했습니다. 이 프로토콜은 AI 연구 전반에 걸쳐 유용한 결과, 대안 경로, 피드백 효과에 대한 공통의 증거 언어를 제공합니다.

Revisiting Complete Reasoning Traces for Post-Training

거대 언어 모델(LLM)은 추론 능력을 향상시키기 위해 사전 수집된 추론 경로(reasoning trajectories)를 기반으로 후처리 학습을 진행하는 경우가 많습니다. 이러한 경로들은 정답으로 가는 과정에서 우회 경로를 포함하기 때문에 복잡하고 길게 이어지는 경향이 있습니다. 하지만 이러한 LLM이 지도 미세 조정(SFT)과 같은 후처리 과정에서 완전한 경로를 학습하는 것이 실제로 이점에 도움이 되는지에 대해서는 충분히 탐구되지 않았습니다.

실험 결과에 따르면, 전체 경로를 제공하는 것은 제한적인 이점만을 제공하는 반면, 경로를 대폭 잘랐을 때도 부분적인 경로가 효과적임이 밝혀졌습니다. 또한, 어텐션 기반 분석과 제어된 토큰 제거 연구를 통해 추론 경로의 중간 토큰들이 최종 추론 품질에 미치는 영향이 미미하다는 것을 확인했습니다. 이는 중복된 정보를 피함으로써 LLM이 내부 지식을 활용하여 알려진 경로의 시작점과 끝점을 바탕으로 누락된 단계를 추론하여 일관된 대안을 내부적으로 추론할 수 있게 함을 시사합니다.

나아가, 경로의 끝점(endpoints)을 사용하여 LLM을 훈련하면 추론 행동에 일관된 변화가 발생하며, 이는 강화 학습(RL)이나 온폴리 추illation(on-policy distillation) 기반의 후처리 방법에도 긍정적인 영향을 미칩니다. 따라서 LLM의 추론 경로에 대한 완전한 흔적을 재검토할 필요성이 강조됩니다. 관련 코드는 github에서 확인할 수 있습니다.

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

월드-액션 모델(WAM)은 비디오 생성적 사전 지식으로부터 세계 지식을 물려받아 체화된 경험을 통해 실행 가능한 제어 신호로 변환하는 것을 목표로 합니다. 하지만 기존 시스템들은 생성 백본, 시각 표현, 아키텍처, 정보 흐름 등이 긴밀하게 결합되어 있어 어떤 설계 선택이 중요한지 파악하기 어렵습니다. 이에 연구진은 월드-액션 사전 학습을 통제된 실험 프로그램으로 전환하는 오픈 연구 스택인 OpenWAM을 소개합니다.

OpenWAM-Infra는 WAM 설계 공간을 통일된 훈련, 추론, 배포 및 평가를 위한 구성 가능한 모듈로 분해합니다. 이 기반 위에서 OpenWAM-Study는 세계와 행동 학습의 상호작용 및 시너지의 확장성을 탐구하며 세 가지 원칙을 도출했습니다. 이 원칙들은 충분히 유능한 생성 백본과 정보가 풍부한 잠재 공간을 통한 상위 지식 전송, 행동 용량과 명시적인 세계-행동 정보 흐름을 통한 세계-행동 시너지, 그리고 세계 커버리지와 행동 접지를 통합하는 공중 학습을 통해 도출되었습니다.

이러한 원칙들을 조합하여 6,400시간 분량의 자각적 인간 및 로봇 데이터로 사전 학습된 OpenWAM-α를 구축했습니다. OpenWAM-α는 시뮬레이션 및 실제 로봇 실험에서 여덟 가지 시뮬레이션 벤치마크와 실제 로봇 실험을 모두 통과하며 일관되게 뛰어난 성능을 보였습니다. 이는 단일 암 조작부터 섬세한 손까지 다양한 구현체를 포괄하는 실험 결과입니다.

연구진은 향후 연구를 촉진하기 위해 인프라, 평가 프로토콜, 사전 학습된 모델, 데이터 레시피를 포함한 전체 스택을 공개합니다. 이는 개발자들이 월-액션 모델을 체계적으로 탐색하고 실험할 수 있는 기반을 제공합니다.

Harnessing CLIP and DINO: An Uncertainty-Aware Cascaded Fusion Network for Generalizable Deepfake Image Detection

딥페이크 이미지의 현실성과 접근성이 증가하면서 디지털 미디어의 신뢰성이 위협받고 있습니다. 이러한 위조를 탐지하기 위해 비전 파운데이션 모델 기반의 탐지기가 유망한 성능을 보였으나, 일반적으로 단일 사전 학습 표현에 의존하여 특정 훈련 분포에 과적합되는 한계가 있었습니다.

이에 연구진은 이러한 일반화 문제를 개선하기 위해 CLIP의 언어 정렬 의미론적 사전 정보와 DINO의 자기 지도 시각 구조 사전 정보를 활용하는 불확실성 인식 경사형 융합 네트워크인 UCF-Net을 제안했습니다. UCF-Net은 트랜스포머 깊이에 걸친 계층적 특징을 추출하고, 레이어별 전문가 집계를 사용하여 각 인코더의 다중 수준 단서를 적응적으로 결합하며, 엔트로피 기반 불확실성을 바탕으로 결과 표현을 가중치 있게 융합합니다.

연구진은 또한 공개된 딥페이크 데이터셋을 약 400만 개의 이미지로 통합하여 통일된 벤치마크를 구축하고, 여덟 가지 최근 생성기에서 얻은 8천여 장의 얼굴 이미지를 포함하는 별도의 교차 생성 평가 세트를 구성했습니다. 이 통일된 벤치마크에서 UCF-Net은 도메인 내 및 교차 도메인 평가 모두에서 평가된 방법들 중 가장 우수한 평균 AUC를 달성했습니다.

교차 생성 세트에서는 제한된 타겟 도메인 데이터로도 효과적으로 적응하지만, 제로샷 전이는 여전히 도전적인 과제로 남아있습니다.

RelightFormer: Feed-forward Generative Transformer for Multiview Object Relighting

이미지 재조명(Image relighting)은 전통적으로 역 렌더링 파이프라인이나 단일 이미지 생성 모델에 의존하여 3차원 기하학과 재질 상호작용을 이해하는 데 필수적인 다중 뷰 단서를 무시하는 한계를 가지고 있었습니다. 이러한 한계를 극복하기 위해 본 논문은 명시적인 고유 속성 추정을 완전히 우회하는 단일 및 다중 뷰 이미지 재조명을 위한 피드포워드 생성 트랜스포머를 제안합니다.

이 아키텍처는 비디오 기반 모델에서 차용되었으며, 공간 특징에 타겟 환경 맵을 교차 주의(cross-attention)를 통해 동적으로 주입하는 잠재 조명 모듈을 특징으로 합니다. 또한, 순차적 편향 없이 순서가 정해지지 않은 다중 뷰 입력을 대칭적으로 처리하기 위해 순열 불변 위치 인코딩(permutation-invariant positional encodings)을 사용합니다.

이 강력한 데이터 기반 모델을 훈련하기 위해 9만 개의 객체와 3만 9천 개의 고유한 조명으로 구성된 방대한 라발 객자버스 데이터셋(Laval Objaverse Dataset, LOD)을 구축했습니다. 실험 결과, 이 모델은 단일 뷰, 다중 뷰, 그리고 새로운 뷰 재조명 작업 전반에 걸쳐 최첨단 시각 품질과 사실적인 재조명 품질을 입증하며 강력한 제로샷 일반화 능력을 보여줍니다.

SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions

대규모 신경망 압축은 리소스 제약적인 장치에 모델을 배포하는 데 필수적입니다. 기존의 방법들은 가중치 가지치기나 저비트 양자화를 개별적으로 적용하여 허용 가능한 성능 저하를 보존하면서도 최적의 압축률을 달성하는 데 한계가 있었습니다.

본 논문은 베이지안 변분 학습(\method)을 통해 가지치기와 저비트 양자화를 동시에 수행하는 통합 프레임워크를 제안합니다. 이 방법은 스파이크-슬랩 사전 분포를 사용하여 희소성을 유도하고 가우시안 혼합 모델(GMM)을 사용하여 양자화된 가중치를 모델링함으로써 저비트 정밀도를 가능하게 합니다.

스파이크-슬랩 사전 분포와 GMM을 포함하는 목적 함수의 계산이 복잡하기 때문에, 본 연구는 최소한의 정확도 손실로 효과적인 압축을 촉진하는 효율적인 근사치를 도출했습니다. 이론적으로 희소하고 양자화된 심층 신경망에 대해 일관된 결과를 제공합니다.

ResNet, BERT-base, Llama3.2, Qwen2.5와 같은 다양한 모델에 대한 광범위한 실험 결과, 제안된 방법은 기존 방법들보다 더 높은 압축률을 달성하면서도 비슷한 성능 저하를 유지했습니다. 이는 모델을 효율적으로 압축하고 배포하는 데 중요한 진전을 의미합니다.

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

로봇 기초 모델은 주로 영어로 훈련 및 평가되며 대부분의 언어에 대한 로봇 시연 데이터는 존재하지 않습니다. 본 연구는 아키텍처 변경 없이 기계 재구성된 지시만을 사용하여 오픈 비전-언어-행동 스택에 그리스어를 추가하는 실험을 진행했습니다. 핵심 과제는 번역 자체가 아니라 측정에 있으며, 여러 측정 도구가 잘못된 결론을 도출할 수 있습니다. 예를 들어, 색상 히스토그램 측정 방식은 노이즈를 보상하고, 단일 목표 벤치마크는 올바른 그리스어 조건에서 84.6%를 기록하지만 의도적으로 잘못된 지시에서는 82.6%에 그칩니다.

실험 결과, 그리스어 시연 데이터가 없는 다국어 텍스트 타워는 잘못된 지시의 하한선에 머물렀으나, 그리스어만 훈련했을 때는 대조군 대비 최대 2.7%p 높은 성능을 보였습니다. 또한, 이중 언어 훈련은 대조군 대비 6.7~7.1%p의 마진을 보이며 영어 성능의 약 4분의 2에 도달했습니다. 모델은 번역된 표현에 과적합되는 경향이 있어, 작업당 일곱 가지 표현으로 훈련했을 때 이 페널티가 절반으로 줄어들었습니다.

성능 저하를 피하기 위해서는 언어 적응 세계 모델로부터 시작하거나 텍스트 타워를 해제하는 것을 피해야 합니다. 이러한 결과는 저자원 로봇 정책 현지화에 대한 두 가지 실용적인 요구 사항을 제시합니다. 측정 지표를 신뢰하기 전에 반드시 보장된 기준점을 설정해야 하며, 저자원 언어 결과를 시드 변동에 관계없이 재현해야 합니다.

Encoded Early, Used Late: Where Transformers Begin to Act on an Inferred Partner's Expertise

트랜스포머 모델은 특정 속성이 출력에 영향을 미치기 전의 깊이에서 잔차 스트림(residual stream) 내에서 선형적으로 디코딩될 수 있음을 보여줍니다. 이는 정보가 읽히는 시점과 사용되는 시점 사이의 간극에 관한 연구이며, 입력에 직접 명시된 속성에 대해서는 이러한 현상이 관찰되었습니다.

연구진은 이러한 현상이 대화 과정에서 모델이 점진적으로 추론해야 하는 속성, 즉 대화 상대방의 전문성에도 적용되는지 질문합니다. 모델이 대화 파트너의 전문성을 추론하는 과정에 대해 ExpertCollab이라는 다중 턴 연구 계획 대화 코퍼스를 사용하여 실험한 결과, 파트너의 전문성은 네트워크의 초기 레이어에서 가장 잘 디코딩되며 네트워크 중간 지점 이전에는 거의 무작위 수준으로 떨어집니다.

카운터팩추얼 패칭 실험은 이 차이를 확인합니다. 최대 디코딩 가능성이 있는 레이어에 전문성 차이를 주입하면 후기 레이어의 결과는 거의 변하지 않지만, 중간 지점을 넘어 주입하면 그 차이가 거의 완전히 전파되어 10배 이상의 분리가 발생합니다. 이는 추론된 관계 속성(inferred relational attribute)이 인과적으로 활성화되기 훨씬 전에 표현된다는 것을 의미하며, 따라서 파트너 조건에 따른 행동을 읽거나 유도하려는 모든 시도가 개입해야 하는 지점을 제한합니다.

ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding

실시간 스트리밍 비디오 이상 이해(VAU)를 위한 Slow-Fast Decoupled Framework인 ReactVAU를 제안합니다. 기존 VAU 방법들은 오프라인 추론과 전역 시간 샘플링에 의존하여 인과 관계를 위반하고 라이브 감시 스트림에 적용하기 어렵다는 한계가 있습니다. 또한 일반적인 스트리밍 비디오 모델은 인과적 접근성은 만족하지만 메모리 압축 과정에서 희귀한 일시적 이상 징후를 희석시키고 긴 정상 구간 동안 무거운 MLLM을 균일하게 호출하는 문제가 있었습니다.

ReactVAU는 이러한 격차를 해소하기 위해 세 가지 시너지 구성 요소를 도입합니다. 첫째, 연속적인 이상 징후 필터링을 위한 공간 그리드 폴딩(SGF) 기반의 경량 빠른 탐지 모듈이 있습니다. 둘째, 시간적 감쇠로부터 중요한 시각적 단서를 보호하는 이상 징후 인식 영구 메모리(AAPM)가 있습니다. 셋째, 정상 스트림 중에는 잠재되어 있다가 의심스러운 이벤트 발생 시에만 활성화되어 의미적 검증과 인과적 설명을 수행하는 무거운 느린 추론 모듈입니다.

광범위한 벤치마크 실험 결과, ReactVAU는 엄격한 스트리밍 제약 조건 하에서 이상 탐지와 인과적 추론 모두에서 경쟁력 있는 성능을 달성했습니다. 특히 무거운 MLLM 호출을 최소화함으로써 계산 효율성이 크게 향상되었음을 입증했습니다. 이 프레임워크는 실시간 스트리밍 환경에서 높은 효율성과 정확성을 동시에 확보하는 데 중점을 둡니다.