에이전트 메모리는 파이프라인이 아니라 파일 형식이어야 한다

기존 에이전트 메모리는 특정 하네스에 종속되거나 별도의 LLM 및 데이터베이스와 연결된 복잡한 파이프라인 형태로 구성되기 쉽습니다. 이러한 복잡성은 에이전트 시스템의 이식성과 확장성을 저해하는 주요 요인이 됩니다.

따라서 에이전트 메모리는 복잡한 파이프라인 구조가 아닌 단순하고 이식 가능한 데이터 형식으로 다루어져야 한다는 주장이 제기되고 있습니다. 이는 메모리 시스템이 특정 인프라에 얽매이지 않고 다양한 환경에서 유연하게 활용될 수 있도록 하기 위함입니다.

Memoryfield는 이러한 접근 방식을 적용하여 에이전트가 직접 작성한 짧은 마크다운 문서와 선택적인 YAML 메타데이터를 메모리 형식으로 사용합니다. 이를 통해 에이전트의 지식과 맥락을 단순한 파일 형식으로 저장하고 관리할 수 있게 됩니다.

Ed Zitron의 AI 회의론 예측은 얼마나 정확했나?

AI 회의론자인 에드 지트론이 2024년과 2025년에 내놓은 AI 발전 정체, 버블 붕괴, 기업 실패에 대한 예측은 실제 결과와 대조했을 때 거의 모두 빗나갔습니다. 이 예측들은 AI 기술의 발전 방향과 시장 상황에 대한 회의론을 담고 있었으나, 실제 시장의 결과는 예측과 크게 다르지 않았습니다.

특히 메타, 알파벳, 마이크로소프트와 같은 주요 기업들이 성장을 잃고 AI에만 집중하고 있다는 진단과는 달리, 이들 회사의 매출과 실적은 여전히 견고한 모습을 보였습니다. 이는 AI에 대한 회의론이 실제 기업의 재무적 성과나 시장 동향을 정확하게 반영하지 못했음을 시사합니다.

따라서 AI 발전의 장기적인 궤적이나 기업의 성과를 예측할 때, 특정 회의론자의 예측보다는 실제 시장 데이터와 기업의 재무 상태를 면밀히 분석하는 것이 더 정확한 접근 방식입니다. 이러한 예측의 실패는 AI 시대의 거시적인 흐름을 이해하는 데 있어 이론적 예측과 현실적 결과 사이의 괴리를 인지해야 함을 보여줍니다.

Janet 1.42.0

Janet 1.42.0 릴리스는 런타임 안정화와 광범위한 문서 개편, 그리고 테스트 및 개발 도구 보강에 중점을 둔 업데이트입니다. 이 버전은 오랫동안 준비되어 왔으며, 개발자들이 보다 안정적으로 Janet 환경을 구축하고 디버깅할 수 있도록 기반을 다지는 데 초점을 맞추었습니다.

이번 릴리스에서 중첩 코드인 `janet_continue`와 관련된 여러 핵심적인 문제들이 해결되었습니다. 구체적으로 활성 파이버가 가비지 컬렉션(GC)되는 오류, 재할당 후 스택 포인터가 무효화되는 문제, 그리고 이벤트 처리 시 발생하는 이중 해제 문제 등이 수정되었습니다.

이러한 수정 사항들은 특히 동시성 환경이나 복잡한 이벤트 처리를 다루는 개발자들에게 중요한 영향을 미칩니다. 개발 도구와 런타임 안정성이 개선됨으로써, 사용자는 더 신뢰할 수 있는 환경에서 애플리케이션을 개발하고 테스트할 수 있게 됩니다.

좋아, 내 텍스트 편집기는 직접 만들겠다

개발자들이 브라우저 기반 텍스트 편집기를 직접 구현하는 과정에서 렌더링 자유도와 네이티브 편집 기능 사이의 절충점을 탐색하는 실험을 진행했습니다. 이들은 텍스트 편집기 기능을 구현하기 위해 HTML의 canvas, contenteditable, textarea 요소를 순차적으로 활용하는 방법을 시도했습니다.

특히 canvas는 높은 렌더링 자유도를 제공하지만 선택이나 실행 취소와 같은 네이티브 편집 기능이 부족하다는 한계가 있습니다. 따라서 개발자들은 이러한 요소들을 조합하여 사용자가 원하는 시각적 자유도와 기본적인 편집 기능을 동시에 확보하는 방법을 모색했습니다.

이러한 실험은 커스텀 텍스트 편집기 인터페이스를 구축할 때, 브라우저의 기본 기능과 커스텀 렌더링 사이의 기술적 트레이드오프를 이해하는 데 중요한 맥락을 제공합니다. 이는 복잡한 사용자 인터페이스를 설계할 때 어떤 기술적 제약과 선택이 필요한지를 보여줍니다.

From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data Attribution

학습 데이터 귀속(TDA)은 모델 행동에 영향을 미치는 학습 예시를 식별하는 것을 목표로 하지만, 그 개입 가치는 예시 선택 방식과 수정 방법에 따라 달라집니다. 영향 함수(IF)는 미세한 재가중(reweighting) 하에서의 행동 변화를 추정하지만, IF로 선택된 예시는 기존의 가중치 기반 개입 하에서 무작위 선택보다 제한적인 이점만을 보였습니다. 이는 영향력 있는 예시가 개입 가치를 상실했는지, 아니면 재가중이 그 행동 레버리지를 실현하지 못하는지에 대한 의문을 제기합니다.

본 연구에서는 IF를 사용하여 개입 대상을 식별하고 지침은 고정한 채 응답을 행동에 부합하거나 반대되는 감독으로 대체하는 영향 가이드 응답 재작성(influence-guided response rewriting) 방법을 제안합니다. 네 개의 오픈 가중치 LLM을 대상으로 응답 재작성과 재가중을 동일한 영향 선택 예시에 적용하여 실험했으며, 그 결과 응답 재작성은 더 강력하고 지속적이며 양방향적인 행동 변화를 유도한 반면, 재가중은 약하고 일관성 없는 효과만을 보였습니다.

추가 분석 결과, 영향 선택 예시는 다른 선택자보다 더 큰 재작성 레버리지를 제공하며, 변화는 목표 관련 행동에 집중되는 것으로 나타났습니다. 이러한 질적 대조는 안전 거부(safety refusal)와 같은 영역에서도 동일하게 나타났습니다. 이 결과는 영향 추정으로 포착되는 국소적인 재가중 효과와 해당 예시들이 식별하는 더 광범위한 개입 레버리지 사이의 차이를 구별하며, TDA 방법론에 대한 개입 인식 평가의 필요성을 강조합니다.

MasterControl Seventeen Every Time

엔터프라이즈 분석을 위한 통제된 접근 방식에 대한 연구 결과가 발표되었습니다. 이 연구는 언어 모델이 질문을 해석하고 결정론적 정책이 사전 승인된 분석 프로그램을 선택 및 실행하여 결과와 증거를 모두 반환하는 방식을 탐구합니다. 연구진은 이러한 제약 조건 하에서도 관계 연산, 집계, 비교, 윈도우, 순위 지정, 유사성 등의 관계 연산을 사용하여 표현력을 유지할 수 있음을 보여줍니다.

고정된 의미, 정책, 데이터, 실행 규칙은 결과의 재현성을 보장하여 분석 결과를 반복적으로 사용할 수 있게 만듭니다. 440회의 실행에서 세 개의 8B 모델은 런타임 시 SQL과 도구를 생성했으며, Qwen3-8B 모델은 의도만 해석하고 정책이 승인된 프로그램을 실행했습니다.

그러나 330개의 런타임 계획 에피소드 중 전체 테스트 데이터셋에 걸쳐 완전한 답변 및 증거 계약을 충족한 경우는 없었습니다. 그럼에도 불구하고 정책이 실행한 분석기는 110/110으로 계약을 충족시켰습니다. 이는 런타임 에이전트가 다른 설계 하에서 성공할 수 없다는 증거가 아니라 특정 구성에 따른 결과임을 강조합니다.

SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

장기적인 조작 작업은 부분적으로 관찰 가능하며, 다음 행동을 선택하는 데 필요한 정보는 몇 분 전의 관찰에서만 나타날 수 있습니다. 기존의 메모리 메커니즘들, 예를 들어 검색 은행, 학습된 압축기, 순환 상태는 미래의 결정에 필요한 정보를 알기 전에 과거에서 무엇을 보존해야 할지 결정해야 하는 문제에 직면해 있습니다. 이 연구는 이러한 시간적 제약이 현대 VLM 백본이 실제로 처리할 수 있는 수준이 아니라는 가정에서 출발하여, 별도의 메모리 모듈이 없는 VLA인 SimpleMemVLA를 제안합니다.

SimpleMemVLA는 샘플링된 과거 기록을 그대로 유지한 채 이를 백본이 사전 학습된 형식인 타임스탬프 비디오 형태로 전달합니다. 생성된 하위 작업의 은닉 상태가 과거로부터 표준 흐름 일치 액션 헤드로 전달되는 유일한 채널이 됩니다. 연속적인 결정들이 대부분의 과거 정보를 공유한다는 점을 활용하여 행동 실행 중 공유 접두사를 미리 채워 넣으면 지연 시간을 단일 프레임 VLA에 가깝게 유지할 수 있습니다.

이러한 접근 방식은 일반 목적 제어에 비용 없이 네 가지 메모리 벤치마크에서 새로운 최고 성능을 달성합니다. 백본과 훈련 설정을 고정했을 때, SimpleMemVLA는 검색, 압축, 순환 상태 메커니즘보다 훨씬 우수한 성능을 보였습니다. 또한 인과적 개입 실험을 통해 해당 정책이 실제로 과거 정보를 정확하게 읽어낸다는 것을 확인했습니다.

Causal Foundation Models

인과 추론은 데이터로부터 치료나 개입의 효과를 추정하는 방법입니다. 전통적으로 인과 추론은 새로운 문제마다 인과 메커니즘을 제안하고, 호환되는 추정치를 선택하며, 최종적으로 모델을 훈련하는 맞춤형 파이프라인을 필요로 했습니다.

반면, 머신러닝 분야는 다양한 설정과 양식에서 기반 모델(Foundation Models) 패러다임으로 전환되었습니다. 이는 대규모로 사전 훈련된 네트워크를 한 번 훈련한 후 미세 조정 없이 새로운 작업에 적용하는 방식입니다.

이러한 기반 모델 패러다임을 인과 추론에 적용한 것이 인과 기반 모델(Causal Foundation Models, CFMs)입니다. CFMs는 모델 업데이트 없이 인컨텍스트 학습을 사용하여 완전히 새로운 데이터셋에서 평균 치료 효과와 같은 인과량을 추정하는 사전 훈련된 신경망입니다.

이 연구는 인과 추론과 머신러닝의 배경을 요약하고 CFMs에 대해 실용적인 입문을 제공하며 예제 코드와 주피터 노트북을 포함하고 있습니다. 이는 복잡한 인과 추론 문제를 기반 모델의 효율적인 학습 방식으로 해결할 수 있는 새로운 접근 방식을 제시합니다.

Unifying Conformal Language Tasks with In-Context Ensembles

많은 자연어 처리(NLP) 작업, 예를 들어 요약이나 추출 질문 응답은 문서에서 관련 콘텐츠를 검색하는 과정에서 두 가지 제약 조건, 즉 커버리지(목표 달성에 필요한 충분한 정보를 유지)와 간결성(불필요한 정보를 제거)을 만족해야 합니다. 컨포멀 예측 방법은 커버리지를 보장하지만, 간결성을 최적화하기 위해 점수 함수를 설계해야 합니다.

기존의 최첨단 점수 함수는 모델이 콘텐츠의 중요도를 평가하도록 요청하는 수작업으로 설계된 LLM 프롬프트를 사용하지만, 이는 수동 프롬프트 엔지니어링이 필요하여 노동 집약적이고 특정 작업에 국한된다는 한계가 있습니다. 이에 본 연구는 인컨텍스트 학습 예시 큐레이션과 앙상블을 활용하여 점수 함수를 생성하는 컨포멀 관련성(Conformal Relevance) 프레임워크를 제안합니다.

이 프레임워크는 최소한의 수동 입력으로 커버리지를 유지하면서 간결성을 개선하는 점수 함수를 만듭니다. 연구진은 이 프레임워크를 일곱 가지 NLP 작업에 적용하여 그 효과를 입증했으며, 또한 앙상블된 컨포멀 점수의 다양성이 미치는 영향을 이론적으로 연구했습니다. 이를 통해 앙상블이 최악의 경우 문장 점수를 개선하는 조건과 앙상블 개선에 대한 포화 한계(saturation bound)를 특징짓는 상보성 조건을 제시합니다.

Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation

온폴리 디스틸레이션(OPD)은 고정된 교사로부터 학생의 롤아웃에 대한 밀도 높은 토큰 수준의 지도(supervision)를 제공하여 훈련 후반 과정을 가속화합니다. 하지만 일반적인 OPD는 각 프롬프트에 대해 교사의 신뢰도를 확인하지 않고 지도를 균일하게 적용하는데, 이는 역 KL(reverse KL)이 모드 탐색적(mode-seeking)이기 때문에 교사가 잘못된 정보를 제공하더라도 강력하지만 오해를 유발하는 업데이트를 유도할 수 있습니다.

이에 연구진은 교사의 신뢰도를 프롬프트 수준에서 확인한 후 밀도 높은 지도를 허용하는 원칙에 기반한 교사 게이팅 온폴리 디스틸레이션(Teacher-Gated On-Policy Distillation, TGOPD)을 제안합니다. TGOPD는 검증기 점수가 매겨진 교사 탐침(probes)의 작은 세트를 통해 신뢰도를 추정하고, 신뢰도 검사가 통과될 경우에만 밀도 높은 OPD로, 그렇지 않을 경우 검증기 기반의 GRPO로 프롬프트를 라우팅합니다.

이러한 접근 방식은 수학, 코드, 지시 따르기 분야에서 4B 및 35B 학생 모델에 대해 모든 단일 도메인 설정과 7가지 벤치마크에서 일반 OPD보다 성능이 우수함을 입증했습니다. 또한, TGOPD는 사용되지 않는 교사 용량을 신뢰도 추정에 활용함으로써 비동기 OPD에서 교사 측 컴퓨팅 낭비를 줄여, 측정된 4B 단일 도메인 실행에서 교사 노드 GPU 활용률을 9.8%에서 78.9%로 크게 증가시켰습니다.

Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

멀티 에이전트 LLM 시스템은 작업을 분해하고 텍스트 반성을 통해 개선하지만, 조정, 기억 개선, 외부 검증에 대한 통일된 설명이 부족합니다. 본 연구는 이러한 상호작용을 이중 레벨 조정 게임으로 모델링하여 오케스트레이터와 작업자 간의 상호작용을 분석합니다. 작업자들의 국소 업데이트 게임은 근사 잠재 게임이며, 이들의 평형 여유는 분해 품질에 의해 제어됩니다.

연구진은 반성을 의미론적 메모리 상태에 대한 확률적 움직임으로 분석하고, 특정 조건 하에서 유한 시간 상한, 최악 경우 타이트함, 그리고 양의 하한을 도출했습니다. 또한, 텍스트 구별 불가능한 환경에서 생성된 전사본만을 관찰하는 게이트는 개선할 수 없지만, 환경에 기반한 게이트는 개선할 수 없다는 정보 이론적 불가능성 결과를 증명했습니다.

이러한 분석을 바탕으로 환경 기반 평가 위험이 엄격하게 감소할 때만 메모리를 수용하는 확률적 반성 메모리 상승(SRMA) 방법을 제안합니다. SRMA는 보정 질량과 보정(calibration) 조건 하에서 정확하게 수렴하며, 확률적 평가에 대한 신뢰 게이팅과 불연속 정지 환경에 대한 재고정 보장을 제공합니다.

실험 결과, 500개의 SWE-bench 인스턴스에서 전체 Kimi 기반 시스템은 공개된 미니 SWE-에이전트 참조 시스템보다 72.2%의 해결률을 보였습니다. 이 연구는 멀티 에이전트 시스템의 조정 및 드리프트 법칙을 예측하며 실질적인 시스템 개선에 기여합니다.

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

스트리밍 비디오 이해는 자율 주행, 임베디드 인텔리전스, 감시 시스템 등 실제 응용 분야에서 매우 중요하지만, 멀티모달 대규모 언어 모델(MLLM)을 사용하여 연속적인 비디오 스트림을 처리하는 것은 막대한 계산 비용을 발생시킵니다. 기존 연구들은 시각 토큰 가지치기, 토큰 병합, 양자화 등의 방법을 통해 스트리밍 오버헤드를 줄여왔으나, 모델의 깊이 차원이라는 측면은 간과되어 왔습니다. 특히, 전체 깊이의 MLLM에 대해 프레임을 반복적으로 프리필하는 것은 상당한 계산 부하를 유발하며 KV 캐시를 프리필 깊이에 비례하여 증가시키는 문제가 있었습니다.

이러한 문제를 해결하기 위해 ShallowStream이라는 새로운 프레임워크가 제안되었습니다. ShallowStream은 MLLM의 얕은 레이어를 활용하여 프레임 인코딩과 검색 인덱스 구축을 동시에 수행합니다. 스트림 처리 과정에서 ShallowStream은 얕은 레이어의 KV 캐시를 사용하여 항상 작동하는 경량 인덱스를 유지합니다. 질의 시간 답변 시에는 얕은 레이어에서 생성된 어텐션 점수를 활용하여 컨텍스트 프레임을 점수화하고 다양성 인식 선택 전략을 통해 정확하고 포괄적인 증거를 검색합니다.

ShallowStream은 기존의 강력한 스트리밍 방법들과 동등한 성능을 달성하면서도 프레임별 프리필 지연 시간과 10초 엔드투엔드 지연 시간을 각각 최대 52.1배 및 11.9배까지 감소시킵니다. 이는 MLLM 기반 비디오 처리의 효율성을 획기적으로 개선하여 실시간 응용 분야에서의 계산 효율성을 높이는 데 기여합니다. 해당 코드는 https://github.com/CURRENTF/ShallowStream에서 공개되어 있습니다.

RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

로봇 학습은 광범위하고 다양한 시연에 의존하지만, 실제 세계의 다양한 작업에 대한 데이터를 수집하는 것은 비용이 많이 들고 한계가 있습니다. 이러한 병목 현상을 해결하기 위해 연구진은 인터넷 규모의 데이터 엔진인 RoboTok을 소개합니다. RoboTok은 특정 인간 조작 비디오를 질의로 제공받으면 웹 비디오에서 조작 관련 인간 시연을 검색하여 숙련된 로봇 정책을 훈련하는 데 사용합니다.

RoboTok은 특히 추정된 행위자 중심 참조 프레임에서 표현된 3차원 손 궤적으로부터 잠재적 움직임 공간을 학습합니다. 이 표현 방식은 카메라 시점, 장면 외관, 행위자 가림 현상의 변화에 걸쳐 조작 행동을 비교할 수 있게 하며, 인터넷 규모의 비디오 컬렉션에 대해 효율적인 검색과 지속적인 인덱싱을 위해 충분히 압축적입니다.

연구진은 RoboTok을 기존의 로봇 데이터 검색 접근 방식과 검색 벤치마크 및 다운스트림 로봇 정책 성능을 비교했습니다. 그 결과, RoboTok은 더 관련성 높은 조작 시연을 검색하고 다운스트림 작업 성공률을 향상시켰습니다. 이는 손 자세 궤적 인식 검색을 통해 웹 비디오를 로봇 학습을 위한 확장 가능하고 지속적으로 성장하는 감독 소스로 만들 수 있음을 입증합니다.

Connecting every app to every other app

모든 앱을 서로 연결하는 $n^2$ 문제 해결을 위해 동적 클라이언트 등록(DCR)과 클라이언트 ID 메타데이터 문서(CIMD)라는 새로운 프로토콜이 제시되었습니다. 이는 사용자가 각 앱에 대해 수동으로 OAuth 클라이언트를 등록해야 하는 번거로움을 없애고, 앱이 동적으로 클라이언트를 프로비저닝하여 즉시 OAuth 흐름을 시작할 수 있게 합니다.

DCR은 개발자가 수동으로 클라이언트를 등록하는 과정을 자동화하며, 이는 Anthropic이나 OpenAI와 같은 서비스가 고객 앱에 연결할 때 OAuth 클라이언트 등록 문제를 해결하는 데 사용되었습니다. 또한 CIMD는 클라이언트 데이터를 미리 등록할 필요 없이 앱이 자체적으로 OAuth 흐름을 시작할 수 있게 하여 Notion과 같은 서비스에 즉시 연결할 수 있는 기반을 제공합니다.

이러한 기술은 Val Town과 같은 플랫폼에서 구현되어 다른 앱의 사용자 계정에 연결하는 기능을 가능하게 하며, std/oauth와 같은 미들웨어 라이브러리를 통해 구현이 용이해졌습니다. DCR과 CIMD는 API 키를 환경 변수로 관리하는 방식에서 벗어나, 앱들이 API 키 없이도 다른 서비스와 연결할 수 있는 미래를 제시합니다.

더 나아가 MCP(Multi-party Communication Protocol) 서버와 REST API의 차이는 안정성이라는 사회적 관습에 기인하며, 이는 AI가 추론을 통해 오류를 수정할 수 있는 MCP의 특성과 연결됩니다. 결국 DCR/CIMD는 API 키 관리의 수고를 줄이고, 연결의 안정성을 높여 소프트웨어의 유연성을 극대화하는 방향으로 발전하고 있습니다.

Record-High 89% in U.S. Say Government Corruption Widespread

미국 성인 중 89%가 정부 부패가 만연하다고 응답하며 20년 만에 최고치를 기록했습니다. 이는 미국 내 정부 부패에 대한 대중의 인식이 역사상 가장 높은 수준에 도달했음을 보여줍니다.

이러한 결과는 공화당, 민주당, 그리고 무소속 유권자들 모두가 정부 부패에 대해 광범위하게 동의한다는 점을 시사합니다. 이는 미국 정부 기관에 대한 대중의 신뢰가 크게 하락했음을 반영하는 중요한 지표입니다.

갤럽의 이 조사 결과는 미국 사회의 정치적 신뢰도와 제도에 대한 믿음에 대한 광범위한 우려를 나타냅니다. 이는 현재 미국 정치 환경에서 정부의 투명성과 책임성에 대한 논의가 더욱 중요해지고 있음을 의미합니다.

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

영상 생성물의 시각적 유창성이 물리적 신뢰성을 의미하지 않으며, 단순한 품질 점수만으로는 클립이 위반하는 의무나 실패 시점을 나타낼 수 없습니다. 이에 연구진은 VeriPhy라는 감사 가능한 물리적 검증 시스템을 제시합니다. 이 시스템은 텍스트 기반 플래너가 프레임을 관찰하기 전에 프롬프트를 유형화된 물리적 의무와 정적으로 검증된 실행 계획으로 컴파일하는 방식으로 작동합니다.

실행 과정에서 VeriPhy는 세그멘테이션, 추적, 깊이 측정, OCR 등 고정된 저수준 전문가 호출에만 제한적으로 접근하며, 각 행동은 유형화된 측정값이나 명시적으로 태그된 학습된 상태를 담은 출처 추적 증거 기록을 반환합니다. 이러한 증거 기록은 유형 해제기가 이를 세 가지 값(지원됨, 모순됨, 알 수 없음)으로 매핑하고 전체 출처를 보존하여 모든 판단이 생성된 증거로 추적 가능하게 만듭니다.

이러한 접근 방식은 결정의 추적 가능성을 확보하여 비평가 판단을 생성 과정으로 다시 기록할 수 있는 인터페이스를 제공합니다. VeriPhy는 인간이 주석을 단 1,500개의 클립 코퍼스를 기반으로 실시간 생성 실패를 위치시키는 방식으로 평가를 시작합니다. 실제로 149개의 클립 코어를 사용하여 VeriPhy는 동일한 클립과 주장을 가진 공개된 질문 분해 평가자에서 164점 중 228점을 획득했습니다.

이는 단순히 회상(Recall)만으로는 단일 결정이 증거 기록과 출처를 유지함으로써 다른 방법들과 구별되며, 결과적으로 생성 과정에 대한 감사 가능성을 높여줍니다.

Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale Invariance

확률적 경사 하강법(SGD)의 시간적 역학을 연구하여 딥 신경망이 더 단순한 부분 네트워크에 해당하는 불변 집합으로 향하는 과정을 분석합니다. 이 과정이 어떻게 전개되는지에 대한 이해는 현재 부족한 상태입니다.

연구진은 확률적 경사 흐름(SGF)을 퍼콜레이션 과정으로 모델링하여 이 문제를 해결합니다. 이 모델에 따르면, 구조적 대칭성이 부분 네트워크를 한 번에 동시에 병합하도록 강제하며, 이러한 구조적 전환은 거시적 차수 매개변수에서 분산 스파이크로 나타나 물리적 상전이를 반영합니다.

나아가 이 트래핑 메커니즘과 관련된 스케일링 캐스케이드가 명시적인 꼬리 분포 노이즈 모델 하에서 Adam 및 AdamW 알고리즘으로 확장됨을 보였습니다. 이는 최적화 과정에서 발생하는 현상이 특정 알고리즘에 국한되지 않고 광범위하게 적용됨을 시사합니다.

Let Confidence Change, Not the Prediction: Prediction-Preserving Repair for Post-hoc Calibration

후처 보정(post-hoc calibration)은 보고된 신뢰도를 보정하지만, 다중 클래스 보정기(multiclass calibrator)는 관련 상위-1 예측(top-1 prediction)을 변경할 수 있다는 문제가 있습니다. 정확도는 이러한 변화가 결과의 정확도에 미치는 순 효과만을 포착할 뿐 예측이 얼마나 자주 변경되는지는 측정하지 못합니다. 대신 상위-1 예측 변화율(Top-1 Prediction Change Rate, TPCR)이 이러한 변화의 빈도를 측정합니다.

이에 연구진은 상위-1 결정 보존을 위해 전체 보정 확률 벡터를 복구하는 최초의 후적응 어댑터인 Calibrator-Output Repair for Top-1 Decision Preservation (CORD)을 제안했습니다. CORD는 원본 출력과 보정된 출력만을 사용하여 원래 상위-1에 할당된 질량을 결정하고, 나머지 질량을 다른 클래스에 할당하여 복구된 벡터가 원래 예측을 회복하도록 합니다. 이 어댑터는 보정된 모델이나 그 직접 출력에 변화를 주지 않으며, 추가적인 지도 학습 맵을 학습하거나 사용자 또는 검증 데이터셋에 따라 조정해야 하는 하이퍼파라미터가 필요하지 않습니다.

CIFAR-10/100 및 ImageNet-1K 데이터셋에서 CORD는 구조적으로 TPCR을 0으로 달성하며, 모든 데이터셋에서 해당 직접 출력 대비 평균 ECE, NLL, Brier 점수를 낮춥니다. 이러한 이점은 분포 변화와 보정 세트 크기에 걸쳐 지속됩니다. CORD는 보정기 적합 과정에서 보존 제약을 제거하고 후속 출력 복구를 통해 원래 결정을 정확하게 회복시킵니다. 코드는 https://github.com/labhai/CORD에서 확인할 수 있습니다.

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

결합 오디오-비디오 생성 모델은 시각적 품질과 오디오-비주얼 동기화에서 상당한 발전을 이루었지만, 스크립트에 따른 샷 전환이나 대화 시점 제어에는 여전히 한계가 있습니다. 현재의 모델들은 비디오와 오디오 표현을 공유된 시간 축에 정렬하지만, 구조화된 프롬프트에 명시된 샷과 대화의 정확한 타이밍은 프롬프트 텍스트 표현에만 인코딩되어 있어 양쪽 양식의 시간 좌표와 일치하지 않습니다. 이로 인해 비디오와 오디오는 서로 동기화될 수 있으나 스크립트의 시간 흐름을 따르지 못하는 문제가 발생합니다.

이러한 불일치를 해결하기 위해 스크립트 타이밍을 비디오 및 오디오 생성의 공유 시간 축으로 확장하고 프롬프트 지침을 두 양식 모두에 해당하는 위치로 라우팅하는 시간 컨텍스트 라우팅(Temporal Context Routing, TCR)을 도입했습니다. TCR은 스크립트 타이밍을 비디오와 오디오 생성의 공유 시간 축에 매핑하여 각 프롬프트 지침을 두 양식 모두의 해당 위치로 전달합니다.

200개의 테스트 스크립트 비교 결과, TCR은 기준 모델 대비 샷 경계 MAE(Shot Boundary MAE)를 96% 감소시켜 1.11초에서 0.042초로 줄였으며, 대화 정확도(Dialogue [email protected] s)를 28.3%에서 84.1%로 높였습니다. TCR은 이러한 개선을 달성하면서도 기준 모델과 비교하여 시각적 품질과 오디오-비주얼 동기화는 유사하게 유지합니다. 사용자 연구 결과, 참가자들은 TCR을 평가된 다섯 가지 차원 모두에서 선호했습니다.

Debias-SparseGPT: Bias-Aware Pruning for Large Language Models

대규모 언어 모델(LLM)의 효율적인 배포와 가속화를 위해 가지치기(pruning) 및 양자화와 같은 모델 압축 기법이 사용되고 있습니다. 그러나 최근 연구에 따르면 SparseGPT와 같은 가중치 희소화(weight sparsification) 방법은 모델 내 기존 편향을 증폭시킬 수 있으며, 프롬프트의 페르소나 신호에 따라 출력 결과가 크게 달라지는 문제가 제기되었습니다.

이에 본 논문에서는 대표적인 편향 제거 기법을 통합한 후처리 가지치기 방법인 Debias-SparseGPT를 소개합니다. 이 방법은 인구 통계학적으로 대비되는 입력에 대해 2차 항을 사용하여 표현적 편향 제거(representational debiasing)를 통합합니다. 연구진은 다양한 생성형 LLM에 걸쳐 이 방법을 실증적으로 검증했으며, 25%, 50%, 구조화된 2:4 희소화 등 여러 희소화 체제에서 Debias-SparseGPT가 SparseGPT에 비해 가지치기로 인한 편향을 일관되게 감소시켰습니다.

모델의 성능과 공정성을 유지하면서도 계산 효율성을 보존하는 것이 핵심 목표입니다. 특히 모델 품질을 가장 공격적으로 저하시키는 가장 제한적인 2:4 구조화 희소화 패턴 하에서, 긴 컨텍스트와 풍부한 콘텐츠를 포함하는 예시로 보정 세트(calibration set)를 보강하면 다운스트림 성능과 공정성이 더욱 향상됨을 확인했습니다.

결론적으로 Debias-SparseGPT는 희소 모델의 계산 효율성을 유지하면서 편향과 성능 간의 상충 관계를 개선하는 데 기여합니다.