오프그리드 태양광으로 전기차 충전하기(2025)

인근 전기차 충전기 없이 전기차를 운용하기 위해 오프그리드 태양광을 활용한 충전 가능성을 시험하는 연구가 진행되었습니다. 연구팀은 기존 1kW 규모의 태양광 설비를 확장하고 계절에 따른 충전 가능성을 검증하는 데 중점을 두었습니다.

초기 실험 단계에서는 맑은 날에도 하루 약 5마일만 충전이 가능했으며, 충전 과정에서 가정용 배터리까지 소모하는 상황이 발생했습니다. 이는 오프그리드 환경에서 태양광 에너지로 전기차를 충전하는 데 있어 현실적인 제약 사항을 보여줍니다.

이후 설비 규모를 5kW로 확대하여 테스트를 진행하면서, 흐린 날에도 태양광을 통해 직접 전기차를 충전할 수 있는지에 대한 가능성을 탐색하고 있습니다. 이 실험은 태양광 기반의 이동형 충전 시스템이 기상 조건에 관계없이 안정적으로 작동할 수 있는지에 대한 기술적 타당성을 확인하는 데 중요한 의미를 가집니다.

번아웃으로 더는 버틸 수 없다

2년 전 번아웃과 이혼을 겪은 후 새로운 도시로 이주하여 현재 생활비와 부채를 감당하며 혼자 일곱 마리의 고양이를 돌보고 있습니다. 이러한 상황에서 경력을 바탕으로 고객 확보는 어렵지 않지만, 유료 업무에 집중할 수 있는 시간이 주당 5~6시간에 불과하여 지속적인 어려움을 겪고 있습니다.

이러한 시간 제약으로 인해 전문적인 업무에 집중하지 못하면서 몇 달마다 고객을 잃는 상황이 반복되고 있습니다. 이는 경력과 실력에도 불구하고 시간 관리와 정신적 여유 부족이 비즈니스 지속성에 직접적인 영향을 미치는 현실을 보여줍니다.

결국 이 사례는 번아웃과 개인적인 어려움이 전문적인 활동과 경제적 안정에 미치는 영향을 구체적으로 보여줍니다. 이는 단순히 업무 효율을 넘어 개인의 삶과 커리어를 유지하는 데 있어 시간과 정신적 에너지가 얼마나 중요한지 시사합니다.

Real-World Knowledge-Guided Change Data Synthesis for Remote Sensing

변경 데이터 합성(Change data synthesis)은 훈련 데이터 확장을 위한 비용 효율적인 해결책을 제공하지만, 기존 방법들은 변화를 시뮬레이션하기 위해 수작업 규칙에 의존합니다. 이러한 방식은 클래스 전환에 대한 커버리지가 제한되어 합성 데이터의 다양성이 부족하고, 미리 정의된 전환 설계는 다양한 변화 유형을 수용하는 유연성을 제한합니다.

이러한 한계를 극복하기 위해 본 연구는 사전 훈련된 비전-언어 모델(vision-language models)을 지식 소스로 활용하여 변화가 발생할 가능성이 있는 위치와 클래스 전환을 추론하는 지식 기반의 변화 데이터 합성 프레임워크인 KnowChange를 소개합니다. KnowChange는 지식 기반 변화 시뮬레이션과 일반화 가능한 합성 모델을 통합하여 다양한 변화 유형을 통합된 프레임워크 내에서 유연하게 합성할 수 있도록 합니다.

광범위한 실험 결과는 KnowChange가 생성한 데이터가 합성-실제 전이 및 합성 데이터 증강 모두에서 기존 합성 데이터셋보다 일관되게 우수함을 입증합니다. 이는 데이터가 비교적 작은 규모로 생성되었음에도 불구하고 성능이 뛰어남을 의미합니다.

또한, 지식 기반 변화 시뮬레이션은 기존 합성 파이프라인에 원활하게 통합될 수 있으며, 합성 데이터의 다운스트림 유용성을 향상시키는 것으로 분석되었습니다.

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

잠재 확산 모델은 고화질 이미지 및 비디오 합성을 위해 변이형 오토인코더(VAE)를 사용하여 계산 효율성을 높이는 주류 프레임워크로 부상했습니다. 그러나 기존 VAE는 고정된 압축 비율을 사용하기 때문에 시공간 콘텐츠의 변화하는 복잡성에 적응하지 못하여 비디오 데이터에 대해서는 최적이 아닙니다.

이에 연구진은 잠재 토큰과 공동으로 학습되는 적응형 토큰 선택기를 통합한 트랜스포머 기반 VAE인 KATok(Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation)를 제안했습니다. 이 모델은 각 토큰의 내용 풍부도를 기반으로 보존 또는 제거 확률을 평가하여 정보가 부족한 토큰을 효과적으로 제거함으로써 데이터 의존적인 압축을 가능하게 합니다.

하지만 토큰을 제거하는 과정에서 원래의 시공간 구조가 손상되어 공간적 불일치가 발생할 수 있습니다. 이러한 문제를 완화하기 위해 연구진은 공간적 일관성을 보장하기 위해 캐스케이드 및 공동 생성이라는 두 가지 위치 예측 전략을 제안했습니다.

실험 결과, 이 모델은 최첨단 압축 비율에서 강력한 재구성 및 생성 품질을 달성했습니다. 비디오 데이터에 대한 추가 분석 결과, 이러한 개선은 양적 및 정성적 결과 모두에서 뒷받침되듯이 시공간 중복성을 줄이고 정보가 부족한 토큰을 제거함으로써 주로 달성되었습니다.

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

StarHarness는 모델 가중치를 고정한 채 환경별 에이전트 하네스를 진화시키는 프레임워크입니다. 이 진화된 하네스는 프롬프트 및 작업 프레이밍, 도구 인터페이스, 스킬, MCP 지원 제공자, 서브에이전트 구조, 에이전트 루프 구성 등을 포함할 수 있습니다. StarHarness는 기본 실패 행동에 따라 작업을 계층화하고, 제안자에게 보이는 검색 작업과 숨겨진 선택 작업을 분리하며, 일반화 평가를 위해 보류된 작업을 따로 확보하여 효율적인 진화 풀을 구축합니다.

이러한 하네스 진화는 ITBench SRE, EnterpriseOps-Gym ITSM, AutomationBench Finance 등 여러 벤치마크에서 기본 하네스 대비 20~35퍼센트 포인트의 전체 벤치마크 성능 향상을 가져옵니다. 이는 환경당 4~12회의 수용된 변경 후에 달성되었으며, 이러한 성능 향상은 진화에서 제외된 작업에서도 지속되며 GPT 및 Qwen 모델 패밀리 간에도 재진화 없이 전이됩니다.

추적 분석 결과, 이러한 개선은 검색을 압축하는 인터페이스 수정, 환경 관습, 운영 지식과 관련이 있으며, 여러 설정에서 오탐 진단 감소 및 더 짧은 궤적을 보였습니다. 따라서 StarHarness는 도구가 풍부한 엔터프라이즈 작업에서 지속적인 모델-환경 불일치를 줄이는 실용적인 방법을 제공합니다.

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

LLM 기반 에이전트가 도구 호출을 통해 외부 환경과 상호작용할 때 파일 수정, 정보 유출, 무단 행동과 같은 보안 위험이 발생합니다. 기존의 안전장치들은 완료된 궤적만을 평가하여 실행 전 단계별 행동에 대한 모니터링은 충분히 다루지 못하고 있습니다.

이에 연구진은 에이전트의 단계별 행동을 검사하고 도구 실행 전에 안전성을 확인하는 단계별 가드 모델인 StepGuard를 제안합니다. StepGuard를 훈련하기 위해 동일한 컨텍스트에서 위험한 단계에 대해 다른 행동을 생성하는 안전하고 위험한 궤적을 자동으로 생성하는 데이터 엔진인 StepGen을 도입했습니다. 또한 과도한 방어와 부족한 방어를 줄이기 위해 관찰된 정확도에 따라 안전한 행동과 위험한 행동 간의 학습을 동적으로 균형 잡는 Balance-GRPO를 제안했습니다.

실험 결과 StepGuard는 공개 가중치 가드 모델 중 가장 높은 평균 정확도를 달성했으며, 성능은 GPT-5.4와 비교될 수 있습니다. AgentDojo와 AgentDyn 환경에서 에이전트를 보호하는 데 사용했을 때, StepGuard는 가드 설정이 없는 경우 대비 평균 공격 성공률을 77.3% 감소시켰습니다. 동시에 평균 유용성은 단 2.8퍼센트 포인트만 감소하여 안전성과 효율성을 동시에 확보했습니다.

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

멀티모달 대규모 언어 모델(MLLM)은 긴 시각 기록을 통합하고 부분 관찰 하에서 추론하며 몇 가지 예시로부터 행동을 추론할 수 있는 능력을 가지고 있습니다. 그러나 비전-언어-행동(VLA) 모델은 일반적으로 이러한 맥락적 능력을 에피소드 메모리로 사용하지 않고 사전 학습된 표현을 상속받습니다. 이 문제를 해결하기 위해 메모리 의존적 정책은 목적에 맞게 구축된 역사 메커니즘을 통해 격차를 해소합니다.

PonderPounce는 MLLM의 고유한 인과적 맥락을 로봇 메모리로 재사용하여 이 격차를 메웁니다. Ponder는 시스템2 MLLM으로 에피소드 관찰, 시연, 사전 인지 사항을 고유한 인과적 맥락에 축적하며 내부 사용을 위해 하위 목표 텍스트와 시연 추론을 생성할 수 있습니다. Pounce는 시스템1 VLA로 현재 관찰, 지침, 고유 감각 정보를 직접 받으며, Ponder--Pounce 인터페이스를 통해 가장 최신의 연속 인지 토큰과 그 연령만을 비동기적으로 수신합니다.

두 모델은 목적에 맞게 구축된 메모리 모듈이나 별도의 브릿지 사전 학습 없이 종단 간으로 공동 훈련됩니다. 최적화된 서비스는 인지 사항 새로 고침에 78ms, 행동 모델 호출에 25ms의 p50 지연 시간을 달성하여 20Hz 행동 재생을 지원합니다.

RoboMME 환경에서 PonderPounce는 동일한 Pounce 아키텍처와 인터페이스 하에서 9B 모델에서 60.83%, 0.8B 모델에서 50.04%의 성능을 달성하며, 이는 FrameSamp+Modul의 44.51%와 현재 관찰 $\pi_{0.5}$의 17.93%보다 높습니다. 데이터가 9배 증가하면 75.54%를 달성하여 FrameSamp+Modul의 57.88%보다 우위를 보입니다. RoboCasa-DC에서는 동일한 인터페이스가 행동 감독만으로 학습하여 가장 강력한 공개 시연 조건부 기준선인 11.6%보다 높은 12.5%를 달성하며, 인지가 학습된 널 상태로 대체될 경우 8.6%로 하락합니다.

Running SQLite Apps on Docker and Kubernetes with Litestream

OpenRun은 Docker나 Kubernetes 환경에서 웹 애플리케이션을 배포하는 GitOps 플랫폼으로, SQLite 애플리케이션에 Litestream 기능을 내장하여 데이터 복제 및 복구를 자동화합니다. 이 시스템을 사용하면 개발자는 애플리케이션을 배포할 때 Litestream을 별도로 설정하거나 객체 스토리지 구성을 직접 처리할 필요 없이 SQLite를 정상적으로 사용할 수 있습니다.

OpenRun은 SQLite 데이터 변경 사항을 AWS S3 또는 S3 호환 객체 스토리지(Cloudflare R2, MinIO 등)로 지속적으로 복제하여 노드 외 백업과 특정 시점 복구 기능을 제공합니다. 애플리케이션 볼륨이 비어 있거나 재구성될 때 OpenRun은 복제본에서 데이터베이스를 복원하여 애플리케이션을 시작시키므로 데이터 손실 위험을 최소화합니다.

이 기능은 단일 노드 환경의 Docker/Podman뿐만 아니라 Kubernetes 환경에서도 동일하게 작동하며, Kubernetes에서는 Litestream 사이드카와 복구 초기 컨테이너를 자동으로 추가하여 관리합니다. 노드 손실 시에도 OpenRun은 메타데이터와 애플리케이션 데이터를 객체 스토리지에서 복구하여 전체 시스템을 복원할 수 있습니다.

다만 복제는 비동기 방식으로 이루어지기 때문에, 일반적인 조건에서는 1초 간격으로 동기화되지만 갑작스러운 충돌 발생 시 객체 스토리지에 도달하지 못한 가장 최근의 쓰기 작업은 손실될 수 있다는 점을 고려해야 합니다.

Luce: Relightable Gaussians for 3D Asset Generation

고품질 이미지-3D 생성은 기하학과 외관을 모두 포착하는 3D 표현을 필요로 하며, 표준 렌더링 파이프라인에 통합하고 재조명(relighting)을 지원하기 위해 알베도, 금속성-거칠기, 표면 법선과 같은 물리 기반 렌더링(PBR) 양식을 포함해야 합니다. 이에 연구진은 각 양식에 전용 가우시안 프리미티브를 사용하는 복셀화된 멀티모달 가우시안 클라우드 내에서 기하학과 PBR 재료를 통합하는 3D 표현인 Luce를 제안합니다.

Luce는 이 표현을 통합된 재료 인식 잠재 공간으로 압축하기 위해 변이형 오토인코더(variational autoencoder)를 사용합니다. 이후 정류 흐름 트랜스포머(rectified-flow transformer)는 사전 학습된 이미지 인코더의 다중 레이어 특징으로부터 단일 이미지에서 이 잠재 공간을 생성하며, 이는 의미적 맥락과 미세 공간 세부 사항을 모두 보존합니다. 생성된 잠재 공간은 재조명 가능한 PBR 가우시안과 선택적 텍스처 메시(접선 공간 법선 맵 포함)로 디코딩됩니다.

Toys4K에서 Luce는 단일 이미지-3D 생성에서 최고 수준을 달성하며, 가장 강력한 기준선 대비 FID를 28% 개선했습니다. 또한 Luce는 AI 생성 이미지에 대한 벤치마크를 도입하여 최적의 기준선(0.8299) 대비 CLIP 이미지 정렬 점수를 개선하여 0.8519를 달성했습니다. 이 기술은 텍스트, 로고, 각인과 같은 미세 세부 사항을 보존하면서 재조명 가능하고 기하학적으로 정확하며 재료적으로 충실한 에셋을 생성합니다.

Verschlimmbesserung: The Word Your Software Updates Need

소프트웨어 업데이트가 필요로 하는 단어는 독일어로 'Verschlimmbesserung'입니다. 이는 개선을 시도했지만 결과적으로 상황을 더 악화시키는 행위를 의미합니다. 사용자들이 일상적으로 경험하는 버튼 이동, 메뉴 이름 변경, 기존 워크플로우 파괴와 같은 업데이트 사례들이 이러한 현상에 해당합니다.

많은 제품 팀이 사용자가 필요로 하지 않는 문제를 해결하는 대신 단순히 '더 나은 경험'을 제공하는 데 집중하면서 Verschlimmbesserung이 발생합니다. 이는 엔지니어링 팀이 실제로 실패한 것이 아니라, 그들이 부여받은 측정 기준에 따라 최적화하고 있음을 보여줍니다. 예를 들어, 이탈률(churn)을 보상하는 지표를 사용하면 이탈률이 증가하게 되고, 배포 자체를 보상하는 지표를 사용하면 개선 여부와 관계없이 배포가 이루어지게 됩니다.

엘리아후 골드랫(Eliyahu Goldratt)은 측정 기준에 따라 행동이 결정된다고 강조하며, 비논리적인 방식으로 측정한다면 비논리적인 행동에 대해 불평하지 말라고 조언합니다. 따라서 안정성은 기능이며, 언제 배포하지 말아야 하는지를 아는 것은 엔지니어링의 한 분야입니다. 소프트웨어 업데이트 시점과 측정 기준에 대한 철학을 재고할 필요가 있습니다.

What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals

평가 산출물은 과제, 평가자, 보고된 지표를 명시하지만, 해당 지표에 첨부된 주장에 대한 라이선스를 반드시 부여하지는 않습니다. 이는 해당 지표를 재현하는 데 필요한 역사적 증거와 대안적 의미론적 근거가 확보되지 않을 수 있기 때문입니다.

연구진은 이러한 누락된 주장-재생 레이어를 고정된 기저 D, 근거 있는 패밀리 F, 주장 쿼리 q, 그리고 식별된 집합을 통해 형식화했습니다. 이를 바탕으로 고정된 커밋에서 기계적으로 적격한 124개의 Inspect Evals 단위를 조사했습니다.

조사 결과, 필요한 역사적 증거 또는 의미론적 근거가 사용 불가능하여 110개의 단위는 결정적 추론 전에 중단되었습니다. 실행이 종료된 경우, 정확한 값, 승자, 완전한 순서, 쌍별 관계는 주장 해결 및 주요 대 검토 패밀리에 따라 분리됩니다.

따라서 이 감사(audit)는 하나의 평가자 의미나 하나의 견고함/비견고함 레이블을 강제하기보다는, 유형화된 중단, 불안정성 증거, 그리고 안정적인 부분 구조를 반환합니다.

GameWAM: A World Action Model for Video Games

최근 연구에서 개발된 GameWAM은 비디오 게임의 동적 상호작용을 통합하는 최초의 세계 행동 모델(WAM)을 제시합니다. 기존 게임 에이전트들은 시각 및 과제 맥락을 행동으로 직접 매핑하지만 명시적인 세계 역학 모델이 부족하며, 게임 세계 모델은 행동으로부터 시각적 미래를 예측하지만 과제 정책 역할을 수행하지 못하는 한계를 가지고 있습니다. GameWAM은 이러한 목표들을 통합하여 네이티브 폐쇄 루프 게임플레이와 GUI 제어를 위한 최초의 WAM으로, 블록 인과 조건화 및 플로우 매칭을 통해 미래 시각 관찰과 실행 가능한 키보드-마우스 궤적을 동시에 생성합니다.

이 모델은 동기화된 게임플레이 및 GUI 궤적을 구축하여 복잡한 상호작용을 지원합니다. 특히 이 모델은 이질적인 네이티브 제어를 처리하기 위해 각 행동 단계에서 게임플레이/GUI 모드를 예측하고 모드별 예측 분포와 연속 행동 정규화를 사용하여 제어합니다. 장기 상호작용을 위해서는 블록-사이클 제어가 사용되어 약속된 지평선 너머를 예측하고 짧은 행동 접두어만 실행한 후 새로운 관찰로부터 재계획을 수행합니다.

또한, GameWAM 실험 결과는 비교 에이전트보다 적은 네이티브 행동 실행으로 경쟁적인 과제 성공을 입증했습니다. 더 나아가, 연구진은 낮은 주파수 구성 요소가 고정된 조건 하에서 생성된 카메라 움직임을 체계적으로 유도하는 저주파 행동 소스 임프린팅(LASI) 현상을 발견했습니다. 이는 생성 제어에서 발생할 수 있는 소스 민감성 실패 모드를 드러내는 중요한 발견입니다.

LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale

LibriBrain100은 음성 디코딩을 위한 대규모 뇌자기(MEG) 데이터셋으로, 재현 가능하고 표준화된 평가를 위해 처음부터 설계되었습니다. 이 데이터셋은 피험자들이 자연스러운 연속 음성을 들을 때 수집된 100시간 이상의 고품질 MEG를 포함하며, 특히 단일 피험자로부터 80시간의 데이터(sim80시간)를 확보하여 기존 비교 데이터셋보다 8배, 다른 데이터셋보다 약 80배 더 깊은 내피험자 신경 데이터를 기록적으로 제공합니다.

이러한 깊이 우선 설계의 이점을 입증하기 위해 단어 분류 벤치마크를 사용하여 평가했으며, 기존 디코딩 모델을 적용하여 최고 성능을 달성함으로써 녹음 품질과 대규모 내피험자 데이터의 가치를 동시에 입증했습니다. 또한, 실제 응용에 필요한 데이터 수집의 비현실성을 고려하여 32명의 피험자로부터 추가 데이터를 수집하여 광범위한 다중 피험자 데이터의 가치를 보여주었습니다.

이 데이터셋은 내피험자 뇌-텍스트 디코딩이라는 오픈 챌린지의 발전에 기여하며, 데이터셋과 평가 인프라가 일반 딥러닝 프레임워크에 쉽게 다운로드, 전처리 및 데이터 로딩을 지원하는 오픈 소스 파이썬 라이브러리로 제공됩니다. 이 데이터셋은 오픈 머신러닝 대회 및 공개 리더보드와 함께 공개되어 표준화된 벤치마킹을 가능하게 합니다.

궁극적으로 LibriBrain100은 심각한 마비로 고통받는 사람들에게 소통을 회복할 수 있는 실용적인 비침습적 뇌-컴퓨터 인터페이스의 발전을 가속화하는 것을 목표로 합니다.

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

대규모 비전-언어 모델이 UI-to-code 생성에서 강력한 발전을 보였음에도 불구하고, 테스트 시 자기 진화 과정은 여전히 불안정하다는 문제가 제기되었습니다. 연구진은 이 문제를 '시각 복구 결합(visual repair coupling)'이라는 근본적인 장애물로 식별했는데, 이는 로컬 코드 수정이 레이아웃, 스타일, 컴포넌트 의존성을 통해 전파되어 한 시각적 불일치를 수정하는 동시에 이전에 충실했던 영역을 저하시킬 수 있다는 것입니다.

이 문제를 해결하기 위해 연구진은 RubSE라는 Rubric-guided Self-Evolution 프레임워크를 제시했습니다. RubSE는 루브릭(rubrics)을 사용하여 시각적 피드백을 구조화된 시각 복구 컨텍스트로 표현합니다. 각 개선 라운드마다 RubSE는 타입화된 후보 루브릭을 생성하고 우선순위가 높은 복구 대상을 선택하며, 이전에 선택된 루브릭들을 기록하여 각 수정이 잘 범위가 정해진 시각 복구 방향으로 나아가도록 유도하고 반복적이거나 광범위한 변경을 억제합니다.

여섯 개의 VLM과 세 개의 UI-to-code 벤치마크에 걸친 평가 결과, RubSE는 단순한 자기 진화보다 최종 라운드 및 최적 라운드 설정에서 훨씬 뛰어난 성능을 보였습니다. 이는 더 안정적인 정제 궤적과 더 높은 궤적 수준의 성능 천장을 달성했음을 의미합니다. 또한 추가 분석 결과, RubSE는 심각한 시각적 퇴행으로부터의 복구를 개선함으로써 궤적 붕괴를 완화하며, 더 강력한 루브릭 생성기는 약한 코드 개선자에게 효과적인 시각 복구 지침을 전달할 수 있음을 보여줍니다.

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

코딩 에이전트가 여러 모델 호출, 도구 사용, 코드 수정을 포함하는 장기 작업을 수행할 때 발생하는 비용-품질 상충 관계를 연구한 결과가 발표되었습니다. 사용자는 더 강력한 모델로 상향 조정하거나(escalation) 추론이 완료된 후 모델을 하향 조정(downshift)하는 선택을 하지만, 이러한 전환 과정에서 수신 모델은 이전 모델이 생성한 비자연스러운 궤적(non-native trajectory)을 계속 이어가야 합니다.

연구진은 클로드(Claude)와 GPT 계열의 저비용/저능력(LC) 모델과 고비용/고능력(HC) 모델 쌍을 사용하여 이러한 핸드오프가 품질과 비용에 미치는 영향을 분석했습니다. 전체 궤적 전송 방식은 비용 프리미엄을 발생시키지만, LC 모델에서 HC 모델로의 상향 조정은 품질 격차의 절반도 회복하지 못하는 것으로 나타났으며, 이를 비용-품질 페널티로 명명했습니다.

반면, 모델을 하향 조정하는 방식은 비용-품질 측면에서 유리한 지점을 제공합니다. 흥미롭게도 선호되는 인터페이스 역시 방향에 따라 반전되었습니다. LC 모델의 궤적 정보를 줄이면 상향 조정 품질이 향상되지만, HC 모델의 궤적 정보를 제거하면 하향 조정 품질이 감소하는 것으로 나타났습니다.

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

대규모 병렬 시뮬레이션 환경에서 오프-폴리시 강화 학습(RL)을 훈련할 때, 데이터 제한 환경에 맞춰 설계된 안정화 기법들이 도전받고 있습니다. 연구진은 여덟 가지 벤치마크 가족에 걸친 실험을 통해 이러한 안정화 기법들이 데이터 체제에 따라 달라진다는 것을 보여주었습니다. 예를 들어, 파라미터 정규화는 데이터가 풍부할 때 가치 적합을 제한하지만 데이터가 제한적일 때는 좁은 재생 범위에 도움이 되며, 클립된 이중 Q(clipped double-Q)는 고처리량 조작에서 완화될 수 있습니다.

이러한 발견을 바탕으로 연구진은 데이터 체제에 민감한 WarpSAC라는 새로운 오프-폴리시 RL 알고리즘 패밀리를 제안했습니다. WarpSAC는 효율적인 활용을 위해 샘플 가중치 감쇠(Sample Weight Decay)를 사용하며, 데이터 제한적인 CPU 규모 훈련을 위한 WarpSAC-L과 데이터가 풍부한 GPU 병렬 훈련을 위한 WarpSAC-A 두 가지 변형을 제공합니다.

WarpSAC는 FlashSAC 대비 정규화된 점수-단계 AUC를 CPU 환경에서 4.5%, GPU 병렬 환경에서 23.1% 향상시켰습니다. 또한, UnitreeG1TransportBox-v1의 성공률을 19.8%에서 96.4%로 높였으며, MuJoCo Playground에서의 평균 정규화된 벽 시간 AUC를 19.1% 개선했습니다. 결과적으로 WarpSAC는 Unitree G1에서 FlashSAC보다 36.4% 더 빠른 시뮬레이션-실제 환경 배포를 달성했습니다.

이러한 결과는 확장 가능한 오프-폴리시 RL이 사용 가능한 데이터 체제에 맞춰 안정화 기법을 적응시켜야 함을 시사합니다.

Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation in Transformers

트랜스포머 언어 모델을 확장할 때 표현력과 메모리 효율성 사이에 내재된 긴장이 발생합니다. 레이어별 고유한 가중치는 기능적 전문화를 보존하지만 상당한 메모리 발자국을 요구하며, 반면 표준 깊이 공유 방식은 표현적 다양성을 붕괴시키고 모델링 품질을 저하시킵니다.

이에 연구진은 재귀적 깊이 트랜스포머인 게이티드 재귀 트랜스포머(Gated Recurrent Transformer)를 제안했습니다. 이 모델은 고정된 깊이의 프렐류드 및 코다 블록이 단일 공유 코어를 R번 반복하도록 구성되며, 게이티드 순환 신경망에서 영감을 받아 은닉 상태, 고정된 프렐류드 출력, 노이즈를 조건으로 사용하여 재귀 업데이트를 조절하는 게이트를 사용합니다. 이는 여러 고유 레이어를 필요로 하지 않고 재귀를 통해 동일한 소수의 레이어에 입력을 전문화할 수 있게 합니다.

isoFLOPS 제약 조건 하에서 3층 Gated Recurrent Transformer는 12층 GPT-2 Small 모델과 유사한 훈련 및 추론 FLOPs를 가지면서 정확도를 일치시키고, 모든 규모별 예산 셀에서 MoR 및 헤비테일 깊이 샘플링을 선도합니다. 또한 isoPARAMS 제약 조건 하에서 더 깊은 재귀는 매칭된 파라미터 및 데이터 예산에서 비재귀 모델보다 2.76의 검증 손실을 달성했습니다.

이 결과는 적응형 깊이 재사용이 품질을 위해 파라미터를 교환하는 원칙적인 전략임을 보여줍니다. 대규모에서 컴파일된 생성 지연 시간이 10% 증가했을 때, 적응형 깊이 재사용은 63% 적은 파라미터와 59% 적은 최대 디코딩 메모리를 제공합니다.

FrontierChallenge: Evaluating Scientific Workflow Completion

과학 에이전트가 데이터를 분석하고 코드를 실행하며 연구 결과물을 생성하고 있지만, 기존 벤치마크들은 최종 답변이나 단일 도메인에 중점을 두는 경향이 있습니다. 이에 연구진은 300개의 종단 간 과학 워크플로우를 포함하는 교차 도메인 벤치마크인 FrontierChallenge를 소개했습니다. 이 벤치마크에서는 양자 화학, 분자 동역학, 재료 특성 분석, 분석 화학, 생명 과학, 전기화학/환경 등 다양한 분야의 97개 작업을 평가했습니다.

평가 결과, 최고의 구성들은 전체 97개 작업 중 단 20개만 완료하여 전체 완료 기준을 만족하는 성공률(Pass Rate)은 20.6%에 불과했습니다. 특히 분석 화학과 전기화학/환경 분야에서는 부분적인 진행 상황이 완전한 결과물로 이어지는 데 매우 미흡한 것으로 나타났습니다. 해당 분야의 평균 점수는 각각 87.6점과 94.9점에 달했지만, 최고 성공률은 4%와 0%에 그쳤습니다.

또한, 통과하지 못한 Claude Code 경로 중 75.5%가 완료를 주장하는 언어를 사용했음에도 불구하고 실제로는 완료되지 않은 것으로 확인되었습니다. 이러한 결과는 높은 부분 점수나 완료에 대한 자신감 있는 주장만으로는 과학적 작업이 완전히 전달되었다고 보장할 수 없음을 시사합니다. 따라서 과학적 작업의 성공 여부를 평가하기 위해서는 종단 간 워크플로우 실행과 과학적 결과물의 완전성을 함께 고려해야 합니다.

D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation

다중 교사 온-정책 증류(MOPD) 방법은 여러 도메인 전문가를 단일 학생으로 증류할 때 각 도메인별 역-KL 발산(reverse-KL divergence)을 최소화하는 방식으로 작동합니다. 기존 접근 방식은 훈련 전에 도메인 데이터 혼합 비율을 고정하여, 도메인들이 서로 다른 속도로 수렴한다는 사실을 간과했습니다. 이로 인해 빠른 수렴 도메인에 컴퓨팅 자원이 낭비되고 느리게 수렴하는 도메인은 충분히 훈련되지 못하는 문제가 발생했습니다.

이 문제를 해결하기 위해 D^3-MOPD(Dynamic Domain Scheduling for MOPD)라는 제로 오버헤드 스케줄러가 제안되었습니다. D^3-MOPD는 훈련 중에 이미 생성된 도메인별 역-KL 신호를 활용하여 도메인 혼합 비율을 온라인으로 조정합니다. 비동기적으로 작동하는 오프-프로세스 감시기가 각 도메인의 KL 궤적을 추적하고 남은 여유 공간과 현재 개선 속도를 추정하여 도메인 샘플링 비율을 조정합니다.

이 스케줄러는 도메인 수에 관계없이 확장 가능하며, 더 다양한 수렴 패턴을 제공할수록 예상되는 이점이 커집니다. 예를 들어, 네 명의 도메인 전문가로부터 증류된 Qwen3.6-35B-A3B 학생 모델의 경우, D^3-MOPD는 일반 MOPD의 63%에 비해 평균 학생-교사 성능 격차를 97%까지 좁혔습니다. 또한, 동일한 최고 성능을 달성하면서 롤아웃 단계는 약 3배 감소했으며, 일곱 개의 벤치마크 중 세 개에서 전문가 교사들을 능가하는 결과를 보였습니다.

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

GUI 에이전트는 안드로이드 환경에서 예상치 못한 팝업이나 잘못된 행동 사용과 같은 동적 이상 현상에 자주 직면하지만, 이러한 이상 현상에 대한 에이전트의 견고성을 체계적으로 평가하는 벤치마크는 부족합니다. 이에 연구진은 에이전트 실행 궤적에 동적 교란을 주입하는 포괄적인 벤치마크인 AnTrap을 소개했습니다. 이 벤치마크는 실제 이상 현상을 상태(State), 사고(Thinking), 행동(Action), 라운드(Round)의 네 가지 계층과 10가지 세분화된 하위 범주로 분류하는 분류 체계를 제안하며, 과제 해결 가능성을 유지하면서 현실적인 적대적 조건을 도입하는 구축 파이프라인을 개발했습니다.

연구 결과, 16개의 주요 GUI 모델을 평가한 결과, 동적 이상 현상에 대해 보편적인 취약성이 발견되었으며, 가장 강력한 모델조차도 상당한 성능 저하를 겪는 것으로 나타났습니다. 또한, 벤치마크를 검증하기 위해 원본 환경과 적대적 환경 모두에서 GRPO 훈련을 수행하여 환경 학습 가능 이상 현상과 추론 병목 현상으로 인한 이상 현상을 분리했습니다.

이러한 분석을 통해 단일 단계의 상태 및 행동 계층 트랩은 적대적 강화 학습을 통해 상당 부분 해결될 수 있음을 알 수 있습니다. 그러나 상태 교착(state deadlock)과 같은 깊은 맥락적 트랩은 트랩이 있는 환경에서 훈련하는 것만으로는 해결할 수 없는 내재적 한계를 노출합니다. 이는 에이전트의 견고성을 평가할 때 단순히 환경 내 훈련을 넘어선 심층적인 맥락적 이해가 필요함을 시사합니다.