Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI

Prior Labs는 관계 학습 분야의 연구를 가속화하기 위해 세 가지 소프트웨어를 오픈 소스로 공개하며 오픈 사이언스에 대한 지속적인 노력을 보여주었습니다. 이들은 커뮤니티의 피드백을 바탕으로 개발을 진행하며, 초기 단계의 개발이기에 알파 버전은 연구자와 조기 채택 실무자들을 대상으로 합니다.

RelArena-α는 TabArena와 같은 기존 표 형식 벤치마크에서 영감을 받아 데이터 로딩, 평가 프로토콜, 튜닝 체제 등을 표준화하여 RelBench v1에서 기준 모델을 실행하고 비교할 수 있는 통합 프레임워크를 제공합니다. 이 프레임워크를 통해 관계 학습 방법론을 비교하고 발전시킬 수 있는 기반이 마련되었습니다.

또한, RelArena-α에서 현재 최고 순위를 차지하는 모델인 TabPFN-Rel이 RDBLearn을 개선하여 관계형 데이터베이스를 단일 테이블로 평탄화하는 것이 실제 작업에서 전문화된 관계형 아키텍처만큼 경쟁력이 있음을 입증했습니다. 연구와 산업에서 관계 학습 방법론의 채택을 촉진하기 위해 Prior Labs는 Relational Predictive Interface(RPI)의 초기 알파 버전을 공개했습니다.

RPI는 모델에 구애받지 않는 오픈 소스 인터페이스로, 조기 채택자들이 새로운 데이터베이스에 문제를 쉽게 정의하고 RelArena-α에서 구현된 모델, 예를 들어 TabPFN-Rel을 이러한 문제에 적용할 수 있도록 지원합니다.

A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

모션 언어 모델(MoLM)은 일반적으로 3차원 모션을 토큰화하여 언어 모델로 처리함으로써 인간의 움직임을 이해합니다. 그러나 모노큘러 비디오에서 정확한 3차원 모션을 얻는 것이 어렵기 때문에 실제 환경에서의 적용 가능성이 제한되어 왔습니다.

이 문제를 해결하기 위해 본 연구는 3차원 사전 학습된 MoLM이 원본 모델을 수정하거나 미세 조정하지 않고 2차원 모션 입력을 받을 수 있게 하는 플러그 앤 플레이 2차원 모션 인터페이스를 제안합니다. 공개 데이터셋 실험 결과, 이 방법은 여러 MoLM에 걸쳐 3차원 모션 입력과 유사한 성능을 달성했으며, 2차원 모션으로 MoLM을 처음부터 학습하는 것보다 더 우수한 성능을 보였습니다.

연구진은 또한 모노큘러 실제 비디오 모션 평가 데이터셋을 구축하고 실제 비디오 어댑터를 도입하여 평가했습니다. 이 결과는 평가된 모노큘러 자세 추정 설정에서 3차원 모션보다 2차원 모션이 더 유용하다는 것을 입증합니다.

결론적으로 2차원 모션은 실제 환경의 모션 이해 설정에서 MoLM을 배포하기 위한 실용적인 인터페이스를 제공합니다. 관련 코드는 GitHub에서 확인할 수 있습니다.

GRNEdit: Efficient General Video Editing from a New Binary-Evidence Perspective in Generative Refinement Networks

인스트럭션 기반의 일반 비디오 편집은 다양한 편집 작업을 단일하고 직관적인 인터페이스 내에서 통합하는 것을 목표로 합니다. 기존 접근 방식들은 무거운 분기나 비용이 많이 드는 소스 연결을 사용하여 리소스 집약적인 조건화에 의존해 왔습니다. 이러한 비효율성을 해결하기 위해 본 연구는 GRNEdit이라는 경량의 2단계 프레임워크를 제안합니다.

GRNEdit은 시각적 의미를 비트 조합으로 인코딩하여 접근하며, 편집 의미를 개별 비트에 대한 로컬 유지 또는 반전 결정으로 재구성합니다. 소스 정보는 관찰된 이진 상태를 뒷받침하는 좌표별 증거로 모델링되며, GRN 백본은 이 증거들을 일관된 생성적 의미로 해결하는 역할을 담당합니다. 특히, 분류 불필요 가이드(classifier-free guidance)를 위한 널 프롬프트 훈련에서 영감을 받아, 편집 관련 의미를 부여하여 소스 재구성을 통해 증거 활용과 콘텐츠 보존을 강화하는 정체성 경로를 도입했습니다.

1단계에서는 압축된 인코더가 이산적인 소스 코드를 연속적인 증거 신호로 변환하고, GRN은 이 신호를 이진 정제 과정 전체에서 흡수합니다. 2단계에서는 편집된 상태를 소스 보존 상태와 직접 비교하여 불확실한 타겟 비트 결정을 수정합니다. 이 방법은 단 0.6M 쌍과 3% 미만의 조건화 매개변수로 훈련되었으며, GRNEdit-2B와 GRNEdit-8B 모델은 OpenVE-Bench에서 각각 4.03과 4.18의 점수를 달성했습니다.

2B 모델은 여러 14B 오픈소스 편집기보다 우수한 성능을 보였으며, 8B 모델은 선도적인 오픈소스 편집기들과 동등한 성능을 나타냈습니다. 이는 GRNEdit이 효율적인 방법으로 비디오 편집 의도를 모델링하고 소스 정보를 활용하여 생성적 정제 네트워크의 성능을 향상시킬 수 있음을 보여줍니다.

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

다중 참조 이미지 생성에 대한 기존 벤치마크는 "주제 구성"과 같은 미리 정의된 작업 유형을 중심으로 구성되어 있어 조합적 설정에 부적합하며, 이는 데이터의 파편화와 복잡성 통제 불능, 그리고 진단 가치 부족을 초래합니다. 이러한 문제를 해결하기 위해 다양한 다중 참조 작업이 공통의 기본 연산(atomic operations)을 공유한다는 관점에서 네 가지 연산자, 즉 Anchor(f), Disentangle(g), Apply(oplus), Compose(C)를 형식화했습니다.

이러한 형식화를 통해 다중 참조 프롬프트는 이 연산자들 위에서 구성된 공식(compositional formula)으로 표현될 수 있으며, 이 공식의 구조적 복잡성은 연산자 슬롯의 수로 정량화됩니다. 이를 기반으로 TRACE-Bench라는 평가 벤치마크를 구축했는데, 이는 1~8 슬롯에 걸쳐 약 1,600개의 평가 사례와 631개의 공식 템플릿, 그리고 다양한 예술 스타일과 실제 주제를 포괄하는 약 4,000개의 참조 이미지를 포함합니다.

TRACE-Bench는 공식 구조를 활용하여 각 역량별 점수를 산출하는 연산자 정렬 평가 프로토콜과 재귀적 실패 위치를 파악하는 진단 트리 분석을 제공합니다. 9개의 선도 모델을 평가한 결과, 전체적인 점수보다 분리(g)와 속성 바인딩(oplus)이 장면 수준 구성(C)보다 주요 병목 현상임을 밝혀냈습니다. 심지어 최고 모델조차도 속성 충실도(attribute fidelity)에서 0.74점만을 기록하는 등, 전체적인 평가에서 파악하기 어려운 세부적인 병목 현상을 드러냅니다.

HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation

경계 표현(B-Rep) 생성은 컴퓨터 지원 설계에서 근본적인 작업이지만, 고충실도와 구조적으로 유효한 B-Rep를 직접 합성하는 것은 여전히 주요한 도전 과제입니다. 기존의 딥 생성 방법들은 잠재 공간에서 패딩 노이즈와 특징 오염으로 인한 표현의 취약성과, 비미분 가능한 유효성 강제 때문에 발생하는 순차적 오류 전파 및 학습-추론 불일치로 인한 생성의 취약성이라는 두 가지 형태의 취약점을 겪고 있습니다.

이에 연구진은 이러한 한계를 해결하기 위해 HiFi-BRep이라는 새로운 프레임워크를 제안했습니다. 이 프레임워크는 두 가지 시너지를 통해 문제를 해결하는데, 첫째는 위상 인식 인코더를 사용하여 학습 가능한 쿼리를 통해 패딩을 제거하고 위상 가이드 어텐션을 통해 특징 오염을 방지하여 고충실도 잠재 표현을 구축합니다.

둘째는 단일 단계 디코더를 통해 기하학과 위상을 병렬로 예측하며, 핵심 다양체 제약 조건을 미분 가능한 학습 목표로 내재화합니다. 이러한 설계는 기하학과 위상 간의 상호 가이드를 보장하면서도 오류가 연쇄적으로 발생하는 것을 방지합니다.

실험 결과, HiFi-BRep은 구조적 유효성과 기하학적 충실도 모두에서 최신 방법들을 크게 능가하며 고품질 B-Rep 합성을 위한 강력한 해결책을 제공합니다. 해당 코드와 모델은 GitHub에서 공개되어 있습니다.

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

그룹 상대적 이점을 이용한 강화 학습(RL)은 사전 훈련된 언어 모델 추론을 위한 표준이 되었지만, 여러 보상 목표를 최적화할 때 기존 방법들은 그룹별 표준화 전에 보상 벡터를 고정된 가중 합으로 스칼라화하는 방식을 사용합니다. 이러한 설계는 서로 다른 보상 프로파일을 가진 롤아웃이 동일한 이점을 받을 수 있으며, 모든 목표가 현재 포화도 수준에 관계없이 고정된 상대적 가중치로 최적화되는 두 가지 근본적인 문제를 야기합니다. 결과적으로 훈련은 더 많은 여유 공간을 가진 목표에 집중하기보다 이미 해결된 목표에 기울기 예산을 계속 할당하게 됩니다.

이에 우리는 다중 보상 정책 최적화를 위한 포화 인식 이점 재가중화(SA-MRPO)를 제안합니다. 이 방법은 각 보상 목표를 독립적으로 표준화하고 배치 수준의 목표 포화도 추정에 따라 그 기여도를 적응적으로 할인합니다. 이는 최적화 노력을 덜 최적화된 목표로 동적으로 재분배하면서도 이미 잘 만족된 목표에 대한 성능을 유지합니다.

SA-MRPO는 수학적 추론과 두 가지 및 세 가지 보상 조합에서 GDPO보다 어려운 정확성 목표를 15개 벤치마크 중 12개에서 개선하며, AIME24에서는 최대 5%의 향상을 보였습니다. 또한 적응형 추론에서는 모든 5개 벤치마크에서 평균 3.8%, AMC23에서는 최대 9.2%의 정확도를 개선했으며, 코딩 벤치마크에서는 합격률을 최대 2.3% 향상시켰습니다. 이 모든 설정에서 이미 만족된 목표들의 성능은 그대로 유지됩니다.

I don't enjoy the Internet any more

인터넷에 대한 즐거움이 사라진 이유에 대해 글쓴이는 콘텐츠의 질적 저하와 인공지능(LLM)의 확산 때문이라고 지적합니다. 과거 인터넷은 메시지 보드나 블로그를 통해 의미 있는 지식 공유와 연결을 제공했지만, 오늘날에는 수익화와 낮은 품질의 콘텐츠가 질 좋은 아이디어를 대체하고 있습니다.

글쓴이는 이 현상을 '이솔라(isolas)'와 '페일(pale)'이라는 비유로 설명합니다. 이솔라는 고품질의 생각과 사람들을 담고 있는 영역이지만, 페일은 정보가 점차 퇴화하는 영역으로, AI가 생성한 낮은 품질의 콘텐츠가 대부분을 차지하며 이 페일이 너무 빠르게 확장되어 지적 능력을 저하시킨다고 말합니다.

특히 인스타그램, 틱톡, X와 같은 단편 콘텐츠는 집단 사고와 군집 심리를 자극하여 지적 게으름을 유발하며, 이는 정보의 질을 떨어뜨립니다. 또한, 해커 뉴스 같은 장문 콘텐츠조차도 LLM이 작성한 내용이 많아져 글쓴이는 더 이상 독서를 즐기지 않게 되었습니다.

더 나아가, 동료들이 LLM 결과물을 공유하는 환경에서는 협업 과정에서 신뢰가 무너지고 연결감이 사라지기 때문에 업무 환경에서의 소통 문제도 심각해졌습니다. 글쓴이는 이러한 상황에서 LLM 작성을 자신의 것으로 여기는 것이 무례하다는 사회적 합의가 필요하지만, 현재로서는 그럴 가능성에 대해 회의적입니다.

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

평가 벤치마크는 단순한 점수 이상의 신뢰성을 제공해야 하며, 그 점수를 정당화하는 추론 과정이 필수적입니다. 특히 월드 모델 평가에서는 물리 법칙, 인과 관계, 세계 상태가 올바르게 변화했는지 이해해야만 평가의 신뢰성을 확보할 수 있습니다. 현재 존재하는 벤치마크들은 측정치를 무작위로 계산하여 추론 체인을 제공하지 않아 인간이 발견하는 오류를 자동화하지 못하고 있습니다.

이에 연구진은 LLM 생태계에서 가져온 하네스(harness) 패러다임을 월드 모델 벤치마킹으로 확장한 에이전트 기반 평가 파이프라인인 HarnessEval-W를 소개합니다. 이 방법은 고정된 평가 기준 대신 각 평가 사례의 맥락을 해석하고 질문을 측정 가능한 하위 문제로 분해한 뒤, 각 하위 문제에 맞춤화된 맥락과 진단 도구를 갖춘 전문 하위 에이전트를 생성하여 추론하게 합니다.

이러한 계층적 워크플로우는 모든 평가를 결과의 정당성을 입증하는 투명한 증거 트리로 전환시킵니다. HarnessEval-W를 18개의 대표적인 월드 모델과 330개의 평가 사례에 적용한 결과, 그 판단은 인간의 선호도와 밀접하게 일치하며 생성된 모든 결과에 대해 검증 가능하고 세밀한 진단을 제공합니다.

연구팀은 이 전체 파이프라인을 라이브 벤치마크로 오픈소스로 공개하여 커뮤니티가 월드 모델의 발전과 새로운 평가 사례를 위해 기여할 수 있도록 초대하고 있습니다.

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

자동화된 검사 파이프라인에서 언어 모델을 검사자(checker)와 수정자(fixer)로 설정했을 때, 이 구성이 보고하는 오경보(false alarms)에 어떤 영향을 미치는지 조사했습니다. 인간이 검증한 정확한 ProcessBench 추적 데이터에서 측정 결과, 감사 후 수정 에피소드가 모델의 컨텍스트에 이미 포함되어 있으면 오경보가 줄어듭니다. 이는 길이 일치하는 비감사 대조군과 비교했을 때 15개 모델 조합에서 2.8%에서 11.5%포인트까지 오경보를 감소시키며, 대조군 대비 9%에서 25%의 감소 효과를 보였습니다.

이러한 결과는 누적 메시지 문헌이 예측하는 방향과 상충됩니다. 감사 보고서가 오류를 보고한 에피소드가 오경보를 더욱 낮춘다고 예측하지만, 실제로는 그 반대의 효과가 나타났습니다. 에피소드를 분해 분석한 결과, 수정 내용과 감사 판정은 상호 보완적이며 서로 다른 모델 계열에 다른 영향을 미치는 것으로 나타났습니다.

신호 탐지 분석을 통해 이 변화는 모델의 판별 능력(discrimination)보다는 임계값(threshold)의 변화에서 발생한다는 것을 발견했습니다. 이 임계값은 15개 조합에서 이동했으며 13개 조합에서 보정되었지만, 민감도 지표인 d'는 전혀 영향을 받지 않았습니다. 또한 50개의 오경보에 대한 수동 감사를 통해 82%가 단순히 잘못된 것으로 확인되어, 현재 작동 지점에서는 이러한 변화가 해롭지 않음을 알 수 있습니다.

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

AnyTalk은 애니메이션 데이터를 요구하지 않고 임의의 캐릭터에 대한 3D 음성 애니메이션을 생성하는 새로운 방법론을 제시합니다. 기존의 오디오 기반 3D 음성 애니메이션 방식이 캐릭터별 학습 데이터나 복잡한 리깅/리메싱 과정을 필요로 했던 한계를 극복하기 위해, AnyTalk은 방대한 비디오 데이터로 학습된 최근의 비디오 확산 모델을 활용합니다.

이 방법은 캐릭터별 미세 조정 기법인 Character-specific Fine-tuning(CsF)을 통해 사전 학습된 비디오 확산 모델을 목표 캐릭터에 적응시킵니다. 이때 3D 캐릭터의 렌더링 이미지와 움직임이 없는 오디오 임베딩을 결합하여 미세 조정함으로써 애니메이션 데이터를 제거하면서도 대규모 비디오 확산 모델의 움직임 사전 정보를 보존합니다. 이후 제안된 최적화 과정을 통해 블렌드셰이프 파라미터를 추정하여 결과적으로 3D 음성 애니메이션을 생성합니다.

AnyTalk은 다양한 얼굴 메쉬와 블렌드셰이프 구성에 걸쳐 입술 싱크 애니메이션을 가능하게 하여 수작업 노력과 데이터 요구 사항을 크게 줄입니다. 또한 AnyTalk을 간소화된 네트워크인 AnyTalk_{RT}로 압축하여 실시간 성능을 구현함으로써 사용성을 더욱 향상시킵니다. 이 기술은 턱헤드 비디오 생성을 활용하여 임의의 캐릭터에 대한 오디오 기반 음성 애니메이션 기술 접근성을 넓히는 데 기여합니다.

Drive, Pack, Fly: The Travelling Thief Problem with Drone

드론을 이용한 수집 작업에서 화물을 축적하면 차량 속도가 느려져 경로 효율성에 누적 페널티가 발생합니다. 이에 대해 탑재된 드론이 외곽 아이템을 회수하여 이 페널티를 상쇄함으로써 작업 완료 시간을 단축하고 운영 이익을 증가시킬 수 있습니다. 이 논문은 아이템 선택, 차량 경로, 비행 동기화를 공동으로 최적화하여 시간 기반 임대 비용을 제외한 수집 수익을 극대화하는 드론 여행자 도둑 문제(Travelling Thief Problem with Drone, TTP-D)를 제안합니다.

연구진은 작은 인스턴스에 대해서는 혼합 정수 선형 계획법(MILP)을 사용하여 최적해를 구했으며, 더 큰 인스턴스에는 메타휴리스틱과 어텐션 기반 심층 강화 학습(DRL) 정책을 개발했습니다. 특히 DRL 정책이 초기 해답을 구성하고 짧은 어닐링 과정을 통해 이를 정제하는 학습 초기화 하이브리드 솔버를 제안했습니다.

이 하이브리드 솔버는 두 개의 벤치마크 세트에서 메타휴리스틱 기준 품질의 대부분을 계산 예산의 일부만으로 회복하는 성능을 보였습니다. 다만 가장 큰 인스턴스의 경우 여전히 기준 모델이 전체 예산을 필요로 합니다.

최종 민감도 분석 결과, 수익성의 주요 동인은 임대 비율이며, 차량 관련 매개변수는 수익에 미치는 영향이 한계에 불과하다는 것을 확인했습니다.

ClawGym II: Exploring Black-Box RL on Agent Harness

에이전트 하네스는 환경과의 상호작용을 조정함으로써 장기 목표 작업에서 성능을 크게 향상시켰지만, 복잡한 하네스를 사용한 강화 학습은 장기 에이전트 작업으로 확장할 때 근본적인 문제를 야기하여 아직 충분히 탐구되지 못했습니다. 이 연구는 복잡한 하네스를 통해 일반 에이전트를 안정적이고 확장 가능하게 최적화하기 위한 통합된 블랙박스 강화 학습 프레임워크를 제시합니다.

이를 위해 연구진은 대규모 동시 실행을 위해 작업 환경과 하네스를 임시 샌드박스 내에서 격리하는 샌드박스 기반 실행 인프라를 구축했습니다. 또한 정책 최적화를 불투명한 하네스 실행으로부터 분리하고 모델 경계에 서빙 프록시를 배치하여 모델 호출을 캡처합니다. 캡처된 호출을 접두사 트리로 정리하여 다중 턴 궤적을 재구성하고 학습 효율성을 개선하며, 이를 통해 비평가 기반 PPO와 비평가 없는 GRPO를 복구된 트리 구조를 최적화하도록 추가적으로 조정합니다.

나아가 이 프레임워크는 이기종 실행 시스템 전반에 걸쳐 통합된 학습을 지원하는 혼합 하네스 학습을 도입합니다. Qwen3-30A3B 모델을 사용하여 블랙박스 강화 학습은 OpenClaw와 Claude Code를 통해 ClawGym-Bench의 Pass@1 점수를 각각 9.98점과 14.81점 향상시켰으며, 200~400번의 최적화 단계 동안 안정성을 유지했습니다. 또한 이 프레임워크는 JobBench 및 OfficeQA와 같은 더 어려운 작업에서도 일관된 성능 향상을 제공합니다.

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs

대규모 언어 모델이 널리 사용됨에 따라, 오픈 웨이트 모델을 배포하는 제3자 제공업체의 추론 API 품질을 감사하는 것은 중요한 과제가 되었습니다. 이 연구는 호스팅된 모델 라우팅을 확률 과정으로 공식화하고, 대상 API로부터 확률 정보가 필요 없는 복합적인 블랙박스 감사 방법인 벤토르-큐테스트(Ventor-QTest)를 제안합니다.

벤토르-큐테스트는 반복 요청 구성요소를 통해 평균 충실도 손실(AFL)을 측정하며, 이는 노이즈 편향을 보정한 내-윈도우 평균 조밀화-KL 통계량으로 보고됩니다. 또한, 장기 시퀀스 구성요소를 통해 독립적인 실행을 사용하여 극단적 충실도 손실(EFL)을 보고하며, 이는 실행 수준의 참조 중심 놀람 통계량의 경험적 상위 꼬리를 통해 측정됩니다.

연구 결과에 따르면, AFL은 로그 확률에서 파생된 조밀화-KL 비교자와 강력한 선형 기술적 일치를 보입니다. 반면, EFL은 태스크 노출이 증가함에 따라 Terminal-Bench 통과율이 감소하는 것과 일치하는데, 이는 장기 목표 태스크의 정확성이 극단적 충실도 손실에 더 민감하기 때문일 수 있습니다.

이러한 패턴은 AFL과 EFL을 함께 보고하는 것이 특히 장기 에이전트 태스크를 감사할 때 유용함을 시사합니다. 이 연구는 AFL과 EFL이 GPQA-Diamond 정확도와 경로 수준에서 큰 연관성이 없음을 보여주며, 오픈 소스 구현은 GitHub에서 제공됩니다.

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

픽셀 공간 확산 모델에 대한 실증 연구를 통해 잠재 공간 모델과 동등하거나 능가하는 성능을 내는 실용적인 훈련 방법을 제시했습니다. 연구 결과에 따르면, 픽셀 공간에서 직접 대규모 사전 훈련을 진행할 경우 잠재 공간에서 훈련하는 것보다 수렴 속도가 현저히 느리다는 사실이 관찰되었습니다.

이러한 관찰을 바탕으로 잠재 공간에서 생성적 사전 지식을 효율적으로 습득한 후 훈련 후반부에 픽셀 공간으로 전환하는 잠재 공간-픽셀 전략이 제안되었습니다. 연구진은 이 전환 과정에 영향을 미치는 가중치 초기화, 데이터 구성, 예측 목표, 디코더 아키텍처, 노이즈 스케줄 등 핵심 설계 선택 사항들을 체계적으로 조사했습니다.

이를 통해 픽셀 공간 모델이 잠재 공간 모델과 동등하거나 더 나은 성능을 달성하면서도 종단 간 추론 속도를 3.18배에서 4.75배까지 향상시키는 실용적인 레시피를 발견했습니다. 이 연구는 픽셀 공간 생성에 대한 향후 연구를 위한 실질적인 통찰력과 지침을 제공할 것으로 기대됩니다.

GenRouter: Unified Workflow Routing for Agentic Image Generation

텍스트-이미지(T2I) 생성 모델의 발전은 원시 픽셀 합성이라는 근본적인 문제를 해결하고 사용자 요청을 충족하는 방향으로 커뮤니티의 초점을 이동시켰습니다. 최근 에이전트 기반 이미지 생성 워크플로우는 외부 지식 검색이나 반복적 추론과 같은 고급 기능을 통해 정적 추론 능력을 향상시켰지만, 대부분 고정된 '일률적인' 토폴로지 내에서 고립된 방식으로 작동합니다. 이러한 방식은 단순한 쿼리가 계산적으로 무거운 파이프라인을 통과하도록 강제되어 심각한 컴퓨팅 불일치를 초래합니다.

이러한 격차를 해소하기 위해 에이전트 이미지 생성을 위한 최초의 통합 워크플로우 라우팅 프레임워크인 GenRouter를 제시합니다. GenRouter는 다양한 에이전트 파이프라인을 보편적인 기본 원시와 실행 가능한 템플릿으로 표준화하는 GenCanvas를 먼저 구축합니다. 이 통합된 공간 위에서 GenRouter는 수요 프로파일링, 경험 매칭, 파레토 필터링이라는 세 가지 방법을 통해 이질적인 프롬프트를 최적의 워크플로우로 적응적으로 라우팅합니다.

광범위한 벤치마크 실험 결과, GenRouter는 무거운 정적 파이프라인과 비교하여 실행 비용을 95% 이상, 지연 시간을 65%까지 줄이면서도 시각적 정렬을 향상시켰습니다. 또한 이 시스템은 축적된 경험을 통해 지속적으로 자체 진화하며 강력한 제로샷 일반화를 가능하게 하여 성능을 높이고 계산 오버헤드를 절반으로 줄입니다.

R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

인지 과학에서 자원 합리성(resource rationality)은 에이전트가 기대 가치를 극대화하기 위해 제한된 연산을 어떻게 할당해야 하는지를 다룹니다. 기존의 추론 및 에이전트 벤치마크는 각 과제에 독립적인 예산을 사용하지만, 공유 예산 연구는 모델이 입증한 단일 문제 해결 능력과 전체 스위트 성능을 보정하지 못하는 한계가 있습니다. 이러한 격차를 해소하기 위해 연구진은 수학, 경쟁 프로그래밍, 추상적 추론 분야에서 도구 사용 없이 또는 에이전트 환경에서 여섯 가지 문제 스위트를 공유 예산 하에 평가하는 R^3-Bench를 제안했습니다.

R^3-Bench는 관찰된 성공을 기반으로 한 단일 문제 응답 곡선을 사용하여 경험적 오라클을 정의합니다. 여섯 가지 모델에 대해 72개의 주요 표 셀을 분석한 결과, 오라클 평균은 모든 셀에서 경쟁 평균과 같거나 더 높았으며 71개 셀에서는 엄격하게 더 높았습니다. 또한 적당한 도구 사용 없는 압력 하에서 균등 할당 재현(equal-allocation replay)은 여섯 가지 모델 중 네 모델에서 경쟁 성능을 능가했습니다.

추이 진단 결과는 전략 업데이트가 제한적이며 압력에 따라 실패 패턴이 달라진다는 것을 보여줍니다. 특히 세 가지 모델 진단에서 강한 에이전트 압력 하에 최소한 하나의 고정 스케줄러가 아홉 개의 셀 중 여섯 개에서 경쟁 평균을 초과했지만, 어떤 정책도 모든 영역에서 지배하지는 않았습니다. 이러한 결과는 입증된 능력과 공유 예산 실현 사이에는 지속적인 격차가 존재함을 드러냅니다.

How I Over-Engineered My Book

저자는 책 집필 과정을 소프트웨어 프로젝트처럼 과도하게 엔지니어링했다고 설명하며, 글쓰기를 개발자가 사용하는 도구와 워크플로우로 재구성한 경험을 공유합니다. 이 과정에서 그는 마크다운 파일을 Git 저장소에 보관하고 CI 빌드 파이프라인을 구축하여 모든 변경 사항에 대해 자동화된 검사를 수행했습니다.

콘텐츠를 코드로 취급하여 글쓰기 오류를 검증하는 자동화 시스템을 구축한 것이 핵심입니다. 그는 VS Code 확장 프로그램과 다양한 프로즈 리너(Markdownlint, LanguageTool 등)를 사용하여 실시간으로 문법과 스타일 오류를 확인했으며, 이 검사들을 CI 환경에 통합했습니다.

더 나아가, 그는 콘텐츠를 테스트하는 방식을 코드 테스트와 동일하게 적용했습니다. 내용 검증을 위해 자체적인 검증 스크립트와 Vitest, Playwright 스펙을 사용하여 자동화된 테스트를 구축했는데, 이는 특정 문장이 현재 직장 소속을 암시하는 등의 오류를 잡아내는 방식으로 작동합니다.

이러한 접근 방식은 실수 한 번을 발견했을 때 해당 문장만 수정하는 것이 아니라, 전체 콘텐츠에 적용되는 규칙을 설정하여 오류가 재발하지 않도록 관리하는 정책 중심의 접근법을 강조합니다. 이는 글쓰기 과정에서 발생하는 오류를 관리하는 데 있어 개발자가 사용하는 시스템적 사고방식을 적용할 수 있음을 보여줍니다.

A Preview of DuckDB v2.0

DuckDB v2.0은 올가을 출시 예정이며, 서버 기능과 데이터 처리 방식에 중점을 둔 대대적인 기능 개선을 포함합니다. 이번 버전은 새로운 SQL 파서, 기본 저장 형식, C API 재작업 등 주요 변경 사항을 포함하며, 특히 DuckDB를 서버로 활용하는 기능을 강화하는 데 초점을 맞추고 있습니다.

가장 큰 변화는 DuckDB가 서버 역할을 수행할 수 있도록 하는 Quack 프로토콜 확장 기능과 CONNECT 명령어가 추가된 점입니다. 이를 통해 다른 DuckDB 인스턴스 간에 네트워크를 통해 데이터베이스를 서비스하고 쿼리를 푸시다운하여 PostgreSQL이나 MySQL 같은 다른 데이터베이스로 직접 실행할 수 있게 됩니다. 이는 DuckDB가 멀티테넌트 환경에서 장기 실행 배포에 적합하도록 확장된 기능입니다.

또한, VARIANT 타입이 첫 번째 클래스로 자리매김하여 JSON과 같은 반정형 데이터를 저장하고 쿼리하는 데 있어 효율성이 극대화됩니다. VARIANT는 데이터를 압축하여 저장하고 쿼리 속도를 높이는 방식으로 작동하며, 이는 실시간 로그 수집과 같은 시나리오에서 매우 유용합니다. v2.0에서는 비동기 I/O, 새로운 저장 형식, 그리고 향상된 모니터링 기능을 통해 전체 시스템의 성능과 가시성을 높이는 데 집중했습니다.

Models Are Getting Dumber on Purpose

최근 거대 언어 모델은 추론 능력은 향상시키면서도 사실적 지식은 의도적으로 희생하는 방향으로 설계되고 있습니다. 모델의 파라미터 수는 계속 증가하지만, 사실적 지식은 파라미터에 비례하여 저장되지 않고, 대신 문제 해결 절차와 추론 능력에 집중되어 있습니다. 이는 모델이 세상의 지식을 저장하는 대신, 정보를 검색하고 판단하는 방법을 학습하도록 설계되었음을 의미합니다.

모델의 지식은 가중치(weights)에 저장될 때 시간이 지남에 따라 구식이 되어 사실이 부패하지만, 추론 절차는 변하지 않기 때문에 모델의 성능은 장기적으로 유지됩니다. 따라서 모델이 사실을 잘못 말하는 현상인 환각(hallucination)을 해결하기 위해서는 지식을 모델 내부가 아닌 외부에서 관리하는 방식이 필요합니다.

이러한 접근 방식은 외부 도구 사용, 검색, 지식 기반 검색 등을 통해 모델이 실시간으로 최신 정보를 참조하도록 하는 '하네스(harness)'를 활용하는 것입니다. 예를 들어, 모델이 특정 사실을 알지 못할 경우 외부 검색을 통해 정보를 가져와 답변을 생성하게 하여, 잘못된 정보가 고착화되는 것을 방지합니다.

결과적으로, 모델의 크기를 줄이고 추론 능력을 강화하면 소비자용 GPU에서도 최첨단 수준의 추론 능력을 갖춘 모델을 구동할 수 있게 됩니다. 이는 모델이 지식 저장과 추론이라는 상충되는 목표를 분리함으로써, 모델이 현실 세계의 변화에 더 유연하게 대응하고 신뢰할 수 있는 답변을 제공할 수 있게 하는 핵심적인 방법입니다.

Reticulum – Decentralized Mesh Network

Reticulum은 사용 가능한 하드웨어를 활용하여 로컬 및 광역 네트워크를 구축하기 위한 암호학 기반 네트워킹 스택입니다. 이 네트워크는 매우 높은 지연 시간과 극도로 낮은 대역폭 조건에서도 작동할 수 있으며, 누구나 자체적인 주권 통신 네트워크를 운영할 수 있도록 하는 것을 목표로 합니다.

Reticulum의 비전은 감시, 검열, 통제로부터 자유로운 네트워크를 구축하는 데 있으며, 이는 키릴(Reticulum)이 단순한 네트워크가 아니라 수천 개의 독립적이고 상호 연결되며 자율적인 네트워크를 구축하기 위한 도구임을 의미합니다. 사용자는 커뮤니티와 개인의 자율성과 주권을 존중하고 강화하는 애플리케이션을 만들 수 있도록 보안 디지털 통신을 제공합니다.

기술적으로 Reticulum은 기존 네트워크 스택과 달리 소스 주소를 사용하지 않아 전송되는 패킷에 출발지, 장치, 사람에 대한 정보가 포함되지 않습니다. 또한 주소 공간에 대한 중앙 통제가 없으며, 사용자가 필요에 따라 원하는 만큼 주소를 할당할 수 있습니다. 새로 생성된 주소는 몇 초에서 몇 분 내에 전 세계적으로 도달 가능하며, 주소는 자율적이고 이동 가능하여 네트워크 내 다른 위치로 물리적으로 이동할 수 있습니다.

모든 통신은 기본적으로 강력하고 현대적인 암호화로 보호되며, 모든 암호화 키는 일시적이고 포워드 시크릿을 제공합니다. Reticulum 네트워크에서는 암호화되지 않은 링크나 패킷 전송이 불가능하여 보안을 기본으로 보장합니다.