State of CSS 2026

2026년 CSS 사용 현황 조사를 통해 Anchor Positioning 기능이 올해 가장 주목받은 기능으로 부상했습니다. 4,902명이 참여한 이번 조사에서 Anchor Positioning은 새 기능들이 빠르게 늘어나는 추세 속에서 사용자들의 관심을 집중시켰습니다.

이 기능의 사용률은 전년 대비 15% 증가하며 조사 대상 기능 중 가장 큰 상승폭을 기록했습니다. 이는 Anchor Positioning이 CSS 개발 환경에서 점차 표준적인 방식으로 자리 잡고 있음을 보여줍니다.

이미 자리 잡은 기능들 중에서는 `:has()`와 같은 기능들의 사용 현황도 분석되었으며, 이는 CSS의 발전 방향과 실제 개발 환경에서의 적용 양상을 이해하는 데 중요한 맥락을 제공합니다.

Corgi kills short-lived website that ranked its female employees

AI 보험 스타트업인 코기(Corgi)의 여성 직원들의 사진을 비교하고 순위를 매긴 웹사이트가 법적 조치 위협으로 인해 운영이 중단되었습니다. 이 웹사이트는 코기의 여성 직원들을 나란히 비교하며 방문자가 매력도를 투표할 수 있는 기능을 제공했으며, 직원들은 이 사이트가 외모를 기준으로 비교되어 불쾌감을 느꼈다고 밝혔습니다.

해당 웹사이트는 세바스찬 만달(Sebastian Mandal)이라는 창업자가 운영했으며, 코기의 직원들 사진을 수집하기 위해 링크드인 페이지를 스크래핑하는 AI 에이전트를 사용했을 가능성이 제기되었습니다. 코기의 법무팀은 이 사실을 인지한 후 만달에게 이메일을 보냈고, 만달이 자발적으로 사이트를 내렸다고 판단하여 삭제 조치를 취했습니다.

코기는 해당 웹사이트의 제작이나 운영에 전혀 관여하지 않았으며, 직원들의 이름이나 이미지를 표적으로 삼아 괴롭히거나 착취하는 행위를 용납하지 않는다고 공식 입장을 밝혔습니다. 이 사건은 기업이 직원들의 데이터와 명예를 보호하는 문제와 AI 기술을 활용한 온라인 콘텐츠 생성의 윤리적 경계에 대해 중요한 논의를 촉발하고 있습니다.

Wails v3 Beta - Go 데스크톱 앱을 위한 새로운 기반

Wails의 v3 베타 버전이 출시되어 Go 백엔드를 사용하여 데스크톱 애플리케이션을 구축하는 새로운 기반을 제공합니다. 초기 Wails는 Go 백엔드와 HTML/CSS/JS(React 또는 Vue) 프론트엔드를 활용하여 맥, 윈도우, 리눅스에서 실행되는 단일 바이너리 앱을 만드는 가벼운 Electron 대체제 역할을 했습니다.

이러한 초기 구조는 단순한 GUI 래퍼를 만드는 데 중점을 두었으나, v3 베타에서는 애플리케이션 구조 자체를 크게 재설계했습니다. 이는 단순한 GUI 래퍼를 넘어 복잡한 데스크톱 애플리케이션을 개발할 수 있도록 설계된 것입니다.

이번 재설계는 개발자들이 더 복잡한 기능을 가진 데스크톱 앱을 구축할 때 필요한 애플리케이션 구조와 아키텍처를 제공하는 데 중점을 두고 있습니다. 따라서 Wails를 사용하여 더 구조적이고 복잡한 데스크톱 애플리케이션을 개발하고자 하는 개발자들에게 중요한 변화를 의미합니다.

PgBouncer 없이 Postgres를 운영하는 사람이 있나요?

Postgres는 많은 연결을 효율적으로 관리하기 어려워 로컬 연결 풀이나 PgBouncer 같은 외부 풀러를 함께 사용하는 방식이 여전히 필요합니다. 이는 Postgres가 연결 관리에 있어 효율성을 확보하기 위해 외부 도구의 도움이 필수적임을 의미합니다.

관리형 Postgres 제공업체 18곳을 조사한 결과, 이 중 16곳이 연결 풀러를 지원하고 있는 것으로 나타났습니다. 이는 연결 관리의 중요성이 산업 전반에서 인식되고 있음을 보여줍니다.

대부분의 제공업체들은 PgBouncer를 기본 구성으로 사용하고 있으며, 이는 연결 효율성을 높이는 표준적인 접근 방식입니다. 따라서 Postgres 운영 시 연결 풀러를 활용하는 것이 효율적인 관리의 핵심이 됩니다.

Bluesky Protocol Services

Bluesky 프로토콜 서비스가 새로운 인프라의 중심이 되면서 개발자를 위한 문서와 서비스 구조가 대대적으로 개편되었습니다. 이는 Bluesky가 운영하는 AT 프로토콜 네트워크 위에서 Jetstream v2와 같은 기능을 제공하며, 개발자들이 인프라를 구축하고 활용하는 데 필요한 모든 문서를 통합하고 서비스 계약을 명확히 하는 것을 목표로 합니다.

새롭게 도입된 Jetstream v2는 네트워크 리플레이 기능을 추가하여 과거 시점의 기록을 서버에서 압축된 아카이브 형태로 저장하고 소비할 수 있게 합니다. 이를 통해 개발자는 실시간 스트림과 데이터 백필링 없이도 특정 시점부터 과거 데이터로 전환하거나, 한 달 치 게시물 분석 등을 수행할 수 있습니다. 이 기능은 서버 측 슬라이싱을 가능하게 하며, 아카이브 요청 시에는 비용과 안정성을 위해 API 토큰을 요구하여 서비스의 신뢰성을 유지합니다.

또한, Jetstream SDK가 TypeScript와 Go 클라이언트로 업데이트되었으며, 이는 기존의 레거시 코드 경로를 제거하고 `@atproto/lex`를 기반으로 구축되어 기술 부채를 크게 줄였습니다. 이 새로운 SDK들은 개발자가 Jetstream 객체를 구성하고 필터를 적용하여 이벤트를 처리하는 과정을 간소화하며, 이는 향후 리플레이 기능을 활용하는 애플리케이션 개발을 촉진합니다.

이러한 변화는 새로운 웹사이트와 업데이트된 HTTP 참조를 통해 모든 Jetstream v2 기능과 SDK 사용법이 한 곳에 모여 있음을 의미합니다. 새로운 인프라를 기반으로 리플레이 기능을 활용하는 애플리케이션을 구축할 계획이라면, 새로운 SDK와 네트워크 리플레이 문서를 참고하여 개발을 시작할 수 있습니다.

SparrowMap – Cameras that watch government vehicles

스패로우맵(SparrowMap)은 정부 차량을 감시하는 카메라를 통해 공공 도로의 차량 정보를 수집하는 프로젝트입니다. 이 시스템은 자원봉사자들이 개인 휴대폰 등을 사용하여 거리를 촬영하고 지나가는 차량을 감지하며, 정부 소유 차량의 사진과 번호판만을 보존하고 나머지 정보는 카메라 자체에서 즉시 파괴하는 방식으로 작동합니다.

데이터 보안 측면에서 이 시스템은 매우 독특한 구조를 가지고 있습니다. 서버로 전송되는 데이터는 사진이나 번호판이 아닌 익명의 점(dot)으로만 이루어지며, 이는 정부 차량 정보만을 공개 기록으로 남기고 나머지 정보는 카메라에서 삭제되어 서버에 도달하지 않습니다. 따라서 영상이 서버에 업로드되어 중간에서 가로채는 것을 방지하며, 카메라의 정확한 위치도 공개되지 않고 감시하는 거리만 표시됩니다.

기술적으로 스패로우맵은 서버 의존성을 최소화하고 로컬에서 작동하도록 설계되었습니다. 별도의 계정이나 앱 설치 없이 구형 휴대폰, 노트북 웹캠, USB 카메라 등 다양한 장치에서 작동할 수 있으며, 영상 감지 및 처리는 서버가 아닌 기기 자체에서 실행됩니다.

사용자는 카메라를 원격으로 제어하거나 네트워크에서 분리할 수 있으며, 심지어 데스크톱 PC와 웹캠을 사용하여 전체 감지 기능을 로컬에서 구동할 수도 있습니다. 이는 사용자 기기 내에서 모든 처리가 이루어지므로 개인 정보 보호와 데이터 통제권을 극대화하는 데 중점을 두고 있습니다.

Jujutsu에서 GitHub 스택형 PR 사용하기

GitHub가 2026년 7월 30일에 공개 프리뷰로 출시한 스택형 PR 기능을 Git 호환 버전 관리 시스템인 Jujutsu(jj)에서 생성, 수정, 병합하는 절차가 정리되었습니다. 이 정보는 Jujutsu를 사용하는 개발자들이 GitHub의 새로운 PR 워크플로우를 효율적으로 통합할 수 있도록 돕는 방법을 안내합니다.

이 통합 절차는 커밋마다 Jujutsu의 북마크 기능을 활용하여 관리하는 방식으로 이루어집니다. 개발자는 각 커밋에 대해 jj 북마크를 생성하고, 이 북마크 목록을 gh stack link 명령어에 전달하여 브랜치 관리를 수행할 수 있습니다.

이 방법을 통해 Jujutsu의 버전 관리 시스템과 GitHub의 스택형 PR 기능을 연동하여 복잡한 PR 흐름을 체계적으로 관리할 수 있습니다. 이는 커밋 기반의 변경 사항을 PR 프로세스와 직접 연결하여 작업의 투명성과 효율성을 높이는 데 중점을 둡니다.

Python의 미리 정의된 상수는 꽤 이상함

파이썬의 미리 정의된 상수들인 True, False, None, __debug__, Ellipsis, NotImplemented 등 여섯 가지 상수에 대한 이름 해석과 대입 규칙이 서로 제각각이라는 문제가 제기되었습니다. 이는 파이썬 개발자들이 기본 상수를 사용할 때 예상치 못한 동작을 경험하게 만들 수 있습니다.

이러한 불일치는 파이썬의 핵심적인 동작 방식에 대한 이해를 복잡하게 만들며, 특히 코드의 안정성과 예측 가능성에 영향을 미칠 수 있습니다. 개발자는 이러한 상수들이 내부적으로 어떻게 처리되고 해석되는지에 대한 일관된 규칙을 기대하지만, 현재는 각 상수에 대해 서로 다른 규칙이 적용되고 있습니다.

개발 환경에서 이러한 불일치는 코드의 동작을 디버깅하거나 새로운 기능을 구현할 때 혼란을 야기할 수 있습니다. 따라서 파이썬의 내부 메커니즘과 상수 처리 규칙에 대한 명확한 이해가 필요하며, 이 불일치가 실제 코드 작성에 어떤 영향을 미치는지 검토해야 합니다.

Hybrid Quantum-inspired Kolmogorov-Arnold Networks for Privacy-Aware Federated Biosignal Learning

심장전도(ECG) 기록은 민감한 생체 의학 데이터이므로, 중앙 집중식 모델 훈련을 위해 원시 신호를 공유하는 데 한계가 있습니다. 연합 학습(Federated Learning)은 이러한 개인 정보 보호 제약을 해결하기 위해 데이터가 원본 소스에 유지되면서 협력적인 모델 훈련을 가능하게 합니다. 그러나 연합 ECG 분류는 클라이언트 측 샘플 부족, 불균형한 부정맥 레이블, 그리고 클라이언트 간의 비독립적이고 동일하게 분포되지 않은(non-IID) 데이터로 인해 여전히 어려운 과제입니다.

이러한 제약을 극복하기 위해서는 통신 효율적이며 클라이언트 간 분포 변화에 강건한 분류기가 필요합니다. 본 연구에서는 연합 평균(FedAvg) 하에서 MIT-BIH 데이터셋의 5개 클래스 부정맥 분류와 INCART 데이터셋의 3개 클래스 분류에 대해 하이브리드 양자 영감 Kolmogorov-Arnold 네트워크(HQKAN)를 다층 퍼셉트론(MLP)과 비교 평가했습니다.

실험 결과, HQKAN은 여러 클라이언트 구성에서 대부분의 집계 및 소수 클래스 지표를 개선하는 동시에 MLP 대비 학습 가능한 파라미터를 37.35% 적게 사용했습니다. 또한, MIT-BIH 데이터셋에서는 통신 비용을 24.89% 감소시켰으며, INCART 데이터셋에서는 각각 44.81%와 36.41%의 통신 비용을 절감했습니다.

이러한 결과는 HQKAN이 생체 신호 데이터에 대한 개인 정보 보호 연합 학습을 위해 MLP 기반의 기준 모델에 비해 더욱 간결하고, 통신 효율적이며, 강력한 대안을 제공함을 시사합니다.

The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

LLM의 지식 삭제(unlearning) 과정에서 인기 있는 사실이 희귀한 사실보다 더 깊이 기억되어 제거하기가 더 어렵다는 점이 밝혀졌습니다. 기존의 지식 삭제 방법들은 훈련 데이터의 빈도와 관계없이 균일한 기울기 압력을 적용하여 이 문제를 해결하지 못합니다.

이에 연구진은 AdaPop(Adaptive Popularity)이라는 새로운 방법을 제안했는데, 이는 외부 프록시(예: 위키데이터 사이트링크, LLM-as-Judge)로부터 파생된 사실별 인기 의존적 지수와 로컬 토큰 신뢰도를 결합합니다. 또한 이 방법은 에포크마다 보존 페널티를 조정하는 듀얼 어센트 컨트롤러를 통해 삭제와 보존의 균형을 자동화합니다.

이 방법은 세 가지 모델 패밀리와 두 가지 벤치마크에서 경쟁 방법들보다 약 5배 적은 내용을 삭제하며, 패러프레이즈된 질의에 대해서는 약 1.6배 적은 내용을 삭제하는 것으로 나타났습니다. 내부 측정 지표를 통해, AdaPop을 사용할 경우 삭제 집합의 은닉 상태는 이전 삭제 모델의 상태로부터 더 멀어지지만, 보존 집합의 표현은 가까운 상태를 유지하는 것을 확인할 수 있습니다.

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion

대규모 언어 모델(LLM)을 위한 고품질 창작 데이터는 여전히 스토리 중심 데이터에 의해 지배되어 다양한 창작 형식의 구조적, 기능적 관습을 따르는 모델의 능력을 제한하고 있습니다. 이에 본 연구는 스토리 생성을 넘어선 창작 데이터 확장을 위해 속성 기반 장르 확장 프레임워크를 제안합니다. 이 프레임워크는 주제적 폭과 장르 형식 제어를 분리하여, 인간이 작성한 스토리 프롬프트를 다양한 창작 시드(seed)로 활용하고 수동으로 선별된 장르 속성을 사용하여 뚜렷한 구조, 스타일, 형식 관습을 강제합니다.

연구진은 이러한 방법을 결합하여 장르에 충실한 질의응답 쌍을 LLM에 프롬프트하고 이를 품질 필터링하여 사용합니다. 이를 통해 스토리, 랩, 가사, 각본, 게임 디자인, 캐릭터 디자인 등 13가지 창작 형식을 포함하는 5만 개의 예시로 구성된 멀티 장르 컬렉션(Multi-Genre Collection)을 구축했습니다.

이 데이터셋을 적용한 실험 결과, 이 데이터로 미세 조정된 모델들은 기본 모델이나 작문 특화 기준선뿐만 아니라 기존 작문 코퍼스로 훈련된 모델보다도 일관되게 우수한 성능을 보였습니다. 이는 강력한 창작 능력의 핵심 동인이 스토리 중심의 확장보다는 통제된 장르 확장이 핵심임을 시사합니다.

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

오픈 웨이트 언어 모델들은 미세 조정, 양자화, 가지치기, 병합 과정을 거치지만, 그 출처(provenance)는 종종 문서화되지 않습니다. 본 연구는 데이터 없이 모델 가중치만으로 두 체크포인트가 공통 조상을 공유하는지 확인하는 화이트박스 계보 검증 방법을 탐구합니다.

잔차 훈련(residual training)은 분기 제품에서 공유된 정체성 정렬 구성요소를 생성하기 때문에 이 구조만으로는 계보를 확립할 수 없습니다. 연구진은 이 요소를 제거하고 잔차 블록 전반에 걸쳐 체크포인트별 구조를 비교하여 독립적인 체크포인트에 대해 보정된 대칭 계보 점수를 도출했습니다.

이 점수는 잔차 훈련을 통해 얻은 결과와 비교하여, 미세 조정되거나 LoRA 병합, 가지치기, 양자화된 후손 모델들을 독립적이거나 증류된 모델과 구별하는 데 성공했으며 AUROC 값이 1.0을 기록했습니다. 또한 기능 보존 체크포인트 세탁 실험에서도 이 점수는 변하지 않았으며, GPT-2에 대한 가장 강력한 기준선보다 76배 빠른 속도로 실행되었습니다.

이 결과는 가중치 계보와 행동적 유사성을 구별하는 수동적이고 데이터 없는 출처 신호를 제공하며, 여섯 가지 언어 모델 패밀리 이상에서 투영 쌍(projection-pairing) 신호가 나타남을 보여줍니다. 이는 호환 가능한 오픈 웨이트 언어 모델 체크포인트에 대한 확실한 출처 신호를 확립하는 데 기여합니다.

Demystifying Agent Skills: Why They Work-Until They Don't

에이전트의 스킬은 추론 시점에 구조화된 지식 패키지를 통해 LLM 에이전트를 향상시키는 실용적이고 효과적인 접근 방식으로 부상했습니다. 하지만 기존 평가들은 스킬이 전체 작업 성공률을 얼마나 개선했는지에만 측정하여, 스킬이 언제 도움이 되고, 왜 작동하며, 어디에서 실패하는지에 대한 근본적인 질문은 충분히 탐구하지 못했습니다. 연구진은 다양한 벤치마크와 에이전트, LLM을 대상으로 통제된 실험을 수행하여 스킬의 표현 방식, 결과 주석, 검색 난이도, 프레임워크 간 견고성 등의 영향을 분리했습니다.

이러한 질문에 답하기 위해 연구진은 통제된 정량적 실험과 쌍으로 분석된 궤적 분석을 결합하는 대조 연구를 설계했습니다. 실험 기록 8,135건과 240개의 개방 코딩 기록에서 얻은 관찰을 통합하여 세 가지 고수준 범주와 열두 가지 스킬 사용 모드로 분류했습니다. 분석 결과, 스킬은 노이즈가 있는 궤적이 실행을 안정화하는 절차적 앵커가 될 때 작동합니다. 스킬은 작업 성공률을 개선하며 워크플로우 메모리보다 6.06%p 더 나은 성능을 보였습니다.

스킬의 작동 메커니즘을 살펴보면, 절차적 앵커링은 스킬 사례의 65.7%를 설명하는 반면, 명시적인 지식 주입은 4.5%에 불과했습니다. 이는 스킬이 누락된 사실을 주입하기보다는 행동을 안정화시킨다는 것을 보여줍니다. 또한 검색(Retrieval)은 별도의 병목 현상으로 작용하는데, 검색 풀이 5에서 100으로 증가함에 따라 실제 사용 정밀도는 29.6%에서 3.3%로 급격히 떨어집니다. 혼동을 일으키는 방해 요소는 오프라인 식별을 방해하지만 다운스트림 성공률은 안정적으로 유지됩니다.

결론적으로 스킬은 취약한 가정, 비호환적인 컨텍스트, 또는 불충분한 적응성 하에서 실패할 수 있습니다. 이러한 발견은 단순한 성공률을 넘어 평가를 유도하며 신뢰할 수 있는 자가 진화 에이전트를 안내하는 데 기여합니다.

Personalized Auto-Research: Towards a True AI Co-Scientist

AI 공동 과학자들이 가설 생성, 관련 연구 검색, 실험 설계, 코드 실행, 논문 초안 작성 등을 수행하면서 연구 방식에 변화를 가져오고 있습니다. 하지만 현재의 최첨단 시스템들은 연구자 개개인을 고려하지 않는 연구자 불가지론적(researcher-agnostic) 상태로 남아 있습니다. 즉, 연구 목표에 따라 참신성, 타당성 또는 심사위원 점수를 최적화할 뿐, 최종 결과물을 사용할 개별 과학자를 무시합니다.

이는 연구에서 참신하거나 가치 있거나 실행 가능하다고 간주되는 것이 연구자의 이전 작업, 방법론적 역량, 그리고 그들이 속한 협력자 및 커뮤니티에 따라 달라진다는 근본적인 사실을 간과하는 것입니다. 본 연구는 연구 과정의 모든 단계를 개별 연구자의 표현에 기반하여 조건화하는 개인화된 자동 연구(personalized auto-research) 문제를 제안합니다. 개인화는 단순한 편의 기능이 아니라 AI 시스템이 진정한 공동 과학자가 되도록 하는 근본적인 속성임을 주장합니다.

이 문제를 해결하기 위해 연구자 맥락을 검색, 가설 탐색, 실험, 작성, 검토의 모든 단계에 걸쳐 연결하는 일반적이고 유연한 프레임워크를 제안합니다. 이 프레임워크는 (i) 그래프 기반 연구자 표현, (ii) 전체 연구 파이프라인에 걸친 개인화, (iii) 개별에 기반한 평가라는 세 가지 기본 구성 요소로 이루어져 있습니다. 특히, 서로 다른 연구자들이 동일한 목표를 제시했을 때 본질적으로 동일한 연구를 받게 되어 새로운 아이디어가 발생하는 암묵적인 지식을 지우는 일종의 일률적인 실패 모드를 강조합니다.

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

AI 에이전트가 초기 가설부터 최종 논문 작성까지 전체 연구 과정을 수행하는 패러다임인 오토리서치(AutoResearch)에 대한 평가가 필요하다는 연구가 발표되었습니다. 기존 평가들은 에이전트의 성능만을 측정할 뿐 작동 방식이나 실패 지점에 대해서는 충분한 정보를 제공하지 못했습니다.

이러한 격차를 해소하기 위해 연구진은 7가지 과학 도메인과 연구 라이프사이클 전반을 포괄하는 100개의 과제를 포함하는 오토리서치 평가 프레임워크인 AutoResearchEval을 도입했습니다. 이 평가를 통해 8개의 하네스 모델 조합에서 800개의 오토리서치 에이전트 궤적을 프로세스 수준으로 주석 처리하고, 실패 패턴을 45가지로 분류한 오토리서치 실패 분류 체계(ARFT)를 제시했습니다.

분석 결과, 모든 모델 조합에서 나타난 실패 패턴은 에이전트가 결과물을 검토하고, 실패 시 수정하며, 경로의 타당성을 질문하는 메타인지 루프(metacognitive loop)가 부족하다는 단일한 한계로 수렴되었습니다. 이는 특정 스캐폴드(scaffold)의 문제가 아니라 모델 자체의 한계에서 발생하는 것으로 나타났습니다.

연구진은 이 결과를 바탕으로 에이전트의 자율 과학 발견 연구를 위한 지속적인 연구 개발을 촉진하고자 AutoResearchEval과 ARFT를 공개했습니다. 이는 에이전트 시스템의 실패 원인을 더 깊이 이해하고 향후 자율 연구 시스템을 발전시키는 데 기여할 것입니다.

PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

자기 진화 에이전트는 상호작용 경험을 통해 미래 행동을 개선하지만, 기존 평가들은 고정된 실행 조건 하에서 최적화되어 조건 변화 후 복구 능력을 테스트하지 못하는 한계를 가지고 있습니다. 이러한 격차를 해소하기 위해 연구진은 시뮬레이션 기반의 벤치마크인 PACE-Bench(물리 적응을 통한 코드 진화)를 소개합니다. 이 벤치마크는 여섯 가지 물리 도메인에 걸쳐 144개의 소스-대상 적응 쌍을 포함하며, 동일한 목표와 인터페이스를 가진 소스 환경과 변이된 대상 환경을 연결합니다.

PACE-Bench의 과제는 소스 환경에서 성공한 코드를 진단 샌드박스 피드백을 사용하여 제한된 시도 예산 내에서 작동하는 대상 설계로 반복적으로 적응시키는 것입니다. 연구진은 네 가지 패러다임에서 나온 열 가지 자기 진화 방법을 비교 분석했습니다. 전체 벤치마크는 아직 포화 상태가 아니며, Reflexion과 Qwen3-14B 조합은 전체 벤치마크 쌍 중 35.9%만 성공했습니다. 또한 GPT-5.5는 전체 예산 하에서 정적(Statics) 하위 집합의 66.7%를 해결하는 것으로 나타났습니다.

이러한 결과는 시뮬레이션 기반 반성이 검증되지 않은 자기 수정보다 더 신뢰할 수 있음을 보여줍니다. 또한 메모리 앵커는 에이전트를 초기 설계에 고정시키고 광범위한 트리 검색은 수렴하지 않으면서 탐색을 수행한다는 점을 확인했습니다. 성능 상한을 높이는 것은 정확한 물리적 변화를 드러내는 것이 아니라 메커니즘 재설계가 핵심 병목임을 시사합니다. 관련 데이터와 코드는 https://github.com/thunlp/PACE-Bench에서 확인할 수 있습니다.

Agentic Transaction: Towards ACID-Compliant Agent Systems

거대 언어 모델(LLM) 에이전트가 단순한 대화형 비서에서 추론, 도구 사용, 코드 생성 등을 통해 장기 목표를 수행하는 자율 시스템으로 발전함에 따라 새로운 도전 과제가 발생하고 있습니다. 에이전트가 지속적인 환경과 다단계 워크플로우에서 작동하면서 신뢰할 수 있는 실행, 일관된 결과, 안전한 동시성, 그리고 영구적인 상태 관리가 필요해집니다.

이에 연구진은 에이전트 실행을 위해 고전적인 ACID 속성을 재해석한 에이전트 트랜잭션 개념과 ACID 준수 에이전트 시스템 프레임워크를 제안했습니다. 이 프레임워크는 모델 불확실성과 동적인 실행 환경 속에서도 신뢰할 수 있는 에이전트 시스템을 구축하기 위한 원칙적인 기반을 제공하며, 세 가지 의미론적 보장, 즉 의미론적 원자성(Semantic Atomicity), 의미론적 일관성(Semantic Consistency), 의미론적 격리(Semantic Isolation), 의미론적 영속성(Semantic Durability)을 통해 이를 달성합니다.

이러한 프레임워크를 구현하기 위해 연구진은 트랜잭션 탐색-실행-검증 주기, 트랜잭션 스킬 허브, 신뢰 분산 기반 검증, 의미론적 의존성 인식 격리, 트랜잭션 인식 의미론적 상태 관리를 통해 ACID 준수 데이터 에이전트를 개발했습니다. 광범위한 벤치마크 실험 결과, 이 시스템은 Claude Code를 포함한 최첨단 에이전트 대비 10.6%의 성능 향상을 달성했습니다.

이 연구는 신뢰할 수 있고 확장 가능하며 스스로 진화하는 AI 에이전트 시스템을 구축하기 위해 트랜잭션 원칙과 시스템 아키텍처를 확장하는 광범위한 연구 의제를 열어줍니다.

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

부분 인식 3D 객체 생성은 모델링, 편집, 관절 조작 등 그래픽 애플리케이션에 필수적이지만, 기존 방법들은 복잡한 객체에 잘 확장되지 않는 한계를 가지고 있습니다. 파트 수가 증가할수록 상세한 지오메트리를 생성하는 것은 토큰 길이와 메모리 측면에서 매우 비싸집니다. 이에 MegaParts는 구조화된 시퀀스 모델링과 토큰 효율적인 벡터 양자화 형태 토크나이저를 결합하여 이러한 문제를 해결하는 확장 가능한 자기회귀 3D 생성 프레임워크를 소개합니다.

이 프레임워크는 기하학적 복잡도에 따라 적응형 길이 토큰화를 가능하게 하며, 고충실도 재구성을 유지하면서 토큰 사용량을 최소화하여 파트 수준의 지오메트리에 대한 이산 잠재 표현을 학습합니다. 또한 이 압축된 표현 위에 대규모 언어 모델을 훈련시켜 객체 경계 상자, 파트 경계 상자, 파트 형태 토큰을 통합된 구조적 시퀀스 내에서 생성할 수 있습니다.

효율적인 장문맥 훈련 전략과 결합하여 이 방법은 최대 300개의 파트와 256k 토큰 길이의 시퀀스에 대해 확장 가능하며, 구성적 구조를 보존하면서 세밀한 파트 수준 제어를 가능하게 합니다. MegaParts는 기존의 자기회귀 및 확산 모델보다 높은 메시 품질을 달성하여 압축된 이산 파트 토큰이 확장성과 생성된 지오메트리의 충실도를 모두 향상시킴을 보여줍니다.

이러한 결과는 대규모 파트 인식 3D 생성에 있어 LLM 기반의 토큰 효율적인 자기회귀 모델링이 확산 모델에 대한 강력한 대안이 될 수 있음을 시사합니다.

Nanbeige4.2-3B on Apple Silicon: Fixing Deployment Bugs and Decreasing Looped Transformer Memory Overhead

30억 개의 파라미터를 가진 에이전트 모델 Nanbeige4.2-3B는 레이어 재사용을 통해 추가 파라미터 없이 깊이를 더하는 Looped Transformer(LT) 구조를 기반으로 구축되었습니다. 이 모델은 Apple Silicon(MPS) 환경에서 평가되었으나, 초기 릴리스 체크포인트가 Hugging Face transformers를 통해 바로 실행되지 않는 다섯 가지 독립적인 버그가 발견되었습니다. 이 버그들에는 RoPE 버퍼가 조용히 0으로 설정되거나 제거된 transformers 캐시 API 호출 등이 포함되어 있습니다.

또한, LT의 레이어 재사용 전략은 피처 효율성을 달성하는 대신 최대 어텐션 메모리를 두 배로 늘리는 결과를 초래했습니다. 이를 해결하기 위해 연구진은 청크-프리필 전략을 도입하여 32~GiB 공유 메모리에서 허용 가능한 컨텍스트 폭을 2.7배 확장하는 메모리 용량 페널티를 완화했습니다. 그러나 이러한 메모리 최적화만으로는 에이전트 작업에 필요한 성능을 달성할 수 없었기 때문에 패치가 필요했습니다.

최종적으로 시스템 프롬프트 및 MPS 네이티브 메모리 버그를 해결함으로써 모델을 안정적으로 사용할 수 있게 되었으며, 표준 MCP 및 툴 호출 벤치마크에서 신뢰할 수 있는 평가가 가능해졌습니다. 디버깅된 모델은 MCPMark의 일부에서 실제 에이전트 작업의 최대 30%를 완료했으며, BFCL에서는 단일 툴 호출에서는 거의 완벽했지만 다중 툴 테스트에서는 실패했습니다.

연구진은 수정된 체크포인트, 시스템 프롬프트 최적화 도구, 평가 도구를 GitHub에서 공개했습니다.

Self-Supervised Visual On-Policy Distillation

시각 온-폴리 디스틸레션은 더 크거나 강력한 교사 모델 또는 참조 답변과 같은 특권적 감독을 통해 정보 있는 교사-학생 비대칭에 크게 의존합니다. 이는 특권적인 정보가 없을 때 정보 있는 비대칭이 어디에서 발생할 수 있는지에 대한 근본적인 질문을 제기합니다. 연구진은 이 비대칭의 발생 위치를 반전시켜, 교사에게 특권 정보를 추가하는 대신 학생으로부터 정보를 빼는 방식으로 접근했습니다. 이 접근 방식은 정답 레이블이나 보상 없이도 학생에게 이용 불가능한 정보를 가진 교사와 동일한 효과적인 학습 신호를 생성합니다.

이 원리를 바탕으로 연구진은 비대칭적 증강된 시각을 통해 온-폴리 학습 신호를 구성하는 간단하면서도 효과적인 방법인 자기 지도 시각 온-폴리 디스틸레션(Self-Supervised Visual On-Policy Distillation, S²VOPD)을 도입했습니다. S²VOPD는 비대칭적 증강된 시각으로부터 온-폴리 학습 신호를 구축합니다. 연구는 시각 증강의 광범위한 설계 공간을 탐색하여 비대칭이 성능에 미치는 영향, 증강의 강도가 성능에 미치는 영향, 그리고 증강이 태스크 일관성을 유지해야 한다는 제약 조건에 대해 밝혀냈습니다.

실험 결과, 네 가지 증강 가족 모두 성능을 향상시키는 반면 대칭적인 자기 디스틸레션은 성능을 저하시켰으며, 성능은 중간 수준의 강도에서 최고치를 보였습니다. 또한 질문 관련 증거를 완전히 제거하는 증강은 정보가 부족한 불일치를 유발할 수 있으므로 태스크 일관성을 유지하는 것이 중요합니다. 이러한 방법으로 여섯 가지 세밀한 인식 벤치마크에서 S²VOPD는 Qwen3.5-4B 모델을 70.7%에서 77.4%로 향상시켰으며, 모든 오픈 소스 모델을 비교했을 때 우위를 점했고 Qwen3-VL 235B 모델에서는 GPT-5.4를 능가했습니다.

심지어 학습 데이터를 동일하게 유지했을 때, S²VOPD는 특권 정보를 사용한 방법들이 달성한 성능 향상의 96%를 회복했습니다. 이는 특권적 정보 없이도 효과적인 비대칭을 활용하여 강력한 성능을 달성할 수 있음을 보여줍니다.