Digging the grave of my job: Hollywood creatives training AI to do their jobs

할리우드 크리에이터들이 AI를 훈련시켜 자신의 직업을 대체하려는 움직임이 나타나고 있습니다. 이는 고용 불안정과 수입 감소에 직면한 작가, 감독, 프로듀서들이 생계를 유지하기 위해 AI 기술을 습득하는 형태로 진행되고 있습니다.

이들은 화면 각본 작성이나 촬영 일정 계획, 영상 녹음의 음성 분리, 영화 기획안 작성 등 자신의 업무에 필요한 기술을 AI에게 가르치기 위해 프리랜서 작업을 수행하고 있습니다. 이들은 시간당 12달러에서 200달러를 받고 AI 모델을 훈련시키며, Anthropic이나 OpenAI와 같은 주요 AI 기업들이 제공하는 계약을 통해 인간의 전문 지식을 전달하고 있습니다.

이러한 AI 활용은 영화 및 음반 산업의 일자리 감소와 맞물려 발생하고 있으며, 일부 크리에이터들은 AI가 인간의 감정이나 미묘한 뉘앙스를 대체할 수 없다는 점을 지적합니다. 하지만 일부는 AI가 새로운 기회를 발굴하는 도구가 될 수 있다고 보며, 이는 단순히 직업을 잃는 것뿐만 아니라 새로운 창작 영역을 개척하는 수단이 될 수 있다는 관점도 존재합니다.

일부 작가들은 AI가 스크립트를 작성하거나 팟캐스트, 소설 등을 생성하는 데 사용되어 경제적 어려움을 해소하고 있으며, 이는 AI가 인간의 감정을 완전히 모방하지 못한다는 한계 속에서 현실적인 대안으로 작용하고 있습니다.

Your "File" Menu Isn't About Files

애플 맥 환경에서 앱 메뉴의 첫 항목을 '파일(File)'로 명명하는 것이 실제 파일 작업과 관련이 없는 경우가 많다는 지적이 제기되었습니다. 저자는 맥북에서 35개의 앱을 검토하며 '파일' 메뉴가 실제로 파일과 관련된 작업을 수행하지 않는 많은 애플리케이션들을 분석하고 더 적절한 대안 이름을 제안했습니다.

예를 들어, 1Password 앱에서는 파일 대신 암호(Password)를 가져오고 내보내는 작업을 수행하며, 캘린더 앱에서는 파일 대신 이벤트나 알림을 처리하므로 '이벤트(Event)'나 '자동화(Automation)'로 이름을 바꾸는 것이 더 논리적이라는 의견이 제시되었습니다. 또한, Safari와 같은 브라우저 환경에서는 '파일'보다는 '탐색(Browse)'이라는 용어가 더 적합하며, Finder와 같은 핵심 앱은 파일의 개념을 가장 잘 반영하고 있다는 점도 언급되었습니다.

이러한 분석은 애플이 표준 앱의 명명 규칙을 재고하고 사용자 경험을 개선할 필요가 있음을 시사합니다. 저자는 Finder나 Terminal(Shell)처럼 실제 기능에 기반한 명명 방식을 따르는 앱들이 존재하며, 이는 애플이 앱 이름을 지을 때 더 나은 대안을 찾을 수 있음을 보여줍니다.

4 in 10 travellers visit tourist sites to capture social media content

TUI Musement의 연구에 따르면 여행자들이 소셜 미디어 콘텐츠를 통해 여행지를 방문하는 경향이 강해지고 있습니다. 여행자 중 거의 4분의 1이 소셜 미디어 콘텐츠를 촬영하거나 기록하기 위해 관광지에 방문하며, 바이럴 게시물을 보고 여행이나 활동을 예약한 비율은 43%에 달합니다. 이러한 현상은 소셜 미디어가 여행의 영감, 예약, 경험 공유 전반에 걸쳐 점점 더 중요한 역할을 하고 있음을 보여줍니다.

여행 영감의 원천에서 세대별 차이가 두드러지는데, 특히 Z세대는 여행 영감을 얻는 데 있어 가족이나 친구의 추천보다 틱톡을 48%로 가장 큰 영향력으로 꼽았습니다. 이는 시각적이고 짧은 형식의 콘텐츠가 새로운 목적지나 활동을 발견하는 데 강력한 영향을 미치고 있음을 의미합니다.

소셜 미디어의 영향은 단순한 영감을 넘어 구체적인 행동으로 이어지며, 특히 밀레니얼 세대와 Z세대는 바이럴 콘텐츠를 보고 여행을 예약하는 데 50%에서 52%에 달하는 높은 비율을 보였습니다. 또한, 여행 경험을 공유하는 과정에서 37%의 여행자가 소셜 미디어에 자신의 휴가를 멋지게 보이게 만들고자 하는 압박감을 느낀다고 응답했습니다.

이러한 현상은 여행의 본질이 소셜 미디어의 순간을 넘어선 진정하고 전문적으로 선별된 경험에 있음을 시사합니다. TUI Musement는 궁극적으로 여행자들이 소셜 미디어의 유행을 넘어 목적지의 핵심과 진정으로 연결되는 경험을 제공하는 데 중점을 두고 있습니다.

GPT 5.6 Sol 20% price reduction

OpenAI는 GPT-5.6 Sol 모델에 대해 입력 토큰 가격을 20%, 출력 토큰 가격을 33% 인하하는 프로모션을 제공하고 있습니다. 이 모델은 100만 입력 토큰당 4달러, 100만 출력 토큰당 20달러의 비용으로 책정되어 이전 모델 대비 비용 효율성이 향상되었습니다. 이 특별 가격은 2026년 11월 21일까지 유효합니다.

이 가격 정책은 사용자가 API를 통해 다양한 기능을 활용할 수 있도록 지원하며, 특히 긴 프롬프트에 대한 가격 책정 기준이 명시되어 있습니다. 입력 토큰이 272K를 초과하는 프롬프트의 경우 입력 토큰은 2배, 출력 토큰은 1.5배로 가격이 적용됩니다. 또한 캐시 쓰기 작업은 비캐시 입력 토큰 요율의 1.25배로 청구됩니다.

GPT-5.6 Sol 모델은 텍스트 및 코드 생성 외에도 이미지 생성, 비디오 생성, 음성 및 오디오 전사, 번역 등 다양한 멀티모달 기능을 지원합니다. 또한 웹 검색, 파일 검색, 코드 인터프리터, 호스팅 셸 등 다양한 도구 사용이 가능하여 개발자들이 복잡한 워크플로우를 구축할 수 있습니다.

사용자는 API 사용량에 따라 Tier 1부터 Tier 5까지의 사용 등급을 선택할 수 있으며, 각 등급은 요청 및 사용량에 대한 제한을 설정합니다. 따라서 개발자는 비용 최적화와 기능 활용을 동시에 고려하여 API 사용 정책과 사용 등급을 신중하게 선택해야 합니다.

Michael Polansky is training an AI model on skin that’s still alive

마이클 폴란스키는 살아있는 피부 조직을 인공지능 모델에 훈련시켜 새로운 스킨케어 화합물을 발견하는 스타트업을 구축했습니다. 이 스타트업은 인체 피부 조직을 체외에서 몇 주 동안 생존 상태로 유지하여 연구 데이터를 수집하는 방식으로 작동합니다.

이 기술은 인공지능과 생체 조직을 결합하여 피부 과학 분야에서 새로운 화합물을 탐색하는 데 사용됩니다. 연구진은 살아있는 피부 조직을 활용하여 기존의 실험 방식보다 더 정교하고 생물학적으로 관련성 높은 데이터를 얻고 있습니다.

폴란스키는 이 기술을 통해 피부 건강과 미용 분야에 혁신을 가져올 수 있는 새로운 접근 방식을 제시하고 있습니다. 이는 AI가 생체 데이터를 분석하여 신약 개발이나 화장품 성분 발견과 같은 복잡한 문제를 해결하는 데 어떻게 적용될 수 있는지 보여주는 사례입니다.

SSL에 대해 배운 모든 것이 더는 유효하지 않음 [유튜브]

장기 인증서와 수동 갱신에 의존하던 기존의 SSL 운영 방식은 더는 안전하거나 지속 가능하지 않다는 내용입니다. 현재는 TLS 1.3과 ACME 자동화를 중심으로 단기 인증서 사용과 자동화된 관리가 핵심으로 바뀌고 있습니다.

이러한 변화는 기존 SSL 관행이 가진 여러 보안 취약점과 관련이 있습니다. 과거에는 CA의 부실한 감사와 인증서 오발급 문제, SHA-1 충돌, Heartbleed 취약점, 그리고 불완전한 폐기 체계 등이 지속적으로 발생해 왔습니다.

따라서 개발자와 운영자는 새로운 보안 환경에 맞춰 인증서 관리 방식을 재검토해야 합니다. 단기 인증서와 자동화된 시스템으로 전환하는 것이 현재의 보안 요구사항을 충족하고 지속 가능한 SSL 환경을 구축하는 데 필수적입니다.

There's no reason for software to be slow anymore

소프트웨어는 더 이상 느릴 이유가 없으며, AI를 통해 전문적인 성능 최적화 작업의 진입 장벽이 크게 낮아지고 있습니다. 과거에는 특정 기술이나 희소한 능력이 필요했던 성능 작업이 이제는 몇 줄의 텍스트만으로도 누구나 수행할 수 있게 되면서, 동적 맞춤형 소프트웨어 개발이 가능해졌습니다.

이러한 변화는 LLM이 JIT 컴파일러 구현과 같은 복잡한 최적화 작업을 훨씬 쉽게 만들었다는 점에서 비롯됩니다. 예를 들어, 특정 워크로드에 맞게 최적화된 정규 표현식 엔진인 FRE를 개발하는 과정에서 에이전트 루프를 통해 성능을 개선한 결과, 단순한 쿼리에서는 2배에서 4배의 성능 향상을 얻었고 복잡한 쿼리에서는 약 7%의 속도 향상을 달성했습니다.

다만 이러한 결과는 벤치마킹 환경을 설정하는 인간의 전문성에 따라 달라지며, 최적의 결과를 얻기 위해서는 여전히 인간의 설정이나 벤치마킹 설계 능력이 필요합니다. 따라서 커스텀 컴파일러를 구축하는 것보다 간단하고 쉬운 승리(easy wins)를 우선하는 것이 더 높은 투자 대비 수익을 가져올 수 있다는 결론이 도출되었습니다.

Japanese space tech startup Letara expands beyond satellite thrusters with $16M

일본의 우주 스타트업 Letara가 하이브 로켓 기술을 소형 위성 추진기를 넘어 우주, 국방 및 보안 분야로 확장하기 위해 26억 엔(16백만 달러)을 유치했습니다. 이 자금 확보는 Letara가 기존의 소형 위성 추진기 시장을 넘어 더 광범위한 시장으로 기술 적용 범위를 넓히는 데 중점을 두고 있음을 보여줍니다.

Letara는 하이브 로켓 기술의 잠재력을 활용하여 우주 탐사 및 방위 산업과 같은 고부가가치 분야에 기술을 적용하고자 합니다. 이는 단순한 소형 위성 추진기 시장을 넘어 더 큰 규모와 복잡성을 요구하는 새로운 시장 기회를 포착하려는 전략적인 움직임입니다.

이러한 투자는 Letara의 기술이 우주 및 보안 분야에서 활용될 수 있는 가능성을 입증하며, 향후 기술 상업화 및 시장 확장에 중요한 발판이 될 것입니다. 다만, 이 기술이 실제 국방 및 보안 시장에 적용되기 위해서는 엄격한 규제 및 기술적 검증 과정을 거쳐야 하는 과제가 남아 있습니다.

YC CEO Garry Tan이 말하는 창업자의 새로운 규칙 [유튜브]

YC CEO 가리 탄이 강조하는 창업자의 새로운 규칙에 대한 내용이다. 웹 1.0 붕괴 직후 유행을 좇아 웹 개발이나 팔란티어 기회를 놓쳤던 경험은 시장의 평가보다 직접적인 경험과 자신만의 지식을 따르는 것이 중요하다는 교훈으로 이어진다.

이는 창업자가 외부의 평가나 유행에 휩쓸리기보다 스스로의 경험과 깊은 지식을 바탕으로 방향을 설정해야 함을 시사한다. 특히 현재와 같은 환경에서는 기존의 성공 공식을 단순히 복제하기보다는 자신만의 독특한 통찰력을 활용하는 것이 성공의 핵심이 된다.

최근 바이브 코딩과 코딩 에이전트와 같은 도구들은 개인의 역량을 과거 수백 명 규모로 증폭시키는 역할을 한다. 이러한 기술 발전은 기존의 SaaS 성공 공식을 그대로 복제하는 방식보다는 개인의 고유한 지식과 경험을 기반으로 새로운 기회를 창출하는 데 더 큰 의미가 있다.

Computer Use와 Skills/Files API로 프로덕션 에이전트 구축하기

Claude Platform의 Computer Use, Skills API, Files API를 결합하면 소프트웨어 조작부터 조직 지식 적용, 완성된 파일 반환까지 하나의 에이전트 흐름으로 구성할 수 있습니다. 이는 복잡한 작업을 수행하는 에이전트를 구축하는 데 필요한 핵심 기능을 통합하여 개발자가 자동화된 워크플로우를 설계할 수 있게 합니다.

새롭게 도입된 Browser Use Tool은 이러한 에이전트의 기능을 확장하는 데 중요한 역할을 합니다. 이 도구는 웹 페이지의 구조를 읽어 특정 필드와 버튼을 조작할 수 있게 하여, 에이전트가 실제 환경에서 상호작용하고 데이터를 처리할 수 있는 능력을 제공합니다.

이러한 API와 도구의 결합은 에이전트가 단순한 텍스트 생성에 그치지 않고 실제 소프트웨어 환경과 조직 지식을 활용하여 파일 처리 및 조작을 수행할 수 있도록 만듭니다. 개발자는 이를 통해 실제 프로덕션 환경에서 복잡한 작업을 자동화하는 에이전트 시스템을 구축할 수 있는 기반을 마련하게 됩니다.

Huggingface Speech To Speech - 오픈소스 모델로 로컬 음성 에이전트를 만드는 파이프라인

오픈소스 모델을 활용하여 로컬 환경에서 완전한 음성 대화 파이프라인을 구성하는 방법이 제시되었습니다. 이 파이프라인은 사용자의 음성을 감지하고 텍스트로 변환하며, 대규모 언어 모델(LLM)이 질문을 이해하고 답변을 생성한 후, 그 답변을 다시 음성으로 읽어주는 기능을 포함합니다.

이러한 음성 대화 파이프라인은 사용자가 말하면 이를 감지하는 음성 활동 감지(VAD), 음성을 텍스트로 바꾸는 음성 인식(STT), LLM을 통한 답변 생성, 그리고 생성된 답변을 음성으로 읽어주는 음성 합성(TTS)의 네 단계로 구성됩니다.

핵심은 이 모든 단계가 각각 별도의 스레드에서 동작하고 큐로 연결되어 순차적으로 처리된다는 점입니다. 이를 통해 개발자는 클라우드 의존성 없이도 로컬 환경에서 음성 에이전트를 구축할 수 있습니다.

이는 개발자들이 외부 API에 의존하지 않고도 개인 기기 내에서 음성 기반의 복잡한 상호작용 시스템을 구현할 수 있는 기반을 제공합니다.

Rust nightly, 차세대 트레이트 솔버 기본 활성화

Rust의 차세대 트레이트 솔버가 nightly 빌드에서 기본 활성화되면서 컴파일러의 핵심 처리 방식이 전면 교체됩니다. 이는 where 절 증명과 연관 타입 정규화 등 Rust 컴파일러의 핵심적인 처리 방식이 완전히 새로운 방식으로 변경됨을 의미합니다.

이러한 변경은 기존 구현을 제거함으로써 Type Alias Impl Trait·Return Type Notation의 안정화를 가져옵니다. 개발자들은 기존의 구현 방식을 제거하고 새로운 솔버 기반으로 전환해야 하며, 이 과정에서 컴파일러의 근본적인 동작 방식이 변경됨에 따라 코드 호환성 및 컴파일 과정에 영향을 줄 수 있습니다.

차세대 트레이트 솔버는 약 4년간 개발되어 안정화를 앞두고 활성화되는 단계이며, 이는 Rust 생태계에서 타입 시스템의 안정성과 효율성을 높이는 데 중점을 둡니다. 따라서 Rust 코드를 사용하는 개발자들은 새로운 컴파일러 환경에 맞춰 기존 구현을 재검토하고 적응해야 합니다.

Initial focus for our partnership with Motorola is a regular non-folding device

Motorola와의 파트너십 초기 초점은 접는 기기가 아닌 일반적인 형태의 기기에 맞춰져 있습니다. 이는 향후 협력 프로젝트의 방향성이 폴더블 디바이스가 아닌 일반적인 스마트폰 기기 개발에 중점을 둘 것임을 시사합니다.

이러한 초점 변화는 개발자들이 하드웨어 및 소프트웨어 아키텍처를 설계할 때 고려해야 할 중요한 맥락을 제공합니다. 파트너십이 특정 폼팩터에 국한되지 않고 범용적인 기기 개발에 집중함으로써, 개발팀은 더 넓은 범위의 사용자 경험과 시스템 요구 사항을 충족시키는 데 집중할 수 있게 됩니다.

따라서 개발자들은 Motorola와의 협력에서 폴더블 디자인에 대한 기대치를 낮추고, 표준적인 기기 설계 및 기능 구현에 필요한 기술 스택과 아키텍처에 우선순위를 두어야 합니다. 이는 장기적인 파트너십 목표를 달성하고 효율적인 제품 개발을 진행하는 데 도움이 될 것입니다.

KDE에 Btrfs 스냅샷을 통합하는 KIO Snapshot

KDE 소프트웨어 환경에서 Btrfs 스냅샷을 일반 파일처럼 직접 탐색할 수 있게 하는 KIO Snapshot이 새로 출시되었습니다. 이 기능은 Dolphin을 포함한 KDE 기반 애플리케이션 사용자들에게 Btrfs 스냅샷을 더욱 직관적으로 관리할 수 있는 환경을 제공합니다.

KIO Snapshot은 파일의 과거 버전과 서브볼륨별 디렉터리 트리를 가상 폴더 형태로 제공하는 것이 핵심입니다. 이를 통해 사용자는 스냅샷 간의 버전 비교, 파일 복사, 그리고 메타데이터 확인 작업을 훨씬 용이하게 수행할 수 있습니다.

이러한 가상 폴더 기능은 복잡한 스냅샷 구조를 탐색하고 관리하는 데 큰 도움을 주어 데이터 관리 효율성을 높입니다. 개발자나 시스템 관리자는 이 기능을 활용하여 Btrfs 환경 내에서 스냅샷 데이터를 보다 쉽게 접근하고 조작할 수 있게 되었습니다.

더 나은 배터리

표준 라이브러리의 핵심 쟁점은 라이브러리의 크기가 아니라 일관된 품질의 API를 설계하고 제공할 조직 역량에 있다는 점입니다. 이는 단순히 코드를 많이 제공하는 것을 넘어, 개발자들이 신뢰하고 사용할 수 있는 일관된 인터페이스를 구축하는 것이 더 중요하다는 의미입니다.

Python 표준 라이브러리의 경우 품질과 명명 규칙이 일관되지 않다는 비판이 있지만, 이러한 라이브러리들이 기능을 일찍 제공한 덕분에 데이터 과학 혁명의 기반을 마련하는 데 크게 기여했습니다.

반면 Go와 같은 언어들은 포괄적인 기능을 제공하는 데 중점을 두며, 이는 라이브러리 설계 시 조직적인 관점에서 품질과 일관성을 확보하는 것이 기술적 완성도만큼이나 중요함을 시사합니다. 개발 환경에서는 라이브러리의 기능적 범위보다는 API의 일관성과 품질을 보장하는 조직 역량이 핵심적인 쟁점이 됩니다.

Rust 1.98.0 발표

Rust 1.98.0 안정 버전이 발표되었으며, 이번 업데이트는 대수적 부동소수점 연산, 버퍼 기반 정수 포맷팅, 그리고 `ManuallyDrop<Box<_>>`의 동작 보장을 추가하여 안전성과 제어력을 향상시킵니다.

특히 `f32`와 `f64` 타입의 `algebraic_*` 메서드에 대한 변경 사항은 성능 최적화에 중요한 영향을 미칩니다. 이 변경으로 인해 해당 메서드들은 연산 재배치나 루프 벡터화를 허용하지 않게 되어 개발자가 연산 흐름을 더 명시적으로 제어할 수 있게 되었습니다.

또한, 메모리 관리 측면에서 `ManuallyDrop<Box<_>>`에 대한 동작 보장이 추가되어 소유권과 드롭(drop) 동작에 대한 안전성이 강화되었습니다. 이는 복잡한 데이터 구조를 다루는 상황에서 잠재적인 런타임 오류를 줄이는 데 기여합니다.

이러한 개선 사항들은 Rust의 안전성과 성능을 높이는 데 중점을 두고 있으며, 특히 고성능 컴퓨팅이나 저수준 메모리 관리가 필요한 개발자들에게 실질적인 이점을 제공합니다.

Ask or Answer: A Decision Framework for Multi-Turn Health Misinformation Intervention

대화 속 건강 잘못된 정보를 수정하는 것은 단순히 사실을 반박하는 것을 넘어 사용자가 알고 있는 것, 믿고 있는 것, 그리고 듣고 싶어 하는 바가 다르기 때문에 적절한 명확화 질문을 던지는 것이 중요합니다. 하지만 기존 방법들은 즉시 응답하거나 무차별적으로 탐색을 시도하여 명확화 과정을 불필요하거나 항상 유익한 것으로 취급하는 한계를 가지고 있습니다.

이에 연구진은 질문의 비용 대비 이득을 학습하는 프레임워크인 보상 최적화 탐색 및 응답(Reward-Optimized Probe-and-Respond, RO-PnR)을 제안합니다. RO-PnR은 각 턴마다 탐색을 통해 얻을 것으로 예상되는 이득과 상호작용 비용을 고려하여 정보 탐색과 최종 수정 약속 중 하나를 선택합니다.

이 프레임워크는 사용자 이질성이 탐색 가치에 미치는 영향을 포착하기 위해 각 가상 사용자를 건강 문해력과 신념 몰입에 따른 잠재 상태로 모델링합니다. 실험 결과, RO-PnR은 세 가지 건강 잘못된 정보 데이터셋과 세 가지 기본 모델에서 가장 높은 비용 조정 유틸리티를 달성했으며, 무조건 탐색하는 기준선 방식보다 30% 적은 턴으로 작업을 완료했습니다.

Just the rumour of a bug is enough to find an exploit these days

보안 취약점의 루머만으로도 공격자가 악용할 수 있는 익스플로잇을 발견할 수 있는 시대가 되었습니다. 개발자가 보안 패치를 배포할 때, 기존의 보안 감금 조치(embargoes)만으로는 더 이상 충분한 시간을 벌 수 없다는 분석입니다.

저자는 OCaml의 cohttp 버그를 수정하는 과정에서, 보안 이슈의 루머만으로도 에이전트 시스템이 새로운 익스플로잇을 찾는 데 충분한 정보를 얻을 수 있음을 발견했습니다. 이는 보안 보고서나 버그가 공개되기 전에 공격자가 이미 취약점을 악용할 수 있는 상황을 의미합니다.

최근 연구에 따르면 익스플로잇 발견에 걸리는 평균 시간은 2018~19년의 63일에서 2024년에 0일 미만으로 줄어들었습니다. 실제로 marimo의 CVE-2026-39987은 공표 없이 9시간 만에 첫 익스플로잇 시도로 이어졌으며, Langflow의 CVE-2026-33017 역시 20시간이 소요되었습니다.

이러한 상황은 오픈 소스 유지보수자들이 보안 대응 방식을 바꿔야 함을 시사합니다. LLM이 익스플로잇을 생성하는 속도에 비해 유지보수자들이 취약점을 검증하고 수정하는 속도가 정체되어 있기 때문입니다. 따라서 보안 프로세스는 취약점 발견과 대응의 병목 현상을 해결하기 위해 모델 지원 기반의 워크플로우를 통해 기술 부채를 해결하는 방향으로 전환되어야 합니다.

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

AI 기반 디지털 아바타 스트리머는 실시간으로 제품 질문에 답하고 시청자와 소통하며 마케팅 전략을 실행해야 하므로 낮은 지연 시간과 빈번한 전략 업데이트, 그리고 정확하고 효과적인 응답이 요구됩니다. 이러한 변화에 대응하기 위해 모델 가중치와 독립적으로 업데이트될 수 있는 Skill, Hook, 프롬프트, 도구 등을 포함하는 진화 가능한 Harness를 활용하는 연구가 진행되었습니다. 그러나 대형 모델은 제로샷 학습은 가능하지만 느리고, 소형 모델은 지연 시간 목표를 충족하지만 고정된 Harness 구성에 과적합되는 상충 관계가 존재합니다.

연구진은 이러한 문제를 해결하기 위해 변화하는 Harness에 적응하도록 소형 모델을 훈련하는 Harness-Aware Training(HAT)을 제안했습니다. 이 방법의 핵심 구성 요소인 Harness-State Augmentation(HSA)은 Skill 식별자, 콘텐츠, 도구 스키마, 프롬프트 구조, Hook 함수에 작업 보존 변환을 적용하여 학습을 진행합니다. 훈련은 HSA-SFT를 통해 다양한 환경에서 강력한 모델 궤적으로부터 추론 및 도구 사용을 학습하고, 일반 온-폴리 정책 증류를 통해 SFT 중 손실된 일반화를 복원하며, HSA-RL을 통해 증강된 환경에서 강화 학습을 수행하여 변화하는 Harness에 대한 견고성을 개선하는 세 단계로 진행됩니다.

HAT는 네 가지 평가 세트에서 Live-Stream QA에서 94.8점, Harness-Variant QA에서 94.6점을 달성하며, 고정 Harness SFT가 기본 모델 대비 7.7점의 IFEval 감소를 유발한 것과 달리 이 성능 저하를 피하고 83.5점을 달성했습니다. 또한, 이 시스템은 NVIDIA H20 GPU에서 P50 지연 시간 3.4초, P95 지연 시간 8.1초를 제공하며, 타오바오 라이브의 디지털 아바타 서비스에 배포되어 GMV 및 상품 페이지 조회에 대한 긍정적인 온라인 A/B 테스트 결과를 보였습니다.

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

컴퓨터 사용 에이전트가 스크린샷에서 자연어 지시를 기반으로 인터페이스 요소를 찾는 기술이 발전하고 있지만, 기존 벤치마크는 모델이 관계 언어를 올바른 요소에 연결하는지 여부를 분리하여 측정하지 못하는 한계가 있습니다. 이에 연구진은 GUI-Primitives라는 994개의 항목으로 구성된 벤치마크를 도입하여 그래픽 사용자 인터페이스 내의 일곱 가지 공간 관계(좌우, 위아래, 포함, 정렬, 근접, 목록 순서, 가림)에 대한 대조적인 지시 쌍을 평가합니다.

이 벤치마크는 스크린샷과 앵커를 고정한 채 관계 표현을 변경하여 올바른 대상이 두 후보 중 하나로 이동하도록 구성됩니다. 5명의 주석자가 196개 항목에 대해 검증했으며, 잘 형성도(well-formedness)는 κ=0.94, 대상 선택(target selection)은 κ=0.79를 기록했습니다. 모델들은 엄격한 점-인-박스 정확도에서 최대 32%에 불과했지만, 예측이 후보 영역 내에 있을 경우 대상 선택 정확도는 수평 및 수직 위치, 근접, 목록 순서에 대해 0.82~0.90에 도달했습니다.

특히 포함(containment)과 가림(occlusion) 관계에서는 정확도가 0.50으로 낮게 나타났는데, 이는 관계 이해보다는 후보 위치 자체의 국소화 실패가 대부분의 오류를 반영함을 시사합니다. 또한, 10개 모델에 걸쳐 벤치마크 정확도는 ScreenSpot-Pro 정확도와 상관관계(Spearman ρ= +0.74)를 보였습니다. 두 후보를 표시하는 작업은 선택 정확도를 35~57퍼센트 포인트 향상시키는 것으로 나타나, 실제 배포 방법이라기보다는 후보 집합을 제공하는 진단 도구로서의 가치를 입증합니다.