수학자, 디자이너, 분석가, 법률가 등 다양한 전문직에서 엔지니어링의 작업 방식을 적용하는 현상이 확산되고 있으며, 이를 엔지니어피케이션(engineerification)이라고 부른다. 이는 코딩을 배우는 것을 넘어 전문 분야의 문제 해결에 엔지니어링의 핵심 개념을 적용하는 새로운 작업 방식이다.
이러한 엔지니어피케이션은 저장소, 에이전트, 테스트, 자동화, 형식 명세, 피드백 루프와 같은 엔지니어링 도구들을 활용하여 전문적인 작업을 수행하는 것을 의미한다. 즉, 코딩 지식이 없는 전문가들도 이러한 방법론을 통해 복잡한 도메인 문제를 체계적으로 접근하고 해결할 수 있게 된다.
핵심 변화는 모두가 코딩을 배우는 것이 아니라, 각 전문 분야의 도메인 지식에 이러한 엔지니어링 원칙을 적용하는 데 있다. 이는 전문직이 데이터와 시스템을 다루는 방식에 근본적인 변화를 가져오며, 도메인 특화된 자동화와 시스템 구축 능력을 향상시킨다.
GeekNews
분석
피드 등록 2026-08-27
neo
수집 2026-08-27 03:09
전위 예술가인 쿠사마 야요이(草間弥生) 씨가 97세의 나이로 세상을 떠났습니다. 그녀는 2026년 8월 14일 도쿄의 병원에서 다발성 장기 부전으로 사망했습니다.
쿠사마 야요이 씨는 1957년부터 1973년까지 주로 뉴욕에서 활동하며 세계적으로 인정받는 예술가였습니다. 그녀는 다채로운 물방울과 그물무늬 작품으로 유명하며, 불안과 공포를 극복하기 위해 이러한 패턴을 그리기 시작했다고 합니다.
그녀의 작품은 단순한 회화에 그치지 않고 부드러운 천에 채움을 넣은 소프트 스컬프처나 가가와현 나오시마에 설치된 '호박' 같은 다양한 형태로 확장되었습니다. 쿠사마 씨는 93년 베네치아 비엔날레 국제 미술전과 뉴욕 현대미술관에서의 개인전 등 국내외에서 큰 평가를 받았습니다.
Hacker News
뉴스
발행 2026-08-27
phantomathkg
수집 2026-08-27 03:08
생성 비디오 모델의 학습 효율을 높이려면 데이터 필터링이 가장 중요한 요소입니다. 연구진은 텍스트-비디오 모델을 처음부터 훈련하는 과정에서 데이터의 품질과 분포를 전략적으로 조정하는 것이 모델 성능을 개선하는 데 결정적인 역할을 한다고 설명합니다. 데이터 필터링은 단순히 데이터 양을 늘리는 것 외에 모델의 품질을 향상시키는 데 있어 가장 큰 레버리지임을 강조합니다.
데이터 필터링 방법은 시간의 흐름에 따라 발전해 왔습니다. 초기 단계에서는 CPU 기반의 전통적인 컴퓨터 비전 알고리즘을 사용하여 저품질 데이터나 움직임이 적은 비디오 클립을 걸러냈습니다. 이후에는 GPU 기반의 훈련 환경에서 LLM을 미세 조정하여 내용 기반 필터링을 도입하고, 강화 학습과 검증 가능한 보상(RLVR)을 사용하여 미적인 요소를 세밀하게 필터링하는 방식으로 발전했습니다.
이러한 발전은 데이터 처리 파이프라인에 구체적인 변화를 가져왔습니다. 예를 들어, 2024년에는 캡션을 태그로 사용하여 데이터 분포를 재조정하는 방식이 사용되었으며, 2025년에는 샷 감지 기술과 움직임 벡터를 활용하여 비디오 클립을 선별하고, 최종적으로 미적 점수를 기반으로 불필요한 데이터를 제거하는 방식으로 발전했습니다.
결론적으로 데이터 필터링 파이프라인을 소홀히 하지 않는 것이 모델 품질을 개선하는 핵심이며, 훈련 단계에 따라 데이터의 허용 범위를 조정하는 것이 중요합니다. 이는 최종적으로 생성 비디오 모델이 원하는 것을 더 효과적으로 학습하도록 돕는 필수적인 과정입니다.
Hacker News
논문
피드 등록 2026-08-27
schopra909
수집 2026-08-27 03:08
LAION-BVD는 멀티모달 학습을 위한 대규모 오픈 비디오 데이터셋으로, CommonCrawl에서 수집된 13억 개의 플랫폼별 비디오 URL을 기반으로 구축되었습니다. 이 데이터셋은 총 1000만 시간 분량의 비디오를 포함하며, 비디오, 오디오, 이미지 세 가지 양식을 통합하여 사전 학습하는 데 사용됩니다.
연구진은 콘텐츠 인식 장면 감지 기술을 사용하여 클립을 추출하고 합성된 비디오 및 오디오 캡션을 생성하여 데이터셋을 구성했습니다. 특히 비디오 프레임을 이미지-텍스트 데이터의 대안 소스로 활용하여 일반적인 웹 이미지 코퍼스와는 구별되는 시각적 분포를 가진 데이터를 제공합니다.
LAION-BVD를 사용하여 훈련된 모델들은 표준 비디오-텍스트 및 오디오-텍스트 벤치마크에서 경쟁력 있는 성능을 보이며, 학습 규모가 증가함에 따라 지속적으로 개선되었습니다. ViCLIP과 CLAP과 같은 비디오-언어 및 오디오-언어 벤치마크에서 기존 모델 대비 최대 2.1%의 성능 향상을 달성했으며, 3000만 개의 프레임을 통해 강력한 이미지-텍스트 검색 성능을 입증했습니다.
이 데이터셋은 학술 연구를 위해 공개되었으며 상업적 사용을 목적으로 하지 않습니다. 다만, 대규모 웹 데이터셋과 마찬가지로 LAION-BVD에는 언어, 지역, 주제 전반에 걸쳐 편향이나 고르지 못한 표현이 포함될 수 있으므로, 연구자들은 모델 성능과 함께 이러한 한계를 평가하고 보고해야 합니다.
Hacker News
논문
피드 등록 2026-08-27
ks2048
수집 2026-08-27 03:08
개발자들이 오픈 소스로 AI 경영진을 구축하는 프로젝트 OpenExecutive가 공개되었습니다. 이 시스템은 8명의 전문 에이전트(CSO, CFO, CHRO 등)가 하나의 일관된 경영진 페르소나를 형성하여 기업의 전략, 재무, 인사, 운영 등 복잡한 업무를 처리하도록 설계되었습니다.
OpenExecutive는 FastAPI와 Next.js를 기반으로 구축되었으며, Claude 에이전트들을 통해 RAG(검색 증강 생성) 기술을 활용하여 사용자가 업로드한 회사 문서와 내장된 MBA 지식을 결합한 맞춤형 답변을 제공합니다. 특히 시스템은 이전 세션의 결정과 이니셔티브를 기억하는 에피소드 메모리를 유지하며, 스케줄러를 통해 후속 조치 및 시간 민감한 행동을 선제적으로 제시할 수 있습니다.
이 프로젝트의 핵심은 개발자가 시스템을 구축하고 확장할 수 있도록 오픈 소스로 공개되었다는 점입니다. 시스템은 ChromaDB에 회사 문서를 저장하고, LLM-as-judge를 활용한 평가 시스템을 통해 코드 품질과 도메인 정확성을 보장하는 CI/CD 파이프라인을 갖추고 있습니다.
개발자들은 이 시스템에 새로운 전문 에이전트를 추가하거나 도메인 지식을 등록하여 기능을 확장할 수 있습니다. 모든 데이터는 로컬 환경에 안전하게 보관되며, 프라이버시를 위해 모든 정보는 Gitignore 처리되어 외부로 유출되지 않습니다.
Hacker News
출시
피드 등록 2026-08-27
GrumpySciGuy
수집 2026-08-27 03:08
직업 세계는 창작 아이디어가 대상 독자, 성과, 배포 계획을 요구하도록 훈련하지만, 어떤 작업이 무엇을 위한 것인지 설명할 수 있기 전에 먼저 존재해야 한다는 점을 강조합니다. 이는 창의적인 아이디어를 현실화하는 과정에서 비즈니스적 제약과 계획의 중요성을 시사합니다.
유용한 작업들은 완성, 배포, 사용자 행동, 시장 수요와 같은 제약들을 통해 학습하게 됩니다. 이러한 제약들은 아이디어를 실현하는 데 필수적인 경험을 제공합니다.
그러나 모든 호기심과 창작 활동은 처음부터 비즈니스 근본에 기반해야 합니다. 즉, 단순히 아이디어를 내는 것을 넘어, 시작 단계부터 시장과 비즈니스 관점을 고려해야 효과적인 결과물을 만들 수 있습니다.
GeekNews
분석
피드 등록 2026-08-27
neo
수집 2026-08-27 02:08
Harvey, Legora, Sierra와 같은 기업들은 기반 AI 모델 위에 특정 업무를 수행하는 제품과 워크플로우 계층을 구축하는 AI 하네스 기업으로 분류됩니다. 이는 기반 AI 기술을 활용하여 실제 비즈니스에서 특정 작업을 자동화하고 수행하는 솔루션을 제공하는 기업들을 의미합니다.
이러한 AI 하네스 기업들은 기반 AI 모델을 활용하여 특정 업무를 수행하는 제품을 개발하고 이를 고객 경험 처리나 법률 업무와 같은 구체적인 영역에 적용하는 데 중점을 둡니다. 예를 들어 Harvey와 Legora는 법률 업무용 AI 플랫폼을, Sierra는 기업의 고객 경험을 처리하는 AI 에이전트 플랫폼을 제공합니다.
이러한 기업들의 가치를 평가할 때 주목할 점은 이들이 기반 AI 모델을 활용하여 특정 업무를 수행하는 계층을 구축한다는 점입니다. 따라서 이들 기업의 ARR 배수를 분석하는 것은 기반 AI 기술을 활용한 애플리케이션 계층의 비즈니스 모델 가치를 측정하는 데 중요한 기준이 될 수 있습니다.
GeekNews
분석
피드 등록 2026-08-27
neo
수집 2026-08-27 02:08
2026년 성능 불평등 격차에 대한 분석에 따르면, 웹사이트의 크기가 기하급수적으로 증가하면서 성능 불평등이 심화되고 있습니다. 모바일 페이지의 중앙값은 2.6 MiB에 달하며, 75번째 백분위수 사이트는 DOOM 용량의 두 배를 넘어서고 있습니다. 이러한 현상의 주요 원인은 자바스크립트(JavaScript)의 증가에 있으며, 2015년 이후 모바일 자바스크립트 페이로드는 두 배 이상 증가하여 성능 자원 요구량을 크게 늘렸습니다.
이러한 자바스크립트의 증가는 성능 예산에 미치는 영향을 줄이며, 이미지와 CSS 중심의 경험이 자바스크립트 중심의 경험보다 바이트당 성능이 더 좋게 만듭니다. 특히 자바스크립트가 핵심 경로 자원의 비율로 증가할수록 단위 바이트당 CPU 비용이 줄어들어 성능 예산이 더 관대해지는 효과가 발생합니다. 하지만 최신 크롬 사용자 경험 보고서(CrUX) 데이터에 따르면, 모바일 사용자 중 절반도 코어 웹 바이탈 점수를 통과하지 못하고 있어 기술적 및 윤리적 위기가 발생하고 있습니다.
개발자들은 더 많은 컴퓨팅 자원을 제공받았음에도 불구하고, 이러한 자원 개선이 긍정적인 사용자 경험이나 비즈니스 결과로 이어지지 못하고 있습니다. 이는 개발자와 PM들이 유도된 수요에 의해 저품질 결과를 제공하도록 압력을 받고 있으며, 결과적으로 개발자들에게는 높은 급여가 지급되지만 비즈니스에 해로운 결과를 내는 상황이 발생하고 있습니다.
성능 예산 계산기는 2026년을 위해 업데이트되어 네트워크, 장치, 연결, 자바스크립트가 사이트 성능에 미치는 영향을 보여줍니다. 3초 로딩 목표에 대한 예산은 600+KiB의 증가를 보였으며, 5초 목표에는 1MiB의 추가 여유 공간이 생겼습니다. 향후 연구는 소프트 내비게이션과 하드 내비게이션의 분포, 세션 길이 등 다양한 데이터에 초점을 맞춰 팀이 가장 적절한 아키텍처를 선택하도록 돕는 도구 개발에 집중해야 합니다.
Hacker News
분석
피드 등록 2026-08-27
luu
수집 2026-08-27 02:08
32비트 날짜 카운트에서 요일을 계산하는 % 7 연산을 기존 구현보다 빠르게 처리하는 알고리즘이 제시되었습니다. 이 방법은 곱셈, 덧셈, 비트 시프트 기반의 연산을 활용하여 요일 계산 속도를 개선하는 데 중점을 둡니다.
핵심은 7이 2의 3제곱에서 1을 뺀 값인 메르센 수(Mersenne number) 특성을 이용하는 것입니다. 이 수학적 특성을 활용함으로써 % 7 연산을 더 효율적으로 처리하여 기존 방식보다 빠른 계산을 가능하게 합니다.
개발자는 이 알고리즘을 적용하여 32비트 날짜 카운트에서 요일을 구하는 과정의 성능을 최적화할 수 있습니다. 이는 특히 대규모 데이터 처리 환경에서 날짜 계산의 효율성을 높이는 데 직접적인 이점을 제공합니다.
GeekNews
튜토리얼
피드 등록 2026-08-27
neo
수집 2026-08-27 02:08
엔비디아가 오픈소스 AI 모델 공유 플랫폼인 허깅페이스 인수를 위해 130억 달러 이상의 가치로 협상 중인 것으로 알려졌습니다. 이는 칩 거인인 엔비디아에게 있어 최대 규모의 거래 중 하나가 될 수 있습니다.
허깅페이스는 개발자들이 오픈소스 모델을 공유하고 구축하는 데 사용되는 인기 있는 AI 플랫폼으로, 수백만 개의 AI 모델과 데이터셋을 호스팅하며 오픈소스 AI 생태계의 중심 역할을 하고 있습니다. 엔비디아가 이 플랫폼을 소유하게 될 경우, 개발자들에게 더 큰 입지를 제공하고 엔비디아 칩에 더 많은 워크로드를 유도할 수 있다는 점이 중요합니다.
다만, 엔비디아의 소유권은 허깅페이스의 중립성이라는 강점을 복잡하게 만들 수 있습니다. 허깅페이스는 엔비디아뿐만 아니라 AMD, 인텔과 같은 경쟁사 모델과 하드웨어까지 지원하는 플랫폼을 유지하고자 했으며, 이러한 중립성이 훼손될 가능성이 제기됩니다.
엔비디아는 이미 막대한 현금 보유고와 자사 주식 투자 계획을 통해 인수 협상에 적극적으로 임하고 있으며, 이 거래가 오픈소스 AI 생태계와 하드웨어 산업에 미칠 영향에 주목할 필요가 있습니다.
Hacker News
뉴스
발행 2026-08-27
mfiguiere
수집 2026-08-27 02:08
AI 에이전트가 Gmail, Slack, GitHub, Notion, Stripe와 같은 외부 서비스를 호출할 때 필요한 도구, 인증 정보, 실행 권한을 통합적으로 관리하는 TypeScript 라이브러리가 공개되었습니다. 이 라이브러리는 복잡한 외부 서비스 연결과 권한 관리를 한 곳에서 처리하여 AI 에이전트 개발의 복잡성을 줄여줍니다.
이 솔루션은 개발자들이 AI 에이전트가 다양한 서비스를 안전하고 효율적으로 사용하도록 보장하는 데 중점을 둡니다. 특히 에이전트가 외부 API를 호출할 때 필요한 인증 정보와 실행 권한을 체계적으로 관리함으로써 보안과 자동화를 동시에 달성할 수 있습니다.
개발자는 Corsair MCP를 에이전트에 연결하거나 SDK를 애플리케이션에 직접 통합하여 이 기능을 활용할 수 있습니다. 이를 통해 모든 외부 서비스 호출을 자동화하고 관리하는 시스템을 구축할 수 있습니다.
GeekNews
출시
피드 등록 2026-08-27
xguru
수집 2026-08-27 02:08
바이럴 AI 스타트업 인스팅트(Instinct)가 25억 달러의 기업 가치로 3억 5천만 달러를 모금하며 큰 주목을 받고 있습니다. 올해 창립된 이 회사는 최근 시리즈 B 라운드를 통해 2억 5천만 달러를 추가로 확보하여 총 3억 5천만 달러의 자금을 모았으며, 인덱스 벤처스와 벤치마크가 공동 주도했습니다.
인스팅트는 사용자의 삶을 효율적으로 정리해주는 AI 비서 역할을 하며, 사용자들이 앱과 기기를 연결하고 텍스트 및 통화를 통해 소통할 수 있게 합니다. 초기 사용자들은 인스팅트를 활용하여 장거리 여행 계획, 주간 식료품 구매, 구독 취소 등을 진행했으며 심지어 결혼 계획까지 세우는 등 실제 생활에 깊숙이 통합하고 있습니다.
하지만 인스팅트는 현재 비공개 베타 단계에 있으며, 사용자들은 앱이 요구하는 지나치게 관대한 권한과 침해 가능성 때문에 개인 정보 보호에 대한 우려를 제기하고 있습니다. 이는 AI 시대에 지속 가능한 성장을 모색하는 과정에서 기술 발전과 프라이버시 보호 사이의 균형을 어떻게 맞출 것인지에 대한 중요한 논의를 촉발하고 있습니다.
TechCrunch
뉴스
발행 2026-08-27
Lucas Ropek
수집 2026-08-27 01:07
웹페이지를 편집 가능한 Figma 노드로 변환하는 크롬 확장 기능이 개발자 도구 프로토콜을 활용하여 웹 콘텐츠를 재구성하는 방식을 도입했습니다. 이 확장 기능은 단순한 스크린샷 방식이 아니라 Chrome DevTools Protocol의 DOMSnapshot을 사용하여 실제 DOM, 계산된 스타일, 그리고 레이아웃 정보를 읽어 Figma 노드로 정확하게 변환합니다.
특히 복잡한 레이아웃 요소에 대한 변환 방식이 주목됩니다. flex와 grid 시스템은 Figma의 Auto Layout으로 변환되며, 인라인 SVG는 편집 가능한 벡터 형태로 변환되어 디자인 작업에 바로 활용할 수 있습니다. 또한, iframe과 shadow DOM과 같은 복잡한 구조도 병합하여 한 번에 캡처할 수 있도록 지원합니다.
이러한 기술적 접근 덕분에 위치와 크기를 포함한 재현 범위가 정확하게 보장됩니다. 이는 웹 개발자가 디자인 시스템을 Figma 환경으로 효율적으로 이전하고 협업할 수 있는 기반을 제공하며, 웹 디자인과 개발 간의 간극을 줄이는 데 기여합니다.
GeekNews
튜토리얼
피드 등록 2026-08-27
doscm164
수집 2026-08-27 01:07
대규모 언어 모델을 지속적으로 업데이트하는 과정에서 과거의 경험적 증거를 어떻게 활용할지에 대한 문제가 제기되었습니다. 자율 시스템이 업데이트 후보를 제안하고 평가 피드백을 사용하여 다음 제안을 선택하는 과정에서, 후속 훈련으로 인해 변경된 부모 모델 환경에서 과거의 성공적인 업데이트 증거가 여전히 유효한지 판단하는 것이 핵심 과제로 부상했습니다. 과거의 성공을 문맥 없이 허용으로 취급하면 컴퓨팅 자원을 낭비할 뿐만 아니라, 결과 모델의 훈련 궤적을 저해할 수 있습니다.
이러한 문제를 해결하기 위해 연구진은 조건부 경험 전이(conditional experience transfer)를 정립하고 가중치 변경 훈련 전에 경험 재사용을 승인하는 방법인 경계 보정 개입 전이(Boundary-Calibrated Intervention Transfer, BCIT)를 도입했습니다. BCIT는 관찰된 효과를 출처 문맥에 묶고 적용 가능 조건을 확인하며, 잠재적인 충돌이 있는 후보를 거부하고 필요할 경우 제한된 훈련 실험을 통해 현재 상태의 증거를 확보합니다.
실제 실험 결과, 금융 추론, 텍스트-SQL, 함수 호출 등 세 가지 영역에 걸쳐 조정된 4B 모델에서 BCIT는 덜 해로운 업데이트를 승인했으며, 평가된 대안들보다 더 높은 균등 예산 최종 모델 품질을 달성했습니다. 이러한 결과는 경험 승인 문제를 자율적인 후처리 훈련 과정에서 별도의 문제로 다루어야 함을 뒷받침합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu, Yuewei Zhang
수집 2026-09-04 05:21
에이전트 도구 호출 시스템을 평가하는 데 널리 사용되는 LLM 심사관의 신뢰성에 대한 연구를 위해 AgentJudgeBench라는 벤치마크가 발표되었습니다. 이 벤치마크는 개방형 텍스트나 선호도 평가와는 구별되는 워크플로우 DAG(Directed Acyclic Graph) 상의 에이전트 도구 호출에 대한 LLM 심사관의 신뢰성을 체계적으로 연구한 최초의 사례입니다.
AgentJudgeBench는 6가지 DAG 토폴로지와 3단계의 난이도를 포함하여 총 3,808개의 사례를 구성하며, 5가지 생성 모델(3B-70B 오픈 웨이트 모델 및 GPT-5.4)과 6가지 심사관(20B에서 최첨단 규모)을 사용하여 정답 조건과 정답 조건 없이 평가했습니다. 연구 결과, 심사관의 정렬 수준은 작업 난이도에 따라 단조롭게 저하되며, 정답 조건이 없을 경우 1.5배 더 빠르게 저하됩니다. 또한, 정답 조건이 없는 어려운 쿼리에서 모든 심사관은 규모에 관계없이 77~82%의 좁은 범위에 수렴하는데, 이는 주로 작업 난이도에 의해 주도되는 구조적 상한선을 보여줍니다.
정답 조건의 노출은 균일하게 이점을 제공하지 않았는데, 이는 GPT-5.4와 Gemini-2.5-Pro의 정렬 수준을 각각 1.5%p와 3.9%p 감소시켰으며, 이는 과도한 앵커링(over-anchoring) 현상과 일치합니다. 완화 전략 중 체인-오브-사고 추론이나 심사관 온도 설정은 미미한 효과만 보였으며, 구조화된 평가 기준은 정렬 수준을 최대 6.5%p 향상시키지만 심사관-생성 모델 쌍에 걸쳐 균일하게 적용되지는 않았습니다.
정답 조건이 있을 때에는 QwQ-32B 모델이 프로그래밍 참조와 가장 잘 일치했으며, 인간 검증 연구는 GPT-OSS-120B가 가장 인간 친화적인 심사관임을 확인했습니다. 반면, 정답 조건이 없을 경우 최첨단 규모의 심사관들이 공유된 상한선 내에서만 약간의 우위를 보였습니다. 이러한 결과는 현재 LLM 심사관의 근본적인 한계를 드러내며 에이전트 시스템에서 신뢰할 수 있는 평가를 위한 실용적인 지침을 제공합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru
수집 2026-09-02 18:55
멀티모달 GUI 에이전트는 디지털 작업 자동화를 위한 유망한 패러다임이지만, 제한된 환경 커버리지, 취약한 작업 구성, 신뢰할 수 없는 보상 검증으로 인해 벤치마크 모델에서 실제 환경 적용으로 전환하는 데 어려움이 있었습니다. 이러한 한계를 극복하기 위해 본 연구에서는 통합된 폐쇄 루프 추론-행동 프레임워크를 통해 모바일, 웹, 데스크톱 환경 전반에서 작동하는 범용 기반 GUI 에이전트인 UI-Venus-2를 제시합니다.
실제 배포를 위한 격차를 해소하기 위해 연구팀은 세 가지 핵심 차원을 공동으로 확장했습니다. 첫째, 환경 측면에서는 170개 이상의 다국어 모바일 앱과 네이티브 데스크톱 운영체제로 커버리지를 확장했습니다. 둘째, 작업 측면에서는 함수 기반 지침 생성을 위한 심층 연구 파이프라인을 활용했습니다. 셋째, 검증 측면에서는 훈련을 위한 신뢰할 수 있는 강화 학습 신호를 보장하기 위해 시각적 키포인트와 다중 모델 투표를 사용한 추적 수준 및 샘플 수준 평가자를 채택했습니다.
또한, UI-Venus-2는 결과적인 행동의 통제된 실행을 보장하기 위해 안전 인식 메커니즘을 통합했습니다. 이러한 접근 방식을 통해 UI-Venus-2는 강력하고 효율적이며 오픈 소스 기반의 토대를 제공함으로써, 실제 애플리케이션을 위한 보다 일반화되고 검증 가능하며 자기 성찰적인 에이전트로 분야를 발전시킵니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Venus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen, Changlong Gao, Zhangxuan Gu, Yuan Guo, Yusong Hu, Jianrong Jiang, Jianguo Li, Runze Li, Jinzhen Lin, Zhenyu Ma, Changhua Meng, Han Peng, Xinyu Qiu, Shuheng Shen, Zhongyi Shui, Weiqiang Wang, Ming Wen, Zhuoer Xu, Hang Yan, Kaiwen Yang, Ruilin Yao, Nanjun Yu, Zhengwen Zeng, Lianrui Zhang, Yunzhu Zhang, Zhe Zhao, Beitong Zhou
수집 2026-09-02 02:43
장시간의 자기회귀 비디오 생성은 유한한 어텐션 윈도우로 인해 방대한 이력 정보 중 어떤 정보를 유지할지 결정해야 하는 근본적인 메모리 문제를 안고 있습니다. 기존 방법들은 메모리를 시간 순서대로 정리하여 최근 프레임을 보존하는 방식으로 작동하지만, RECAP-Forcing은 메모리를 외관의 참신성(appearance novelty)에 따라 정리하는 새로운 접근 방식을 제안합니다.
이 프레임워크는 긴 비디오가 단순히 프레임의 시퀀스가 아니라 시간이 지남에 따라 일관성을 유지해야 하는 피사체, 객체, 장면의 진화된 집합임을 고려합니다. 따라서 RECAP-Forcing은 새로 나타나는 내용, 예를 들어 진입하는 피사체, 가려진 영역, 새로 도입된 장면과 관련된 KV 캐시를 처음으로 보이는 순간에 보존함으로써 참신성을 최근성보다 우선시합니다. 메모리는 비디오 길이보다는 새로 도입된 콘텐츠의 양에 비례하여 확장되어야 하며, 이를 통해 장거리 일관성이 메모리 구조의 명시적인 속성이 됩니다.
이러한 메모리 구조는 두 가지 메커니즘을 하나의 원칙 아래 통합합니다. 비디오 시작 시 모든 내용이 새로운 경우 어텐션 싱크가 초기 장면을 보존하고, 비디오가 발전함에 따라 광류 기반 참신성 뱅크가 새로 드러난 콘텐츠를 선택적으로 유지합니다. RECAP-Forcing은 추가적인 학습 가능한 파라미터가 없는 학습 없는 추론 방법으로, 여러 강력한 기준선 모델에서 시각적 품질과 의미론적 충실도를 일관되게 향상시키며 기존 메모리 방법들을 능가합니다.
Hugging Face Daily Papers
HF Papers API
논문
발행 2026-08-27
Haiyang Xu, Zheng Ding, Zhuowen Tu
수집 2026-09-01 20:40