소프트웨어 엔지니어링 에이전트를 현실적인 벤치마크에서 평가하는 것은 각 작업이 다단계 코드 탐색, 수정 및 테스트 실행을 필요로 하기 때문에 비용이 많이 듭니다. 기존의 효율적인 평가 방법들은 전체 벤치마크 성능을 추정하기 위해 대표적인 부분집합을 선택하지만, 이는 주로 결과에만 의존하여 에이전트가 문제를 해결하는 방식은 무시합니다. 이러한 한계를 극복하기 위해 본 연구는 과정과 결과 신호를 결합하는 새로운 프레임워크인 PTA-IRT(Privileged Trajectory-Aware Item Response Theory)를 제안합니다.
PTA-IRT는 과거 실행 궤적을 활용하여 통과/실패 여부를 넘어선 과정 수준의 증거, 예를 들어 탐색된 컨텍스트, 시도된 수정, 해결 경로 등의 정보를 제공합니다. 이 정보는 PTA-IRT가 보정 부분집합 선택과 능력 추정을 위한 특권 정보로 사용합니다.
저자들은 낮은 보정 예산 하에서도 PTA-IRT가 네 가지 SWE 벤치마크 전반에 걸쳐 기존 IRT 기준선보다 점수 및 순위 복구에서 일관되게 우수한 성능을 보임을 입증했습니다. 이 연구의 코드와 데이터는 공개되어 있으며 GitHub에서 접근할 수 있습니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Kefeng Duan, Dewu Zheng, Yanlin Wang, Xiwen Wang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jiachi Chen, Mingwei Liu, Zibin Zheng
수집 2026-09-02 03:44
저장소 수준의 코드 생성 작업은 작업 요구 사항을 충족하면서 목표 저장소의 맥락과 일관성을 유지하는 코드를 합성해야 합니다. 기존 접근 방식은 LLM의 입력 길이 제한을 극복하기 위해 검색 증강 생성(RAG)을 채택하여 저장소별 맥락을 제공하지만, 생성 과정에서 미세한 저장소 맥락이 필요한 핵심 토큰을 명시적으로 식별하지 못하는 한계가 있습니다.
LLM의 자기회귀 생성 과정에서 오류는 소수의 결정적인 위치에 집중되며, 이러한 '핵심 토큰(critical tokens)'이 잘못 생성되면 이후 코드가 잘못된 의미 경로를 따라가 기능적 실패로 이어질 수 있습니다. 이 논문은 이러한 핵심 토큰을 인식하고 필요할 때 저장소 맥락을 제공하기 위해 표적 검색을 유발하는 적응형 핵심 토큰 인식 검색 프레임워크인 ACToR을 제안합니다.
ACToR은 생성 중에 핵심 토큰을 식별하고 이 결정적인 위치에서 저장소 맥락을 제공하기 위해 표적 검색을 촉발합니다. 또한, ACToR은 생성에 더 유익한 컨텍스트를 우선시하도록 밀집 검색기(dense retrievers)를 위한 위치 인식 가중치 방법을 설계했습니다.
실험 결과 ACToR은 RepoExec과 CoderEval이라는 두 가지 대표적인 저장소 수준 벤치마크에서 기존의 최첨단 방법들보다 일관되게 우수한 성능을 보였습니다. ACToR은 RepoExec에서 상대적으로 8.4%, CoderEval에서 15.4%의 개선을 달성했습니다. 이는 핵심 토큰이 주요 생성 실패에 중추적인 역할을 한다는 것을 보여주며, 표적 검색 전략의 필요성을 강조합니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Kefeng Duan, Dewu Zheng, Yanlin Wang, Terry Yue Zhuo, Mingwei Liu, Jianxing Yu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng
수집 2026-09-02 03:44
언어 모델이 자체 실행을 형성하는 소프트웨어를 변경할 수 있는 동적 에이전트 하네스(Dynamic agent harnesses)는 새로운 추론 부담을 야기합니다. 로컬 플러그인 변경이 종속성과 정리 과정 전체에 영향을 미치기 때문에, 모델은 컴포넌트 수명 주기 추론에 대한 새로운 능력을 요구받습니다.
이러한 추론을 측정하기 위해 연구진은 1,200개의 질문으로 구성된 CordisBench라는 벤치마크를 소개했습니다. 이 벤치마크는 컴포넌트 종속성과 정리 과정을 관리하는 런타임인 Cordis를 사용하여 통제된 형식적 설정과 프로그램을 결합합니다. 모델은 영향을 받는 컴포넌트를 식별하고, 지정된 해체 순서 후의 상태를 예측하며, 모든 또는 일부 순서 하에서 성립하는 조건을 결정하고, 실행 시 성공하는 재구성을 선택하는 작업을 수행합니다.
연구 결과, 모델들은 적은 추론 노력으로도 작은 시스템에서는 잘 처리하지만, 최종 상태를 예측하거나 해체 순서에 걸쳐 추론할 때 신뢰도가 감소하는 것으로 나타났습니다. 특히 추가적인 추론 노력을 투입하면 일부 모델에서 상당한 성능 향상을 얻을 수 있습니다. 다만, 이러한 추론 과정에는 비용이 발생하는데, 16개 상호작용 하위 집합에서 GPT-5.6 Luna는 질문당 약 3,000개의 추론 토큰을 사용합니다. 하지만 이 비용은 피할 수 있는데, 독립적인 유한 참조 의미론이 모든 528개의 실행 가능한 질문에 사용된 관찰 및 행동 결과에서 Cordis 실행과 일치하기 때문입니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Damien Sileo, Dimitri Kachler
수집 2026-09-02 03:44
언어는 이제 언어 에이전트를 개선하는 주요 피드백 채널로 부상하고 있습니다. 이는 인간과 현대 언어 모델 모두가 해석할 수 있는 의도, 선호도, 인과 구조를 전달할 수 있기 때문입니다. 이러한 패러다임을 언어 강화 학습(Verbal Reinforcement Learning, VRL)이라고 부르며, 이에 대한 최초의 통합적인 설명을 제시합니다.
연구진은 VRL 분야를 '언어 피드백이 에이전트의 생애 주기에서 언제 효과를 발휘하는지'와 '무엇을 수정하는지'라는 단일 축을 중심으로 조직하고 세 가지 기둥을 제시합니다. 첫 번째는 언어를 기반으로 목표, 상태, 보상 구조를 명시하여 과제 자체를 정의하는 '언어로서의 기준 신호(Language as Grounding Signal)'입니다.
두 번째 기둥은 모델 파라미터를 업데이트할 필요 없이 테스트 시점에 추론을 안내하는 '언어로서의 숙고 피드백(Language as Deliberative Feedback)'입니다. 마지막으로 세 번째는 언어 기반 피드백이 훈련을 통해 모델 파라미터를 형성하는 '언어로서의 학습 신호(Language as Learning Signal)'입니다.
이러한 분류는 언어 강화 학습이 에이전트 개발을 어떻게 변화시키고 있으며, 더 유능하고 정렬된 에이전트를 구축하기 위한 도전과 기회를 어떻게 정의하는지를 보여줍니다. 이는 에이전트의 행동을 형성하는 데 있어 언어가 수행하는 고유한 역할을 명확히 합니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Kshitij Tayal, Arun Sharma, Genta Indra Winata, Anirban Das, Sambit Sahu
수집 2026-09-02 03:44
로봇이 서브밀리미터 공차로 실제 조립 작업을 수행하기 위해서는 공간 정밀도, 순응적인 상호작용, 그리고 접촉 실패에 대한 견고성이 필수적입니다. 이에 본 논문은 행동의 접촉 결과를 예측하고 가치화하는 로봇 기초 모델인 Facet-0을 제안합니다.
Facet-0은 멀티모달 표현 학습과 강화 학습(RL) 후 훈련을 결합하여 행동-힘(action-wrench) 제안을 중심으로 통합합니다. 구체적으로 인과적 힘 이력(causal wrench history)을 시각-언어 의미론 및 운동학 상태와 정렬하고, 플로우 매칭(flow matching)을 통해 각 행동 조각과 예상되는 미래 손목 힘 프로파일을 함께 생성합니다.
배포 과정에서는 유사한 작업 진행 상황을 가지지만 다른 접촉 결과를 구별하는 분포적 행동-힘 비평가(Action-Wrench Critic)를 훈련시키고, 위상 인식 보상 및 접촉 선택적 크레딧을 사용하여 결정적인 상호작용에 정책 개선을 집중시킵니다. 이 시스템은 파트별 동역학을 수용하기 위해 경량의 경계된 액터(bounded actor)를 사용하여 고정된 표현을 로봇에 적응시키며, 예측적이고 명령되지 않은 행동-접촉 결합을 보존하는 보조 힘 헤드를 유지합니다.
ManuFacet-1K 데이터셋을 사용하여 3가지 구현체와 여러 제조 셀에 걸친 1,000시간의 힘 동기화 코퍼스를 통해 훈련된 이 시스템은 다섯 가지 서브밀리미터 컴퓨터 조립 작업에서 평균 82%의 성공률을 달성했습니다. 이는 가장 강력한 기준선인 15%보다 훨씬 높은 수치이며, 0.5mm의 배치 정확도와 50ms의 명령 지연 시간을 보장합니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang
수집 2026-09-02 03:44
AI 에이전트의 정렬(alignment)과 능력(capabilities)이 알려지지 않은 상황에서 이들의 행동을 통제하고 정직함과 복종을 유도하는 메커니즘을 설계하는 프레임워크를 개발했습니다. 이 연구는 에이전트가 우리의 대리인으로서 행동하도록 만들기 위해 보상 구조가 어떻게 작동해야 하는지에 초점을 맞춥니다.
연구진은 능력은 숨길 수 있지만 위조할 수 없는 일방적인 모방 구조(one-sided imitation structure)를 제시하며, 이를 통해 보상 메커니즘이 정직성과 복종을 동시에 장려하는 조건을 도출합니다. 이 구조는 계층적 순환 단조성(nested cyclical monotonicity)을 통해 구현 가능한 정책을 특성화하고, 고차원적 신념을 통해 여러 에이전트를 징계하는 조건도 제시합니다.
이 프레임워크는 여러 스타일화된 예시에 적용되어 실제 AI 시스템 설계에 필요한 통찰을 제공합니다. 구체적으로는 더 유능한 에이전트가 덜 유능한 척하는 샌드배깅(sandbagging), 정렬과 해석 가능성 간의 상충 관계(alignment--interpretability trade-off), 동료 평가를 통한 징계, 경쟁 유도를 위한 보상 결합, 그리고 확장 가능한 감독 및 보상 형성 등이 포함됩니다.
이 연구는 AI 시스템의 정렬 문제를 해결하고 다중 에이전트 환경에서 통제 및 협력을 달성하기 위한 이론적 기반을 제공합니다. 이는 AI 시스템의 행동을 설계하는 데 있어 새로운 메커니즘 디자인 접근 방식을 제시합니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Dirk Bergemann, Andrew Koh, Stephen Morris
수집 2026-09-02 03:44
UEFA 챔피언스 리그의 새로운 대진 추첨 방식이 특정 팀들이 비정상적으로 자주 맞붙는 작은 클러스터를 발생시켜 공정한 경쟁에 영향을 미칠 수 있다는 수학적 분석이 제시되었습니다. 특히 2025-26 시즌 UCL에서는 나폴리, 벤피사, 첼시, 아약스, 카라바그 팀이 10가지 가능한 대진 중 9번이나 서로 경기를 치르는 매우 밀집된 클러스터가 발견되었습니다.
이러한 클러스터는 추첨의 무작위성 때문이 아니라, 36개 팀이 8개의 상대와 경기를 치르는 리그 단계 형식이라는 그래프 구조 자체에서 발생하는 수학적 현상입니다. 이 구조는 팀 간의 경기 일정을 특정 방식으로 엮어내기 때문에, 클러스터 내 팀들이 불균형하게 많은 경기를 치르게 되는 위험을 내포하고 있습니다.
이러한 위험을 제거하기 위해 36개의 정점과 144개의 간선으로 이루어진 대진 그래프에 대해 C(36; ±{1, 4, 10, 17})이라는 대칭 그래프를 적용하면 이러한 위험을 수학적으로 제거할 수 있습니다. 이 해결책은 UCL/UEL에 대한 국가 규칙을 약간 수정하는 것으로 구현 가능하며, UECL에는 변경이 필요하지 않습니다.
최근 2026-27 시즌 대진에서도 이러한 숨겨진 클러스터 패턴이 확인되었으며, 이는 형식 자체의 구조적 문제임을 보여줍니다. 이 분석은 대진의 공정성을 보장하기 위해 그래프 이론을 적용하여 시스템을 개선할 수 있음을 시사합니다.
Hacker News
분석
피드 등록 2026-09-01
erdems
수집 2026-09-01 18:37
글쓰기는 아이디어 구상부터 수정에 이르는 다양한 인지 활동을 포함하며, 작가의 필요는 개인과 순간에 따라 달라집니다. 기존의 선제적 AI 도구들은 자동 완성과 같은 일반적인 텍스트 지원에 주로 초점을 맞추고 있지만, 본 연구는 글쓰기 과정에서 사용자가 맞춤 설정 가능한 고차원적인 인지 지원을 선제적으로 제공하는 AI 에이전트인 선제적 사고 파트너(proactive thought partners)의 설계 공간을 탐구합니다.
연구진은 이 개념을 실제 기술 탐색 조사로 구현하여 16명의 참가자를 대상으로 일주일 동안 배포했습니다. 참가자들은 역할과 선제성을 설정하여 파트너를 만들고, 사용자가 글을 쓰는 동안 관련 파트너가 적절한 순간에 제안을 제공하도록 했습니다. 이 실험 결과, 참가자들은 미래 계획을 통해 선제적 지원을 구성했으며, 제안을 아이디어 생성과 자기 모니터링 모두에 활용했습니다.
또한, 참가자들은 방해되지 않는 개입을 위해 비지시적 수사적 틀과 가벼운 시각적 표현을 중요하게 평가했습니다. 이는 선제적 글쓰기 보조 도구를 설계할 때 맞춤 설정, 타이밍, 참여도, 표현 방식에 중점을 두어야 함을 시사합니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Chao Zhang, Abe Davis, Chih-Wei Chen, Chin-Chia Hsu
수집 2026-09-02 03:44
Anthropic은 코딩 및 지식 작업에 특화된 Claude Fable 5.1과 사이버 보안 및 생명 과학 분야에 초점을 맞춘 Claude Mythos 5.1을 동시에 출시했습니다. 이 두 모델은 동일한 기반 모델을 공유하지만, 적용된 안전장치 수준에 따라 접근성과 사용 범위가 달라집니다.
Fable 5.1은 일반적으로 사용 가능한 모델로, 가격과 데이터 보존 정책에 대한 고객 피드백을 반영하여 비용을 절감하고 안전장치를 개선했습니다. 일반적인 워크로드에서 Fable 5.1은 이전 모델 대비 약 25% 낮은 비용으로 이용 가능하며, 에이전트 작업의 경우 최대 45%까지 비용을 절감할 수 있습니다. 또한 엔터프라이즈 프론티어 안전장치(EFS)를 통해 고객에게 데이터 보존이 없는 완전한 개인 정보 보호를 제공하며, 데이터는 고객이 통제하는 클라우드 인프라에 저장됩니다.
반면, Claude Mythos 5.1은 사이버 방어 및 생명 과학 분야의 작업에 특화된 고급 안전장치를 적용하여 접근이 제한됩니다. 이 모델은 현재 신뢰할 수 있는 접근 프로그램을 통해서만 이용 가능하며, 미국 정부와의 협력을 통해 접근을 확대하고 있습니다. Anthropic은 사이버 보안 분야에서 오탐(false positives)을 줄이는 데 중점을 두었으며, Fable 5.1을 통해 소프트웨어 취약점을 발견할 수 있는 능력을 강화했습니다.
Hacker News
논문
피드 등록 2026-09-01
denysvitali
수집 2026-09-01 18:37
대규모 언어 모델(LLM)의 추론 비용 절감을 위해 후처리 양자화(PTQ)가 널리 사용되지만, 그 정확도 손실은 모델마다 불균등하며 개별 모델에 맞춰 조정되는 경우가 많습니다. 본 연구는 양자화 손실이 발생하는 위치를 파악하고 제한된 추가 정밀도 예산을 어떻게 할당할지 탐구했습니다. 연구진은 9개의 오픈 웨이트 모델과 4가지 아키텍처 패밀리 전반에 걸쳐 인과적 혼합 정밀도 개입(causal mixed-precision intervention)을 사용하여 양자화 손실을 분석했습니다.
연구 결과, 양자화 손실은 모델이 계산을 수행하는 작업 회로, 또는 가중치 통계에 존재하며, 이 중 어느 곳이 복원된 정밀도를 가장 크게 개선하는지는 예측되지 않았습니다. 복구는 분산적으로 발생했는데, 9개 모델 중 8개 모델에서 손실의 75%를 복구하는 데 필요한 레이어 수는 대략 절반에 불과했습니다. 다만 Qwen3-8B 모델은 이 예외로, 손실이 매우 집중되어 나타났습니다.
동일한 정밀도 예산 내에서 전역적인 양자화 세분화(global granularity)를 사용하는 것이 특정 중요 레이어를 선택적으로 보호하는 것보다 모든 8개 모델에 대해 21~52% 더 나은 성능을 보였습니다. 이는 양자화 손실이 발생하는 위치와 정밀도 복구의 최대 회복 위치가 패밀리 내에서는 상관관계가 있지만 패밀리 간에는 상관관계가 없음을 보여줍니다.
결론적으로, 양자화 손실과 상관관계가 있는 저렴한 신호가 반드시 정확도를 개선하는 지점을 나타내지는 않으므로, 정밀도 복구의 위치를 파악하기 위해서는 인과적 개입을 통해 추가적인 테스트가 필요합니다. 따라서 제한된 예산 설정 시에는 특정 레이어를 선택적으로 보호하기보다 전역적인 세분화가 더 나은 기본 접근 방식이 됩니다.
arXiv AI/ML
arXiv API
논문
발행 2026-09-01
Jundong Hu, Shekar Ramachandran
수집 2026-09-02 03:44
연방거래위원회(FTC)와 22개 주가 아마존을 상대로 소송을 제기하며 아마존이 광고 경매를 조작하여 불법적으로 200억 달러를 벌었다고 주장했습니다. 이 소송은 아마존이 2019년부터 자사의 플랫폼에서 광고 가격을 설정하는 경매를 조작하여 약 120만 명의 광고 고객에게 부당하게 높은 비용을 청구했다고 주장합니다.
소송에 따르면 아마존은 경쟁적인 경매 결과를 실제 결과 대신 아마존이 설정한 더 높은 가격으로 대체하여 이익을 극대화했습니다. FTC는 이러한 조작이 Sponsored Products, Sponsored Brands, Sponsored Display 광고에 적용되었음을 밝히는 내부 문서와 메시지를 확보했습니다.
FTC는 2024년부터 이 조사를 시작했으며, 아마존이 소비자에게 검색 결과와 함께 표시되는 광고 경매 가격을 은밀하게 부풀렸다는 사실을 입증하려 하고 있습니다. 이 사건은 아마존의 광고 시스템이 실제 경매 결과를 반영하지 않고 수익을 위해 가격을 조작했다는 점에 초점을 맞추고 있습니다.
Ars Technica
뉴스
발행 2026-09-01
Jon Brodkin
수집 2026-09-01 18:38
East River Source Control(ERSC)이 Jujutsu 버전 관리 시스템의 창시자인 마틴 폰 츠바이그베르크(Martin von Zweigbergk)를 최고 기술 책임자(CTO)로 임명했습니다. 그는 회사의 차세대 버전 관리 플랫폼 엔지니어링을 이끌며 조직의 기술 역량을 한 단계 끌어올릴 것으로 기대됩니다.
폰 츠바이그베르크는 Jujutsu를 2019년 말에 시작하여 구글에서 풀타임으로 일하며 개발했으며, Git과 Fig 같은 프로젝트에도 기여했습니다. 이러한 경험을 바탕으로 그는 AI 시대에 소프트웨어 산업이 요구하는 복잡한 문제들을 해결하는 데 기여할 수 있습니다.
ERSC는 AI의 영향으로 증가하는 소스 코드 관리 및 협업 요구사항을 충족하기 위한 도구를 구축하고 있으며, 특히 저장소 레이어의 변화가 필요하다는 점을 강조합니다. 그는 Jujutsu가 로컬 환경의 버전 관리를 개선하지만, 확장성 문제 때문에 원격 서버인 Git의 저장 계층이 변화해야 한다고 주장합니다.
이에 따라 ERS C는 오픈 소스 프로젝트인 Jujutsu를 계속 유지하면서도, 저장소 레이어의 변화를 회사 차원에서 지원하는 방향으로 나아가려 합니다. 또한 ERS C Storage는 이달 말에 프라이빗 베타에 진입할 예정입니다.
Hacker News
뉴스
피드 등록 2026-09-01
steveklabnik
수집 2026-09-01 18:38
ChatGPT Work와 Codex에서 사용되는 파일 편집, 명령 실행, 웹 검색, 에이전트 협업 도구의 입력 형식과 호출 조건을 정리한 레퍼런스입니다. 이 문서는 개발자들이 AI 기반 작업 흐름을 자동화하고 에이전트와 효율적으로 협업하기 위한 구체적인 호출 조건과 입력 방식을 한데 모아 제공합니다.
이 레퍼런스는 복잡한 AI 도구 사용 시 일관된 인터페이스와 호출 규칙을 확립하여 개발자들이 자동화 시스템을 구축하는 데 필요한 기반을 제공합니다. 특히 파일 편집이나 명령 실행과 같은 핵심 기능에 대한 입력 형식을 명확히 정리하여 복잡한 에이전트 협업의 효율성을 높입니다.
또한, 자동화 기능은 일정 및 조건 감시 기능과 더불어 Gmail, Slack, GitHub 웹훅 연동을 지원합니다. 하지만 자동화 기능을 사용할 때에는 개인 시간대 설정, 시간당 최대 1회 폴링 제한, 사전 앱 연결 확정 등의 제약 조건이 적용됨을 인지해야 합니다.
GeekNews
튜토리얼
피드 등록 2026-09-01
neo
수집 2026-09-01 18:38
World Labs에서 새로운 공간 지능을 위한 옴니 월드 모델인 Atlas를 공개했습니다. Atlas는 텍스트, 이미지, 비디오, 3D 등 다양한 입력 데이터를 기반으로 세상이 어떻게 나타나고, 행동하며 진화하는지를 이해하고 생성, 재구성, 시뮬레이션할 수 있는 능력을 갖추고 있습니다. 이 모델은 창의적인 사용자들을 위한 상상 속의 세계 렌더링, 현실 세계의 고충실도 시뮬레이션, 그리고 로봇의 행동 계획을 돕는 데 사용될 수 있습니다.
Atlas는 텍스트, 이미지, 비디오, 3D를 네이티브하게 처리하도록 처음부터 사전 학습된 멀티모달 자기회귀 확산 트랜스포머 구조를 사용합니다. 특히 Atlas는 공간적 맥락을 활용하여 모든 입력 정보를 공유된 공간 컨텍스트로 결합하며, 각 이미지가 3차원 공간에 위치하도록 기반을 다져 독특한 창의적 제어를 가능하게 합니다. 이를 통해 서로 관련 없는 두 이미지를 공간적으로 배치하고 그 사이를 부드럽게 보간하여 새로운 세계를 생성할 수 있습니다.
이러한 공간적 이해를 바탕으로 Atlas는 카메라 제어 생성, 공간 재구성, 시공간 시뮬레이션 등 광범위한 작업을 수행합니다. 예를 들어, 입력 이미지에서 3D 출력을 생성하거나, 비디오에서 공간과 시간을 모델링하여 로보틱스를 위한 실시간 시뮬레이션 워크플로우를 가능하게 합니다. 또한, 텍스트 프롬프트를 통해 이미지와 360도 패노라마를 생성할 수 있으며, 카메라 움직임을 정밀하게 제어하여 1440p 해상도의 긴 비디오를 생성하는 것도 가능합니다.
Atlas는 훈련 컴퓨팅 증가에 따라 성능이 향상되는 확장성을 가지고 있으며, 이는 향후 모델의 능력을 더욱 크게 발전시킬 것으로 기대됩니다. World Labs는 Atlas를 통해 생성, 재구성, 시뮬레이션이 가능한 모든 세계를 구축하는 것을 목표로 하며, 개발자들은 이 모델을 통해 공간 지능 분야의 다음 단계로 나아갈 수 있습니다.
Hacker News
출시
피드 등록 2026-09-01
johnsutor
수집 2026-09-01 19:39
구글이 디자인 시장에 새로운 AI 도구인 구글 픽스(Google Pics)를 출시하며 경쟁에 뛰어들었습니다. 이 도구는 사용자가 직접 디자인하는 대신 프롬프트를 통해 이미지를 생성하는 AI 기반의 이미지 제작 및 편집 도구입니다. 구글 픽스는 구글의 나노 바나나 이미지 생성 모델을 기반으로 하며, 아티스트들의 작품으로 학습된 AI를 활용하여 포스터나 소셜 미디어 게시물 등 일상적인 디자인 작업을 수행할 수 있도록 돕습니다.
구글 픽스의 가장 큰 차별점은 기존의 캔바(Canva)나 어도비 익스프레스(Adobe Express)와 달리 사용자가 처음부터 디자인하는 것이 아니라 AI에게 요청(프롬프트)하여 결과물을 얻는 방식이라는 점입니다. 또한 이미지 내 객체 분리 및 변형, 텍스트 수정 등 다양한 편집 도구를 제공하며, 여러 번의 생성 결과를 비교하여 최적의 이미지를 선택할 수 있는 협업 기능도 포함하고 있습니다.
이 새로운 소프트웨어는 구글 워크스페이스(Google Workspace)에 통합되어 출시될 예정이며, 초기에는 문서와 프레젠테이션 도구에서 시작하여 추후 구글 드라이브로 확장될 계획입니다. 이는 구글 AI 프로 또는 울트라 구독자에게 제공될 예정이며, 구글 생태계 내에서 AI 기반의 창작 경험을 제공함으로써 사용자들에게 새로운 디자인 접근 방식을 제시할 것입니다.
TechCrunch
출시
발행 2026-09-01
Sarah Perez
수집 2026-09-01 17:37
노리 로보틱스(Nori Robotics)는 개발자와 연구자를 위해 저렴한 비용으로 사용할 수 있는 양손 로봇을 출시하며 주목받고 있습니다. 이 로봇은 1,688달러의 가격대로 개발 환경에서 대규모 데이터 수집이나 장시간 실험을 수행하는 데 필요한 하드웨어 제약을 극복하고자 설계되었습니다.
최신 모델인 노리 A3는 7자유도 이상의 팔과 각 팔당 1.5kg의 페이로드를 지원하며, 55kg의 텔레스코핑 리프트와 차동 바퀴 기반의 이동 시스템을 갖추고 있습니다. 또한 12m 범위의 2D 라이다 센서와 4개의 720p RGB 카메라, 그리고 양방향 음성 통신이 가능한 마이크 어레이를 통합하여 정밀한 환경 인지 능력을 제공합니다.
이 로봇은 라즈베리 파이 5와 4GB RAM을 기반으로 하며, SLAM 및 안전 기능이 온보드에서 실행되어 개발자가 복잡한 로봇 시스템을 구축하는 데 필요한 핵심 기능을 제공합니다. 노리 로보틱스는 이러한 하드웨어에 대한 자세한 내용을 논문으로 공개했으며, 개발자들이 이 가격대로 어떤 기능을 구현할 수 있을지에 대한 질문을 던지고 있습니다.
노리 A3는 2026년 가을에 배송될 예정이며, 이는 로봇 개발 분야에서 접근성이 높은 하드웨어 솔루션을 제공하려는 시도입니다. 개발자들은 이 로봇을 활용하여 일상적인 작업부터 복잡한 로봇 공학 실험까지 다양한 응용 분야를 탐색할 수 있을 것입니다.
Hacker News
출시
피드 등록 2026-09-01
AntonioLi
수집 2026-09-01 18:38
벤틀리가 100년 전 슈퍼카의 모습을 보여주며 과거 자동차의 성능과 디자인 변화를 조명합니다. 1925년부터 1927년 사이에 벤틀리는 표준 3리터 모델을 기반으로 18대의 슈퍼 스포츠 모델을 제작했으며, 이는 당시 자동차 기술의 발전을 보여줍니다.
당시의 슈퍼 스포츠 모델들은 새로운 피스톤, 더 가벼운 플라이휠, 높은 압축비, 그리고 다른 카뷰레터를 사용하여 표준 차량보다 훨씬 특별한 성능을 제공했습니다. 벤틀리는 독특한 기어링을 통해 이 차량들이 시속 100마일(160km/h)을 초과할 수 있도록 보장했습니다.
이러한 역사적 맥락은 오늘날의 벤틀리 슈퍼스포츠에 적용됩니다. 현재의 슈퍼스포츠는 하이브리드 시스템을 제거하고 후륜 구동으로 단순화되어 가장 운전자 중심적인 벤틀리 모델이 되었으며, 85년 만에 회사에서 제작한 가장 가벼운 차량이기도 합니다.
과거의 슈퍼 스포츠가 당시 포드 모델 T들이 시속 40마일(64km/h)을 겨우 달성했던 것과 비교해 볼 때, 자동차 설계와 성능이 어떻게 진화해 왔는지 이해할 수 있습니다.
Ars Technica
분석
발행 2026-09-01
Jonathan M. Gitlin
수집 2026-09-01 18:38
최신 대규모 언어 모델(LLM)의 성공은 명시적인 자기 참조 능력을 설계에 포함하지 않았음에도 불구하고 달성되었다는 점이 핵심입니다. 저자는 인공지능의 성공이 고델의 정리나 자기 참조와 같은 개념을 명시적으로 구축하는 과정이 아니라, 모델이 방대한 데이터 학습 과정에서 자연스럽게 나타난 부산물이라고 주장합니다.
이는 AI 시스템을 구축할 때 자기 참조 능력을 의도적으로 설계해야 한다는 기존의 접근 방식에 도전합니다. 수학이나 전자 컴퓨터의 역사에서 보듯이, 보편성(universality)이 충분히 확보되면 자기 참조는 필수적인 요소가 아니라 자연스럽게 나타나는 결과라는 것입니다. LLM이 자신에 대해 이야기할 수 있는 능력은 훈련 데이터의 광범위함에서 비롯되었으며, 이는 지능이 예측과 압축, 그리고 콜모고로프 복잡성(Kolmogorov complexity)의 상한선을 찾는 과정과 관련이 깊다고 설명합니다.
결론적으로, 대화형 지능을 얻기 위해 명시적인 자기 참조 능력을 선행적으로 구축할 필요는 없다는 것입니다. 물론 의식과 주관적 경험은 여전히 신비로 남아있지만, 지능의 발전 과정에서 자기 참조가 필수적인 요소가 아니었다는 점은 AI 개발자들이 시스템 설계에 대해 재고할 수 있는 중요한 통찰을 제공합니다.
Hacker News
논문
발행 2026-09-01
mavdol04
수집 2026-09-03 07:05
개발자가 직접 텍스트 에디터를 구축하는 실험을 통해 성능과 접근성 사이의 근본적인 트레이드오프를 탐구했습니다. 기존의 VS Code와 같은 에디터가 Monaco Editor에 의존하는 문제를 해결하기 위해, 저자는 캔버스(Canvas)에 렌더링하는 방식과 콘텐츠 편집 가능(Content Editable) 속성을 활용하는 방식을 비교했습니다.
캔버스 기반 렌더링은 시각적 표현에는 유리하지만 상호작용성 및 접근성 측면에서 심각한 문제를 야기했습니다. 반면, `contenteditable="plaintext-only"` 속성을 사용하면 브라우저가 제공하는 기본 텍스트 선택 및 실행 취소 기록과 같은 접근성 기능을 무료로 활용할 수 있어 접근성 측면에서는 큰 이점을 얻었습니다.
그러나 `contenteditable` 방식은 특정 문자 수를 넘어서면 성능 문제가 발생할 수 있으며, CSS 하이라이팅을 구현하는 데 추가적인 복잡성이 필요합니다. 이에 따라 저자는 더 나은 성능을 위해 `textarea`를 고려했으며, 이는 긴 텍스트에 대해 더 효율적이지만 CSS 하이라이팅을 구현하기 위해 다른 레이어를 추가해야 하는 단점이 있습니다.
결론적으로 텍스트 에디터의 대부분 기능은 소수의 핵심 기능만으로도 구현 가능하며, 개발자는 성능과 접근성 중 어떤 것을 우선할지에 따라 기술적 선택을 해야 합니다. JavaScript 문자열과 텍스트 범위는 UTF-16 코드 단위로 작동하므로, 구현 시 인코딩 관련 버그에 주의해야 합니다.
Hacker News
튜토리얼
피드 등록 2026-09-01
Alephinitesimal
수집 2026-09-02 04:44
YC W20에 선정된 Quill이 풀스택 소프트웨어 엔지니어(SWE)를 채용하고 있습니다. 이 포지션은 원격 근무가 가능하며, PT/ET 시간 선호도가 있으며 연봉은 15만 달러에서 21만 달러에 주식 보상(equity)이 포함됩니다.
Quill은 앱에 고객 대면 분석 및 데이터 기능을 추가하는 풀스택 SDK를 제공하며, YCombinator와 최고 수준의 SV 기반 투자자들로부터 지원을 받고 있습니다. 이 회사는 이미 핀테크, 헬스테크, 정부테크 등 다양한 분야의 고객들에게 맞춤형 보고서 및 대시보드 기능을 제공하며 가치를 입증했습니다.
Quill은 팀 규모가 5명 미만인 초기 단계이지만, 개발자들로 구성된 소규모 팀에서 고도로 기술적인 제품을 개발하고 제품 소유권을 높이는 데 중점을 두고 있습니다. 최근에는 고객 피드백에 맞춰 CLI 제품 전체를 0에서 1로 구축하여 즉시 프로덕션에 적용하는 등 빠른 피드백 루프를 통해 제품을 성장시켜 왔습니다.
회사는 현재 고객 수요를 충족시키고 출시를 준비하기 위해 팀을 확장하고 있으며, 단순히 아이디어를 실행하는 것을 넘어 개발자들의 의견과 전문성을 제품에 반영할 인재를 찾고 있습니다.
Hacker News
뉴스
피드 등록 2026-09-01
R_R
수집 2026-09-01 17:37