Profit based evaluation of machine learning for nitrogen recommendations in winter wheat

겨울 밀의 질소량은 가격과 기상 조건이 미정된 상태에서 계절 전에 결정됩니다. 표준 영국 권고 사항은 가격 변화에 반응하지 않지만, 최근 가격 변동은 가장 수익성 높은 질소량을 헥타르당 수십 킬로그램으로 변화시켰습니다. 따라서 많은 개발자들이 질소 추천에 머신러닝을 적용하지만, 이는 보통 예측 정확도로 평가되며 정확한 예측만으로는 추천된 비율이 더 수익성이 높아지지 않습니다.

연구진은 질소 조언을 측정된 수확 반응 곡선에서 포기하는 이익으로 직접 점수화하는 방법을 제시합니다. 이들은 두 차례의 장기 영국 실험에서 얻은 892개의 곡선을 기반으로 질소 대 곡물 가격 비율을 조정하여 모든 가격 시나리오를 포괄하는 테스트 벤치를 구축했습니다. 이 벤치에서 머신러닝 모델은 예측에 실패하며, 농장 허용 오차 범위 내에서 최적의 비율을 복구하지 못하고 기준 노이즈 역시 이를 불가능하게 보여줍니다.

일반적인 가격에서 모든 모델은 수익 측면에서 표준 조언에 뒤처지며, 실제 이익은 다른 곳에서 발생합니다. 모델이 수익 손실을 4분의 1로 줄이는 단순한 보정 단계를 적용하면 손실이 감소하며, 더 나은 모델이나 추가 특징은 이익을 추가로 제공하지 못합니다. 심지어 재학습 없이 동일한 동결 보정은 두 번째 부지에서 손실을 43% 줄였습니다.

결론적으로, 표준 조언에 더하여 감쇠 보정을 적용하는 하이브리드 방식은 편향을 제거하고 드문 대규모 손실을 정리합니다. 이 방법은 또한 현재 탄소 가격과 비슷한 비용으로 배출량 감축 가격을 책정할 수 있게 합니다. 따라서 머신러닝은 표준 조언을 대체하는 것이 아니라 수익 점수가 적용된 보정으로 기능합니다.

Hollywood's Video Game Era Is Here. Will It Be Any Good?

할리우드의 비디오 게임 시대가 도래하면서 영상 콘텐츠의 원천이 변화하고 있으며, 이는 영화의 질적 향상으로 이어질 수 있다는 분석이 제기되고 있습니다. 과거 슈퍼 마리오 브라더스 영화가 비판받았던 사례와 달리, 최근에는 게임 프랜차이즈를 기반으로 한 작품들이 대중의 기대를 충족시키고 있으며, 이는 마블 시네마틱 유니버스(MCU)가 보여준 것과는 다른 새로운 스토리텔링 잠재력을 보여줍니다.

이러한 변화의 배경에는 게임 IP의 거대한 팬덤과 시장 규모가 있습니다. 미국인들은 물리적인 만화책에 20억 달러를 지출하는 것에 비해 비디오 게임에 연간 약 600억 달러를 소비하며, 이는 게임이 훨씬 더 광범위한 팬층을 확보하고 있음을 의미합니다. 이러한 게임 기반 프로젝트들은 단순히 흥행을 넘어, 성인 관객을 위한 고품질의 스토리텔링과 블록버스터급 경험을 제공할 수 있는 잠재력을 가지고 있습니다.

현재 많은 영화 제작자들이 레지던트 이블, 엘든 링, 배틀필드, 콜 오브 듀티와 같은 대형 게임 프랜차이즈를 각색하며 참여하고 있습니다. 특히 마크플라이어(Markiplier)가 인디 게임을 영화화하여 5,100만 달러의 흥행을 기록한 사례는 게임과 소셜 미디어, 극장 경험이 결합될 때 강력한 상업적 성공을 거둘 수 있음을 입증합니다.

결론적으로, 비디오 게임은 기존의 미디어 콘텐츠가 제공하지 못했던 예술적 깊이와 대중적 매력을 결합하여 새로운 시대의 엔터테인먼트를 창출할 기회를 제공하고 있습니다. 앞으로의 문화 트렌드가 비디오 게임을 중심으로 형성될 경우, 이는 성인 관객을 위한 고품질의 영화 제작과 활발한 엔터테인먼트 산업 성장의 기회가 될 것입니다.

Common Geodesics Do Not Guarantee Fisher Consistency of the Structured SVM: Minimal Counterexamples and a Tree-Metric Classification

구조화된 SVM의 피셔 일관성(Fisher consistency)을 달성하기 위한 필요 조건은 모든 출력 트리플이 공통의 측지점(geodesic point)을 갖는 거리(metric)여야 한다는 것입니다. 그러나 이 조건만으로는 표준적인 좌표별 argmax 디코더가 충분하지 않음을 보였습니다.

연구진은 이 조건이 좌표별 argmax 디코더에 대해 충분하지 않음을 입증하며, 네 출력 유닛 별(unit star)에서 최적의 점수 벡터가 존재하지만 그 극대화 지점들이 모두 베이즈(Bayes)가 아닌 경우를 제시했습니다. 또한, 출력 공간이 정점 집합인 트리 측정치(tree metrics)에 대해 argmax 일관성은 해당 트리가 경로(path)일 때만 성립함을 분류했습니다.

공통 측지 조건이 만족되는 거리들 중에서 전체 지원(full-support)에 대한 반례를 찾기 위해서는 다섯 개의 출력이 필요하며, $K_{2,3}$가 무한한 $K_{m,n}$ 가족 중 가장 작은 원소입니다. 이 외에도 세차원 해밍 큐브에 대한 전체 지원 반례를 제시했습니다.

이러한 반례들은 디코더의 구체적인 격차를 드러내는데, 다면체 설정에서 임베딩은 보정된 링크의 존재를 보장할 수 있지만, 모든 대리 위험 최소화(surrogate-risk minimizer)에 대해 규정된 argmax 링크를 검증하지는 못한다는 점을 보여줍니다.

Launching Route 53 Files

AWS의 Route 53 Files 기능이 발표되어 AWS 컴퓨팅 리소스와 Amazon의 고가용성 데이터베이스를 파일 시스템으로 연결하는 새로운 방식이 도입되었습니다. 이 시스템은 기존의 DNS 레코드 관리를 위해 AWS 관리 콘솔, Route 53 API, 또는 기타 도구를 사용하는 대신 표준 UNIX 소프트웨어를 사용하여 DNS 레코드를 편집할 수 있게 하여 작업 흐름을 간소화합니다.

Route 53 Files는 호스팅 영역을 파일 시스템으로 접근 가능하게 만들어 여러 컴퓨팅 리소스에서 공유 접근을 가능하게 하며, 팀 간에 DNS 영역을 중복 없이 공유할 수 있게 합니다. 이로써 사용자는 Route 53 콘솔이나 API에 의존하는 대신, Amazon EC2 인스턴스, Amazon ECS, Amazon EKS, AWS Lambda 함수 등 모든 AWS 컴퓨팅 환경에서 네이티브 파일 시스템으로 도메인 레코드를 관리할 수 있습니다.

파일 시스템은 DNS 레코드 세트를 파일로, 레코드 이름을 디렉토리로 표현하며 NFS v4.1+ 작업을 지원하고, 별칭 레코드는 심볼릭 링크로 제공됩니다. 데이터 접근 시 지연 시간은 파일 저장 후 라이브 DNS에 반영되는 데 약 90초가 소요되며, 다른 경로에서 발생한 변경 사항이 마운트된 파일 시스템에 반영되는 데는 최대 6분이 걸릴 수 있습니다. 또한, 여러 컴퓨팅 리소스의 동시 접근을 지원하며 마지막 쓰기 승리(last-write-wins) 충돌 해결 방식을 사용하여 AI 에이전트나 온콜 엔지니어 간의 DNS 변경 사항 충돌을 관리할 수 있습니다.

Hold up, there’s a new Twitter in town

새로운 소셜 네트워크인 트위터나우(Twitter.now)가 출시되어 사용자 신뢰와 투명성을 중심으로 운영되는 새로운 서비스를 제공하고 있습니다. 이 서비스는 전(前) 트위터의 브랜드를 재현하려는 것이 아니라, 사용자 선택과 신뢰 신호를 기반으로 콘텐츠를 제공하는 데 중점을 두고 있습니다.

이 플랫폼은 AI 시스템인 VERA를 사용하여 게시물을 평가하고, 주장의 출처와 맥락을 확인하며, 신뢰 점수를 부여하는 방식으로 작동합니다. 사용자는 이 신뢰 점수를 기준으로 낮은 신뢰도의 게시물을 걸러낼 수 있으며, 이는 소셜 네트워크가 겪는 모더레이션 문제를 해결하기 위한 시도입니다.

운영팀은 현재 VERA 엔진을 통해 모더레이션 문제를 해결하는 것을 목표로 하며, 향후 VERA 2.0에서는 사용자가 원하는 임계값 이상의 게시물만 볼 수 있도록 앱 설정을 조정할 수 있는 기능을 추가할 계획입니다. 현재 트위터나우는 테스트 단계에 있으며 초기 접근 비용은 20달러입니다.

Sprains, pain, and whiplash: Waymo and Zoox test drivers are getting hurt as robotaxis scale

웨이모(Waymo)와 주옥스(Zoox)의 테스트 운전자들이 자율주행 차량의 급제동이나 갑작스러운 움직임으로 인해 2024년과 2025년에 걸쳐 두려스(OSHA)에 제출된 데이터에 따르면 두려스여섯 건 이상의 부상을 입었습니다. 이는 자율주행 기술이 상용화 단계로 나아가면서 실제 환경에서 테스트를 진행할 때 운전자들이 겪는 신체적 위험을 구체적으로 보여줍니다.

이러한 부상은 자율주행 차량이 수행하는 급제동이나 예상치 못한 움직임에서 비롯되었으며, 이는 기술의 안전성과 인간 운전자와의 상호작용에 대한 중요한 질문을 제기합니다. 자율주행 시스템이 작동하는 환경에서 발생하는 이러한 사고 데이터는 기술 개발 과정에서 안전 기준을 어떻게 설정하고 개선해야 하는지에 대한 논의를 촉발합니다.

해당 데이터는 자율주행 기술이 확장됨에 따라 실제 도로 환경에서 발생할 수 있는 잠재적인 위험 요소를 명확히 합니다. 따라서 자율주행 기술의 발전은 단순히 효율성을 넘어 운전자와 차량 간의 안전한 상호작용을 보장하는 데 중점을 두어야 합니다.

When Interference Graphs Evolve: Doubly Robust Estimation of Dynamic Peer Effects

상호작용 그래프가 진화할 때 동적 피어 효과를 추정하는 것은 사전 할당 네트워크 역사, 동적 피어 노출, 사후 할당 네트워크 변화가 각기 다른 인과적 역할을 하기 때문에 어렵습니다. 이 논문은 이러한 문제를 해결하기 위해 자신의 치료, 시간적으로 집계된 피어 노출, 사후 네트워크 진화 요약을 기준으로 잠재적 결과를 인덱싱하는 통제 대비 프레임워크를 제안합니다.

연구진은 동적 네트워크 이중 강건 추정량인 DynaNet-DR을 개발했는데, 이는 시간적으로 요인화된 성향(propensity)과 정규화된 증강(normalized augmentation)을 결합한 방법입니다. 이 추정량은 일관성, 요약 충분성, 순차적 교환 가능성, 양성성, 잡음 수렴, 약한 의존성 등의 조건 하에서, 결과 회귀 또는 성향 추정량 중 하나만 일관적이면 일관성을 보장합니다.

실제 구현에서는 대표 점수 예측, 고정 클리핑, 유한 표본 안정화 등의 요소를 추가했습니다. 고정된 실제 시간적 그래프 시퀀스에 대한 반합성 벤치마크에서, 전체 프로파일을 목표로 하는 방법들 중에서 이 접근 방식이 유리한 추정 정확도를 보였습니다. 이는 반사실적 엣지 생성보다는 요약 인덱스 대비 대조를 평가하며, MathOverflow 연구는 제시된 가정 하에서의 관찰적 예시로 활용됩니다.

Amazon Mechanical Turk, 2026년 9월 30일 서비스 종료

아마존이 프로그램, 도구, 서비스 평가를 거친 후 Mechanical Turk(MTurk) 서비스를 2026년 9월 30일에 영구적으로 종료하기로 결정했습니다. 이 결정에 따라 현재 MTurk를 이용하고 있는 작업자(Worker)와 요청자(Requester) 모두 종료 절차에 대한 정보를 확인할 수 있습니다.

MTurk는 데이터 검증, 설문 조사, 콘텐츠 조정 등 다양한 작업을 통해 아마존의 비즈니스에 기여하는 플랫폼으로 운영되어 왔습니다. 따라서 서비스 종료가 확정됨에 따라 이용자들은 서비스 종료에 대비한 구체적인 준비 절차를 확인해야 합니다.

현재 이용 중인 작업자와 요청자는 아마존의 FAQ를 통해 서비스 종료와 관련된 상세한 준비 절차를 확인할 수 있습니다. 이는 서비스 종료 시점에 원활하게 작업을 마무리하고 데이터를 관리하기 위해 필수적인 정보입니다.

LLMs in Digital EDA: A perspective on shifting roles from Generation to Orchestration

전자 설계 자동화(EDA)는 합성, 최적화, 검증을 자동화하며 엔지니어링 생산성을 향상시켜 왔습니다. 대규모 언어 모델(LLM)은 설계 의도를 하드웨어 구현으로 직접 번역함으로써 이러한 발전 궤적을 확장하고 있습니다. 그러나 대부분의 EDA 문헌에서 LLM 기반 솔루션은 고립된 설계 단계나 작업만 지원하는 데 그쳐, 실제 능력 발현과 시스템 확장 동인을 가리는 결과를 낳았습니다.

이 관점에서 능력 축적 방식을 드러내기 위해 세 가지 계층적 역할, 즉 단일 패스로 설계 산출물을 생성하는 생성자(Generator), 반복적인 도구 피드백을 통해 결과를 개선하는 에이전트(Agent), 그리고 EDA 단계를 걸쳐 결정을 조정하는 오케스트레이터(Orchestrator)를 정의합니다. 현재 공개된 시스템들을 분석한 결과, 모델이 물리적으로 정확한 하드웨어보다는 그럴듯한 코드를 생성하도록 훈련되는 구문적 함정이 발견되었습니다. 이는 파편화된 도구와 설계 맥락의 손실이 결합되어 결정이 후속 단계에 미치는 영향을 모호하게 만듭니다.

이러한 세 가지 역할 간의 비교는 현재 접근 방식이 산업용 설계로 확장하는 데 어려움을 겪고 있음을 보여줍니다. 따라서 더 신뢰할 수 있고 접근하기 쉬운 하드웨어 설계를 위해 도구와 에이전트를 EDA 흐름 전체에 걸쳐 연결하는 표준화되고 물리적 지향적인 오케스트레이터로의 전환이 필요합니다.

TraceBench: Controlled Evaluation of LLM Agents for Time-Series Root-Cause Attribution

LLM 에이전트는 실제 시스템에서 수집된 시계열 관측 데이터의 이상 탐지 및 근본 원인 분석에 점점 더 많이 적용되고 있지만, 이러한 작업에 대한 성능이 통제된 조건 하에서 체계적으로 평가된 적은 없습니다. 이 문제를 해결하기 위해 연구진은 통제된 근본 원인 귀속 작업을 생성하기 위한 시뮬레이션 기반 프레임워크인 TraceBench를 소개합니다. TraceBench는 물리 동역학 시스템을 시뮬레이션하여 생성된 시계열 관측값을 에이전트에게 제공하고, 시스템 매개변수가 변경되었는지 여부와 변경되었다면 어떤 매개변수인지 판단하도록 요구하는 과제를 생성합니다.

연구팀은 TraceBench를 사용하여 세 가지 해석 가능한 기계 시스템에서 과제를 생성하고 네 가지 LLM 에이전트를 통제된 실험 조건에서 체계적으로 평가함으로써 동역학 시스템의 시계열 관측값을 분석하는 방식에 대한 새로운 통찰을 얻었습니다. 실험 결과, 에이전트는 도메인 컨텍스트로부터 상당한 이점을 얻으며, 시각화보다는 주로 수치 콘솔 출력(numerical console output)을 통해 데이터를 탐색하는 경향을 보였습니다.

또한, 에이전트는 각 시계열 샘플을 예측된 근본 원인 레이블에 매핑하는 파이썬 스크립트를 생성하도록 요구받을 때 직접 예측을 제출할 때보다 성능이 떨어지는 것으로 나타났습니다. 연구팀은 이 연구에서 사용된 데이터셋, 에이전트 궤적, 실험 결과를 담은 자료와 순위표를 tracebench.github.io 웹사이트에서 공개했습니다.

French CII's Mitra-15 in SIMH. Work in Progress

프랑스 CII의 미트라-15(Mitra-15) 마이크로컴퓨터를 SIMH 시뮬레이터에 구현하려는 작업이 진행 중입니다. 이 프로젝트는 1970년대 초에 개발된 미트라-15의 역사적 컴퓨팅 기록을 보존하고 시뮬레이션하는 것을 목표로 합니다.

미트라-15는 DMA 대신 마이크로코드를 사용하여 입출력 주변 장치를 프로그래밍할 수 있는 흥미로운 개념을 가진 16비트 미니컴퓨터로, 산업 자동화 및 군사 응용 분야에서 널리 사용되었습니다. 개발자는 기존의 SDS 940 시뮬레이터를 기반으로 미트라-15의 특성을 모방하며 시뮬레이터를 수정하고 있습니다.

현재 시뮬레이터는 시스템 및 선택 명령어, 메모리 관리, 인터럽트 시스템, 다양한 입출력 장치(프린터, 자기 테이프 리더 등)를 포함하도록 확장하는 것을 목표로 합니다. 하지만 많은 주변 장치에 대한 문서가 부족하여 시뮬레이터의 정확도를 높이는 데 어려움이 있습니다.

개발자는 명령어 디코더를 만들고, 공통 장치에 대한 코드를 작성하며, 브랜치 명령어를 테스트하는 등 복잡한 작업을 수행하고 있습니다. 장기적으로는 Z80 계열의 RSX280을 미트라에 포팅하는 계획도 가지고 있습니다.

Australian police arrest two over TeamPCP hacks targeting Mercor, OpenAI, and others

호주 경찰이 대형 기술 기업과 오픈 소스 프로젝트를 대상으로 한 해상 사이버 공격에 연루된 해킹 그룹 팀PCP 소속 두 명을 체포했습니다. 이들은 대규모 오픈 소스 소프트웨어 공급망을 공격하여 자격 증명과 데이터를 탈취하고 몸값을 요구하는 방식으로 범죄를 저질렀습니다.

이 해커들은 수천 개의 회사에 침입하여 민감한 개인 키와 자격 증명을 훔쳤으며, 이 과정에서 최소 50만 개 이상의 자격 증명을 탈취한 것으로 드러났습니다. 이들의 공격은 LiteLLM, AI 리크루팅 스타트업 Mercor, 그리고 인기 있는 취약점 스캐너 도구인 Trivy와 같은 소프트웨어에 영향을 미쳤습니다.

해당 그룹은 GitHub나 OpenAI와 같은 거대 기술 기업뿐만 아니라 유럽 위원회의 클라우드 인프라까지 침해한 혐의를 받고 있습니다. 이는 개발자들이 의존하는 인기 있는 오픈 소스 도구의 보안 취약점이 전체 시스템에 심각한 위협이 될 수 있음을 보여줍니다.

경찰은 이들의 수사를 2026년 4월에 시작했으며, 현재 이들이 훔친 데이터와 장치들을 압수했습니다. 이 사건은 소프트웨어 공급망 보안의 중요성을 강조하며, 개발 환경에서 사용되는 모든 오픈 소스 프로젝트의 보안 점검이 필수적임을 시사합니다.

The Teaser Period: Why the AI Boom Is Hitting a Reset Wall

인공지능 붐이 재조정의 장벽에 부딪히고 있는 이유를 설명하는 기사입니다. 이는 2007~2008년 주택 담보 시장에서 발생했던 모기지 재조정 장벽, 즉 '리셋 월(reset wall)'과 유사한 구조를 AI 컴퓨팅 계약에 적용하여 설명합니다.

AI 구축에 필수적인 컴퓨팅 계약은 서명 시점에 비용이 시작되는 것이 아니라 실제 자원 제공 시점, 즉 데이터 센터가 가동되고 용량이 확보될 때부터 비용이 발생합니다. 이는 계약이 체결된 시점과 실제 비용 발생 시점 사이에 시간적 격차를 만들며, 이는 주택 담보의 티저 기간과 같은 구조를 형성합니다.

이러한 구조는 계약상 의무가 선지급되고 고정되어 있지만, 실제 수익은 채택에 따라 지연되는 현상을 낳습니다. 결과적으로 시장은 수요가 도달하기 전에 자금 조달 구조가 무너지거나, 요구되는 비용이 실제 수익 흐름을 따라잡지 못하는 지급 불능 문제가 발생할 수 있습니다.

따라서 AI 붐에 대한 논쟁은 기술 자체의 거품 여부가 아니라, 이러한 금융 구조가 수요보다 먼저 무너질 수 있는 위험에 초점을 맞춰야 합니다. 이는 AI 기술이 실재한다는 점과 동일하게, 계약상의 의무와 실제 수익 흐름 사이의 불일치가 핵심 문제임을 시사합니다.

AI’s memory crunch is coming for Android apps

구글이 AI 데이터 센터 확대로 인한 하드웨어 공급 제약에 대응하여 안드로이드 앱의 메모리 사용량과 코드 최적화에 대한 새로운 요구 사항을 발표했습니다. 이는 모바일 산업 전반의 메모리 가용성 변화를 반영하며, 특히 저가형 기기에서 메모리 부족 문제가 심화되는 상황을 해결하기 위함입니다.

구글은 동적 메모리 사용량 및 비트맵 사용량과 같은 여러 영역에 걸쳐 새로운 성능 기준을 설정했으며, 앱 성능 저하 및 충돌을 방지하기 위한 코드 최적화 요구 사항도 추가했습니다. 개발자들을 돕기 위해 구글은 앱이 새로운 기준을 초과할 경우 알림을 제공하는 새로운 도구를 출시하고 있으며, 연내 메모리 제한 기능을 포함한 추가 진단 도구도 제공할 예정입니다.

개발자들은 2027년 2월까지 새로운 성능 기준을 충족해야 하며, 또한 2027년 4월까지 모든 플레이 스토어 앱은 안드로이드 복원 자격 증명 API를 사용하여 기기 마이그레이션 시 사용자 로그인 상태를 자동으로 복원하는 제로 탭 로그인 요구 사항을 충족해야 합니다. 이러한 변경 사항은 메모리가 제한적인 환경에서도 사용자에게 지속적인 품질 경험을 제공하기 위한 조치입니다.

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

음성 대화를 이해하기 위해서는 어휘 내용과 감정, 대화 의도 같은 음향적 신호에 대한 공동 추론이 필요합니다. 하지만 기존 평가 방식은 전사본이나 단일 모달 솔루션에 의존하여 모델이 실제로 음성에서 예측을 근거로 삼는지 여부를 가리는 한계가 있습니다. 연구진은 이러한 실패 모드를 교차 모달 불일치(cross-modal disagreement)로 공식화했는데, 이는 전사본이 그럴듯하지만 잘못된 표면 해석을 제시하는 반면, 운율이나 말하는 스타일 같은 음향적 단서가 다른 답변을 뒷받침하는 상황을 의미합니다.

연구팀은 이러한 문제를 해결하기 위해 텍스트 편향된 표면 해석을 식별하고 불일치 영역을 충돌 QA 예시로 변환하는 확장 가능한 프레임워크를 개발했습니다. 또한 전사본 기반 해석과 음성 기반 해석이 일치하는 일관된 사례를 포함하여 적대적인 오디오 의존성을 넘어 평가할 수 있도록 했습니다. 이를 통해 5차원(상호작용 행동, 감정 상태, 담화 행위, 사회적 입장, 대화 의도)에 걸쳐 501개의 질문을 포함하는 통제된 벤치마크인 ContraTalk을 구축했습니다.

추가로, 연구진은 음성을 지역화된 음향 단서의 텍스트 판독 가능한 표현인 오디오 트윈(Audio Twin)으로 변환하는 에이전트 스타일 추론 프레임워크를 개발했습니다. 이 프레임워크는 음향 증거를 추론 모델에 노출시켜 음향적 증거 집계를 통해 음성 기반 추론을 진단하고 개선할 수 있는 더 통제 가능한 인터페이스를 제공합니다.

실험 결과, 강력한 텍스트 전용 LLM은 일관된 사례에서는 90% 이상의 정확도를 보였으나 충돌 사례에서는 33~48%로 하락했습니다. 직접적인 오디오 LLM은 부분적인 근거만 제공하며 충돌 사례에서 여전히 전사본 편향된 함정을 30~40% 선택하는 경향을 보였습니다. 오디오 트윈 프레임워크는 충돌 사례의 정확도를 개선하고 함정 선택을 줄였지만, 일관된 사례에서의 행동은 여전히 백본 모델에 의존하는 것으로 나타났습니다.

If Meta’s going down, it’s taking TikTok and YouTube with it

메타는 새로운 아동 안전 합의에 따라 171억 달러와 함께 여러 앱 변경 사항을 이행해야 합니다. 이 합의는 47개 미국 주와 여러 지역 및 영토와 체결되었으며, 소셜 미디어로 인한 피해에 대한 오랜 논란 끝에 도달한 결과입니다.

이번 합의는 메타에게 경쟁사들을 압박할 수 있는 기회를 제공합니다. 메타는 이 새로운 산업 표준이 청소년들에게 혜택을 주기를 원하지만, 혼자서 모든 것을 해결할 수는 없다고 밝혔습니다.

메타는 이 입장을 바탕으로 틱톡과 유튜브에게도 동참을 촉구하는 공개 서한을 발표하며 경쟁사들이 자신들의 선두를 따르도록 독려하고 있습니다. 이 조치는 소셜 미디어 플랫폼의 안전 기준과 정책 변화에 대한 개발자와 사용자들에게 중요한 영향을 미칠 것입니다.

Software engineering is about managing complexity

소프트웨어 엔지니어링은 코드를 작성하는 것을 넘어 복잡성을 관리하는 일입니다. 코드를 작성하는 것은 아이디어를 컴퓨터가 실행할 수 있는 명령어로 번역하는 것이지만, 소프트웨어를 구축하는 것은 어떤 명령어를 어떤 제약 조건 하에서, 어떤 비용과 트레이드오프를 감수하며 설계할지 결정하는 과정입니다.

실제 엔지니어링의 어려움은 구문이나 언어 선택이 아니라 시스템의 제약 조건과 상충되는 요구사항 사이에서 적절한 절충안을 선택하는 데 있습니다. 예를 들어, 시스템의 일관성, 가용성, 처리량, 구축 속도, 기존 인프라, 팀의 숙련도 등 수많은 맥락에 따라 최적의 아키텍처는 완전히 달라질 수 있습니다.

AI는 코드 생성이나 반복적인 작업을 가속화하는 데 매우 유용하지만, 시스템의 근본적인 문제와 복잡성을 해결하는 데는 한계가 있습니다. 올바른 결정은 수많은 맥락과 조직 내의 이해관계, 과거의 운영 경험 등 인간만이 가지고 있는 광범위한 정보에 기반해야 하며, 이러한 판단을 AI에게 위임하는 것은 위험합니다.

따라서 엔지니어는 AI를 개발 과정의 보조 도구로 활용하되, 자신이 책임져야 할 시스템의 복잡성을 이해하고 그에 따른 트레이드오프를 결정하는 주체로서의 역할을 유지해야 합니다.

Traders brought Central American cacao to Georgia 1,000 years ago

천 년 전 조지아 북부 지역의 잔치에는 중앙아메리카에서 온 카카오가 포함되었습니다. 에토와(Etowah) 지역의 11세기 잔치 후 버려진 냄비 조각에서 카카오의 흔적이 발견되었는데, 이는 초콜릿의 원료인 카카오의 화학 잔류물과 고대 DNA 분석을 통해 확인되었습니다.

사우스캐롤라이나 대학교의 고고학자 아담 킹과 동료들은 에토와 지역의 잔치에서 나온 냄비 조각 내부에서 카카오(*Theobroma cacao*)의 고대 DNA 조각을 발견했습니다. 카카오 열매는 가공 과정을 거쳐 초콜릿을 만드는 콩을 포함하고 있으며, 카카오는 열대 지방에서만 자라기 때문에 동부 미국 지역에서 가장 가까운 카카오 나무는 최소 3,000킬로미터 떨어진 곳에 위치했습니다.

이러한 발견은 에토와에 살았던 미시시피 문화 사람들이 중앙아메리카까지 최소 3,000킬로미터에 달하는 대륙을 횡단하는 광범위한 무역 연결망을 가지고 있었음을 시사합니다. 이는 카카오가 미시시피 문화의 토대 건설에 기여했을 가능성까지 제기하며 고대 무역의 중요성을 강조합니다.

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable

LLM 에이전트가 전문적인 시장 패널을 보았을 때, 단순 질문보다 방향성 예측에 대한 약속을 더 자주 하게 됩니다. 12개 선도 모델에서 증거가 제시될수록 이러한 약속은 6.5%에서 54.0%까지 상승합니다. 이는 정보의 내용보다는 그 포장(packaging)의 권위가 자신감 있는 행동을 유발한다는 것을 보여줍니다.

모델이 실제 시장 데이터를 기반으로 할 때와 완전히 조작된 숫자로 패널 전체를 위조했을 때도 이러한 현상이 나타납니다. 이 경우 모델의 약속은 24.5%에서 36.8%로 상승하며, 이는 실제 시장 데이터에서 나오는 37.6%와 통계적으로 구별할 수 없습니다. 이는 모델이 정보의 진위 여부보다 제시된 형식의 권위에 더 크게 반응함을 의미합니다.

실패의 원인은 모델의 무능력이나 믿음의 문제가 아니라 행동을 결정하는 '실행/비실행 게이트'에 있으며, 이 게이트는 특정 모델에 국한되어 나타납니다. 이 게이트는 응답 형식이 추론의 여지를 남길 때 정확하게 작동하지만, 형식을 경직시키는 방식은 모델이 틀린 확신을 갖게 만듭니다.

이러한 게이트는 훈련 가능하며 문맥에 따라 변화하기 때문에, 3B 모델을 540개의 합성 사례로 지도 미세 조정(SFT)할 경우 원래 사례에서는 약속이 0.0%로 떨어지지만, 보지 못했던 세 개의 새로운 영역으로 그 효과가 전이됩니다. 따라서 배포 시에는 추론의 여지를 남기는 유연성과 엄격함을 모두 고려해야 합니다.

Prediction of Prediction (PoP): Inter-Layer Activation Fusion for Single-Pass Hallucination Detection in Large Language Models

거대 언어 모델(LLM)은 높은 디코딩 신뢰도에도 불구하고 사실적으로 부정확한 출력을 생성하는 문제가 있어 고위험 워크플로우에서의 배포를 제한하고 있습니다. 기존의 출력 단계 불확실성 측정 지표는 모델이 잘못된 주장에 대해 과신할 경우 실패할 수 있으며, 다중 샘플 검증 파이프라인은 상당한 메모리와 지연 시간 오버헤드를 발생시킵니다.

본 연구는 생성 과정 중 내부 은닉 상태 전환 역학이 보조적인 디코딩 호출 없이 사실 오류를 신호할 수 있는지 평가합니다. 이를 위해 단일 순방향 통과 동안 깊이 전반에 걸쳐 중간 은닉 표현을 융합하여 레이어 전환 불확실성을 포착하는 예측 예측(Prediction of Prediction, PoP) 메커니즘을 제안합니다.

PoP는 자기회귀 트랜스포머 백본을 사용하여 TruthfulQA 벤치마크에서 평가되었으며, 사실 정확성 분류에 대해 75.5%의 AUC(Area Under the Receiver Operating Characteristic Curve)를 달성했습니다. 이 메커니즘은 기본 순방향 통과 내에서 작동하여 실행 시간 지연은 1.2% 미만이며 추가적인 생성 단계를 요구하지 않습니다.

따라서 PoP는 LLM의 내부 상태 변화를 활용하여 사실 오류를 탐지하는 효율적인 방법을 제공하며, 이는 추가적인 계산 비용 없이 고신뢰도의 출력을 보장하는 데 중요한 의미를 가집니다.