AI 에이전트 스킬, 벤치마크 성능의 절반도 현실에서 안 나온다
UC Santa Barbara, MIT CSAIL, MIT-IBM Watson AI Lab 연구팀은 AI 에이전트의 스킬 활용 능력을 현실적으로 평가하는 연구를 진행했습니다. 기존 벤치마크(SKILLSBENCH)가 이상적인 조건에서 성능을 과장하는 문제를 지적하며, 실제 환경에서는 스킬 사용이 오히려 성능 저하를 초래할 수 있음을 발견했습니다.
특히, 에이전트가 스킬을 선택하고 검색하는 과정에서 정확도 한계와 적응 능력 부족이 성능 저하의 주요 원인으로 작용했으며, 연구팀은 더 나은 검색 기법과 효과적인 스킬 정제 전략을 통해 에이전트의 실질적인 성능을 개선해야 한다고 제언했습니다.
특히, 에이전트가 스킬을 선택하고 검색하는 과정에서 정확도 한계와 적응 능력 부족이 성능 저하의 주요 원인으로 작용했으며, 연구팀은 더 나은 검색 기법과 효과적인 스킬 정제 전략을 통해 에이전트의 실질적인 성능을 개선해야 한다고 제언했습니다.