Kimi K3: second only to Fable 5 on AA-Briefcase
Kimi K3 모델은 에이전트 지식 작업 벤치마크인 AA-Briefcase에서 Fable 5에 이어 두 번째로 높은 점수를 기록하며 주목받고 있습니다. Kimi K3는 2.8조 파라미터를 가진 모델로, AA-Briefcase에서 1543의 Elo 점수를 달성했는데, 이는 Claude Fable 5(1574)에 이어 전체 최고 점수를 기록한 결과입니다.
이러한 성과는 Kimi K3가 이전 세대 모델인 Kimi K2.6(816) 대비 727점 향상된 수치이며, 객관적 및 분석적 성능은 Claude Fable 5와 유사한 수준인 분석 품질 Elo 1754를 기록했습니다. 하지만 발표 품질 Elo는 1471로, GPT-5.6 Sol이나 Claude Opus 4.8보다 낮은 것으로 나타나 성능 간의 균형에 차이가 있음을 보여줍니다.
Kimi K3의 운영 비용과 시간 측면에서는 높은 점을 기록했습니다. 이 모델은 작업당 평균 1시간에 가까운 시간이 소요되며, 작업당 비용은 $10.57로, Opus 4.8보다 비싼 수준입니다. 이는 작업당 평균 83회의 턴 사용과 120k의 출력 토큰 사용에 기인하며, Claude Fable 5나 GPT-5.6 Sol에 비해 토큰 효율성이 낮다는 것을 의미합니다.
결론적으로 Kimi K3는 강력한 분석 능력을 갖추고 있지만, 높은 비용과 긴 처리 시간을 감수해야 하는 트레이드오프가 존재합니다. 이는 에이전트 지식 작업에서 모델 선택 시 성능과 효율성 간의 균형을 고려해야 함을 시사합니다.
이러한 성과는 Kimi K3가 이전 세대 모델인 Kimi K2.6(816) 대비 727점 향상된 수치이며, 객관적 및 분석적 성능은 Claude Fable 5와 유사한 수준인 분석 품질 Elo 1754를 기록했습니다. 하지만 발표 품질 Elo는 1471로, GPT-5.6 Sol이나 Claude Opus 4.8보다 낮은 것으로 나타나 성능 간의 균형에 차이가 있음을 보여줍니다.
Kimi K3의 운영 비용과 시간 측면에서는 높은 점을 기록했습니다. 이 모델은 작업당 평균 1시간에 가까운 시간이 소요되며, 작업당 비용은 $10.57로, Opus 4.8보다 비싼 수준입니다. 이는 작업당 평균 83회의 턴 사용과 120k의 출력 토큰 사용에 기인하며, Claude Fable 5나 GPT-5.6 Sol에 비해 토큰 효율성이 낮다는 것을 의미합니다.
결론적으로 Kimi K3는 강력한 분석 능력을 갖추고 있지만, 높은 비용과 긴 처리 시간을 감수해야 하는 트레이드오프가 존재합니다. 이는 에이전트 지식 작업에서 모델 선택 시 성능과 효율성 간의 균형을 고려해야 함을 시사합니다.