GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps
GPT-5.6, Grok 4.5, Claude, Muse Spark가 동일한 네 가지 애플리케이션을 구축하는 비교 실험 결과가 공개되었습니다. 이번 실험은 레이캐스터 미로, 3차원 루빅스 큐브, 계산기, 게임 오브 라이프 등 네 가지 과제를 대상으로 진행되었으며, 결과는 비용과 지연 시간까지 포함하여 제시되었습니다.
이전 실험에 대한 피드백을 반영하여 이번에는 총 열두 개의 모델, 즉 GPT-5.6 Sol, Terra, Luna, Meta의 Muse Spark 1.1, Grok 4.5, GPT-5.5, Claude Opus 4.8, Claude Fable 5, 그리고 오픈 웨이트 모델인 Qwen 3.7 Plus, DeepSeek V4 Pro, Kimi K2.6, GLM-5.2가 참여했습니다. 각 과제별로 다섯 번의 시도를 통해 모델들의 성능과 비용, 시간을 비교 분석했습니다.
결과를 분석한 결과, GPT-5.6 Sol 모델이 레이캐스터 미로 과제에서 5/5로 가장 높은 성공률을 보이며 가장 좋은 결과를 기록했습니다. 루빅스 큐브 과제에서도 GPT-5.6 Sol이 좋은 결과를 보였으며, Grok 4.5 역시 가격 대비 좋은 성능을 보여주었습니다. 하지만 모든 모델이 완벽한 결과를 내지 못했으며, 일부 모델은 특정 작업에서 실패하거나 애니메이션 오류를 보이는 등 결과의 편차가 컸습니다.
이러한 결과는 최신 플래그십 모델이 반드시 자동적인 승자가 아님을 보여주며, 사용자가 직접 각 시도를 확인하고 판단할 수 있도록 원본 빌드 결과가 공개되었습니다. 따라서 독자들은 제시된 데이터와 다양한 시도 결과를 바탕으로 각 모델의 실제 성능과 한계를 스스로 평가할 수 있습니다.
이전 실험에 대한 피드백을 반영하여 이번에는 총 열두 개의 모델, 즉 GPT-5.6 Sol, Terra, Luna, Meta의 Muse Spark 1.1, Grok 4.5, GPT-5.5, Claude Opus 4.8, Claude Fable 5, 그리고 오픈 웨이트 모델인 Qwen 3.7 Plus, DeepSeek V4 Pro, Kimi K2.6, GLM-5.2가 참여했습니다. 각 과제별로 다섯 번의 시도를 통해 모델들의 성능과 비용, 시간을 비교 분석했습니다.
결과를 분석한 결과, GPT-5.6 Sol 모델이 레이캐스터 미로 과제에서 5/5로 가장 높은 성공률을 보이며 가장 좋은 결과를 기록했습니다. 루빅스 큐브 과제에서도 GPT-5.6 Sol이 좋은 결과를 보였으며, Grok 4.5 역시 가격 대비 좋은 성능을 보여주었습니다. 하지만 모든 모델이 완벽한 결과를 내지 못했으며, 일부 모델은 특정 작업에서 실패하거나 애니메이션 오류를 보이는 등 결과의 편차가 컸습니다.
이러한 결과는 최신 플래그십 모델이 반드시 자동적인 승자가 아님을 보여주며, 사용자가 직접 각 시도를 확인하고 판단할 수 있도록 원본 빌드 결과가 공개되었습니다. 따라서 독자들은 제시된 데이터와 다양한 시도 결과를 바탕으로 각 모델의 실제 성능과 한계를 스스로 평가할 수 있습니다.