Skip to main content

GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

Hacker News · 2026-07-10 · 모델 비교/성능 벤치마크


이번 빌드오프는 GPT-5.6의 Sol·Terra·Luna 세 티어와 Grok 4.5, Claude(여러 변종), Meta의 Muse Spark 1.1, Qwen·GLM 등 오픈웨이트 그룹을 한데 모아 동일한 네 가지 애플리케이션을 각 모델별로 다섯 번씩 실행해 비교한 실전 관찰 보고서다. 과제는 1인칭 레이캐스터, 3D 루빅스 큐브(스크램블·해결 애니메이션 포함), 연산 우선순위를 지키는 계산기 UI, 그리고 게임 오브 라이프(그리드와 재생·단계 제어)로 구성됐고, 시도마다 성공 기준을 명확히 해 일부 과제(라이프 제외)에선 횟수 기반 평가를 병행했다. 저자는 모든 원시 시도 결과를 공개하며 객관적 과학적 결론을 주장하지 않는다고 밝혔지만, 관찰만으로도 모델 간 강점과 비용·지연 트레이드오프가 뚜렷히 드러난다. 핵심 결과는 복잡하고 전례 없는 작업에서는 최첨단(프론티어) 모델이 우위라는 점이다. 예컨대 레이캐스터에서는 GPT-5.6(특히 Sol)이 두드러졌고, 루빅스 큐브 분야에선 Claude Fable 5가 완성도 높은 결과를 연달아 내며 눈에 띄었다. 반면 게임 오브 라이프처럼 예제 코드가 풍부한 단순 과제에서는 Qwen 3.7·GLM-5.2 등 오픈웨이트들이 저렴한 비용으로 충분히 잘 수행해 비용 효율 면에서 유리했다. 또한 실험은 응답 속도와 비용 차이도 보여준다(Luna가 짧은 프롬프트에서 빠른 응답을 보였고, Qwen은 매우 저렴하고 빠른 편, DeepSeek·GLM은 느린 편). Grok 4.5는 가성비 좋은 대안으로 평가됐고, Muse Spark 1.1은 기대 이상으로 선전했으나 아직 전 분야에서 대체하기엔 아쉬움이 남는다는 관찰도 제시됐다. 기술적 의미는 명확하다: 과제의 난이도와 사전 예제의 풍부함에 따라 모델 선택 전략이 달라지며, 비용·지연·일관성(시도 간 편차)을 함께 고려해야 한다는 실전적 시사점을 준다.

Hacker News에서 원문 읽기 →