leejk/ jk lee
Landscapes

Landscape · 2026.06

Models: 프런티어 본체 모델 줄세우기

코딩·자율·환각·과학추론 — 어느 모델이 무엇을 잘하나 (2026-06 줄세우기 + 2026-08 세대 갱신 메모)

·
#models#claude-fable-5#frontier#landscape

코딩 에이전트·하네스·스킬이 올라타는 프런티어 본체 모델(Claude Fable 5 · GPT-5.5 · Gemini 3.1 Pro)을 강약으로 줄세웠다. 셋이 능력에서 같은 상위 구간으로 수렴했고, 1위는 영역마다 갈린다 — 코딩·장기 자율·낮은 환각은 Fable 5, 과학추론(GPQA)은 Gemini 3.1 Pro. Claude Fable 5의 단독 강약은 별도 글로 깊게 다룬다.

TL;DR. 2026-06 기준 프런티어 본체 모델은 Claude Fable 5 · GPT-5.5 · Gemini 3.1 Pro(7월 세대 교체는 바로 아래 업데이트). 능력에서 같은 상위 구간으로 수렴했고, 1위는 영역마다 갈린다 — 코딩·장기 자율·낮은 환각은 Fable 5, 과학추론(GPQA Diamond)은 Gemini 3.1 Pro. "어느 게 제일 똑똑한가"가 아니라 어느 작업에 뭘 쓸까가 실전 질문이다. Fable 5의 강약은 단독 글에서 깊게.

업데이트 (2026-08-15) — 아래 줄세우기는 2026-06 기준이고, 7월에 세 벤더가 모두 세대를 갈았다. 표를 그대로 읽으면 한 세대 틀린다.

  • Anthropic — Claude Opus 5(2026-07-24, claude-opus-5). SWE-bench Verified 96.0% · SWE-bench Pro 79.2% — Opus 4.8(88.6/69.2)을 크게 넘겼고, 가격은 $5/$25로 동결(Fable 5의 절반). Anthropic 자체 에이전틱 코딩 평가에선 Fable 5보다 앞선다. 즉 아래 표의 "Fable 5 = 코딩 최상위"는 자사 후속에 먼저 깨졌다.
  • OpenAI — GPT-5.6(2026-07-09, 06-26 제한 프리뷰). Luna·Terra·Sol 3종 체제. 플래그십 Sol은 AA Coding Agent Index v1.1에서 80점으로 경쟁 모델을 앞서면서 출력 토큰은 절반 이하·비용은 약 1/3. 아래 GPT-5.5 행은 이제 전 세대다.
  • Google — Gemini 3.5 Flash(2026-05-19). Terminal-Bench 2.1 76.2% · GDPval-AA 1656 · MCP Atlas 83.6%에이전틱·코딩에서 3.1 Pro를 추월했다. 단 3.5 Pro는 아직 미출시2026-07-21 Google이 Gemini 3종을 더 냈지만 3.5 Pro는 그중에 없었다. 그리고 Flash 라인은 그 뒤로 두 번 더 갈렸다 — 3.6 Flash(07-21)에 이어 3.7 Flash(2026-08-13)가 나왔고 가격이 절반으로 떨어졌다($0.75/$3.75 인트로). Pro 티어는 여전히 2026-02의 3.1 Pro가 현행이다 — Flash가 세 세대 나아가는 동안 Pro는 한 번도 안 갈렸다.
  • 오픈웨이트가 프런티어 표에 들어왔다 — Kimi K3(Moonshot, 2026-07-16; 가중치 07-27 공개). 출시 시점 AA 지능 지수 57점으로 전체 3위였고, 2026-08-15 지수에서도 4위로 GPT-5.6 Sol 위다(아래 표). 닫힌 셋만 줄세우던 이 표의 전제 자체가 깨진 자리다. GLM 5.2의 오픈웨이트 선두도 여기로 넘어갔다.
  • Fable 5 접근은 복원됐다(2026-07-01, 전 세계). Mythos 5만 미국 조직 일부로 제한 유지.

단정 하나 — 이 표가 6주 만에 한 세대 밀렸다는 사실이, 표의 내용보다 중요한 신호다. 프런티어 본체의 갱신 주기가 이 블로그의 갱신 주기보다 짧아졌다.

이 자리를 뭐라 부르나

정의 — 프런티어 LLM 본체. 코딩 에이전트·하네스·스킬이 그 위에 올라타는 모델 층 자체다. 코딩 에이전트 카테고리"어떤 제품"을 묻고 단정을 "분기는 모델에서 일어난다"로 닫았다면, 이 카테고리는 그 모델들을 영역별 강약으로 줄세운다.

영역별 우세는 다음과 같이 갈린다 (2026-08-15 기준. 코딩 '우세'는 scaffold 아티팩트라 미확정 — 아래 벤치 표 주석 참조).

영역 우세
종합 지능 (AA 지수) Claude Opus 5 (63.0) — Fable 5(62.1)·Grok 4.6(60.9) 순
과학추론 (GPQA Diamond) Gemini 3.1 Pro (95.45) — GPT-5.6 Sol(95.20)·Grok 4.6(94.70) 순
코딩 (SWE-Bench Pro) 미확정 — 같은 하네스로 도는 보드가 없다
장기 자율 실행 Fable (vendor 보고)
환각 억제 Claude 라인 — 1차 출처로 가장 탄탄
가격 대비 성능 Opus 5($5/$25) — Fable 5 능력에 근접하되 절반 가격

스택

Claude Fable 5 — 코딩·자율·낮은 환각

장기 자율 실행이 헤드라인 — Stripe의 2개월치 마이그레이션 하루 완료(vendor self-claim). 코딩 강점이나 '압도'는 하네스 scaffold 아티팩트라 미검증, 환각은 경쟁군의 절반 이하(1차 출처로 탄탄). 약점은 과학추론 비-최상위 · classifier 과차단 · Opus 4.8의 2배 가격. 강약 전체는 단독 글.

GPT-5.5

집계상 코딩·지식추론에서 Fable에 밀리지만, 그 코딩 격차는 scaffold 아티팩트다 — 표준 보드(Scale SEAL급)에선 GPT-5.x가 앞선다. 과학추론(GPQA)에선 Fable과 공동 2위로 동률 — 표에서 가장 깨끗한 벤치에서 Fable에 안 진다. 환각은 85.53%로 약점. 가격·운영 제약(토큰 +30%·30일 retention·classifier 과차단)은 Fable 쪽만 부담이라, 그만큼 GPT-5.5의 조용한 이점. 강약 전체는 단독 글.

Gemini 3.1 Pro

long-context + thinking 강점은 코딩 에이전트 모델 표에서 이미 줄세웠다. 2026 Q2의 단 하나 — GPQA Diamond 과학추론 프런티어 1위(Fable·GPT-5.5보다 앞섬). 단 공식 헤드라인은 ARC-AGI-2 77.1%고 GPQA 1위는 써드파티다. 그리고 후속 Gemini 3.5(2026-05-19 I/O)가 에이전틱·코딩에서 3.1 Pro를 추월하며 세대가 갈렸다. 강약·세대 전환 전체는 단독 글.

Alternative Models — 닫힌 프런티어 바깥

닫힌 셋 바깥에서 본체 모델을 내놓는 랩들은 별도 카테고리로 묶었다 — Grok 4.6(xAI) · Kimi K3(Moonshot) · Qwen3.8-Max(Alibaba) · GLM 5.2(Z.ai). 아래 표 톱6 중 셋이 이 카테고리이고, Grok 4.6(3위)·Kimi K3(4위)가 GPT-5.6 Sol(5위)보다 위다.

기준은 가중치 공개가 아니라 벤더다 — Grok 4.6은 가중치가 닫혀 있지만 여기 들어온다. 그래서 개방이 진입 조건이 아니라 카테고리 안의 축이 되고, 그 축은 이분법이 아니라 열림 · 시차 개방 · 닫힘 셋으로 갈린다. xAI는 이전 세대를 뒤늦게 여는 관행이 있으나 일정을 벤더가 정하고 열렸을 때 OSI 라이선스가 아니었다. 강약·비교 전체는 카테고리 개요.

벤치 비교 표

2026-08-15 전면 교체. 이전 판은 써드파티 집계 블로그를 섞은 표였고, 적대적 감사에서 코딩 수치가 Anthropic 자체 scaffold 값과 중립 하네스 값을 섞은 것이라는 결함이 나왔다. 이번 판은 그 결함을 구조로 고쳤다 — 모든 모델이 같은 하네스로 도는 보드 두 개만 쓴다. 벤더 발표 수치는 이 표에서 전부 뺐다.

모델 벤더 AA 지능 지수¹ GPQA Diamond² 가격(입력/출력)³ 개방⁶
Claude Opus 5 Anthropic 63.0 (1위) 93.43 $5 / $25 닫힘
Claude Fable 5 Anthropic 62.1 93.18 $10 / $50 닫힘
Grok 4.6 xAI 60.9 94.70 $2 / $6 시차
Kimi K3 Moonshot 59.7 92.93 $3 / $15 열림
GPT-5.6 Sol OpenAI 58.9 95.20 (2위) 미확인 닫힘
Qwen3.8-Max Alibaba 58.1 93.69 미확인 열림
Claude Opus 4.8 Anthropic 57.3 미등재 $5 / $25 닫힘
GPT-5.5 OpenAI 56.3 93.18 $5 / $30⁴ 닫힘
Gemini 3.7 Flash Google 56.0 미등재 $0.75 / $3.75⁵ 닫힘
Gemini 3.1 Pro Google 미등재 95.45 (1위) standard 닫힘
GLM 5.2 Z.ai 톱10 밖 미등재 $1.4 / $4.4 열림

¹ AA Intelligence Index 2026, 2026-08-15 스냅샷(BenchLM 미러, 177개 모델 평가). AA 자체 기사(v4.1)의 Kimi K3 57·GLM 5.2 51과 수치가 다르다 — 지수 버전이 갈렸으니 세대 간 비교에 쓰지 말 것. 톱10 밖은 순위만 알 수 있어 수치를 비웠다. ² Vals AI 호스팅 GPQA Diamond, 2026-08-12 스냅샷. few-shot·zero-shot CoT 분할. 같은 하네스로 도는 값이라, 이 표에서 모델 간 직접 비교가 성립하는 유일한 능력 축이다. 톱10 밖은 미등재로 표시. ³ per MTok. 미확인은 1차 출처로 확인 못 한 것 — 추정치를 넣지 않았다. ⁴ 공식 발표로 확인. gpt-5.5-pro는 $30/$180. ⁵ 2026-12-31까지 인트로 가격. 이후 $1.50 / $7.50으로 복귀. ⁶ 열림은 가중치를 지금 받을 수 있는 것, 시차는 이전 세대만 사후 공개되는 관행(Grok), 닫힘은 안 열리는 것. 셋의 구분은 Alternative Models 개요 참조.

코딩 열을 뺀 이유 — 이 열한 모델을 같은 하네스로 재는 코딩 보드가 없다. SWE-Bench Pro·Terminal-Bench 수치는 대부분 벤더 self-report고 scaffold가 제각각이라, 한 표에 올리는 순간 이전 판의 결함이 그대로 재발한다. 코딩 비교는 각 모델 단독 글에서 출처를 갈라 다룬다.

표 한 줄 결론 네 가지.

  1. 빅3 경계가 능력에서 사라졌다. 톱6 중 셋이 Alternative Models고, Grok 4.6(3위)·Kimi K3(4위)가 GPT-5.6 Sol(5위)보다 위다. 능력만으로 빅3를 고를 이유는 이 표에서 사라졌다 — 남는 이유는 개방의 조건과 운영이다.
  2. 두 축의 순위가 어긋난다. 종합 1위 Opus 5는 GPQA에서 6위(93.43)고, GPQA 1위 Gemini 3.1 Pro는 종합 톱10에 없다. 종합 지수 1위를 전 영역 1위로 읽으면 틀린다 — 6개월째 이 표에서 반복되는 패턴이다.
  3. 가격 열이 능력 열보다 많이 갈린다. 종합 1~4위의 출력 단가가 $25 · $50 · $6 · $15로 순위와 무관하게 흩어진다. Grok 4.6은 3위를 유지하며 1위의 1/4, 2위의 1/8이다. 능력이 수렴하면 표의 정보량은 가격 열로 옮겨간다.
  4. 아직 안 다룬 모델이 톱10에 남아 있다. Meta의 Muse Spark 1.2(종합 8위)는 카테고리에 자리가 없다. 줄세우기의 빈칸은 순위가 아니라 커버리지다.

(이 글은 Claude Code로 작성·상위권이 Anthropic 모델이라 구조적 이해상충이 있다 — 위 두 보드는 모두 제3자 측정이지만, 서술의 강조점은 비-Anthropic 출처로 교차검증 권장.)

어느 작업에 뭘 쓰나

  • 큰 리팩토링·오버나잇 코딩·다단계 자율 에이전트 → Fable 5 (장기 자율 + 코딩 최상위). 단 보안 인접 작업이면 classifier 과차단에 막힌다.
  • 순수 과학추론 최상위 → Gemini 3.1 Pro.
  • 짧고 반복적인 작업 → Fable 5는 과하다. Opus 5가 절반 가격($5/$25)에 충분 — 2026-07-24 이후로는 Opus 4.8이 아니라 여기가 기본값.
  • ZDR 필수 조직 → Fable 5는 아예 불가(30일 retention 강제).

결론

도입 질문은 "어느 게 제일 똑똑한가"가 아니라 작업별 매칭이다.

  1. 작업이 어느 영역인가 — 코딩·자율이면 Claude 라인, 과학추론이면 Gemini. 단 코딩 최상위 자리는 2026-07-24 이후 Fable 5가 아니라 Opus 5다.
  2. 비용·반복도 — 짧고 반복적이면 Fable은 과하다(Opus 5로 충분, 절반 가격).
  3. 제약 — 보안 인접(classifier)·ZDR 필요(retention)면 Fable은 탈락 조건이 명확하다.
  4. 세대를 먼저 확인할 것 — 위 업데이트 블록대로 이 표는 2026-06 스냅샷이다. 벤치 한 칸을 인용하기 전에 그 모델이 아직 벤더의 현행 플래그십인지부터 본다.

출처

1차 자료 (Anthropic 공식)

벤치·집계 (공개 전 1차 보드 대조 필요)

관련 글

하위 문서