TL;DR. 2026-06 기준 프런티어 본체 모델은 Claude Fable 5 · GPT-5.5 · Gemini 3.1 Pro(7월 세대 교체는 바로 아래 업데이트). 능력에서 같은 상위 구간으로 수렴했고, 1위는 영역마다 갈린다 — 코딩·장기 자율·낮은 환각은 Fable 5, 과학추론(GPQA Diamond)은 Gemini 3.1 Pro. "어느 게 제일 똑똑한가"가 아니라 어느 작업에 뭘 쓸까가 실전 질문이다. Fable 5의 강약은 단독 글에서 깊게.
업데이트 (2026-08-15) — 아래 줄세우기는 2026-06 기준이고, 7월에 세 벤더가 모두 세대를 갈았다. 표를 그대로 읽으면 한 세대 틀린다.
- Anthropic — Claude Opus 5(2026-07-24,
claude-opus-5). SWE-bench Verified 96.0% · SWE-bench Pro 79.2% — Opus 4.8(88.6/69.2)을 크게 넘겼고, 가격은 $5/$25로 동결(Fable 5의 절반). Anthropic 자체 에이전틱 코딩 평가에선 Fable 5보다 앞선다. 즉 아래 표의 "Fable 5 = 코딩 최상위"는 자사 후속에 먼저 깨졌다.- OpenAI — GPT-5.6(2026-07-09, 06-26 제한 프리뷰). Luna·Terra·Sol 3종 체제. 플래그십 Sol은 AA Coding Agent Index v1.1에서 80점으로 경쟁 모델을 앞서면서 출력 토큰은 절반 이하·비용은 약 1/3. 아래 GPT-5.5 행은 이제 전 세대다.
- Google — Gemini 3.5 Flash(2026-05-19). Terminal-Bench 2.1 76.2% · GDPval-AA 1656 · MCP Atlas 83.6% — 에이전틱·코딩에서 3.1 Pro를 추월했다. 단 3.5 Pro는 아직 미출시 — 2026-07-21 Google이 Gemini 3종을 더 냈지만 3.5 Pro는 그중에 없었다. 그리고 Flash 라인은 그 뒤로 두 번 더 갈렸다 — 3.6 Flash(07-21)에 이어 3.7 Flash(2026-08-13)가 나왔고 가격이 절반으로 떨어졌다($0.75/$3.75 인트로). Pro 티어는 여전히 2026-02의 3.1 Pro가 현행이다 — Flash가 세 세대 나아가는 동안 Pro는 한 번도 안 갈렸다.
- 오픈웨이트가 프런티어 표에 들어왔다 — Kimi K3(Moonshot, 2026-07-16; 가중치 07-27 공개). 출시 시점 AA 지능 지수 57점으로 전체 3위였고, 2026-08-15 지수에서도 4위로 GPT-5.6 Sol 위다(아래 표). 닫힌 셋만 줄세우던 이 표의 전제 자체가 깨진 자리다. GLM 5.2의 오픈웨이트 선두도 여기로 넘어갔다.
- Fable 5 접근은 복원됐다(2026-07-01, 전 세계). Mythos 5만 미국 조직 일부로 제한 유지.
단정 하나 — 이 표가 6주 만에 한 세대 밀렸다는 사실이, 표의 내용보다 중요한 신호다. 프런티어 본체의 갱신 주기가 이 블로그의 갱신 주기보다 짧아졌다.
이 자리를 뭐라 부르나
정의 — 프런티어 LLM 본체. 코딩 에이전트·하네스·스킬이 그 위에 올라타는 모델 층 자체다. 코딩 에이전트 카테고리가 "어떤 제품"을 묻고 단정을 "분기는 모델에서 일어난다"로 닫았다면, 이 카테고리는 그 모델들을 영역별 강약으로 줄세운다.
영역별 우세는 다음과 같이 갈린다 (2026-08-15 기준. 코딩 '우세'는 scaffold 아티팩트라 미확정 — 아래 벤치 표 주석 참조).
| 영역 | 우세 |
|---|---|
| 종합 지능 (AA 지수) | Claude Opus 5 (63.0) — Fable 5(62.1)·Grok 4.6(60.9) 순 |
| 과학추론 (GPQA Diamond) | Gemini 3.1 Pro (95.45) — GPT-5.6 Sol(95.20)·Grok 4.6(94.70) 순 |
| 코딩 (SWE-Bench Pro) | 미확정 — 같은 하네스로 도는 보드가 없다 |
| 장기 자율 실행 | Fable (vendor 보고) |
| 환각 억제 | Claude 라인 — 1차 출처로 가장 탄탄 |
| 가격 대비 성능 | Opus 5($5/$25) — Fable 5 능력에 근접하되 절반 가격 |
스택
Claude Fable 5 — 코딩·자율·낮은 환각
장기 자율 실행이 헤드라인 — Stripe의 2개월치 마이그레이션 하루 완료(vendor self-claim). 코딩 강점이나 '압도'는 하네스 scaffold 아티팩트라 미검증, 환각은 경쟁군의 절반 이하(1차 출처로 탄탄). 약점은 과학추론 비-최상위 · classifier 과차단 · Opus 4.8의 2배 가격. 강약 전체는 단독 글.
GPT-5.5
집계상 코딩·지식추론에서 Fable에 밀리지만, 그 코딩 격차는 scaffold 아티팩트다 — 표준 보드(Scale SEAL급)에선 GPT-5.x가 앞선다. 과학추론(GPQA)에선 Fable과 공동 2위로 동률 — 표에서 가장 깨끗한 벤치에서 Fable에 안 진다. 환각은 85.53%로 약점. 가격·운영 제약(토큰 +30%·30일 retention·classifier 과차단)은 Fable 쪽만 부담이라, 그만큼 GPT-5.5의 조용한 이점. 강약 전체는 단독 글.
Gemini 3.1 Pro
long-context + thinking 강점은 코딩 에이전트 모델 표에서 이미 줄세웠다. 2026 Q2의 단 하나 — GPQA Diamond 과학추론 프런티어 1위(Fable·GPT-5.5보다 앞섬). 단 공식 헤드라인은 ARC-AGI-2 77.1%고 GPQA 1위는 써드파티다. 그리고 후속 Gemini 3.5(2026-05-19 I/O)가 에이전틱·코딩에서 3.1 Pro를 추월하며 세대가 갈렸다. 강약·세대 전환 전체는 단독 글.
Alternative Models — 닫힌 프런티어 바깥
닫힌 셋 바깥에서 본체 모델을 내놓는 랩들은 별도 카테고리로 묶었다 — Grok 4.6(xAI) · Kimi K3(Moonshot) · Qwen3.8-Max(Alibaba) · GLM 5.2(Z.ai). 아래 표 톱6 중 셋이 이 카테고리이고, Grok 4.6(3위)·Kimi K3(4위)가 GPT-5.6 Sol(5위)보다 위다.
기준은 가중치 공개가 아니라 벤더다 — Grok 4.6은 가중치가 닫혀 있지만 여기 들어온다. 그래서 개방이 진입 조건이 아니라 카테고리 안의 축이 되고, 그 축은 이분법이 아니라 열림 · 시차 개방 · 닫힘 셋으로 갈린다. xAI는 이전 세대를 뒤늦게 여는 관행이 있으나 일정을 벤더가 정하고 열렸을 때 OSI 라이선스가 아니었다. 강약·비교 전체는 카테고리 개요.
벤치 비교 표
2026-08-15 전면 교체. 이전 판은 써드파티 집계 블로그를 섞은 표였고, 적대적 감사에서 코딩 수치가 Anthropic 자체 scaffold 값과 중립 하네스 값을 섞은 것이라는 결함이 나왔다. 이번 판은 그 결함을 구조로 고쳤다 — 모든 모델이 같은 하네스로 도는 보드 두 개만 쓴다. 벤더 발표 수치는 이 표에서 전부 뺐다.
| 모델 | 벤더 | AA 지능 지수¹ | GPQA Diamond² | 가격(입력/출력)³ | 개방⁶ |
|---|---|---|---|---|---|
| Claude Opus 5 | Anthropic | 63.0 (1위) | 93.43 | $5 / $25 | 닫힘 |
| Claude Fable 5 | Anthropic | 62.1 | 93.18 | $10 / $50 | 닫힘 |
| Grok 4.6 | xAI | 60.9 | 94.70 | $2 / $6 | 시차 |
| Kimi K3 | Moonshot | 59.7 | 92.93 | $3 / $15 | 열림 |
| GPT-5.6 Sol | OpenAI | 58.9 | 95.20 (2위) | 미확인 | 닫힘 |
| Qwen3.8-Max | Alibaba | 58.1 | 93.69 | 미확인 | 열림 |
| Claude Opus 4.8 | Anthropic | 57.3 | 미등재 | $5 / $25 | 닫힘 |
| GPT-5.5 | OpenAI | 56.3 | 93.18 | $5 / $30⁴ | 닫힘 |
| Gemini 3.7 Flash | 56.0 | 미등재 | $0.75 / $3.75⁵ | 닫힘 | |
| Gemini 3.1 Pro | 미등재 | 95.45 (1위) | standard | 닫힘 | |
| GLM 5.2 | Z.ai | 톱10 밖 | 미등재 | $1.4 / $4.4 | 열림 |
¹ AA Intelligence Index 2026, 2026-08-15 스냅샷(BenchLM 미러, 177개 모델 평가). AA 자체 기사(v4.1)의 Kimi K3 57·GLM 5.2 51과 수치가 다르다 — 지수 버전이 갈렸으니 세대 간 비교에 쓰지 말 것. 톱10 밖은 순위만 알 수 있어 수치를 비웠다.
² Vals AI 호스팅 GPQA Diamond, 2026-08-12 스냅샷. few-shot·zero-shot CoT 분할. 같은 하네스로 도는 값이라, 이 표에서 모델 간 직접 비교가 성립하는 유일한 능력 축이다. 톱10 밖은 미등재로 표시.
³ per MTok. 미확인은 1차 출처로 확인 못 한 것 — 추정치를 넣지 않았다.
⁴ 공식 발표로 확인. gpt-5.5-pro는 $30/$180.
⁵ 2026-12-31까지 인트로 가격. 이후 $1.50 / $7.50으로 복귀.
⁶ 열림은 가중치를 지금 받을 수 있는 것, 시차는 이전 세대만 사후 공개되는 관행(Grok), 닫힘은 안 열리는 것. 셋의 구분은 Alternative Models 개요 참조.
코딩 열을 뺀 이유 — 이 열한 모델을 같은 하네스로 재는 코딩 보드가 없다. SWE-Bench Pro·Terminal-Bench 수치는 대부분 벤더 self-report고 scaffold가 제각각이라, 한 표에 올리는 순간 이전 판의 결함이 그대로 재발한다. 코딩 비교는 각 모델 단독 글에서 출처를 갈라 다룬다.
표 한 줄 결론 네 가지.
- 빅3 경계가 능력에서 사라졌다. 톱6 중 셋이 Alternative Models고, Grok 4.6(3위)·Kimi K3(4위)가 GPT-5.6 Sol(5위)보다 위다. 능력만으로 빅3를 고를 이유는 이 표에서 사라졌다 — 남는 이유는 개방의 조건과 운영이다.
- 두 축의 순위가 어긋난다. 종합 1위 Opus 5는 GPQA에서 6위(93.43)고, GPQA 1위 Gemini 3.1 Pro는 종합 톱10에 없다. 종합 지수 1위를 전 영역 1위로 읽으면 틀린다 — 6개월째 이 표에서 반복되는 패턴이다.
- 가격 열이 능력 열보다 많이 갈린다. 종합 1~4위의 출력 단가가 $25 · $50 · $6 · $15로 순위와 무관하게 흩어진다. Grok 4.6은 3위를 유지하며 1위의 1/4, 2위의 1/8이다. 능력이 수렴하면 표의 정보량은 가격 열로 옮겨간다.
- 아직 안 다룬 모델이 톱10에 남아 있다. Meta의 Muse Spark 1.2(종합 8위)는 카테고리에 자리가 없다. 줄세우기의 빈칸은 순위가 아니라 커버리지다.
(이 글은 Claude Code로 작성·상위권이 Anthropic 모델이라 구조적 이해상충이 있다 — 위 두 보드는 모두 제3자 측정이지만, 서술의 강조점은 비-Anthropic 출처로 교차검증 권장.)
어느 작업에 뭘 쓰나
- 큰 리팩토링·오버나잇 코딩·다단계 자율 에이전트 → Fable 5 (장기 자율 + 코딩 최상위). 단 보안 인접 작업이면 classifier 과차단에 막힌다.
- 순수 과학추론 최상위 → Gemini 3.1 Pro.
- 짧고 반복적인 작업 → Fable 5는 과하다. Opus 5가 절반 가격($5/$25)에 충분 — 2026-07-24 이후로는 Opus 4.8이 아니라 여기가 기본값.
- ZDR 필수 조직 → Fable 5는 아예 불가(30일 retention 강제).
결론
도입 질문은 "어느 게 제일 똑똑한가"가 아니라 작업별 매칭이다.
- 작업이 어느 영역인가 — 코딩·자율이면 Claude 라인, 과학추론이면 Gemini. 단 코딩 최상위 자리는 2026-07-24 이후 Fable 5가 아니라 Opus 5다.
- 비용·반복도 — 짧고 반복적이면 Fable은 과하다(Opus 5로 충분, 절반 가격).
- 제약 — 보안 인접(classifier)·ZDR 필요(retention)면 Fable은 탈락 조건이 명확하다.
- 세대를 먼저 확인할 것 — 위 업데이트 블록대로 이 표는 2026-06 스냅샷이다. 벤치 한 칸을 인용하기 전에 그 모델이 아직 벤더의 현행 플래그십인지부터 본다.