TL;DR. Grok 4.6(xAI, 2026-08-12)의 자리는 프런티어 구간에서 가장 싸다는 한 칸이다. 강점 — AA 지능 지수 60.9로 전체 3위이면서 가격이 입력 $2 / 출력 $6로, 바로 위 Opus 5($5/$25)의 출력가 1/4이다. Vals GPQA Diamond 94.70으로 과학추론도 3위. 약점 — 가중치가 닫혀 있고, 컨텍스트가 500K로 경쟁군의 절반이며, 파라미터 수를 공개하지 않는다. xAI에는 이전 세대를 뒤늦게 여는 관행이 있으나, 실제 공개 때 붙은 라이선스는 OSI 표준이 아니었다.
provenance 메모. 이 글은 Grok 4.6을 직접 돌려본 후기가 아니다. BenchLM 모델 페이지(스펙·가격·가중치 상태)와 AA 지능 지수·Vals GPQA Diamond 스냅샷을 읽고 정리했다. 세대 간 상승폭(DeepSWE·APEX-Agents)은 발표를 옮긴 써드파티 보도라 저자 보고로 표시했다. 실측·체감은 없다.
한눈에
| 항목 | 값 |
|---|---|
| 모델 | Grok 4.6 (xAI) |
| 출시 | 2026-08-12 |
| 컨텍스트 | 500K 토큰 (지식 컷오프 2026-02-01) |
| 모달리티 | 텍스트 + 이미지 입력 → 텍스트 출력 |
| 추론 조절 | low · medium · high · xhigh 4단계 |
| 가격 | $2 / $0.50 / $6 per MTok (입력 / 캐시히트 / 출력). 고속 변형은 2배 |
| 파라미터 | 미공개 (BenchLM 기준 provider 비공개) |
| 가중치 | 닫힘 — 공개 안 됨, proprietary |
| 접근 | xAI API · Grok Build · Cursor · OpenRouter · Vercel · Cloudflare |
왜 여기에 두는가 — 빅3 바깥의 세 번째 개방 포지션
이 카테고리는 닫힌 프런티어 셋(Claude·OpenAI·Google) 바깥의 본체 모델 자리다. Grok 4.6은 그 조건에 맞되, 가중치는 닫혀 있다 — Kimi K3·Qwen3.8-Max·GLM 5.2와 같은 칸에 놓이지만 개방 축에서는 반대편이다.
그런데 xAI는 영구히 닫는 쪽도 아니다. 이전 프런티어를 다음 세대가 나올 때 여는 관행이 있다 — Grok-1을 2024-03에 Apache 2.0으로, Grok 2 계열 가중치를 2025년에 공개했다. 즉 이 카테고리의 개방 축은 이분법이 아니라 셋이다.
| 포지션 | 모델 | 지금 받을 수 있나 |
|---|---|---|
| 열림 | Kimi K3 · Qwen3.8-Max · GLM 5.2 | 받는다 |
| 시차 개방 | Grok 4.6 (xAI) | 지금은 못 받고, 다음 세대 때 이전 세대가 열릴 수 있다 |
| 닫힘 | Claude · OpenAI · Google | 안 열린다 |
Grok을 이 칸에 두는 값은 여기 있다 — 빅3 바깥이면서 닫힌 모델이라는 자리가 개방 축의 중간항을 드러낸다.
강점 — 뭘 잘하나
1. 프런티어 구간에서 가장 싸다 — 이 모델의 본체
AA 지능 지수 60.9로 전체 3위(2026-08-15 스냅샷)인데 가격이 입력 $2 / 출력 $6다. 같은 표의 상위권과 대면 비교하면 격차가 크다.
| 모델 | AA 지수 | 출력 가격 |
|---|---|---|
| Claude Opus 5 | 63.0 | $25 |
| Claude Fable 5 | 62.1 | $50 |
| Grok 4.6 | 60.9 | $6 |
| Kimi K3 | 59.7 | $15 |
종합 3위를 유지하면서 출력가가 1위 모델의 1/4이고 2위의 1/8이다. 캐시히트 입력은 $0.50까지 떨어진다. 지능 지수 2.1점을 포기하고 출력 비용을 4분의 1로 줄이는 거래가 성립하는 자리라, 대량 호출·장기 실행 에이전트에서 이 축이 곧바로 실효 비용이 된다.
2. 과학추론 3위 — 같은 하네스 기준
Vals AI 호스팅 GPQA Diamond에서 94.70(2026-08-12 스냅샷)으로 Gemini 3.1 Pro(95.45)·GPT-5.6 Sol(95.20) 다음 3위다. Opus 5(93.43)·Fable 5(93.18)보다 위다. 모든 모델이 같은 하네스로 도는 보드의 값이라 models 표에서 직접 비교가 성립하는 축이고, 가격을 함께 보면 대비가 더 커진다.
3. 에이전틱·코딩에서 세대 상승폭이 크다 (저자 보고)
Grok 4.5 대비 DeepSWE 54 → 65.9, APEX-Agents 47.1 → 57.5로 발표됐다. xAI는 이 세대의 초점을 장기 실행 에이전트·에이전틱 코딩·인터랙티브 작업으로 잡는다. 집계 보드에서도 에이전틱 축이 코딩 축보다 앞선다(BenchLM 기준 에이전틱 66.7 / 코딩 63.6). 단 세대 상승폭 수치는 벤더 발표라 표준 보드 대조 전까지 방향으로 읽는다.
4. 추론 강도를 네 단계로 조절한다
low·medium·high·xhigh 네 단계로 추론 강도를 지정할 수 있다. 토큰 예산을 작업별로 다르게 주는 운영에서, 강도가 이분법인 모델보다 조절 폭이 넓다.
약점 — 뭘 못하나
1. 가중치가 닫혀 있다
이 카테고리의 다른 셋과 결정적으로 갈리는 지점이다. BenchLM 기준 weights not published, proprietary. Fable 5가 2026-06-12 실증한 접근 회수 리스크가 이 모델에는 그대로 적용된다 — 싸다는 강점은 벤더가 계속 열어둘 때만 유효하다.
2. 시차 개방은 관행이지 약속이 아니고, 열려도 OSI가 아니었다
xAI의 개방 관행에는 두 가지 단서가 붙는다. 첫째, 일정이 지켜진다는 보장이 없다 — 공개 시점은 다음 세대 출시에 묶여 있고 그 시점을 벤더가 정한다. 둘째, 열렸을 때 붙은 라이선스가 OSI 표준이 아니었다 — Grok-1은 Apache 2.0이었지만, 2025-08 공개된 Grok 2.5는 반경쟁 조항이 포함된 자체 라이선스였다. GLM 5.2의 MIT와 같은 축에 놓으면 틀린다. 언젠가 열린다를 도입 계획의 근거로 쓰지 말 것.
3. 컨텍스트 500K — 경쟁군의 절반
이 카테고리와 프런티어 상위권이 대부분 1M인데 Grok 4.6은 500K다. Kimi K3·GLM 5.2·Opus 5·Gemini 3.7 Flash가 전부 1M 이상이다. 강점으로 내세운 장기 실행 에이전트와 정면으로 부딪히는 제약이라, 대형 레포 전체를 한 호흡에 무는 워크로드에서는 먼저 걸린다.
4. 파라미터 수를 공개하지 않는다
BenchLM 기준 provider가 파라미터를 비공개로 둔다. 일부 보도가 1.5T를 적지만 벤더 확인이 없다. self-host 계획이 애초에 불가능한 모델이라 실무 영향은 작지만, 이 카테고리의 다른 셋이 총·활성 파라미터를 다 공개하는 것과 대비된다 — 개방의 정도는 가중치만의 문제가 아니다.
5. 지식 컷오프가 2026-02
컷오프가 2026-02-01이다. 출시(08-12) 기준 반년 전이고, 이 블로그가 다루는 2026년 상반기 변화(Fable 5 사태·GPT-5.6·오픈웨이트 3종 공개)가 모델 안에 없다. 최신 생태계 지식을 모델에 기대는 용도에는 검색·컨텍스트 주입이 필수다.
어느 작업에 뭘 쓰나
- 비용 민감한 프런티어급 작업 → Grok 4.6. 이 표에서 종합 3위를 유지하며 가장 싼 자리는 여기가 단독이다.
- 대량 호출·장기 실행 에이전트 → Grok 4.6, 단 500K 컨텍스트에 들어가는 작업인지 먼저 확인.
- 1M 컨텍스트가 필요 → Kimi K3·GLM 5.2 또는 Opus 5.
- 접근 회수 리스크를 구조적으로 없애야 함 → 이 모델이 아니다. 열린 셋 중에서 고른다.
- 과학추론 최상위 → Gemini 3.1 Pro(95.45). Grok은 3위(94.70)로 근접하되 1위는 아니다.
결론
Grok 4.6은 능력으로 이기는 모델이 아니라 가격 축을 갈아버린 모델이다.
- 가격 — 종합 3위를 유지하며 출력가가 상위 둘의 1/4·1/8이다. 이 표에서 단독 자리고, 이 글의 주장 중 가장 탄탄하다(두 보드 모두 제3자 측정).
- 개방 — 지금은 닫혀 있고, 시차 개방은 관행이지 약속이 아니며, 열려도 OSI 라이선스가 아니었다. 이 카테고리의 다른 셋과 같은 축에 놓으면 안 된다.
- 제약 — 500K 컨텍스트와 2026-02 컷오프가 장기 실행 에이전트라는 자기 포지셔닝과 부딪힌다. 싸다는 이유로 고르기 전에 이 둘을 먼저 잰다.
출처
집계·독립 평가
- BenchLM — Grok 4.6 모델 페이지 (스펙·가격·가중치 상태·집계 순위)
- AA Intelligence Index 2026 스냅샷 (종합 3위, 60.9)
- Vals AI 호스팅 GPQA Diamond 스냅샷 (과학추론 3위, 94.70)
개방 관행
- xAI — Open Release of Grok-1 (2024-03, Apache 2.0)
- TechCrunch — xAI가 Grok 2.5를 공개 (2025-08, 자체 라이선스·반경쟁 조항)