leejk/ jk lee

Alternative Models — 닫힌 프런티어 바깥의 본체 모델 · 2026.08

Grok 4.6

프런티어 구간에서 가장 싸다는 한 칸이 강점, 닫힌 가중치와 500K 컨텍스트와 미공개 스펙이 약점

·
#models#xai#grok#landscape

Grok 4.6(xAI, 2026-08-12)이 무엇을 잘하고 무엇을 못하는지 강약으로 정리했다. 강점 — AA 지능 지수 60.9로 전체 3위이면서 입력 2달러 출력 6달러로 프런티어 구간에서 가장 싸고, Vals GPQA Diamond 94.70으로 과학추론 3위이며, 에이전틱 코딩에서 전 세대 대비 큰 폭으로 올랐다. 약점 — 가중치가 닫혀 있고, 컨텍스트가 500K로 경쟁군의 절반이며, 파라미터 수를 공개하지 않고, 시차 개방 관행이 있으나 실제 공개 라이선스는 OSI 표준이 아니었다. 직접 돌린 게 아니라 집계 보드와 공개 자료를 출처별로 갈라 정리했다.

TL;DR. Grok 4.6(xAI, 2026-08-12)의 자리는 프런티어 구간에서 가장 싸다는 한 칸이다. 강점AA 지능 지수 60.9로 전체 3위이면서 가격이 입력 $2 / 출력 $6로, 바로 위 Opus 5($5/$25)의 출력가 1/4이다. Vals GPQA Diamond 94.70으로 과학추론도 3위. 약점가중치가 닫혀 있고, 컨텍스트가 500K로 경쟁군의 절반이며, 파라미터 수를 공개하지 않는다. xAI에는 이전 세대를 뒤늦게 여는 관행이 있으나, 실제 공개 때 붙은 라이선스는 OSI 표준이 아니었다.

provenance 메모. 이 글은 Grok 4.6을 직접 돌려본 후기가 아니다. BenchLM 모델 페이지(스펙·가격·가중치 상태)와 AA 지능 지수·Vals GPQA Diamond 스냅샷을 읽고 정리했다. 세대 간 상승폭(DeepSWE·APEX-Agents)은 발표를 옮긴 써드파티 보도라 저자 보고로 표시했다. 실측·체감은 없다.

한눈에

항목
모델 Grok 4.6 (xAI)
출시 2026-08-12
컨텍스트 500K 토큰 (지식 컷오프 2026-02-01)
모달리티 텍스트 + 이미지 입력 → 텍스트 출력
추론 조절 low · medium · high · xhigh 4단계
가격 $2 / $0.50 / $6 per MTok (입력 / 캐시히트 / 출력). 고속 변형은 2배
파라미터 미공개 (BenchLM 기준 provider 비공개)
가중치 닫힘 — 공개 안 됨, proprietary
접근 xAI API · Grok Build · Cursor · OpenRouter · Vercel · Cloudflare

왜 여기에 두는가 — 빅3 바깥의 세 번째 개방 포지션

이 카테고리는 닫힌 프런티어 셋(Claude·OpenAI·Google) 바깥의 본체 모델 자리다. Grok 4.6은 그 조건에 맞되, 가중치는 닫혀 있다Kimi K3·Qwen3.8-Max·GLM 5.2와 같은 칸에 놓이지만 개방 축에서는 반대편이다.

그런데 xAI는 영구히 닫는 쪽도 아니다. 이전 프런티어를 다음 세대가 나올 때 여는 관행이 있다 — Grok-1을 2024-03에 Apache 2.0으로, Grok 2 계열 가중치를 2025년에 공개했다. 즉 이 카테고리의 개방 축은 이분법이 아니라 이다.

포지션 모델 지금 받을 수 있나
열림 Kimi K3 · Qwen3.8-Max · GLM 5.2 받는다
시차 개방 Grok 4.6 (xAI) 지금은 못 받고, 다음 세대 때 이전 세대가 열릴 수 있다
닫힘 Claude · OpenAI · Google 안 열린다

Grok을 이 칸에 두는 값은 여기 있다 — 빅3 바깥이면서 닫힌 모델이라는 자리가 개방 축의 중간항을 드러낸다.

강점 — 뭘 잘하나

1. 프런티어 구간에서 가장 싸다 — 이 모델의 본체

AA 지능 지수 60.9로 전체 3위(2026-08-15 스냅샷)인데 가격이 입력 $2 / 출력 $6다. 같은 표의 상위권과 대면 비교하면 격차가 크다.

모델 AA 지수 출력 가격
Claude Opus 5 63.0 $25
Claude Fable 5 62.1 $50
Grok 4.6 60.9 $6
Kimi K3 59.7 $15

종합 3위를 유지하면서 출력가가 1위 모델의 1/4이고 2위의 1/8이다. 캐시히트 입력은 $0.50까지 떨어진다. 지능 지수 2.1점을 포기하고 출력 비용을 4분의 1로 줄이는 거래가 성립하는 자리라, 대량 호출·장기 실행 에이전트에서 이 축이 곧바로 실효 비용이 된다.

2. 과학추론 3위 — 같은 하네스 기준

Vals AI 호스팅 GPQA Diamond에서 94.70(2026-08-12 스냅샷)으로 Gemini 3.1 Pro(95.45)·GPT-5.6 Sol(95.20) 다음 3위다. Opus 5(93.43)·Fable 5(93.18)보다 위다. 모든 모델이 같은 하네스로 도는 보드의 값이라 models 표에서 직접 비교가 성립하는 축이고, 가격을 함께 보면 대비가 더 커진다.

3. 에이전틱·코딩에서 세대 상승폭이 크다 (저자 보고)

Grok 4.5 대비 DeepSWE 54 → 65.9, APEX-Agents 47.1 → 57.5로 발표됐다. xAI는 이 세대의 초점을 장기 실행 에이전트·에이전틱 코딩·인터랙티브 작업으로 잡는다. 집계 보드에서도 에이전틱 축이 코딩 축보다 앞선다(BenchLM 기준 에이전틱 66.7 / 코딩 63.6). 단 세대 상승폭 수치는 벤더 발표라 표준 보드 대조 전까지 방향으로 읽는다.

4. 추론 강도를 네 단계로 조절한다

low·medium·high·xhigh 네 단계로 추론 강도를 지정할 수 있다. 토큰 예산을 작업별로 다르게 주는 운영에서, 강도가 이분법인 모델보다 조절 폭이 넓다.

약점 — 뭘 못하나

1. 가중치가 닫혀 있다

이 카테고리의 다른 셋과 결정적으로 갈리는 지점이다. BenchLM 기준 weights not published, proprietary. Fable 5가 2026-06-12 실증한 접근 회수 리스크가 이 모델에는 그대로 적용된다 — 싸다는 강점은 벤더가 계속 열어둘 때만 유효하다.

2. 시차 개방은 관행이지 약속이 아니고, 열려도 OSI가 아니었다

xAI의 개방 관행에는 두 가지 단서가 붙는다. 첫째, 일정이 지켜진다는 보장이 없다 — 공개 시점은 다음 세대 출시에 묶여 있고 그 시점을 벤더가 정한다. 둘째, 열렸을 때 붙은 라이선스가 OSI 표준이 아니었다 — Grok-1은 Apache 2.0이었지만, 2025-08 공개된 Grok 2.5는 반경쟁 조항이 포함된 자체 라이선스였다. GLM 5.2의 MIT와 같은 축에 놓으면 틀린다. 언젠가 열린다를 도입 계획의 근거로 쓰지 말 것.

3. 컨텍스트 500K — 경쟁군의 절반

이 카테고리와 프런티어 상위권이 대부분 1M인데 Grok 4.6은 500K다. Kimi K3·GLM 5.2·Opus 5·Gemini 3.7 Flash가 전부 1M 이상이다. 강점으로 내세운 장기 실행 에이전트와 정면으로 부딪히는 제약이라, 대형 레포 전체를 한 호흡에 무는 워크로드에서는 먼저 걸린다.

4. 파라미터 수를 공개하지 않는다

BenchLM 기준 provider가 파라미터를 비공개로 둔다. 일부 보도가 1.5T를 적지만 벤더 확인이 없다. self-host 계획이 애초에 불가능한 모델이라 실무 영향은 작지만, 이 카테고리의 다른 셋이 총·활성 파라미터를 다 공개하는 것과 대비된다 — 개방의 정도는 가중치만의 문제가 아니다.

5. 지식 컷오프가 2026-02

컷오프가 2026-02-01이다. 출시(08-12) 기준 반년 전이고, 이 블로그가 다루는 2026년 상반기 변화(Fable 5 사태·GPT-5.6·오픈웨이트 3종 공개)가 모델 안에 없다. 최신 생태계 지식을 모델에 기대는 용도에는 검색·컨텍스트 주입이 필수다.

어느 작업에 뭘 쓰나

  • 비용 민감한 프런티어급 작업 → Grok 4.6. 이 표에서 종합 3위를 유지하며 가장 싼 자리는 여기가 단독이다.
  • 대량 호출·장기 실행 에이전트 → Grok 4.6, 단 500K 컨텍스트에 들어가는 작업인지 먼저 확인.
  • 1M 컨텍스트가 필요Kimi K3·GLM 5.2 또는 Opus 5.
  • 접근 회수 리스크를 구조적으로 없애야 함 → 이 모델이 아니다. 열린 셋 중에서 고른다.
  • 과학추론 최상위 → Gemini 3.1 Pro(95.45). Grok은 3위(94.70)로 근접하되 1위는 아니다.

결론

Grok 4.6은 능력으로 이기는 모델이 아니라 가격 축을 갈아버린 모델이다.

  1. 가격 — 종합 3위를 유지하며 출력가가 상위 둘의 1/4·1/8이다. 이 표에서 단독 자리고, 이 글의 주장 중 가장 탄탄하다(두 보드 모두 제3자 측정).
  2. 개방 — 지금은 닫혀 있고, 시차 개방은 관행이지 약속이 아니며, 열려도 OSI 라이선스가 아니었다. 이 카테고리의 다른 셋과 같은 축에 놓으면 안 된다.
  3. 제약 — 500K 컨텍스트와 2026-02 컷오프가 장기 실행 에이전트라는 자기 포지셔닝과 부딪힌다. 싸다는 이유로 고르기 전에 이 둘을 먼저 잰다.

출처

집계·독립 평가

개방 관행

관련 글

같은 주제