leejk/ jk lee

Alternative Models — 닫힌 프런티어 바깥의 본체 모델 · 2026.08

Kimi K3

오픈웨이트 최상위 능력·1M 컨텍스트·네이티브 비전이 강점, 자체 라이선스·비용·self-claim 벤치가 약점

·
#models#moonshot#kimi#open-weights#landscape

Kimi K3(Moonshot AI, 2026-07-16 출시, 07-27 가중치 공개)가 무엇을 잘하고 무엇을 못하는지 강약으로 정리했다. 강점 — Artificial Analysis 지능 지수 57점으로 전체 3위이자 오픈웨이트 1위, 2.8T MoE에 1M 컨텍스트와 네이티브 비전, Kimi Delta Attention으로 디코딩 가속, 공개된 가중치 중 최대 규모. 약점 — Kimi K3 License가 관대하되 OSI 승인 라이선스가 아니고, 태스크당 비용이 GLM 5.2의 약 3배이며, 코딩 세부 벤치는 저자 보고라 독립 검증이 지능 지수 한 줄에 몰려 있다. 직접 돌린 게 아니라 독립 지수와 공개 자료를 출처별로 갈라 정리했다.

TL;DR. Kimi K3(Moonshot AI)는 오픈웨이트 능력 1위다. 강점AA 지능 지수 57점으로 전체 3위로 Opus 4.8·GPT-5.5와 같은 구간, 2.8T MoE에 1M 컨텍스트 + 네이티브 비전, 그리고 공개된 가중치 중 최대 규모. 약점 — 라이선스가 MIT가 아닌 자체 Kimi K3 License고, 태스크당 비용이 GLM 5.2의 약 3배($0.94 vs $0.32)이며, 코딩 세부 벤치는 저자 보고라 독립 검증이 지능 지수 한 줄에 몰려 있다.

provenance 메모. 이 글은 Kimi K3를 직접 돌려본 후기가 아니다. AA의 독립 지능 지수·MoonshotAI/Kimi-K3 레포·OpenRouter 모델 페이지를 읽고 정리했고, 수치는 독립 측정(AA가 직접 실행)저자 보고(Moonshot 발표) 를 갈라 표시했다. 실측·체감은 없다.

한눈에

항목
모델 ID moonshotai/kimi-k3 (Moonshot AI)
아키텍처 MoE — 2.8T 총 / 896 전문가 중 16개 활성, Kimi Delta Attention + Attention Residuals
컨텍스트 1M 토큰
모달리티 텍스트 + 이미지 (네이티브 비전)
라이선스 Kimi K3 License — 수정 MIT 계열의 자체 라이선스, OSI 승인 아님
가격 $3.00 / $0.30 / $15.00 per MTok (입력 / 캐시히트 / 출력). 태스크당 $0.94 (AA 측정)
출시 2026-07-16 API → 2026-07-27 가중치 공개 (~594GB MXFP4 체크포인트)

왜 지금 — 오픈웨이트가 프런티어 구간에 처음 들어온 자리

models 개요는 프런티어 본체를 닫힌 셋으로 줄세웠다. Kimi K3는 그 전제를 깬 첫 모델이다. AA 지능 지수 57점으로 전체 3위 — Opus 4.8·GPT-5.5와 같은 구간이고, 위에 있는 건 Fable 5와 GPT-5.6 Sol뿐이다.

타이밍이 축을 만든다. Fable 5가 2026-06-12 정부 지시로 접근이 끊긴 지 6주 뒤, 능력이 거의 같으면서 회수당하지 않는 모델이 가중치로 풀렸다. 도입 질문이 "오픈웨이트로 버틸 수 있나"에서 "어느 오픈웨이트를 고를까"로 넘어간 지점이다.

강점 — 뭘 잘하나

1. 오픈웨이트 능력 1위 — 독립 지수로 받친 한 줄

AA 지능 지수 57점으로 GLM 5.2(51)를 6점 앞선다. GDPval-AA v2에서는 1668 Elo. 이 수치는 AA가 직접 돌린 독립 종합 지수라, 이 글의 능력 주장 중 1차 검증이 가장 탄탄한 자리다. 다만 07-16 출시 시점 AA 기사는 가중치 공개 전에 쓰였고, 실제 공개는 07-27이다 — "오픈웨이트 1위"는 그 시점부터 성립한다.

2. 1M 컨텍스트 + 네이티브 비전

컨텍스트 1M에 텍스트와 이미지를 함께 받는다. 오픈웨이트에서 이 조합은 드물다 — GLM 5.2는 1M이지만 비전이 없고, Qwen3.8-Max의 공개 체크포인트는 텍스트 전용에 네이티브 262K다. 스크린샷·로그 이미지·다이어그램을 그대로 물리는 에이전트 워크플로에서 이 축이 실질 차이를 만든다.

3. 디코딩 효율 — Kimi Delta Attention

Moonshot은 Kimi Delta AttentionAttention Residuals 두 메커니즘으로 최대 6.3배 빠른 디코딩을 주장한다. 2.8T 규모에서 디코딩 속도는 self-host 비용에 직결되는 축이다. 단 이 수치는 저자 보고라 독립 벤치 대조 전까지 방향만 읽는다.

4. 코딩 — 대형 레포 탐색과 에이전틱 루프 (저자 보고)

Moonshot 발표 기준 FrontierSWE 81.2 · Terminal-Bench 2.0 88.3. 강점 자리로는 대형 레포 탐색·도구 사용·디버깅·이미지와 로그와 테스트를 놓고 반복을 든다. 외부 신호로는 Arena.ai Code WebDev 리더보드 1위중국 랩 모델이 주요 코딩 리더보드 정상에 오른 첫 사례다. 세부 벤치는 self-claim이고 리더보드 순위는 외부 집계라, 둘을 갈라 읽어야 한다.

5. 공개된 가중치 중 최대 규모

~594GB MXFP4 체크포인트가 Hugging Face에 올라갔다. 규모 자체가 강점은 아니지만, 이 급의 모델을 실제로 받을 수 있다는 사실이 이 카테고리의 상한을 올렸다.

약점 — 뭘 못하나

1. 라이선스가 MIT가 아니다

Kimi K3 License는 수정 MIT 계열의 관대한 라이선스지만 OSI 승인 라이선스가 아니다. GLM 5.2의 MIT와 결정적으로 갈리는 지점이 여기다 — MIT는 법무 검토가 사실상 끝나 있고, 자체 라이선스는 조항을 직접 읽어야 한다. 능력 6점 차이보다 이 축이 기업 도입에서 먼저 걸린다.

2. 오픈웨이트 중 비싸다

AA 측정 태스크당 $0.94로 GLM 5.2($0.32)의 약 3배다. 토큰 단가도 $3/$15로 GLM($1.4/$4.4)의 두 배 이상. 캐시히트 입력이 $0.30로 90% 할인되고 코딩 워크로드에서 캐시 적중률이 높다는 게 완화 요인이지만, 그건 워크로드 형태에 달렸다. 오픈웨이트를 고르는 이유가 비용이라면 이 모델이 아니다.

3. 세부 벤치는 저자 보고

독립 검증이 탄탄한 건 AA 종합 지능 지수(57) 하나다. FrontierSWE 81.2·Terminal-Bench 88.3·디코딩 6.3배는 전부 Moonshot 자기 보고라, 모든 모델이 같은 하네스로 도는 표준 보드 대조가 아직 없다. Fable 5에서 본 함정과 같다 — self-claim 코딩 수치는 scaffold 아티팩트일 수 있다.

4. 운영 규모의 진입 장벽

2.8T MoE를 self-host하려면 클러스터가 필요하다. 가중치가 열렸다직접 돌릴 수 있다 사이의 거리가 이 카테고리에서 가장 먼 모델이다. 실질 도입 경로는 대부분 Moonshot API나 서드파티 라우팅(OpenRouter 등)이 되고, 그러면 회수 불가능성이라는 오픈웨이트의 핵심 이점이 실제로는 발동하지 않는다.

5. 가격 표기가 출처마다 다르다

Moonshot 기준 $3.00/$15.00인데 OpenRouter는 $2.80/$14로 적는다. 라우팅 계층·프로바이더마다 단가가 갈리므로, 비용 모델은 실제 쓰는 경로 기준으로 다시 잡아야 한다.

어느 작업에 뭘 쓰나

  • 오픈웨이트에서 능력 최상위가 필요 → Kimi K3. 이 카테고리에서 이 자리는 단독이다.
  • 비전이 섞인 에이전트 워크플로 → Kimi K3. 오픈웨이트에서 네이티브 비전 + 1M은 여기뿐이다.
  • 라이선스 리스크를 0으로GLM 5.2(MIT). Kimi는 자체 라이선스라 검토가 남는다.
  • 비용 민감 대량 추론GLM 5.2. 태스크당 1/3이다.
  • 검증된 코딩 최상위 → 아직 self-claim. 표준 보드 대조 전까지 Opus 5·GPT-5.6 Sol과 같은 축으로 재볼 것.

결론

Kimi K3의 뉴스는 벤치 한 칸이 아니라 상한이 올라갔다는 것이다.

  1. 능력 — 오픈웨이트 1위이자 전체 3위. 독립 지수로 받쳐진 이 카테고리 최고 수치다. 단 세부 코딩·효율 우위는 self-claim.
  2. 개방의 조건 — 가중치는 열렸으나 라이선스가 MIT가 아니고, 2.8T라 실제 self-host 문턱이 높다. 열림의 정도를 GLM과 같은 축에 놓으면 틀린다.
  3. 비용 — 오픈웨이트 안에서는 비싼 축이다. 닫힌 프런티어 대비 싸다는 것과 오픈웨이트 안에서 싸다는 것은 다른 얘기다.

출처

1차·독립 평가

보도

관련 글

같은 주제