leejk/ jk lee

Alternative Models — 닫힌 프런티어 바깥의 본체 모델 · 2026.06

GLM 5.2

2026-06 오픈웨이트 지능 1위·MIT·1M 컨텍스트·1/10 가격이 강점, 토큰 verbose·self-claim 벤치·단일 지수 1위의 한계가 약점 — 7월 Kimi K3에 선두를 넘겼다

·
#models#zai#zhipu#glm#open-weights#landscape

GLM 5.2(Z.ai/Zhipu)가 무엇을 잘하고 무엇을 못하는지 강약으로 정리했다. 강점 — Artificial Analysis 지능 지수 v4.1에서 51점으로 오픈웨이트 1위(MiniMax-M3·DeepSeek V4 Pro max 44, Kimi K2.6 43), GDPval-AA v2 1524로 한 집계선 GPT-5.5 xhigh(1514)를 근소하게 추월, MIT 라이선스에 1M 컨텍스트, 입력 $1.4·출력 $4.4로 Fable 5의 약 1/10 가격, 가중치 공개라 접근 회수가 불가능. 약점 — 태스크당 43k 출력 토큰으로 경쟁군(24~37k)보다 verbose해 가격 우위가 일부 상쇄, 저자 보고 코딩·추론 벤치(SWE-bench Pro 62.1·AIME 99.2·GPQA 91.2)는 vendor self-claim이라 독립 검증은 AA 지수 한 줄뿐, 단일 종합 지수 1위가 전 영역 우위는 아니다(GPQA는 Gemini·Fable·GPT에 못 미침). 직접 돌린 게 아니라 독립 지수·HF 카드·발표를 읽고 출처별로 갈라 정리했다.

TL;DR. GLM 5.2(zai-org/GLM-5.2, Z.ai/구 Zhipu)는 오픈웨이트 본체 모델 1위다. 강점Artificial Analysis 지능 지수 v4.1에서 51점으로 공개 모델 선두(MiniMax-M3·DeepSeek V4 Pro max 44, Kimi K2.6 43), 한 집계(GDPval-AA v2 1524)에선 GPT-5.5 xhigh(1514)를 근소하게 넘었고, MIT 라이선스 + 1M 컨텍스트 + Fable 5의 약 1/10 가격가중치 공개라 접근을 회수당하지 않는다. 약점 — 태스크당 43k 출력 토큰으로 경쟁 오픈웨이트(24~37k)보다 verbose해 가격 우위가 일부 깎이고, 코딩·추론 벤치는 저자 보고(self-claim)라 독립 검증이 AA 지수 한 줄뿐이며, 종합 지수 1위가 전 영역 1위는 아니다(GPQA는 Gemini·Fable·GPT에 못 미침). 능력 신호는 출처를 갈라 읽어야 한다.

업데이트 (2026-07-27) — 오픈웨이트 선두를 Kimi K3에 넘겼다. 아래 "오픈웨이트 1위"는 2026-06 시점 값이다. Moonshot AI의 Kimi K3(2.8T MoE·1M 컨텍스트, 2026-07-16 출시)가 AA 지능 지수 57점으로 전체 3위를 찍었고 — GLM 5.2(51)를 6점 앞선다 — 7월 27일 가중치가 Kimi K3 License로 공개되면서 오픈웨이트 선두가 넘어갔다. 단 아래 분석의 척추는 그대로다: GLM 5.2는 여전히 훨씬 싸고(AA 태스크당 $0.32 vs K3 $0.94), MIT라 Kimi K3 License(bespoke — 가중치는 열렸으나 OSI 오픈소스는 아님)보다 라이선스가 깨끗하다. 즉 지능 선두는 넘어갔고, 비용·라이선스 축은 유지다.

provenance 메모. 이 글은 GLM 5.2를 직접 돌려본 후기가 아니다. AA의 독립 지능 지수·HF 모델 카드·발표를 읽고 정리했고, 수치는 독립 평가(AA가 직접 측정)저자 보고(HF 카드 self-claim)를 갈라 표시했다. 실측·체감은 없다.

한눈에

항목
모델 ID zai-org/GLM-5.2 (Z.ai, 구 Zhipu AI)
아키텍처 MoE — 744B 총 / 40B 활성 (AA 집계; HF 카드는 ~753B 총), sparse attention
컨텍스트 1M 토큰 (GLM-5.1의 200K → 1M)
라이선스 MIT (가중치·상업 이용 개방)
가격 $1.4 / $0.26 / $4.4 per MTok (입력 / 캐시히트 / 출력) — Fable 5($10/$50)의 약 1/10
출시 2026-06-14 공개 → 06-18 AA 오픈웨이트 1위 → 07-27 Kimi K3에 선두 이양
제공 Z.ai 1차 API + DeepInfra·Fireworks 등 서드파티, 그리고 self-host

왜 지금 — 닫힌 프런티어가 흔들린 자리에 오픈웨이트 1위

models 개요는 본체 모델 1위가 영역마다 갈린다고 닫았다 — 닫힌 프런티어 셋(Fable·GPT·Gemini) 안에서. GLM 5.2는 그 구도 에서 들어온다. 출시 직후 AA 지능 지수에서 공개 모델 선두를 찍었고, 같은 시점 HN 826포인트·HF 좋아요 1천 돌파로 신호가 모였다.

타이밍이 핵심이다. Claude Fable 5는 출시 사흘 만에 미 정부 export-control 지시로 외국 국적자 전원 접근이 끊겼다(2026-06-12, 07-01 해제). 닫힌 본체는 능력과 무관하게 지정학으로 회수될 수 있다는 게 그 주에 실증됐다 — 18일 뒤 풀렸지만, 스위치를 쥔 쪽이 벤더가 아니었다는 사실은 남는다. GLM 5.2는 정확히 그 자리에 MIT 가중치로 들어왔다 — 능력 상위 구간에 올라오면서, 접근 자체가 회수 불가능한 모델이다. "어느 게 제일 똑똑한가"에 더해 "누구도 못 끄는 게 어디까지 왔나"가 실전 질문이 됐다.

강점 — 뭘 잘하나

1. 오픈웨이트 지능 1위 — 독립 지수로 받친 단 하나

AA Intelligence Index v4.1에서 51점으로 공개 모델 선두다 — MiniMax-M3·DeepSeek V4 Pro max(각 44), Kimi K2.6(43)을 앞선다. 이 수치는 AA가 직접 돌린 독립 종합 지수라, 이 글의 능력 주장 중 1차 검증이 가장 탄탄한 한 줄이다.

2. 한 집계선 GPT-5.5를 넘었다

GDPval-AA v2에서 1524GPT-5.5 xhigh(1514)를 근소하게 넘었다(AA). 오픈웨이트가 닫힌 프런티어 한 종을 한 집계에서 추월한 게 헤드라인 값이다. 단 GDPval-AA는 단일 집계 Elo이고 격차가 10점이라, "GPT-5.5보다 똑똑하다"로 일반화하지 말 것 — 한 자리에서 앞섰다는 사실만 받친다.

3. 가격·라이선스 — 회수 불가능 + 1/10 비용

MIT 라이선스다(가중치·상업 이용 개방). 가격은 입력 $1.4 / 출력 $4.4로 Fable 5($10/$50)의 약 1/10. 태스크당 비용은 ~$0.46(AA 측정). 가중치를 받아 직접 돌리면 vendor가 접근을 끊을 수 없다 — Fable 5가 2026-06-12 실증한 회수 리스크(07-01 해제)가 구조상 적용되지 않는다. ZDR·데이터 거버넌스 제약이 강한 조직엔 이 한 축만으로도 후보다.

4. 1M 컨텍스트 + 장기 자율 (저자 보고)

컨텍스트가 GLM-5.1의 200K에서 1M으로 뛰었다. HF 카드는 "1M 토큰을 안정적으로 유지하며 long-horizon 작업을 지속"한다고 적고, 유연한 effort 레벨의 코딩·툴 유즈·에이전트 작업을 든다(HF 카드). 단 이 long-horizon 주장은 저자 보고다.

5. 저자 보고 코딩·추론 벤치 — 강하되 self-claim

HF 카드 기준 — AIME 2026 99.2, GPQA-Diamond 91.2, HLE 40.5; SWE-bench Pro 62.1, Terminal Bench 2.1 82.7; MCP-Atlas 76.8(HF 카드). 커뮤니티에서도 SWELancer 벤치에서 GLM이 GPT를 이겼다는 글이 돌았다. 방향(코딩·에이전트 강함)은 일관되지만, 이 숫자들은 저자 보고이고 표준 보드 등재치가 아니다 — 아래 약점에서 갈라 읽는다.

약점 — 뭘 못하나 / 단점

1. 토큰 verbose — 가격 우위를 일부 깎는다

가장 실전적인 단점. AA 측정에서 지능 지수 태스크당 43k 출력 토큰(37k가 reasoning)을 쓴다 — MiniMax-M3(24k)·DeepSeek V4 Pro max(37k)보다 많다(AA). 토큰당 가격이 싸도 태스크당 토큰이 많으면 실효 비용·지연이 올라간다. 1/10 가격이 곧 1/10 비용은 아니다 — verbose가 그만큼 되먹는다.

2. 독립 검증은 종합 지수 한 줄뿐

검증으로 탄탄한 건 AA 종합 지능 지수(51, 오픈웨이트 1위) 하나다. 코딩·추론 세부 벤치(SWE-bench Pro 62.1 등)는 전부 저자 보고라, 모든 모델이 같은 하네스로 도는 표준 보드(Scale SEAL급) 대조가 아직 없다. Fable 5에서 본 함정과 같다 — self-claim 코딩 수치는 scaffold 아티팩트일 수 있다. 세부 우위 주장은 독립 보드가 받칠 때까지 보류.

3. 종합 지수 1위 ≠ 전 영역 1위

GPQA-Diamond 91.2(저자 보고)는 닫힌 프런티어에 못 미친다 — Gemini 3.1 Pro ~95(과학추론 1위), Fable 5·GPT-5.5 ~93. 즉 오픈웨이트 종합 1위이지 순수 과학추론 최상위는 아니다. "지수 1위"를 전 영역 우위로 읽으면 틀린다.

4. 거버넌스 — 가중치는 열렸으나 출처는 중국 랩

데이터·콘텐츠 정책·검열 정렬은 중국 랩 모델을 도입할 때 따로 평가할 축이다. 단 가중치가 MIT로 열려 있어 self-host로 외부 API 의존·텔레메트리를 끊을 수 있다는 점이 닫힌 프런티어 대비 완화 요인이다 — 트레이드오프지 결격은 아니다.

어느 작업에 뭘 쓰나

  • 접근 회수 리스크 회피·self-host·ZDR 필수 → GLM 5.2. 가중치를 보유하면 vendor·지정학이 접근을 끊을 수 없다(Fable 5는 끊겼다).
  • 비용 민감 대량 추론 → GLM 5.2(토큰당 ~1/10). 단 verbose(태스크당 43k)를 비용 모델에 반영할 것.
  • 순수 과학추론 최상위 → 여전히 Gemini 3.1 Pro(GPQA). GLM 5.2는 종합 1위지 이 영역 1위가 아니다.
  • 검증된 코딩 최상위가 필요 → 아직 self-claim. 표준 보드 대조 전까지 단정 보류, Fable 5·GPT-5.5와 같은 축으로 재볼 것.

결론

GLM 5.2의 진짜 뉴스는 벤치 한 칸이 아니라 축이 하나 늘었다는 것이다.

  1. 능력 — 오픈웨이트 종합 선두는 독립 지수로 받쳐졌다. 단 2026-06 기준이고 07-27 Kimi K3(57)에 넘어갔으며, 세부 코딩·추론 우위는 self-claim이라 표준 보드 대조 전까지 보류.
  2. 비용 — 토큰당 1/10이되 verbose라, 실효 비용은 태스크당 토큰으로 다시 계산할 것. 이 축은 Kimi K3 대비로도 유지된다(AA 태스크당 $0.32 vs $0.94).
  3. 회수 불가능성 — MIT 가중치라 접근을 끊을 수 없다. 닫힌 프런티어가 2026-06-12 실증한 리스크가 구조상 적용되지 않는 게, 능력 순위만큼 큰 도입 변수다. 그 리스크는 07-01 해제로 한 번 되돌려졌지만, 되돌린 주체가 벤더가 아니라 규제 당국이라는 점이 축을 오히려 굳힌다.

출처

1차·독립 평가

관련 글

같은 주제