leejk/ jk lee

Alternative Models — 닫힌 프런티어 바깥의 본체 모델 · 2026.08

Qwen3.8-Max

Max 티어를 처음 연 2.4T 오픈웨이트가 강점, 공개 체크포인트가 API 모델과 다르고 라이선스가 자체 규약인 것이 약점

·
#models#alibaba#qwen#open-weights#landscape

Qwen3.8-Max(Alibaba, 2026-08-03 발표, 08-12 가중치 공개)가 무엇을 잘하고 무엇을 못하는지 강약으로 정리했다. 강점 — Qwen 계열 최초로 Max 티어를 가중치로 열었고, 2.4T 총 95B 활성 MoE로 PaperBench 93.0과 Terminal-Bench 2.1 86.6을 저자 보고했으며, 27B 소형 체크포인트를 함께 예고했다. 약점 — 공개 체크포인트가 API 모델과 다르다(텍스트 전용, 네이티브 262K), 라이선스가 표준 OSI가 아닌 자체 qwen3.8-max 규약, SWE-bench Pro 67.7로 닫힌 프런티어에 크게 못 미치고, AA 같은 독립 종합 지수 등재가 아직 없다. 직접 돌린 게 아니라 Hugging Face 모델 카드와 발표 보도를 출처별로 갈라 정리했다.

TL;DR. Qwen3.8-Max(Alibaba)는 Qwen 계열이 Max 티어를 처음 가중치로 연 모델이다. 강점 — 2.4T 총 / 95B 활성 MoE, 저자 보고 기준 PaperBench 93.0 으로 GPT-5.6 Sol·Opus 4.8을 앞서고 Terminal-Bench 2.1 86.6 으로 Opus 4.8·Fable 5(84.6)를 넘는다. 약점공개된 체크포인트가 API 모델과 다르다HF 카드텍스트 전용네이티브 262,144 컨텍스트고, 라이선스는 표준 OSI가 아닌 자체 qwen3.8-max 규약이다. SWE-bench Pro는 67.7로 Fable 5(80.0)에 크게 못 미치고, 독립 종합 지수 등재는 아직 없다.

provenance 메모. 이 글은 Qwen3.8-Max를 직접 돌려본 후기가 아니다. Hugging Face 모델 카드를 직접 읽어 라이선스·컨텍스트·모달리티를 확인했고(1차), 벤치 수치는 발표를 옮긴 써드파티 보도라 저자 보고로 표시했다(2차). 이 글에서 가장 단단한 사실은 벤치가 아니라 모델 카드에 적힌 스펙이다. 실측·체감은 없다.

한눈에

항목
모델 ID Qwen/Qwen3.8-2.4T-A95B (Alibaba Qwen)
아키텍처 MoE — 2.4T 총 / 95B 활성
컨텍스트 (공개 체크포인트) 262,144 네이티브 → 확장 시 ~1,010,000
모달리티 (공개 체크포인트) 텍스트 전용 — 카드 명시: "Multimodal inputs are not supported"
모달리티 (API) 텍스트 · 이미지 · 영상 입력, 1M 컨텍스트
실행 조건 thinking mode 상시 필수 (카드 명시), BF16 safetensors
라이선스 qwen3.8-max — 자체 규약, 표준 OSI 라이선스 아님
출시 2026-08-03 발표 → 2026-08-12 Hugging Face·ModelScope 가중치 공개

왜 지금 — Max 티어가 처음 열렸다

Qwen은 오랫동안 중소형은 열고 Max 티어는 닫는 구도였다. Qwen3.8-Max는 그 선을 넘은 첫 모델이다 — 2.4T 플래그십을 가중치로 풀었고, Kimi K3(2026-07-27, 2.8T)와 3주 간격이다.

두 랩이 한 달 안에 조 단위 파라미터 플래그십을 가중치로 던졌다는 게 이 카테고리의 신호다. 오픈웨이트가 "작고 싼 대안"이던 구도가 여기서 끝났다.

강점 — 뭘 잘하나

1. Max 티어 개방 — 계열 최초

Qwen 라인업에서 Max 급을 가중치로 받는 건 처음이다. 공식 레포는 Qwen/Qwen3.8-2.4T-A95B, BF16 safetensors로 vLLM·SGLang 호환. 능력 상위 구간의 모델을 직접 보유할 수 있는 선택지가 하나 더 늘었다는 게 벤치 수치보다 큰 사실이다.

2. 에이전틱·연구 벤치에서 닫힌 프런티어와 겹친다 (저자 보고)

발표 기준 PaperBench 93.0 으로 GPT-5.6 Sol과 Opus 4.8을 앞서고, Terminal-Bench 2.1 86.6 으로 Opus 4.8·Fable 5(84.6)를 넘되 GPT-5.6 Sol max(88.8)에는 뒤진다. 연구 문서 처리와 터미널 에이전트 축에서 닫힌 프런티어와 같은 표에 오른다. 단 전부 벤더 발표 수치라, 표준 보드 대조 전까지는 방향으로 읽는다.

3. 소형 체크포인트를 함께 겨냥했다

Alibaba는 일반 온프레미스 GPU에서 돌아가는 Qwen3.8-27B를 같은 주에 예고했다. 조 단위 플래그십과 27B를 같은 세대로 묶는 전략은 이 카테고리에서 Qwen만의 축이다 — 단, 2026-08-15 기준 27B는 아직 공개되지 않았다(레포·카드·라이선스 파일 부재). 예고를 도입 계획에 넣지 말 것.

약점 — 뭘 못하나

1. 공개 체크포인트가 API 모델과 같은 물건이 아니다

이 글에서 가장 중요한 사실이고, 1차 출처로 확인된 유일한 약점이다. 발표와 보도는 Qwen3.8-Max를 텍스트·이미지·영상 입력에 1M 컨텍스트로 소개했다. 그런데 실제 공개된 Qwen/Qwen3.8-2.4T-A95B 카드텍스트 전용이라고 명시한다 — "Multimodal inputs are not supported." 컨텍스트도 네이티브 262,144이고 1M은 확장 시 수치다.

벤치를 보고 고른 모델과 다운로드한 모델이 같지 않다. 멀티모달을 기대하고 가중치를 받으면 그 기능이 없다. 이 카테고리에서 모델 카드와 API 스펙 대조를 필수 절차로 만든 사례가 이 모델이다.

2. 라이선스가 표준 OSI가 아니다

HF 카드의 라이선스는 qwen3.8-max라는 자체 규약이다. GLM 5.2의 MIT처럼 검토가 끝나 있는 물건이 아니고, Kimi K3 License와도 다른 별개 조약이다. 상업 이용 조건을 직접 읽고 법무 검토를 태워야 한다. 일부 보도는 대규모 상업 이용에 수익 배분 요건이 붙는다고 전하는데, 모델 카드 본문에는 그 내용이 확인되지 않는다 — 조항 원문을 직접 확인할 것.

3. 코딩 본체 벤치는 닫힌 프런티어에 못 미친다

저자 보고 기준으로도 SWE-bench Pro 67.7 vs Fable 5 80.0, FrontierSWE 73.5 vs Fable 5 88.8이다. 강점 2의 에이전틱·문서 축과 달리, 코드 수정 본체 축에서는 격차가 뚜렷하다. "Opus 4.8을 앞선다"는 헤드라인은 Terminal-Bench 한 칸에 걸려 있지 전 영역이 아니다.

4. 독립 종합 지수 등재가 없다

Kimi K3(57)·GLM 5.2(51)는 AA 지능 지수에 등재돼 같은 축에서 비교된다. Qwen3.8-Max는 2026-08-15 기준 그 자리가 비어 있어, 이 카테고리 안에서 줄을 세울 수 없다. 벤더 발표만으로 순위를 매기면 틀린다.

5. thinking mode 강제

카드는 모든 상호작용에 thinking mode가 필요하다고 적는다. 짧고 반복적인 호출에서 thinking 토큰이 그대로 비용·지연으로 쌓인다는 뜻이다. 대량 저지연 워크로드에는 구조적으로 안 맞는다.

어느 작업에 뭘 쓰나

  • Max 급 가중치를 직접 보유해야 함 → Qwen3.8-Max. 단 라이선스 조항을 먼저 읽는다.
  • 연구 문서·터미널 에이전트 → Qwen3.8-Max(PaperBench·Terminal-Bench 저자 보고). 표준 보드 대조 후 재확인.
  • 멀티모달이 필요 → 공개 체크포인트로는 불가(텍스트 전용). Kimi K3가 오픈웨이트에서 네이티브 비전을 가진 자리다.
  • 라이선스 리스크 최소화GLM 5.2(MIT).
  • 오픈웨이트 능력 최상위Kimi K3(AA 57). Qwen은 독립 지수 등재 자체가 없다.

결론

Qwen3.8-Max의 뉴스는 Max 티어가 열렸다는 것이고, 교훈은 열렸다는 말을 스펙으로 확인해야 한다는 것이다.

  1. 개방의 범위 — Max 급 2.4T를 받을 수 있다. 계열 최초이고 이 카테고리의 상한을 넓혔다.
  2. 개방의 조건 — 라이선스가 자체 규약이라 검토가 남고, 공개 체크포인트가 API 모델보다 좁다(텍스트 전용·네이티브 262K). 이 두 가지가 도입 판단의 본체다.
  3. 능력 — 에이전틱·문서 축은 닫힌 프런티어와 겹치되 저자 보고고, 코드 수정 본체는 격차가 남는다. 독립 지수 등재 전까지 순위 단정 보류.

출처

1차 자료

발표·보도 (저자 보고 수치)

관련 글

같은 주제