TL;DR. Gemini 3.1 Pro(Google DeepMind, 2026-02-19)는 추론·과학 코어다. 강점 — ARC-AGI-2 verified 77.1%(Gemini 3 Pro의 2배 이상), 써드파티 기준 GPQA Diamond 과학추론 1위(~95.5), Deep Think로 과학·연구·공학 난제, 멀티모달 기반 + 1M 컨텍스트. 약점 — 에이전틱·코딩·문서는 GPT-5.5에 밀리고(OfficeQA Pro 18.1로 큰 격차), 자기 후속 Gemini 3.5 Flash가 코딩·에이전틱에서 추월하며, GPQA 1위는 공식 페이지가 아닌 써드파티, Gemini CLI 단종 같은 운영 단절도 있다. 이 모델의 자리는 "제일 똑똑한 본체"가 아니라 "과학추론 1위 + 에이전틱은 후속에 양보"다.
업데이트 (2026-08-15) — 3.5 Pro가 아직 안 나왔다. 이 글의 유효기간이 오히려 늘었다. Google은 I/O(2026-05-19)에서 3.5 Pro를 "다음 달"로 예고했지만, 2026-07-21 Gemini 3종을 추가 출시하면서도 3.5 Pro는 내지 않았다 — 코딩·수학·환각 신뢰도를 잡느라 몇 달 밀렸다는 보도다. 그래서 아래 "후속에 자리를 넘기는 중"이라는 서술은 Flash 티어에 한정된다. Pro 티어의 현행 모델은 여전히 3.1 Pro고, 이 글이 다루는 추론·과학 한 칸은 대체된 적이 없다.
provenance 메모. 이 글은 Gemini 3.1 Pro를 직접 돌려본 후기가 아니다. Google 공식 발표(3.1 Pro·3.5·Omni)를 headless 브라우저로 직접 끌어와 받쳤다. 읽는 법 — 공식 발표가 직접 싣는 1차 수치는 ARC-AGI-2 77.1% 하나다. GPQA Diamond 1위(~95.5)는 써드파티(vals.ai) 값이고 공식 3.1 Pro 페이지엔 없다. 에이전틱·코딩 수치는 경쟁사 표(OpenAI GPT-5.5 발표)가 Gemini 3.1 Pro를 비교 대상으로 올린 값이라, 경쟁사가 자기 하네스로 잰 값임을 감안해 읽는다. 실측·체감은 없다.
한눈에
| 항목 | 값 |
|---|---|
| 모델 | Gemini 3.1 Pro (Gemini 3 시리즈) — 코어 추론 baseline |
| 출시 | 2026-02-19 (developer preview·Vertex AI·Gemini Enterprise·Gemini app·NotebookLM) |
| 포지셔닝 | "단순한 답으론 부족한 가장 복잡한 작업을 위한 더 똑똑한 모델" (공식) |
| 추론 (ARC-AGI-2, verified) | 77.1% — Gemini 3 Pro의 2배 이상 (공식 헤드라인) |
| 과학추론 (GPQA Diamond) | ~95.5 (1위) — 써드파티(vals.ai), 공식 페이지 미수록 |
| 컨텍스트 | 1M (Gemini 3 시리즈) |
| 세대 위치 | 후속 Gemini 3.5(2026-05-19)에 에이전틱·코딩 추월당하는 중 |
왜 이 페이지 — 빈 자리이자 낡은 자리
models 개요는 프런티어 본체를 Fable 5 · GPT-5.5 · Gemini 3.1 Pro 셋으로 줄세웠고, Fable 5·GPT-5.5는 단독 글로 다뤘다. Gemini는 벤더 페이지에서 이름만 불렸지 단독 글이 없었다 — 게다가 그새 세대가 갈렸다. 이 글이 그 빈자리를 채우면서 2026-02의 3.1 Pro → 2026-05의 3.5 전환을 같이 정산한다.
척추 하나를 먼저 깐다. Gemini 3.1 Pro의 자리는 "전 영역 최강"이 아니라 "추론·과학 1위"라는 한 칸이다. models 표가 그렇게 닫았고(GPQA 1위), 공식 발표도 그렇게 포지셔닝한다(ARC-AGI-2). 코딩·에이전틱은 처음부터 이 모델의 자리가 아니었고, 이제 자기 후속에게 그마저 양보하는 중이다.
강점 — 뭘 잘하나
1. 추론·과학 — ARC-AGI-2 77.1%가 공식 헤드라인
가장 단단한 1차 강점. 공식 발표는 "새로운 논리 패턴을 푸는 능력"을 재는 ARC-AGI-2에서 verified 77.1%를 헤드라인으로 든다 — Gemini 3 Pro 추론 성능의 2배 이상. 3.1 Pro는 이 블로그가 줄세운 Fable 5·GPT-5.5와 달리 코딩이 아니라 추론을 헤드라인으로 내건 유일한 본체다.
2. 과학추론 1위 — 단, 써드파티 값
이 블로그가 models 표에서 Gemini를 GPQA Diamond 과학추론 단독 1위(~95.5)로 줄세운 근거다(vals.ai 독립 평가, Fable·GPT-5.5는 ~93.2 공동 2위). 중요 단서 — 이 GPQA 1위는 공식 3.1 Pro 발표 페이지엔 없는 써드파티 값이다. 공식이 내건 건 ARC-AGI-2고, GPQA 1위는 독립 보드가 받친 별개 축이다 — 둘을 한 출처로 섞지 말 것.
3. Deep Think — 과학·연구·공학 난제 코어
공식 발표가 3.1 Pro를 "Gemini 3 Deep Think의 돌파를 가능케 한 업그레이드 코어 지능"으로 규정한다. Deep Think는 과학·연구·공학의 어려운 문제를 푸는 모드고, 3.1 Pro가 그 baseline이다. 코드 기반 애니메이션 SVG·복잡 시스템 합성·3D 인터랙티브 같은 추론을 실용으로 옮기는 작업이 권장 자리다.
4. 멀티모달 + 1M 컨텍스트
Gemini 3 시리즈는 네이티브 멀티모달로 설계됐고(공식), 1M 컨텍스트를 갖는다. 코딩 에이전트 모델 표에서 이미 long-context + thinking 강점으로 줄세운 그 축이다.
약점 — 뭘 못하나 / 단점
1. 에이전틱·코딩·문서는 GPT-5.5에 밀린다
GPT-5.5 공식 표가 Gemini 3.1 Pro를 비교 대상으로 올렸는데, 에이전틱·코딩·문서 전반에서 뒤진다 — Terminal-Bench 2.0 68.5(GPT-5.5 82.7), GDPval wins/ties 67.3(84.9), SWE-Bench Pro Public 54.2(58.6, 단 Opus 4.7이 64.3 선두), OfficeQA Pro 18.1(GPT-5.5 54.1·Opus 43.6 — 큰 격차로 꼴찌), Toolathlon 48.8(55.6). 단 이건 OpenAI가 자기 하네스로 잰 경쟁사 표라 격차 크기는 감안할 것. 방향은 분명하다 — 3.1 Pro는 추론 모델이지 에이전틱 최강이 아니다.
2. 자기 후속에게 그 자리도 추월당하는 중
가장 중요한 시점 약점. Gemini 3.5(2026-05-19, I/O)가 "행동하는 지능"으로 나오면서, 3.5 Flash가 Gemini 3.1 Pro를 코딩·에이전틱 벤치에서 직접 앞선다고 공식 발표에 명시했다 — Terminal-Bench 2.1 76.2%·GDPval-AA 1656 Elo·MCP Atlas 83.6%, 멀티모달 CharXiv Reasoning 84.2%, 그리고 출력 토큰/초가 다른 프런티어의 4배·비용은 절반 이하. 즉 3.1 Pro의 약점(에이전틱·코딩·속도·비용)을 정확히 겨냥한 후속이 이미 나왔다(3.5 Flash 출시, 3.5 Pro 후속). 3.1 Pro를 지금 새로 채택할 이유는 추론·과학 한 칸으로 좁아진다.
3. GPQA 1위는 공식이 아니다 — 출처를 갈라야
위 강점 2의 뒤집힌 면. 이 블로그가 가장 자주 인용하는 "Gemini 과학추론 1위"는 공식 발표가 직접 받친 값이 아니라 vals.ai 써드파티다. 공식 헤드라인은 ARC-AGI-2 77.1%고, GPQA는 별개 보드다. 1위 주장을 공식 1차로 착각하면 출처가 부풀려진다.
4. 운영 단절 — Gemini CLI 단종
운영 축의 실전 비용. 3.1 Pro 발표는 접근 경로로 Gemini CLI를 들었지만, 그 Gemini CLI는 2026-06-18부로 단종되고 Antigravity CLI로 강제 전환됐다(daily 아카이브). 전환 자체가 "bait and switch" 비판(HN 614점)을 받았다. 도입 경로가 세대 교체와 함께 흔들린다는 게 닫힌 본체의 운영 리스크다.
어느 작업에 뭘 쓰나
- 과학추론·신규 논리 패턴(ARC-AGI-2)·Deep Think → Gemini 3.1 Pro. 이 한 칸이 여전히 강점.
- 에이전틱·코딩·장기 자율 → 이제 후속 Gemini 3.5 Flash(3.1 Pro를 직접 앞섬) 또는 GPT-5.5.
- 엔터프라이즈 문서·지식 작업 → GPT-5.5(OfficeQA Pro 54.1 vs 3.1 Pro 18.1).
- 속도·비용 민감 → Gemini 3.5 Flash(4배 빠름·절반 이하 비용)가 3.1 Pro보다 낫다.
- 옴니모달 생성(영상) → 같은 벤더의 Gemini Omni(별개 라인).
결론
Gemini 3.1 Pro는 한 칸이 분명한 모델이다.
- 추론·과학 — ARC-AGI-2 77.1%가 공식 헤드라인이고, GPQA 1위(써드파티)가 이 블로그 표의 과학추론 정상을 받친다. 이 한 칸은 진짜다.
- 에이전틱·코딩 — 처음부터 이 모델 자리가 아니었고(GPT-5.5에 밀림), 이제 자기 후속 3.5 Flash에 그마저 추월당한다.
- 출처·운영 — 1위 주장은 공식이 아닌 써드파티고, Gemini CLI 단종처럼 도입 경로가 세대 교체와 함께 흔들린다.
한 줄 평 — 과학추론 1위라는 한 칸은 단단하되, 에이전틱·코딩·속도·비용은 이미 자기 후속(3.5 Flash)에 넘긴 모델. Google 본체를 새로 고른다면 추론·과학이면 3.1 Pro, 에이전틱·코딩·비용이면 3.5 Flash로 갈린다 — 그리고 3.5 Pro가 안 나온 2026-08 현재, 그 갈림은 한 세대 안에서 티어끼리 갈리는 비정상 상태로 유지되고 있다.
출처
1차 자료 (Google 공식 — 본문 직접 인출)
- Gemini 3.1 Pro: A smarter model for your most complex tasks (공식 발표·ARC-AGI-2·Deep Think, 2026-02-19)
- Gemini 3.5: frontier intelligence with action (후속 세대·3.5 Flash 벤치, 2026-05-19)
- Introducing Gemini Omni (옴니모달 생성 라인)
경쟁사 표·독립 평가
- OpenAI GPT-5.5 발표 — Gemini 3.1 Pro 비교 수치 (경쟁사 하네스 기준 에이전틱·코딩·문서)
- vals.ai — GPQA 보드 (과학추론 1위 — 공식 미수록)
- Gemini CLI → Antigravity CLI 전환 공지 (운영 단절)