leejk/ jk lee

OpenAI — GPT 모델 자리 · 2026.06

GPT-5.5

에이전틱·터미널 코딩, 엔터프라이즈 문서·과학추론, 가격 효율이 강점, raw SWE-Bench Pro 열세·환각·단독 1위 영역 부재가 약점

·
#models#openai#gpt#gpt-5-5#landscape

GPT-5.5(OpenAI, 2026-04-23 발표)가 무엇을 잘하고 무엇을 못하는지 강약으로 정리했다. 공식 발표 본문을 직접 끌어와 1차 수치로 받쳤다. 강점 — 에이전틱·터미널 코딩(Terminal-Bench 2.0 82.7% SOTA, Opus 4.7 69.4·Gemini 3.1 Pro 68.5 대비), 엔터프라이즈 문서·지식 작업(OfficeQA Pro 54.1% vs Opus 43.6·Gemini 18.1, GDPval wins/ties 84.9% vs Gemini 67.3), 가격 효율(API $5/$30 per MTok로 Fable 5의 절반 입력, "AA Coding Index SOTA at half the cost", GPT-5.4 지연 유지하며 토큰 더 적게), 과학추론 신호(FrontierMath Tier4 35.4 vs Gemini 16.7, Ramsey 수 새 증명 Lean 검증, GeneBench/BixBench 선두). 약점 — raw SWE-Bench Pro Public에선 Opus 4.7이 64.3%로 GPT-5.5(58.6)보다 앞서고(+memorization 각주), 써드파티 환각 벤치(AA-Omniscience) 85.53%는 약점이며, 단독 1위 영역이 없고(BrowseComp·MCP Atlas·FinanceAgent는 Opus/Gemini가 위), 공식 표의 비교 대상이 Opus 4.7·Gemini 3.1 Pro라 Fable 5와는 직접 비교가 아니다. 직접 돌린 게 아니라 공식 발표·집계·daily 아카이브를 읽고 출처별로 갈라 정리했다.

TL;DR. GPT-5.5(gpt-5.5, OpenAI, 2026-04-23)는 OpenAI가 "가장 똑똑하고 직관적인 모델 / real work를 위한 새 지능"으로 내놓은 본체 라인이다. 강점에이전틱·터미널 코딩(Terminal-Bench 2.0 82.7% SOTA), 엔터프라이즈 문서·지식 작업(OfficeQA Pro 54.1%로 Opus 4.7·Gemini 압도), 가격 효율(API $5/$30로 Fable 5의 절반 입력, "AA Coding Index를 경쟁 모델 절반 비용에"), 과학추론 신호(FrontierMath·Ramsey 수 증명 Lean 검증). 약점raw SWE-Bench Pro Public에선 Opus 4.7이 앞서고(64.3 vs 58.6, +memorization 각주), 써드파티 환각 벤치에서 85.53%로 약하며, 단독 1위 영역이 없다(BrowseComp·MCP Atlas·FinanceAgent는 Opus/Gemini가 위). 공식 표 비교 대상이 Opus 4.7·Gemini 3.1 Pro라 Fable 5와는 직접 비교가 아니다. 능력 신호는 출처를 갈라 읽어야 한다.

업데이트 (2026-08-15) — GPT-5.6이 플래그십을 가져갔다. 아래 분석은 2026-06 기준이다. GPT-5.6이 2026-07-09 공개됐고(06-26 제한 프리뷰 선행 — 정부 규제로 일반 출시가 밀린 케이스), Luna·Terra·Sol 3종 체제로 갈렸다. 아래 글의 두 축이 정확히 이 3종에 흡수됐다 — 가격 효율은 Terra(GPT-5.5급 성능을 절반 비용에)가, 에이전틱·터미널 코딩은 Sol(AA Coding Agent Index v1.1 80점, 출력 토큰 절반 이하·비용 약 1/3)이 가져갔다. 그래서 아래 "강점 1·3"은 살아 있되 주어가 바뀐다. 반대로 약점으로 짚은 단독 1위 영역 부재는 Sol이 사이버보안 축(08-10 GPT-5.6-Cyber)에서 한 칸을 잡으며 부분 해소됐다.

provenance 메모. 이 글은 GPT-5.5를 직접 돌려본 후기가 아니다. 단, OpenAI 공식 발표(2026-04-23) 본문을 headless 브라우저로 직접 끌어와 벤치 표·가격·컨텍스트를 1차 수치로 받쳤다. 읽는 법 — 아래 벤치는 OpenAI가 자기 발표에 올린 self-report 값이고, 비교 대상은 GPT-5.4·Claude Opus 4.7·Gemini 3.1 Pro다(Fable 5는 5.5보다 뒤(2026-06-09)에 나와 이 표에 없다). vendor self-report라 표준 보드 교차가 여전히 필요하고, 발표가 안 싣는 항목(GPQA·환각)은 써드파티(vals.ai·AA-Omniscience)로 갈라 표시했다. 실측·체감은 없다.

한눈에

항목
모델 ID gpt-5.5 (본체) — 변종: gpt-5.5 pro·gpt-5.5 codex·gpt-5.5-cyber, 직전 세대 gpt-5.4
출시 2026-04-23 ChatGPT·Codex, 04-24 API (System Card 동시)
포지셔닝 "our smartest and most intuitive to use model yet — a new class of intelligence for real work" (공식)
가격 (API) $5 / $30 per MTok (입력/출력) — gpt-5.5-pro는 $30 / $180. Batch·Flex 절반, Priority 2.5배
컨텍스트 API 1M / Codex 400K. Codex Fast mode 1.5배 속도·2.5배 비용
효율 GPT-5.4와 동일 per-token 지연 유지하며 같은 Codex 작업에 더 적은 토큰. NVIDIA GB200/GB300 NVL72 공동설계
비교 기준 공식 표는 vs Opus 4.7 · Gemini 3.1 Pro (Fable 5 아님)

왜 이 페이지 — 인덱스가 이름만 부르던 자리

models 개요는 프런티어 본체를 Fable 5 · GPT-5.5 · Gemini 3.1 Pro 셋으로 줄세웠고, Fable 5는 단독 글로 깊게 다뤘다. GPT-5.5는 개요 표와 OpenAI 벤더 페이지에서 이름만 불렸지 단독 글이 없었다. 이 글이 그 빈자리를 채운다 — 이번엔 공식 발표 본문을 직접 끌어와 1차 수치로.

먼저 깔아둘 사실 하나. OpenAI 공식 표의 비교 대상은 Opus 4.7과 Gemini 3.1 Pro다 — Fable 5가 아니다. Fable 5는 GPT-5.5보다 한 달 반 뒤(2026-06-09) 나왔다. 그래서 이 블로그가 다른 글에서 인용한 "GPT-5.5 vs Fable" 수치는 모두 써드파티 집계의 교차 비교고, GPT-5.5의 1차 데이터는 vs Opus 4.7 세대다. 이 시차를 모르면 비교가 어긋난다.

강점 — 뭘 잘하나

1. 에이전틱·터미널 코딩 — Terminal-Bench 2.0 SOTA

가장 단단한 1차 강점. 공식 발표 기준 Terminal-Bench 2.0 82.7%로, Opus 4.7(69.4)·Gemini 3.1 Pro(68.5)를 큰 폭으로 앞선다 — OpenAI는 이걸 "가장 강한 에이전틱 코딩 모델"의 근거로 든다. Expert-SWE(중간 추정 인간 완료 시간 20시간인 장기 코딩 내부 평가)에서도 73.1%로 5.4(68.5)를 앞서고, OSWorld-Verified 78.7%(Opus 78.0)·CyberGym 81.8%(Opus 73.1). 계획·반복·도구 조율이 필요한 명령줄/장기 작업이 가장 잘 맞는 자리다. Codex 생태계(Wasmer·Ramp·Nextdoor·Warp)가 이 강점에 얹힌다(wasmer·nextdoor).

2. 엔터프라이즈 문서·지식 작업 — OfficeQA Pro·GDPval 압도

이 블로그가 "측정된 우위 하나"로 잡았던 Databricks의 OfficeQA Pro 신기록이제 1차 수치가 붙는다GPT-5.5 54.1% vs Opus 4.7 43.6 vs Gemini 3.1 Pro 18.1. 격차가 크다. 직업적 지식 작업 종합인 GDPval(wins or ties) 84.9%도 Gemini(67.3)를 크게 앞서고, Investment Banking Modeling(내부) 88.5%. 문서·스프레드시트·업무 추론이 GPT-5.5의 측정 우위가 가장 뚜렷한 영역이다.

3. 가격 효율 — Fable의 절반 입력, "절반 비용에 SOTA"

Fable 5의 약점이던 가격($10/$50)에 정면으로 대비된다. GPT-5.5는 API $5/$30입력이 정확히 절반, 출력은 60%다. OpenAI는 "AA Coding Index에서 경쟁 프런티어 코딩 모델의 절반 비용으로 SOTA 지능"이라 주장한다. 게다가 GPT-5.4와 동일한 per-token 지연을 유지하면서 같은 Codex 작업에 더 적은 토큰을 쓴다 — Fable의 +30% 토크나이저와 반대 방향이다. 비용 민감 대량 워크로드에서 이 축이 크다.

4. 과학추론 신호 — FrontierMath·Ramsey 증명

순수 추론에서도 1차 신호가 있다. FrontierMath Tier 1–3 51.7%(Gemini 36.9), Tier 4 35.4%(Gemini 16.7)로 Gemini를 앞선다(단 5.5 Pro가 Tier 4 39.6으로 더 높다). 발표는 내부 GPT-5.5가 커스텀 하네스로 off-diagonal Ramsey 수의 오래된 점근 사실에 새 증명을 찾았고 Lean으로 검증됐다고 든다 — 코드·설명이 아니라 수학적 논증 기여다. GeneBench·BixBench(유전·생명정보) 공개 점수 모델 중 선두, "bona fide co-scientist" 주장. 단 과학추론 단일 1위는 여전히 Gemini다(아래 약점).

5. 운영 상대 이점 — Fable이 짊어진 제약을 안 진다

Fable 5의 약점 목록이 그대로 GPT-5.5의 상대 이점이다. Fable은 30일 retention 강제·ZDR 불가·새 토크나이저 토큰 +30%·문서화된 classifier 과차단 불만(TechCrunch)·분 단위 응답을 짊어진다. GPT-5.5는 이 중 retention·ZDR·토큰·가격 부담이 가볍다. 단 'classifier-free'는 아니다 — 발표가 "GPT-5.5에 더 강한(stricter) classifier를 배포"한다고 명시한다(사이버·생물). 즉 과차단 불만이 문서화된 건 Fable 쪽이지, GPT-5.5도 자체 사이버 세이프가드를 강화했다.

6. 작업별 변종 + 엔터프라이즈 유통

본체 + Pro(더 어려운 문제·고정확) + Codex + Cyber(Trusted Access) + 직전 5.4로 작업별 변종이 갈린다. 유통도 두껍다 — AWS Bedrock, Gartner 2026 코딩 에이전트 리더, 삼성 전사 도입, Ona 인수.

약점 — 뭘 못하나 / 단점

1. raw SWE-Bench Pro Public에선 Opus 4.7에 뒤진다

다른 글의 "scaffold를 걷어내면 GPT가 코딩 선두"라는 일반화는 벤치마다 다르다. OpenAI 자기 표에서 SWE-Bench Pro (Public)는 Opus 4.7이 64.3%로 GPT-5.5(58.6)·Gemini(54.2)보다 앞선다. 즉 깨끗한 공개 코딩 벤치 하나에선 GPT-5.5가 1위가 아니다. 게다가 OpenAI 자신이 이 벤치에 "memorization 증거가 보고됐다"는 각주를 단다 — 이 수치 자체를 능력 격차로 읽지 말라는 경고다. GPT-5.5의 코딩 강점은 Terminal-Bench·에이전틱 쪽이지, SWE-Bench Pro 단일 우위는 아니다.

2. 환각 — 써드파티 기준 약점

공식 발표 표는 환각 수치를 직접 싣지 않는다(AA-Omniscience를 AA Index 구성요소로만 언급). 써드파티 기준으로는 AA-Omniscience 85.53%(낮을수록 좋음)로 Fable 라인 36.18%두 배 이상이다. 1차 발표로 못 받치는 약점이지만, 정확성이 비용보다 중요한 작업이면 abstain·교차검증을 통합에 넣어야 한다.

3. 단독 1위 영역이 없다 — 도구·금융·브라우즈는 Opus/Gemini가 위

공식 표 안에서도 GPT-5.5가 모든 칸을 먹지는 않는다. BrowseComp 84.4는 Gemini(85.9)·자사 5.5 Pro(90.1)보다 낮고, MCP Atlas 75.3은 Opus(79.1)·Gemini(78.2)보다 낮으며, FinanceAgent v1.1 60.0은 Opus(64.4)·5.4 Pro(61.5)보다 낮다. 순수 과학추론(GPQA Diamond) 단독 1위는 Gemini 3.1 Pro. GPT-5.5의 자리는 "한 영역의 챔피언"이 아니라 "에이전틱·문서·가격에서 강하고 전반이 상위"다 — "제일 똑똑한 모델"을 기대하면 어긋난다.

4. 숫자가 vendor self-report — 표준 보드 교차가 남는다

이 글의 1차 수치는 OpenAI가 자기 발표에 올린 값이고, 비교 대상이 Opus 4.7·Gemini 3.1 Pro다. Fable 5와의 직접 비교가 아니고, 모든 모델이 같은 하네스로 도는 중립 표준 보드(Scale SEAL급) 대조도 아니다. Fable 5가 self-scaffold로 과대평가됐듯, 어느 vendor 표든 자기에게 유리한 하네스·프롬프트가 섞인다(이 표도 Tau2-bench를 프롬프트 조정한 타 랩 결과는 빼고 자사 original 98.0만 싣는다). 방향은 1차로 받쳐지되 격차 크기는 중립 보드가 정산할 때까지 보류.

어느 작업에 뭘 쓰나

  • 에이전틱·터미널·컴퓨터 유즈 코딩 → GPT-5.5(Terminal-Bench 2.0 SOTA). 단 raw SWE-Bench Pro Public 단일 비교에선 Opus 4.7이 앞섬을 알고 읽을 것.
  • 엔터프라이즈 문서·지식 작업 → GPT-5.5(OfficeQA Pro·GDPval 압도).
  • 비용 민감 대량 추론 → GPT-5.5($5/$30, Fable의 절반 입력 + 토큰 효율).
  • 정확성이 비용보다 중요(낮은 환각 필수) → 써드파티 기준 GPT-5.5가 약함. Fable이 낫다.
  • 순수 과학추론 최상위Gemini 3.1 Pro(GPQA 단독 1위). GPT-5.5는 FrontierMath는 앞서나 GPQA 단독 1위는 아니다.
  • 도구 오케스트레이션(MCP)·금융 에이전트·브라우징 → Opus 4.7·Gemini가 공식 표에서 위.

결론

이번엔 1차 발표를 직접 끌어와 줄세웠다.

  1. 코딩에이전틱·터미널은 SOTA(Terminal-Bench 82.7), 단 raw SWE-Bench Pro Public은 Opus 4.7이 앞서고 OpenAI 스스로 그 벤치에 memorization 각주를 단다. "코딩 단독 선두"는 영역을 쪼개야 참이다.
  2. 가격·문서$5/$30(Fable 절반 입력) + OfficeQA Pro 압도가 GPT-5.5의 가장 깨끗한 1차 강점이다. 엔터프라이즈·비용 민감 워크로드의 실전 선택지.
  3. 출처 — 1차 수치를 받쳤지만 vendor self-report에 비교 대상이 Opus 4.7이라, Fable 5와의 직접 비교와 중립 표준 보드 정산은 남는다.

한 줄 평 — 에이전틱 코딩·엔터프라이즈 문서·가격에서 강한 본체, 단 raw SWE-Bench Pro 단일 우위는 아니고 환각이 약점. "제일 똑똑한 한 모델"을 찾으면 영역마다 답이 갈리고, GPT-5.5는 에이전틱·문서·가격 축을 맡는 자리다.

출처

1차 자료 (OpenAI 공식 — 본문 직접 인출)

집계·독립 평가 (1차 발표가 안 싣는 항목)

관련 글

같은 주제