leejk/ jk lee

Claude — Anthropic 모델 자리 · 2026.06

Claude Fable 5

장기 자율·코딩·비전·낮은 환각이 강점, 과학추론·과차단·가격·운영 제약이 약점

·
#models#claude-fable-5#anthropic#landscape

Claude Fable 5가 무엇을 잘하고 무엇을 못하는지 강약으로 정리했다. 강점 — 장기 자율 실행(Stripe 2개월치 마이그레이션 하루), 코딩(SWE-Bench Pro 80.3%·FrontierCode 1위), vision-only 비전, 메모리 활용(Opus 4.8 대비 3배), 낮은 환각과 추론 토큰 효율. 약점 — 과학추론은 단독 1위 아님(GPQA Diamond 3위), safety classifier 과차단으로 보안·생명과학 인접 작업 거부, Opus 4.8의 2배 가격, 30일 retention 강제·ZDR 불가·새 토크나이저 +30% 토큰·분 단위 응답시간 같은 운영 제약. 능력 신호 다수는 vendor self-claim이라 출처를 갈라 읽어야 한다.

TL;DR. Claude Fable 5(claude-fable-5)는 Anthropic이 일반 공개한 가장 강한 모델. 강점 — 장기 자율 실행·코딩·비전·메모리 활용, 그리고 낮은 환각 + 추론 토큰 효율. 약점 — 과학추론은 단독 1위가 아니고(GPQA Diamond에서 Gemini·GPT-5.5에 뒤짐), safety classifier가 보안·생명과학 인접 작업을 과차단하며, 가격이 Opus 4.8의 2배라 반복 작업엔 과하다. 운영 제약(30일 retention 강제·ZDR 불가·토큰 +30%·분 단위 응답)도 같이 따라온다. 능력 신호 상당수는 vendor self-claim이라 출처를 갈라 읽어야 한다.

업데이트 (2026-07-01) — 접근 복원, 단 Fable 5만. 아래 6월 중단은 해제됐다. 미 상무부가 2026-06-30 export control을 풀었고, Anthropic은 7월 1일부터 Fable 5를 Claude Platform·Claude.ai·Claude Code·Claude Cowork에서 전 세계 사용자에게 다시 열었다(Anthropic — Redeploying Claude Fable 5 · CNBC 2026-06-30). 유료 플랜은 7월 7일까지 주간 사용량 한도의 최대 50%까지 Fable 5 포함, 이후는 usage credit 필요. 갈린 건 Mythos 5다 — 2026-06-26 정부 승인에 따라 미국 조직 일부에만 복원됐고, Anthropic은 Project Glasswing으로 대상을 넓히는 중이다. 즉 Fable 5는 일반 접근 정상, Mythos 5는 여전히 제한.

업데이트 (2026-06-12) — 전면 접근 중단 (해제됨, 위 항목 참조). 출시 사흘 만에 미 정부가 국가안보 권한을 들어 export-control 지시를 내려, Fable 5·Mythos 5를 외국 국적자 전원(미국 내외 불문, Anthropic 외국인 직원 포함)에 대해 차단하라고 요구했다(Anthropic 성명, 2026-06-12 17:21 ET 수령). Anthropic은 컴플라이언스를 위해 두 모델을 전 고객 대상으로 비활성화했고(다른 모델은 영향 없음), 명분은 정부가 Fable 5 우회(jailbreak) 방법을 인지했다는 것. Anthropic은 이를 오해로 봤다(코드 리뷰·결함 식별을 시키는 좁고 비보편적인 우회, 타 모델에도 흔함). 출처 주의 — Anthropic 성명은 1차 자료지만 정부와 대립하는 자기이해 당사자라, '오해' 프레이밍은 중립 보도(CNBC·Bloomberg)로 교차할 것. 18일 만에 풀렸다는 사실 자체가 축이다 — 닫힌 프런티어의 접근권은 벤더가 아니라 규제 당국이 쥔 변수라는 게 실증됐다.

검증 메모 (2026-06-11, 적대적 council 감사 반영). 아래 벤치 숫자는 써드파티 집계 출처이고, 핵심 한 가지가 검증에서 걸렸다 — 코딩 격차(SWE-Bench Pro 80.3 vs 58.6, FrontierCode Diamond 29.3 vs 5.7)는 Anthropic 자체 scaffold 값과 중립 하네스 값을 섞은 것이라 같은 축이 아니다. 모든 모델이 같은 도구로 도는 표준 보드(Scale SEAL급)에선 GPT-5.x급이 ~59%로 앞서 순위가 뒤집힌다. 코딩 '압도'는 능력 격차가 아니라 상당 부분 하네스 아티팩트로 읽을 것. 또 이 글은 Claude Code로 작성됐고 대상이 Anthropic 모델이라 구조적 이해상충이 있다 — pro-Fable 프레이밍은 비-Anthropic 1차 출처로 교차검증 권장.

한눈에

항목
모델 ID claude-fable-5 (Mythos 5 = 같은 모델, classifier 없는 Glasswing 한정 버전)
컨텍스트 / 출력 1M(기본값이자 최대) / 128K
가격 $10 / $50 per MTok (입력/출력) — Opus 4.8($5/$25)의 2배
출시 2026-06-09, API·Bedrock·Vertex·Foundry GA — 06-12 정부 지시로 중단됐다가 07-01 전 세계 복원(위 업데이트)
사고 adaptive thinking 항상 on, raw chain-of-thought 미반환(요약만)

강점 — 뭘 잘하나

1. 장기 자율 실행 — 가장 큰 강점

Anthropic 발표의 헤드라인은 "어떤 이전 Claude보다 오래 자율로 일한다". 대표 사례 — Stripe가 팀이 2개월+ 걸렸을 코드베이스 전면 마이그레이션을 하루에 완료(vendor self-claim). 큰 리팩토링·오버나잇 코딩·다단계 에이전트 루프처럼 사람이 중간에 안 붙는 작업이 가장 잘 맞는 자리. 권장 사용 — effort high/xhigh + 전체 스펙을 첫 턴에 한 번에 주기.

2. 코딩 — 강하되 '압도'는 미검증

코딩이 강점인 건 맞다. 단 흔히 인용되는 격차는 조심해서 읽어야 한다. 집계상 SWE-Bench Pro 80.3%로 GPT-5.5(58.6)·Gemini(54.2)를 앞서지만, 이 80.3%는 Anthropic 자체 scaffold 값이고 GPT 수치는 중립 하네스 값이라 같은 축이 아니다. 모든 모델이 같은 도구로 도는 표준 보드(Scale SEAL급)에선 GPT-5.x급이 ~59%로 앞서고 최고 Claude는 ~52% — 순위가 뒤집힌다. FrontierCode Diamond 29.3 vs 5.7 같은 5배 격차는 더 의심스럽다(같은 GPT-5.5가 GPQA 92.8을 받는 모델이다). 방향(Fable 코딩 강함)은 맞지만 격차 크기는 vendor scaffold 아티팩트다. Cognition FrontierCode 전체 최고점·Hebbia 금융 최고점은 vendor 보고.

3. 비전 — vision-only로 SOTA

포켓몬 FireRed를 복잡한 헬퍼 없이 vision-only 최소 하네스로 클리어(이전 Claude는 헬퍼 필요). 스크린샷·문서·차트 이해, 컴퓨터 유즈 같은 비전 의존 작업에서 강하다.

4. 메모리 활용

파일 기반 메모리를 쓰고 다시 꺼내 쓰는 능력이 좋다. Slay the Spire 실험에서 메모리 효과가 Opus 4.8 대비 3배. 세션을 넘나드는 장기 에이전트에서 메모를 남기고 활용하는 결이 강하다.

5. 낮은 환각 + 추론 토큰 효율

독립 환각 벤치(AA-Omniscience, 낮을수록 좋음)에서 Claude 라인 36.18% vs GPT-5.5 85.53% — 두 배 이상 낮다. 다섯 벤치 중 1차 출처가 가장 탄탄한 수치(AA가 벤치 원저자). 단 단서 둘 — AA 자체 분석은 Claude의 낮은 환각이 더 자주 abstain/거부하는 행동 특성에서도 온다고 본다(순수 지식 우위만은 아님). 또 36.18%는 'Claude 라인' 일반값이라 Fable 5 단독값 확인 필요. 추론 효율도 강점 — 물리 리서치에서 GPT-5.5가 4일 걸린 지점에 추론 토큰 1/3로 근접(vendor 보고).

약점 — 뭘 못하나 / 단점

1. 과학추론은 단독 1위가 아니다

GPQA Diamond에서 Gemini 3.1 Pro가 선두다(독립 평가 vals.ai 기준 ~95.5). 단 흔히 도는 "Fable 3위(GPT-5.5에 뒤짐)"는 부정확하다 — vals.ai에선 Fable 5와 GPT-5.5가 ~93.2로 공동 2위(동률)다. 즉 순수 과학추론은 Fable의 최상위 자리가 아니지만, GPT-5.5에 진다고 단정할 근거는 약하다. "가장 똑똑한 모델"은 영역마다 다르다.

2. safety classifier 과차단 — 못 하는 작업이 생긴다

가장 실전적인 약점. TechCrunch 보도 — 사이버 classifier가 키워드 기반이라 합법적 보안 작업을 광범위하게 막는다. IBM X-Force의 Valentina Palmiotti "블로그 글 읽기 같은 무해한 것도 거부", Matt Suiche "cybersecurity 어휘장에 걸리면 다 트리거… 보안 코드 요청이 사이버 작업으로 오인", 다른 연구자 "코드 리뷰 요청만 해도 막힌다". 막히면 stop_reason: "refusal"로 거부되고 Opus 4.8로 다운그레이드된다. 보안·생명과학 인접 워크로드면 과차단이 일상 비용.

3. 가격 — Opus 4.8의 2배

$10/$50로 Opus 4.8($5/$25)의 정확히 2배. 짧고 반복적인 작업에는 cost-benefit이 안 맞는다 — 이런 작업은 Opus 4.8이 절반 가격에 충분. 게다가 새 토크나이저가 같은 내용에 ~30% 더 많은 토큰을 쓰므로, 체감 비용 차이는 2배보다 더 벌어진다.

4. 운영 제약이 많다

  • 30일 retention 강제·ZDR 불가 — ZDR이 계약·규제상 필수인 조직은 아예 쓸 수 없다(400 에러).
  • 새 토크나이저 +~30% 토큰 — max_tokens·컨텍스트 예산을 재측정해야 한다.
  • assistant prefill 불가 — prefill로 출력 형식 강제하던 코드는 structured output으로 갈아야 한다.
  • 분 단위 응답시간 — 어려운 작업은 단일 요청이 수 분 걸린다. 타임아웃·스트리밍·진행 표시를 설계에 넣어야 함.
  • refusal 처리 부담 — classifier 거부를 정상 상태로 다뤄 fallback 경로를 통합에 넣어야 한다.

5. 조용한 성능 저하 우려

비판 블로그(jonready)가 짚는 약점 — model card에 safeguard는 사용자에게 보이지 않고 prompt modification·steering vector·PEFT로 작동한다고 명시됐다. AI 개발 인접 작업에서 성능이 조용히 떨어져도 모델이 헷갈린 건지 정책이 막은 건지 구분이 안 된다는 신뢰 문제. 경계가 모호해 진단이 불가능하다는 게 핵심.

언제 쓰고 언제 안 쓰나

쓰면 좋은 자리

  • 큰 리팩토링·오버나잇 코딩·다단계 자율 에이전트 (장기 자율 강점)
  • 1M context 깊은 추론, 비전 의존 작업
  • 정확성이 비용보다 중요한 작업 (낮은 환각)

안 쓰는 자리

  • ZDR 필수 조직 (아예 불가)
  • 보안 리서치·offensive 작업 (classifier 차단)
  • 짧고 반복적인 작업 (Opus 4.8이 절반 가격에 충분)
  • 순수 과학추론 최상위가 필요 (Gemini가 앞섬)
  • 프런티어 생물·화학 연구로 ungated가 진짜 필요 → 이건 Fable이 아니라 Mythos 5/Glasswing 영역

Mythos 5와의 관계

같은 모델, classifier만 제거한 버전. Project Glasswing 승인 고객(생물 연구자 일부)에게만 열린다. 능력·가격·스펙 동일. 위의 과차단 약점이 없는 대신, 일반 접근이 불가능. Mythos Preview 후속.

접근 중단 — 진짜 탈옥됐나, 정부가 성급했나

위 업데이트의 후속. 6각도 검색·20소스·적대적 3표 검증 기반으로 두 질문을 따로 본다. 전제 — 이 사안은 거의 모든 핵심 주장이 분쟁 당사자 Anthropic의 자기이해 성명에서 나오는 비대칭 구조다(정부는 기술 증거 무공개·반박 무). 아래는 그 비대칭을 깐 위에서의 정리.

진짜 탈옥되나 — 좁은 의미로만 Yes

  • 좁은 탈옥은 실재. 독립 연구자(Pliny the Liberator 등)가 출시 48시간 안에 우회 성공 — 유니코드/호모글리프 치환·롱컨텍스트 프레이밍·서사 픽션·분해-재조합을 겹쳐 익스플로잇 코드와 화학/사이버 정보를 끌어냄(SecurityWeek, cybersecuritynews).
  • 단 '보편 탈옥'은 아무도 못 찾았다. 1,000시간+ 레드팀(Anthropic + 정부·UK AISI 검토 포함)에서 광범위하게 세이프가드를 무너뜨리는 방법은 안 나옴. SecurityWeek도 "이건 narrow bypass, 보편 탈옥 주장한 연구자 없음"으로 명시. cybersecuritynews는 약점을 Fable 고유가 아니라 모델 전반에 전이되는 구조적 문제로 본다 — Anthropic의 "신규성 없음" 프레이밍과 일치하되, 그 일치 자체가 검증은 아니다(불가능을 증명할 수 없다는 한계, dev.to 비평이 정확히 지적).

정부가 성급했나 — 공개 근거만 보면 정황상 그렇다, 단 확정 불가

  • 속도·범위: 출시(6/9)→직권 중단(6/12) 사흘, 17:21 ET 수령 당일 전 고객 셧다운. 범위는 외국 국적자 전원(미국 내외·자사 외국인 직원 포함) — 좁은 기술 근거 대비 넓다.
  • 근거 빈약: 서한엔 구체 명세 없이 "국가안보 권한"만. Anthropic은 정부가 구두 증거만 줬다고 함.
  • 결정적 정황(Axios, 3-0 검증): 실제 방아쇠는 정부가 시연한 보편 탈옥이 아니라 — 다른 회사가 "Mythos를 탈옥할 수 있다"고 주장한 것. 트리거(타사의 Mythos 주장)와 인용 근거(정부가 Fable에 시연한 좁은 기법)가 부분적으로 뒤섞여 있고 둘 다 독립 검증 안 됨.

Anthropic 편향을 깎는 단 하나의 반대 증거

  • 독립 벤치 ExploitBench(techloy·digitalapplied 2차 보도): Fable 5 ~78% vs GPT-5.5 ~34%공격적 익스플로잇 능력 큰 격차. 사실이면 Anthropic의 "능력은 타 모델에 흔함" 방어를 정면으로 약화. 단서 둘 — 이건 공격적 익스플로잇 측정이고 인용된 탈옥은 방어적 결함 수정이라 축이 다름; 출처도 블로그/집계라 저신뢰.

한 줄 판정

공개 기록만 보면 정부 조치는 기술적 정당화 대비 과도·성급해 보인다(사흘·전세계 외국인·구두 증거·타사 주장이 방아쇠). 그러나 정부가 기술 증거를 일절 공개하지 않아 확정 불가, ExploitBench 격차가 사실이면 "흔한 능력" 방어는 흔들린다. 핵심은 Anthropic 서사가 사실상 유일한 1차 소스인 비대칭 — 한쪽 말로 결론 내지 말 것.

미해결 (추적 대상). ①정부 구두 증거의 실제 내용 ②Mythos 탈옥을 주장한 '다른 회사'의 정체·검증 여부 ③ExploitBench 격차의 방법론 타당성 ④BIS가 발동한 법적 근거·이후 복원/소송 여부.

종합

한 줄 평 — 장기 자율·코딩·비전·낮은 환각에서 프런티어 최상위, 단 과학추론은 2등급이고 과차단·가격·운영 제약이 분명한 비용. 정확성과 자율성이 비용보다 중요한 무거운 작업이면 1순위, 짧고 반복적이거나 보안 인접이거나 ZDR이 필요하면 Opus 4.8이나 다른 모델이 낫다.

참고

1차 자료 (Anthropic 공식)

비판·담론

접근 중단 보도 (2026-06-12)

탈옥·레드팀 검증

벤치·집계 (공개 전 1차 보드 대조 필요)

관련 글

같은 주제