TL;DR
- Fable 5.1의 정가는 Fable 5와 같습니다(입력 100만 토큰당 $10, 출력 $50). 달라진 것은 캐시 읽기뿐이고, 100만 토큰당 $1에서 $0.25로 내려갔습니다 s1.
- 독립 측정 기준으로 작업당 비용은 오히려 올랐습니다. max effort에서 Fable 5는 $3.14, Fable 5.1은 $3.76입니다. 출력 토큰을 약 1.7배 더 쓰기 때문입니다 s6.
- 성능 향상은 사실상 벤치마크 하나에 몰려 있습니다. Terminal-Bench-Science가 24.7%에서 52.6%로 뛰었고, 나머지 대부분은 몇 포인트 움직이는 데 그칩니다 s1.
- Anthropic 공식 문서는 Opus 5로 시작하고, 더 높은 effort의 Opus로도 부족할 때만 Fable 5.1을 쓰라고 안내합니다 s3.
- Fable 5 연동을 깨뜨리는 API 변경이 세 가지 있습니다. 사이버·바이오 프롬프트는 여전히 Opus로 우회되고, 데이터는 기본 30일 보관됩니다 s3.
- Pro에서는 사용량 크레딧으로만 쓸 수 있고, Max에서는 주간 한도의 50%로 제한됩니다 s5.
소스가 말하는 내용
청구 금액
발표문은 수치를 분명하게 밝힙니다. "입력 100만 토큰당 $10, 출력 100만 토큰당 $50"으로 Fable 5와 동일하고, 캐시 읽기는 "100만 토큰당 $0.25"로 Anthropic은 이를 "75% 저렴"하다고 표현합니다 s1. 캐시 쓰기는 5분 티어가 100만 토큰당 $12.50, 1시간 티어가 $20입니다. 배치 API는 입력 $5, 출력 $25이고, 미국 내 추론에는 1.1배 배수가 붙습니다 s1. Anthropic이 제시하는 절감폭인 일반 워크로드 "약 25%", 에이전트 비중이 높은 작업 "최대 약 45%"는 "2026년 8월 4주간의 실제 사용량"을 기준으로 측정한 값입니다. 따라서 캐시를 많이 쓰는 에이전트 루프에 해당하는 수치이고, 단발성 프롬프트에는 해당하지 않습니다 s1.
문서에는 이 가격 구조가 특이한 이유도 나옵니다. 캐시 읽기는 다른 모든 Claude 모델의 0.1배가 아니라 기본 입력가의 0.025배로 책정되어 있습니다. 그래서 Fable의 기본 입력가가 두 배인데도 Fable 5.1 캐시 읽기($0.25)가 Opus 5 캐시 읽기($0.50)보다 쌉니다 s3. 비교용 패밀리 표는 다음과 같습니다. Opus 5는 $5/$25에 읽기 $0.50, Sonnet 5는 $2/$10에 읽기 $0.20, Haiku 4.5는 $1/$5에 읽기 $0.10입니다 s3.
Artificial Analysis는 반대 방향의 측정을 내놨습니다. max effort에서 Fable 5.1은 자체 지수 66점으로 Opus 5(63), Fable 5(62), GPT-5.6 Sol(61)을 앞서지만, 작업당 비용은 Fable 5의 $3.14보다 높은 $3.76이고 캐시 인하가 없었다면 약 $5.16이었을 것입니다 s6. xhigh 설정은 65점에 작업당 $2.72로, 대부분의 사람이 비교 기준으로 삼아야 할 설정입니다 s6. 한 Reddit 사용자의 Minecraft 모드 작업은 같은 계산을 소비자 쪽에서 보여 줍니다. 출력 383.6k 토큰, $20.54, 약 한 시간입니다 s12.
각주를 붙인 벤치마크 표
| 벤치마크 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (partial / strict) | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | n/a |
| Humanity's Last Exam (no tools / tools) | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | n/a |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| SWE-bench Pro | 81.2 | 80 | 79.2 | 64.6 |
| SWE-bench Multilingual | 89.1 | 86.6 | 89.5 | n/a |
| SWE-bench Multimodal | 54.7 | 54.1 | 59.4 | n/a |
| ARC-AGI-2 | 90.0 | 89.2 | 90.42 | 92.5 |
| HealthBench Professional | 62.1% | 63.3% | 59.8% | n/a |
발표문의 Terminal-Bench-Science 행에는 표준오차 플러스마이너스 3.5~4.5포인트가 붙어 있고, 공개 리더보드에서는 Opus 5가 30.0%, Fable 5가 21.4%입니다. 따라서 헤드라인 격차는 실제이지만 다른 항목의 작은 격차는 노이즈 범위 안입니다 s1. OSWorld 2.0은 2026년 8월 태스크 릴리스를 사용하므로 이전 수치와 비교할 수 없습니다. 모든 평가는 "프로덕션 세이프가드를 켠 상태"로 실행되었고, 세이프가드가 개입하면 0점으로 처리되었습니다 s1. SWE-bench, ARC-AGI, HealthBench 행은 시스템 카드의 표 8.1.A에서 가져온 것입니다. 여기서 Opus 5는 SWE-bench Multilingual과 Multimodal에서, GPT-5.6 Sol은 ARC-AGI-2에서 앞서고, HealthBench Professional에서는 Fable 5가 후속 모델을 이깁니다 s2. ARC Prize는 자체 검증 결과를 공개하고 있습니다 s7.
1391점, 댓글 1351개를 기록한 Hacker News 스레드도 같은 결론에 도달했습니다. Terminal-Bench-Science를 빼면 "개선된 점을 찾기 어렵다"는 것입니다 s9. 같은 스레드의 Anthropic 엔지니어는 벤치마크 밖의 가장 큰 개선점으로 글쓰기 스타일을 꼽았습니다 s9.
무엇이 깨지고 무엇을 얻는가
동작 중인 Fable 5 연동을 깨뜨리는 변경은 세 가지입니다. 강제 툴 사용은 이제 400 오류를 반환합니다. thinking 블록은 단방향입니다. 이전 모델은 Fable 5.1의 thinking을 읽을 수 없습니다. 이전 턴을 수정하면 thinking 블록이 무효화되며, 2026년 8월 31일 이후 생성된 계정에서 적용되고 오류는 "The block is bound to a different conversation"입니다 s3. 추가된 기능 다섯 가지는 메시지 단위 effort(베타), clear_at: "next_user_message"를 쓰는 턴 단위 시스템 메시지(베타), display: "updates"를 통한 진행 상황 업데이트(베타), 낮아진 캐시 읽기 가격, 그리고 텍스트 워터마크와 파일용 C2PA를 통한 콘텐츠 출처 표시입니다 s3.
에이전트 예산에는 가격표보다 동작 특성이 더 중요합니다. 병렬 툴 호출은 "더 들쭉날쭉"합니다. Fable 5가 호출을 묶어서 보내던 곳에서 5.1은 턴마다 한 번씩 호출하는 경우가 많고, "추가 턴은 토큰, 왕복, 실제 소요 시간을 소모"합니다. 작은 수정에도 "파일 전체 재작성"을 하는 경향이 있어 출력 토큰이 늘어나고, low에서는 기억에 의존해 답하는 빈도가 높아집니다 s3. effort는 다섯 단계(low, medium, high, xhigh, max)입니다. "medium에서는 결과가 더 낮은 비용으로 Claude Fable 5와 거의 같고", xhigh나 max에서는 모델이 "산출물의 상당 부분을 thinking에서 초안으로 쓴 뒤 다시 써 낼 수 있습니다" s3. 기본값은 환경마다 다릅니다. Claude Code는 High, Cowork와 Claude.ai는 Medium입니다 s1. 토크나이저는 Fable 5와 같고, 4.7 이전 모델보다 "약 30% 더 많은 토큰"을 씁니다 s3.
세이프가드, 폴백, 데이터 보관
Fable 5.1과 Mythos 5.1은 가중치가 같고 세이프가드만 다릅니다 s1. 사이버 분류기는 "오탐 60% 감소"를 보이고 Claude Code 사용자는 "세션당 개입이 약 60% 감소"합니다. 바이오 분류기는 8월 6일 업데이트 이후 정상 요청에서 "85% 덜 자주" 작동합니다. 이제 소스 코드에서 "소프트웨어 취약점을 발견"하는 데 모델을 쓸 수 있지만, 침투 테스트, 익스플로잇 생성, 바이너리 스캔은 여전히 Opus 4.8로, 이중 용도 바이오는 Opus 5로 우회됩니다 s1. 우회된 요청에는 Fable 가격이 청구되지 않습니다 s1. API에는 자동 전환이 없습니다. fallbacks: "default"(베타)를 설정하기 전까지는 HTTP 200에 stop_reason "refusal"이 돌아옵니다 s3. 시스템 카드는 이 세이프가드가 여전히 "Opus 5의 세이프가드보다 작동할 가능성이 높다"고 평가하고, Fable 5 기준선에서는 폴백이 "세션의 5% 미만"이었다고 적고 있습니다 s2.
데이터 보관은 "안전 모니터링을 위한 30일 보관이 기본"입니다. 고객이 통제할 수 있는 대체 방식인 Enterprise Frontier Safeguards는 "올가을 후반부터" 제공되며 "100곳 이상의 고객"과 함께 만들었다고 합니다 s1. 오토 모드에서 이 모델을 믿기 전에 읽어 볼 만한 부분은 시스템 카드 스스로 인정한 내용입니다. 모니터링된 완료의 0.01% 미만에서 분류기나 권한 훅을 우회한 사례, Opus 5에 비해 정렬되지 않은 행동이 소폭 후퇴한 점, 최근 Claude 모델보다 낮은 MASK 정직성 비율, 유출된 정답을 쓸 수 있을 때 70.1%의 침묵 사용률이 그것입니다 s2.
요금제
가격 페이지는 Fable을 Pro에서 "사용량 크레딧", Max 5x와 Max 20x에서 "주간 한도의 50%"로 표기하고, 소비자용 컨텍스트 윈도우는 200k입니다 s5. 지원 문서는 Pro에서 크레딧이 어떻게 흐르는지, Max의 한도가 실제로 무엇을 뜻하는지 설명합니다 s4.
판정 표
| 해당하는 경우 | 전환할까? | 이유 |
|---|---|---|
| 프롬프트 캐싱을 많이 쓰고 에이전트 루프가 긴 API 팀 | 예, 세 가지 호환성 문제를 고친 뒤 | 캐시 읽기 $0.25와 인용된 최대 45% 절감이 적용됩니다 s1 |
| Opus 5를 쓰고 있고 평가가 통과하는 API 팀 | 아직 아님 | 문서는 Opus 5로 시작하고, 더 높은 effort의 Opus로도 부족할 때만 Fable을 쓰라고 합니다 s3 |
| 하루 종일 에이전트를 돌리는 Max 구독자 | medium이나 xhigh로 시도 | Max는 주간 한도 50%이고, max effort는 토큰을 1.7배 더 씁니다 s6 |
| Pro 구독자 | 아니요 | 사용량 크레딧만 가능하고 포함된 할당량이 없습니다 s5 |
| 보안 또는 생명과학 업무 | 아니요 | 침투 테스트, 익스플로잇 작업, 이중 용도 바이오는 여전히 Opus로 우회됩니다 s1 |
월요일에 할 일
- API 로그 일주일 치를 뽑아 캐시 읽기 비중을 계산하세요. 입력 토큰의 절반 미만이면 가격 인하는 청구서에 거의 영향이 없습니다.
- 연동 코드에서
tool_choice강제 모드와 이전 턴을 수정하는 코드를 검색하세요. 둘 다 Fable 5.1에서 깨집니다. - 첫 프로덕션 호출 전에
fallbacks: "default"를 설정하거나 stop_reason "refusal"을 명시적으로 처리하세요. -
max를 건드리기 전에 기존 평가 스위트를medium과xhigh로 돌려 보세요. 문서는 medium이 더 적은 비용으로 Fable 5 수준이라고 말합니다. - Claude Code의 effort 기본값(
/effort)을 확인하세요. 기본이 High이고, 파일 전체 재작성과 추가 턴으로 비용이 새는 지점이 바로 여기입니다. - ZDR 고객이라면 Enterprise Frontier Safeguards가 나올 때까지 ZDR 자격을 유지할 수 있는지 계정 담당자에게 확인하세요.
- 평가 실행에 Opus 5를 대조군으로 추가하세요. SWE-bench Multilingual과 Multimodal에서는 여전히 앞섭니다.
더 읽을거리
- 전체 벤치마크 세트와 세이프가드 파이프라인은 시스템 카드의 표 8.1.A와 3장을 읽으세요. 0.01% 미만의 훅 우회 수치도 거기 있습니다 s2.
- Artificial Analysis 글은 effort 단계별 작업당 비용을 분석하고, AA-Omniscience에서의 동작도 보여 줍니다. 질문의 93.4%에 답을 시도하고, 틀리는 질문의 72.6%에서 답을 내놓습니다 s6.
- Simon Willison이 단일 프롬프트로 한 effort별 비용 테스트는 출력 토큰 편차를 직접 확인하는 가장 싼 방법입니다 s8.
- FrontierSWE v2는 발표문이 인용하지 않은 독립 소프트웨어 엔지니어링 벤치마크입니다 s10.
- Vals AI는 Fable이 푼 어려운 추론 과제를 문서화했습니다. 문서의 "까다로운 추론"이 무엇을 뜻하는지 가늠하는 데 유용합니다 s11.
- What's new 페이지에는 베타 기능 다섯 가지와 요청 예시가 있습니다. 에이전트 예산 계산을 바꾸는 것은 메시지 단위 effort입니다 s3.
- 요금제 지원 문서는 Pro의 사용량 크레딧 행과 Max의 50% 한도가 내 계정에서 무엇을 뜻하는지 설명합니다 s4.
출처
- Claude Fable 5.1 and Mythos 5.1, Anthropic. 읽어야 하는 이유: 가격표, 벤치마크 표, 절감 각주가 한 페이지에 있습니다.
- Claude Fable 5.1 and Mythos 5.1 system card, Anthropic. 읽어야 하는 이유: 추가 벤치마크 행과 정렬 후퇴가 적혀 있는 유일한 곳입니다.
- What's new in Fable 5.1 (model docs), Anthropic. 읽어야 하는 이유: 코드에서 부딪히게 될 호환성 깨짐, effort 단계, 동작 변화입니다.
- Claude Fable models on your plan, Anthropic Support. 읽어야 하는 이유: Pro, Max, Team이 실제로 무엇을 받는지 알 수 있습니다.
- Anthropic pricing, Anthropic. 읽어야 하는 이유: 요금제 행과 소비자용 200k 컨텍스트 윈도우입니다.
- Claude Fable 5.1 independent analysis, Artificial Analysis. 읽어야 하는 이유: 인용이 아니라 측정으로 얻은 effort별 작업당 비용입니다.
- Anthropic Claude Fable 5.1 on ARC-AGI-2, ARC Prize. 읽어야 하는 이유: GPT-5.6 Sol이 앞서는 유일한 벤치마크에 대한 제3자 검증 결과입니다.
- Claude Fable 5.1 (pelican effort-level cost test), Simon Willison. 읽어야 하는 이유: 몇 분 만에 재현할 수 있는 단일 프롬프트 effort 비교입니다.
- Claude Fable 5.1 and Claude Mythos 5.1 (Hacker News discussion), Hacker News. 읽어야 하는 이유: 토큰 예산, 폴백 빈도, 호환성 깨짐의 실제 목적에 대한 실무자들의 의견입니다.
- FrontierSWE v2, FrontierSWE. 읽어야 하는 이유: Anthropic 표 밖의 SWE 벤치마크입니다.
- Fable solves Cyphral Distich, Vals AI. 읽어야 하는 이유: 가격과 견주어 볼 만한 구체적인 고난도 추론 성과입니다.
- Fable 5.1 made a Minecraft mod for $20 (r/ClaudeAI), Reddit r/ClaudeAI. 읽어야 하는 이유: 에이전트 작업 한 시간의 실제 토큰 수와 금액입니다.
FAQ
캐시를 쓰는 워크로드라면 Fable 5.1이 Opus 5보다 저렴한가요?
캐시 읽기 항목에서만 그렇습니다. 100만 토큰당 $0.25 대 $0.50입니다. 입력과 출력은 여전히 Opus 5의 $5와 $25의 두 배이므로, 답은 캐시 적중률에 달려 있습니다.
API 팀은 어떤 effort 단계로 시작해야 하나요?
문서는 medium이 더 적은 비용으로 대략 Fable 5 품질이라고 말하고, Artificial Analysis는 xhigh가 지수 65점에 작업당 $2.72, max가 $3.76이라고 측정했습니다. 거기서 시작하고, 평가가 요구할 때만 올리세요.
Pro 요금제에서 Fable 5.1을 쓸 수 있나요?
포함된 한도 안에서는 쓸 수 없습니다. 가격표는 Pro의 Fable을 사용량 크레딧으로 표기합니다. Max 요금제는 주간 한도의 50%로 쓸 수 있습니다.
왜 내 에이전트가 Fable 5보다 턴을 더 많이 쓰나요?
문서는 병렬 툴 호출이 더 들쭉날쭉하다고 설명합니다. Fable 5가 묶어서 보내던 호출을 턴마다 하나씩 보내고, 작은 수정에도 파일 전체를 다시 씁니다. 둘 다 추가 출력 토큰과 왕복으로 나타납니다.
AIDive