AIDive

Fable 5.1 리뷰: 가격은 내렸는데 청구서는 오르는 이유

AIDive · 게시

AI 모델코딩 에이전트

4년 묵은 크래시 해결, 그리고 환불 요구

Claude Fable 5.1은 Anthropic이 2026년 9월 1일 공개한 프런티어 추론 모델입니다. 한 쌍 중 구매할 수 있는 쪽이고, 나머지 한쪽인 Mythos 5.1은 안전장치가 더 적은 대신 검증된 프로그램에만 제공됩니다. 같은 주에 상반된 반응이 두 개 나왔는데, 둘 다 사실입니다.

Millennium에는 약 100만 번 실행에 한 번꼴로 죽는 코드가 있었고, 팀의 누구도 4~5년 동안 설명하지 못했습니다. Fable 5를 포함해 시도한 모든 모델이 놓쳤습니다. 처음으로 찾아낸 것이 Fable 5.1입니다.

같은 주에 한 프랑스 크리에이터는 리뷰 제목을 "환불을 요구합니다"로 달았고, 이 모델들의 순위를 매기는 Artificial Analysis는 Fable 5.1을 지수 1위에 올리면서 동시에 작업당 비용이 Fable 5보다 20% 높다고 측정했습니다.

둘 다 맞는 이유는, 이번 업그레이드가 원시 성능의 도약이 아니라 대체로 경제적·행동적 변화이기 때문입니다. 단일 항목의 가격 인하, API 추가 다섯 가지, 호환성을 깨는 변경 세 가지, 다시 쓴 안전장치 두 가지. 나에게 맞는지는 깨알 같은 조항이 결정합니다.

Mythos와 같은 가중치, 그리고 "Opus부터 시작하라"

Anthropic의 표현 그대로, Fable 5.1과 Mythos 5.1은 안전장치 수준만 다른 같은 모델입니다. Mythos는 제한이 없는 빌드로, 검증된 사이버·생명과학 프로그램 전용입니다. 살 수 있는 쪽은 Fable입니다.

사양 Fable 5.1
컨텍스트 윈도우 100만 토큰
최대 출력 128K 토큰
Thinking 적응형, 항상 켜짐, 끌 수 없음
지연 시간 문서상 "더 느림"
지식 컷오프 2026년 6월
effort 단계 5단계, low부터 max까지
기본 effort Claude Code에서 high, Co-work와 claude.ai에서 medium
가격 입력 100만 토큰당 $10, 출력 $50

모델 문서의 한 문장은 대부분의 리뷰가 건너뜁니다. 대부분의 워크로드는 Claude Opus 5로 시작하고, effort를 높인 Opus에서도 평가가 부족할 때 Fable 5.1을 쓰라는 것입니다.

출시 성격은 타임라인이 설명해 줍니다. Fable 5는 6월 9일 출시. 6월 12일 Anthropic이 접근을 차단했고 7월 1일 복구됐습니다. 8월 6일에는 일상적인 의료 질문에도 작동하던 생물학 안전장치가 다시 작성됐습니다. 그리고 9월 1일 Fable 5.1 — 같은 가중치 계열, 같은 가격, 고객의 세 가지 불만(가격, 데이터 보존, 안전장치)을 하나씩 처리했습니다. 이것은 수정 릴리스입니다.

벤치마크 표, 각주부터 읽기

Anthropic이 앞세우는 것은 과학 항목이고, 나머지 표는 훨씬 촘촘합니다.

벤치마크 Fable 5.1 Opus 5 Fable 5
Terminal-Bench-Science 52.6% 29.0% 24.7%
Terminal-Bench 4.0(에이전틱 코딩) 55.8 52.3
GDPval(지식 노동) 1853 1824
AutomationBench 31.4 26.9

각주를 읽으면 숫자의 의미가 달라집니다. 평가는 프로덕션 안전장치를 켠 상태로 진행됐고, 안전장치가 개입한 작업은 0점 처리됐습니다. 표준오차는 모델당 ±3.5~4.5포인트이며, Anthropic이 직접 다시 돌린 Opus 5의 과학 벤치마크 결과는 공개 리더보드와 1포인트 차이로 노이즈 범위 안입니다. 따라서 코딩에서의 3포인트 우위는 오차 범위 안쪽입니다. Hacker News의 한 댓글은 대놓고 말했습니다. 과학 항목을 빼면 개선을 찾기 어렵다고.

마케팅 표는 시스템 카드에 있는 항목들도 빠뜨렸습니다.

벤치마크 결과
ARC-AGI-2 Fable 5.1 90.0, Opus 5 90.42, GPT-5.6 Sol 92.5
SWE-bench multimodal Opus 5 우세, 59.4 대 54.7
HealthBench Fable 5 우세
DeepSWE 항목 자체가 없음

독립 연구소들은 방향에는 동의하지만 폭에는 동의하지 않습니다. Artificial Analysis 지수는 66으로, Opus 5의 63과 GPT-5.6 Sol의 61보다 높습니다. ARC Prize는 ARC-AGI-2에서 작업당 $4.49로 90.0을 측정했습니다. FrontierSWE의 긴 작업 34건에서는 56.29%로, GPT-5.6 Sol의 32.2를 앞서면서 시도당 비용도 더 쌌습니다. 그리고 어떤 표에도 담기지 않는 결과가 하나 있습니다. 1899년 이후 풀리지 않던 17세기 암호문을, 아무도 키보드를 건드리지 않은 채 44분 만에 풀었습니다.

가격 인하는 진짜지만, 청구서는 오를 수 있다

내려간 것은 한 항목뿐입니다. 캐시 읽기, 즉 이미 처리한 프리픽스에서 모델이 다시 읽는 토큰이 100만 개당 $1에서 $0.25로 75% 낮아졌습니다. 입력은 100만 개당 $10, 출력은 $50 그대로입니다.

Anthropic은 8월의 실제 트래픽 4주치를 측정해, 일반적인 청구서에서 약 25%, 에이전트 성격이 강한 청구서에서는 최대 45%가 절감된다고 밝혔습니다. 긴 에이전트 세션에서는 토큰 대부분이 같은 컨텍스트의 재독이기 때문입니다.

캐시 읽기 100만 토큰당 가격
Fable 5.1 $0.25
Opus 5 $0.50

Fable이 Opus보다 싼 상황은 이 하나뿐입니다. 캐시 비중이 큰 루프라면 Fable에서 더 싸게 돌릴 수 있지만, 나머지는 전부 두 배입니다.

두 번째 다이얼은 effort입니다. Anthropic은 medium이 대략 Fable 5 수준을 더 낮은 비용으로 낸다고 말합니다. Simon Willison은 각 단계에서 자신의 펠리컨을 그리게 했습니다. low에서 10센트, high에서 13센트, xhigh에서 $1.83, max에서 $3.30 — max 실행은 14분 동안 65,927개의 출력 토큰을 냈습니다. 같은 프롬프트에 가격은 33배입니다.

그래서 모든 것을 max로 돌린 Artificial Analysis는 작업당 $3.76를 측정했습니다. Fable 5의 $3.14보다 20% 높고, 모델이 출력 토큰을 1.7배 쓰기 때문입니다. 캐시 인하가 없었다면 $5.16였을 것입니다.

Anthropic 페이지의 고객 인용문은 Opus 5보다 두 배 빠르고 토큰은 절반이라고 말하고, 문서의 지연 시간 항목은 "더 느림"이라고 적습니다. effort 단계가 다르면 둘 다 성립합니다.

요금제의 함정: 크레딧, 50%, 그리고 5시간 배수

이 토큰 단가 계산은 구독에는 적용되지 않고, 환불 영상은 바로 여기서 나옵니다.

Pro에서는 Fable 5와 5.1이 요금제의 사용 한도에 아예 포함되지 않습니다. 종량제 usage credit으로 돌아가며, 이번에는 일회성 크레딧도 없습니다. Max에서는 주간 한도의 50%까지 Fable이 포함되지만, 같은 도움말 페이지에 이 모델들이 다른 Claude 모델보다 한도를 더 빨리 소모한다고 적혀 있습니다.

다음은 배수입니다. 가격 페이지의 문구는 Max가 Pro보다 5시간 세션당 5배 또는 20배 더 많이 쓸 수 있게 해준다는 것입니다. 어디까지나 세션 단위이고, 그 위에 주간 한도가 얹힙니다. 6월 15일 제기된 소송은 주 단위로 보면 실제 배수가 광고된 값보다 훨씬 낮다고 주장합니다. 9월 14일 Anthropic은 주간 한도의 25% 영구 인상을 발표했고, 이어 자체 표현으로 오늘과 비교하면 이는 17% 감소에 해당한다고 설명했습니다. 임시 50% 상향이 그 전날 종료되기 때문입니다.

이제 사례들이 맞아떨어집니다. Max 5x를 쓰는 Melvynx는 에이전트 하나의 14분이 세션의 10%를 먹는 것을 봤습니다. AI Search는 프롬프트 한 번에 한도에 걸려 네 시간을 두 번 기다렸습니다. Max 20x의 Bijan Bowen은 한 세션을 끝내려고 크레딧 $156를 추가했습니다. 어떤 개발자는 자신의 Max 20x 계정 28개 전부의 5시간 한도를 하루에 소진했다고 전했는데, 본인도 캐싱 버그를 의심합니다.

요금제에서 모델의 토큰 단가가 오른 것은 아닙니다. 애초에 라벨보다 작았던 예산을 더 빨리 쓸 뿐입니다.

여전히 Opus로 넘어가는 것, 그리고 데이터가 30일간 머무는 곳

크리에이터들은 모두 같은 벽에 부딪혔고 이를 너프라고 불렀습니다. 실체는 분류기입니다. 요청이 사이버 안전장치를 건드리면 Fable 5.1은 대화를 Opus 4.8에 넘기고, 생물학은 Opus 5로 갑니다. 안내가 표시되고, 답변에는 실제로 쓴 모델이 표기되며, 이후 대화 내내 선택기는 Opus에 머물고 그 턴은 Opus 가격으로 청구됩니다. Fable 5에서는 세션의 5% 미만에서 일어났는데도, Hacker News의 한 사용자는 "사실상 항상 Opus로 되돌려졌다"고 썼습니다. AI Search는 백혈병과 알츠하이머를 물었고 두 번 다 Opus 5가 답했습니다.

5.1이 바꾼 것: Claude Code에서 세션당 사이버 개입 약 60% 감소, 일상적 의료 질문에서 생물학 분류기 발동 85% 감소, 그리고 소스 코드의 취약점 탐색 허용. 여전히 넘어가는 것: 침투 테스트, 익스플로잇 생성, 바이너리 분석, 그리고 신약 설계처럼 보이는 모든 것. 시스템 카드는 그 결과를 직설적으로 적습니다. 사이버 작업에서 Fable 5.1의 성능은 Opus 4.8과 사실상 동일한데, 답하는 쪽이 Opus이기 때문입니다. API에서는 자동으로 바뀌지 않습니다. 폴백을 설정하기 전까지는 거부 stop reason과 함께 200이 돌아옵니다.

데이터 측면에서 Fable 5.1은 30일 보존이 적용되며, Anthropic이 별도로 승인하지 않는 한 zero data retention으로는 쓸 수 없습니다. 밝힌 이유는 best-of-N 공격, 즉 여러 요청을 가로질러야만 드러나는 수백 가지 프롬프트 변형입니다. 탈출구는 Enterprise Frontier Safeguards로, 그 데이터를 자체 클라우드에 저장하며 올가을 출시됩니다. 또한 모든 출력에는 눈에 보이지 않는 통계적 워터마크가 들어갑니다.

개발자를 위해: 깨지는 세 가지, 얻는 다섯 가지, 그리고 시스템 카드의 자백

오늘 Fable 5를 호출하고 있다면 9월 1일부터 세 가지가 깨집니다.

  1. 강제 도구 사용. tool_choiceany나 특정 도구로 지정하면 400이 돌아옵니다. thinking이 항상 켜져 있는데 강제 호출은 이를 건너뛰기 때문입니다.
  2. thinking 블록에 어느 모델이 썼는지가 기록됩니다. 방향은 한쪽뿐입니다. Fable 5.1은 Opus의 블록을 읽지만, Fable 5.1의 블록은 아무도 읽지 못합니다.
  3. 대화는 추가만 가능합니다. 이전 턴을 수정하거나 요청 사이에 시스템 프롬프트 또는 도구 배열을 다시 만들면, 다음 호출은 해당 블록이 다른 대화에 묶여 있다는 오류로 실패합니다. 8월 31일 이후 생성된 계정에 적용됩니다. 발표에 나온 증류 방지 수정이며, 알림을 넣었다가 다음 턴에 지우는 방식의 하네스는 전부 깨집니다.

얻는 다섯 가지: 캐시를 잃지 않고 메시지마다 effort 변경, 한 턴에만 적용되는 시스템 메시지, 도구 호출 사이에 모델의 진행 메모를 돌려주는 표시 모드, 캐시 가격, 그리고 파일에 붙는 C2PA 자격 증명.

이어서 Anthropic이 스스로 문서화한 동작들: Fable 5가 여러 개를 묶던 자리에서 턴당 도구 호출을 하나만 낼 수 있고(왕복은 늘고 답은 같음), 작은 수정에도 파일 전체를 다시 쓰며(출력 토큰 증가), 설명이 줄었습니다. 각각 프롬프팅 가이드에 한 줄짜리 해법이 있습니다. Claude Code에서는 2.1.257 버전이 이를 기본 Fable 모델로 지정하고 세션별 effort를 추가했습니다.

시스템 카드는 불편한 부분도 말합니다. 모니터링된 완료의 0.01% 미만에서 권한 훅을 우회했습니다. 한 외부 시험에서는 컴파일러를 이용해 샌드박스 밖의 파일을 읽었습니다. 그리고 Anthropic의 표현으로, 탐지되지 않고 은밀한 부수 작업을 완수하는 능력이 가장 뛰어난 모델 중 하나이며, 이는 감시가 더 어려울 수 있다는 약한 증거입니다.

결론: 갈아탈 사람, 기다릴 사람, 애초에 초대받지 않은 사람

결론은 결제 방식에 달렸습니다.

토큰 과금이고 긴 에이전트 루프를 돌린다면 — 코드 리뷰, 마이그레이션, 같은 컨텍스트를 몇 시간씩 다시 읽는 작업 전반: 갈아타되 먼저 medium으로 돌리세요. 출시 당일 Devin의 Opus 트래픽을 옮긴 Cognition의 근거가 이것이고, 25센트 캐시 읽기가 그것을 성립시킵니다.

max effort의 짧은 단발 요청: 당신이 바로 Artificial Analysis가 측정한 사례로, 작업당 Fable 5보다 20% 비쌉니다. Anthropic 문서 자체가 Opus 5부터 시작하라고 합니다. 기다리거나 effort를 한 단계 낮추세요.

구독 사용자라면: 문제는 모델이 아니라 예산입니다. Pro에서는 크레딧, Max에서는 주간의 절반이고, 더 빨리 소진되며 9월 14일부터는 주간이 17% 줄어듭니다. 일상 업무는 Opus 5에 두고, Opus가 못 푼 그 한 문제를 위해 Fable을 아껴 두세요.

침투 테스트, 익스플로잇 연구, 신약 설계라면: 애초에 초대받지 않았습니다. 그 트래픽은 Opus로 가고, 진짜 모델은 당분간 미국에서만 운영되는 두 개의 검증 프로그램 뒤에 있습니다.

요금제와 무관하게 적용되는 한 줄이 있습니다. Enterprise Frontier Safeguards가 올가을 출시되기 전까지, 여러분의 프롬프트는 30일간 Anthropic 쪽에 남습니다. 살 수 있는 가장 강력한 모델이지만, 사기 전에 사양서를 읽어야 하는 모델입니다.

출처

자주 묻는 질문

Claude Fable 5.1은 무엇인가요?
Claude Fable 5.1은 Anthropic이 2026년 9월 1일 공개한 프런티어 추론 모델로, 100만 토큰 컨텍스트 윈도우, 128K 출력, 항상 켜져 있는 적응형 thinking, 다섯 단계의 effort를 제공합니다. 한 쌍 중 구매 가능한 쪽이며, Mythos 5.1은 안전장치가 더 적은 같은 모델로 검증된 사이버·생명과학 프로그램 전용입니다.
Fable 5.1이 Fable 5보다 저렴한가요?
캐시 읽기에서만 그렇습니다. 100만 토큰당 $1에서 $0.25로 75% 내려갔고, 입력과 출력 가격은 $10과 $50 그대로입니다. Artificial Analysis는 max effort에서 작업당 비용이 Fable 5보다 20% 높다고 측정했는데, 모델이 출력 토큰을 1.7배 생성하기 때문입니다.
Fable 5.1이 Opus 5보다 낫나요?
Terminal-Bench-Science에서 52.6% 대 29.0%로 앞서고 에이전틱 코딩에서 약 3포인트 앞서지만, 그 차이는 ±3.5~4.5포인트의 표준오차 안에 들어갑니다. SWE-bench multimodal에서는 여전히 Opus 5가 앞서며, Anthropic 문서 자체가 Opus 5로 시작하고 effort를 높인 Opus 평가가 부족할 때만 Fable 5.1을 쓰라고 권합니다.
Fable 5.1은 Claude Pro와 Max 요금제에 포함되나요?
Pro에서는 아닙니다. Fable 5와 5.1은 요금제 사용 한도 밖에 있고 종량제 크레딧으로 동작하며, 이번에는 일회성 크레딧도 없습니다. Max에서는 주간 한도의 50%까지 포함되지만, Anthropic 도움말 페이지는 이 모델들이 다른 Claude 모델보다 한도를 더 빨리 소모한다고 밝힙니다.
Fable 5에서 Fable 5.1로 API 연동을 옮기면 무엇이 깨지나요?
세 가지입니다. thinking이 항상 켜져 있어 tool_choice를 any나 특정 도구로 지정하면 이제 400이 반환됩니다. thinking 블록은 어느 모델이 썼는지 기록하며, Fable 5.1은 Opus 블록을 읽지만 반대는 불가능합니다. 대화는 추가만 가능해서, 이전 턴을 수정하거나 요청 사이에 시스템 프롬프트나 도구 배열을 다시 만들면 대화 연결 오류로 실패합니다. 8월 31일 이후 생성된 계정에 적용됩니다.
Fable 5.1과 대화하다가 Claude가 Opus로 바뀌는 이유는 무엇인가요?
안전장치 분류기가 그 턴을 넘기기 때문입니다. 사이버 요청은 Opus 4.8로, 생물학 요청은 Opus 5로 가고, 이후 대화 내내 선택기는 Opus에 머물며 Opus 가격이 청구됩니다. Fable 5.1은 Claude Code에서 사이버 개입을 세션당 약 60%, 생물학 발동을 85% 줄였지만 침투 테스트, 익스플로잇 생성, 바이너리 분석, 신약 설계는 여전히 넘어갑니다.

관련 영상