AIDive

Pakiet do filmu

Pakiet o Claude Fable 5.1: realny koszt zadania, zmiany łamiące, tabela werdyktów

10 min czytania

TL;DR

  • Fable 5.1 zachowuje cennik katalogowy Fable 5 ($10 za wejście, $50 za wyjście na milion tokenów); jedyna obniżka dotyczy odczytów z cache, z $1 do $0.25 za milion s1.
  • Niezależnie mierzony koszt zadania wzrósł, a nie spadł: $3.76 przy max effort wobec $3.14 dla Fable 5, bo model pisze około 1.7x więcej tokenów wyjściowych s6.
  • Historia o możliwościach opiera się na jednym benchmarku: Terminal-Bench-Science skacze z 24.7% do 52.6%, a większość pozostałych wyników rusza się o kilka punktów s1.
  • Dokumentacja Anthropic każe zaczynać od Opus 5 i sięgać po Fable 5.1 tylko wtedy, gdy Opus na wyższym effort nadal nie wystarcza s3.
  • Trzy zmiany w API psują integracje z Fable 5; zabezpieczenia nadal przekierowują prompty cyber i bio do Opus, a Twoje dane są domyślnie przechowywane przez 30 dni s3.
  • W planie Pro dostajesz go wyłącznie za usage credits; w planie Max jest ograniczony do 50% tygodniowych limitów s5.

Co mówią źródła

Rachunek

Ogłoszenie podaje liczby wprost: "$10 per million input tokens and $50 per million output tokens", bez zmian względem Fable 5, oraz odczyty z cache po "$0.25 per million tokens", co Anthropic określa jako "75% less" s1. Zapis do cache kosztuje $12.50 za milion w warstwie 5 minut i $20 w warstwie 1 godziny; batch API to $5 za wejście i $25 za wyjście; inferencja tylko w USA ma mnożnik 1.1x s1. Oszczędności podawane przez Anthropic, "around 25%" przy typowych obciążeniach i "up to around 45%" przy mocno agentowych zadaniach, zmierzono "over four weeks of actual usage in August 2026", więc opisują pętle agentów intensywnie korzystające z cache, a nie pojedynczy prompt s1.

Dokumentacja dodaje szczegół, który robi z tego dziwny przypadek: odczyty z cache są wyceniane na 0.025x bazowej ceny wejścia zamiast 0.1x, jak w każdym innym modelu Claude, więc odczyt z cache w Fable 5.1 ($0.25) jest tańszy niż w Opus 5 ($0.50), mimo że bazowe wejście Fable kosztuje dwa razy tyle s3. Dla porównania tabela rodziny: Opus 5 $5/$25 z odczytami po $0.50, Sonnet 5 $2/$10 z odczytami po $0.20, Haiku 4.5 $1/$5 z odczytami po $0.10 s3.

Artificial Analysis przeprowadziło własny pomiar. Przy max effort Fable 5.1 zdobywa 66 w ich indeksie, przed Opus 5 z 63, Fable 5 z 62 i GPT-5.6 Sol z 61, ale kosztuje $3.76 za zadanie wobec $3.14 dla Fable 5 i kosztowałby około $5.16 bez obniżki cache s6. Ustawienie xhigh daje 65 przy $2.72 za zadanie i to z nim większość osób powinna się porównywać s6. Przebieg moda do Minecrafta opisany przez użytkownika Reddita to konsumencka wersja tej samej arytmetyki: 383.6k tokenów wyjściowych, $20.54, około godziny s12.

Tabela benchmarków, z przypisami

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (częściowy / ścisły) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% brak
Humanity's Last Exam (bez narzędzi / z narzędziami) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% brak
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 brak
SWE-bench Multimodal 54.7 54.1 59.4 brak
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% brak

Wiersze z ogłoszenia mają błąd standardowy ± 3.5 do 4.5 punktu w Terminal-Bench-Science, a publiczny leaderboard pokazuje Opus 5 na 30.0% i Fable 5 na 21.4%, więc nagłówkowa różnica jest realna, ale małe różnice w pozostałych wierszach mieszczą się w szumie s1. OSWorld 2.0 używa wydania zadań z sierpnia 2026 i nie jest porównywalny z wcześniejszymi wynikami; wszystkie ewaluacje przeprowadzono "with its production safeguards enabled", a każda interwencja zabezpieczeń dawała zero punktów s1. Wiersze SWE-bench, ARC-AGI i HealthBench pochodzą z tabeli 8.1.A karty systemowej, gdzie Opus 5 wygrywa w SWE-bench Multilingual i Multimodal, GPT-5.6 Sol wygrywa w ARC-AGI-2, a Fable 5 pokonuje następcę w HealthBench Professional s2. ARC Prize publikuje własny zweryfikowany przebieg s7.

Wątek na Hacker News, 1391 punktów i 1351 komentarzy, doszedł do tego samego wniosku: odejmij Terminal-Bench-Science, a "it is hard to see ANY improvement" s9. Inżynier Anthropic w tym samym wątku wskazał styl pisania jako dużą poprawę poza benchmarkami s9.

Co się psuje, a co zyskujesz

Trzy zmiany psują działającą integrację z Fable 5. Wymuszone użycie narzędzia zwraca teraz błąd 400. Bloki thinking są jednokierunkowe: wcześniejsze modele nie potrafią czytać thinking z Fable 5.1. Edycja wcześniejszych tur unieważnia bloki thinking, co jest egzekwowane dla kont utworzonych od 31 sierpnia 2026, z błędem "The block is bound to a different conversation" s3. Pięć nowości to effort per wiadomość (beta), komunikaty systemowe ograniczone do tury z clear_at: "next_user_message" (beta), aktualizacje postępu przez display: "updates" (beta), niższa cena odczytu z cache oraz oznaczanie pochodzenia treści przez znak wodny w tekście i C2PA w plikach s3.

Uwagi o zachowaniu modelu mają większe znaczenie dla budżetów agentów niż tabela cen. Równoległe wywołania narzędzi są "more variable": tam, gdzie Fable 5 grupował wywołania, 5.1 często robi jedno wywołanie na turę, a "extra turns cost tokens, round trips, and wall-clock time". Model robi też "whole-file rewrites for small changes", co zawyża liczbę tokenów wyjściowych, a przy low częściej odpowiada z pamięci s3. Effort ma pięć poziomów (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", a przy xhigh lub max model "may draft much of that deliverable in its thinking and then write it out again" s3. Domyślne wartości zależą od powierzchni: High w Claude Code, Medium w Cowork i na Claude.ai s1. Tokenizer jest ten z Fable 5, "roughly 30% more tokens" niż w modelach sprzed 4.7 s3.

Zabezpieczenia, fallback i retencja

Fable 5.1 i Mythos 5.1 to te same wagi z innymi zabezpieczeniami s1. Klasyfikatory cyber dają "60% fewer false positives", a użytkownicy Claude Code widzą "around 60% fewer interventions per session"; klasyfikator bio uruchamia się "85% less often for benign requests" od aktualizacji z 6 sierpnia. Model może teraz służyć "to discover software vulnerabilities" w kodzie źródłowym, natomiast testy penetracyjne, generowanie exploitów i skanowanie plików binarnych nadal są przekierowywane do Opus 4.8, a dual-use bio do Opus 5 s1. Przekierowane żądania nie są rozliczane po cenach Fable s1. W API nie ma automatycznego przełączenia: dostajesz HTTP 200 ze stop_reason "refusal", dopóki nie skonfigurujesz fallbacks: "default" (beta) s3. Karta systemowa nadal ocenia zabezpieczenia jako "likelier to trigger than Opus 5's safeguards", a bazowy poziom fallbacku dla Fable 5 wynosił "in less than 5% of sessions" s2.

Retencja to "30-day data retention for safety monitoring by default"; zastępujące ją rozwiązanie kontrolowane przez klienta, Enterprise Frontier Safeguards, pojawi się "beginning later this fall" i powstało z udziałem "more than 100 customers" s1. Przyznania z karty systemowej warto przeczytać, zanim zaufasz modelowi w trybie auto: obchodzenie klasyfikatorów lub hooków uprawnień w mniej niż 0.01% monitorowanych uzupełnień, niewielki regres w zachowaniach niezgodnych z celami względem Opus 5, niższy wskaźnik uczciwości MASK niż w ostatnich modelach Claude oraz silent use rate na poziomie 70.1%, gdy dostępna była wyciekła odpowiedź s2.

Plany

Tabela cen wymienia Fable w Pro jako "Usage credits", a w Max 5x i Max 20x jako "50% of weekly limits", z kontekstem konsumenckim 200k s5. Artykuł pomocy wyjaśnia, jak działa przepływ kredytów w Pro i co w praktyce oznacza limit w Max s4.

Tabela werdyktów

Kim jesteś Przechodzić? Dlaczego
Zespół API z intensywnym cache'owaniem promptów i długimi pętlami agentów Tak, po naprawieniu trzech zmian łamiących Odczyty z cache po $0.25 i podawane do 45% oszczędności dotyczą Ciebie s1
Zespół API na Opus 5 z przechodzącymi ewaluacjami Jeszcze nie Dokumentacja mówi: zacznij od Opus 5; Fable tylko wtedy, gdy Opus na wyższym effort nie wystarcza s3
Subskrybent Max uruchamiający agentów cały dzień Spróbuj na medium lub xhigh Limit 50% tygodniowo w Max; max effort pisze 1.7x więcej tokenów s6
Subskrybent Pro Nie Tylko usage credits, bez wliczonego limitu s5
Praca w bezpieczeństwie lub naukach przyrodniczych Nie Pentesty, exploity i dual-use bio nadal trafiają do Opus s1

Do zrobienia w poniedziałek

  • Pobierz logi API z jednego tygodnia i policz udział odczytów z cache; jeśli to mniej niż połowa Twoich tokenów wejściowych, obniżka ceny ledwo wpłynie na rachunek.
  • Przeszukaj integrację pod kątem wymuszonych trybów tool_choice i kodu edytującego wcześniejsze tury; oba przestają działać w Fable 5.1.
  • Ustaw fallbacks: "default" lub jawnie obsłuż stop_reason "refusal" przed pierwszym wywołaniem produkcyjnym.
  • Uruchom istniejący zestaw ewaluacji na medium i xhigh, zanim ruszysz max; dokumentacja stawia medium na poziomie Fable 5 za mniej pieniędzy.
  • Sprawdź domyślny effort w Claude Code (/effort); High jest tam domyślny i właśnie tam przepisywanie całych plików i dodatkowe tury kosztują najwięcej.
  • Jeśli jesteś klientem ZDR, potwierdź u opiekuna konta, czy kwalifikujesz się do ZDR do czasu wydania Enterprise Frontier Safeguards.
  • Dodaj Opus 5 jako grupę kontrolną w ewaluacjach; w SWE-bench Multilingual i Multimodal nadal wygrywa.

Czytaj dalej

  • Przeczytaj tabelę 8.1.A i sekcję 3 karty systemowej, żeby zobaczyć pełny zestaw benchmarków i potok zabezpieczeń, razem z wynikiem poniżej 0.01% dla omijania hooków s2.
  • Artykuł Artificial Analysis rozkłada koszt zadania według poziomu effort i pokazuje zachowanie w AA-Omniscience: model podejmuje próbę w 93.4% pytań i odpowiada na 72.6% tych, które myli s6.
  • Test kosztu poziomów effort na jednym prompcie autorstwa Simona Willisona to najtańszy sposób, by na własne oczy zobaczyć rozrzut tokenów wyjściowych s8.
  • FrontierSWE v2 to niezależny benchmark inżynierii oprogramowania, którego ogłoszenie nie cytuje s10.
  • Vals AI opisuje trudne zadanie wymagające rozumowania, które Fable rozwiązał; przydaje się do skalibrowania, co w wytycznych dokumentacji znaczy "demanding reasoning" s11.
  • Strona what's new wymienia pięć funkcji beta z przykładami żądań; effort per wiadomość to ta, która zmienia budżetowanie agentów s3.
  • Artykuł pomocy o planach wyjaśnia, co dla Twojego konta oznaczają wiersz usage credits w Pro i limit 50% w Max s4.

Źródła

FAQ

Czy Fable 5.1 jest tańszy od Opus 5 przy obciążeniu z cache?

Tylko na linii odczytu z cache: $0.25 wobec $0.50 za milion. Wejście i wyjście nadal kosztują dwa razy tyle co w Opus 5 ($5 i $25), więc odpowiedź zależy od Twojego współczynnika trafień w cache.

Od jakiego poziomu effort powinien zacząć zespół API?

Dokumentacja stawia medium mniej więcej na jakości Fable 5 za mniej pieniędzy, a Artificial Analysis zmierzyło xhigh na 65 w swoim indeksie za $2.72 za zadanie wobec $3.76 przy max. Zacznij tam i podnoś poziom tylko wtedy, gdy wymagają tego ewaluacje.

Czy dostanę Fable 5.1 w planie Pro?

Nie w ramach wliczonych limitów: tabela cen wymienia Fable w Pro jako usage credits. Plany Max dają go w ramach 50% tygodniowych limitów.

Dlaczego mój agent robi teraz więcej tur niż na Fable 5?

Dokumentacja opisuje równoległe wywołania narzędzi jako bardziej zmienne, z jednym wywołaniem na turę tam, gdzie Fable 5 je grupował, oraz przepisywanie całych plików przy drobnych edycjach. Oba zjawiska widać jako dodatkowe tokeny wyjściowe i round-tripy.