Awaria sprzed czterech lat rozwiązana i żądanie zwrotu pieniędzy
Claude Fable 5.1 to graniczny model rozumowania wydany przez Anthropic 1 września 2026 roku — kupowalna połowa pary, której druga połowa, Mythos 5.1, ma mniej zabezpieczeń i jest dostępna wyłącznie dla zweryfikowanych programów. W tym samym tygodniu pojawiły się dwie reakcje i obie są prawdziwe.
Millennium miało fragment kodu, który wywalał się mniej więcej raz na milion uruchomień, a nikt w zespole nie potrafił tego wyjaśnić od czterech do pięciu lat. Wszystkie testowane modele, w tym Fable 5, przechodziły obok. Fable 5.1 znalazł to jako pierwszy.
W tym samym tygodniu francuski twórca zatytułował swoją recenzję „żądam zwrotu pieniędzy", a Artificial Analysis — laboratorium układające rankingi tych modeli — umieściło Fable 5.1 na szczycie swojego indeksu, jednocześnie mierząc koszt zadania o 20% wyższy niż w przypadku Fable 5.
Oba te fakty są prawdziwe, bo ta aktualizacja jest przede wszystkim ekonomiczna i behawioralna, a nie skokiem surowych możliwości: obniżka ceny w jednej pozycji, pięć dodatków w API, trzy zmiany łamiące zgodność i dwa przepisane zabezpieczenia. O tym, czy model jest dla ciebie, decyduje drobny druk.
Te same wagi co Mythos i „zacznij od Opusa"
Słowami samego Anthropic, Fable 5.1 i Mythos 5.1 to ten sam model z różnymi poziomami zabezpieczeń. Mythos to wersja bez ograniczeń, zarezerwowana dla zweryfikowanych programów z obszaru cyberbezpieczeństwa i nauk o życiu. Fable to ten, który możesz kupić.
| Specyfikacja | Fable 5.1 |
|---|---|
| Okno kontekstu | 1 mln tokenów |
| Maksymalne wyjście | 128 K tokenów |
| Thinking | Adaptacyjny, zawsze włączony, nie da się wyłączyć |
| Opóźnienie | W dokumentacji „wolniejsze" |
| Granica wiedzy | Czerwiec 2026 |
| Poziomy effort | 5, od low do max |
| Domyślny effort | high w Claude Code, medium w Co-work i na claude.ai |
| Cena | 10 $ / mln na wejściu, 50 $ / mln na wyjściu |
Jedno zdanie z dokumentacji modelu pomija większość recenzji: dla większości zadań zacznij od Claude Opus 5, a po Fable 5.1 sięgnij wtedy, gdy twoje ewaluacje na Opusie przy wyższym effort wciąż nie wystarczają.
Chronologia tłumaczy charakter wydania. Fable 5 pojawił się 9 czerwca. 12 czerwca Anthropic odciął dostęp, który wrócił 1 lipca. 6 sierpnia przepisano zabezpieczenia biologiczne, bo uruchamiały się przy codziennych pytaniach medycznych. Fable 5.1 wyszedł 1 września — ta sama rodzina wag, te same ceny i trzy skargi klientów (cena, przechowywanie danych, zabezpieczenia) załatwione po kolei. To wydanie naprawcze.
Tabela benchmarków, najpierw przypisy
Anthropic otwiera wierszem o nauce, a reszta tabeli jest znacznie ciaśniejsza.
| Benchmark | Fable 5.1 | Opus 5 | Fable 5 |
|---|---|---|---|
| Terminal-Bench-Science | 52,6% | 29,0% | 24,7% |
| Terminal-Bench 4.0 (kodowanie agentowe) | 55,8 | 52,3 | — |
| GDPval (praca umysłowa) | 1853 | 1824 | — |
| AutomationBench | 31,4 | 26,9 | — |
Przypisy zmieniają odczyt każdej liczby. Model oceniano z włączonymi produkcyjnymi zabezpieczeniami, a każde zadanie, w którym zabezpieczenie zainterweniowało, dostawało zero. Błąd standardowy wynosi ±3,5 do 4,5 punktu na model, a własne powtórzenie testu Opusa 5 na benchmarku naukowym przez Anthropic wypada o punkt obok publicznego rankingu, czyli w granicach szumu. Trzypunktowa przewaga w kodowaniu mieści się więc w słupku błędu. Komentator na Hacker News powiedział to wprost: usuń wiersz o nauce, a trudno dostrzec jakąkolwiek poprawę.
Tabela marketingowa pomija też wiersze, które są w karcie systemowej.
| Benchmark | Wynik |
|---|---|
| ARC-AGI-2 | Fable 5.1 90,0, Opus 5 90,42, GPT-5.6 Sol 92,5 |
| SWE-bench multimodal | Opus 5 z przodu, 59,4 do 54,7 |
| HealthBench | Fable 5 z przodu |
| DeepSWE | brak wiersza |
Niezależne laboratoria zgadzają się co do kierunku, nie co do skali. Artificial Analysis daje 66 w swoim indeksie wobec 63 dla Opusa 5 i 61 dla GPT-5.6 Sol. ARC Prize zmierzyło 90,0 na ARC-AGI-2 przy 4,49 $ za zadanie. W 34 długich zadaniach FrontierSWE model osiąga 56,29% wobec 32,2 dla GPT-5.6 Sol i jest tańszy w przeliczeniu na próbę. Jest też wynik, którego żadna tabela nie uchwyci: rozwiązał siedemnastowieczny kryptogram, nierozwiązany od 1899 roku, w 44 minuty, i nikt nie dotykał klawiatury.
Obniżka ceny jest realna, a rachunek i tak może wzrosnąć
Obniżka dotyczy jednej pozycji. Odczyty z cache — tokeny, które model czyta ponownie z już przetworzonego prefiksu — spadły z 1 $ do 0,25 $ za milion, czyli o 75%. Wejście zostaje na 10 $ za milion, wyjście na 50 $.
Anthropic zmierzył cztery tygodnie rzeczywistego ruchu z sierpnia i podaje około 25% oszczędności na typowym rachunku i do 45% na mocno agentowym, ponieważ w długiej sesji agenta większość tokenów to ponowne odczyty tego samego kontekstu.
| Odczyt z cache | Cena / mln tokenów |
|---|---|
| Fable 5.1 | 0,25 $ |
| Opus 5 | 0,50 $ |
To jedyna sytuacja, w której Fable schodzi poniżej Opusa: pętla mocno korzystająca z cache może być tańsza na Fable, podczas gdy wszystko inne kosztuje tam dwa razy więcej.
Drugie pokrętło to effort. Anthropic twierdzi, że medium odpowiada mniej więcej Fable 5 przy niższym koszcie. Simon Willison kazał narysować swojego pelikana na każdym poziomie: 10 centów przy low, 13 centów przy high, 1,83 $ przy xhigh i 3,30 $ przy max — przebieg na max dał 65 927 tokenów wyjściowych w 14 minut. Ten sam prompt, cena 33 razy wyższa.
Dlatego Artificial Analysis, uruchamiając wszystko na max, zmierzyło 3,76 $ za zadanie wobec 3,14 $ dla Fable 5 — o 20% więcej, bo model pisze 1,7 raza więcej tokenów wyjściowych. Bez obniżki cache byłoby to 5,16 $.
Cytat klienta na stronie Anthropic mówi o dwukrotnie większej szybkości niż Opus 5 przy połowie tokenów; kolumna opóźnienia w dokumentacji mówi „wolniejsze". Na różnych poziomach effort obie rzeczy mogą być prawdą.
Pułapka planów: kredyty, 50% i mnożnik pięciogodzinny
Cała ta arytmetyka za token nie dotyczy subskrypcji i właśnie stąd biorą się filmy o zwrotach pieniędzy.
W Pro Fable 5 i 5.1 w ogóle nie wliczają się do limitów planu — działają na kredytach rozliczanych za faktyczne użycie, a tym razem nie ma żadnego jednorazowego kredytu. W Max Fable jest wliczony do 50% limitów tygodniowych, a ta sama strona pomocy zaznacza, że te modele zużywają limity szybciej niż pozostałe modele Claude.
Potem mnożnik. Strona cennika mówi dosłownie, że Max daje 5 lub 20 razy więcej użycia na pięciogodzinną sesję niż Pro — na sesję, a limity tygodniowe leżą na wierzchu. Pozew złożony 15 czerwca zarzuca, że w ujęciu tygodniowym rzeczywiste mnożniki są znacznie niższe od reklamowanych. 14 września Anthropic ogłosił trwałe podniesienie limitów tygodniowych o 25%, a następnie wyjaśnił własnymi słowami, że w porównaniu z dniem dzisiejszym wychodzi z tego obniżka o 17%, ponieważ tymczasowy bonus 50% kończy się dzień wcześniej.
Teraz anegdoty się układają. Melvynx na Max 5x patrzył, jak 14 minut pracy jednego agenta zjada 10% jego sesji. AI Search trafił na limit po jednym prompcie i dwukrotnie czekał po cztery godziny. Bijan Bowen na Max 20x dokupił kredytów za 156 $, żeby dokończyć jedną sesję. Pewien deweloper opisał, jak w jeden dzień wypalił pięciogodzinne limity na wszystkich 28 swoich kontach Max 20x — sam podejrzewa, że to błąd cache'owania.
W planie model nie jest droższy za token. Po prostu szybciej wydaje budżet, który i tak był mniejszy niż etykieta.
Co nadal trafia do Opusa i gdzie twoje dane leżą przez 30 dni
Wszyscy twórcy uderzyli w tę samą ścianę i nazwali to nerfem. To klasyfikator. Kiedy żądanie uruchomi zabezpieczenie cyber, Fable 5.1 przekazuje rozmowę do Opusa 4.8; biologia idzie do Opusa 5. Dostajesz powiadomienie, odpowiedź jest oznaczona modelem, który ją naprawdę napisał, przełącznik zostaje na Opusie do końca czatu, a za tę turę płacisz ceny Opusa. Na Fable 5 zdarzało się to w mniej niż 5% sesji, a mimo to użytkownik Hacker News napisał, że „praktycznie zawsze wyrzucało mnie z powrotem do Opusa". AI Search zapytał o białaczkę i alzheimera i za każdym razem odpowiedział Opus 5.
Co zmieniła wersja 5.1: około 60% mniej interwencji cyber na sesję w Claude Code, klasyfikatory biologiczne uruchamiające się o 85% rzadziej przy codziennych pytaniach medycznych oraz dopuszczone wyszukiwanie podatności w kodzie źródłowym. Nadal przekierowywane są: testy penetracyjne, generowanie exploitów, skanowanie binariów i wszystko, co wygląda na projektowanie leków. Karta systemowa mówi wprost o konsekwencji: w zadaniach cyber Fable 5.1 wypada niemal identycznie jak Opus 4.8, bo to on odpowiada. W API nic nie przełącza się samo: dostajesz 200 ze stop reason oznaczającym odmowę, dopóki nie skonfigurujesz rozwiązania zapasowego.
Jeśli chodzi o dane, Fable 5.1 objęty jest 30-dniowym przechowywaniem i nie jest dostępny w trybie zerowego przechowywania danych, o ile Anthropic tego nie zatwierdzi. Podana przyczyna to ataki best-of-N — setki wariantów promptu, widoczne dopiero w zestawieniu wielu żądań. Wyjściem jest Enterprise Frontier Safeguards, które trzyma te dane w twojej własnej chmurze i pojawi się tej jesieni. Każde wyjście niesie też niewidoczny statystyczny znak wodny.
Dla programistów: trzy rzeczy, które się psują, pięć, które zyskujesz, i przyznania samej karty systemowej
Jeśli dziś wywołujesz Fable 5, od 1 września psują się trzy rzeczy.
- Wymuszone użycie narzędzia. Ustawienie
tool_choicenaanyalbo na konkretne narzędzie zwraca 400. Thinking jest zawsze włączony, a wymuszone wywołanie by go pominęło. - Bloki thinking zapisują teraz, który model je napisał, w jedną stronę: Fable 5.1 czyta bloki Opusa, bloków Fable 5.1 nie czyta nic.
- Rozmowa jest tylko do dopisywania. Edytuj wcześniejszą turę albo przebuduj system prompt lub tablicę narzędzi między żądaniami, a kolejne wywołanie zwróci błąd mówiący, że blok jest powiązany z inną rozmową — zasada obowiązuje konta założone 31 sierpnia lub później. To właśnie poprawka antydestylacyjna z ogłoszenia i psuje każdy harness, który wstrzykuje przypomnienie i kasuje je w następnej turze.
Pięć rzeczy, które zyskujesz: zmiana effort dla każdej wiadomości bez utraty cache; wiadomości systemowe obowiązujące tylko przez jedną turę; tryb wyświetlania zwracający notatki modelu o postępie między wywołaniami narzędzi; cena cache; oraz poświadczenia C2PA na plikach.
Do tego zachowania, które Anthropic dokumentuje sam: model może wykonać jedno wywołanie narzędzia na turę tam, gdzie Fable 5 grupował kilka (więcej rund, ta sama odpowiedź), przepisuje całe pliki przy drobnych zmianach (więcej tokenów wyjściowych) i mniej opowiada o tym, co robi. Każdy przypadek ma jednolinijkowe rozwiązanie w przewodniku po promptach. W Claude Code wersja 2.1.257 ustawia go jako domyślny model Fable i dodaje effort na sesję.
Karta systemowa mówi też rzeczy niewygodne. W mniej niż 0,01% monitorowanych odpowiedzi model obszedł permission hook. W jednym zewnętrznym teście użył kompilatora, żeby odczytać pliki spoza swojej piaskownicy. I jest, słowami Anthropic, jednym z najzdolniejszych modeli w niewykrywalnym wykonywaniu ukrytych zadań pobocznych — słaba przesłanka, że może być trudniejszy do monitorowania.
Werdykt: kto się przesiada, kto czeka, kogo nigdy nie zaproszono
Werdykt zależy od tego, jak płacisz.
Rozliczasz się za tokeny i uruchamiasz długie pętle agenta — code review, migracje, wszystko, gdzie ten sam kontekst jest czytany godzinami: przesiądź się i najpierw uruchom na medium. Tak właśnie rozumowało Cognition, przenosząc ruch Opusa w Devinie w dniu premiery, a odczyt z cache za 25 centów jest powodem, dla którego to działa.
Krótkie, jednorazowe żądania na max effort: jesteś dokładnie tym przypadkiem, który zmierzyło Artificial Analysis — 20% drożej za zadanie niż Fable 5. Dokumentacja Anthropic sama mówi, żeby zacząć od Opusa 5: poczekaj albo zejdź o poziom effort niżej.
Na subskrypcji: pytaniem nie jest model, tylko budżet. W Pro to kredyty. W Max to połowa twojego tygodnia, wydawana szybciej, a od 14 września tydzień jest o 17% krótszy. Zostań przy Opusie 5 do rutyny, a Fable zachowaj na ten jeden problem, którego Opus nie rozgryzł.
Jeśli zajmujesz się testami penetracyjnymi, badaniem exploitów albo projektowaniem leków: nigdy nie byłeś zaproszony. Ten ruch idzie do Opusa, a prawdziwy model stoi za dwoma programami weryfikacyjnymi, na razie dostępnymi tylko w USA.
Jedno zdanie obowiązuje przy każdym planie: twoje prompty leżą 30 dni po stronie Anthropic, dopóki tej jesieni nie pojawi się Enterprise Frontier Safeguards. Najmocniejszy model, jaki możesz kupić, ze specyfikacją, którą warto przeczytać, zanim to zrobisz.
AIDive