GPT-6 Astra kontra Claude Fable 5.1: uczciwe porównanie
Większość krążących tabel porównawczych dla tych dwóch modeli nie wytrzymuje sprawdzenia. Ten tekst pokazuje dlaczego i wskazuje niewielki zestaw liczb, który naprawdę się broni.
Tłumaczenie wygenerowane automatycznie przez AI. Wersja niemiecka jest oryginałem zweryfikowanym redakcyjnie.
Od początku września 2026 roku istnieją dwa modele klasy frontier, które niemiecka firma może poważnie zestawić ze sobą: Claude Fable 5.1 od Anthropic, opublikowany 1 września, oraz GPT-6 Astra od OpenAI, w ograniczonej wersji zapoznawczej od 3 września i ogólnie dostępny od 4 września. Znaczna część krążących od tamtej pory tabel porównawczych jest nierzetelna, i to nie ze złej woli, lecz dlatego, że liczby pochodzące z różnych ram pomiarowych trafiają do tej samej kolumny. Ten tekst postępuje odwrotnie: najpierw odsiewa porównania, które się nie bronią, a potem wskazuje te nieliczne, które się bronią. Na końcu zostaje kolumna, która faktycznie rozstrzyga decyzję architektoniczną w Niemczech, i nie jest to wiersz benchmarku.
01. Tabela, którą publikują niemal wszyscy, jest wadliwa
Najczęstsze zdanie w bieżących doniesieniach brzmi mniej więcej tak: własne benchmarki Anthropic miałyby stawiać Claude Fable 5.1 przed GPT-6 Astra. To zdanie jest fałszywe i obala je zwykły kalendarz.
Anthropic opublikował swoją tabelę benchmarków 1 września 2026 roku. Kolumna porównawcza nosi w niej oznaczenie GPT-5.6 Sol. GPT-6 Astra trafił 3 września do ograniczonej wersji zapoznawczej, a 4 września do ogólnej dostępności. Anthropic nie tylko więc nie zmierzył Astry, ale nie mógł jej zmierzyć: model nie był publiczny w dniu publikacji.
Kto czyta wiersz Terminal-Bench 4.0, w którym 55,8% dla Fable 5.1 stoi naprzeciw 37,3%, i bierze te 37,3% za Astrę, porównuje aktualny model Anthropic z poprzednikiem konkurenta. To nie błąd zaokrąglenia, lecz zupełnie inne twierdzenie. I właśnie ta błędna interpretacja rozprzestrzenia się dziś najszybciej w agregatorach i streszczeniach.
Wartość tego tekstu tkwi zatem mniej w liczbach, a bardziej w segregacji: które porównania się bronią, które nie i po czym rozpoznać różnicę.
02. Co naprawdę porównuje się jeden do jednego
Zostaje niewielki, ale czysty rdzeń. Wszystkie wiersze poniższej tabeli pochodzą z dokumentacji modelu Anthropic, ze strony cenowej Anthropic oraz z dokumentacji deweloperskiej OpenAI dla gpt-6-astra, pobranych 10 września 2026 roku. To oświadczenia każdego dostawcy o własnym produkcie, w tej samej jednostce, bez ram pomiarowych pośrodku.
| Cecha | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|
| Publikacja | 1 września 2026 | 3 września 2026 (wersja zapoznawcza), 4 września 2026 (ogólna) |
| Identyfikator API | claude-fable-5-1 | gpt-6-astra |
| Wejście / wyjście za mln tokenów | 10 / 50 USD | 10 / 50 USD |
| Odczyt pamięci podręcznej za mln tokenów | 0,25 USD | 1,00 USD |
| Zapis pamięci podręcznej za mln tokenów | 12,50 USD (5 min) / 20 USD (1 godz.) | 12,50 USD |
| Maksymalne wyjście | 128K tokenów | 128K tokenów |
| Modalność | tekst i obraz na wejściu, tekst na wyjściu | tekst i obraz na wejściu, tekst na wyjściu |
| Data odcięcia wiedzy | czerwiec 2026 | 30 kwietnia 2026 |
Do wiersza o zapisie pamięci podręcznej należy zastrzeżenie: Anthropic sprzedaje dwa czasy przechowywania, pięć minut i godzinę, natomiast OpenAI nie publikuje odpowiadającego progu. Obie kwoty 12,50 USD są sobie bliskie, ale nie w pełni równoległe.
Ekonomicznie interesujący jest wiersz odczytu pamięci podręcznej. Czterokrotna różnica na korzyść Anthropic brzmi jak pozycja poboczna, lecz w pracy agentowej nią nie jest: ten sam kontekst, repozytorium, instrukcja systemowa i opisy narzędzi są tam odczytywane raz za razem przez setki kroków. Anthropic sam wycenia wynikającą z tego oszczędność na około 25% wobec Fable 5 przy typowych obciążeniach i do około 45% przy obciążeniach silnie agentowych. Ta liczba to wyliczenie modelowe dostawcy, a nie obniżka cen: ceny katalogowe wejścia i wyjścia są niezmienione, a obciążenie z niewielką liczbą trafień w pamięć podręczną nie oszczędza praktycznie nic.
Do każdej kalkulacji należą jeszcze dwie pozycje. Batch API Anthropic zmniejsza o połowę oba kierunki, do 5 USD za wejście i 25 USD za wyjście na milion tokenów. A przypięcie wnioskowania do Stanów Zjednoczonych po stronie Anthropic oznacza, zgodnie z dokumentacją Anthropic dotyczącą lokalizacji danych, mnożnik 1,1 dla wejścia, wyjścia, zapisów i odczytów pamięci podręcznej.
03. Terminal-Bench 4.0: jedyna liczba z prawdziwą kontrolą krzyżową
Jeden wiersz benchmarku zasługuje tu na szczególne zaufanie, z powodu, który rzadko bywa wyjaśniany.
1 września 2026 roku Anthropic podaje dla Claude Fable 5.1 na Terminal-Bench 4.0 wynik 55,8%. W wynikach raportowanych przez OpenAI dla GPT-6 Astra, przekazanych 3 września 2026 roku przez DataCamp i tam wyraźnie oznaczonych jako dane dostawcy, Astra osiąga 57,7%, a Fable 5.1 figuruje z niezmienionym wynikiem 55,8%.
Obaj dostawcy dochodzą zatem niezależnie do tej samej liczby dla modelu drugiej strony. To najmocniejsza pojedyncza kontrola dostępna w całym tym porównaniu. Dostawca ma niewielki interes w zawyżaniu konkurenta, a gdy dwie strony o przeciwnych interesach podają tę samą liczbę, przemawia to za tym, że liczba przeżywa konfigurację, zamiast być pomiarem domowym.
Mimo to pozostają dwa ograniczenia. Po pierwsze, żadna z publikacji nie podaje, jakiego harnessu, jakiego scaffoldu i jakiego poziomu wysiłku użyto. Po drugie, różnica 1,9 punktu procentowego jest na tyle mała, że mogłaby pochodzić dokładnie z tych czynników. Broniąca się interpretacja brzmi więc: na Terminal-Bench 4.0 oba modele leżą blisko siebie według danych obu dostawców, z niewielką przewagą Astry wedle pomiaru OpenAI.
04. Co nie jest porównywalne i dlaczego
Większa część opublikowanych liczb nie należy do wspólnej tabeli. To nie formalizm, lecz różnica między podstawą decyzji a ścianą cyfr.
- OSWorld 2.0. Anthropic podaje dla Fable 5.1 dwie wartości, 77,9% z punktami częściowymi i 41,7% przy ocenie ścisłej. Po stronie OpenAI figuruje dla Astry pojedyncza wartość 72,6%, bez wskazania trybu oceny. Zestawienie 72,6 z 77,9 jest tak samo bezpodstawne jak zestawienie z 41,7. Dopóki tryb oceny się nie zgadza, nie ma tu porównania, jest tylko wybór.
- Okno kontekstu. Anthropic podaje 1 000 000 tokenów, OpenAI 1 050 000 przy maksymalnym wejściu 922 000 tokenów. Te liczby nie są miarą pojemności w tej samej skali, bo token znaczy co innego w zależności od tokenizatora. Anthropic sam pisze, że jego obecny tokenizator wytwarza dla tego samego tekstu około 30% więcej tokenów niż jego własny poprzedni. Publicznie nie istnieje żadna międzydostawcza dana o liczbie tokenów na słowo, więc pytanie, który model mieści więcej tekstu, nie da się rozstrzygnąć na podstawie źródeł otwartych.
- AutomationBench. Anthropic publikuje 31,4% dla Fable 5.1. We własnym wpisie ogłoszeniowym OpenAI rości sobie pierwsze miejsce na tym samym benchmarku, ale nie podaje tam żadnej liczby. Po prostu nie ma czego porównywać.
- Wiersze, w których liczba dla Claude nie pochodzi od Anthropic. Dla ScreenSpot-Pro, FrontierMath Tier 4 v2, ExploitBench, ARC-AGI-3, GPQA Diamond i FrontierCode 1.1 istnieją wyłącznie wartości ze strony OpenAI. Liczba dla Claude w tych wierszach to pomiar Claude wykonany przez OpenAI, a w kilku przypadkach pomiar Claude Fable 5 lub Claude Opus 5, nie Fable 5.1. Przypisanie ich Anthropic oznacza cytowanie niewłaściwego źródła, a częściowo także niewłaściwego modelu.
- Poziomy wysiłku. Obaj dostawcy dopuszczają różną moc obliczeniową na zapytanie. U Anthropic już domyślne ustawienie różni się zależnie od powierzchni:
highw Claude Code,mediumw claude.ai i Claude Cowork. Artificial Analysis mierzy na poziomach „max” i „xhigh”. Liczba benchmarkowa bez podanego poziomu wysiłku nie jest porównywalna z liczbą uzyskaną na innym poziomie. To nie subtelność, lecz najbardziej prawdopodobna przyczyna tego, że ten sam ranking pokazuje trzy wyniki na trzech stronach.
Jeden przypadek szczególny wymaga ostrzeżenia: 99,9%, które krąży dla Astry na ARC-AGI-3, nosi w źródle dopisek „harness adaptera” i sąsiaduje z 7,8% dla poprzedniego modelu. Skok o około 92 punkty przy zmianie harnessu opisuje najpierw harness, a dopiero potem model. Ta liczba nie należy do żadnego nagłówka.
05. Rankingi zewnętrzne otwarcie sobie przeczą
Kto nie ufa liczbom dostawców, sięga po rankingi niezależne. W tym przypadku to nie pomaga, bo rankingi przeczą sobie nawzajem, i to przy jednym i tym samym indeksie.
Artificial Analysis we własnym artykule z 3 września 2026 roku podaje dla Intelligence Index: GPT-6 Astra 61, GPT-5.6 Sol 61, Claude Fable 5.1 66, przy czym ten ostatni na maksymalnym poziomie wysiłku z konfiguracją zapasową, która nie jest domyślnym ustawieniem API. BenchLM przedstawia ten sam indeks inaczej we wrześniu 2026 roku: GPT-5.6 Sol prowadzi z wynikiem 58,9%, a Fable 5.1 ma 53,7%. llm-stats, pobrane 10 września 2026 roku, podaje Fable 5.1 na 56,8, Astrę na 54,7 i Claude Opus 5 na 54,1.
Trzy źródła, jeden indeks, trzy kolejności. Nie mogą być wszystkie aktualne. Jako przyczyny wchodzą w grę różne daty pomiaru, różne ustawienia wysiłku oraz mieszanie punktów z procentami. Praktyczna konsekwencja jest prosta: wartość Intelligence Index bez podania serwisu, daty i poziomu wysiłku nie jest informacją. Artificial Analysis zresztą sam wskazuje na mieszane wyniki, w tym spadek o około 80 punktów Elo na GDPval-AA v2.
Pozostaje arena. Tam również nie ma czego szukać: ani Claude Fable 5.1, ani GPT-6 Astra nie ma sklasyfikowanej pozycji w LMArena w dostępnych tu migawkach z września 2026 roku, ponieważ Elo areny potrzebuje wolumenu głosów i opóźnia się o tygodnie wobec premier klasy frontier. Nawet gdyby te wartości istniały, byłyby niewłaściwym narzędziem dla tej decyzji. Ślepe porównanie parami mierzy postrzeganą jakość odpowiedzi na samodzielnie dobranych zapytaniach, silnie reaguje na formatowanie i rozwlekłość oraz mało mówi o pracy agentowej w długim horyzoncie. Dla agenta programistycznego albo platformy pracy wiedzy nie jest to miara, według której należy układać zakup.
06. FrontierCode 1.1: liczba, która działa przeciwko własnemu dostawcy
W tym porównaniu jest jeden wiersz, który waży więcej niż pozostałe, z powodu metodologicznego. Na FrontierCode 1.1 GPT-6 Astra stoi według własnych raportowanych wyników OpenAI na poziomie 53,3%, a więc za Claude Fable 5 z wynikiem 53,5%.
Dwa doprecyzowania są tu obowiązkowe. Wartość porównawcza dotyczy Claude Fable 5, a nie Fable 5.1, a Anthropic nie opublikował dla Fable 5.1 własnego wyniku na tym benchmarku. Różnica wynosi 0,2 punktu procentowego i mieści się w każdym prawdopodobnym rozrzucie pomiarowym.
Mimo to jest to najbardziej godny zaufania rodzaj liczby, jaki może zawierać ogłoszenie produktowe. Dostawca, który publikuje wiersz, gdzie jego nowy okręt flagowy przegrywa z cudzym modelem, nie ma w tym żadnego interesu marketingowego. Kto chce ocenić nośność tabeli benchmarków, powinien najpierw sprawdzić, czy takie wiersze w ogóle w niej występują. Tabela, w której publikujący ją dostawca wygrywa każdy pojedynczy wiersz, nie jest pomiarem, lecz wyborem.
07. Kierunek się odwraca: lokalizacja danych w UE i zero retencji
Do tego miejsca Anthropic prowadzi w cenie i ekonomii pamięci podręcznej, a w benchmarkach jest mniej więcej na równi. W zarządzaniu danymi obraz odwraca się całkowicie, a dla niemieckiej firmy to właśnie ta kolumna zmienia architekturę.
| Cecha | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|
| Wnioskowanie w regionie UE | Nie, tylko us i global | Tak, przez eu.api.openai.com dla EOG i Szwajcarii |
| Region przechowywania danych | Wyłącznie Stany Zjednoczone | Europa do wyboru na poziomie projektu |
| Zero retencji danych | Niedostępne, Covered Model z obowiązkowym 30-dniowym przechowywaniem | Udokumentowane dla głównych punktów końcowych wnioskowania, wymaga zgody |
| Trenowanie na danych API klienta | Nie, nie bez wyraźnego zezwolenia | Nie, nie bez wyraźnej zgody |
Po stronie Anthropic wynika to z własnej dokumentacji. Parametr inference_geo przyjmuje dokładnie dwie wartości, global i us, a jako region przechowywania obszaru roboczego można wybrać wyłącznie us, ustalony w chwili utworzenia. Strona retencji jest jeszcze wyraźniejsza: Anthropic oznacza Fable 5.1 i Mythos 5.1 (a także Fable 5 i Mythos 5) jako Covered Models, które wymagają 30-dniowego przechowywania danych i nie są dostępne w trybie zero retencji bez wyraźnego zezwolenia Anthropic. Organizacja objęta ZDR musi aktywnie włączyć 30-dniowe przechowywanie dla konkretnego obszaru roboczego, inaczej zapytanie zostaje odrzucone.
Po stronie OpenAI dokumentacja deweloperska dotycząca przetwarzania danych stwierdza, że Europa (EOG i Szwajcaria) obsługuje zarówno przechowywanie regionalne, jak i przetwarzanie regionalne przez eu.api.openai.com, konfigurowane na poziomie projektu, przy czym regiony poza Stanami Zjednoczonymi wymagają zgody na mechanizmy kontroli nadużyć oraz aneksu o zmodyfikowanej retencji. Ta sama strona wymienia punkty końcowe kwalifikujące się do ZDR, w tym /v1/chat/completions i /v1/responses, i wyraźnie wyklucza Assistants, Threads, Vector Stores, dostrajanie oraz Batches.
Precyzja jest tu ważniejsza niż gładkie sformułowanie: żadne znalezione źródło nie stwierdza wprost, że GPT-6 Astra kwalifikuje się do ZDR. Udokumentowane jest, że wymienione punkty końcowe obsługują ZDR i że dla gpt-6-astra nie opublikowano wyjątku specyficznego dla modelu. Brak ograniczenia nie jest jednak zezwoleniem. Kto opiera na tym architekturę, powinien uzyskać potwierdzenie umowne, zamiast wnioskować z luki w dokumentacji. U Anthropic sytuacja jest jednoznaczna w drugą stronę, bo wyjątek jest tam zapisany wprost.
Poprawki wymaga też często powtarzane zdanie: „Claude ma lokalizację danych w UE, bo działa na AWS we Frankfurcie”. To prawda dokładnie wtedy, gdy pobierają Państwo Claude przez chmurę partnerską, na przykład Amazon Bedrock lub Google Cloud, gdzie to dostawca chmury ustala region i jest podmiotem przetwarzającym. Dla własnego API Anthropic to nie obowiązuje. W kwestii gwarantowanego routingu regionalnego Anthropic sam odsyła do regionalnych punktów końcowych chmur partnerskich, z dopłatą 10% wobec punktów globalnych. Dla oceny zgodności z RODO ta różnica jest sednem sprawy, ponieważ przesądza, z kim zawierana jest umowa powierzenia przetwarzania.
08. Artykuł 50: różnica, którą da się udowodnić tylko w połowie
Od 2 sierpnia 2026 roku obowiązują wymogi przejrzystości z artykułu 50 rozporządzenia o AI, które nakazują maszynowo czytelne oznaczanie treści syntetycznych. Anthropic podaje, że Fable 5.1 i Mythos 5.1 od pierwszego dnia noszą niewidoczny znak wodny w tekście, i stosuje to oznaczanie na całym świecie, a nie tylko w UE. Na tyle, na ile sięgają dostępne źródła, jest to rzeczywista różnica.
Zdanie to potrzebuje jednak obu połówek. Nie znaleziono żadnego źródła mówiącego o tym, czy wyjście tekstowe GPT-6 Astra jest oznaczane. Udokumentowane podejście OpenAI do proweniencji, Content Credentials C2PA wraz z SynthID, dotyczy obrazu i dźwięku; dostępne strony nie mówią nic o tekście. Z tej luki nie wynika, że OpenAI nie oznacza tekstu. Dlatego tego nie twierdzimy. OpenAI publikuje osobno wskazówki dla klientów dotyczące rozporządzenia o AI.
Także znak wodny Anthropic niesie mniej, niż sugeruje samo pojęcie. Anthropic pisze we własnej pomocy, że wykryty znak wskazuje, iż treść mogła zostać przetworzona przez Claude, nie jest w pełni rozstrzygający i sam z siebie nie potwierdza pochodzenia treści. Odpowiednie API do wykrywania znajduje się ponadto w prywatnej wersji zapoznawczej dla wybranych organizacji. Jako element argumentacji zgodnościowej znak wodny jest przydatny; jako środek dowodowy nie.
09. Co to oznacza dla decyzji w Niemczech
Jeśli mają Państwo wynieść z tego porównania jedną regułę, niech będzie to ta: przy dwóch modelach klasy frontier, które w broniących się liczbach leżą blisko siebie i mają identyczne ceny katalogowe, wiersz benchmarku rzadko rozstrzyga. Różnica na Terminal-Bench 4.0 wynosi 1,9 punktu procentowego bez podanego harnessu. Na FrontierCode 1.1 to 0,2 punktu w drugą stronę, wobec starszego modelu Claude. Takie różnice przesuwają się przy kolejnym wydaniu i nie zmieniają żadnej architektury.
To, co zmienia architekturę, znajduje się w kolumnie zarządzania danymi. Organizacja zobowiązana do zera retencji nie może używać Claude Fable 5.1 przez własne API Anthropic bez wyraźnego zezwolenia, niezależnie od tego, jak dobry jest model. Organizacja wymagająca wnioskowania w UE znajdzie tę drogę u Anthropic wyłącznie przez chmurę partnerską, z odpowiednią dopłatą i innym podmiotem przetwarzającym w umowie. Odwrotnie, przewaga Anthropic w odczycie pamięci podręcznej jest realna i rośnie wraz z udziałem pracy agentowej, w której ten sam kontekst odczytywany jest setki razy.
W praktyce: proszę najpierw wyjaśnić wymogi, potem koszty, a benchmarki na końcu. W odwrotnej kolejności zbudują Państwo system, który dobrze mierzy i przegrywa w rozmowie o ochronie danych. I przy każdej liczbie, którą ktoś Państwu pokazuje, warto sprawdzić trzy rzeczy: kto ją zaraportował, kiedy i na jakim poziomie wysiłku.
Co samo wydanie zmieniło dla niemieckiej firmy, opisujemy w naszym tekście o Claude Fable 5.1. Jak model zachowuje się w bieżącej pracy projektowej, omawiamy w tekście o możliwościach w praktyce. A jeśli odpowiedzią na pytanie o zarządzanie danymi jest to, że dane w ogóle nie mogą opuścić firmy, droga prowadzi przez rozważenie wariantu on-premise wobec chmury, a nie przez ranking.

