Powrót do artykułów

ChatGPT-5.6 - Słońce, Ziemia, Księżyc.

2026-07-12Autor: Piotr Szczepanik
ChatGPT-5.6 - Słońce, Ziemia, Księżyc.
Subskrybuj

Firma, która przez trzy lata karmiła nas nazwami w stylu o1, o3-mini-high, GPT-4o i 4.1, wypuszcza modele o nazwach Sol, Terra i Luna. Słońce, Ziemia, Księżyc. Ktoś w San Francisco wreszcie zauważył, że ludzie mają problem z wybraniem modelu z listy, która wygląda jak numery katalogowe uszczelek.

Dziewiątego lipca OpenAI udostępniło rodzinę GPT-5.6. Trzy modele, dwa nowe pokrętła mocy i nowy produkt ChatGPT Work, który przypomina Claude Cowork. Premiera była opóźniona, bo rząd USA poprosił o jej wstrzymanie z powodu możliwości modeli. Anthropic z Fable 5 miał podobne polityczne perypetie.

Zobaczmy, co realnie dostajesz.

Sol, Terra, Luna. Który do czego?

Liczba (5.6) oznacza generację. Nazwa oznacza półkę wydajnościową. Za jakiś czas będzie GPT-5.7 Sol i będziesz wiedział, że to ta sama półka, tylko nowsza.

Sol to flagowiec. Kodowanie, praca z dokumentami, cyber bezpieczeństwo, nauka. Do Sol zlecasz rzeczy najtrudniejsze.

Terra to model do codziennej pracy. OpenAI twierdzi, że dorównuje wydajnością poprzedniemu flagowcowi GPT-5.5, za mniej więcej połowę jego ceny. Notion (jeden z partnerów OpenAI) mówi ostrożniej i konkretniej: wiele agentów, które chodziły na GPT-5.5, osiąga na Terrze podobne wyniki za połowę ceny i przy około 16 procentach mniejszej liczbie zużytych tokenów. Wiele, nie wszystkie.

Luna to najszybszy i najtańszy z trójki. Klasyfikacja, proste redagowanie, wszystko, co robisz masowo i gdzie nie potrzebujesz filozofa.

Ceny w tabelce niżej, po porównaniu z Claude.

Max i ultra, czyli pokrętła mocy

max to wyższy poziom wysiłku. Model dostaje więcej czasu, żeby pomyśleć, sprawdzić własną robotę i poprawić podejście, zanim odda wynik. Masz go w dwóch miejscach: jako zwykły przełącznik w ustawieniach ChatGPT Work i Codeksa oraz jako poziom reasoning.effort: "max" w API.

ultra idzie dalej. Zamiast jednego modelu myślącego dłużej odpala domyślnie czterech agentów, którzy pracują równolegle nad osobnymi kawałkami zadania, a potem zszywają wyniki. To ustawienie produktowe. W API zbliżony mechanizm daje multi-agent w Responses API.

OpenAI potwierdza, że sumuje tokeny wszystkich agentów, więc rachunek rośnie znacząco. Nie mówi natomiast, że każde uruchomienie zużywa dokładnie czterokrotność. Agenci mogą wykonać różną ilość pracy, dochodzi agent główny i sama synteza. Traktuj ultra jako "znacznie drożej", nie jako "razy cztery".

Kto co dostaje. W ChatGPT Work ultra mają Pro i Enterprise, w Codeksie od Plusa w górę. W zwykłym czacie ChatGPT Plus, Pro, Business i Enterprise mają Sola od średniego wysiłku w górę, a Pro i Enterprise dodatkowo wersję Sol Pro.

Z Free i Go jest zabawnie, bo OpenAI przeczy samo sobie. Komunikat premierowy mówi, że te plany dostają Terra w ChatGPT Work i Codeksie. Centrum pomocy w tej chwili twierdzi co innego: w Work modele 5.6 zaczynają się od Plusa, a Terra dla Free i Go jest tylko w Codeksie.

Co się zmieniło względem GPT-5.5

Najciekawsza rzecz w tej premierze nie jest oznaczona żadnym benchmarkiem, tylko liczbą tokenów.

OpenAI trenowało 5.6 pod kątem wyciśnięcia więcej roboty z każdego tokena. Lovable raportuje 25 procent mniej kroków i 35 do 48 procent mniej wywołań narzędzi.

To są liczby od partnera, opublikowane przez OpenAI, więc traktuj je trochę jak materiał marketingowy. Jednak kierunek jest jednoznaczny i ma sens biznesowy. Kiedy zarządzasz systemem przepalającym setki milionów tokenów, różnica w skuteczności modelu przekłada się na budżet.

Do tego doszło Programmatic Tool Calling w Responses API. Model pisze i uruchamia w pamięci mały program, który koordynuje narzędzia, filtruje wyniki pośrednie i decyduje, co dalej. Bez odbijania każdej odpowiedzi narzędzia z powrotem przez model. To również ma się przekładać na mniejsze zużycie tokenów.

Zmienił się też prompt caching. Jawne punkty odcięcia cache, minimalny czas życia 30 minut, zapis do cache po 1,25x stawki wejściowej, odczyt nadal z 90-procentowym rabatem.

Claude kontra GPT-5.6, czyli benchmarki, które nie mówią jednego

Wynik starcia zależy od tego, którą tabelkę czytasz. Większość liczb pochodzi z materiałów OpenAI, więc to wersja jednej strony. Tam, gdzie mogłem, sięgnąłem po niezależny Artificial Analysis. Nawet w tej mieszance obraz nie jest jednoznaczny.

Sol wygrywa tam, gdzie model rusza myszką i klika. Obsługa komputera, agenty przeglądarkowe, research w sieci. Na OSWorld 2.0 Sol bije Opusa 4.8, zużywając przy tym o około 85 procent mniej tokenów wyjściowych. To wynik jednego testu, nie gwarancja dla wszystkich agentów komputerowych w produkcji, ale kierunek powtarza się także na BrowseComp.

Sol prowadzi w generowaniu prezentacji, ale nie w całej pracy z dokumentami. Ma najwyższą ocenę Presentation Elo i bardzo dobre wyniki w generowaniu slajdów. Potrafi odczytać design system z wzorca slajdów i konsekwentnie go zastosować. Model ML podaje 39 procent mniej tokenów na prezentację niż Fable, Canva mówi o 1,6x lepszej efektywności tokenowej. Tyle że to wypowiedzi partnerów opublikowane przez OpenAI, nie niezależne badania.

W szerszym teście pracy analitycznej, AA-Briefcase, prowadzi Fable 5. Wyższa jakość analityczna. Czyli: ładne slajdy szybciej robi Sol, a poważną robotę na dokumentach nadal lepiej ogarnia Claude. To dwie różne rzeczy, choć obie wrzuca się do worka "dokumenty".

Kodowanie to nie jest jedna kategoria i tu trzeba uważać. Liczby: na SWE-Bench Pro Mythos 5 robi 80,3 procent, Fable 5 osiemdziesiąt równo, Sol 64,6. Piętnaście punktów to przepaść. Ale na Terminal-Bench 2.1 jest 88,8 do 83,1 dla OpenAI, na DeepSWE 72,7 do 69,7, a w zbiorczym Coding Agent Index Artificial Analysis 80,0 do 77,2.

Zanim ogłosisz, że "Sol jest lepszym modelem terminalowym", przeczytaj metodologię. Artificial Analysis nie porównuje samych modeli. Porównuje całe zestawy: Sol chodzący w Codeksie kontra Claude chodzący w Claude Code. Model plus narzędzie.

Uczciwy wniosek brzmi więc tak: konfiguracja Sol + Codex prowadzi w Terminal-Bench, DeepSWE i zbiorczym indeksie agentów kodujących. Konfiguracje Claude zdecydowanie prowadzą w SWE-Bench Pro. Ile z tego to model, a ile obudowa wokół niego, nie wiadomo. To ważne, bo Ty też nie kupujesz gołego modelu, tylko cały zestaw.

Czyli zdanie "twarde kodowanie równa się Claude, bez dyskusji" jest nieprawdziwe. Ale odwrotne też.

Praca umysłowa, długi kontekst, orkiestracja narzędzi. Tu też nie ma jednego zwycięzcy, tylko trzy różne odpowiedzi. Na GDPval prowadzi Fable 5, nieznacznie. W Toolathlonie, czyli orkiestracji narzędzi, przed Solem są Fable i Mythos. A w długim kontekście przewagę trzyma głównie Mythos: na GraphWalks 1M jest wyżej od Sola, ale Fable ma tam wynik wyraźnie niższy niż Sol. Na GraphWalks 256K Mythos wygrywa minimalnie.

Czyli "Claude trzyma długi kontekst" to skrót myślowy, który nie przechodzi weryfikacji. Trzyma go Mythos. Fable w tej konkretnej dyscyplinie wypada nierówno. I dotyczy to górnej półki, nie całej rodziny, bo Sonnet czy Haiku to jeszcze inna sprawa.

Na ogólnym indeksie inteligencji Artificial Analysis Sol jest drugi za Fable 5, przy mniej więcej jednej trzeciej kosztu w porównywanym ustawieniu.

Moim zdaniem sedno tej premiery brzmi tak: OpenAI położyło szczególny nacisk na efektywność kosztową, nie rezygnując z poprawy jakości. To komentarz, nie ustalenie. Ale dla większości firm koszt na skończone zadanie waży więcej niż jeden punkt na indeksie.

Cennik API

Stawki za milion tokenów, wejście / wyjście, ceny standardowe:

ModelWejścieWyjście
GPT-5.6 Sol5 USD30 USD
GPT-5.6 Terra2,50 USD15 USD
GPT-5.6 Luna1 USD6 USD
Claude Fable 510 USD50 USD
Claude Opus 4.85 USD25 USD
Claude Sonnet 52 USD*10 USD*
Claude Haiku 4.51 USD5 USD
  • Cena promocyjna Sonnet 5 obowiązuje do 31 sierpnia 2026. Potem 3 / 15.

Na pierwszy rzut oka Claude wygląda konkurencyjnie. Opus 4.8 ma nawet tańsze wyjście niż Sol. Sonnet 5 jest tańszy niż Terra. Haiku tańszy niż Luna.

Tylko że ta tabela kłamie przez przemilczenie i to po obu stronach.

Po stronie OpenAI: powyżej 272 tysięcy tokenów wejścia GPT-5.6 przechodzi na wyższą taryfę. Podwójna stawka za wejście i półtorakrotna za wyjście, i to dla całego requestu, nie tylko dla nadmiaru. Jeśli pracujesz na długim kontekście, cennik ze strony głównej nie jest Twoim cennikiem.

Po stronie Anthropic: modele od Opus 4.7 wzwyż, czyli Fable 5, Mythos 5, Sonnet 5 i Opus 4.8, używają nowego tokenizera. Ten sam tekst daje więcej tokenów. Twoja stawka za milion tokenów spadła, ale tych tokenów jest więcej.

Cennik to nie to samo co koszt i o tym napisałem obszerną analizę i propozycję wdrożeniową na https://praktyczneai.substack.com.