OpenAI zbudowało GPT-5.6 z trzech modeli. Sol jest flagowcem, Terra ma łączyć jakość z niższą ceną, a Luna stawia na szybkość i tani token.
Deklaracja „najmocniejszy model” pojawia się przy każdej premierze i sama w sobie niewiele mówi. Ciekawsze jest podział cenowy: Sol kosztuje tyle co GPT-5.5, Terra po obniżce z 30.07.2026 jest o 60% tańsza od flagowca, a Luna - o 96%. Jeśli wyniki z prezentacji OpenAI przełożą się na codzienną pracę, to Terra i Luna, a nie Sol, mogą okazać się modelami, o których będzie głośno w integracjach i automatyzacjach.
OpenAI obniżyło ceny API: Terra z $2.50/$15 do $2/$12 (-20%), Luna z $1/$6 do $0.20/$1.20 (-80%). Sol pozostał przy $5/$30. Źródło: Advancing the price-performance frontier with GPT-5.6. Tabele poniżej pokazują stawki po obniżce.
GPT-5.6 jest w ogólnej dostępności w ChatGPT Work, Codex i API (Free/Go: Terra; Plus+: Sol/Terra/Luna). Szczegóły planów i limitów: ogłoszenie GA.
Czym jest rodzina GPT-5.6?
Numer 5.6 oznacza generację. Nazwy Sol, Terra i Luna mają oznaczać stałe poziomy możliwości, szybkości i ceny, a nie jednorazowe warianty jak przy starszych wydaniach.
| Model | Charakterystyka | Naturalne zastosowanie |
|---|---|---|
| GPT-5.6 Sol | Najmocniejszy z rodziny | Trudne zadania agentowe, programowanie, badania, cyberbezpieczeństwo, analizy o wysokim koszcie błędu |
| GPT-5.6 Terra | Pośredni, tańszy | Codzienna praca, analiza danych, kod, automatyzacja, dokumenty |
| GPT-5.6 Luna | Najszybszy i najtańszy | Masowa klasyfikacja, ekstrakcja, routing zapytań, proste treści |
OpenAI opisuje Sol jako najmocniejszy dotychczas model firmy. Terra ma być konkurencyjna wobec GPT-5.5 przy niższej cenie (po obniżce z 30.07.2026: $2/$12). Luna ma być najszybsza i najtańsza z całej trójki (zapowiedź GPT-5.6).
Luna nie jest po prostu „gorszym Solem”. W sensownie zaprojektowanym systemie każdy model ma inną rolę: Luna na prosty ruch, Terra na pracę wymagającą rozumowania, Sol tylko tam, gdzie dodatkowa jakość rekompensuje koszt.
Wydajność w benchmarkach OpenAI
OpenAI stawia GPT-5.6 w programowaniu agentowym, pracy z komputerem, badaniach, biologii i cyberbezpieczeństwie. Model oceniany jest nie tylko po odpowiedzi na pytanie, ale po tym, czy potrafi zaplanować pracę, użyć narzędzi, wykonać kolejne kroki i poprawić własny wynik.
Programowanie i agenci
Według OpenAI Sol ustawia rekord w Terminal-Bench 2.1. To test pracy w terminalu: planowanie, iteracje, koordynacja narzędzi. Bliżej prawdziwego programowania niż wygenerowanie jednej funkcji z promptu.
Pełnego porównania Sol, Terra i Luna w tym samym benchmarku OpenAI jeszcze nie publikuje. Wiemy, że Sol ma być najlepszy w Terminal-Bench 2.1, ale bez niezależnych testów na własnych repozytoriach trudno powiedzieć, o ile wygrywa w typowym projekcie.
W Solu pojawia się poziom rozumowania max (więcej czasu i tokenów na trudny problem) oraz ultra (dodatkowi agenci pracujący równolegle). To bezpośrednio podbija rachunek: im dłużej model pracuje, tym mniej użyteczna staje się sama stawka za milion tokenów. W zadaniach agentowych liczy się koszt ukończonej pracy, nie cennik input/output.
Biologia i badania
Na GeneBench v1 OpenAI podaje lepszy wynik Sola niż GPT-5.5 przy mniejszej liczbie tokenów. W HealthBench Professional (po skorygowaniu o długość odpowiedzi) wypada tak:
| Model | HealthBench Professional |
|---|---|
| GPT-5.5 | 51,8 |
| GPT-5.6 Sol | 60,5 |
| GPT-5.6 Terra | 57,7 |
| GPT-5.6 Luna | 55,7 |
Terra ma około 95% wyniku Sola przy cenie ok. 40% flagowca (po obniżce 30.07). Luna około 92% przy cenie ok. 4% Sol input / output. To nie znaczy, że ta sama relacja powtórzy się w każdym zadaniu, ale tłumaczy, dlaczego Terra i Luna mogą być ważniejsze biznesowo niż flagowiec (GPT-5.6 Preview System Card).
Cyberbezpieczeństwo
Największy skok OpenAI raportuje w security. W wewnętrznym Capture the Flag Sol osiągnął 96,7%. Terra była lepsza od GPT-5.5, Luna powyżej GPT-5.4, ale poniżej GPT-5.5 i Terra.
Na ExploitBench Sol ma być konkurencyjny wobec Mythos Preview przy około jednej trzeciej tokenów wyjściowych. Na FrontierCyber Sol rozwiązał 11% zadań łatwych, 12% średnich i 5% trudnych (GPT-5.5: 6%, 6%, 4%). Żadnego zadania z poziomu Elite Sol nie domknął samodzielnie.
Model wygląda na lepsze narzędzie do szukania podatności i analizy kodu niż na autonomicznego pentestera bez nadzoru człowieka.
Gdzie wyniki nie rosną
W teście unikania nadpisywania cudzych zmian przy wykonywaniu zadań wynik wygląda tak:
| Model | Unikanie nadpisania i poprawne wykonanie |
|---|---|
| GPT-5.5 | 0,44 |
| GPT-5.6 Sol | 0,44 |
| GPT-5.6 Terra | 0,37 |
| GPT-5.6 Luna | 0,32 |
W pracy agentowej, gdzie model sam modyfikuje pliki, tańszy wariant może wymagać większej kontroli. Oszczędność na tokenach szybko znika, jeśli ktoś potem naprawia nadpisane zmiany. Na złożoną migrację kodu nie brałbym Luny tylko dlatego, że jest ~25× tańsza od Sola.
Cennik API
| Model | Model ID | Input / 1M | Output / 1M |
|---|---|---|---|
| GPT-5.6 Sol | gpt-5.6-sol |
5 USD | 30 USD |
| GPT-5.6 Terra | gpt-5.6-terra |
2 USD | 12 USD |
| GPT-5.6 Luna | gpt-5.6-luna |
0,20 USD | 1,20 USD |
Sol = cena GPT-5.5. Po obniżce z 30.07.2026 Terra to 40% stawki Sola, Luna - 4%. OpenAI nie podnosi stawki za najmocniejszy model; przesuwa możliwości GPT-5.5 w dół cenowo przez Terrę i Lunę.
Koszt w liczbach, nie w cenniku
Stawka za milion tokenów mało co mówi bez kontekstu. Poniżej same input + output, bez narzędzi, wielokrotnych prób i agentów w tle:
| Przykład | Sol | Terra | Luna |
|---|---|---|---|
| 50 tys. input + 5 tys. output | 0,40 USD | 0,16 USD | 0,02 USD |
| 500 tys. input + 50 tys. output | 4,00 USD | 1,60 USD | 0,16 USD |
| 1 mln input + 200 tys. output | 11,00 USD | 4,40 USD | 0,44 USD |
Jedna analiza na Solu może być tania. Przy zadaniach agentowych model wielokrotnie czyta pliki, woła narzędzia, poprawia wynik. Przy tysiącach operacji dziennie różnica Sol vs Luna robi się ogromna. Przy pojedynczej decyzji strategicznej kilka dolarów różnicy często nie ma znaczenia.
Prompt caching
GPT-5.6 ma jawne punkty cache i minimum 30 minut życia wpisu. Zapis kontekstu kosztuje 1,25× ceny inputu, odczyt z cache 90% taniej:
| Model | Zapis 1M do cache | Odczyt 1M z cache |
|---|---|---|
| Sol | 6,25 USD | 0,50 USD |
| Terra | 2,50 USD | 0,20 USD |
| Luna | 0,25 USD | 0,02 USD |
Cache opłaca się, gdy ten sam duży kontekst wraca wielokrotnie: dokumentacja, katalog produktów, regulamin, schemat danych, instrukcje agenta. Przy jednorazowym zapytaniu płacisz za zapis bez zwrotu.
Kiedy Sol, kiedy Terra, kiedy Luna
Sol
Sol ma sens, gdy błąd kosztuje więcej niż dodatkowe tokeny. Nie jako domyślny model do każdego maila czy opisu produktu.
- wieloplikowe projekty i duże refaktoryzacje,
- migracje systemów,
- analiza podatności i defensywne testy,
- trudne analizy na wielu źródłach,
- zadania agentowe z wieloma zależnościami,
- weryfikacja wyników z Terra lub Luny w przypadkach niejednoznacznych.
Terra
Jeśli Terra utrzyma „prawie GPT-5.5” przy ~40% ceny Sola, będzie domyślnym wyborem w integracjach API. Sol zostanie warstwą eskalacji, nie codziennym silnikiem.
Terra wygląda na najbardziej uniwersalny wariant:
- analiza danych i raporty,
- praca na dokumentach i ofertach,
- codzienne programowanie,
- normalizacja i audyt katalogów e-commerce,
- research konkurencji,
- automatyzacja back-office.
Model nie musi wygrać benchmarku. Musi być wystarczająco dobry w Twoim procesie i przewidywalny kosztowo.
Luna
Luna do zadań masowych, gdzie liczy się szybkość i cena:
- klasyfikacja zgłoszeń i tagowanie produktów,
- ekstrakcja pól z dokumentów,
- routing zapytań do mocniejszych modeli,
- krótkie podsumowania i warianty tekstów,
- proste operacje w UI.
Bez kontroli nie powierzałbym Lunie dużej migracji danych ani decyzji o wysokim koszcie błędu. Jej przewaga jest przy skali.
E-commerce: podział zamiast jednego modelu
W sklepie nie trzeba odpalać Sola dla każdego produktu.
- Luna: klasyfikacja, uzupełnianie podstawowych pól, wykrywanie braków, routing ticketów.
- Terra: niespójne atrybuty, reguły normalizacji, porównanie ERP ze sklepem, analiza opinii, przygotowanie migracji katalogu.
- Sol: plan całej migracji, zależności między systemami, kod integracji, ocena ryzyka operacji na tysiącach SKU.
Taki podział zwykle wychodzi taniej niż jeden model „na wszystko”.
Analityka i BI
GPT-5.6 nie zastępuje warstwy semantycznej ani kontroli jakości danych. Mocniejszy model nadal potrafi zbudować przekonującą analizę na złych danych.
Może jednak przyspieszyć pracę:
- Luna: klasyfikacja zapytań, opisy kolumn, proste transformacje,
- Terra: SQL, różnice między raportami, dokumentacja metryk,
- Sol: złożone problemy na wielu źródłach, kodzie i dokumentacji naraz.
Model nie wie sam, czy przychód z GA4 jest właściwą metryką, czy Consent Mode zaniżył dane. Wyższy wynik w benchmarku nie naprawia bałaganu w definicjach.
Prosty schemat wyboru
| Rodzaj zadania | Model |
|---|---|
| Proste, częste, łatwe do sprawdzenia | Luna |
| Codzienna praca z rozumowaniem | Terra |
| Trudne, rzadkie, drogie błędem | Sol |
| Niepewny przypadek | Eskalacja Luna → Terra → Sol |
| Masowy proces | Luna + kontrola próbki na Terrze |
Zamiast „który model jest najlepszy?” warto zadać: ile kosztuje błąd, jak często powtarzamy zadanie, czy wynik da się szybko zweryfikować, czy model tylko odpowiada czy wykonuje serię akcji, ile kontekstu wraca wielokrotnie.
Czy przechodzić na GPT-5.6 już teraz?
Na pełną ocenę niezależnych benchmarków nadal warto czekać, ale rodzina jest już w GA. Z tego, co widać dziś:
- Sol przesuwa programowanie agentowe, badania i security, ale nadal wymaga kontroli.
- Terra może być najważniejszym modelem rodziny, jeśli utrzyma jakość bliską GPT-5.5 przy ~40% ceny Sola ($2/$12).
- Luna celuje w procesy masowe przy $0.20 / $1.20 za milion tokenów input/output (od 30.07.2026).
Podsumowanie
GPT-5.6 to nie jeden model na wszystko, tylko rodzina dopasowana do trudności zadania. Sol na najtrudniejsze przypadki, Terra na codzienną pracę, Luna na skalę.
Największy błąd to ustawienie Sola jako domyślnego silnika w każdym procesie. Lepiej działa architektura z eskalacją: proste zadania na tańszy model, trudne automatycznie na mocniejszy.
W biznesie wygrywa model wystarczająco dobry, przewidywalny i tani w relacji do wartości całego procesu, a nie ten z najwyższym wynikiem w jednej tabeli.
Pełny opis modeli OpenAI (GPT-5.5, GPT-Live, GPT-5.6, gpt-oss): katalog OpenAI. Do doboru dostawcy pod budżet i compliance: kreator wyboru modelu i porównanie modeli.