Przejdź do treści
Blog

Opus 5.5, GPT-6 Luna i DeepSeek: płacisz za zadanie, nie za token

Opus 5.5 ma tańszy cennik niż Opus 5, a na najwyższym poziomie myślenia kosztuje tyle samo. Porównuję nowe modele po koszcie zadania i zużyciu tokenów, a nie po cenie za milion.

Przemysław Zagórski9 min czytania

22 września Anthropic wypuścił Claude Opus 5.5, a OpenAI tego samego dnia GPT-6 Sol i GPT-6 Lunę. Wszystkie trzy są tańsze od poprzedników: Opus 5.5 o 20 procent na token, Sol i Luna o połowę na tokenach wejściowych. Cena za milion tokenów nie mówi jednak, ile zapłacisz za zadanie, bo model sam decyduje, ile tokenów wyprodukuje, a poziom myślenia potrafi tę liczbę zwielokrotnić. Zestawiam nowe modele z konkurencją po koszcie jednego zadania i zużyciu tokenów, na danych z 26 września.

Modele przełączam w pi jedną komendą i w ostatnich tygodniach testowałem tak Gemini 3.8 Flash, przez API Google i przez Vertex, a także DeepSeek, Qwen i Kimi K3. Kilka sesji daje wrażenie, a nie pomiar. Dlatego liczby poniżej pochodzą z niezależnego zestawu testów, a moje wrażenia oznaczam jako moje.

Skąd biorę liczby

Korzystam z Artificial Analysis, firmy, która sama uruchamia modele na tym samym zestawie testów. Jej indeks w wersji 4.3.2 składa się z dziesięciu testów w czterech grupach: zadania agentowe z wagą 30 procent, programowanie i rozumowanie naukowe po 20 procent, wiedza ogólna 30 procent. Koszt zadania to średni koszt jednego zadania z tego zestawu po cenach katalogowych, liczony z tokenów, które raportuje API dostawcy. Obejmuje więc także tokeny myślenia.

Osobno podaję Terminal-Bench 4.0, bo najlepiej oddaje pracę agenta w repozytorium. To 66 zadań w terminalu, każde uruchamiane trzy razy w prostym środowisku z samym bashem i bez kompresji historii. Środowisko ma znaczenie: Anthropic podaje dla Opusa 5.5 na poziomie xhigh wynik 66,4 procent w tym teście na własnym stanowisku, a Artificial Analysis na tym samym poziomie mierzy 59,6 procent.

Dwa zastrzeżenia. To nie są Twoje zadania, więc indeks mówi, gdzie szukać, a nie co wybrać. Różnicę jednego czy dwóch punktów traktuję jako remis.

Opus 5.5: tańszy cennik nie zawsze znaczy tańsze zadanie

Opus 5.5 kosztuje 4 dolary za milion tokenów wejściowych i 20 za wyjściowe, o 20 procent mniej niż Opus 5. Odczyt z cache'u staniał o 60 procent, do 20 centów za milion. Anthropic pisze, że model działa na poziomie Fable 5.1 w większości zadań i przy ustawieniach domyślnych kosztuje o 40 procent mniej niż Opus 5. Fable 5.1 kosztuje 10 i 50 dolarów.

Model i poziom myśleniaIndeksKoszt zadaniaTokeny wyjściowe na zadanie
Opus 5.5, medium51,21,34 USD25 745
Opus 5.5, high53,61,82 USD35 584
Opus 5.5, xhigh56,03,46 USD65 667
Opus 5.5, max57,65,98 USD119 166
Opus 5, medium44,82,19 USD28 977
Opus 5, max50,85,86 USD72 511
Fable 5.1, max53,47,63 USD78 111
GPT-6 Astra, max52,73,26 USD27 206

Na poziomie medium deklaracja Anthropic się potwierdza. Opus 5.5 kosztuje o 39 procent mniej niż Opus 5 na tym samym poziomie i ma 6,4 punktu więcej. Na poziomie max obraz jest inny. Opus 5.5 generuje tam o 64 procent więcej tokenów niż Opus 5, więc zadanie kosztuje o 2 procent więcej, mimo tańszego cennika. Na pytanie, ile Opus 5.5 „zżera”, odpowiedź brzmi: na max najwięcej ze wszystkich modeli w tym zestawieniu, prawie 120 tysięcy tokenów na zadanie.

Najciekawsza pozycja w tabeli to high. Opus 5.5 ma tam 53,6 punktu, tyle co Fable 5.1 na max, za 24 procent jego kosztu. Przejście z high na max daje 4 punkty i kosztuje 3,3 raza więcej. Na co dzień high albo xhigh wystarczy, a max warto zostawić dla zadań, które na niższym poziomie się nie udały.

GPT-6 Astra idzie w drugą stronę. Na max zużywa najmniej tokenów z czołówki, 27 tysięcy na zadanie, ale płaci 2,5 raza wyższą stawkę niż Opus 5.5. Wychodzi drożej niż Opus 5.5 na high i ma prawie o punkt mniej.

Przy Claude trzeba pamiętać o jeszcze jednej rzeczy, o której pisałem przy tokenach po polsku. Modele od Claude 4.7 używają nowszego tokenizatora, który według Anthropic daje około 30 procent więcej tokenów dla tego samego tekstu. Koszty w tabeli już to uwzględniają, bo Artificial Analysis liczy tokeny z API. Porównując same cenniki, trzeba to doliczyć samemu.

Opus 5.5 zmienia też coś, o czym pisałem przy cache'u po stronie dostawcy. Odczyt z cache'u kosztuje w nim 5 procent stawki wejściowej, a nie 10, więc jeden wygenerowany token kosztuje tyle, co sto tokenów odczytanych z cache'u. W tamtym tekście dopisałem aktualizację.

GPT-6 Luna: bardzo tania, ale nie do każdej pracy

Luna kosztuje 10 centów za milion tokenów wejściowych i 50 za wyjściowe. Poziom myślenia ustawia się parametrem reasoning.effort od none do max, a domyślny jest medium. Moje wrażenie było takie, że Luna na wysokim poziomie myślenia to czarny koń w relacji ceny do jakości. Dane częściowo to potwierdzają:

Model i poziom myśleniaIndeksKoszt zadaniaTerminal-Bench 4.0Czas do pierwszego tokena
GPT-6 Luna, medium29,50,017 USD2,5%brak danych
GPT-6 Luna, high32,10,029 USD4,5%7,1 s
GPT-6 Luna, xhigh33,90,042 USD8,1%18,4 s
GPT-6 Luna, max37,30,068 USD12,6%122,3 s
Claude Sonnet 5, max38,25,09 USD14,1%153,6 s

Przy Lunie poziom myślenia zmienia wynik bardziej niż przy Opusie 5.5. Przejście z medium na max daje 7,8 punktu, a zużycie tokenów rośnie 4,5 raza. Luna na max ma prawie taki sam indeks jak Sonnet 5 na max i kosztuje 75 razy mniej. W tym sensie czarny koń się zgadza.

Ma jednak dwa słabe punkty. W Terminal-Bench 4.0 rozwiązuje 12,6 procent zadań, czyli ponad dwa razy mniej niż DeepSeek V4.1 Flash, o którym niżej. Na max mediana czasu do pierwszego tokena to dwie minuty. Luna na high albo xhigh dobrze nadaje się do pracy wsadowej: klasyfikacji, wyciągania danych, streszczeń, analizy dokumentów. Jako agent w terminalu przegrywa z innymi modelami z tej półki cenowej. Uwaga na długie wejścia: powyżej 272 tysięcy tokenów OpenAI liczy podwójną stawkę za wejście i półtorej za wyjście dla całego zapytania.

Poziom myślenia to pokrętło kosztu Zadanie na poziomie `max` kosztuje w tych danych 4,5 raza więcej niż na `medium` przy Opusie 5.5 i 3,9 raza więcej przy Lunie. Ustaw poziom jawnie dla każdego rodzaju pracy, zamiast zostawiać jeden globalnie.

Tańsza półka: DeepSeek, Qwen, Gemini, Kimi

ModelIndeksKoszt zadaniaTerminal-Bench 4.0Cena wejście / wyjście za milion
GPT-6 Luna, max37,30,07 USD12,6%0,10 / 0,50 USD
DeepSeek V4.1 Flash, max39,50,27 USD26,8%0,30 / 1,20 USD w szczycie
Qwen3.8 Flash Next39,80,37 USD25,3%0,15 / 0,47 USD
Gemini 3.8 Flash, high40,91,24 USD19,7%0,75 / 3,75 USD do końca 2026
Kimi K3, max43,62,00 USD12,6%3 / 15 USD
Qwen3.8 Max (wersja 0902)45,45,41 USD38,9%2 / 6 USD
GPT-6 Sol, max47,51,06 USD43,9%2 / 10 USD

DeepSeek V4.1 Flash ma najlepszy wynik w terminalu wśród modeli, którym zadanie z indeksu kosztuje mniej niż 40 centów. Rozwiązuje ponad jedną czwartą zadań w terminalu, zadanie z indeksu kosztuje go 27 centów, a mediana czasu do pierwszego tokena to sekunda. Cennik ma ciekawostkę ważną dla polskich zespołów. Stawki szczytowe obowiązują w dni robocze między 1:00 a 4:00 i między 6:00 a 10:00 UTC, a poza nimi wszystko kosztuje połowę. W Polsce oznacza to szczyt od 3:00 do 6:00 i od 8:00 do 12:00, a po zmianie czasu 25 października od 2:00 do 5:00 i od 7:00 do 11:00. Poranna praca płaci więc pełną stawkę, popołudniowa połowę. Odczyt z cache'u kosztuje 2 procent zwykłej stawki wejściowej.

Qwen3.8 Flash Next jest w podobnym miejscu co DeepSeek, trochę drożej na zadanie, i według Artificial Analysis ma otwarte wagi. Qwen3.8 Max ma w tej grupie najwyższy wynik w terminalu, 38,9 procent, ale zużywa prawie 108 tysięcy tokenów na zadanie i kosztuje 5,41 dolara. Za mniej niż jedną piątą tej kwoty GPT-6 Sol na max rozwiązuje 43,9 procent. Jeśli szukasz modelu ze średniej półki do agenta, Sol wygląda w tych danych lepiej niż Luna.

Gemini 3.8 Flash jest najszybszy w zestawieniu: 330 tokenów na sekundę. Jego cena to cena wprowadzająca. Google zapowiada, że 1 stycznia 2027 obie stawki wzrosną dwukrotnie, do 1,50 i 7,50 dolara. W Vertex punkt końcowy regionalny, na przykład w UE, kosztuje o 10 procent więcej niż globalny.

Kimi K3 ma otwarte wagi na własnej licencji Moonshot i indeks 43,6, ale przez API kosztuje 2 dolary na zadanie, generuje 35 tokenów na sekundę i w terminalu wypada jak Luna. Cenę podaję za Artificial Analysis. Strony z cennikiem Moonshot nie otworzyłem, bo sieć, z której pracowałem, blokuje tę domenę.

Od czego zacząć

  1. Porównuj koszt zadania, a nie cennik. Puść od 10 do 20 swoich typowych zadań na dwóch lub trzech modelach i zsumuj z odpowiedzi API wejście, odczyt z cache'u i wyjście. Jak z tego złożyć rachunek, pokazałem w tekście o koszcie agenta.
  2. Ustaw poziom myślenia jawnie. Dla Opusa 5.5 zacznij od high, a max włączaj, gdy zadanie się nie udało. Dla Luny w pracy wsadowej porównaj high z xhigh.
  3. Pracę wsadową puszczaj taniej. OpenAI liczy za przetwarzanie wsadowe połowę stawki, a DeepSeek połowę poza godzinami szczytu, czyli w Polsce po południu i w weekendy.
  4. Zaplanuj budżet na 2027 po nowych cenach Gemini. Jeśli Gemini 3.8 Flash ma zostać w produkcji, policz koszt po stawkach od 1 stycznia.
  5. Sprawdź, gdzie trafiają dane. Zanim wyślesz kod firmy do API DeepSeek, Moonshot albo Alibaby, ustal z działem prawnym warunki przetwarzania. Modele z otwartymi wagami można uruchomić u dostawcy, którego wybierzesz sam.
  6. Testuj na tym samym zadaniu. W pi modele zmienia się komendą /model w trakcie sesji, więc porównanie kilku modeli na jednym problemie nie wymaga zmiany narzędzia ani zaczynania od nowa.

Ceny za token spadły 22 września u Anthropic i OpenAI, a rachunek za zadanie spadł tylko tam, gdzie model nie nadrobił tego liczbą tokenów. Dlatego pierwsze, co zmieniłbym w konfiguracji po tych premierach, to poziom myślenia, a dopiero potem model.

Źródła

  1. [1]Introducing Claude Opus 5.5 (22 września 2026)Anthropic
  2. [2]Pricing: cennik modeli, fast mode, tokenizer od Claude 4.7Anthropic
  3. [3]Prompt caching: mnożniki odczytu dla poszczególnych modeliAnthropic
  4. [4]GPT-6 Luna: model, ceny, poziomy reasoning.effortOpenAI
  5. [5]GPT-5.6 Luna i GPT-5.6 Sol: ceny poprzednikówOpenAI
  6. [6]GPT-6 Sol: model i cenyOpenAI
  7. [7]GPT-6 Astra: model i cenyOpenAI
  8. [8]Models and Pricing: DeepSeek V4.1 Flash, godziny szczytuDeepSeek
  9. [9]Agent Platform (dawniej Vertex AI): cennik Gemini 3.8 Flash do końca 2026 i od 2027Google Cloud
  10. [10]Gemini API: cennikGoogle
  11. [11]Model Studio: cennik modeli QwenAlibaba Cloud
  12. [12]moonshotai/Kimi-K3: karta modelu i licencjaHugging Face
  13. [13]Leaderboard modeli: indeks, koszt zadania, tokeny, Terminal-Bench 4.0 (stan na 26 września 2026)Artificial Analysis
  14. [14]Metodologia Intelligence Index v4.3.2Artificial Analysis
Przemysław Zagórski

Przemysław Zagórski

Programista i architekt, 14+ lat w telco i enterprise IT. Prowadzi warsztaty z inżynierii kontekstu, GitHub Copilota, Google ADK oraz ekosystemu Gemini dla zespołów, które muszą dowozić produkcyjnie.

Jeśli widzisz te problemy u siebie, zwykle da się je rozbroić w kilka dni roboczych. Nie kolejnym narzędziem, tylko zmianą sposobu pracy zespołu. Chętnie omówię Wasz przypadek.

9 min czytania

Pi: agent do kodu, który zaczyna od czterech narzędzi

Pi to otwarty agent do kodu w terminalu, który celowo nie ma MCP, subagentów ani trybu planu. Zmierzyłem, ile wysyła do modelu na starcie, i opisuję, dla kogo to dobry wybór.

  • Agenci
  • Inżynieria kontekstu
Czytaj