22 września Anthropic wypuścił Claude Opus 5.5, a OpenAI tego samego dnia GPT-6 Sol i GPT-6 Lunę. Wszystkie trzy są tańsze od poprzedników: Opus 5.5 o 20 procent na token, Sol i Luna o połowę na tokenach wejściowych. Cena za milion tokenów nie mówi jednak, ile zapłacisz za zadanie, bo model sam decyduje, ile tokenów wyprodukuje, a poziom myślenia potrafi tę liczbę zwielokrotnić. Zestawiam nowe modele z konkurencją po koszcie jednego zadania i zużyciu tokenów, na danych z 26 września.
Modele przełączam w pi jedną komendą i w ostatnich tygodniach testowałem tak Gemini 3.8 Flash, przez API Google i przez Vertex, a także DeepSeek, Qwen i Kimi K3. Kilka sesji daje wrażenie, a nie pomiar. Dlatego liczby poniżej pochodzą z niezależnego zestawu testów, a moje wrażenia oznaczam jako moje.
Korzystam z Artificial Analysis, firmy, która sama uruchamia modele na tym samym zestawie testów. Jej indeks w wersji 4.3.2 składa się z dziesięciu testów w czterech grupach: zadania agentowe z wagą 30 procent, programowanie i rozumowanie naukowe po 20 procent, wiedza ogólna 30 procent. Koszt zadania to średni koszt jednego zadania z tego zestawu po cenach katalogowych, liczony z tokenów, które raportuje API dostawcy. Obejmuje więc także tokeny myślenia.
Osobno podaję Terminal-Bench 4.0, bo najlepiej oddaje pracę agenta w repozytorium. To 66 zadań w terminalu, każde uruchamiane trzy razy w prostym środowisku z samym bashem i bez kompresji historii. Środowisko ma znaczenie: Anthropic podaje dla Opusa 5.5 na poziomie xhigh wynik 66,4 procent w tym teście na własnym stanowisku, a Artificial Analysis na tym samym poziomie mierzy 59,6 procent.
Dwa zastrzeżenia. To nie są Twoje zadania, więc indeks mówi, gdzie szukać, a nie co wybrać. Różnicę jednego czy dwóch punktów traktuję jako remis.
Opus 5.5 kosztuje 4 dolary za milion tokenów wejściowych i 20 za wyjściowe, o 20 procent mniej niż Opus 5. Odczyt z cache'u staniał o 60 procent, do 20 centów za milion. Anthropic pisze, że model działa na poziomie Fable 5.1 w większości zadań i przy ustawieniach domyślnych kosztuje o 40 procent mniej niż Opus 5. Fable 5.1 kosztuje 10 i 50 dolarów.
| Model i poziom myślenia | Indeks | Koszt zadania | Tokeny wyjściowe na zadanie |
|---|
| Opus 5.5, medium | 51,2 | 1,34 USD | 25 745 |
| Opus 5.5, high | 53,6 | 1,82 USD | 35 584 |
| Opus 5.5, xhigh | 56,0 | 3,46 USD | 65 667 |
| Opus 5.5, max | 57,6 | 5,98 USD | 119 166 |
| Opus 5, medium | 44,8 | 2,19 USD | 28 977 |
| Opus 5, max | 50,8 | 5,86 USD | 72 511 |
| Fable 5.1, max | 53,4 | 7,63 USD | 78 111 |
| GPT-6 Astra, max | 52,7 | 3,26 USD | 27 206 |
Na poziomie medium deklaracja Anthropic się potwierdza. Opus 5.5 kosztuje o 39 procent mniej niż Opus 5 na tym samym poziomie i ma 6,4 punktu więcej. Na poziomie max obraz jest inny. Opus 5.5 generuje tam o 64 procent więcej tokenów niż Opus 5, więc zadanie kosztuje o 2 procent więcej, mimo tańszego cennika. Na pytanie, ile Opus 5.5 „zżera”, odpowiedź brzmi: na max najwięcej ze wszystkich modeli w tym zestawieniu, prawie 120 tysięcy tokenów na zadanie.
Najciekawsza pozycja w tabeli to high. Opus 5.5 ma tam 53,6 punktu, tyle co Fable 5.1 na max, za 24 procent jego kosztu. Przejście z high na max daje 4 punkty i kosztuje 3,3 raza więcej. Na co dzień high albo xhigh wystarczy, a max warto zostawić dla zadań, które na niższym poziomie się nie udały.
GPT-6 Astra idzie w drugą stronę. Na max zużywa najmniej tokenów z czołówki, 27 tysięcy na zadanie, ale płaci 2,5 raza wyższą stawkę niż Opus 5.5. Wychodzi drożej niż Opus 5.5 na high i ma prawie o punkt mniej.
Przy Claude trzeba pamiętać o jeszcze jednej rzeczy, o której pisałem przy tokenach po polsku. Modele od Claude 4.7 używają nowszego tokenizatora, który według Anthropic daje około 30 procent więcej tokenów dla tego samego tekstu. Koszty w tabeli już to uwzględniają, bo Artificial Analysis liczy tokeny z API. Porównując same cenniki, trzeba to doliczyć samemu.
Opus 5.5 zmienia też coś, o czym pisałem przy cache'u po stronie dostawcy. Odczyt z cache'u kosztuje w nim 5 procent stawki wejściowej, a nie 10, więc jeden wygenerowany token kosztuje tyle, co sto tokenów odczytanych z cache'u. W tamtym tekście dopisałem aktualizację.
Luna kosztuje 10 centów za milion tokenów wejściowych i 50 za wyjściowe. Poziom myślenia ustawia się parametrem reasoning.effort od none do max, a domyślny jest medium. Moje wrażenie było takie, że Luna na wysokim poziomie myślenia to czarny koń w relacji ceny do jakości. Dane częściowo to potwierdzają:
| Model i poziom myślenia | Indeks | Koszt zadania | Terminal-Bench 4.0 | Czas do pierwszego tokena |
|---|
| GPT-6 Luna, medium | 29,5 | 0,017 USD | 2,5% | brak danych |
| GPT-6 Luna, high | 32,1 | 0,029 USD | 4,5% | 7,1 s |
| GPT-6 Luna, xhigh | 33,9 | 0,042 USD | 8,1% | 18,4 s |
| GPT-6 Luna, max | 37,3 | 0,068 USD | 12,6% | 122,3 s |
| Claude Sonnet 5, max | 38,2 | 5,09 USD | 14,1% | 153,6 s |
Przy Lunie poziom myślenia zmienia wynik bardziej niż przy Opusie 5.5. Przejście z medium na max daje 7,8 punktu, a zużycie tokenów rośnie 4,5 raza. Luna na max ma prawie taki sam indeks jak Sonnet 5 na max i kosztuje 75 razy mniej. W tym sensie czarny koń się zgadza.
Ma jednak dwa słabe punkty. W Terminal-Bench 4.0 rozwiązuje 12,6 procent zadań, czyli ponad dwa razy mniej niż DeepSeek V4.1 Flash, o którym niżej. Na max mediana czasu do pierwszego tokena to dwie minuty. Luna na high albo xhigh dobrze nadaje się do pracy wsadowej: klasyfikacji, wyciągania danych, streszczeń, analizy dokumentów. Jako agent w terminalu przegrywa z innymi modelami z tej półki cenowej. Uwaga na długie wejścia: powyżej 272 tysięcy tokenów OpenAI liczy podwójną stawkę za wejście i półtorej za wyjście dla całego zapytania.
Poziom myślenia to pokrętło kosztu
Zadanie na poziomie `max` kosztuje w tych danych 4,5 raza więcej niż na `medium` przy Opusie 5.5 i 3,9 raza więcej przy Lunie. Ustaw poziom jawnie dla każdego rodzaju pracy, zamiast zostawiać jeden globalnie.
| Model | Indeks | Koszt zadania | Terminal-Bench 4.0 | Cena wejście / wyjście za milion |
|---|
| GPT-6 Luna, max | 37,3 | 0,07 USD | 12,6% | 0,10 / 0,50 USD |
| DeepSeek V4.1 Flash, max | 39,5 | 0,27 USD | 26,8% | 0,30 / 1,20 USD w szczycie |
| Qwen3.8 Flash Next | 39,8 | 0,37 USD | 25,3% | 0,15 / 0,47 USD |
| Gemini 3.8 Flash, high | 40,9 | 1,24 USD | 19,7% | 0,75 / 3,75 USD do końca 2026 |
| Kimi K3, max | 43,6 | 2,00 USD | 12,6% | 3 / 15 USD |
| Qwen3.8 Max (wersja 0902) | 45,4 | 5,41 USD | 38,9% | 2 / 6 USD |
| GPT-6 Sol, max | 47,5 | 1,06 USD | 43,9% | 2 / 10 USD |
DeepSeek V4.1 Flash ma najlepszy wynik w terminalu wśród modeli, którym zadanie z indeksu kosztuje mniej niż 40 centów. Rozwiązuje ponad jedną czwartą zadań w terminalu, zadanie z indeksu kosztuje go 27 centów, a mediana czasu do pierwszego tokena to sekunda. Cennik ma ciekawostkę ważną dla polskich zespołów. Stawki szczytowe obowiązują w dni robocze między 1:00 a 4:00 i między 6:00 a 10:00 UTC, a poza nimi wszystko kosztuje połowę. W Polsce oznacza to szczyt od 3:00 do 6:00 i od 8:00 do 12:00, a po zmianie czasu 25 października od 2:00 do 5:00 i od 7:00 do 11:00. Poranna praca płaci więc pełną stawkę, popołudniowa połowę. Odczyt z cache'u kosztuje 2 procent zwykłej stawki wejściowej.
Qwen3.8 Flash Next jest w podobnym miejscu co DeepSeek, trochę drożej na zadanie, i według Artificial Analysis ma otwarte wagi. Qwen3.8 Max ma w tej grupie najwyższy wynik w terminalu, 38,9 procent, ale zużywa prawie 108 tysięcy tokenów na zadanie i kosztuje 5,41 dolara. Za mniej niż jedną piątą tej kwoty GPT-6 Sol na max rozwiązuje 43,9 procent. Jeśli szukasz modelu ze średniej półki do agenta, Sol wygląda w tych danych lepiej niż Luna.
Gemini 3.8 Flash jest najszybszy w zestawieniu: 330 tokenów na sekundę. Jego cena to cena wprowadzająca. Google zapowiada, że 1 stycznia 2027 obie stawki wzrosną dwukrotnie, do 1,50 i 7,50 dolara. W Vertex punkt końcowy regionalny, na przykład w UE, kosztuje o 10 procent więcej niż globalny.
Kimi K3 ma otwarte wagi na własnej licencji Moonshot i indeks 43,6, ale przez API kosztuje 2 dolary na zadanie, generuje 35 tokenów na sekundę i w terminalu wypada jak Luna. Cenę podaję za Artificial Analysis. Strony z cennikiem Moonshot nie otworzyłem, bo sieć, z której pracowałem, blokuje tę domenę.
- Porównuj koszt zadania, a nie cennik. Puść od 10 do 20 swoich typowych zadań na dwóch lub trzech modelach i zsumuj z odpowiedzi API wejście, odczyt z cache'u i wyjście. Jak z tego złożyć rachunek, pokazałem w tekście o koszcie agenta.
- Ustaw poziom myślenia jawnie. Dla Opusa 5.5 zacznij od
high, a max włączaj, gdy zadanie się nie udało. Dla Luny w pracy wsadowej porównaj high z xhigh.
- Pracę wsadową puszczaj taniej. OpenAI liczy za przetwarzanie wsadowe połowę stawki, a DeepSeek połowę poza godzinami szczytu, czyli w Polsce po południu i w weekendy.
- Zaplanuj budżet na 2027 po nowych cenach Gemini. Jeśli Gemini 3.8 Flash ma zostać w produkcji, policz koszt po stawkach od 1 stycznia.
- Sprawdź, gdzie trafiają dane. Zanim wyślesz kod firmy do API DeepSeek, Moonshot albo Alibaby, ustal z działem prawnym warunki przetwarzania. Modele z otwartymi wagami można uruchomić u dostawcy, którego wybierzesz sam.
- Testuj na tym samym zadaniu. W pi modele zmienia się komendą
/model w trakcie sesji, więc porównanie kilku modeli na jednym problemie nie wymaga zmiany narzędzia ani zaczynania od nowa.
Ceny za token spadły 22 września u Anthropic i OpenAI, a rachunek za zadanie spadł tylko tam, gdzie model nie nadrobił tego liczbą tokenów. Dlatego pierwsze, co zmieniłbym w konfiguracji po tych premierach, to poziom myślenia, a dopiero potem model.