Nowy model Anthropic kosztuje niemal dwukrotnie więcej za zadanie niż poprzednik przy nominalnie tych samych cenach tokenów.

Źródło zdjęcia: The Decoder
Claude Sonnet 5 utrzymuje pozorne stałe ceny tokenów, ale rzeczywiste koszty zadań wzrosły niemal dwukrotnie w porównaniu z poprzednikiem. Niezależne testy ujawniają wzrost konsumpcji tokenów o 40 proc., co czyni model droższym niż konkurencyjny Opus 4.8, donosi The Decoder.
Artificial Analysis przetestowało Claude Sonnet 5 przed jego oficjalną premierą i umieściło go w rankingu Intelligence Index. Model zdobył 53 punkty, dzieląc piąte miejsce z GPT-5.5 (high). To wzrost o 6 punktów względem Sonnet 4.6, ale kosztem znacznie większego zużycia tokenów.
Mimo że Sonnet 5 oficjalnie utrzymuje te same ceny co poprzednik — 3 USD za milion tokenów wejściowych i 15 USD za tokeny wyjściowe — rzeczywiste koszty znacznie wzrosły. Według analizy Artificial Analysis, średnie zadanie kosztuje 2,29 USD w przypadku Sonnet 5, podczas gdy Opus 4.8 (z cenami 5 USD i 25 USD) kosztuje około 1,97 USD.
W trybie maksymalnej wydajności Sonnet 5 zużywa około 40 proc. więcej tokenów wyjściowych na zadanie niż Sonnet 4.6. W benchmarkach pracy agentowej, takich jak AA-Briefcase i GDPval-AA, wykonuje około trzy razy więcej pętli agentowych niż poprzednik. To sprawia, że koszt zadania wzrósł z około 1,20 USD do 2,29 USD — niemal podwojenie ceny.
Anthropic oferuje promocyjne stawki 2 USD i 10 USD za milion tokenów do 1 września, ale analiza Artificial Analysis bazowała na regularnych cenach.
Sonnet 5 nadal ustępuje większym modelom w benchmarkach wymagających zaawansowanego rozumowania i wiedzy. W teście CritPt — sprawdzającym rozumowanie fizyczne opracowanym przez Argonne National Labs i University of Illinois — model osiągnął 17 proc. To o 14 punktów procentowych więcej niż poprzednik, ale wciąż mniej niż GLM-5.2, Claude Opus, Fable i GPT-5.5 w wyższych konfiguracjach.
W innych obszarach Sonnet 5 wykazał solidne poprawy względem Sonnet 4.6: wzrost o 9 punktów w Terminal-Bench v2.1, o 10 punktów w Humanity's Last Exam i o 7 punktów w SciCode. Wyniki w pozostałych testach pozostały na podobnym poziomie.
To nie pierwszy raz, gdy Anthropic stosuje taką strategię cenową. Podczas premiery Opus 4.7 ceny tokenów oficjalnie pozostały bez zmian, ale nowy tokenizer dzielił ten sam tekst na „około 30 proc.” więcej tokenów, zawyżając faktyczną opłatę. Deweloper Abhishek Ray zmierzył wzrost od 1,325x do 1,47x, a analiza społeczności obejmująca ponad 483 zgłoszenia wykazała 37,4 proc. wzrost liczby tokenów na żądanie.
W przypadku Sonnet 5 problem tokenizera pogłębia bardziej agentowe zachowanie modelu, które zużywa znacznie więcej tokenów na zadanie. Ta praktyka ukrytego wzrostu kosztów staje się problematyczna wobec chińskiej konkurencji, takiej jak Deepseek V4 Pro i GLM-5.2, które oferują porównywalną wydajność za ułamek ceny w segmencie średnio-zaawansowanych modeli.
Claude Sonnet 5 pokazuje, że poprawa wydajności AI często wiąże się z ukrytymi kosztami, które nie są odzwierciedlone w oficjalnych cennikach tokenów. Branża potrzebuje bardziej przejrzystego modelu cenowego opartego na standardowych zadaniach lub rzeczywistej pracy, a nie na surowych cenach tokenów, które tracą znaczenie.

Meta open sourcowała kod do budowy własnych gadżetów z Muse oraz rozdaje 5000 egzemplarzy gotowego urządzenia Muse Home Link.

Nvidia zwiększyła cenę siedmioletniego Shield TV Pro z 199,99 do 299,99 dolara, winiąc za podwyżkę rosnące koszty komponentów napędzane boomem AI.

Nowa metoda GAD-RL adaptacyjnie reguluje nadzór nauczyciela w treningu modeli OCR, poprawiając wierność transkrypcji na benchmarkach CHAOS-Bench i OmniDocBench.