Anthropic wprowadza Claude Haiku 5.5 z cenami niższymi nawet o 90% i dużym skokiem wydajności, ale niezależne testy ujawniają wysokie zużycie tokenów.

Źródło zdjęcia: The Decoder
Anthropic wprowadził Claude Haiku 5.5 — najszybszy i najtańszy model ze swojej rodziny, zaprojektowany do zadań o wysokiej skali, takich jak zapytania do baz danych czy obsługa klienta. Jak czytamy w oryginalnym materiale the-decoder.com, premiera przynosi drastyczne spadki cen oraz wyraźny skok wydajności względem poprzedniej wersji, co potwierdza, że wojna cenowa na rynku modeli AI wciąż się rozkręca.
Nowy model trafił już do dostępu na AWS, Google Cloud i Azure. Anthropic jednocześnie ogłosił obniżkę kosztów odczytów z cache dla Sonnet 5.5 o połowę oraz wprowadzenie miesięcznych kredytów API dla subskrybentów.
Anthropic podaje konkretny cennik za milion tokenów. Odczyty z cache dla promptów do 100 000 tokenów kosztują 0,01 dolara wobec 0,10 dolara w Haiku 4.5. Zapis do cache spadł z 1,25 dolara do 0,125 dolara. Tokeny wejściowe kosztują teraz 0,10 dolara wobec 1,00 dolara, a wyjściowe 0,50 dolara wobec 5,00 dolara. Dla porównania Sonnet 5.5 pobiera odpowiednio 0,10 dolara za odczyt z cache, 2,50 dolara za zapis, 2,00 dolara za tokeny wejściowe i 10,00 dolara za wyjściowe.
Warto jednak zaznaczyć, że prompty dłuższe niż 100 000 tokenów kosztują pięć razy więcej niż te krótsze. Dodatkowo Anthropic zaznacza, że Haiku 5.5 korzysta z nowego tokenizera, który zużywa nieco więcej tokenów na zadanie niż poprzednik. Podobny efekt zaobserwowano wcześniej przy modelach Opus 4.x, gdzie sama zmiana tokenizera zwiększyła zużycie tokenów o około 30 procent. W praktyce realne oszczędności mogą więc być mniejsze, niż wskazują ceny jednostkowe.
Skala postępu względem Haiku 4.5 jest wyraźna w kilku kategoriach. Na Humanity's Last Exam model osiąga 45,9 procent bez narzędzi i 57,4 procent z narzędziami, wobec odpowiednio 10,2 i 18,7 procent u poprzednika. Największy skok dotyczy jednak obsługi komputera: na OSWorld-2.1 wynik wzrósł z 15,7 do 72,4 procent, co ma sens, bo zadania typu „computer use” pochłaniają dużo tokenów, a tani i szybki model idealnie nadaje się do tej roli. Na benchmarku kodowania agentowego Terminal-Bench 4.0 Haiku 5.5 uzyskał 39,2 procent, podczas gdy Haiku 4.5 nie zdobył żadnych punktów.
Anthropic porównał model także z budżetowym GPT-6 Luna od OpenAI — Haiku 5.5 wygrywa we wszystkich testowanych kategoriach. Mimo to wyniki referencyjne pokazują, że model wciąż znacząco odstaje od większego Sonnet 5.5, który na Terminal-Bench 4.0 osiąga 70,6 procent, a na OSWorld 2.1 – 83,9 procent.
Haiku 5.5 jest też pierwszym modelem klasy Haiku z regulowanymi poziomami rozumowania, co pozwala użytkownikom balansować koszt względem jakości. Anthropic zaleca model do zadań o wąskim zakresie, takich jak kompaktowanie danych, podsumowania czy praca podagentów. Do złożonego kodowania agentowego firma wciąż poleca Sonnet 5.5 lub Opus 5.5. Zabezpieczenia cyberbezpieczeństwa są ściślejsze niż u poprzednika, ale dopuszczają szerszy zakres zadań defensywnych niż w Sonnet 5.5.
Dzień po premierze, 8 października, platforma Artificial Analysis opublikowała własne pomiary. Haiku 5.5 trafił na szczyt klasy „small” z wynikiem 43 na Intelligence Index, przed GLM-5.3 Flash (42), Gemini 3.8 Flash (41) i GPT-6 Luna (38). Do Claude Sonnet 5.5 nadal dzieli go 13 punktów.
Problem dotyczy jednak zużycia tokenów. Przy najwyższym poziomie wysiłku Haiku 5.5 potrzebuje około 162 000 tokenów wyjściowych na zadanie w ramach Intelligence Index – to prawie trzy razy więcej niż 50 000 tokenów zużywanych przez GPT-6 Luna. Dysproporcja utrzymuje się nawet przy porównywalnej wydajności: na ustawieniu „high” Haiku 5.5 notuje wynik 38 przy około 55 000 tokenów na zadanie, podczas gdy GPT-6 Luna osiąga identyczny wynik przy około 50 000 tokenach.
Pod względem efektywności Pareto – czyli relacji wydajności do zużycia zasobów – model OpenAI wypada lepiej. Przejście z poziomu „xhigh” na „max” u Haiku 5.5 dodaje tylko dwa punkty, zwiększając jednocześnie zużycie tokenów 1,8 raza. Na wykresie łączącym inteligencję z kosztem zadania Haiku 5.5 w ustawieniu „max” osiąga wynik 43 za 0,21 dolara za zadanie, nieco poniżej linii efektywności Pareto, podczas gdy GPT-6 Luna w tym samym ustawieniu osiąga podobny wynik za około jedną trzecią tego kosztu.
Artificial Analysis zwraca jednak uwagę na zaletę Haiku 5.5 w postaci niskiego wskaźnika halucynacji – model myli się w 40 procentach przypadków, wobec 77 procent u GPT-6 Luna. Jego słabsza wiedza faktyczna (36 procent trafności w teście AA-Omniscience wobec 44 procent u GPT-6 Luna) jest częściowo kompensowana tym, że model częściej otwarcie przyznaje, gdy nie zna odpowiedzi. Okno kontekstowe wzrosło przy tym z 200 000 tokenów w Haiku 4.5 do 1 miliona tokenów.
Haiku 5.5 to kolejny krok w rywalizacji cenowej między dostawcami modeli AI – Anthropic stawia na agresywne obniżki i wysokie wyniki benchmarków, choć niezależne testy pokazują, że pod względem efektywności tokenów konkurencja, zwłaszcza GPT-6 Luna, wciąż ma przewagę w niektórych obszarach.

Framework ADSD łączy diagnozę błędów z reużywalnymi umiejętnościami solvera, redukując błąd o niemal 71 razy w testach przepływu mocy.

Profesor MIT Cathy Wu wykorzystuje uczenie ze wzmocnieniem, by projektować lepsze systemy transportowe, po latach porażek osiągając 30-krotny wzrost efektywności treningu.
Android Authority odnalazło w kodzie APK dowody na rozszerzenie funkcji Call for Me w Gemini na rozmowy z rodziną i znajomymi.