[Anthropic ogłosiło Claude Opus 5.5](https://the-decoder.com/claude-opus-5-5-matches-fable-5-1-at-40-percent-lower-cost-as-anthropic-promises-to-fix-claudish-writing/) – pierwszy model nowej rodziny,

Źródło zdjęcia: The Decoder
Anthropic ogłosiło Claude Opus 5.5 – pierwszy model nowej rodziny, który według firmy dorównuje wydajnością flagowemu Claude Fable 5.1, kosztując przy tym znacznie mniej i działając szybciej niż poprzednik, Opus 5. To druga aktualizacja linii Opus w ciągu niespełna dwóch miesięcy – jak przypomina ZDNet, sam Opus 5 reklamowany był jako model o „prawie fable'owej” wydajności za pół ceny. Teraz Anthropic idzie o krok dalej.
Firma twierdzi, że Opus 5.5 dorównuje Fable 5.1 „na większości zadań”, kosztując około 40 procent mniej niż Opus 5 w przeliczeniu na całkowite koszty operacyjne. W kolejnych tygodniach mają się pojawić Claude Sonnet 5.5 i Haiku 5.5, z podobnymi usprawnieniami wydajności, efektywności i bezpieczeństwa.
Anthropic oparło swoją argumentację na serii testów porównujących Opus 5.5 z Fable 5.1, Opus 5 oraz konkurencyjnymi modelami OpenAI: GPT-6 Astra i GPT-5.6 Sol. W teście Terminal-Bench 4.0, mierzącym agentowe kodowanie, Opus 5.5 osiągnął 66,4 procent, wyprzedzając Fable 5.1 (55,8 procent), Opus 5 (52,3 procent) i GPT-6 Astra (57,9 procent). W FrontierCode v1.1 wynik to 54,4 procent wobec 50,3 procent dla Fable 5.1. W CursorBench 4.0 Opus 5.5 uzyskał 57,8 procent, GPT-5.6 Sol – 41,7 procent.
W teście wiedzy biznesowej GDPval-AA v2.1 Opus 5.5 osiągnął wynik 1846 punktów, przewyższając Fable 5.1 (1735) i Opus 5 (1708). W Humanity's Last Exam z użyciem narzędzi model zdobył 67,7 procent, wobec 65,6 procent u Fable 5.1 i 57,2 procent u GPT-6 Astra. Wyjątkiem jest agentowe badanie naukowe (Terminal-Bench-Science 0.1) – tu GPT-6 Astra prowadzi z wynikiem 64,6 procent, a Opus 5.5 osiąga 58,7 procent.
Co do samych kosztów: ceny tokenów wejściowych spadły z 5 do 4 dolarów za milion, a wyjściowych z 25 do 20 dolarów za milion – to 20-procentowa redukcja. Koszty odczytu z pamięci podręcznej (cache reads) obniżono aż o 60 procent, z 0,50 do 0,20 dolara za milion tokenów, a zapisu do cache – z 6,25 do 5 dolarów. Anthropic podkreśla, że sumaryczne koszty operacyjne, uwzględniające zarówno cenę tokenów, jak i ich rzeczywiste zużycie, są niższe o około 40 procent niż w przypadku Opus 5 – model po prostu potrzebuje mniej tokenów, by wykonać to samo zadanie, a generuje wynik ponad 30 procent szybciej.
Firma wskazuje konkretne porównania z konkurencją: na FrontierCode Opus 5.5 pokonuje GPT-6 Astra za około 20 procent kosztu na zadanie. Na Terminal-Bench 4.0 osiąga tę samą wydajność co Astra za 40 procent ceny. Na CursorBench wyprzedza GPT-5.6 Sol o 11 punktów, kosztując jedną trzecią. Yashodha Bhavnani, wiceprezes ds. produktów AI w Box, potwierdza to w praktyce: „W naszych ewaluacjach Claude Opus 5.5 zużył jedną trzecią tokenów Opus 5, a jego odpowiedzi były o 40 procent mniej rozwlekłe bez utraty dokładności”. Redukcja cen to, jak zauważa the-decoder, bezpośrednia odpowiedź na presję ze strony OpenAI oraz zwłaszcza chińskich modeli AI, które oferują niższą wydajność, ale za ułamek ceny – podobną strategię cenową opisywaliśmy niedawno w kontekście Groka 4.7 od xAI.
Anthropic przyznaje, że aktualizacja odpowiada głównie na oczekiwania klientów dotyczące kosztów, efektywności i jakości komunikacji – zwłaszcza w usługach finansowych, prawie i tworzeniu oprogramowania. Obecne modele Claude bywały krytykowane za formuliczny, zawiły styl pisania, określany żartobliwie jako „Claudish”. Opus 5.5 ma stawiać najważniejsze informacje na początku, używać mniej żargonu i ściślej trzymać się instrukcji dotyczących formy tekstu.
John Ruelas, inżynier oprogramowania w Ramp, mówi wprost: „Rozwlekły, trudny do śledzenia output był moim największym problemem z modelami frontier, a Claude Opus 5.5 to naprawia. Pisze jak dobry kolega z pracy i trzyma się naszych zasad pisania. Specyfikacja projektowa wyszła użyteczna z minimalnymi poprawkami, a gdy model przepisał jeden z naszych promptów, wolałem jego wersję od swojej”. Podobne wrażenia relacjonuje Mario Rodriguez, chief product officer GitHub: w testach na GitHub Copilot CLI i VS Code Opus 5.5 zużył jedne z najmniejszych liczb tokenów i kroków wśród testowanych modeli, rozwiązując więcej zadań terminalowych niż Opus 5 w mniej niż połowie kroków.
Carl Bennett, CIO w Deloitte Consulting LLP, dodaje twarde liczby: „Nawet na najniższym ustawieniu wysiłku Claude Opus 5.5 wykrył 72 procent znanych błędów w naszych przeglądach kodu, wobec 56 procent u Opus 5 na wysokim wysiłku, przy mniejszej liczbie fałszywych alarmów i ułamku objętości wyjściowej”. Anthropic samo zaznacza, że wczesni testerzy opisywali tekst modelu jako bardziej przejrzysty i zrozumiały, co ma czynić go lepszym partnerem podczas długich sesji pracy.
Opus 5.5 jest pierwszym modelem z rodziny Opus z zabezpieczeniami dla cyberbezpieczeństwa, biologii i rozwoju zaawansowanych modeli językowych na poziomie porównywalnym z Fable 5.1. Gdy te mechanizmy się aktywują, żądania są – jak deklaruje Anthropic – transparentnie przekierowywane do innego modelu. Użytkownicy wciąż mogą znajdować i naprawiać błędy w kodzie, ale większość zadań związanych z cyberbezpieczeństwem trafi do starszego modelu Opus 4.8. Żądania oznaczone przez klasyfikatory jako dotyczące biologii lub rozwoju zaawansowanych LLM będą kierowane do Opus 5.
Zweryfikowane organizacje mogą aplikować o dostęp do modelu w celach badań biologicznych poprzez Life Sciences Verification Program. Anthropic planuje w najbliższych tygodniach rozszerzyć istniejący Cyber Verification Program o Opus 5.5. Model jest już dostępny na wszystkich platformach, w tym Amazon Web Services, Google Cloud i Microsoft Azure, a deweloperzy korzystający z Claude Platform mogą uzyskać do niego dostęp pod identyfikatorem claude-opus-5–5.
Firma nawiązuje przy tym do szerszej debaty w branży na temat tempa wypuszczania coraz bardziej zdolnych modeli. Anthropic zapowiada bardziej rygorystyczny przegląd środowisk uczenia ze wzmocnieniem, wskazując, że wadliwe środowiska treningowe są głównym źródłem niewspółmiernego zachowania modeli. Firma pracuje też nad lepszymi nagrodami alignmentowymi, zautomatyzowanymi metodami tworzenia scenariuszy treningu bezpieczeństwa oraz silniejszym monitoringiem. Zewnętrzne organizacje Frontier Design i METR przetestowały Opus 5.5 jeszcze przed jego publicznym udostępnieniem. Kontekst tej dyskusji uzupełnia niedawne stanowisko OpenAI, które wezwało do międzynarodowych standardów dla systemów AI zdolnych do samodoskonalenia się, podczas gdy część badaczy publicznie apeluje o wstrzymanie tempa wydawania modeli, dopóki metody alignmentowe nie nadgonią możliwości technicznych. Anthropic deklaruje podobne stanowisko, wzywając do wyższego standardu bezpieczeństwa dla modeli, które mogłyby całkowicie zautomatyzować badania nad AI, i podkreśla, że polityka publiczna powinna mieć większy głos w ustalaniu tego standardu.
Claude Opus 5.5 pokazuje, że Anthropic stawia w tej rundzie na trzy elementy naraz: obniżenie kosztów o 40 procent, wydajność zbliżoną do najdroższego modelu w portfolio i poprawę jakości komunikacji, którą krytykowano jako „Claudish”. Sonnet 5.5 i Haiku 5.5 mają dołączyć w kolejnych tygodniach, kontynuując tę samą strategię niższych cen i szybszej pracy w obliczu narastającej presji cenowej ze strony OpenAI i chińskich konkurentów.

OpenAI wdraża textGrain – niewidzialny znak wodny w tekstach ChatGPT i Codexa dla użytkowników UE, zgodnie z wymogami AI Act.

Profesor MIT Cathy Wu wykorzystuje uczenie ze wzmocnieniem, by projektować lepsze systemy transportowe, po latach porażek osiągając 30-krotny wzrost efektywności treningu.

Nvidia zwiększyła cenę siedmioletniego Shield TV Pro z 199,99 do 299,99 dolara, winiąc za podwyżkę rosnące koszty komponentów napędzane boomem AI.