Anthropic wypuściło Opus 5.5 — tańszy i szybszy model, który w testach dorównuje większemu Fable i respektuje zabezpieczenia poziomu Mythos.

Źródło zdjęcia: TechCrunch
Anthropic ogłosiło we wtorek premierę Opus 5.5 — nowego modelu, który firma opisuje jako nowy punkt odniesienia w kodowaniu i pracy wymagającej wiedzy specjalistycznej. Według Anthropic, model w wielu testach benchmarkowych przewyższa większy model Fable, a w kilku nieformalnych zadaniach poradził sobie tam, gdzie Fable zawiódł.
Nowa wersja jest przy tym znacząco tańsza od swojego poprzednika. Tokeny wyjściowe w Opus 5.5 kosztują 20 dolarów za milion, podczas gdy w poprzednim modelu cena wynosiła 25 dolarów za milion. Podobne spadki cen dotyczą również innych metryk rozliczeniowych. Model działa też szybciej, co odzwierciedla ogólny spadek wymagań obliczeniowych potrzebnych do jego obsługi.
Opus 5.5 trafił do użytkowników zaledwie dwa miesiące po wydaniu Opus 5, które miało miejsce 24 lipca. Tak krótki cykl aktualizacji pokazuje, jak intensywnie Anthropic konkuruje z innymi laboratoriami AI o pozycję lidera w segmencie modeli przeznaczonych do kodowania i pracy intelektualnej. Zgodnie z komunikatem firmy, kolejne modele z rodziny 5.5 — Sonnet i Haiku — mają zostać opublikowane w najbliższych tygodniach, przynosząc analogiczne usprawnienia wydajności i kosztów.
Zmieniła się także sama forma komunikacji modelu. Anthropic podkreśla, że Opus 5.5 rzadziej używa specjalistycznego żargonu i częściej stawia kluczowe informacje na początku odpowiedzi — zmiana, która ma ułatwić pracę z modelem osobom niebędącym ekspertami technicznymi.
Anthropic zaznaczyło, że Opus 5.5 w zakresie zdolności biologicznych i cyberbezpieczeństwa jest porównywalny z modelem Mythos, dlatego objęto go tymi samymi mechanizmami ochronnymi. Zabezpieczenia te ograniczają możliwość wykorzystania modelu do wykrywania podatności w skompilowanych programach czy opracowywania rozpoznawalnych broni biologicznych, a także innych zadań wysokiego ryzyka.
Trening bezpieczeństwa Opus 5.5 był, jak podaje firma, w dużej mierze zbliżony do poprzednich modeli — obejmował testy dostosowania (alignmentu) oraz ocenę przedwydawniczą przeprowadzoną przez zewnętrzne organizacje, takie jak METR i Frontier Design. Anthropic zaznaczyło jednak, że dla kolejnych modeli już przygotowywane są bardziej zaawansowane systemy treningu i ewaluacji, w tym ulepszone mechanizmy monitorowania i bezpieczeństwa.
Premiera Opus 5.5 jest pierwszym wydaniem modelu Anthropic po tym, jak CEO Dario Amodei przystał na apele o „tempo dostosowane do frontu” (pacing the frontier) — czyli świadome zwolnienie postępów w zdolnościach AI, aby dorównały tempu prac nad bezpieczeństwem i dostosowaniem systemów.
„Doszedłem do przekonania, że pełne zaadresowanie ryzyka wymaga jeszcze większej rozwagi” — napisał Amodei w swoim wpisie opublikowanym wcześniej w tym miesiącu — „nie tylko inwestowania w zapobieganie ryzyku, ale też tempowania rozwoju zdolności, tak aby zapobieganie ryzyku miało czas nadrobić dystans”.
W opublikowanym komunikacie firma zapowiada również większą rolę polityki publicznej w nadzorze nad rozwojem coraz zdolniejszych systemów AI. „W miarę jak AI staje się coraz zdolniejsza, polityka publiczna powinna odgrywać większą rolę w zapewnieniu, że systemy, na których ludzie polegają, są bezpieczne. Ta zdolność wymaga czasu, aby ją zbudować, a my zaczęliśmy wdrażać infrastrukturę wspierającą ten proces” — czytamy we wpisie. Anthropic dodało, że więcej szczegółów tych działań zostanie ujawnionych „wkrótce”.
Opus 5.5 pokazuje, że Anthropic potrafi jednocześnie obniżać koszty i przyspieszać działanie swoich modeli, deklarując przy tym większą ostrożność w tempie rozwoju samych zdolności AI — kombinację, która może wyznaczać kierunek dla całej branży w najbliższych miesiącach.

Brytyjski startup Books by People wprowadza znak certyfikujący książki jako napisane przez człowieka, reagując na skandale z AI w wydawnictwach.

Fizyk z Harvardu zbudował BootLoops — open-source'owe narzędzie, które pozwala Claude wykonywać precyzyjne obliczenia naukowe w 18 dziedzinach.

David Robinson, autor raportów bezpieczeństwa OpenAI, odchodzi z firmy i w eseju dla The Atlantic ostrzega o zepsutej kulturze branży AI.