Test frameworków agentów AI pokazuje ogromne różnice kosztów — Claude Code najszybszy za $0,195, OpenCode najtańszy za $0,073 za zadanie.

Źródło zdjęcia: The Decoder
Firma Composio przeprowadziła test porównawczy czterech popularnych frameworków agentów AI, testując je na modelu DeepSeek V4 Flash. Wyniki pokazują znaczące różnice w kosztach i szybkości działania, mimo podobnych wskaźników sukcesu. Szczegóły badania zostały opublikowane przez The Decoder.
Composio przeprowadziło testy na 30 rzeczywistych zadaniach z wykorzystaniem popularnych narzędzi takich jak Gmail, GitHub, Slack i Notion. Wszystkie frameworki używały tego samego modelu — DeepSeek V4 Flash, co pozwoliło na rzetelne porównanie wpływu samego oprogramowania otaczającego model AI na wydajność i koszty.
Badanie objęło cztery frameworki: Claude Code, Codex, OpenCode i Oh My Pi. Każdy z nich został oceniony pod kątem trzech kluczowych metryk: wskaźnika sukcesu, czasu wykonania zadania oraz kosztów operacyjnych.
Wskaźniki sukcesu między frameworkami pozostawały stosunkowo zbliżone. Oh My Pi osiągnął najlepszy rezultat z 17 zadaniami wykonanymi pomyślnie z 30, podczas gdy OpenCode nieco odstał z wynikiem 14/30. Pozostałe frameworki znajdowały się między tymi wartościami.
Prawdziwe różnice ujawniły się w zakresie szybkości i kosztów. Claude Code, mimo że był najszybszy, generował najmniej tokenów wyjściowych i wykonywał najmniej wywołań narzędzi, okazał się znacznie droższy od konkurencji. To paradoks, który pokazuje, jak różne podejścia do optymalizacji mogą wpływać na strukturę kosztów.
Wyniki badania pokazują, że wybór frameworka agenta AI może mieć znaczący wpływ na budżet projektów wykorzystujących sztuczną inteligencję. Organizacje muszą rozważyć trade-off między szybkością wykonania a kosztami operacyjnymi, w zależności od specyfiki swoich potrzeb i ograniczeń budżetowych.

Meta wprowadza nowe narzędzia AI wykrywające reklamy i konta kierujące do materiałów przedstawiających wykorzystywanie seksualne dzieci na Facebooku i Instagramie.

Framework REACT redukuje błąd rekonstrukcji pH oceanu o 14,7% i błąd chemiczny o 24% dzięki modelowaniu zgodnemu z cyklem węgla.

Brytyjski startup Books by People wprowadza znak certyfikujący książki jako napisane przez człowieka, reagując na skandale z AI w wydawnictwach.