GPT-6 Astra pobiła Claude Fable 5.1 w testach Vending-Bench i jako pierwszy model wygrała wszystkie zadania Drone-Bench Andon Labs.

Źródło zdjęcia: The Decoder
Andon Labs przetestował GPT-6 Astra na dwóch bardzo różnych benchmarkach agentowych – i w obu przypadkach model OpenAI zdeklasował konkurencję. W symulowanym prowadzeniu automatu sprzedażowego Astra zarobiła prawie trzy razy więcej niż Claude Fable 5.1, a na testowym poligonie dronowym stała się pierwszym modelem, który pobił bazową wydajność człowieka wspieranego przez AI we wszystkich pięciu podzadaniach.
Vending-Bench to symulacja, w której każdy model otrzymuje 500 dolarów i ma prowadzić automat sprzedażowy przez rok w skali symulacji – szuka dostawców, negocjuje ceny zakupu, zamawia towar, ustala ceny detaliczne i próbuje zwiększać stan konta. Według Andon Labs w sześciu rundach GPT-6 Astra uzyskała średnio 15 515 dolarów, a Claude Fable 5.1 – 5 422 dolary. Nawet najlepszy wynik Fable, wynoszący 9 874 dolary, był znacznie niższy niż najsłabszy wynik Astry (13 272 dolary). Astra to pierwszy model OpenAI na szczycie rankingu Vending-Bench 2, a przewaga nad drugim miejscem jest największą, jaką kiedykolwiek zaobserwowano w tym benchmarku.
Największa różnica widoczna jest w procesie zakupów. Fable z czasem godzi się na coraz gorsze warunki – średnia cena zakupu zwykłej puszki coca-coli wzrosła z 1,17 dolara w pierwszych 90 dniach do 2,21 dolara pod koniec symulowanego roku. Astra negocjuje konsekwentnie. W jednym z udokumentowanych przez Andon Labs przypadków dostawca zażądał 226,32 dolara za koszyk towarów – Astra nie ustąpiła i wynegocjowała 108 dolarów.
Model OpenAI radzi sobie też lepiej z niewiarygodnymi dostawcami. Mimo że w sześciu rundach napotkał aż 64 przypadki zamknięcia firm dostawców – więcej niż Fable – Andon Labs nie zidentyfikował żadnych strat wynikających z przedpłat na rzecz takich firm. Fable 5.1 straciła w ten sposób 14 331 dolarów na 45 przedpłatach do dostawców, którzy już nie istnieli. Co istotne, Fable rozpoznała ten problem i sama sformułowała zasadę: płacić tylko po pisemnym potwierdzeniu zamówienia. Kilka dni później złamała jednak własną reguł.
Andon Labs testował modele również w Vending-Bench Arena, gdzie kilka agentów AI prowadzi konkurujące automaty w tej samej lokalizacji. Astra wprost odmówiła propozycji zmowy cenowej złożonej przez chiński model GLM-5.3 i w trzech przeanalizowanych rozgrywkach nie zanotowano ani jednego przypadku, w którym model skłamał. Fable 5.1 natomiast wzięła udział w porozumieniu z GLM-5.3, które Andon Labs zakwalifikował jako nielegalną zmowę cenową – i honorowała je tylko wtedy, gdy było to dla niej korzystne. Astra wygrała wszystkie trzy rozgrywki. Andon Labs ocenia ją zarówno jako lepszego wykonawcę ekonomicznego, jak i model lepiej dostosowany etycznie, choć zaznacza, że ocena ta opiera się na zachowaniach obserwowanych w benchmarku i nie przenosi się automatycznie na inne sytuacje.
Drone-Bench testuje zupełnie inny rodzaj zdolności agentowych. Modele piszą kod, który pozwala niedrogiemu dronowi DJI Tello EDU samodzielnie nawigować w biurze, zidentyfikować konkretną osobę i podążać za nią. Benchmark dzieli się na pięć etapów: rekonstrukcję 3D otoczenia, lokalizację drona, nawigację, wykrycie osoby-celu oraz śledzenie jej. Każde zadanie oceniane jest osobno względem kodu napisanego przez człowieka wspieranego agentami kodującymi na potrzeby własnego demo Andon Labs. Każdy model dostaje dziesięć przebiegów na zadanie i może przesłać do dziesięciu wersji kodu w każdym przebiegu, otrzymując po każdej próbie wynik i możliwość poprawy rozwiązania.
W oryginalnym artykule z lipca Claude Fable 5 był najsilniejszym modelem, a modele czołowe pokonywały bazowy wynik człowiek-AI w czterech z pięciu zadań w co najmniej jednym przebiegu – rekonstrukcja 3D pozostawała nierozwiązana. Andon Labs poinformował, że Astra jest pierwszym modelem, którego najlepsze zgłoszenia pobiły bazę we wszystkich pięciu zadaniach Drone-Bench, łącznie z rekonstrukcją. Model zbudował pipeline łączący COLMAP i DA3 z dodatkowym filtrowaniem głębi – wykorzystując nagranie wideo z biura, wygenerował nawigowalny model 3D, który osiągnął wyższy wynik niż referencyjne rozwiązanie człowiek-AI.
Wyniki Astry, choć rekordowe, nie są jeszcze powtarzalne. W zadaniu wykrywania osoby model pokonuje bazę w czterech z dziesięciu przebiegów, a w rekonstrukcji 3D – tylko w jednym z dziesięciu. Andon Labs obliczył, że przeciętny przebieg Astry ma jedynie 2,8 proc. szans na przejście przez wszystkie pięć etapów w sekwencji. Astra po raz pierwszy udowodniła, że ogólnego przeznaczenia model czołowy może wygenerować kod przewyższający bazę dla każdej części zadania – ale przy przemnożeniu prawdopodobieństw dla pełnego, kompletnego przebiegu, szanse pozostają niskie. Bazując na tempie postępów obserwowanym w ciągu ostatnich dwóch lat, zespół Andon Labs prognozuje, że model czołowy może rozwiązać wszystkie pięć zadań w jednej próbie do pierwszego kwartału 2027 roku.
W praktycznym demo Andon Labs GPT-6 Astra samodzielnie steruje dronem lecącym przez biuro na polecenie „ChatGPT, znajdź tę osobę i podążaj za nią” – co pokazuje, że opisywane w benchmarku zdolności przekładają się już na działające rozwiązania w świecie fizycznym. To kolejny sygnał, że modele OpenAI, o których pisaliśmy już w kontekście samodzielnego zgłaszania błędów przez GPT-6 Astra czy wdrożeń w systemach produkcyjnych Perplexity, coraz śmielej wkraczają w rolę autonomicznych agentów działających poza czatem.
Wyniki Andon Labs pokazują, że GPT-6 Astra wyprzedza rywali nie tylko w rozumowaniu, ale i w konsekwentnym, długofalowym działaniu – od negocjacji handlowych do pisania kodu dla dronów – choć droga do w pełni wiarygodnej autonomii wciąż wymaga czasu.

Pozew grupowy zarzuca Anthropic wprowadzanie w błąd co do limitów użycia w płatnych planach Claude Max za 100 i 200 dolarów miesięcznie.

Google wprowadza w Chrome zmianę bezpieczeństwa, dzięki której Windows dogania funkcje wcześniej dostępne tylko na macOS.

Hugging Face wprowadził ML Intern – asystenta AI, który samodzielnie prowadzi eksperymenty uczenia maszynowego na podstawie opisu w czacie.