Nowy benchmark Epoch AI pokazuje, że GPT-6 Astra rozpoznaje błędy montażu mebli IKEA z 80% dokładnością wobec 28% jeszcze 10 miesięcy temu.

Źródło zdjęcia: The Decoder
Furniture Assembly Benchmark, przygotowany przez Epoch AI, sprawdza coś na pierwszy rzut oka niepoważnego: czy sztuczna inteligencja rozpozna, że ktoś źle złożył meble z IKEA. W praktyce test okazuje się solidnym miernikiem postępu w rozumowaniu wizualnym modeli AI, a wyniki najnowszych systemów pokazują, jak szybko ta zdolność się rozwija.
Benchmark działa prosto: trzy meble IKEA są fotografowane w trakcie montażu, przy czym w niektórych krokach popełniono celowe błędy. Modele AI otrzymują zdjęcia wraz z instrukcją montażu i muszą porównać jedno z drugim, wykryć nieprawidłowość i opisać, co konkretnie poszło nie tak.
Skala postępu jest tym bardziej zaskakująca, że jeszcze niedawno modele AI zawodziły w znacznie prostszych zadaniach wizualnych niż analiza wielokrokowego montażu mebli. Wynik Claude Opus 4.5 na poziomie 28% z listopada 2025 roku pokazywał, że rozpoznawanie błędów montażowych na zdjęciach było wyzwaniem przekraczającym możliwości najlepszych wówczas systemów.
Dziesięć miesięcy później GPT-6 Astra od OpenAI podniósł ten wynik do 80% – nie chodzi jedynie o wykrycie, że coś jest nie tak, ale o dokładne wskazanie, w którym miejscu instrukcji doszło do rozbieżności między obrazem a schematem montażu. Model osiąga ten wynik w tempie trzech minut na jedno zdjęcie, co według badaczy Epoch AI wciąż jest zbyt wolne, by realnie wspierać kogoś skręcającego regał w salonie.
Warto zauważyć, że Astra wyróżnia się nie tylko w tym benchmarku – model radzi sobie również dobrze w wizualnych zadaniach robotycznych, co sugeruje, że zdolność do precyzyjnego porównywania obrazu z instrukcją krok po kroku ma szersze zastosowanie niż tylko test na meblach.
Za liderem plasują się inne modele Anthropic: Claude Fable 5.1 z wynikiem 70% oraz Claude Opus 5 z wynikiem 61%. To pokazuje, że różnica między najlepszym a kolejnymi systemami wciąż jest wyraźna, choć znacznie mniejsza niż przepaść, jaka dzieliła liderów jeszcze rok temu.
Chińskie modele open-weight, w tym Kimi K3, wypadają zauważalnie słabiej – badacze Epoch AI szacują, że pozostają w tyle za czołowymi modelami o co najmniej siedem miesięcy rozwoju. To kolejny wskaźnik utrzymującej się przewagi laboratoriów amerykańskich w zadaniach wymagających złożonego rozumowania wizualnego opartego na wielu krokach i porównywaniu obrazu z tekstem instrukcji.
Choć trzy minuty na zdjęcie wykluczają obecnie zastosowanie w czasie rzeczywistym podczas samodzielnego montażu, badacze wskazują na szersze możliwości tej technologii. Podobny mechanizm – porównywanie stanu faktycznego z dokumentacją techniczną i wykrywanie odstępstw – mógłby w przyszłości wspierać naprawy samochodów lub napraw sprzętu domowego, gdzie precyzyjne zidentyfikowanie miejsca usterki na podstawie zdjęcia i instrukcji technicznej ma realną wartość praktyczną.
Sam fakt, że modele AI potrafią teraz z 80-procentową skutecznością analizować wielokrokowy proces montażu i lokalizować konkretny błąd, pokazuje, jak szybko rozwija się zdolność systemów AI do łączenia percepcji wizualnej z rozumowaniem sekwencyjnym – umiejętność kluczowa nie tylko dla asystentów domowych, ale i dla zastosowań przemysłowych czy robotyki.
Postęp odnotowany przez Furniture Assembly Benchmark w ciągu niecałego roku – od 28% do 80% skuteczności – jest jednym z wyraźniejszych sygnałów, jak szybko modele multimodalne uczą się zadań łączących obraz, tekst instrukcji i rozumowanie logiczne, nawet jeśli na razie brakuje im szybkości potrzebnej do praktycznego zastosowania w domu.

Badacze DeepMind proponują „Artificial Symbiotic Intelligence” – sieć ludzi i agentów AI zamiast pojedynczej superinteligencji napędzającej singularity.

Google od 9 października 2026 r. zdejmuje darmowym kontom Gemini model Pro, zostawiając jedynie Flash-Lite. Zmienia się też cennik abonamentów.
OpenAI testuje reklamy wizualne w ChatGPT i rozszerza narzędzia pomiarowe oraz partnerstwa dla reklamodawców na platformie z 1,2 mld użytkowników.