Naukowcy podłączyli GPT-6 Astra do robota Unitree G1 w systemie HomeBody, który samodzielnie sprząta i nawiguje nieznaną kuchnię.

Źródło zdjęcia: The Decoder
Naukowcy ze Stanfordu i Caltechu podłączyli model GPT-6 Astra bezpośrednio do robota humanoidalnego Unitree G1 i pozwolili mu samodzielnie posprzątać nieznaną wcześniej kuchnię. System o nazwie HomeBody, opisany w artykule the-decoder.com, to kolejny test potwierdzający, że model wizualno-językowy OpenAI dobrze radzi sobie z kontrolą fizycznych maszyn.
Kluczowa różnica między HomeBody a klasycznymi systemami robotycznymi polega na architekturze. Zamiast osadzać między modelem językowym a fizycznym robotem dedykowaną, wyszkoloną warstwę kontrolną, twórcy HomeBody postawili na wymienny model wizualno-językowy — w tym przypadku GPT Astra — który wywołuje bezpośrednio rozszerzalną bibliotekę umiejętności. Biblioteka ta obejmuje takie zdolności jak chwytanie przedmiotów, nawigację po pomieszczeniu czy otwieranie szuflad.
Proces zaczyna się od eksploracji. Robot najpierw skanuje nieznane otoczenie, a na tej podstawie budowany jest cyfrowy bliźniak pomieszczenia w środowisku symulacyjnym Nvidia Isaac Sim. Jednocześnie system rejestruje w pamięci przestrzennej pozycje obiektów i lokalizacje w kuchni. To rozwiązanie pozwala robotowi zachować orientację nawet wtedy, gdy przedmiot, który wcześniej zauważył, opuszcza jego bieżące pole widzenia — nie musi „zapamiętywać” wszystkiego wizualnie w czasie rzeczywistym, bo korzysta z zbudowanej wcześniej mapy.
Gdy robot otrzymuje polecenie w stylu „posprzątaj kuchnię”, model językowy samodzielnie rozkłada je na konkretne kroki i, co istotne, koryguje się na bieżąco w przypadku błędów. Kod projektu jest dostępny publicznie na GitHubie, co pozwala innym badaczom weryfikować i rozwijać architekturę systemu.
Badacze nie kryją, że system ma poważne ograniczenia praktyczne. Astra działa z zauważalnym opóźnieniem, co w kontekście fizycznej robotyki może mieć znaczenie przy zadaniach wymagających szybkiej reakcji. Do tego dochodzą przegrzewające się serwomechanizmy w palcach robota oraz wysokie koszty obliczeniowe związane z uruchamianiem dużego modelu wizualno-językowego w czasie rzeczywistym.
HomeBody nie jest pierwszym testem zdolności GPT-6 Astra w kontekście robotyki. Wcześniejsze benchmarki wykazały znacząco poprawione rozumowanie przestrzenne modelu — zdolność, którą wykorzystano również w innym projekcie, gdzie Astra wykrywała błędy montażu mebli IKEA ze skutecznością 80 procent. Inne testy zwróciły jednak uwagę na kwestie bezpieczeństwa, jakie mogą wystąpić, gdy Astra bezpośrednio kontroluje robota — sygnalizując, że mimo obiecujących wyników technicznych, wdrożenie takich systemów w realnych warunkach domowych wymaga dalszej pracy nad zabezpieczeniami.
Fakt, że OpenAI ogłosiło już plany powrotu do robotyki, w tym rozwiązań do zastosowań osobistych, nadaje projektowi HomeBody dodatkowy kontekst. Eksperyment ze Stanfordu i Caltechu pokazuje, jak może wyglądać architektura przyszłych robotów domowych — takich, w których nie trzeba osobno trenować wyspecjalizowanego modelu kontrolnego dla każdego robota, a wystarczy podłączyć uniwersalny model wizualno-językowy do biblioteki umiejętności i pamięci przestrzennej.
Jednocześnie zidentyfikowane problemy — opóźnienia, przegrzewanie się podzespołów, koszty obliczeniowe oraz sygnalizowane wcześniej kwestie bezpieczeństwa — pokazują, że droga od demonstracji laboratoryjnej do praktycznego, bezpiecznego robota domowego wciąż jest długa. HomeBody stanowi jednak konkretny dowód, że kierunek „model wizualno-językowy jako mózg robota” jest technicznie wykonalny już dziś.
Projekt HomeBody, choć eksperymentalny, wpisuje się w szerszy trend testowania możliwości najnowszych modeli AI poza czystym tekstem czy obrazem — w środowiskach fizycznych, gdzie błędy mają realne konsekwencje.
Android Authority odnalazło w kodzie APK dowody na rozszerzenie funkcji Call for Me w Gemini na rozmowy z rodziną i znajomymi.

Common Sense Media ocenia, że ChatGPT for Teens nie wysyła alertów rodzicom w sytuacjach kryzysowych. OpenAI podważa metodologię testów.

Naukowcy wskazują, że model mózgu jako komputera zniekształca nasze rozumienie myślenia i tłumaczy, czemu AI szkodzi poznaniu.