Mimo obietnic Muska i Nvidii naukowcy jak LeCun ostrzegają, że roboty humanoidalne AI nie są jeszcze wystarczająco inteligentne, by zmienić nasze życie.

Źródło zdjęcia: MIT Technology Review
Nowy tekst MIT Technology Review przygotowany wspólnie z fundacją badawczą Aventine analizuje jedną z najgorętszych obietnic obecnej fali AI – humanoidalne roboty, które miałyby w ciągu kilku lat zrewolucjonizować fabryki i domy. Problem w tym, że entuzjazm inwestorów i szefów firm technologicznych rozjeżdża się z tym, co realnie potrafią dziś najbardziej zaawansowane systemy robotyczne.
Białe roboty z czarną głową i torsem pojawiają się coraz częściej w materiałach wideo – tańczą, podają popcorn, wkładają śmieci do kosza, odkurzają, naciskają przycisk mikrofalówki. Ale te same nagrania pokazują też, jak maszyna przewraca się do tyłu podczas podawania butelek z wodą albo nie radzi sobie z prasowaniem koszuli. To Optimus – humanoidalny robot Tesli, który według Elona Muska ma być „nie tylko największym produktem Tesli w historii, ale prawdopodobnie największym produktem w ogóle”.
Fala zapowiedzi dotyczących humanoidalnych robotów napędzana jest przekonaniem, że te same przełomy AI, które stoją za ChatGPT od OpenAI czy Claude od Anthropic, pozwolą nowej generacji maszyn imitować ludzki ruch tak, jak chatboty imitują ludzki język. Musk, Andreessen i Huang to głosy najbardziej słyszalne w tej narracji, ale bynajmniej nie jedyne – podobny ton przebija z wyliczeń Morgan Stanley, które mówią o rynku wartym biliony dolarów już w perspektywie 2050 roku.
Jednak wielu badaczy robotyki podchodzi do tych deklaracji z dużą rezerwą. Argumentują, że takie założenia minimalizują skalę wyzwania, jakim jest wykorzystanie inteligencji zbudowanej na języku i obrazach do opanowania nieskończonej zmienności świata fizycznego. Wypowiedź Yanna LeCuna na marginesie Davos w styczniu – że żadna z firm budujących humanoidy nie wie, jak uczynić je naprawdę użytecznymi – dobrze oddaje poziom sceptycyzmu w środowisku naukowym, nawet gdy sam przemysł ogłasza kolejne spektakularne cele.
Badacze zwracają też uwagę na pojęciowe pomieszanie, które napędza część hype'u: utożsamianie robotów o ludzkim kształcie z tak zwanymi maszynami generalistycznymi, zdolnymi uczyć się i wykonywać wiele różnych zadań. Jonathan Hurst, współzałożyciel i główny specjalista od robotów w Agility Robotics oraz profesor robotyki na Oregon State University, ujmuje to bezpośrednio: „Bardzo łatwo zbudować robota, który wygląda jak człowiek. Dramatycznie trudniej jest zbudować maszynę, która rusza się lub zachowuje dynamicznie czy fizycznie jak człowiek”.
Aby zobaczyć jeden z najbardziej zaawansowanych „mózgów” robotycznych działających obecnie, autorzy artykułu przyglądają się temu, co Google DeepMind osiąga przy pomocy urządzenia o nazwie ALOHA 2 – skrót od „A Low-cost Open-source Hardware System for Bimanual Teleoperation”. Sam w sobie ALOHA 2 to nic szczególnie widowiskowego: para ramion, kilka chwytaków i dwie kamery. Reprezentuje jednak filozofię odmienną od modelu Optimusa – zamiast formy humanoidalnej stawia na prostotę mechaniczną, która ma ułatwić testowanie najbardziej zaawansowanych systemów AI dla robotyki, w tym flagowego systemu Google DeepMind – Gemini Robotics.
Gdy ALOHA 2 jest kontrolowana przez Gemini Robotics, staje się czymś bliższym robotowi generalistycznemu – zdolnemu wykonać wiele różnych zadań na podstawie przykładów, na których została wytrenowana. Nagranie z tego ćwiczenia pokazuje, jak robot pakuje lunch: dwoma chwytakami typu pęseta delikatnie umieszcza kromkę białego chleba w worku Ziploc, zamyka go, wkłada kilka winogron do pojemnika Tupperware, zabezpiecza wieczko, a następnie ostrożnie przekłada wszystkie elementy do lunchboxa i zapina go na zamek.
To nie jest wyśmienity lunch, ale sam fakt, że robot jest w stanie go złożyć, stanowi obiektywny postęp względem tego, co było możliwe choćby trzy lata temu. W dużej mierze zawdzięczamy to postępom AI w obszarze tak zwanych „polityk robota” (robot policies) – mechanizmów, które kontrolują, jak robot ogólnego przeznaczenia ocenia i rozumie swoje otoczenie, planuje ruch w jego obrębie, a następnie prawidłowo wykonuje zadanie.
Mniej więcej dekadę temu seria przełomów zapoczątkowała generatywną rewolucję AI, która zamieniła od dawna wyobrażaną możliwość sztucznej inteligencji w rzeczywistość. Roboticy – choć nie zgadzają się, kiedy to nastąpi – wierzą, że równie transformacyjna rewolucja jest możliwa w robotyce: taka, która wyposaży maszyny w fizyczną intuicję i płynność ruchu, dotąd pozostające poza zasięgiem.
W miarę jak postęp w robotyce przebiega krok po kroku, kluczowe pytanie brzmi, czy te same metody i narzędzia, które napędziły przełomy w AI językowej, wystarczą, aby osiągnąć ten cel – czy konieczna jest zupełnie nowa droga. Spór ten toczy się obecnie w laboratoriach robotyki w całych Stanach Zjednoczonych, gdzie medialny hype dotyczący harmonogramów przesłania żmudny, lecz realny postęp badawczy.
Napięcie między wizją Muska – powszechnych humanoidów dostępnych już za kilka lat – i ostrzeżeniami naukowców takich jak LeCun czy Hurst pokazuje, że droga od efektownego wideo do rzeczywiście użytecznej, inteligentnej maszyny jest znacznie dłuższa i bardziej skomplikowana, niż sugerują miliardowe prognozy rynkowe.

Profesor MIT Cathy Wu wykorzystuje uczenie ze wzmocnieniem, by projektować lepsze systemy transportowe, po latach porażek osiągając 30-krotny wzrost efektywności treningu.

Natura wprowadza smart ring Interface za 99 dolarów, łączący dostęp do agentów AI jak ChatGPT i Claude z monitorowaniem zdrowia użytkownika.

Framework REACT redukuje błąd rekonstrukcji pH oceanu o 14,7% i błąd chemiczny o 24% dzięki modelowaniu zgodnemu z cyklem węgla.