Skild AI i Nvidia pokazują model S1 — robot uczy się złożonych zadań z jednego nagrania wideo, bez retreningu i przeprogramowania.

Źródło zdjęcia: NVIDIA Blog
Startup Skild AI zaprezentował nową generację modelu fundamentalnego dla robotów, który uczy się zupełnie nowych zadań na podstawie pojedynczego nagrania wideo — bez konieczności retreningu czy dostrajania pod konkretne zastosowanie. Jak opisuje blog Nvidii, model S1 powstał na infrastrukturze AI Nvidii w ramach szerszej współpracy obejmującej generowanie danych syntetycznych, trenowanie modeli, symulacje i wdrożenia fizycznej AI w realnym świecie.
Hale produkcyjne, magazyny i linie montażowe rzadko pozostają niezmienne — zadania się zmieniają, układy przestrzenne ewoluują, a nowe produkty trafiają na linię. Większość robotów przemysłowych nie jest w stanie nadążyć za tymi zmianami bez znaczącego przeprogramowania. S1 ma to zmienić.
Większość robotów przemysłowych jest projektowana pod z góry określone zadania — każdy nowy produkt, proces czy układ hali wymaga zebrania kolejnych danych, retreningu i walidacji. S1 idzie inną drogą: operator nagrywa wideo z żądanym zadaniem i przekazuje je modelowi jako prompt. System interpretuje zademonstrowaną intencję, obiekty i sekwencję działań, a następnie przekłada je na konkretne akcje robota stojącego przed nim — bez żadnego retreningu, często dla zadania, którego model nigdy wcześniej nie widział w danych treningowych.
Deepak Pathak, współzałożyciel i CEO Skild AI, podsumowuje to podejście: „Uczenie się przez doświadczenie, a nie preprogramowanie, to zmiana skokowa, jaka nastąpiła w robotyce. Technologie NVIDIA Isaac Lab i NVIDIA Cosmos pomagają Skild tworzyć skalowalne, zróżnicowane doświadczenie, którego roboty potrzebują, aby uczyć się w wielu scenariuszach i wielu formach fizycznych”.
S1 poradzi sobie z nieznanymi wcześniej zadaniami trwającymi do 10 minut — od sadzenia roślin, przez robienie naleśników i przygotowywanie kawy metodą pour-over, po montaż zestawów złożonych z wielu elementów. Takie zadania mogą obejmować dziesiątki kroków manipulacyjnych i wymagać od robota układania umiejętności w sekwencje, których nigdy wcześniej nie wykonywał. W jednym z testów sadzenia roślin zespół Skild AI przeszedł od nagrania demonstracji do autonomicznego wykonania zadania na sprzęcie w zaledwie 11 minut. Model potrafi też reagować, gdy obiekty się przemieszczą, wychodzić z błędów i łączyć umiejętności w sekwencje, które nie zostały wprost zaprogramowane.
S1 przerywa cykl konieczności ciągłego retreningowania robotów pod każdą nową zmianę, pozwalając operatorom pokazywać nowe zadania bezpośrednio, bez potrzeby nowego zbioru danych czy uruchamiania nowego treningu przy każdej modyfikacji. Tam, gdzie umowy z klientami to pozwalają, doświadczenie zdobyte podczas komercyjnych wdrożeń Skild może zasilać rozwój ogólnego modelu i przyspieszać przyszłe wdrożenia.
Ta praca już trwa na hali produkcyjnej. Skild, Nvidia i Foxconn wdrażają tak zwany Skild Brain na dwuramiennych manipulatorach do precyzyjnego montażu systemów Nvidia Blackwell. W jednym z zademonstrowanych procesów robot instaluje szynę zbiorczą (busbar) oraz blok ograniczający, dokręca 16 śrub i adaptuje się do zakłóceń w trakcie wieloetapowego zadania. Praca ta wymaga precyzyjnego ruchu, kontroli uwzględniającej kontakt fizyczny, śledzenia sekwencji i zdolności do wychodzenia z błędów, gdy sytuacja różni się od zaplanowanej.
Przyspieszone obliczenia Nvidii dają Skild skalę potrzebną do trenowania wspólnego „mózgu” robotów przy wykorzystaniu symulacji, nagrań wideo z udziałem ludzi, teleoperacji oraz — tam, gdzie to możliwe — danych z rzeczywistych wdrożeń. Modele fundamentalne NVIDIA Cosmos pomagają różnicować dane treningowe i przekształcać wideo w ustrukturyzowane opisy, a Cosmos Curator wspiera opisywanie, filtrowanie i organizowanie danych na dużą skalę.
Skild intensywnie korzysta z otwartych frameworków symulacyjnych Nvidii, aby trenować i walidować swój model przed rzeczywistym wdrożeniem. Biblioteki NVIDIA Omniverse oraz framework NVIDIA Isaac Sim dostarczają fizycznie wiarygodne środowiska wirtualne do generowania danych, testowania przypadków granicznych i walidacji zachowań robota. Firma wzmacnia umiejętności swojego modelu poprzez uczenie ze wzmocnieniem w Isaac Lab — otwartym, modularnym frameworku do uczenia robotów, zasilanym przez silnik fizyczny Newton, który pomaga inżynierom Skild precyzyjnie modelować parametry fizyczne, takie jak siły, kontakt, kolizje i nacisk, redukując rozbieżność między symulacją a rzeczywistością.
Skild i Nvidia wspólnie opracowują także nowe solwery symulacyjne akcelerowane przez GPU, które szybko i dokładnie modelują sposób, w jaki roboty dotykają, chwytają i manipulują przedmiotami — mają one wkrótce zostać udostępnione wszystkim programistom w ramach Newton. Gdy modele przechodzą do produkcji, narzędzia NVIDIA Nsight pomagają inżynierom znajdować wąskie gardła wydajności podczas treningu, a zestaw NVIDIA TensorRT optymalizuje wnioskowanie, aby roboty mogły szybko reagować w fizycznym świecie.
Dla branży robotyki przemysłowej rozwiązanie takie jak S1 może oznaczać istotne przyspieszenie wdrożeń automatyzacji w środowiskach, które dotąd były zbyt zmienne dla tradycyjnie programowanych robotów — jak wielokrotnie zmieniające się linie montażowe czy elastyczne magazyny.
Skild AI, przy wsparciu infrastruktury i technologii symulacyjnych Nvidii, pokazuje, że roboty przemysłowe mogą uczyć się nowych, złożonych zadań z pojedynczego nagrania wideo — bez retreningu i kosztownej rekonfiguracji. Model S1 znajduje już zastosowanie w realnych fabrykach, w tym przy montażu systemów Nvidia Blackwell wspólnie z Foxconnem, a firma odnotowuje szybki wzrost przychodów i liczby wdrożeń komercyjnych.

OpenAI twierdzi, że AI rozwiązała problem Naviera-Stokesa, ale matematyk Buckmaster zarzuca firmie próbę przejęcia zasług za odkrycie.

Microsoft uruchomił Dynamics 365 Activate – AI-owe narzędzie migrujące klientów z Salesforce, którego Agentforce nie spodobał się użytkownikom.

Nowa praca naukowa łączy model falowo-probabilistyczny mózgu z danymi giełdowymi, proponując alternatywę dla architektur AGI opartych na sieciach neuronowych.