NVIDIA udostępnia Cosmos 3 Edge, kompaktowy model o 4 mld parametrów do robotyki brzegowej, osiągający kontrolę w czasie rzeczywistym przy 15 Hz na Jetson Thor.

Źródło zdjęcia: huggingface.co
NVIDIA udostępniła Cosmos 3 Edge — kompaktowy model świata o 4 miliardach parametrów, zaprojektowany specjalnie do działania na urządzeniach brzegowych w robotyce i systemach wizji komputerowej. Model został opublikowany na platformie Hugging Face i ma pomóc robotom rozumieć otoczenie oraz podejmować decyzje w czasie rzeczywistym.
Cosmos 3 Edge to przełom w dziedzinie fizycznej sztucznej inteligencji — łączy możliwości rozumienia sceny, przewidywania przyszłych stanów i generowania akcji robotycznych w jednym modelu działającym lokalnie na urządzeniach brzegowych.
Cosmos 3 Edge wykorzystuje innowacyjną architekturę składającą się z dwóch wież transformerów, które współdzielą wspólną reprezentację danych multimodalnych. Wieża autoregresyjna przetwarza tokeny wizualne i tekstowe dla rozumienia i rozumowania, podczas gdy wieża dyfuzyjna obsługuje tokeny wizualne, dźwiękowe i akcji dla przewidywania i generacji.
Kluczowym elementem są warstwy uwagi multimodalnej, które wyrównują informacje z języka, wideo, dźwięku i akcji. Wzorce uwagi są dostosowane do każdego typu informacji — język wykorzystuje uwagę przyczynową, gdzie każdy token odnosi się do poprzednich tokenów, natomiast tokeny dyfuzyjne mają szerszy dostęp do kontekstu.
Model mapuje różne reprezentacje akcji fizycznych systemów — od pozy ego pojazdu, przez ruch kamery, po pozę efektora końcowego ramienia robotycznego — w jednolitą reprezentację geometryczną obejmującą translację, rotację i stan manipulacji.
W trybie polityki Cosmos 3 Edge przewiduje akcję wraz z jej oczekiwaną konsekwencją wizualną. Model może generować to, co system powinien zrobić, i symulować prawdopodobny wynik. To bezpośrednio łączy modelowanie świata z trenowaniem i oceną polityk robotycznych.
Deweloperzy mogą używać małego klastra H100 lub NVIDIA DGX Station do efektywnego dostrajania Cosmos 3 Edge dla swoich konkretnych zastosowań przed wdrożeniem na platformach NVIDIA edge i obliczeniach przyspieszanych. NVIDIA udostępnia również referencyjne punkty kontrolne i przepisy treningowe po dodatkowym treningu.
Model został zaprojektowany jako kompaktowy otwarty model, który może służyć jako mały model językowy wizualny (VLM) z najlepszą w klasie przepustowością i dokładnością przy wnioskowaniu w czasie rzeczywistym. Cosmos 3 Edge reprezentuje znaczący krok naprzód w kierunku autonomicznych systemów fizycznych zdolnych do rozumienia i działania w złożonych środowiskach rzeczywistych.
Zohran Mamdani wprowadza obowiązek ujawniania przez właścicieli używania sztucznej inteligencji do modyfikacji zdjęć w ogłoszeniach najmu nieruchomości.

Brytyjski instytut wykazał, że GLM-5.2 i DeepSeek V4-Pro osiągają poziom systemów zamkniętych sprzed kilku miesięcy, przy kosztach 50 razy niższych.

Koncern farmaceutyczny wdraża drugi klaster DGX SuperPOD z ośmioma systemami Vera Rubin, oferując 10x wyższą wydajność i nieograniczony dostęp do AI.