Integracja eliminuje konwersje checkpointów i oferuje gotowe przepisy dla FLUX, Wan, HunyuanVideo — od jednego GPU do wielowęzłowych klastrów.

Źródło zdjęcia: huggingface.co
NVIDIA i Hugging Face ogłosiły integrację biblioteki NeMo Automodel z ekosystemem Diffusers, która umożliwia skalowalne trenowanie i dostrajanie modeli dyfuzji bezpośrednio z Hugging Face Hub. Współpraca ta eliminuje potrzebę konwersji checkpointów i przepisywania modeli, oferując gotowe przepisy dla najpopularniejszych modeli generatywnych, jak podaje oficjalny wpis na blogu Hugging Face.
Integracja została udokumentowana w oficjalnym przewodniku treningowym Diffusers i jest dostępna jako oprogramowanie open source na licencji Apache 2.0. Rozwiązanie adresuje rosnące zapotrzebowanie na narzędzia do trenowania modeli dyfuzji, które oferują efektywne zarządzanie pamięcią, cachowanie latentów oraz konfiguracje skalujące się od jednego GPU do setek.
NeMo Automodel to biblioteka treningowa PyTorch DTensor oparta na dwóch kluczowych zasadach projektowych. Pierwsza to natywna kompatybilność z Hugging Face — użytkownicy mogą wskazać dowolny identyfikator modelu z Hub jako pretrained_model_name_or_path i od razu rozpocząć trening. Biblioteka wykorzystuje klasy modeli Diffusers (np. WanTransformer3DModel) do ładowania oraz pipeline'y Diffusers (WanPipeline) do generowania.
Druga zasada to ”jeden program, dowolna skala” — przepisy i skrypty treningowe można łatwo modyfikować do treningu w każdej skali. Równoległość to wybór konfiguracyjny, nie przepisywanie kodu. Przełączanie między FSDP2, tensor parallel, expert parallel, context parallel i pipeline parallel odbywa się przez deklaracje konfiguracji.
Pod maską biblioteka wykorzystuje flow matching jako cel treningowy, z treningiem w przestrzeni latentnej (via pre-encoded VAE outputs) oraz multiresolution bucketed dataloading dla przyspieszenia przepustowości.
Biblioteka dostarcza gotowe przepisy dostrajania dla sześciu rodzin modeli. Wan 2.1 T2V w wersji 1.3B mieści się na pojedynczym A100 40GB, podczas gdy wersja 14B wymaga większych zasobów. FLUX.1-dev (12B parametrów) i jego następca FLUX.2-dev (32B) obsługują generowanie obrazów z tekstu z opcją LoRA.
HunyuanVideo 1.5 oferuje 13 miliardów parametrów dla zadań text-to-video, a Qwen-Image wykorzystuje architekturę MMDiT z 20 miliardami parametrów. Wan 2.2 T2V A14B wyróżnia się jako model Mixture of Experts z 27 miliardami parametrów łącznie, ale tylko 14 miliardami aktywnymi na krok.
Każdy model ma dedykowany przepis w katalogu examples/diffusion/finetune, a większość obsługuje zarówno pełne dostrajanie, jak i efektywne metody LoRA. Wyjątkiem jest Wan 2.2 MoE, dla którego przepis LoRA nie jest jeszcze dostępny.
Przepływ pracy składa się z trzech głównych kroków. Pierwszy to pre-enkodowanie datasetu, które przyspiesza trening przez wcześniejsze przetworzenie danych przez VAE. Drugi krok to uruchomienie treningu z wykorzystaniem istniejącego pliku YAML — na przykład dla FLUX wystarczy komenda wskazująca na odpowiedni przepis konfiguracyjny.
Ostatni krok to generowanie z dostrojonego checkpointu, które działa bezpośrednio z DiffusionPipeline bez dodatkowych konwersji. Wydajność skaluje się efektywnie — przykładowe testy pokazują, że można skutecznie wykorzystać zasoby od pojedynczych GPU po wielowęzłowe klastry.
Autorzy zapowiadają również nadchodzące Pythonic recipe APIs, które uproszą konfigurację i uruchamianie treningu bezpośrednio z kodu Python, eliminując potrzebę zarządzania plikami YAML.
Ta integracja stanowi znaczący krok w demokratyzacji dostępu do zaawansowanych technik trenowania modeli dyfuzji, łącząc łatwość użytkowania Diffusers z mocą obliczeniową rozwiązań NVIDIA.

Chiński model Kimi K3 zajął pierwsze miejsce w benchmarku programistycznym, ale osiąga tylko 39% dokładności w zaawansowanych zadaniach matematycznych.

Nowy procesor Google'a ma być 6–10 razy bardziej wydajny od TPU dzięki wbudowanej architekturze Gemini bezpośrednio w krzem. Wdrożenie planowane od 2028 roku.

Sąd zatwierdził rekordową ugodę Anthropic z autorami i wydawcami. Każde dzieło otrzyma 3000 dolarów odszkodowania za nielegalne pozyskiwanie książek.