NVIDIA wydała nową wersję modelu Magpie TTS obsługującą 12 języków z opóźnieniem zaledwie 32 ms, umożliwiając tworzenie szybkich asystentów głosowych.

Źródło zdjęcia: huggingface.co
NVIDIA wprowadziła nową wersję swojego modelu Magpie TTS, który umożliwia tworzenie wielojęzycznych asystentów głosowych o niskim opóźnieniu. Model o otwartych wagach obsługuje 12 języków i może być wdrażany w prywatnej infrastrukturze, co daje programistom pełną kontrolę nad optymalizacją i dostosowywaniem do własnych potrzeb. Szczegóły nowego wydania opisuje artykuł na blogu Hugging Face.
Najnowsza wersja rozszerza wsparcie językowe o nowoczesny arabski standardowy, koreański i brazylijski portugalski, jednocześnie poprawiając jakość istniejących języków dzięki zaktualizowanym danym treningowym i ulepszeniom modelu.
Współczesne aplikacje głosowe coraz rzadziej obsługują tylko jeden język. Globalne systemy obsługi klienta, asystenci biznesowi, dokumentacja medyczna czy systemy automatyzacji handlu wymagają naturalnych rozmów w wielu językach przy zachowaniu niskich opóźnień.
Wyzwanie wykracza poza samo dodanie kolejnych języków. Programiści potrzebują możliwości wdrażania tam, gdzie znajdują się ich dane, spełniania korporacyjnych wymagań prywatności, dostosowywania wymowy i głosów, przewidywania opóźnień w środowisku produkcyjnym oraz skalowania na własnej infrastrukturze.
Model Magpie TTS Multilingual obsługuje angielski, hiszpański, francuski, niemiecki, włoski, wietnamski, mandaryński, hindi, japoński oraz nowo dodane: nowoczesny arabski standardowy, koreański i brazylijski portugalski. Każdy język oferuje męskie i żeńskie głosy dzięki wspólnej wielojęzycznej reprezentacji mówców.
W konwersacyjnej sztucznej inteligencji synteza mowy jest ostatnim etapem przed dotarciem odpowiedzi do użytkownika. To sprawia, że czas do pierwszego dźwięku (TTFA) — opóźnienie między rozpoczęciem generowania mowy a dotarciem pierwszego dźwięku do użytkownika — staje się jedną z najważniejszych metryk opóźnienia w całym pipeline'ie głosowym.
Model wprowadza dwa komplementarne ulepszenia architektoniczne redukujące czas wnioskowania przy zachowaniu jakości mowy. Frame stacking sprawia, że dekoder przewiduje dwie klatki audio w każdym kroku dekodowania zamiast jednej, co zmniejsza o połowę liczbę iteracji dekodera. Lokalne transformery kompensują potencjalny spadek jakości audio wprowadzony przez frame stacking.
Wyniki testów wydajności pokazują, że na GPU B200 model osiąga TTFA na poziomie 32 ms dla pojedynczego strumienia, podczas gdy dla 64 równoczesnych strumieni wynosi 239 ms przy przepustowości 320 razy szybszej od czasu rzeczywistego.
Model NVIDIA Magpie TTS stanowi otwartą podstawę dla produkcyjnych aplikacji głosowych, oferując programistom pełną kontrolę nad wdrożeniem przy zachowaniu profesjonalnej jakości i wydajności wymaganej w zastosowaniach komercyjnych.

Replikacja badania nad α-FLOPs pokazuje, że liczba operacji FLOP-ów słabo szacuje realny czas wykonania na nowszym sprzęcie AI.

Badanie MIT CSAIL pokazuje, że przy dużych zbiorach danych pojedynczy obraz treningowy przestaje wpływać na wynik generatora AI — to zjawisko attribution decay.

Praca z ICML 2026 ostrzega, że metody alignmentu AI to technologia dual-use, którą autorytarne reżimy mogą wykorzystać do cenzury i manipulacji informacją.