Microsoft AI wypuściło modele transkrypcji i syntezy mowy dla agentów głosowych — niskie opóźnienia, 60 języków i klonowanie głosu z kilku sekund nagrania.

Źródło zdjęcia: The Decoder
Microsoft AI zaprezentowało nowe modele do transkrypcji mowy w czasie rzeczywistym oraz syntezy głosu, przeznaczone do budowy agentów głosowych. Firma twierdzi, że jej nowy model transkrypcji zajmuje pierwsze miejsce pod względem dokładności w rankingu Artificial Analysis, a towarzyszące mu modele text-to-speech potrafią mówić w kilkudziesięciu językach tym samym głosem, zachowując naturalny, lokalny akcent.
Nowy model transkrypcji MAI-Transcribe-2-Streaming ma rozwiązywać jeden z fundamentalnych problemów asystentów głosowych – opóźnienie między wypowiedzią użytkownika a reakcją systemu. Dzięki pierwszym częściowym wynikom już po nieco ponad 100 milisekundach, agent może zacząć formułować odpowiedź, zanim rozmówca dokończy zdanie. Microsoft podkreśla, że model obsługuje 60 języków i – według danych firmy – plasuje się na pierwszym miejscu rankingu dokładności Artificial Analysis. Cena wprowadzeniowa, obowiązująca do końca roku, wynosi 0,54 dolara za godzinę przetworzonego audio.
Równolegle Microsoft wypuściło dwa modele text-to-speech. MAI-Voice-2.1 ma umożliwiać mówienie w 23 językach przy zachowaniu tego samego głosu, ale z naturalnym, rodzimym akcentem w każdym z nich – co ma znaczenie dla firm chcących wdrażać jednego wirtualnego asystenta na wielu rynkach bez utraty wiarygodności brzmienia. Wariant Flash tego modelu stawia na szybkość: opóźnienie na poziomie 150 milisekund i niższa cena – 15 dolarów za milion znaków wobec 22 dolarów w wersji standardowej.
Oba modele głosowe potrafią sklonować głos na podstawie zaledwie kilku sekund nagrania referencyjnego. To funkcjonalność, która budzi szczególne obawy etyczne, dlatego Microsoft zapewnia, że wprowadziło zabezpieczenia mające ograniczać nieuprawnione wykorzystanie technologii. Skala realizmu generowanej mowy jest jednak znacząca – w przeprowadzonym teście z udziałem 4 000 osób około połowa uczestników wskazała, że słyszany głos należy do prawdziwego człowieka. Nowe modele są dostępne przez Microsoft Foundry i MAI Playground, a oba modele głosowe trafiły również na platformę OpenRouter.
Premiera modeli Microsoftu zbiega się w czasie z szerszą dyskusją o tym, jak w ogóle mierzyć jakość systemów text-to-speech. Jak zauważa zespół badawczy Hugging Face w opublikowanym 30 września 2026 roku wpisie na blogu, na Hugging Face Hub dostępnych jest już ponad 8 tysięcy modeli TTS, a tempo publikacji nowych wersji dawno wyprzedziło możliwości standardowych metod oceny.
Dotychczas branża opierała się głównie na rankingach typu „arena” – takich jak TTS Arena v2, Artificial Analysis czy Voice Arena – w których użytkownicy porównują wyniki dwóch modeli i głosują na lepszy, a system ocen typu Elo (zwykle liczony modelem Bradley–Terry) ustala ranking. Problem w tym, że modele open-source są w nich systematycznie niedoreprezentowane: według danych Hugging Face, na dzień 30 września 2026 roku jedynie 16 z 92 modeli notowanych w Artificial Analysis to modele z otwartymi wagami, a podobny rozrzut dotyczy Voice Arena. Wynika to z praktycznych przyczyn – dodanie modelu dostępnego przez API wymaga jedynie klucza API, podczas gdy model open-source musi zostać samodzielnie wdrożony i hostowany przez operatora arenowego rankingu, a dostawcy komercyjni mają po prostu większą motywację, by zabiegać o obecność w takich zestawieniach.
W odpowiedzi na te ograniczenia Hugging Face zaprezentował Open TTS Leaderboard – ranking opierający się na obiektywnych metrykach, a nie na głosowaniu ludzi. Ocenia on modele pod kątem trzech wymiarów: zrozumiałości (wskaźnik błędów słów/znaków między promptem a transkrypcją wygenerowanego audio, liczony za pomocą Qwen3 ASR), szybkości (odwrotny współczynnik czasu rzeczywistego dla przetwarzania wsadowego na GPU H200 oraz czas do pierwszego fragmentu audio w trybie strumieniowym) oraz podobieństwa głosu (podobieństwo kosinusowe embeddingów mówcy WavLM między wygenerowanym audio a nagraniem referencyjnym). Dzięki temu ocena modelu trwa godziny, a nie tygodnie potrzebne na zebranie głosów w tradycyjnej arenie. Autorzy zaznaczają jednak, że ich ranking nie zastępuje oceny preferencji ludzkich – metryki oparte na ASR są jedynie przybliżeniem zrozumiałości, a podobieństwo mówcy nie mierzy bezpośrednio naturalności czy ekspresyjności głosu.
Deklaracja Microsoftu, że MAI-Transcribe-2-Streaming jest numerem jeden w Artificial Analysis, nabiera dodatkowego kontekstu w świetle obserwacji Hugging Face o niedoreprezentowaniu modeli open-source w tego typu rankingach arenowych. Nie zmienia to jednak faktu, że dla firm budujących agentów głosowych liczą się przede wszystkim praktyczne parametry: niskie opóźnienie, wielojęzyczność i koszt na jednostkę przetworzonego audio czy tekstu – a w tych kategoriach Microsoft agresywnie konkuruje cenowo, zwłaszcza w wariancie Flash modelu głosowego. Jednocześnie łatwość klonowania głosu z kilkusekundowego nagrania, potwierdzona wysokim odsetkiem osób niewykrywających syntetycznego pochodzenia dźwięku w teście z 4 000 uczestnikami, podkreśla, jak ważne stają się mechanizmy zabezpieczające przed nadużyciami w miarę komercjalizacji tej technologii.
Nowe modele Microsoftu pokazują, jak szybko rozwija się segment głosowych agentów AI, podczas gdy równolegle społeczność – za pośrednictwem inicjatyw takich jak Open TTS Leaderboard – próbuje nadać temu rozwojowi bardziej wiarygodne i skalowalne standardy oceny jakości.

Microsoft wprowadza w Windows 11 kontenery bezpieczeństwa i lokalne modele AI, zmieniając Copilot w agenta działającego na komputerach Copilot+.
Android Authority odnalazło w kodzie APK dowody na rozszerzenie funkcji Call for Me w Gemini na rozmowy z rodziną i znajomymi.

Sondaż Quinnipiac pokazuje, że większość Amerykanów chce spowolnienia rozwoju AI i nie ufa liderom branży technologicznej.