Suno uruchomiło funkcję Speech w becie – pierwszy model audio generujący głos i muzykę AI jako jeden spójny utwór.

Źródło zdjęcia: The Verge
Suno, znana dotąd przede wszystkim jako generator muzyki AI, poszerza swoją ofertę o nową funkcję do syntezy mowy. Jak informuje The Verge, funkcja Speech jest już dostępna w publicznej becie na platformach webowej i mobilnej Suno i umożliwia jednoczesne generowanie głosu oraz towarzyszącej mu muzyki w tle.
Nową funkcję zapowiedział Jack Brody, dyrektor produktowy Suno. Jak podkreślił w oficjalnym komunikacie, muzyka pozostaje sercem firmy, ale jej wizja od początku wykraczała poza ten jeden rodzaj twórczości. „Dziś poszerzamy to, co możliwe w Suno, dzięki Speech: pierwszemu modelowi audio, który generuje głos i muzykę razem, jako jeden spójny utwór” – stwierdził Brody.
Synteza mowy generowanej przez AI nie jest nowością na rynku. DeepMind eksperymentuje z głębokim uczeniem w tym obszarze już od dekady, Adobe posiada własne narzędzie text-to-speech, a ElevenLabs stało się jedną z najbardziej rozpoznawalnych platform tego typu od swojego startu w 2023 roku. Suno wchodzi więc na już zagospodarowany rynek – prawdopodobnie w celu zdywersyfikowania swojej działalności, biorąc pod uwagę, że generator muzyki firmy przyciągnął wiele procesów sądowych związanych z prawami autorskimi.
Pomysł łączenia generowanej muzyki z syntetycznym głosem to sposób Suno na ożywienie klasycznych narzędzi text-to-speech. Rozwiązanie jest opcjonalne – muzykę w tle można wyłączyć prostym przełącznikiem, jeśli zależy nam wyłącznie na czystej mowie. Koncepcja ma jednak uzupełniać konkretne zastosowania generowanej mowy, na przykład kojący podkład muzyczny do poezji albo bardziej energiczny motyw do dramatycznych voiceoverów czy przemówień motywacyjnych.
Aby skorzystać z nowej opcji, użytkownik przechodzi do zakładki „Create” i wybiera opcję Speech. Dostępne są dwa tryby pracy. Tryb Simple pozwala opisać, co ma zostać stworzone, za pomocą pola z promptem – przykładem podanym przez Suno jest fraza „kapitan piratów motywujący swoją załogę”. Tryb Advanced umożliwia natomiast wgranie własnego, gotowego scenariusza tekstowego, jeśli użytkownik precyzyjnie wie, co ma zostać powiedziane.
Ustawienia zaawansowane dają też możliwość regulacji płci generowanego głosu AI, stylu mówienia oraz stopnia zróżnicowania każdej generacji głosu. Maksymalna długość wygenerowanego nagrania wynosi około ośmiu minut.
Suno nie kryje, że funkcja jest wciąż niedopracowana. Firma zapowiada, że będzie ją udoskonalać na podstawie informacji zwracanych przez użytkowników. „Beta naprawdę oznacza betę” – powiedział Brody. „Czasami brytyjski akcent może niepostrzeżenie zawędrować do Australii i z powrotem. Dramatyczne pauzy mogą być bardzo dramatyczne. Z pewnością odkryjecie zastosowania, które nigdy nie przyszły nam do głowy.”
To otwarte przyznanie niedociągnięć wpisuje się w szerszy trend wśród firm AI, które coraz częściej wprowadzają nowe funkcje w fazie publicznej bety, licząc na to, że rzeczywiste użycie przez odbiorców szybciej ujawni problemy i wskaże nieoczekiwane sposoby wykorzystania narzędzia niż testy wewnętrzne.
Podsumowując, Suno otwiera nowy front swojej działalności, wychodząc poza generowanie samej muzyki w stronę syntezy mowy osadzonej w muzycznym kontekście – krok, który może pomóc firmie zdywersyfikować przychody w obliczu trwających sporów prawnych dotyczących jej głównego produktu.

David Robinson rzuca pracę w OpenAI, oceniając, że kultura firmy jest „zepsuta”, a branża AI nie jest wystarczająco ostrożna wobec zagrożeń.

Ubezpieczyciele obawiają się milionowych roszczeń za szkody agentów AI, w tym osobistej odpowiedzialności szefów OpenAI i Anthropic.

Nowa metoda MintFlow wymusza ograniczenia na próbkach flow matching, minimalnie zaburzając trajektorię i zachowując pretrenowany rozkład danych.