CEO ElevenLabs Mati Staniszewski mówi o wycenie 22 mld dolarów, konkurencji z klientami i wdrożeniu AI w polskiej opiece zdrowotnej.

Źródło zdjęcia: TechCrunch
Rozmowa TechCrunch z Matim Staniszewskim, współzałożycielem i CEO ElevenLabs, przeprowadzona podczas konferencji Nrth w Toronto, rzuca światło na strategię firmy budującej „warstwę głosową” sztucznej inteligencji — modele zamieniające tekst w mowę na tyle naturalną, że większość ludzi nie zdaje sobie sprawy, że rozmawia z maszyną. ElevenLabs, założone cztery lata temu, deklaruje obecnie tempo przychodów na poziomie 600 milionów dolarów rocznie (ARR) i jest wyceniane przez inwestorów na 22 miliardy dolarów.
Firma obsługuje pierwszą linię wsparcia telefonicznego dla 35 milionów amerykańskich klientów Klarny, a wśród jej klientów są też Deutsche Telekom, Cisco, Adobe oraz coraz większa liczba instytucji rządowych. Z platformy korzystają również twórcy audiobooków, dubbingu i muzyki.
Rok temu, na konferencji TechCrunch Disrupt, Staniszewski przewidywał, że modele audio zostaną skomodytyzowane w ciągu kilku lat. Dziś ocenia tę prognozę z rezerwą: „Jest jeszcze wiele do zrobienia, a różnica jakości, jaką można osiągnąć na poziomie samego modelu, jest wciąż znacząca. Jeśli myślimy w dłuższej perspektywie, powiedzmy trzy, pięć lat od teraz, te różnice się zmniejszą” – powiedział. Jego zdaniem docelowym celem branży jest zdanie testu Turinga dla konwersacyjnej AI, co wymaga połączenia inteligencji z inteligencją emocjonalną – umiejętnością zrozumienia emocji rozmówcy i odpowiedniego dopasowania tempa czy tonu rozmowy. „To jeszcze nie zostało zrobione” – dodał.
CEO ElevenLabs przyznał też, że granice między firmami tworzącymi modele, platformy i aplikacje coraz bardziej się zacierają. Jako przykład podał Anthropic, które z firmy skoncentrowanej na modelach ewoluowało w platformę, a teraz coraz szerzej działa też jako dostawca aplikacji. Sam ElevenLabs doświadcza tego z bliska – Decagon, konwersacyjna platforma AI, wytrenowała swój produkt głosowy na technologii ElevenLabs i dziś przepuszcza zapytania przez własne modele, stając się jednocześnie klientem i konkurentem.
Pytany o wybór między modelami frontier lab a open-weight, Staniszewski podkreślił, że to nie jest wybór binarny. W przypadku prostych interakcji informacyjnych z klientami – gdzie baza wiedzy definiuje jakość doświadczenia – wiele modeli open-source wystarcza. Jednak w usługach finansowych, gdzie potrzebna jest autentykacja, informacje o transakcjach czy zwrotach, „nie ma miejsca na błąd”, a tam wciąż dominują modele frontier.
Kwestia doboru modeli komplikuje się jeszcze bardziej w kontekście klientów rządowych. Amerykański rząd jest klientem ElevenLabs, tak jak rządy europejskie – a niektóre dostępne modele open-weight mają chińskie pochodzenie. Staniszewski zapewnia, że dobór modeli i głosów zależy od konkretnego wdrożenia i wymagań danego kraju. „Jeśli współpracujemy z rządem Polski czy Brazylii, mają swój własny zestaw wymagań. To może być model open-weight, model closed-source albo ich własny model dostrojony” – wyjaśnił.
Jako konkretny przykład podał polski system opieki zdrowotnej: „[W Polsce] to przypadek związany z opieką zdrowotną. Pacjenci umawiają wizyty w publicznym systemie zdrowia, a 18% z nich nigdy się nie pojawia. Wdrożenie to agenci, którzy dzwonią i przypominają. Mieli zestaw modeli zoptymalizowanych na swojej wiedzy, a my integrujemy się, zachowując lokalizację danych” – powiedział CEO ElevenLabs.
Poruszono również etyczny wymiar wdrażania agentów głosowych – kwestię, czy firmy powinny informować klientów, że rozmawiają z AI, a nie z człowiekiem. Staniszewski jest przekonany, że obecnie takie ujawnienie powinno mieć miejsce. „Ludzie nie są jeszcze do tego przyzwyczajeni, i powszechnym wzorcem jest to, że nie chcesz czuć się oszukany podczas tej rozmowy” – powiedział. Jednak przewiduje zmianę: „Za pięć lat, kiedy każdy będzie miał własnego agenta działającego w jego imieniu, będziesz dzwonić i oczekiwać agenta. Wtedy myślę, że przesuniemy się jako społeczeństwo”. Jako dobrą praktykę wskazał danie klientom wyboru – na przykład informowanie, że oczekiwanie na człowieka wynosi 30 minut, i pozwolenie zdecydować. „W prawie wszystkich przypadkach wybierają agenta, a potem są zaskoczeni, jak dobre jest to doświadczenie” – dodał.
Zapytany o marże brutto w kontekście kosztów modeli i inferencji, Staniszewski unikał konkretów, ale zarysował filozofię firmy: „Jeśli możemy przekazać jakiekolwiek oszczędności klientowi, to to robimy. Najważniejsze jest wciąż dowiedzenie wartości i bycie przy kliencie. Jeśli możemy inwestować i dowieść tej wartości, nie mamy nic przeciwko temu, żeby marże spadały niżej, aby faktycznie skorzystać razem z wartości, która powstanie w ciągu najbliższych pięciu lat” – wyjaśnił.
Odnośnie danych treningowych, Staniszewski wskazał, że kluczem nie był sam wolumen danych, ale ich adnotacja. Firma zatrudnia tysiące osób na zasadzie kontraktowej, które pomagają oznaczać nie tylko treść wypowiedzi, ale też sposób, w jaki ludzie mówili, kiedy mówili i jakich emocji używali. W niektórych przypadkach modele były tworzone razem z konkretnymi klientami, którzy potrzebowali rozwiązań dostosowanych do swojego przypadku użycia.
Polska pojawia się w rozmowie jako konkretny przykład wdrożenia ElevenLabs w sektorze publicznym – system agentów głosowych przypominających pacjentom o wizytach w ramach publicznej opieki zdrowotnej, gdzie problem niezjawiania się na umówione terminy dotyczy 18% pacjentów. Staniszewski podkreślił, że w takich wdrożeniach ElevenLabs integruje się z lokalnymi systemami z zachowaniem lokalizacji danych (data residency), co ma znaczenie w kontekście unijnych regulacji dotyczących przetwarzania danych osobowych i przepisów krajowych o ochronie danych medycznych. Dla polskich instytucji publicznych i firm rozważających automatyzację obsługi klienta czy przypomnień telefonicznych, przykład ten pokazuje, że technologia głosowa AI już funkcjonuje w praktyce na polskim rynku, a nie jest jedynie zapowiedzią.
ElevenLabs, wyceniane na 22 miliardy dolarów przy 600 milionach dolarów ARR, balansuje między szybkim wzrostem, coraz bardziej rozmytymi granicami konkurencji z własnymi klientami oraz kompromisami dotyczącymi marż – a wszystko to w drodze do celu, jaki Staniszewski określa jako zdanie testu Turinga przez konwersacyjną AI.

Sean Parker i Stability AI wiążą się z Sony, Warnerem i Universal, budując narzędzia AI do generowania muzyki z licencjonowanych katalogów.

Microsoft i Hugging Face udostępnili ThinkingBox — benchmark oceniający agentów AI na podstawie stanu bazy danych, nie treści odpowiedzi.

Anthropic wprowadza Claude'a jako panel boczny w Dokumentach Google – redaguje tekst, tworzy tabele i działa równolegle z Gemini.