Google DeepMind wprowadza Gemini 3.5 Transcribe – precyzyjny model speech-to-text z niższym WER i błyskawiczną latencją dla deweloperów.

Źródło zdjęcia: Google
Google DeepMind zaprezentowało swój najnowszy model rozpoznawania mowy — Gemini 3.5 Transcribe. To najbardziej precyzyjny jak dotąd model speech-to-text firmy, zaprojektowany do inteligentnych interakcji głosowych. W przeciwieństwie do konwencjonalnych systemów rozpoznawania mowy, które mają problem z tłem akustycznym, złożonym żargonem i „czyszczeniem” niepłynności mowy, Gemini 3.5 Transcribe przekształca surowe audio bezpośrednio w dokładny, uporządkowany i sformatowany tekst.
Model już działa w produktach konsumenckich Google, w tym w funkcji Rambler na Androidzie oraz w aplikacji Gemini na macOS. Teraz deweloperzy mogą budować podobne rozwiązania samodzielnie — Gemini 3.5 Transcribe jest dostępny w Gemini API w Google AI Studio oraz na platformie Gemini Enterprise Agent Platform.
Kluczową nowością jest tzw. smart transcription — model bezproblemowo obsługuje autokorekty wypowiadane na żywo, usuwa „ymm” i „ehh”, a wynikowy tekst formatuje automatycznie. Gemini 3.5 Transcribe może też delegować bardziej złożone zadania, takie jak generowanie obrazów czy analiza plików, do innych modeli Gemini za pomocą wywołań funkcji — ta funkcjonalność jest obecnie dostępna w aplikacji Gemini na macOS.
Model wyróżnia się także precyzją w środowiskach zaszumionych i realistycznych warunkach nagrywania, dokładnie odczytując dane alfanumeryczne, takie jak kody pocztowe czy numery zamówień. Na benchmarku FLEURS, obejmującym zestaw najważniejszych języków i lokalizacji, Gemini 3.5 Transcribe osiągnął 5,50% WER w trybie strumieniowym i 5,04% WER przy przetwarzaniu nagrań — wynik lepszy niż poprzedni model Chirp 3.
Google integruje Gemini 3.5 Transcribe w wielu powierzchniach produktowych, wykraczając poza standardowe rozpoznawanie mowy. Na Gboardzie na Androidzie funkcja Rambler przekształca wypowiedziane myśli w dobrze sformatowany tekst, filtrując słowa-wypełniacze — użytkownik może też głosowo edytować treść, poprawiać literówki i zmieniać styl pisania.
W Google Antigravity model łączy kontekst ekranu i historię czatu (za zgodą użytkownika), by zapewnić precyzyjną transkrypcję nazw plików, myśli agenta i aktywnych dokumentów. W Google AI Studio, w trybie Build, można „vibe kodować” aplikacje głosem. W aplikacji Gemini na macOS Gemini 3.5 Transcribe nie tylko zamienia swobodną mowę w czysty, sformatowany tekst, ale umożliwia też komendy głosowe łączone z kontekstem ekranu do obsługi złożonych zadań — model w tle wywołuje inne modele Gemini, dzięki czemu można głosem podsumowywać pliki lokalne, przenosić treści między aplikacjami czy generować obrazy w miejscu kursora.
Wkrótce funkcja trafi też do Chrome, gdzie umożliwi dyktowanie tekstu w każdym polu na stronie internetowej — co ułatwi tworzenie odpowiedzi, postów czy zapytań do Gemini bezpośrednio głosem.
Gemini 3.5 Transcribe reprezentuje istotny skok względem poprzedniego modelu Chirp 3 — poprawione wskaźniki błędów, nowe funkcje i znacznie lepsza latencja mają otworzyć drogę do bardziej naturalnych interakcji głosowych w produktach Google oraz aplikacjach zewnętrznych. Dostępność modelu przez Gemini API oznacza, że firmy trzecie mogą budować własnych asystentów głosowych, narzędzia do napisów w czasie rzeczywistym czy systemy analityki po rozmowach telefonicznych, korzystając z tej samej technologii, która stoi za funkcjami Rambler czy Antigravity. To wpisuje się w szerszy trend rozwoju agentów AI, w którym mowa staje się jednym z głównych interfejsów do zarządzania złożonymi zadaniami cyfrowymi.
Gemini 3.5 Transcribe to kolejny krok Google w kierunku uczynienia głosu naturalnym, kontekstowym interfejsem obsługi aplikacji — od dyktowania tekstu po sterowanie złożonymi przepływami pracy za pomocą samej mowy.

Wyrok w sprawie Anthropicu i inne procesy sądowe pokazują, że legalność trenowania AI na książkach zależy od fair use i konkurencji rynkowej.

Praca pozycyjna proponuje Transition Complexity Profile (TCP) – metrykę mierzącą trudność przewidywania przejść w grach dla modeli AI i RL.
Simon Willison wydał LLM 0.33 – narzędzie CLI do modeli AI zyskało obsługę kluczy w embeddingach i łączenie szablonów promptów.