
Google a prezentat Gemini 3.5 Transcribe, un nou model de inteligenţă artificială specializat în transformarea vorbirii în text. Compania îl descrie drept cel mai precis model speech-to-text dezvoltat până acum, iar tehnologia este deja integrată în mai multe produse Google, inclusiv în Gboard Rambler pentru Android.
Spre deosebire de sistemele tradiţionale de recunoaştere vocală, Gemini 3.5 Transcribe este conceput să înţeleagă mai bine modul natural în care vorbesc oamenii. Modelul poate interpreta ezitări, corectări făcute în timpul unei propoziţii, termeni specializaţi şi chiar zgomotul de fundal, transformând ulterior înregistrarea într-un text mai curat şi mai uşor de folosit.
Unul dintre punctele forte ale noului model este capacitatea de a interpreta situaţiile în care utilizatorul se corectează în timp ce vorbeşte. Dacă spui „ne întâlnim marţi, nu, miercuri”, de exemplu, Gemini 3.5 Transcribe poate identifica schimbarea şi reda în text varianta corectă, fără să păstreze toate ezitările din conversaţie, notează 9to5Google.
Modelul poate elimina şi expresii precum „ăă” sau „mmm” atunci când acestea nu sunt relevante pentru rezultatul final. În acelaşi timp, poate structura automat textul rezultat şi permite modificarea acestuia folosind comenzi vocale formulate natural.
Potrivit măsurătorilor realizate de Artificial Analysis şi citate de Google, Gemini 3.5 Transcribe are o rată medie de eroare de aproximativ 4% în transcrierea în timp real şi de 2,6% atunci când înregistrarea este procesată fără constrângerile specifice modului streaming.
Un alt avantaj este suportul pentru vocabular personalizat. Acest lucru poate fi important la transcrierea numelor neobişnuite, a termenilor tehnici, a codurilor sau a identificatorilor alfanumerici. Google susţine că modelul poate recunoaşte şi transcrie automat peste 85 de limbi, inclusiv în prezenţa unor accente regionale şi dialecte diferite.
Gemini 3.5 Transcribe nu este destinat exclusiv dictării. În cazul fişierelor audio preînregistrate, modelul poate diferenţia vocile mai multor persoane, atribuind replicile fiecărui vorbitor şi adăugând marcaje temporale.
În prezent, sistemul poate identifica până la trei vorbitori, în timp ce suportul pentru un număr mai mare de persoane este încă în fază experimentală.
Google susţine şi că noul model reduce semnificativ timpul necesar pentru obţinerea transcrierii finale. Comparativ cu Chirp 3, modelul de transcriere lansat de companie în 2025, timpul până la obţinerea rezultatului este cu aproximativ 70% mai mic, conform măsurătorilor prezentate de Google.
Pe benchmark-ul FLEURS, utilizat pentru evaluarea performanţei multilingve, Gemini 3.5 Transcribe a obţinut o rată de eroare de 5,50% în modul streaming şi 5,04% în modul non-streaming pentru setul de limbi şi regiuni inclus în evaluare.
Google nu vede noua tehnologie doar ca pe un instrument pentru transcriere. Gemini 3.5 Transcribe poate colabora cu alte modele Gemini pentru sarcini mai complexe, inclusiv analiza unor fişiere sau generarea de imagini.
Tehnologia este deja utilizată în mai multe produse ale companiei. În aplicaţia Gemini pentru macOS, de exemplu, funcţia Speak to Window permite interacţiunea vocală, în timp ce Gemini 3.5 Transcribe este folosit şi pentru microfonul din caseta de prompt a Google Antigravity.
În acest caz, sistemul poate utiliza, cu permisiunea utilizatorului, informaţiile afişate pe ecran şi istoricul conversaţiei pentru a interpreta mai corect nume de fişiere, documente deschise sau alte elemente relevante.
Pe Android, tehnologia a ajuns deja în Gboard Rambler. Următorul pas important este Chrome, unde Google pregăteşte posibilitatea de a utiliza vocea pentru introducerea textului în orice câmp al unei pagini web.
Practic, utilizatorii vor putea dicta răspunsuri, redacta postări sau introduce prompturi pentru Gemini fără să mai fie nevoiţi să tasteze manual.
Pentru dezvoltatori, Gemini 3.5 Transcribe este disponibil în previzualizare publică prin Gemini API, Google AI Studio şi Google Antigravity. Companiile pot testa tehnologia şi prin Gemini Enterprise Agent Platform, în timp ce integrarea în Gemini Enterprise for Customer Experience urmează să fie disponibilă ulterior.
Prin urmare, Google pare să trateze Gemini 3.5 Transcribe nu doar ca pe un upgrade al tehnologiei de dictare, ci ca pe o componentă importantă pentru interacţiunea vocală cu produsele sale. Dacă modelul îşi confirmă performanţele în utilizarea de zi cu zi, transcrierea ar putea deveni doar una dintre aplicaţiile sale, în timp ce vocea ar putea deveni o metodă de control tot mai importantă pentru aplicaţiile şi serviciile Google.
