Suno lansează Speech: AI-ul care generează voci şi muzică de fundal dintr-un simplu text

Suno, cunoscut până acum în special pentru instrumentele sale de generare muzicală cu inteligenţă artificială, îşi extinde platforma cu o nouă funcţie dedicată vocilor sintetice. Compania a lansat în versiune beta publică Speech, un instrument capabil să genereze voci pornind de la un text sau de la o descriere introdusă de utilizator. Funcţia este disponibilă pe platforma web şi în aplicaţiile mobile Suno şi poate produce simultan voce şi muzică de fundal.

„Muzica va fi întotdeauna în centrul Suno şi a ceea ce construim. În acelaşi timp, viziunea noastră s-a extins mereu şi către alte forme de exprimare umană”, a declarat Jack Brody, directorul de produs al companiei. Potrivit acestuia, Speech reprezintă primul model audio al Suno capabil să genereze voce şi muzică împreună, ca o singură piesă audio coerentă.

Generarea vocilor cu ajutorul inteligenţei artificiale nu este o tehnologie nouă. Google DeepMind lucrează de ani de zile la sinteza vocală bazată pe deep learning, Adobe oferă propriile instrumente text-to-speech, iar ElevenLabs a devenit una dintre cele mai cunoscute platforme din domeniu după lansarea sa în 2023. Pentru Suno, intrarea pe această piaţă reprezintă însă o extindere importantă dincolo de generarea muzicii.

Noua funcţie combină în mod implicit cele două componente care definesc platforma: vocea generată de AI şi muzica. Utilizatorii pot dezactiva însă muzica de fundal dacă doresc doar o voce sintetică. Suno sugerează că această combinaţie ar putea fi utilă pentru o gamă largă de conţinut, de la poezii însoţite de coloane sonore relaxante până la voice-over-uri dramatice, discursuri motivaţionale sau alte materiale audio narate.

Pentru a utiliza Speech, utilizatorii trebuie să acceseze secţiunea „Create” şi să selecteze opţiunea dedicată. Sunt disponibile două moduri de generare.

Modul Simple permite descrierea rezultatului dorit direct în caseta de prompt. De exemplu, utilizatorul poate cere o voce care să sune precum un căpitan de corabie care îşi motivează echipajul. Modul Advanced este destinat celor care au deja un text pregătit şi vor să controleze mai precis conţinutul rostit.

Setările avansate permit ajustarea unor caracteristici precum genul vocii, stilul de interpretare şi nivelul de variaţie dintre generaţiile succesive. Durata maximă a unui material generat prin Speech este de aproximativ opt minute.

Suno recunoaşte însă că tehnologia se află încă într-un stadiu experimental şi că rezultatele nu sunt întotdeauna perfecte. Compania spune că va continua să îmbunătăţească sistemul pe baza feedbackului primit de la utilizatori.

Jack Brody subliniază chiar că versiunea beta trebuie privită ca atare: accentele pot devia uneori în mod neaşteptat, pauzele dramatice pot deveni excesiv de dramatice, iar utilizatorii ar putea descoperi moduri de utilizare la care echipa Suno nu s-a gândit iniţial.

Prin lansarea Speech, Suno încearcă astfel să transforme platforma dintr-un instrument axat în principal pe generarea muzicii într-o soluţie mai largă pentru producţia de conţinut audio cu inteligenţă artificială.

Adaugă-ne ca sursă în Google Urmărește-ne pe Google News Urmărește-ne pe Whatsapp

Leave a reply

SONDAJ DE OPINIE

Ce este cel mai important pentru dumneavoastră la Faleza Dunării din Galaţi?

Follow
Search
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...

Adaugă-ne ca sursă în Google Urmărește-ne pe Google News Urmărește-ne pe Whatsapp