Com transcriure àudio a text gratis
Passar una gravació de veu a text escrit és una necessitat molt habitual: estudiants que volen repassar una classe, periodistes que transcriuen una entrevista, professionals que redacten actes de reunió o creadors de contingut que necessiten subtítols. Fer-ho a mà és lent i avorrit; per sort, els navegadors moderns porten integrat un motor de reconeixement de veu prou bo per fer aquesta feina en temps real i sense cost.
AudioText Pro aprofita aquesta tecnologia —la Web Speech API— per convertir la teva veu en text directament des del navegador. No cal instal·lar cap programa ni crear cap compte: obres la pàgina, prems el botó del micròfon i el text va apareixent a la pantalla a mesura que parles. Com que tot el procés el gestiona el navegador, no pugem cap fitxer d'àudio als nostres servidors ni el guardem enlloc; quan tanques la pestanya, no en queda cap rastre al nostre costat.
Fer servir l'eina és senzill: obre la pàgina amb Google Chrome o Microsoft Edge, dona permís al navegador per fer servir el micròfon quan t'ho demani, i prem el botó rodó per començar. Pots parlar amb normalitat; el text es va escrivint a la caixa de sota. Quan acabis, prem el mateix botó per aturar l'enregistrament. Des d'allà pots copiar el text al portapapers amb un clic, descarregar-lo com a fitxer .TXT, o netejar la caixa per començar una nova transcripció.
Per obtenir el millor resultat, parla a un ritme natural i clar, evita solapar-te amb altres veus i fes servir un espai relativament silenciós: com més soroll de fons hi hagi, més errors cometrà el reconeixement. Un micròfon extern o uns auriculars amb micròfon també milloren molt la precisió respecte al micròfon integrat d'un portàtil.
També pots transcriure un àudio que ja tinguis gravat (una nota de veu, una entrevista en MP3, un WAV o un M4A): puja el fitxer des de l'apartat corresponent, tria l'idioma en què es parla —català, espanyol, anglès, francès o italià— i l'eina el transcriu sencer fent servir un model d'IA de reconeixement de veu (Whisper) que es descarrega un sol cop i s'executa dins del mateix navegador. No cal reproduir res en veu alta ni acostar cap micròfon: el fitxer es processa directament, encara que en un ordinador o mòbil modest el procés pot trigar més que la durada real de l'àudio.
Cal tenir en compte algunes limitacions: el dictat en directe necessita connexió a internet i només funciona en navegadors compatibles amb la Web Speech API (Chrome i Edge, principalment); la transcripció de fitxers necessita descarregar un model la primera vegada (uns 150 MB) i pot trigar una estona en equips més lents. En els dos casos la puntuació automàtica és bàsica, així que val la pena repassar el text final abans de fer-lo servir. Amb tot, per a la majoria d'usos quotidians —apunts ràpids, primers esborranys, subtítols senzills— és una solució gratuïta que estalvia molt de temps.