Cómo funciona el dictado por voz: la guía completa
Pulsas una tecla, hablas, y unos segundos después aparece en pantalla una frase limpia. Entre ambos momentos ocurre mucho más de lo que se imagina: una onda sonora se convierte en una secuencia de números, esos números se convierten en una imagen, esa imagen se convierte en texto, y ese texto se convierte finalmente en una frase correctamente escrita. Esta guía recorre cada una de esas etapas, sin jerga innecesaria pero sin simplificar en exceso. Al final entenderás por qué el dictado de tu teléfono te obliga a decir «coma» mientras otras herramientas se encargan solas, por qué el mismo modelo entiende perfectamente a tu vecino y tropieza con el nombre de tu cliente, y por dónde pasa realmente tu voz durante la operación.
Contenido
- Las cuatro etapas de un vistazo
- Etapa 1: tu voz se convierte en números
- Etapa 2: la transcripción
- Etapa 3: la limpieza con IA
- Etapa 4: la inserción en tu aplicación
- ¿Cuánto tarda todo esto?
- ¿Dónde se ejecutan estos modelos?
- El vocabulario, sin confusiones
- Qué determina realmente la calidad
- Qué ocurre con tu voz
- Lo esencial
Las cuatro etapas de un vistazo
Todo dictado por voz moderno se apoya en la misma cadena. Lo que distingue a unas herramientas de otras casi nunca es la primera etapa: es el hecho de ejecutar o no la tercera.
| Etapa | Qué entra | Qué sale |
|---|---|---|
| 1. Captura | Una onda sonora en el aire | Una secuencia de números, luego un espectrograma |
| 2. Transcripción | El espectrograma | Texto en bruto, palabra por palabra |
| 3. Limpieza | El texto en bruto | Un texto puntuado, corregido, formateado |
| 4. Inserción | El texto final | Caracteres en la posición de tu cursor |
Los dictados integrados en los sistemas operativos y en las suites ofimáticas se detienen en la etapa 2. Es el caso de la escritura por voz de Windows, del dictado de macOS, del de iOS, del dictado por voz de Gboard en Android y de la escritura por voz de Google Docs. Las herramientas llamadas «IA» añaden la etapa 3, y en eso reside toda la diferencia entre una transcripción y un texto que puedes enviar tal cual. Hemos detallado el comportamiento de cada una en nuestras guías dedicadas al iPhone, a Android, a Word y a las herramientas de voz de Google.
Etapa 1: tu voz se convierte en números
El muestreo
Cuando hablas, tus cuerdas vocales hacen vibrar el aire. Esa vibración es una variación continua de presión. La membrana de tu micrófono sigue esas variaciones y las convierte en tensión eléctrica, y después la tarjeta de sonido mide esa tensión a intervalos regulares. Cada medición se llama muestra.
Para el habla, la frecuencia de muestreo estándar es de 16.000 muestras por segundo, es decir 16 kHz. Un minuto de dictado equivale por tanto a unos 960.000 números. Esa cifra de 16 kHz no es arbitraria: el teorema de muestreo de Nyquist-Shannon obliga a medir al menos al doble de velocidad que la frecuencia más alta que se quiere conservar. Como la mayor parte de la información que distingue una «s» de una «f» se sitúa por debajo de los 8 kHz, 16 kHz bastan. Es también la razón por la que el dictado no necesita en absoluto la calidad de CD a 44,1 kHz: los datos adicionales no aportarían nada al reconocimiento y solo recargarían el cálculo y la transferencia. No se trata de una convención oficiosa: el artículo de investigación de Whisper precisa que todo el audio se lleva a 16.000 Hz antes del procesamiento.
El espectrograma: la imagen que el modelo «ve» realmente
Una secuencia en bruto de 960.000 números resulta muy difícil de aprovechar directamente. Por eso se transforma en algo mucho más legible para una red neuronal.
El principio: la grabación se trocea en pequeñas ventanas superpuestas de 25 milisegundos, avanzadas 10 milisegundos cada vez. Para cada ventana, una transformada de Fourier calcula qué frecuencias están presentes y con qué intensidad. Al apilar todos esos resultados uno junto a otro se obtiene una imagen: el espectrograma. El eje horizontal representa el tiempo, el vertical las frecuencias, y la intensidad luminosa la energía presente en esa frecuencia en ese instante. Esos valores de 25 y 10 milisegundos son exactamente los que emplea Whisper.
El modelo no «oye» tu voz. Mira una imagen, una especie de partitura térmica en la que cada vocal, cada consonante y cada silencio forma un patrón reconocible. El problema «comprender un sonido» se ha transformado en el problema «reconocer patrones en una imagen», terreno en el que las redes neuronales son extraordinariamente eficaces.
Una última sutileza: la escala de frecuencias no es lineal, está comprimida hacia los agudos. Se habla de escala Mel, calcada de la percepción humana, que distingue mucho más finamente la diferencia entre 200 y 300 Hz que la que hay entre 8.000 y 8.100 Hz. En concreto, la imagen final solo contiene unas decenas de bandas de frecuencia: Whisper usa 80, y 128 en su versión large-v3. Es una reducción masiva de la información, pero conserva justamente lo que permite distinguir los sonidos del habla.
Etapa 2: la transcripción, de la imagen al texto
Whisper, el estándar de facto
Hasta alrededor de 2020, el reconocimiento de voz se basaba en sistemas que ensamblaban varios componentes separados: un modelo acústico, un diccionario de pronunciación y un modelo de lenguaje. Funcionaban, pero exigían un ajuste minucioso para cada idioma y se degradaban rápidamente en cuanto el audio se salía de las condiciones previstas.
El vuelco vino de los modelos de extremo a extremo, de los cuales el más conocido es Whisper, publicado como código abierto por OpenAI a finales de 2022. Su interés reside menos en su arquitectura que en su entrenamiento. La versión original se entrenó con 680.000 horas de audio recopilado en la web junto con las transcripciones correspondientes, de las cuales 117.000 horas cubren 96 idiomas distintos del inglés, según detalla el artículo de investigación asociado. La generación siguiente volvió a cambiar de escala: la versión large-v3 se apoya en un millón de horas de audio débilmente anotado, complementado con cuatro millones de horas transcritas automáticamente por el modelo anterior.
A esa escala, el modelo ha visto tantas voces, acentos, micrófonos mediocres y ruidos de fondo que se mantiene robusto con el sonido del día a día, y no solo con audio de estudio. Hoy cubre alrededor de cien idiomas dentro de un único modelo. Eso es lo que lo ha convertido en el estándar sobre el que se apoya buena parte de las herramientas de dictado recientes.
Codificador, decodificador y tokens
El modelo se compone de dos mitades que trabajan una después de la otra.
- El codificador lee el espectrograma en tramos de 30 segundos y lo condensa en una representación interna. Puedes verlo como un resumen numérico denso que retiene, para cada instante, lo que importa desde el punto de vista del habla y descarta el resto.
- El decodificador produce el texto trozo a trozo. En cada paso mira tanto ese resumen de audio como todo lo que ya ha escrito, y después predice el siguiente fragmento de texto más probable.
Esos fragmentos se llaman tokens. Un token no es una palabra: es más bien un pedazo de palabra, a menudo de tres o cuatro caracteres. Las palabras muy frecuentes forman un solo token, mientras que un término poco común como «electroencefalografista» ocupa varios. Ese troceado permite al modelo tratar cualquier idioma y cualquier palabra inédita con un vocabulario de tamaño razonable.
Por qué el contexto elimina los homófonos
Aquí se juega lo esencial del progreso de los últimos diez años. Como el decodificador tiene en cuenta lo que ya ha escrito, no elige sus palabras únicamente por el sonido. Tomemos «hecho» y «echo», «vaya» y «valla», «tubo» y «tuvo», «haber» y «a ver»: estas formas son acústicamente idénticas en español. Ningún tratamiento de la señal las separará jamás. En cambio, un modelo que ha leído millones de frases sabe que «un hecho probado» es mucho más probable que «un echo probado».
El mismo mecanismo explica los errores. El modelo no busca la verdad, busca la continuación más probable. Ante un nombre propio poco frecuente o un término de sector escasamente representado en sus datos, propondrá con total seguridad una palabra común que suena igual. Por eso el vocabulario personalizado es un tema real, aunque se aborda en la etapa siguiente y no en esta.
Cómo se mide la calidad: el WER
El indicador de referencia es el WER, del inglés Word Error Rate, tasa de error de palabra. Se compara la transcripción producida con una transcripción de referencia elaborada por una persona, se cuentan tres tipos de error y luego se divide el total entre el número de palabras de la referencia.
- Sustituciones: una palabra ha sido reemplazada por otra.
- Inserciones: se ha añadido una palabra que nunca se pronunció.
- Omisiones: una palabra pronunciada se ha perdido.
Un WER del 5 % significa que una palabra de cada veinte es incorrecta. Conviene sin embargo una precaución: el WER no significa nada en abstracto, depende enteramente del corpus de prueba. El mismo modelo puede marcar un 3 % con lecturas de audiolibros grabadas con auriculares y un 20 % en una reunión a varias voces en una sala con eco. Dos cifras de WER solo son comparables si proceden del mismo conjunto de evaluación, algo que las comunicaciones comerciales rara vez precisan.
Etapa 3: la limpieza con IA, lo que separa una transcripción de un texto
Supongamos que la etapa 2 fuera perfecta: cada palabra pronunciada reconocida correctamente. Seguirías sin tener un texto utilizable, y por una razón muy sencilla: no hablas como escribes. Una transcripción fiel restituye tus vacilaciones, tus rectificaciones, tus muletillas y tus frases que cambian de rumbo a mitad de camino. Es fiel, y ese es precisamente el problema.
| Transcripción en bruto (etapa 2) | Tras la limpieza con IA (etapa 3) |
|---|---|
| bueno eh quería decirte que el expediente martín está listo bueno creo que está listo así que podemos enviarlo mañana por la mañana si te parece bien | El expediente Martín está listo. Podemos enviarlo mañana por la mañana, si te parece bien. |
Esa transformación es el trabajo de un gran modelo de lenguaje situado detrás de la transcripción. En concreto, se encarga de:
- La puntuación y la división en frases, que no has pronunciado y que por tanto hay que deducir de la estructura del discurso.
- La eliminación de las vacilaciones y los falsos arranques, sin alterar el sentido de lo que querías decir.
- La gramática y la concordancia, a menudo aproximativas en el habla.
- El formato esperado: un correo no tiene el mismo aspecto que una nota interna o un mensaje breve. Las herramientas más avanzadas permiten definir reglas de formato propias, aplicadas a cada dictado.
- El vocabulario profesional y los nombres propios, a partir de una lista aportada por el usuario. Es el remedio al problema de los homófonos descrito antes, y funciona mejor de lo que se cree: el nombre de tu cliente no necesita ser conocido por el modelo de transcripción, basta con que lo conozca la etapa de corrección, que restablecerá la ortografía exacta a partir de una aproximación fonética.
Por qué no todos ejecutan esta etapa
Un modelo de limpieza verdaderamente fiable es un gran modelo de lenguaje, es decir un objeto pesado, mucho más pesado que el modelo de transcripción. Ejecutarlo supone servidores equipados en consecuencia. En un ordenador personal, los modelos lo bastante pequeños como para caber tienden a ignorar las instrucciones y a romper el formato, mientras que los modelos lo bastante buenos se vuelven demasiado lentos para un uso en tiempo real. Esa es la razón por la que los dictados integrados en los sistemas operativos, que se ejecutan en local, se conforman con el palabra por palabra, y por la que te piden pronunciar «coma» y «punto» tú mismo. También explica la diferencia de resultado que se constata en la práctica en Word.
Etapa 4: la inserción en tu aplicación
La etapa menos espectacular y, sin embargo, la que determina si la herramienta es utilizable a diario. El texto final debe llegar allí donde escribes, sin rodeos por un portapapeles o una ventana intermedia.
Aquí se enfrentan dos familias de herramientas. Los dictados ligados a una aplicación concreta, como el de Word o la escritura por voz de Google Docs, solo funcionan dentro de esa aplicación, a veces incluso solo en un navegador determinado. Las herramientas de sistema, en cambio, se instalan como una capa por encima de todo lo demás: escuchan un atajo de teclado global y después escriben el resultado en la posición del cursor, sea cual sea la ventana activa. Un campo de búsqueda, un correo, un ticket, un terminal: todo lo que acepta texto acepta dictado.
Técnicamente, esa inserción se realiza o bien simulando pulsaciones de teclado, o bien a través de las interfaces de accesibilidad del sistema operativo. Esa diferencia, invisible en el uso, explica que una herramienta funcione perfectamente en un procesador de textos y falle en una aplicación con un renderizado gráfico particular, como ciertos juegos o entornos remotos.
¿Cuánto tarda todo esto?
Contrariamente a una intuición extendida, el tiempo de procesamiento no coincide con la espera percibida, porque las etapas no se desarrollan todas después de que hayas terminado de hablar. La captura y la preparación del espectrograma se hacen sobre la marcha, mientras hablas. Quedan la transcripción y la limpieza, que se ejecutan al soltar el atajo.
Tres factores dominan el resultado. Primero, la potencia de cálculo disponible: las tarjetas gráficas de centro de datos procesan una grabación de varios minutos en una fracción del tiempo que emplearía un portátil. Después, el número de idas y vueltas de red, que una cadena bien diseñada reduce al mínimo fusionando transcripción y limpieza en lugar de encadenarlas como dos llamadas separadas. Por último, el troceado del audio: dado que el modelo razona por tramos de 30 segundos, una grabación larga puede procesarse por bloques en paralelo en lugar de estrictamente en secuencia.
De ahí se deriva un punto contraintuitivo: el tiempo de espera no crece de forma proporcional a la duración del dictado. En una cadena bien diseñada, duplicar la longitud del dictado no duplica la espera, lo que hace los dictados largos bastante más rentables que las frases sueltas.
Dónde se ejecutan estos modelos: ¿en tu ordenador o en un servidor?
La cadena descrita aquí es la misma en todas partes. Lo que cambia de una herramienta a otra es el lugar donde se ejecuta cada etapa, y esa elección tiene consecuencias directas sobre lo que obtienes.
- Todo en local. El audio nunca sale de tu máquina, lo que representa el máximo en materia de confidencialidad y funciona sin conexión. En la práctica obtienes las etapas 1, 2 y 4, rara vez la 3, por falta de la potencia que exige un gran modelo de limpieza.
- Transcripción y limpieza en un servidor. Tu audio viaja a una infraestructura diseñada para estos cálculos, lo que hace posible la cadena completa en cualquier ordenador, incluso un portátil ligero sin tarjeta gráfica dedicada. A cambio, hace falta conexión y dependes de los compromisos del proveedor sobre conservación y localización de los datos.
Este equilibrio merece un tratamiento propio: lo hemos detallado en dictado por voz local frente a la nube.
El vocabulario, sin confusiones
Cuatro términos se emplean con frecuencia uno por otro aunque designan cosas distintas.
| Término | Qué es |
|---|---|
| Reconocimiento de voz speech-to-text, ASR |
La tecnología que convierte el habla en texto. Es la etapa 2 de esta guía. |
| Dictado por voz escritura por voz |
El uso de esa tecnología para escribir: un correo, un documento, un mensaje. Es la cadena completa, de la etapa 1 a la 4. |
| Síntesis de voz text-to-speech, TTS |
La operación inversa: un texto es leído en voz alta por una voz artificial. Nada que ver con el dictado, pese a la confusión frecuente. |
| Comando de voz | El reconocimiento sirve para activar una acción, no para escribir. «Pon un temporizador de diez minutos» es un comando de voz. |
Qué determina realmente la calidad
Con el mismo modelo, el resultado puede ir de excelente a mediocre. Los factores que más pesan, por orden:
- La relación entre tu voz y el ruido ambiente. No cuenta el volumen del ruido, sino su distancia respecto a tu voz. Un micrófono de auriculares, o los micrófonos de un portátil reciente a una distancia razonable, bastan de sobra; un micrófono al otro extremo de una sala grande es el principal factor de degradación.
- La reverberación. Una habitación desnuda con techo alto devuelve tu voz con un desfase, lo que emborrona los patrones del espectrograma mucho más que un ruido constante de ventilación.
- El ritmo y la articulación. Hablar deprisa no es un problema en sí, comerse los finales de palabra sí lo es.
- Los nombres propios y la jerga. El punto débil estructural explicado más arriba, y la razón de ser de las listas de vocabulario personalizado.
- El idioma y la mezcla de idiomas. Los modelos son claramente mejores en inglés que en otros idiomas, sencillamente porque hay más datos de entrenamiento. Alternar dos idiomas dentro de una misma frase sigue siendo el caso más difícil.
- La longitud de los pasajes. Un contexto más amplio ayuda al modelo a resolver ambigüedades: un dictado de varias frases suele dar mejor resultado que tres palabras sueltas.
Qué ocurre con tu voz durante todo esto
Una vez comprendida la cadena, la cuestión de los datos se vuelve mucho más concreta. No se trata de saber si una herramienta es «segura» en abstracto, sino de saber qué le ocurre a tres objetos bien identificados: la grabación de audio, la transcripción en bruto y el texto final.
Tres preguntas bastan para acotar el tema, y valen para cualquier herramienta:
- ¿Se conservan estos elementos tras el procesamiento, y en tal caso durante cuánto tiempo?
- ¿Se reutilizan para entrenar modelos? Es una cuestión distinta de la conservación, y se resuelve en las condiciones de uso.
- ¿Bajo qué jurisdicción tiene lugar el tratamiento? Un servidor físicamente situado en Europa pero operado por una entidad sujeta al derecho estadounidense no responde a la misma pregunta que un tratamiento realizado en Europa por una entidad europea.
Una grabación de voz es un dato personal en el sentido del RGPD, y su contenido puede serlo mucho más aún según lo que dictes. Estos tres puntos se detallan en nuestra guía dictado por voz y RGPD.
Lo esencial
El dictado por voz no es una caja negra. Es una cadena de cuatro operaciones bien identificadas, y casi todas las preguntas que se plantean al respecto se reducen a una etapa concreta de esa cadena.
- Un resultado decepcionante en un entorno ruidoso se juega en la etapa 1, y se corrige con un mejor micrófono antes que con un mejor programa.
- Un error en un nombre propio o en un término profesional se juega en la etapa 2, y se corrige con una lista de vocabulario.
- La ausencia de puntuación, las vacilaciones dejadas tal cual y el texto que hay que retrabajar se juegan en la etapa 3, sencillamente ausente en la mayoría de las herramientas integradas.
- La imposibilidad de dictar en tal o cual aplicación se juega en la etapa 4, y depende de la arquitectura de la herramienta, no de la calidad de su reconocimiento.
Queda la pregunta que atraviesa toda la cadena: el equilibrio entre la potencia necesaria para las etapas 2 y 3 y la confidencialidad de lo que dictas. Ese es el verdadero tema de fondo, y se decide en el momento de elegir una herramienta, no después.
Preguntas frecuentes
¿Cómo funciona el dictado por voz?
El dictado por voz atraviesa cuatro etapas. Tu micrófono convierte primero la onda sonora en una secuencia de números, normalmente 16.000 mediciones por segundo. Esos números se transforman en un espectrograma, una imagen de las frecuencias a lo largo del tiempo. Un modelo de reconocimiento de voz analiza esa imagen y produce texto. Por último, en las herramientas modernas, un gran modelo de lenguaje limpia ese texto: puntuación, eliminación de las vacilaciones, gramática, formato. El resultado se inserta allí donde se encuentra tu cursor.
¿Cuál es la diferencia entre reconocimiento de voz y dictado por voz?
El reconocimiento de voz es la tecnología que convierte el habla en texto. El dictado por voz es el uso que se hace de ella para escribir un documento, un correo o un mensaje. No hay que confundirlo con la síntesis de voz, que hace lo contrario al leer un texto en voz alta, ni con los comandos de voz, que activan una acción en lugar de escribir.
¿Qué es Whisper y por qué se habla de él en todas partes?
Whisper es un modelo de reconocimiento de voz publicado como código abierto por OpenAI a finales de 2022. Su versión original se entrenó con 680.000 horas de audio multilingüe, y su versión large-v3 con varios millones de horas. Se ha convertido en el estándar de facto porque maneja alrededor de cien idiomas en un solo modelo, resiste bien el ruido y los acentos, y puede usarse libremente. La mayoría de las herramientas de dictado recientes se apoyan en él o en modelos construidos según los mismos principios.
¿Por qué el dictado por voz se equivoca con los nombres propios y el vocabulario técnico?
Un modelo de reconocimiento de voz predice la continuación más probable a partir de lo que ha aprendido. El nombre poco frecuente de un cliente o un término técnico de nicho aparece muy poco en sus datos de entrenamiento: el modelo prefiere una palabra común que suena igual. La solución es proporcionar a la herramienta una lista de vocabulario personalizado, que la etapa de limpieza aplica después de la transcripción.
¿Por qué algunos dictados no ponen la puntuación?
Porque se detienen en la etapa de transcripción. Transcribir consiste en escribir lo que se ha pronunciado, y las comas no se pronuncian. Añadir una puntuación correcta exige comprender la estructura de las frases, lo que requiere un gran modelo de lenguaje por detrás de la transcripción. Los dictados integrados en los sistemas operativos no suelen tener esa segunda etapa y por eso te piden decir «coma» y «punto» en voz alta.
¿Funciona el dictado por voz sin conexión a Internet?
Depende de dónde se ejecuten los modelos. Un dictado totalmente local funciona sin conexión, pero en la práctica se limita a la transcripción palabra por palabra, porque ejecutar un gran modelo de limpieza en un ordenador personal sigue siendo poco viable. Un dictado en la nube exige conexión, y eso es precisamente lo que le permite ejecutar la cadena completa, transcripción y limpieza incluidas.
Para profundizar
Entender lo que está en juego
Dictado por voz local frente a la nube: la comparativa completa
Privacidad & RGPDDictado por voz y RGPD: ¿adónde van realmente tus datos?
Dictar en tus aplicaciones
Dictado por voz en Word: por qué el integrado no basta
ProductividadDictado por voz para correo: dicta en Gmail, Outlook y donde sea
En el móvil
Dictado por voz en iPhone: activarlo y dictar en todas tus apps
MóvilEscritura por voz en Android: activarla y dictar en todas tus apps
Móvil & escritorioReconocimiento de voz de Google: dictar en el teléfono y en el PC
Guía prácticaDictado por voz gratis: las mejores opciones en 2026
Elegir una herramienta
Mejor dictado por voz para Windows: la comparativa completa
ComparativaDictado por voz en Mac: ¿qué solución elegir?
Casos de uso específicos
Por Pierrick Michel · Actualizado en agosto de 2026