Solución de problemas

Errores al pasar audio a texto: por qué ocurren y cómo corregirlos rápido

La mayoría de los errores al pasar audio a texto vienen del audio, no de la herramienta: ruido, voces que se pisan, nombres poco comunes, anglicismos y grabaciones de llamadas con poca calidad. Identificar el tipo de error te dice si conviene corregir a mano, limpiar el audio y repetir, o volver a grabar.

7 min de lectura · Actualizado

Nota: la interfaz de mydubly está en inglés. Puedes transcribir audio en español, traducir al español de Latinoamérica o de España y generar voz en español; solo los botones aparecen en inglés.

Cómo «escucha» un sistema de transcripción automática

Los sistemas actuales de reconocimiento de voz, como Whisper, no comparan sonidos con un diccionario palabra por palabra. Escuchan fragmentos de audio y predicen el texto más probable a partir de lo que aprendieron con enormes cantidades de grabaciones. Eso los hace muy buenos con habla natural, acentos variados y frases bien construidas, pero también explica sus errores típicos: cuando el sonido es ambiguo, eligen la palabra más común que encaja, aunque no sea la que se dijo.

Por eso, una transcripción mala casi nunca es aleatoria. Los errores siguen patrones, y cada patrón tiene una causa y una solución distintas. Si quieres la explicación técnica completa, está en la guía sobre cómo funciona el reconocimiento de voz (en inglés).

Ruido de fondo y música

Es la causa más frecuente. Un ventilador, el tráfico, la cafetera de la oficina o música de fondo compiten con la voz, y el sistema pierde sílabas o confunde palabras parecidas.

Síntomas: palabras cambiadas por otras de sonido similar, frases cortadas, tramos con texto incoherente.

Qué hacer:

  • Si puedes repetir la grabación, aléjate de la fuente de ruido y acerca el micrófono a la boca. Ninguna limpieza posterior equivale a grabar bien.
  • Si no puedes repetir, una reducción de ruido suave en un editor de audio ayuda, pero sin exagerar: un filtro agresivo deja la voz metálica y empeora el reconocimiento.
  • Con música, si tienes el proyecto original (un video editado, un podcast), exporta una versión solo con voz para transcribir.

La guía sobre ruido de fondo y reconocimiento de voz (en inglés) amplía estos consejos.

Voces que se pisan y conversaciones de grupo

En reuniones, clases con preguntas del público o entrevistas animadas, la gente se interrumpe. Cuando dos personas hablan a la vez, el sistema suele transcribir solo a la más fuerte o mezclar ambas frases en una sola que nadie dijo.

Qué hacer: en la grabación, un micrófono por persona o al menos un micrófono en el centro de la mesa. En la revisión, busca los tramos donde el texto pierde sentido y escúchalos; con la transcripción con marcas de tiempo, saltas directo al minuto exacto.

Otro punto: muchas herramientas, mydubly incluida, no indican quién habla en cada momento. En una transcripción de grupo, tendrás que añadir los nombres a mano si los necesitas.

Nombres propios, siglas y vocabulario especializado

Un apellido poco común, el nombre de una empresa pequeña, un medicamento o una sigla técnica son palabras que el sistema ha visto pocas veces. Las sustituye por algo parecido y frecuente.

Ejemplos típicos de este error

Se dijo «Yolanda Itzel Ramírez» y se transcribe «Yolanda y sell Ramírez». Se dijo «la reunión con la SUNAT» y aparece «la reunión con la su nada». Se dijo «hay que hacer el merge hoy» y aparece «hay que hacer el mers hoy».

La solución es la más rápida de todas: antes de revisar, haz una lista con los nombres, marcas y siglas que aparecen en la grabación, y usa buscar y reemplazar en tu editor de texto. En pocos minutos corriges decenas de apariciones. Para cifras y fechas, revisa también la guía sobre números en transcripciones (en inglés).

Anglicismos y mezcla de idiomas

En el español de oficina, tecnología, marketing o redes es normal decir «el feedback», «hacer un deploy», «agendar un call» o «el insight del focus group». El sistema puede escribir esas palabras en inglés, adaptarlas fonéticamente («fidbac») o confundirlas con palabras españolas.

Cuando se cambia de idioma dentro de la misma frase (algo muy habitual entre hispanohablantes en Estados Unidos, el llamado spanglish), el resultado se transcribe tal como se oye, pero con más errores en los puntos de cambio. No es un fallo de una herramienta concreta: es una limitación conocida de la transcripción automática. La guía sobre videos con varios idiomas (en inglés) explica por qué ocurre.

Qué hacer: decide un criterio (dejar los anglicismos en inglés, en cursiva o adaptarlos) y aplícalo con buscar y reemplazar. Si el texto es para un trabajo académico, sigue las convenciones de transcripción de tu disciplina.

Audio de llamadas, videollamadas y mensajes de voz

Las llamadas telefónicas transmiten solo una parte de las frecuencias de la voz, y las videollamadas comprimen mucho el audio y a veces lo cortan cuando la conexión falla. A eso se suma el eco y que cada participante tiene un micrófono distinto.

Síntomas: consonantes confundidas (b y p, d y t), palabras perdidas en los cortes de conexión, una persona que se entiende bien y otra no.

Qué hacer:

  • Si la plataforma de videollamadas permite grabar el audio de cada participante por separado, usa esa opción.
  • Para entrevistas a distancia, pide a la otra persona que grabe su propia voz con el teléfono y luego te envíe el archivo.
  • Ojo con los formatos: los audios de WhatsApp (.opus) y algunas grabaciones de llamadas (.amr) no se aceptan en mydubly; conviértelos a MP3 o M4A primero.

Más detalles en la guía sobre grabaciones de llamadas telefónicas (en inglés) y, para mensajes de voz, en transcribir audios de WhatsApp.

Frases que nadie dijo y el filtro de silencios

Un error que desconcierta: aparecen en la transcripción frases que no están en el audio, en especial durante silencios largos, aplausos o música. Los sistemas basados en Whisper tienden a «rellenar» esos tramos con frases típicas de cierre de video, del estilo de «gracias por ver» o créditos de subtítulos. Se conoce como alucinación, y lo explicamos en la guía sobre alucinaciones de Whisper (en inglés).

Para reducirlo, mydubly aplica detección de actividad de voz: antes de transcribir, identifica los tramos donde hay habla y salta los silencios. Así, una pausa larga no produce texto inventado ni bloques vacíos en los subtítulos, y las marcas de tiempo siguen correspondiendo al audio original. El filtro no es perfecto: un susurro o una voz muy lejana puede tomarse por silencio y quedar sin transcribir, y la música con voz cantada sí se considera habla. Si te faltan frases dichas en voz baja, revisa ese tramo y transcríbelo a mano. La técnica se explica en la guía sobre detección de actividad de voz (en inglés).

Cuando el idioma detectado no es el correcto

mydubly detecta el idioma automáticamente y no permite elegirlo a mano. Con grabaciones normales no da problemas, pero si el audio empieza con un tramo largo en otro idioma (una canción en inglés, un video de presentación) o con mucho ruido, la detección puede confundirse.

Qué hacer: recorta el inicio del archivo para que empiece con habla clara en el idioma principal y vuelve a procesarlo. Volver a transcribir una grabación de 30 minutos cuesta 30 créditos (US$ 0,03), así que repetir con el audio mejorado suele compensar.

Dónde encaja mydubly y qué no hace

mydubly transcribe archivos de audio (MP3, WAV, M4A, AAC, OGG, FLAC, WebM) y de video de hasta 2 horas con reconocimiento basado en Whisper y filtro de silencios. En el área de audio arrastras el archivo a «Drop audio here», dejas apagado «Audio and text output» y pulsas «Transcribe audio». Puedes descargar el texto corrido, el texto con marcas de tiempo y subtítulos SRT. Cuesta 1 crédito por minuto, con un mínimo de 5 créditos por archivo, y los 100 créditos del registro alcanzan para hasta 100 minutos.

Lo que no hace: no tiene editor para corregir la transcripción en la web (se corrige en el archivo descargado), no permite subir un glosario de nombres, no identifica hablantes, no limpia ni mejora el audio y no permite elegir manualmente el idioma de origen. No hay forma de darle una cifra de precisión: depende del audio. Más información en la página de audio a texto (en inglés).

Un flujo de revisión rápido

Para corregir una transcripción sin volver a escuchar la grabación completa:

  1. Lee el texto de corrido una vez, sin corregir, y marca los tramos que no tienen sentido.
  2. Aplica buscar y reemplazar con tu lista de nombres, marcas y siglas.
  3. Con la transcripción con marcas de tiempo, escucha solo los tramos marcados.
  4. Revisa cifras, fechas y unidades.
  5. Haz una última pasada de puntuación: los sistemas automáticos ponen comas y puntos razonables, pero no siempre donde un lector los necesita.

Si el resultado sigue lleno de errores después de limpiar el audio, la conclusión honesta es que la grabación no da para más. Ahí conviene volver a grabar si es posible, o contratar transcripción humana para los tramos críticos. Para la próxima vez, sigue los consejos de cómo grabar audio para transcribir, y si tu grabación tiene acentos muy marcados, revisa la guía sobre acentos y modismos en la transcripción.

Preguntas frecuentes

¿Por qué la transcripción automática escribe palabras que no se dijeron?

Porque el sistema predice el texto más probable a partir del sonido. Con ruido, silencios largos o música, puede elegir palabras frecuentes que encajan pero no son las correctas, o rellenar silencios con frases típicas. El filtro de silencios de mydubly reduce este problema, pero conviene revisar los tramos con música.

¿Qué precisión tiene pasar audio a texto con IA?

No existe una cifra válida para cualquier grabación: depende de la calidad del audio, del ruido, de cuántas personas hablan y del vocabulario. Con una voz clara cerca del micrófono, los errores suelen limitarse a nombres y términos raros; con una llamada ruidosa, serán muchos más.

¿Cómo corrijo rápido los nombres mal escritos?

Haz una lista con los nombres, marcas y siglas de la grabación y usa buscar y reemplazar en tu editor de texto. Es el arreglo que más errores resuelve en menos tiempo.

¿Sirve limpiar el audio antes de transcribir?

Una reducción de ruido suave puede ayudar, pero un filtro demasiado fuerte deja la voz artificial y empeora el resultado. Si tienes la pista de voz sin música, úsala; y si puedes repetir la grabación con mejor micrófono, es lo que más mejora el texto.

¿Puedo elegir el idioma de la grabación en mydubly?

No, el idioma se detecta automáticamente. Si la detección falla porque el audio empieza con música o con otro idioma, recorta ese inicio y vuelve a procesar el archivo.

¿Por qué faltan frases que se dijeron en voz baja?

El filtro de silencios salta los tramos sin habla, y una voz muy baja o lejana puede confundirse con silencio. Revisa esos momentos con la transcripción con marcas de tiempo y complétalos a mano.