Primero revisa si WhatsApp ya lo hace por ti
WhatsApp ha ido incorporando la transcripción de mensajes de voz dentro de la propia aplicación, pero no está disponible en todos los teléfonos ni en todos los idiomas, y la forma de activarla puede cambiar entre versiones. Revisa en los ajustes de chats si aparece una opción de transcripciones de mensajes de voz y, si la tienes, pruébala con un audio corto.
Esa transcripción integrada es cómoda para leer un audio rápido en una reunión, pero tiene límites: el texto se queda dentro del chat, no obtienes marcas de tiempo ni un archivo que puedas guardar, y si el audio dura varios minutos copiar el texto a mano resulta engorroso. Cuando necesitas el contenido en un documento (el audio de un cliente con instrucciones, una entrevista que te mandaron por WhatsApp, el mensaje de un familiar que quieres conservar), te conviene exportar el audio y transcribirlo aparte.
Cómo sacar la nota de voz del chat
El objetivo es tener el archivo de audio en tu teléfono o tu computadora. Según el dispositivo, hay varias formas habituales:
- Compartir el mensaje: mantén presionado el audio en el chat y busca la opción de compartir o reenviar. Puedes mandártelo a ti mismo por correo, guardarlo en Archivos o subirlo a tu nube.
- Exportar el chat con archivos: la opción de exportar chat incluye las notas de voz como archivos sueltos. Es útil cuando necesitas transcribir una conversación entera.
- Carpeta de medios en Android: en muchos teléfonos Android las notas de voz se guardan en la carpeta de medios de WhatsApp, dentro del almacenamiento interno, organizadas por fecha.
Sea cual sea el camino, el archivo resultante suele tener la extensión .opus. Ahí empieza el problema más frecuente.
Por qué tu archivo .opus no se acepta
Opus es un códec de audio muy eficiente, pensado para voz por internet: ocupa poco y suena bien incluso con conexiones lentas. Por eso WhatsApp lo usa para las notas de voz. Pero no todos los programas aceptan archivos con extensión .opus, y mydubly es uno de ellos: no acepta notas de voz .opus ni grabaciones de llamadas .amr. Si te interesa la parte técnica, en esta guía sobre el códec Opus (en inglés) se explica cómo funciona.
La solución es convertir el archivo a MP3 o M4A antes de transcribirlo. Puedes hacerlo con cualquier conversor de audio en el que confíes: hay aplicaciones de escritorio, apps para el teléfono y conversores en línea. Al elegir uno, ten en cuenta:
- Si el audio contiene datos personales o información de trabajo, prefiere un programa que convierta en tu propio equipo en lugar de subir el archivo a un sitio desconocido.
- Para voz basta con una calidad media; no necesitas el bitrate más alto.
- Revisa que el archivo convertido se reproduzca completo antes de seguir.
Las notas de voz grabadas con la app de grabadora del iPhone, en cambio, suelen ser M4A y se aceptan directamente; lo tratamos en transcribir notas de voz del iPhone.
Transcribir el audio convertido en mydubly
mydubly es una aplicación web para pasar audio a texto (en inglés) desde el navegador. La interfaz está en inglés; los pasos son estos:
- En la página principal, arrastra el MP3 o M4A a la zona «Drop audio here».
- Deja apagado el interruptor «Audio and text output»: así obtienes «Timestamped transcript only», es decir, la transcripción en el idioma original con marcas de tiempo.
- En «Select language» elige el idioma del audio para recibir el texto sin traducir, o bien otro idioma si lo quieres traducido (por ejemplo, un audio en portugués que quieres leer en español).
- Haz clic en «Transcribe audio»; mientras se procesa, la pestaña tiene que seguir abierta.
- Descarga el resultado con «Download transcript» (transcript.txt, texto plano) o «Download timestamped transcript» si quieres conservar los minutos.
El idioma se detecta automáticamente y no puedes elegirlo a mano. La transcripción se basa en Whisper, un modelo abierto de reconocimiento de voz. El audio viaja por HTTPS y se borra del servidor, junto con los resultados, dentro de los 30 minutos posteriores a terminar el trabajo.
Lo que no hace: no se conecta a WhatsApp ni lee tus chats, no acepta el .opus original, no separa quién dice qué si en el audio hablan varias personas y no resume el contenido. Tampoco tiene un editor: las correcciones las haces en el archivo descargado, con el bloc de notas, Word o Google Docs.
Problemas frecuentes y cómo resolverlos
Más allá del formato, estos son los tropiezos habituales con audios de WhatsApp:
- La transcripción tiene huecos o palabras inventadas: las notas de voz se graban muchas veces caminando, en el auto o con la tele de fondo. El ruido y el viento confunden a cualquier sistema de reconocimiento. No hay arreglo mágico después de grabar; si puedes, pide que te reenvíen el audio grabado en un lugar más tranquilo.
- Mezcla de idiomas: si la persona alterna español e inglés (algo muy común en audios de Miami o de trabajo en empresas internacionales), el texto sale tal como suena y los cambios de idioma pueden quedar mal escritos.
- Nombres, apodos y modismos mal escritos: "el Chino", "la Pochi" o una calle de tu barrio no están en ningún diccionario. Corrígelos a mano; más casos así en errores al pasar audio a texto.
- No encuentras el archivo: en iPhone, el audio compartido suele ir a la app Archivos o a la carpeta que elegiste; en Android, búscalo por la fecha del mensaje en la carpeta de medios.
- Es una llamada grabada y no una nota de voz: si el archivo es .amr, también hay que convertirlo. Para la calidad de este tipo de grabaciones, lee sobre transcribir llamadas telefónicas (en inglés).
- El audio es muy corto y sale casi vacío: con mensajes de dos o tres segundos, el detector de actividad de voz puede no encontrar casi nada que transcribir. En esos casos, escúchalo directamente.
Muchos audios cortos: cómo no pagar de más
La transcripción cuesta 1 crédito por minuto iniciado, con un mínimo de 5 créditos por archivo. Para un audio largo eso es casi nada, pero si tienes muchas notas de voz cortas el mínimo se acumula.
Si subes las diez notas por separado, cada una paga el mínimo de 5 créditos: 50 créditos en total. Si antes las unes en un solo archivo de unos 10 minutos con un editor de audio como Audacity, pagas 10 créditos. Con los 100 créditos gratis del registro te sobra para cualquiera de las dos opciones, pero la diferencia se nota cuando el volumen crece.
Al unir audios, deja un segundo de silencio entre uno y otro y anota en qué orden los pusiste: así luego sabrás a qué mensaje corresponde cada tramo de la transcripción con marcas de tiempo.
Privacidad: los audios no son solo tuyos
Una nota de voz contiene la voz y, a menudo, datos personales de otra persona. Antes de pasarla por cualquier servicio, piensa si quien habla esperaría que su mensaje terminara en un documento. En contextos de trabajo (recursos humanos, salud, temas legales) consulta las normas de tu empresa o institución.
Si vas a guardar la transcripción, considera quitar números de teléfono, direcciones o nombres de terceros que no necesites. Y recuerda que el texto es más fácil de reenviar que un audio: trátalo con el mismo cuidado que el mensaje original. Para entender qué pasa con tus datos cuando un servicio procesa voz en la nube, esta guía sobre privacidad en el procesamiento de voz (en inglés) es un buen punto de partida.
Preguntas frecuentes
¿Por qué mydubly no acepta mi audio de WhatsApp?
Porque las notas de voz de WhatsApp se exportan como archivos .opus, y mydubly no acepta esa extensión. Conviértelo a MP3 o M4A con un conversor de confianza y súbelo de nuevo. Lo mismo ocurre con las grabaciones de llamadas en formato .amr.
¿WhatsApp puede transcribir los audios por sí solo?
En algunos teléfonos e idiomas, sí: WhatsApp ha incorporado transcripciones de mensajes de voz que se activan desde los ajustes de chats. La disponibilidad varía según la versión y el dispositivo. El texto se muestra en el chat, sin archivo ni marcas de tiempo.
¿Cuánto cuesta transcribir un audio de WhatsApp de 3 minutos?
Cuesta 5 créditos, porque es el mínimo por archivo en la transcripción. Los 100 créditos gratis del registro alcanzan para veinte audios así. Si tienes muchos audios cortos, unirlos en un solo archivo antes de subirlos sale más barato.
¿Puedo transcribir un audio de WhatsApp que está en inglés y leerlo en español?
Sí. Sube el audio convertido, deja apagado «Audio and text output» y elige Spanish en «Select language». Obtendrás el texto traducido al español con el nivel de precio de transcripción.
¿Mi audio queda guardado en algún servidor?
El audio se envía por HTTPS para procesarlo y se borra del servidor, junto con los resultados, dentro de los 30 minutos posteriores a terminar el trabajo. Aun así, si contiene datos sensibles de otras personas, piensa antes si tienes su consentimiento.
¿Se puede saber quién habla en un audio con varias personas?
No automáticamente: mydubly no identifica hablantes. Si en el audio participan varias personas, tendrás que marcar a mano quién dice qué en el texto descargado, escuchando el audio a la vez.
