Caso de uso

Transcripción de entrevistas cualitativas para tesis e investigación

La transcripción de entrevistas cualitativas convierte horas de conversación en el material que vas a codificar, citar y defender ante tu comité. Una herramienta automática puede darte un primer borrador, pero las decisiones que importan (qué tipo de transcripción, cómo anonimizar, cómo marcar hablantes y cómo revisar) son tuyas y deben quedar documentadas.

7 min de lectura · Actualizado

Nota: la interfaz de mydubly está en inglés. Puedes transcribir audio en español, traducir al español de Latinoamérica o de España y generar voz en español; solo los botones aparecen en inglés.

La transcripción ya es parte del análisis

En investigación cualitativa, transcribir no es un trámite previo al análisis: es la primera lectura de tus datos. Al decidir dónde termina una frase, si anotas una risa o un silencio largo, o cómo escribes una expresión coloquial, ya estás interpretando. Por eso los comités de tesis y los evaluadores de revistas preguntan cómo se transcribieron las entrevistas, quién lo hizo y con qué criterios.

Esto vale igual para una tesis de maestría en trabajo social en Guadalajara, un proyecto de antropología con productores de café en el Eje Cafetero o un doctorado en educación con docentes rurales en el norte de Argentina. Cambian los temas; el rigor que se espera en la transcripción, no.

Literal o limpia: decide antes de la primera entrevista

La decisión más importante es el tipo de transcripción, y conviene tomarla antes de empezar para aplicarla igual en todas las entrevistas.

  • Transcripción literal (verbatim): recoge lo que se dijo tal como se dijo, con repeticiones, muletillas ("este", "o sea", "pues", "¿me explico?"), frases inacabadas, risas y pausas. Es la adecuada para análisis del discurso, análisis conversacional o cuando la forma de hablar es parte del objeto de estudio.
  • Transcripción limpia (o literal depurada): conserva el contenido y las palabras de la persona, pero elimina muletillas y titubeos que no aportan significado. Es la más habitual en análisis temático, teoría fundamentada o estudios de caso centrados en el contenido.

Sea cual sea tu elección, define unas convenciones mínimas y anótalas en un documento aparte. Por ejemplo:

[risas]
Risa del participante o de ambos
[pausa larga]
Silencio llamativo, más de unos segundos
[inaudible 00:23:41]
Fragmento que no se entiende, con su marca de tiempo
[nombre de la institución]
Dato eliminado al anonimizar
E: / P07:
Entrevistadora / participante número 7

Para profundizar, revisa esta comparación entre transcripción literal y limpia (en inglés) y la guía de convenciones de transcripción en investigación (en inglés).

Un flujo de trabajo con transcripción automática

mydubly es una aplicación web para pasar audio a texto (en inglés) que puede darte el primer borrador de cada entrevista. La interfaz está en inglés. El flujo es este:

  1. Arrastra la grabación a «Drop audio here» (MP3, WAV, M4A, AAC, OGG, FLAC o WebM). Si grabaste en video, por ejemplo una entrevista por Zoom, usa «Drop a video here».
  2. Deja apagado el interruptor «Audio and text output» para obtener «Timestamped transcript only».
  3. Pulsa «Transcribe audio» y mantén la pestaña abierta.
  4. Descarga «Download timestamped transcript» (transcript-timestamped.txt). Las marcas de tiempo te ayudarán en la revisión y al citar fragmentos.

El reconocimiento de voz se basa en Whisper y el idioma se detecta solo. Cada archivo puede durar hasta 2 horas, más que suficiente para una entrevista en profundidad.

Ahora, lo que no hace y conviene tener presente al planificar: no identifica hablantes, así que no sabrás automáticamente qué dijo la entrevistadora y qué dijo el participante; no anonimiza; no aplica tus convenciones (no marca risas ni pausas); no codifica ni resume; y no tiene editor integrado, de modo que la revisión se hace en el archivo descargado. Si la persona alterna idiomas, por ejemplo español y quechua o español y portugués, el texto sale tal como se oye y con errores en los cambios; además, de esas lenguas solo el portugués está entre los idiomas admitidos.

Sobre los datos: el audio se envía por HTTPS y se borra del servidor, junto con los resultados, dentro de los 30 minutos posteriores a que termina el trabajo. Esto no sustituye lo que te pida tu comité de ética: si tu protocolo exige que las grabaciones no salgan de equipos de la universidad, consúltalo antes de usar cualquier servicio en línea.

Marcar hablantes y revisar escuchando

El borrador automático no es una transcripción terminada. La revisión es lo que la convierte en un dato válido, y la forma más fiable de hacerla es escuchando.

  1. Abre el audio en un reproductor que permita bajar la velocidad, como VLC, y el texto en tu procesador habitual.
  2. Primera pasada: avanza segmento a segmento, corrige palabras mal reconocidas y añade las etiquetas de hablante (E:, P07:) al inicio de cada intervención. Las marcas de tiempo te dicen dónde buscar.
  3. Segunda pasada: aplica tus convenciones (risas, pausas, inaudibles) y revisa nombres propios, siglas y términos locales. Un sistema automático no sabe que "la UNAM", "el SENA" o "el CONICET" se escriben así.
  4. Marca como [inaudible] lo que no logres entender en lugar de adivinarlo.

En esta guía para revisar una transcripción hecha con IA (en inglés) hay una lista de errores típicos que conviene buscar.

Anonimizar a los participantes

La anonimización se hace sobre el texto revisado, no sobre el borrador, para no perder datos por el camino. Algunas pautas comunes en investigación cualitativa:

  • Sustituye nombres por códigos o seudónimos (P07, "Marta") y mantén la tabla de correspondencias en un archivo separado, cifrado o protegido, que no compartas con el resto del material.
  • Generaliza lugares e instituciones que puedan identificar a alguien: "una escuela rural de Salta" en lugar del nombre de la escuela.
  • Revisa los datos indirectos: un cargo único, una anécdota muy conocida o la combinación de edad, profesión y pueblo pueden identificar a una persona aunque no aparezca su nombre.
  • Guarda las grabaciones originales según lo pactado en el consentimiento informado y bórralas cuando corresponda.

Las leyes de protección de datos personales de cada país (por ejemplo, la Ley 1581 de 2012 en Colombia o la Ley 25.326 en Argentina) y los reglamentos de tu universidad marcan el marco general. Esto es información orientativa, no asesoría legal: ante dudas, consulta al comité de ética o a la oficina de protección de datos de tu institución. La guía sobre gestión de datos de investigación con grabaciones (en inglés) ofrece ideas prácticas para organizar archivos y permisos.

Cómo describirlo en la metodología

Los evaluadores no esperan que transcribas a mano; esperan que expliques qué hiciste y cómo garantizaste la calidad. Un párrafo bien escrito resuelve la mayoría de las preguntas.

Ejemplo de párrafo para la metodología

"Las doce entrevistas semiestructuradas se grabaron en audio con el consentimiento informado de cada participante. Se generó un primer borrador mediante una herramienta de transcripción automática basada en el modelo Whisper. La investigadora revisó cada borrador escuchando la grabación completa, corrigió errores, añadió las etiquetas de hablante y aplicó las convenciones de transcripción limpia descritas en el anexo 2. Posteriormente se seudonimizaron nombres de personas, lugares e instituciones. Las transcripciones finales se importaron al software de análisis cualitativo para su codificación."

Adapta el texto a tu caso: si hiciste transcripción literal, si un segundo investigador revisó una muestra o si devolviste las transcripciones a los participantes para que las validaran, dilo.

Ejemplo: el costo de transcribir una tesis completa

Pongamos una tesis de maestría en salud pública con doce entrevistas a enfermeras, de entre 40 y 60 minutos cada una. Se cobra por minuto iniciado en cada archivo; sumando las duraciones redondeadas salen 580 minutos.

Cálculo

12 entrevistas, 580 minutos en total, a 1 crédito por minuto: 580 créditos (US$ 0,58). Los 100 créditos gratis del registro cubren la primera entrevista completa, así que puedes probar el flujo con datos reales antes de pagar nada.

El costo de la herramienta es lo de menos; lo que realmente consume tiempo es la revisión, la anonimización y la codificación. Una vez listas, puedes importar las transcripciones en Word o texto plano a programas como Atlas.ti, NVivo o MAXQDA, o trabajar con una hoja de cálculo. Para la etapa siguiente, mira la guía sobre análisis temático de transcripciones (en inglés). Si tus entrevistas están en otro idioma y necesitas citarlas en español, la opción «Select language» traduce el texto, pero en investigación conviene que una persona bilingüe revise las citas, como se explica en traducir entrevistas cualitativas (en inglés). Y si todavía no grabaste, lee primero cómo grabar audio para transcribir.

Preguntas frecuentes

¿Es válido usar transcripción automática en una tesis?

En general sí, siempre que lo declares en la metodología y demuestres que revisaste cada transcripción escuchando la grabación. Lo que los evaluadores cuestionan es usar un borrador automático sin revisión. Consulta también si tu programa o tu comité de ética tiene normas específicas sobre herramientas en línea.

¿Qué es mejor para mi investigación, transcripción literal o limpia?

Depende del enfoque: el análisis del discurso o conversacional necesita transcripción literal, con pausas y titubeos; el análisis temático suele trabajar bien con transcripción limpia. Lo importante es elegir una, documentar las convenciones y aplicarlas igual en todas las entrevistas.

¿mydubly distingue entre entrevistador y entrevistado?

No. mydubly no identifica hablantes, así que las etiquetas (E:, P01:) se añaden a mano durante la revisión. Las marcas de tiempo del archivo descargado ayudan a ubicar cada intervención en el audio.

¿Cómo anonimizo una entrevista sin perder información útil?

Sustituye nombres por códigos o seudónimos, generaliza lugares e instituciones y revisa datos indirectos que puedan identificar a alguien. Guarda la tabla de correspondencias aparte y protegida. Hazlo sobre la transcripción ya revisada para no perder contexto.

¿Puedo transcribir una entrevista de dos horas y media?

No en un solo archivo: el límite es de 2 horas por archivo. Divide la grabación en dos partes con un editor de audio, transcribe cada una y únelas después en el documento final.

¿Mis grabaciones quedan guardadas en el servidor?

No de forma permanente: el audio y los resultados se borran dentro de los 30 minutos posteriores a terminar el trabajo, y el envío se hace por HTTPS. Aun así, verifica que tu protocolo de ética y el consentimiento informado permitan usar un servicio en línea.

¿Puedo traducir entrevistas en inglés al español para citarlas?

Sí, con «Select language» obtienes el texto traducido. Para citas en una tesis, una persona bilingüe debería revisar la traducción y conviene conservar también la transcripción en el idioma original.