Duas maneiras de pôr uma fala no papel
Toda transcrição é uma decisão. A fala tem ritmo, entonação, interrupções e sons que a escrita não tem, e quem transcreve precisa decidir o que preservar. Na prática acadêmica e profissional brasileira, as duas pontas dessa decisão costumam ser chamadas de transcrição literal (também “ipsis litteris” ou “verbatim”) e transcrição naturalizada (também “limpa” ou “editada”).
Entre as duas há muitas gradações. Um jornalista pode tirar os “né” e manter as repetições enfáticas; um pesquisador pode manter as hesitações e dispensar a marcação de pausas. O importante é saber o que está sendo descartado e por quê. O artigo sobre verbatim e clean verbatim (em inglês) mostra a mesma distinção no contexto do inglês.
O que a transcrição literal preserva
- Hesitações e preenchimentos: “é...”, “hã”, “ãh”, “hum”.
- Marcadores da fala: “né”, “tipo”, “aí”, “então”, “sabe?”, usados como apoio e não como conteúdo.
- Repetições e falsos começos: “eu fui, eu fui lá... quer dizer, a gente foi”.
- Formas coloquiais de pronúncia, quando o estudo exige: “pra”, “tá”, “cê”, “nós vai”.
- Pausas, às vezes com duração, e interrupções.
- Sobreposição de vozes, risos, suspiros e mudanças de tom.
Em pesquisas de análise da conversação, essa marcação segue convenções próprias, como as de Gail Jefferson, adaptadas no Brasil por autores como Luiz Antônio Marcuschi. São símbolos para pausa, alongamento de vogal, fala sobreposta e ênfase. Se o seu trabalho segue essa linha, o orientador geralmente indica qual quadro de convenções adotar; o artigo sobre convenções de transcrição em pesquisa (em inglês) dá uma visão geral.
O que a transcrição naturalizada faz
A naturalizada mantém tudo o que tem conteúdo e tira o que é ruído da oralidade. Os “né” e “tipo” saem, as repetições involuntárias somem, os falsos começos são cortados e a pontuação organiza o raciocínio. O que ela não deve fazer é reescrever: trocar palavras do entrevistado por sinônimos “melhores”, corrigir concordância a ponto de mudar o registro ou juntar frases que a pessoa não juntou.
Um bom teste: se o entrevistado lesse a transcrição naturalizada, reconheceria nela o que disse, só que mais fácil de ler.
Exemplo lado a lado
Literal: “Então, é... eu, eu comecei a trabalhar lá em, tipo, dois mil e dezoito, né? (pausa) E aí no começo era... era bem puxado, sabe, porque a gente não tinha, hã, não tinha equipe.” Naturalizada: “Eu comecei a trabalhar lá em 2018. No começo era bem puxado, porque a gente não tinha equipe.”
As duas versões dizem a mesma coisa. Mas, se a sua pergunta de pesquisa é sobre como trabalhadores narram situações difíceis, as hesitações em “era... era bem puxado” e em “não tinha, hã, não tinha equipe” podem ser dado relevante. Na versão limpa, isso some.
Quando usar cada uma
- Análise do discurso e análise da conversação
- Literal, com marcação de pausas, sobreposições e entonação
- Sociolinguística e estudos de variação
- Literal, preservando as formas como foram pronunciadas
- Análise de conteúdo (como a proposta por Laurence Bardin)
- Naturalizada costuma bastar, porque o foco é o que foi dito
- Análise temática e pesquisa de mercado
- Naturalizada, com marcação de tempo para voltar ao áudio
- Entrevista jornalística para citação
- Naturalizada, com cuidado redobrado nas citações diretas
- Ata de reunião e registro interno
- Naturalizada ou até resumida
A análise de conteúdo é muito usada em pesquisas brasileiras de saúde, educação e administração, e nela a transcrição literal raramente é exigida. Já em letras e linguística, a literal costuma ser o padrão. Se você está entre as duas áreas, decida a partir da pergunta de pesquisa, não do hábito do grupo. Para as regras de formatação do trabalho final, veja o guia sobre transcrição de entrevista nas normas ABNT.
O que a transcrição automática entrega por padrão
Ferramentas automáticas não seguem nenhuma das duas convenções de forma rigorosa. Modelos de reconhecimento como o Whisper tendem a produzir algo mais próximo da naturalizada: pontuam o texto, costumam omitir parte das hesitações e repetições, e não marcam pausas, sobreposições nem quem está falando. Mas isso não é uma limpeza editorial confiável. Às vezes o modelo mantém um “né”, às vezes some com uma palavra que tinha conteúdo, e em trechos de fala sobreposta pode perder frases inteiras.
No mydubly, que usa reconhecimento baseado no Whisper, o caminho é este: arraste a gravação para “Drop audio here” (MP3, WAV, M4A, AAC, OGG, FLAC ou WebM, até 2 horas), deixe desligada a chave “Audio and text output” para ficar só a transcrição, escolha em “Select language” o idioma falado (o texto sai sem tradução) e clique em “Transcribe audio”. O idioma é detectado automaticamente. Depois baixe com “Download transcript” (texto corrido) ou “Download timestamped transcript” (texto com marcação de tempo, o mais útil para revisar). Os detalhes estão na página de transcrição de áudio para texto (em inglês).
O que ele não faz: não marca pausas, não usa símbolos de análise da conversação, não separa falantes e não tem editor na tela; você revisa o arquivo .txt em qualquer editor de texto. O custo é de 1 crédito por minuto iniciado: uma entrevista de 1 hora sai por 60 créditos (US$ 0,06) e uma de 2 horas sai por 120 créditos (US$ 0,12).
Como chegar à versão final a partir do texto automático
Para uma transcrição naturalizada:
- Leia a transcrição com o áudio tocando, de preferência em velocidade normal nos trechos citáveis.
- Corrija nomes, siglas, números e termos técnicos.
- Retire os resíduos de oralidade que o modelo deixou e padronize a pontuação.
- Identifique os falantes à mão (E: e P1:, ou nomes fictícios).
Para uma transcrição literal, o trabalho é maior:
- Use a versão com marcação de tempo para localizar cada trecho no áudio.
- Reinsira as hesitações, repetições e marcadores que o modelo omitiu.
- Marque pausas, sobreposições e risos segundo o quadro de convenções escolhido.
- Ouça os trechos mais densos mais de uma vez; é aqui que a revisão consome horas.
Mesmo assim, partir do texto automático costuma ser mais rápido do que digitar do zero, porque a estrutura e a maior parte das palavras já estão lá. O guia sobre como revisar uma transcrição feita por IA (em inglês) traz uma rotina de revisão.
Como justificar a escolha no seu trabalho
Bancas e pareceristas perguntam isso. Escreva na metodologia, em duas ou três frases, qual tipo de transcrição você usou, por que ele serve à sua pergunta de pesquisa e quais convenções seguiu. Se usou ferramenta automática como apoio, diga isso e explique que o material inteiro foi revisado com o áudio.
Lembre também da ética: entrevistas com seres humanos costumam passar por comitê de ética, e o termo de consentimento deve cobrir gravação e transcrição. Anonimize nomes, cidades pequenas e empresas na versão que vai para o anexo. No mydubly, o áudio enviado e os resultados são apagados do servidor em até 30 minutos depois do fim do trabalho, mas a decisão de usar uma ferramenta online com dados de pesquisa deve seguir as regras do seu comitê e da sua instituição.
Perguntas frequentes
Qual é a diferença entre transcrição literal e naturalizada?
A literal registra a fala como foi dita, com hesitações, repetições, marcadores como “né” e, às vezes, pausas. A naturalizada mantém o conteúdo e retira esses elementos para facilitar a leitura. Nenhuma das duas reescreve o que a pessoa disse.
Para TCC, qual tipo de transcrição devo usar?
Depende da sua pergunta de pesquisa e da área. Se você analisa o conteúdo das respostas, a naturalizada costuma bastar. Se analisa a forma de falar, como em linguística ou análise do discurso, a literal é necessária. Combine a escolha com o orientador e declare-a na metodologia.
Transcrição automática é literal?
Não. Ferramentas baseadas em modelos como o Whisper tendem a gerar texto pontuado e mais limpo, omitindo parte das hesitações, mas sem critério editorial consistente. Para uma transcrição literal você precisa reinserir hesitações e pausas ouvindo o áudio.
Posso corrigir erros de português do entrevistado?
Na literal, não. Na naturalizada, pequenos ajustes de legibilidade são aceitáveis, mas mudar concordância ou vocabulário pode alterar o registro e a voz do participante. Na dúvida, mantenha a forma original nas citações diretas.
O mydubly identifica entrevistador e entrevistado?
Não. Ele não faz separação de falantes, então a transcrição sai como texto contínuo, com ou sem marcação de tempo. Você identifica quem fala durante a revisão, usando o áudio como referência.
Quanto tempo leva para revisar uma transcrição automática?
Varia muito com a qualidade do áudio, o número de pessoas e o tipo de transcrição. A naturalizada exige bem menos tempo que a literal, que pede várias escutas dos mesmos trechos. Áudio limpo, gravado perto de quem fala, reduz bastante esse trabalho.
