Por que a máquina ouve diferente de você
Quando você ouve uma gravação, completa o que não entendeu com contexto: sabe quem está falando, qual é o assunto, como se escreve o nome da sua chefe. Um sistema de transcrição com IA também usa contexto, mas só o que está no próprio áudio. Se o som é ruim, se duas vozes se misturam ou se aparece uma palavra que ele raramente viu escrita, ele escolhe a opção mais provável — e às vezes a opção mais provável está errada.
Por isso não existe transcrição automática "sem erros" em condições reais. O que existe é áudio que facilita e áudio que atrapalha. A boa notícia é que os erros se repetem em padrões, e padrões se corrigem com uma rotina de revisão. Para entender a mecânica por trás, o texto sobre como funciona o reconhecimento de fala (em inglês) é um bom começo.
Os erros mais frequentes em português
Alguns tropeços aparecem em quase qualquer transcrição de português brasileiro, seja qual for a ferramenta:
- Palavras que soam igual
- "mas" e "mais", "sessão", "seção" e "cessão", "conserto" e "concerto", "há" e "a" ("há dois anos" virando "a dois anos"). O som é o mesmo; só o contexto decide.
- Fala coloquial
- "pra", "tá", "cê", "né" e "tipo" podem ser normalizados para a forma escrita ou mantidos como foram ditos, sem muita consistência ao longo do texto.
- Números
- "Dois mil e quinhentos" pode sair por extenso ou como 2.500; "um e meio milhão" pode virar algo ambíguo. Valores em reais merecem conferência sempre.
- Nomes e lugares
- Itaquaquecetuba, Guaratinguetá, sobrenomes de origem indígena, italiana ou japonesa, nomes de empresas novas: tudo isso tende a sair "aportuguesado" ou trocado por palavras comuns.
- Pontuação
- Frases longas, faladas sem pausa, viram blocos sem vírgula ou com pontos no lugar errado.
- Sotaques
- Sotaques regionais marcados e fala muito rápida aumentam os erros; há um guia inteiro sobre sotaques regionais na transcrição.
Trecho bruto: "a reunião foi adiada a duas semanas porque o fide beque da diretoria não chegou mais o prazo continua" — Trecho revisado: "A reunião foi adiada há duas semanas porque o feedback da diretoria não chegou, mas o prazo continua."
Repare que nenhum dos erros do exemplo é absurdo: são escolhas plausíveis para quem só tem o som. É exatamente esse tipo de deslize que passa batido numa leitura rápida.
Ruído, eco e microfone distante
Ar-condicionado, ventilador, trânsito, música ambiente, eco de sala vazia: tudo isso compete com a voz. O sistema não "limpa" o áudio por mágica; quanto mais o ruído se parece com fala, mais ele interfere. Os casos mais difíceis são restaurante cheio (conversas ao fundo são fala de verdade) e auditório com eco, em que cada sílaba chega duas vezes.
O microfone longe da boca piora tudo, porque a voz chega fraca e o ambiente chega forte. Um celular a um palmo de distância costuma render mais do que um microfone caro do outro lado da sala. Para gravações já feitas, um filtro leve de redução de ruído pode ajudar, mas exagerar deixa a voz metálica e cria novos erros. O artigo sobre ruído de fundo e reconhecimento de fala (em inglês) detalha o que vale a pena tentar.
Falas sobrepostas e reuniões animadas
Reunião de condomínio, mesa de bar, grupo focal, podcast com quatro convidados: quando duas pessoas falam ao mesmo tempo, a transcrição geralmente segue a voz mais alta e perde a outra, ou mistura pedaços das duas numa frase sem sentido. Risadas e "aham" por cima da fala também atrapalham.
Não há correção automática para isso. O que funciona é prevenção — combinar que uma pessoa fala de cada vez, usar um microfone por participante quando possível — e, na revisão, voltar ao áudio nos trechos confusos. Se você precisa saber quem disse o quê, lembre que a identificação de falantes é um processo à parte, que nem toda ferramenta faz.
Nomes próprios, siglas e anglicismos
O português corporativo brasileiro é cheio de inglês: deadline, feedback, call, budget, follow-up, insight. Essas palavras podem sair na grafia inglesa correta, numa grafia improvisada ou trocadas por uma palavra portuguesa de som parecido. O mesmo vale para nomes de produtos e de ferramentas.
Siglas são outro ponto sensível. "CLT", "INSS", "CNPJ" e "SUS" costumam ser reconhecidas, mas siglas internas da sua empresa ou da sua área de pesquisa não. E quando alguém mistura frases inteiras em inglês e em português, a transcrição registra o que ouviu, mas com mais erros justamente nas trocas de idioma.
A solução prática é uma lista de nomes e termos, feita antes da revisão, para usar com a função localizar e substituir do editor. Cinco minutos montando a lista economizam muita releitura.
Áudio de ligação, WhatsApp e videochamada
Ligações telefônicas tradicionais transmitem uma faixa estreita de frequências: a voz fica abafada, e consoantes como "f", "s" e "x" ficam parecidas. Áudios de aplicativos de mensagem e de videochamadas são comprimidos para economizar dados, e às vezes cortam sílabas quando a conexão oscila. Tudo isso reduz a informação disponível para o reconhecimento.
Há ainda a questão do formato. Notas de voz do WhatsApp chegam em .opus e gravações de chamada de alguns celulares em .amr, formatos que o mydubly não aceita. É preciso converter para MP3 ou M4A antes, com um conversor de sua confiança; o passo a passo está no guia sobre transcrever áudio do WhatsApp. Para entender as limitações de áudio telefônico em geral, veja o texto sobre transcrição de ligações (em inglês).
O que o filtro de silêncio faz e o que não faz
Muitos sistemas modernos, incluindo o que o mydubly usa, passam o áudio por uma detecção de atividade de voz antes de transcrever. Esse filtro identifica os trechos em que há fala e pula os silêncios.
Isso traz duas vantagens. Primeiro, o processamento fica mais rápido em gravações com muitas pausas, como aulas em que o professor escreve no quadro. Segundo, diminui um problema conhecido dos modelos da família Whisper: em silêncios longos ou música, eles às vezes "inventam" frases que ninguém disse, como textos genéricos que parecem créditos de legenda. O texto sobre alucinações do Whisper (em inglês) mostra exemplos.
Mas o filtro tem limites. Fala muito baixa, sussurro, alguém falando longe do microfone ou voz enterrada debaixo de música alta podem ser classificados como "não fala" e ficar de fora. Se a sua transcrição está pulando trechos inteiros, essa é uma das causas prováveis; a solução é melhorar o volume e a clareza da voz na origem. Mais detalhes no artigo sobre detecção de atividade de voz (em inglês).
Revisão rápida em quatro passadas
Revisar lendo e ouvindo tudo do início ao fim é lento e cansativo. Esta sequência concentra a atenção onde estão os erros:
- Substituições em lote: com a lista de nomes e termos em mãos, use localizar e substituir para corrigir as grafias erradas que se repetem.
- Leitura sem áudio: leia o texto corrido e marque o que não faz sentido, os números e as frases sem pontuação. Não corrija ainda.
- Áudio só nos pontos marcados: use a transcrição com marcação de tempo para ir direto a cada trecho e ouvir de novo. Velocidade um pouco acima do normal ajuda nos trechos longos.
- Padronização: decida se o texto será literal ou naturalizado e aplique a mesma regra no documento inteiro — "pra" ou "para", hesitações mantidas ou cortadas. O guia sobre transcrição literal ou naturalizada ajuda nessa decisão.
O texto em inglês sobre revisão de transcrições feitas por IA (em inglês) traz um checklist complementar.
O que esperar do mydubly nessa tarefa
O mydubly transcreve vídeo e áudio no navegador, com reconhecimento de fala baseado no Whisper (modelo large-v3-turbo) e o filtro de silêncio descrito acima. O português é detectado automaticamente. Na ferramenta de vídeo para texto (em inglês), você arrasta o arquivo em "Drop a video here", deixa "Full translation output" desligado, escolhe "Portuguese (Brazil)" em "Select language" (o texto sai sem tradução) e clica em "Transcribe video". Para áudio, o caminho é "Drop audio here", a mesma escolha em "Select language" e "Transcribe audio". Os downloads "Download transcript", "Download timestamped transcript" e "Download subtitles" entregam o texto puro, o texto com tempos e um SRT. A transcrição custa 1 crédito por minuto, com mínimo de 5 créditos por arquivo, e os 100 créditos gratuitos do cadastro cobrem até 100 minutos.
O que ele não resolve: não identifica falantes, não aceita lista de vocabulário personalizado, não tem editor para corrigir o texto dentro do aplicativo e não deixa escolher o idioma de origem manualmente. Se o começo da gravação tem uma vinheta em outro idioma, vale cortá-la antes, para não confundir a detecção. E, como qualquer ferramenta automática, ele não transforma áudio ruim em áudio bom: a qualidade da gravação continua sendo o fator que mais pesa no resultado.
Perguntas frequentes
Por que a transcrição vive trocando “mas” por “mais”?
Porque, em boa parte do Brasil, as duas palavras soam quase iguais na fala corrida. O sistema escolhe pela probabilidade do contexto, e nem sempre acerta. Na revisão, faça uma busca por “mais” e confira as ocorrências que deveriam indicar oposição.
A transcrição pulou um trecho inteiro. O que pode ter acontecido?
As causas mais comuns são fala muito baixa, voz distante do microfone ou fala coberta por música alta, que o filtro de silêncio pode ter tratado como ausência de fala. Também acontece em trechos com várias pessoas falando ao mesmo tempo. Ouça o trecho: se você mesmo tem dificuldade de entender, o problema está na gravação.
Apareceram frases que ninguém falou. Isso é normal?
É um fenômeno conhecido em modelos da família Whisper, chamado de alucinação, e costuma surgir em silêncios longos, ruído constante ou música. O filtro de detecção de voz reduz esse risco, mas não o elimina. Confira o áudio nas marcações de tempo das frases suspeitas e apague o que não foi dito.
Converter o áudio para WAV melhora a transcrição?
Converter um arquivo já comprimido para WAV não recupera a qualidade perdida; só deixa o arquivo maior. O que melhora o resultado é gravar bem na origem. Converta apenas quando o formato não for aceito, como no caso de .opus e .amr, que precisam virar MP3 ou M4A.
Dá para ensinar à ferramenta os nomes da minha empresa?
No mydubly, não: não existe cadastro de vocabulário personalizado. O caminho é montar uma lista de nomes e siglas e corrigir com localizar e substituir no arquivo baixado. Em transcrições recorrentes, como reuniões semanais, essa lista vira um recurso valioso.
A gravação mistura português e inglês. Como fica a transcrição?
O idioma é detectado automaticamente e a fala é transcrita como foi ouvida, inclusive os trechos em inglês. As trocas de idioma no meio da frase são justamente onde aparecem mais erros, então revise esses pontos com o áudio. Se a gravação começa com uma longa parte em inglês, considere cortá-la antes de processar.
