Entenda

Sotaques regionais na transcrição: nordestino, gaúcho, carioca, caipira e outros

Sotaques regionais na transcrição raramente impedem o reconhecimento automático, mas concentram os erros em pontos previsíveis: gírias, nomes de lugares, sílabas engolidas e palavras que soam iguais. Sabendo onde olhar, a revisão fica bem mais rápida e você preserva a fala de quem gravou.

8 min de leitura · Atualizado

Observação: a interface do mydubly está em inglês. Você pode transcrever áudio em português, traduzir para o português do Brasil ou de Portugal e gerar voz em português; só os botões aparecem em inglês.

Por que o sotaque pesa na transcrição automática

Um sistema de reconhecimento de fala aprende a ligar sons a palavras a partir de uma enorme quantidade de áudio. Quanto mais exemplos ele viu de um jeito de falar, mais seguro fica diante dele. A fala de telejornal, de aula gravada e de vídeo do YouTube aparece muito nesses dados; a conversa de feira em Caruaru, o causo contado na varanda em Piracicaba ou a prosa de galpão na Campanha gaúcha aparecem bem menos.

Isso não quer dizer que um sotaque seja "mais difícil" que outro em si. Cada brasileiro tem sotaque, inclusive o paulistano e o brasiliense. O que acontece é que certos traços regionais coincidem com situações em que o modelo tem menos referência: vocabulário local, nomes próprios pouco comuns e reduções fortes de sílabas. É ali que o texto escorrega.

Se quiser entender o mecanismo com mais detalhe, o artigo sobre reconhecimento de fala e sotaques (em inglês) explica por que alguns erros se repetem em qualquer idioma.

O que cada sotaque brasileiro costuma provocar no texto

Os traços abaixo são tendências, não regras. Dentro de cada região há muita variação, e a mesma pessoa fala diferente numa entrevista formal e num almoço de família.

  • Nordestino: vogais abertas antes da sílaba forte ("Récife", "péqueno") e o "t" e o "d" sem o chiado de "tchia" e "djia" em boa parte da região quase nunca atrapalham, porque a grafia padrão é a mesma. O problema aparece em expressões como "oxente", "arretado", "visse", "avexado", "mainha" e "painho", que podem sair cortadas ou trocadas por palavras parecidas.
  • Gaúcho: o "tu" com verbo na terceira pessoa ("tu vai") ou na segunda ("tu vais"), o "e" final pronunciado como "e" ("leite" e não "leiti") e gírias como "bah", "tchê", "guri", "bergamota", "cacetinho" e "faceiro". Interjeições curtas como "bah" às vezes somem ou viram outra palavra.
  • Carioca: o "s" chiado ("mesmo" soando "mêjmo", "escola" soando "eshcola") raramente gera erro, porque o modelo escreve a forma padrão. O que dá trabalho é a gíria rápida: "caraca", "maneiro", "mermão", "parada", "suave na nave".
  • Caipira (interior de São Paulo, sul de Minas, Goiás, Mato Grosso do Sul): o "r" retroflexo de "porta" e "carne" não costuma confundir, mas reduções como "cê", "nóis", "mió", "tá bão" e "causo" podem ser "corrigidas" para a forma padrão ou virar palavras erradas.
  • Mineiro: a fala que junta palavras ("pó pô pão?", "ondé que cê tá?") é um desafio real, porque o modelo precisa separar sílabas que chegaram coladas. "Uai" e "trem" quase sempre saem certos; a junção de palavras, nem sempre.
  • Nortista: "égua", "mana", "maninho", "pai d'égua" e nomes indígenas de rios e bairros de Belém e Manaus pedem atenção redobrada.

Gírias, expressões e o dilema da grafia

O primeiro erro com sotaque forte não é técnico, é editorial: decidir como escrever o que foi dito. A transcrição automática tende a puxar a fala para a norma escrita. "Tá" pode virar "está", "pra" pode virar "para", e "nóis vai" pode aparecer como "nós vamos". Em alguns contextos isso é ótimo; em outros, apaga justamente o que interessa.

Antes de revisar, responda três perguntas:

  1. O texto é para leitura corrida (blog, relatório, ata) ou para registro fiel da fala (pesquisa, acervo, processo)?
  2. Gírias e interjeições serão mantidas como foram ditas ou adaptadas?
  3. Reduções como "cê", "tá" e "pra" serão padronizadas no documento inteiro ou só nas falas do entrevistador?

Essa escolha tem nome: transcrição literal ou naturalizada. O guia sobre transcrição literal ou naturalizada ajuda a decidir. O importante é ser coerente: escrever "nóis" na fala do seu Zé e corrigir tudo na fala da pesquisadora paulistana transforma o sotaque em caricatura.

Exemplo ilustrativo de revisão

Fala gravada: "Bah, tchê, o guri tava faceiro que só, comeu umas três bergamota." Saída automática plausível: "Ba, tchê, o guri tava fazendo que só, comeu umas três bergamotas." Versão revisada (literal): "Bah, tchê, o guri tava faceiro que só, comeu umas três bergamota." Repare que o erro está em "faceiro", uma palavra regional, e que a concordância "três bergamota" foi corrigida sem ninguém pedir.

Gravar melhor ajuda mais do que "neutralizar" o sotaque

Pedir para alguém "falar mais neutro" é desrespeitoso e, na prática, inútil: a pessoa fica travada e a gravação perde naturalidade. O que realmente reduz erros é a qualidade do áudio.

  • Microfone perto da boca. Celular apoiado na mesa, a meio metro, capta mais eco do que voz.
  • Uma pessoa por vez. Falas sobrepostas são o pior cenário para qualquer sotaque.
  • Ambiente sem ventilador, televisão ou rua movimentada ao fundo.
  • No começo da gravação, peça que a pessoa diga o próprio nome, a cidade e nomes difíceis que vão aparecer ("Itaquaquecetuba", "Mossoró", "Chuí"). Isso não "ensina" nada ao modelo, mas facilita muito a sua revisão depois.

Para gravações feitas no telefone, o guia sobre gravar áudio no celular para transcrição (em inglês) tem ajustes simples que fazem diferença.

Um roteiro de revisão para falas com sotaque forte

Revisar linha por linha do começo ao fim cansa e deixa passar erros. Com sotaque marcado, funciona melhor atacar primeiro os pontos onde os erros se concentram.

  1. Monte uma lista curta de termos antes de ouvir: nomes das pessoas, bairros, cidades, comidas, ferramentas de trabalho e gírias que você já sabe que vão aparecer.
  2. Use a busca do editor de texto para localizar cada termo e conferir como saiu. Erros em nomes próprios costumam se repetir do mesmo jeito, então "localizar e substituir" resolve vários de uma vez.
  3. Leia o texto procurando frases sem sentido. Uma frase gramaticalmente estranha quase sempre esconde uma palavra regional mal reconhecida.
  4. Vá ao trecho exato do áudio usando a minutagem e ouça em velocidade normal. Em sotaque forte, acelerar o áudio atrapalha mais do que ajuda.
  5. Quando não entender mesmo depois de ouvir três vezes, marque como [inaudível 00:12:31] em vez de inventar.
  6. Se possível, peça para alguém da mesma região ler a versão final. Um conterrâneo identifica em minutos o que você levaria uma hora para decifrar.

O passo a passo de revisão de transcrições feitas por IA (em inglês) complementa esse roteiro com dicas de pontuação e números.

Pesquisa, jornalismo e acervo: a fala regional é o dado

Em sociolinguística, história oral e pesquisa qualitativa, o jeito de falar faz parte do material. Uma entrevista com uma marisqueira do Recôncavo baiano ou com um tropeiro aposentado do Paraná perde valor se for "limpa" demais. Nesses casos, mantenha reduções, repetições e interjeições, e registre suas convenções na seção de metodologia.

No jornalismo, a regra mais comum é corrigir apenas o necessário para a compreensão nas citações escritas, sem mudar o sentido. Nas legendas de vídeo, o espaço é curto e a padronização leve costuma ser aceita, mas gírias que carregam significado ("arretado" não é só "bom") merecem ficar.

Para acervos e projetos de memória, o artigo sobre transcrição de história oral (em inglês) traz boas práticas de organização e consentimento.

Onde o mydubly entra e o que ele não faz

O mydubly transcreve vídeos e áudios em português com um reconhecimento de fala baseado no Whisper, um modelo de código aberto. O idioma é detectado automaticamente ("Source: Auto detect"); não há como escolher o idioma manualmente, nem selecionar um sotaque, um dialeto ou um vocabulário personalizado. Por isso vale que o arquivo comece com alguns segundos de fala clara em português.

Na prática, para uma entrevista gravada em vídeo:

  1. Abra a ferramenta de vídeo para texto (em inglês) e solte o arquivo em «Drop a video here» (MP4, MOV, WebM, MKV ou M4V, até 2 horas).
  2. Deixe desligada a opção «Full translation output», o que gera a transcrição com minutagem, e escolha em «Select language» o idioma falado na entrevista para o texto sair sem tradução.
  3. Clique em «Transcribe video» e mantenha a aba aberta até terminar.
  4. Baixe «Download timestamped transcript» para revisar com a minutagem ou «Download transcript» para o texto corrido.

O que o mydubly não faz: não identifica quem está falando (você marca entrevistador e entrevistado à mão), não tem editor de transcrição na tela (a revisão é no arquivo baixado, em qualquer editor) e não aprende gírias ou nomes que você corrigiu. A qualidade depende do áudio, do sotaque, de falas sobrepostas e de nomes raros, e não existe um número de precisão garantido.

Duração da entrevista
50 minutos
Modo
Transcrição com minutagem
Custo
50 créditos (US$ 0,05)
Créditos grátis no cadastro
100, suficientes para essa entrevista

Se você também precisa de legendas, o mesmo processo gera um arquivo SRT. Para português em geral, a página de transcrição de vídeo em português (em inglês) resume os formatos aceitos, e o guia de erros na transcrição automática ajuda quando o problema não é o sotaque, e sim o áudio.

Perguntas frequentes

A transcrição automática entende sotaque nordestino?

Em geral, sim: a maior parte do texto sai correta quando o áudio é limpo. Os erros se concentram em expressões regionais como "oxente" e "avexado", em nomes de cidades e de pessoas e em trechos com fala rápida ou sobreposta. Reserve tempo para revisar esses pontos específicos.

Dá para configurar o mydubly para um sotaque específico?

Não. O idioma é detectado automaticamente e não há opção de sotaque, dialeto ou vocabulário personalizado. O que você controla é a qualidade da gravação e a revisão do arquivo baixado.

Devo corrigir "cê", "tá" e "pra" na transcrição?

Depende do uso. Para pesquisa, acervo ou registro fiel, mantenha como foi dito. Para um texto de blog, relatório ou ata, padronizar costuma deixar a leitura mais fluida. O essencial é aplicar a mesma regra a todas as pessoas da gravação.

Por que a transcrição troca gírias por palavras parecidas?

O modelo escolhe a sequência de palavras mais provável para aqueles sons. Quando uma gíria regional aparece pouco nos dados de treinamento, uma palavra comum de som parecido pode "ganhar". Uma lista de gírias esperadas e a busca do editor de texto ajudam a encontrar essas trocas rápido.

Falar mais devagar melhora a transcrição de quem tem sotaque forte?

Ajuda um pouco, mas a qualidade do áudio pesa muito mais: microfone perto da boca, uma pessoa falando por vez e pouco ruído de fundo. Pedir para alguém mudar o jeito de falar costuma deixar a entrevista artificial sem resolver o problema.

E se a gravação mistura português com espanhol, como na fronteira?

Fala que alterna idiomas, como o portunhol de cidades de fronteira, é transcrita como foi ouvida, mas de forma imperfeita. Espere mais trechos para revisar e, se possível, peça a alguém que conheça os dois idiomas para conferir.