Entenda

Legenda para surdos e ensurdecidos (LSE): o que muda em relação à legenda comum

Legenda para surdos, também chamada de LSE (legenda para surdos e ensurdecidos), traz a fala e tudo o que é preciso ouvir para entender a cena: quem está falando, sons relevantes, música e tom de voz. A legenda comum pressupõe que o espectador escuta; a LSE não.

6 min de leitura · Atualizado

Observação: a interface do mydubly está em inglês. Você pode transcrever áudio em português, traduzir para o português do Brasil ou de Portugal e gerar voz em português; só os botões aparecem em inglês.

Por que a legenda comum não basta

A legenda que acompanha um filme estrangeiro foi pensada para quem ouve, mas não entende o idioma. Essa pessoa escuta a porta batendo, percebe que a voz mudou de dono e nota a música de suspense. Por isso a legenda comum traz só a fala traduzida.

Uma pessoa surda ou com perda auditiva não recebe nada disso. Se a legenda mostra apenas “Quem está aí?”, ela não sabe que a pergunta veio depois de um barulho na janela, nem que foi dita por alguém fora do enquadramento. A LSE preenche essas lacunas por escrito. Em inglês, essa diferença aparece na distinção entre captions e subtitles, explicada no artigo sobre captions e subtitles (em inglês).

No Brasil, também se usa o termo closed caption (CC), herdado da televisão, para legendas que o espectador pode ligar e desligar. Na prática, quando alguém pede “legenda para surdos” em um vídeo de internet, quer um arquivo de legenda com as informações sonoras incluídas.

O que uma LSE acrescenta à fala

  • Identificação de quem fala: quando não está claro na imagem, indique o nome ou a função da pessoa antes da fala. Isso é essencial em entrevistas, mesas-redondas e em falas fora de cena.
  • Efeitos sonoros que importam: campainha, telefone tocando, aplausos, risos, porta batendo, buzina. Só os que mudam o sentido ou explicam uma reação.
  • Música: se há música de fundo com função narrativa, descreva o clima (música tensa, música animada). Se a letra importa, transcreva-a com o símbolo de nota musical.
  • Tom e maneira de falar: sussurrando, gritando, ironicamente, com sotaque carregado, quando isso muda a interpretação.
  • Silêncios e interrupções: uma fala cortada no meio ou uma pausa longa intencional podem precisar de indicação.

Um critério simples: se alguém que ouve normalmente reagiria a um som, a LSE precisa dizer qual foi o som. Se o som é só ambiente e não muda nada, deixe de fora para não poluir a tela. O guia sobre como legendar efeitos sonoros e música (em inglês) aprofunda esse equilíbrio.

Convenções comuns em português

Não existe uma única regra seguida por todas as emissoras e plataformas, mas algumas convenções aparecem com frequência em LSE brasileira:

  • Sons entre colchetes e em letra minúscula: [telefone tocando], [risos], [aplausos].
  • Nome de quem fala em maiúsculas, seguido de dois-pontos ou entre colchetes: ANA: ou [ANA].
  • Diálogo de duas pessoas no mesmo bloco, cada fala em uma linha começando com hífen.
  • Fala fora de cena ou pelo telefone indicada antes do texto: [ao telefone], [voz em off].
  • Letra de música entre símbolos de nota musical.

Escolha um padrão e mantenha do começo ao fim. Inconsistência (às vezes colchete, às vezes parênteses, às vezes nada) atrapalha mais do que qualquer escolha específica.

LSE não substitui Libras

Para muitas pessoas surdas no Brasil, a primeira língua é a Libras, reconhecida oficialmente pela Lei 10.436, de 2002. O português escrito é uma segunda língua para elas, e uma legenda rápida ou com vocabulário difícil pode ser tão inacessível quanto o áudio. Já para quem ficou surdo depois de adulto ou tem perda auditiva parcial, a legenda costuma ser o recurso principal.

Por isso, em conteúdo institucional, educacional ou de serviço público, a combinação de LSE com janela de Libras atende mais gente. A Lei Brasileira de Inclusão (Lei 13.146, de 2015) trata de acessibilidade na comunicação em termos gerais; se o seu vídeo tem obrigação específica, confirme com o jurídico ou com a área de acessibilidade da sua instituição. Tecnologias automáticas de tradução para língua de sinais ainda são limitadas, como discute o artigo sobre IA e língua de sinais (em inglês).

Também vale lembrar que audiodescrição é outro recurso, voltado a pessoas cegas ou com baixa visão. Ela descreve a imagem em voz e não se confunde com a LSE.

Como montar uma LSE a partir de uma transcrição automática

Escrever cada fala do zero é o que mais consome tempo. Uma transcrição automática resolve essa parte e deixa para você o trabalho que exige julgamento humano. Com o gerador de legendas do mydubly (em inglês), o fluxo fica assim:

  1. Arraste o vídeo para “Drop a video here” ou o áudio para “Drop audio here”.
  2. Deixe a chave de saída completa desligada (“Timestamped transcript only”) e, em “Select language”, escolha o mesmo idioma da fala (por exemplo, Portuguese (Brazil) para um vídeo em português), para a legenda sair sem tradução.
  3. Clique em “Transcribe video” ou “Transcribe audio” e, no fim, use “Download subtitles” para baixar o subtitles.srt.
  4. Abra o arquivo num editor de legenda como o Subtitle Edit ou o Aegisub e acrescente as informações sonoras.

Seja claro sobre o limite: o mydubly transcreve só a fala. O reconhecimento é baseado no Whisper, com detecção de voz que pula trechos sem fala, então campainhas, risos e música não viram texto. Ele também não identifica quem está falando, porque não faz separação de locutores. Identificação de falantes, efeitos sonoros e tom de voz são trabalho manual. Se não sabe por onde começar a editar o arquivo, o guia sobre arquivo SRT: como abrir e usar explica a estrutura e os cuidados com acentos.

O custo dessa etapa é pequeno: 1 crédito por minuto iniciado, mínimo de 5 créditos por arquivo. Um webinar de 50 minutos sai por 50 créditos (US$ 0,05), e os 100 créditos grátis do cadastro cobrem um vídeo desse tamanho.

Exemplo: da transcrição à legenda para surdos

Antes e depois

Saída automática: bloco 8, 00:00:31,200 --> 00:00:33,000, “Pode entrar, a porta está aberta.” Versão LSE: um bloco novo antes, 00:00:29,800 --> 00:00:31,100, “[campainha]”; e o bloco 8 reescrito como “CARLOS [fora de cena]: Pode entrar, a porta está aberta.”

Repare que foi preciso criar um bloco onde não havia fala. É por isso que editores com forma de onda ajudam: você enxerga o pico do som da campainha e posiciona o bloco nele. Em vídeos com muita ação sonora, conte com mais tempo de edição do que de revisão de texto.

Legibilidade e revisão com quem vai usar

  • Tempo de leitura: LSE tem mais texto que a legenda comum, então blocos muito curtos ficam impossíveis de ler. Prefira resumir a fala a deixar o bloco piscar.
  • Posição: se o vídeo tem texto na parte de baixo da tela, como nome do entrevistado, verifique se a legenda não cobre essa informação.
  • Contraste: a aparência depende do player, mas ao gravar a legenda na imagem num editor, use fundo ou contorno que garanta leitura sobre imagens claras.
  • Teste real: sempre que possível, peça a uma pessoa surda ou com perda auditiva para assistir antes da publicação. Ela vai apontar o que falta muito mais rápido que qualquer checklist.

Erros comuns em legenda para surdos

  • Descrever cada ruído: [passos], [vento], [carro passando] em sequência cansam e escondem o que importa.
  • Esquecer quem fala em falas fora de cena ou em videochamadas com câmeras desligadas.
  • Corrigir o português da fala a ponto de mudar o sentido. Simplificar é aceitável; inventar não é.
  • Publicar uma legenda automática sem revisão chamando-a de acessível. Nomes errados e palavras trocadas atrapalham justamente quem depende só do texto.
  • Achar que a legenda resolve tudo. Para parte do público, a Libras continua sendo necessária.

Perguntas frequentes

Qual a diferença entre LSE e closed caption?

Closed caption descreve a forma de exibir: uma legenda que o espectador liga e desliga. LSE descreve o conteúdo: legenda que inclui sons, música e identificação de falantes. Uma legenda pode ser closed caption sem ser LSE, se trouxer só a fala.

Legenda automática serve como legenda para surdos?

Serve como ponto de partida, não como produto final. A transcrição automática registra a fala, mas não descreve sons nem identifica quem fala, e pode errar nomes e termos. A versão acessível exige revisão e acréscimos feitos por uma pessoa.

O mydubly coloca [risos] e [música] na legenda automaticamente?

Não. Ele transcreve apenas a fala e pula trechos sem voz. Você baixa o SRT e acrescenta as indicações sonoras num editor de legenda, como Subtitle Edit ou Aegisub.

Preciso de janela de Libras além da legenda?

Depende do público e de eventuais obrigações do seu tipo de conteúdo. Para pessoas cuja primeira língua é a Libras, a legenda em português pode não ser suficiente. Em conteúdo público ou educacional, consulte a área de acessibilidade ou o jurídico da instituição.

Como indicar quem está falando na legenda?

O mais comum é escrever o nome em maiúsculas antes da fala, seguido de dois-pontos, ou entre colchetes. Use isso quando a imagem não deixa claro quem fala, como em falas fora de cena ou com várias pessoas. Mantenha o mesmo formato no vídeo inteiro.

Legenda para surdos precisa ser palavra por palavra?

Não necessariamente. A prioridade é que a pessoa consiga ler no tempo do bloco e entenda o mesmo que quem ouve. Pequenas simplificações são aceitáveis, desde que não mudem o sentido nem o tom da fala.