Wat AI-nasynchronisatie precies is
Bij klassieke nasynchronisatie spreken stemacteurs in een studio de vertaalde tekst in, zin voor zin afgestemd op het beeld. Denk aan de Nederlandse versie van een animatiefilm in de bioscoop of een tekenfilmserie op televisie. Bij AI-nasynchronisatie doet software dat werk: er is geen stemacteur, maar een gegenereerde stem.
Het woord wordt in de praktijk ruim gebruikt. Soms bedoelt iemand een volledig vervangen stem, soms een vertaalde voice-over die over het origineel heen ligt, zoals bij documentaires. Dat verschil is relevant: bij nasynchronisatie hoor je de oorspronkelijke spreker niet meer, bij een voice-over vaak nog zacht op de achtergrond. Het Engelstalige stuk over dubbing en voice-over (Engels) zet de varianten naast elkaar.
Ondertiteling laat de originele stem staan en voegt tekst toe. Nasynchronisatie vervangt de stem. AI-nasynchronisatie vervangt de stem door een computerstem, zonder studio en zonder stemacteur.
Waarom je het ineens overal hoort
Veel mensen maken voor het eerst kennis met AI-nasynchronisatie op YouTube. Bij een deel van de video's kun je via het tandwielmenu een andere audiotrack kiezen, en soms staat een video standaard in het Nederlands terwijl de maker duidelijk Engelstalig is. Dat komt doordat YouTube kanalen de mogelijkheid geeft om extra audiosporen in andere talen toe te voegen, en doordat er ook automatisch gegenereerde sporen bestaan. Hoe dat voor makers werkt, lees je in het stuk over meertalige audio op YouTube (Engels).
De reacties in het Nederlandse taalgebied zijn gemengd. Wie gewend is aan de originele stem met ondertitels, vindt een vlakke computerstem al snel vreemd. Tegelijk zijn er groepen voor wie een gesproken Nederlandse versie juist de drempel wegneemt. Beide reacties zijn terecht; het hangt af van de video en het publiek.
Hoe het technisch werkt
Achter een AI-nasynchronisatie zitten meestal vier stappen die na elkaar worden uitgevoerd.
- Spraakherkenning: de gesproken tekst wordt omgezet in tekst met tijdcodes, zodat bekend is wanneer elke zin begint en eindigt.
- Vertaling: die tekst wordt vertaald naar de doeltaal, zin voor zin of in grotere stukken voor meer context.
- Spraaksynthese: een tekst-naar-spraakmodel spreekt de vertaling uit met een gekozen stem.
- Timing en samenvoegen: de nieuwe zinnen worden op de plek van de oorspronkelijke spraak gezet en het geheel wordt weer een video.
De lastigste stap is vaak de laatste. Een vertaling is zelden even lang als het origineel. Nederlands is vergeleken met Engels vaak wat langer, dus een zin moet sneller worden uitgesproken of de vertaling moet compacter. Het stuk over tekstuitbreiding bij vertalen (Engels) legt uit waarom dat zo is.
Origineel (Engels, ongeveer 2 seconden): "Grab your gear and let's head out." Letterlijke vertaling: "Pak je spullen en dan gaan we op pad." Compactere vertaling die beter in dezelfde tijd past: "Spullen pakken en gaan!" De software moet die afweging per zin maken, en dat lukt niet altijd even elegant.
Waarom Nederland en Vlaanderen vooral ondertitelen
Grote taalgebieden als Duitsland, Frankrijk, Italië en Spanje hebben een lange traditie van nasynchroniseren. Het Nederlandse taalgebied koos al vroeg voor ondertiteling. Een kleine markt maakt dure studionasynchronisatie per titel minder aantrekkelijk, en kijkers zijn het horen van de echte stem gaan waarderen. Bijkomend effect: veel Nederlanders en Vlamingen pikken via ondertitelde series en films een flink stuk Engels op. De achtergrond lees je in het stuk over de geschiedenis van nasynchronisatie en ondertiteling (Engels).
Er is één duidelijke uitzondering: kinderprogramma's. Tekenfilms en familiefilms krijgen in het Nederlandse taalgebied gewoonlijk wél een Nederlandse stem, soms zelfs een aparte Vlaamse versie. Jonge kinderen kunnen nog niet snel genoeg lezen om ondertitels te volgen. Diezelfde redenering werkt ook buiten de kinderwereld.
Wanneer een Nederlandse stem wél zinvol is
Een gesproken versie loont vooral wanneer ondertitels de kijker in de weg zitten. Een paar herkenbare situaties:
- Kinderen. Een Engelstalige uitlegvideo over het zonnestelsel of een knutselfilmpje voor groep 3 werkt beter met een Nederlandse stem dan met tekst die ze nog niet kunnen bijhouden. Zie ook het stuk over video's vertalen voor kinderen (Engels).
- Trainingen en instructies. Bij een veiligheidsinstructie in een magazijn of een softwaredemo moeten de ogen op het beeld, niet op een regel tekst onderaan. Een stem laat de handen en ogen vrij.
- E-learning voor medewerkers. Een Engelstalige module van het hoofdkantoor wordt beter opgepakt op de werkvloer in Eindhoven of Gent als hij in de eigen taal klinkt.
- Mensen die moeizaam lezen. Er is in Nederland en Vlaanderen een aanzienlijke groep volwassenen voor wie ondertitels een drempel zijn; ook voor sommige ouderen en slechtzienden is luisteren prettiger dan lezen.
- De andere kant op. Een Nederlands mkb-bedrijf dat een productvideo voor Duitse of Franse klanten nodig heeft, kan juist een Duitse of Franse stem gebruiken, omdat die markten nasynchronisatie gewend zijn.
Voor trainingsmateriaal heeft het Engelstalige stuk over trainingsvideo's vertalen (Engels) meer praktische voorbeelden.
Wanneer je beter bij ondertitels blijft
Er zijn ook situaties waarin een computerstem iets wegneemt wat de video waardevol maakt.
- Interviews en getuigenissen, waarin de echte stem, aarzelingen en emotie onderdeel van de boodschap zijn.
- Humor en cabaret, waar timing en intonatie alles bepalen.
- Video's met meerdere sprekers die je uit elkaar moet kunnen houden.
- Content waar elk woord moet kloppen, zoals juridische of medische uitleg, en waar een kijker de tekst wil kunnen teruglezen.
- Een publiek dat het origineel prima verstaat en vooral een steuntje in de rug wil.
In die gevallen ben je meestal beter af met ondertitels. Hoe je die zelf maakt, lees je in de handleiding ondertitels maken. Twijfel je, maak dan van één video beide versies en vraag een paar kijkers uit je doelgroep welke ze prettiger vinden.
AI-nasynchronisatie met mydubly: wat wel en wat niet
mydubly maakt van je eigen video of audiobestand een versie met een vertaalde stem. De spraakherkenning is gebaseerd op Whisper en de stemmen worden gegenereerd met Chatterbox Multilingual, beide opensourcemodellen. De interface is Engelstalig; zo werkt het:
- Sleep je video naar ‘Drop a video here’ (of een geluidsbestand naar ‘Drop audio here’). De brontaal wordt automatisch herkend.
- Zet de schakelaar ‘Full translation output’ aan (bij een geluidsbestand heet die ‘Audio and text output’).
- Kies bij ‘Select language’ de doeltaal, bijvoorbeeld Dutch voor een Nederlandse versie of German voor Duitse klanten.
- Kies bij ‘Select voice’ een van de 8 standaardstemmen. In het stemmenvenster hoor je van elke stem een kort voorbeeld in de gekozen taal; luister die echt even af.
- Klik op ‘Translate video’ (of ‘Translate audio’), houd het tabblad open en download het resultaat met ‘Download translated video’ (of ‘Download translated audio’ voor alleen het geluidsspoor).
De vertaalde stem wordt op de timing van het origineel gezet. Het videobestand zelf verlaat je computer niet: alleen de audio wordt via HTTPS verwerkt en de nieuwe video wordt in je browser samengesteld. Audio en resultaten worden binnen 30 minuten na afronding van de server verwijderd.
Nasynchronisatie valt onder het duurdere tarief: 50 credits per minuut, met een minimum van 2 minuten (100 credits) per bestand. Met de 100 gratis credits bij aanmelding kun je daarom precies één video van maximaal 2 minuten van een stem voorzien, of een proef doen met ondertitels of een transcript. Voor langere video's moet je opwaarderen.
Een cursus van zes modules van elk 8 minuten. Per module is dat 8 × 50 = 400 credits, voor de hele cursus 2.400 credits (US$ 2,40). Een korte welkomstvideo van 1 minuut kost het minimum: 100 credits (US$ 0,10). Een webinar van 30 minuten komt op 1.500 credits (US$ 1,50).
Wees je bewust van de grenzen. mydubly kloont geen stemmen: je kiest een standaardstem, niet de stem van de oorspronkelijke spreker. Er is geen lipsynchronisatie, dus monden bewegen niet mee met de nieuwe tekst. Alle sprekers in een video krijgen dezelfde stem, er zijn geen sprekerlabels en je kunt de emotie of intonatie niet sturen. Tekst in beeld, zoals titels of slides, wordt niet vertaald. Nederlands is één taaloptie, zonder aparte Vlaamse variant; luister daarom naar het stemvoorbeeld voordat je een Vlaams publiek bedient. Meer over de functie staat op de pagina over AI-dubbing (Engels), en over de keuze tussen standaardstemmen en gekloonde stemmen in het stuk over stemklonen versus standaardstemmen (Engels).
Zo beoordeel je een AI-stem voordat je publiceert
Een nagesynchroniseerde video die je zonder controle online zet, valt vroeg of laat op door één verkeerd uitgesproken naam. Loop daarom deze punten na met een Nederlandstalige luisteraar die de video nog niet kent:
- Eigennamen en plaatsnamen: wordt ‘Scheveningen’ of ‘Roeselare’ herkenbaar uitgesproken?
- Getallen, data en bedragen: klopt ‘drieëntwintig’ met wat er in beeld staat?
- Tempo: worden sommige zinnen opvallend snel uitgesproken omdat de vertaling langer is dan het origineel?
- Toon: past een neutrale stem bij de inhoud, of klinkt een grappige of emotionele scène nu vlak?
- Aanspreekvorm: gebruikt de vertaling ‘je’ of ‘u’, en past dat bij je publiek en je organisatie?
Wees ook open naar kijkers. Vermeld in de beschrijving of aan het begin van de video dat de stem door AI is gegenereerd; dat voorkomt verwarring en wantrouwen. Een uitgebreidere lijst staat in de kwaliteitschecklist voor AI-dubbing (Engels). Wat mydubly verder voor Nederlandstaligen kan, vind je op de Nederlandse overzichtspagina.
Veelgestelde vragen
Wat is het verschil tussen AI-nasynchronisatie en ondertiteling?
Bij ondertiteling hoor je de originele stem en lees je de vertaling. Bij AI-nasynchronisatie wordt de stem vervangen door een computerstem in de doeltaal, zodat je niets hoeft te lezen. Welke beter werkt, hangt af van je publiek en het soort video.
Klinkt een AI-stem net als een echte stemacteur?
Moderne synthetische stemmen klinken een stuk natuurlijker dan een paar jaar geleden, maar een ervaren stemacteur stuurt intonatie, emotie en timing bewuster. Bij uitleg en instructie valt het verschil minder op dan bij drama of humor. Luister altijd eerst een voorbeeld af voordat je een hele video laat nasynchroniseren.
Kan mydubly mijn eigen stem gebruiken in het Nederlands?
Nee. mydubly werkt met 8 standaardstemmen en kloont geen stemmen. Je kiest de stem die het best bij je video past; in het stemmenvenster hoor je van elke stem een kort voorbeeld in de gekozen taal.
Bewegen de lippen mee met de Nederlandse tekst?
Nee, mydubly doet geen lipsynchronisatie. De nieuwe stem volgt de timing van de oorspronkelijke zinnen, maar de mondbewegingen in beeld blijven die van het origineel. Bij uitlegvideo's, schermopnames en video's met veel beelden zonder spreker valt dat het minst op.
Is er een aparte Vlaamse stem?
Nee, Nederlands is één taaloptie zonder Vlaamse variant. Luister de stemvoorbeelden af en laat bij twijfel een Vlaamse collega meeluisteren voordat je de video voor een Vlaams publiek publiceert.
Wat kost een Nederlandse stem onder mijn video?
Nasynchronisatie kost 50 credits per minuut, met een minimum van 100 credits per bestand. Een video van 5 minuten kost 250 credits (US$ 0,25), een video van 10 minuten 500 credits (US$ 0,50). De 100 gratis credits bij aanmelding dekken precies één nasynchronisatie van maximaal 2 minuten; voor langere video's moet je opwaarderen.
Wat gebeurt er als een video meerdere sprekers heeft?
Alle sprekers krijgen dezelfde stem, omdat mydubly geen sprekers onderscheidt. Bij een interview of gesprek kan dat verwarrend zijn. Ondertitels zijn voor zulke video's vaak de betere keuze.
