Was ein Transkript für Ihren Podcast leistet
Eine Folge von 50 Minuten ist für Hörerinnen und Hörer ein Genuss, für Suchmaschinen und Redaktionen aber eine Blackbox. Erst als Text wird der Inhalt durchsuchbar, zitierbar und wiederverwertbar. Konkret nutzen deutschsprachige Podcast-Teams die Abschrift vor allem für:
- Shownotes, die mehr enthalten als „Heute sprechen wir über …“, nämlich die wichtigsten Thesen, erwähnte Bücher und Links.
- Kapitelmarken, damit Hörer im Player direkt zum Gast oder zum Themenblock springen können.
- Zitate und Kurztexte für Social Media, Newsletter oder die Episodenseite.
- Eine Textfassung für gehörlose und schwerhörige Menschen sowie für alle, die lieber lesen.
- Eine Grundlage für eine englische Fassung, als übersetzter Text oder als vertonte Version.
Der Aufwand dafür sinkt erheblich, wenn die Rohfassung nicht von Hand abgetippt werden muss. Die Nacharbeit bleibt, aber sie besteht aus Lesen und Markieren statt aus stundenlangem Zurückspulen.
Gute Aufnahme, gute Abschrift: Vorbereitung im Studio
Die Qualität des Transkripts entscheidet sich bei der Aufnahme. Ein paar Gewohnheiten, die sich in vielen Produktionen bewährt haben:
- Jede Person spricht in ein eigenes Mikrofon, möglichst nah und in gleichbleibendem Abstand.
- Gleichzeitiges Reden vermeiden. Bei lebhaften Diskussionen ist Überlappung normal, doch genau diese Stellen werden am ungenauesten erfasst.
- Namen von Gästen, Firmen und Fachbegriffen einmal deutlich aussprechen, am besten gleich in der Anmoderation.
- Musikbetten unter Sprache sparsam einsetzen. Ein Jingle zwischen Blöcken stört kaum, Musik unter dem gesamten Gespräch schon eher.
- Remote-Gäste bitten, sich lokal aufzunehmen, statt nur den komprimierten Ton aus dem Videocall zu nutzen.
Für die Abschrift verwenden Sie die fertig geschnittene Folge, nicht die Rohspuren. So stimmen die Zeitmarken später mit dem veröffentlichten Audio überein, und das ist für Kapitelmarken entscheidend.
Folge transkribieren: der Ablauf mit mydubly
mydubly ist eine Web-App für Audio- und Videodateien. Die Oberfläche ist auf Englisch, für einen Podcast brauchen Sie aber nur wenige Klicks:
- Exportieren Sie die fertige Folge als MP3, M4A, WAV, AAC, OGG oder FLAC. Video-Podcasts können Sie als MP4 oder MOV im Videobereich verarbeiten.
- Ziehen Sie die Datei auf der Startseite in „Drop audio here“.
- Lassen Sie „Audio and text output“ ausgeschaltet, damit nur das Transkript mit Zeitmarken erstellt wird. Die Sprache erkennt das Tool selbst („Source: Auto detect“).
- Starten Sie mit „Transcribe audio“ und lassen Sie den Browser-Tab bis zum Ende geöffnet.
- Laden Sie „Download timestamped transcript“ für Kapitel und Zitate herunter und „Download transcript“ für die Fließtextfassung.
Pro Datei sind bis zu zwei Stunden möglich. Längere Live-Mitschnitte oder Marathonfolgen teilen Sie vorher in zwei Teile.
Was Sie wissen sollten: mydubly unterscheidet keine Sprecher, schreibt keine Shownotes und erstellt keine Zusammenfassungen. Es gibt auch keine Bearbeitungsoberfläche; Korrekturen machen Sie in der heruntergeladenen Textdatei. mydubly liefert die Rohabschrift, den redaktionellen Teil übernehmen Sie. Mehr zu den Möglichkeiten für Audiodateien finden Sie auf der Seite Audio in Text umwandeln (Englisch).
Sprecher von Hand kennzeichnen
Weil die Abschrift ohne Sprecherlabels kommt, steht der Text von Moderatorin und Gast zunächst in einem Fluss. Wie automatische Sprechererkennung grundsätzlich funktioniert und warum sie fehleranfällig ist, erklärt der Beitrag über Speaker Diarization (Englisch). Für ein Gespräch mit zwei oder drei Personen ist die Handarbeit aber überschaubar:
- Öffnen Sie die Datei mit Zeitmarken in einem Editor, in dem Sie gleichzeitig die Folge abspielen können.
- Gehen Sie die Fragen durch: Fragen stammen meist vom Host, das gibt Ihnen schnell Orientierung.
- Setzen Sie Kürzel wie „JM:“ und „Gast:“ an jeden Sprecherwechsel. Bei Unsicherheit springen Sie über die Zeitmarke an die Stelle im Audio.
- Ersetzen Sie die Kürzel am Ende per Suchen und Ersetzen durch die vollen Namen.
Für eine Interviewreihe mit wissenschaftlichem Anspruch lohnen sich feste Regeln, etwa für Pausen, Füllwörter und unverständliche Stellen. Die Grundlagen dazu fasst der Artikel über Regeln für Interview-Transkripte zusammen.
Kapitelmarken und Shownotes aus den Zeitmarken
Mit dem Transkript mit Zeitmarken vor Augen sind Kapitel in wenigen Minuten gesetzt. Suchen Sie die Stellen, an denen ein neues Thema beginnt, und übernehmen Sie die Zeitmarke. Viele Podcast-Hoster und Player lesen Kapitel aus den Shownotes oder aus einem eigenen Kapitelfeld; auf YouTube werden Zeitangaben in der Beschreibung als Kapitel erkannt, wenn die Liste bei 0:00 beginnt.
Folge 112: Wärmepumpe im Altbau – lohnt sich das? 0:00 Begrüßung und Vorstellung von Energieberaterin Katrin Hofer 3:41 Was „Altbau“ technisch bedeutet 14:20 Vorlauftemperatur und Heizkörpertausch 31:05 Förderung, Kosten und typische Fehler bei der Planung 46:12 Fragen aus der Community
Für die eigentlichen Shownotes markieren Sie beim Durchlesen drei bis fünf Kernaussagen und alle erwähnten Quellen. Daraus entsteht ein Absatz, der auch in der Podcast-App neugierig macht. Eine ausführliche Anleitung auf Englisch bietet der Beitrag Shownotes aus dem Transkript (Englisch).
Barrierefreiheit: Textfassung und Untertitel
Ein reiner Audio-Podcast schließt gehörlose und viele schwerhörige Menschen aus. Eine veröffentlichte Textfassung auf der Episodenseite ändert das, und sie hilft auch Menschen, die Deutsch als Zweitsprache sprechen. Gerade öffentliche Stellen, Hochschulen und Unternehmen mit Inklusionszielen achten zunehmend darauf.
Für eine barrierefreie Fassung genügt die Rohabschrift nicht ganz. Korrigieren Sie Namen und Fachbegriffe, setzen Sie Sprecherkennungen und ergänzen Sie wichtige Geräusche oder Musik in eckigen Klammern, etwa [Lachen] oder [Jingle]. Bei Video-Podcasts erzeugen Sie im Videobereich zusätzlich eine SRT-Untertiteldatei („Download subtitles“), die Sie auf YouTube oder in Ihrem Player hochladen.
Englische Fassung: Text oder Ton
Viele deutschsprachige Formate haben ein Publikum, das über den DACH-Raum hinausgeht, etwa in der Tech-, Wissenschafts- oder Start-up-Szene. Zwei Wege bieten sich an:
- Übersetztes Transkript: Bei ausgeschaltetem Schalter wählen Sie unter „Select language“ English. Sie erhalten die Abschrift auf Englisch, die Sie als englische Textfassung veröffentlichen können. Das kostet so viel wie eine normale Abschrift.
- Vertonte Fassung: Mit eingeschaltetem „Audio and text output“ wählen Sie eine Zielsprache und eine von acht Standardstimmen. Das Ergebnis ist eine englische Tonspur, deren Timing am Original ausgerichtet ist.
Bei der Vertonung sollten Sie die Grenzen kennen: Alle Sprecher erhalten dieselbe Stimme, Ihre eigene Stimme wird nicht nachgebildet, und Emotionen lassen sich nicht steuern. Für ein Gespräch mit mehreren Personen ist das ein deutlicher Unterschied zum Original. Ob das für Ihr Format passt, testen Sie am besten mit einer kurzen Folge. Hintergründe zu mehrsprachigen Podcasts bietet der Beitrag über Podcast-Übersetzung (Englisch).
Was das pro Folge kostet
Abgerechnet wird pro angefangener Minute mit Prepaid-Credits, ohne Abo. Eine Abschrift kostet 1 Credit pro Minute, eine vertonte Fassung 50 Credits pro Minute (mindestens 100 Credits pro Datei). 1.000 Credits entsprechen einem US-Dollar, zum Start gibt es 100 Credits gratis.
- Folge von 60 Minuten, Transkript
- 60 Credits (US$ 0,06)
- Doppelfolge von 2 Stunden, Transkript
- 120 Credits (US$ 0,12)
- Folge von 60 Minuten, Transkript auf Englisch übersetzt
- 60 Credits (US$ 0,06)
- Folge von 60 Minuten, englische Tonspur
- 3.000 Credits (US$ 3,00)
Ein wöchentlicher Podcast mit Folgen von rund einer Stunde kommt für die Abschriften eines ganzen Jahres also auf wenige Dollar. Das Startguthaben reicht für die Abschrift einer kompletten Folge. Alternativ deckt es eine Vertonung von bis zu zwei Minuten ab; für längere Vertonungen laden Sie Guthaben auf.
Häufige Fragen
Erkennt mydubly, wer im Podcast spricht?
Nein, die Abschrift enthält keine Sprecherlabels. Bei zwei oder drei Stimmen lassen sich die Wechsel mithilfe der Zeitmarken zügig von Hand markieren. Kürzel und anschließendes Suchen und Ersetzen sparen dabei Zeit.
Kann ich einfach den Link zu meinem Podcast eingeben?
Nein, mydubly arbeitet nur mit Dateien auf Ihrem Gerät. Exportieren Sie die fertige Folge aus Ihrem Schnittprogramm oder laden Sie die eigene Datei bei Ihrem Hoster herunter. Danach ziehen Sie sie in den Audiobereich.
Wie genau wird ein deutschsprachiger Podcast transkribiert?
Das hängt vor allem von der Aufnahme ab: klare Mikrofone, wenig Überlappung und kaum Musik unter der Sprache führen zu deutlich besseren Ergebnissen. Namen, Fachbegriffe und Dialektpassagen sollten Sie immer gegenlesen. Eine feste Prozentzahl lässt sich seriös nicht nennen.
Kann mydubly Shownotes oder eine Zusammenfassung schreiben?
Nein, mydubly liefert das Transkript, aber keine Zusammenfassungen. Shownotes schreiben Sie selbst auf Basis der Abschrift. Mit den Zeitmarken finden Sie die passenden Stellen dafür schnell.
Meine Folge ist länger als zwei Stunden. Was nun?
Teilen Sie die Datei mit einem Audioeditor in zwei Teile und transkribieren Sie diese nacheinander. Die Zeitmarken des zweiten Teils beginnen dann wieder bei null; für Kapitel addieren Sie die Länge des ersten Teils. Am besten schneiden Sie an einer natürlichen Pause.
Bekommt jede Person in der englischen Fassung eine eigene Stimme?
Nein, in der vertonten Fassung spricht eine einzige Standardstimme alle Rollen. Für Gesprächsformate ist daher oft das übersetzte Transkript die passendere Lösung. Hören Sie im Stimmendialog die Hörproben an, bevor Sie eine Vertonung bezahlen.
