Anwendungsfall

Podcast transkribieren: Vom Rohtext zu Shownotes, Kapiteln und Zitaten

Wer einen Podcast transkribieren lässt, bekommt mehr als eine Textfassung: Aus der Abschrift entstehen Shownotes, Kapitelmarken, Zitate für Instagram und LinkedIn, eine barrierefreie Version und auf Wunsch eine englische Fassung. Dieser Leitfaden zeigt einen Arbeitsablauf, der sich für wöchentliche Folgen genauso eignet wie für ein einmaliges Interviewformat.

6 Min. Lesezeit · Aktualisiert

Hinweis: Die Oberfläche von mydubly ist auf Englisch. Deutsche Aufnahmen transkribieren, ins Deutsche übersetzen und eine deutsche Stimme erzeugen funktioniert trotzdem – nur die Schaltflächen sind englisch beschriftet.

Was ein Transkript für Ihren Podcast leistet

Eine Folge von 50 Minuten ist für Hörerinnen und Hörer ein Genuss, für Suchmaschinen und Redaktionen aber eine Blackbox. Erst als Text wird der Inhalt durchsuchbar, zitierbar und wiederverwertbar. Konkret nutzen deutschsprachige Podcast-Teams die Abschrift vor allem für:

  • Shownotes, die mehr enthalten als „Heute sprechen wir über …“, nämlich die wichtigsten Thesen, erwähnte Bücher und Links.
  • Kapitelmarken, damit Hörer im Player direkt zum Gast oder zum Themenblock springen können.
  • Zitate und Kurztexte für Social Media, Newsletter oder die Episodenseite.
  • Eine Textfassung für gehörlose und schwerhörige Menschen sowie für alle, die lieber lesen.
  • Eine Grundlage für eine englische Fassung, als übersetzter Text oder als vertonte Version.

Der Aufwand dafür sinkt erheblich, wenn die Rohfassung nicht von Hand abgetippt werden muss. Die Nacharbeit bleibt, aber sie besteht aus Lesen und Markieren statt aus stundenlangem Zurückspulen.

Gute Aufnahme, gute Abschrift: Vorbereitung im Studio

Die Qualität des Transkripts entscheidet sich bei der Aufnahme. Ein paar Gewohnheiten, die sich in vielen Produktionen bewährt haben:

  • Jede Person spricht in ein eigenes Mikrofon, möglichst nah und in gleichbleibendem Abstand.
  • Gleichzeitiges Reden vermeiden. Bei lebhaften Diskussionen ist Überlappung normal, doch genau diese Stellen werden am ungenauesten erfasst.
  • Namen von Gästen, Firmen und Fachbegriffen einmal deutlich aussprechen, am besten gleich in der Anmoderation.
  • Musikbetten unter Sprache sparsam einsetzen. Ein Jingle zwischen Blöcken stört kaum, Musik unter dem gesamten Gespräch schon eher.
  • Remote-Gäste bitten, sich lokal aufzunehmen, statt nur den komprimierten Ton aus dem Videocall zu nutzen.

Für die Abschrift verwenden Sie die fertig geschnittene Folge, nicht die Rohspuren. So stimmen die Zeitmarken später mit dem veröffentlichten Audio überein, und das ist für Kapitelmarken entscheidend.

Folge transkribieren: der Ablauf mit mydubly

mydubly ist eine Web-App für Audio- und Videodateien. Die Oberfläche ist auf Englisch, für einen Podcast brauchen Sie aber nur wenige Klicks:

  1. Exportieren Sie die fertige Folge als MP3, M4A, WAV, AAC, OGG oder FLAC. Video-Podcasts können Sie als MP4 oder MOV im Videobereich verarbeiten.
  2. Ziehen Sie die Datei auf der Startseite in „Drop audio here“.
  3. Lassen Sie „Audio and text output“ ausgeschaltet, damit nur das Transkript mit Zeitmarken erstellt wird. Die Sprache erkennt das Tool selbst („Source: Auto detect“).
  4. Starten Sie mit „Transcribe audio“ und lassen Sie den Browser-Tab bis zum Ende geöffnet.
  5. Laden Sie „Download timestamped transcript“ für Kapitel und Zitate herunter und „Download transcript“ für die Fließtextfassung.

Pro Datei sind bis zu zwei Stunden möglich. Längere Live-Mitschnitte oder Marathonfolgen teilen Sie vorher in zwei Teile.

Was Sie wissen sollten: mydubly unterscheidet keine Sprecher, schreibt keine Shownotes und erstellt keine Zusammenfassungen. Es gibt auch keine Bearbeitungsoberfläche; Korrekturen machen Sie in der heruntergeladenen Textdatei. mydubly liefert die Rohabschrift, den redaktionellen Teil übernehmen Sie. Mehr zu den Möglichkeiten für Audiodateien finden Sie auf der Seite Audio in Text umwandeln (Englisch).

Sprecher von Hand kennzeichnen

Weil die Abschrift ohne Sprecherlabels kommt, steht der Text von Moderatorin und Gast zunächst in einem Fluss. Wie automatische Sprechererkennung grundsätzlich funktioniert und warum sie fehleranfällig ist, erklärt der Beitrag über Speaker Diarization (Englisch). Für ein Gespräch mit zwei oder drei Personen ist die Handarbeit aber überschaubar:

  1. Öffnen Sie die Datei mit Zeitmarken in einem Editor, in dem Sie gleichzeitig die Folge abspielen können.
  2. Gehen Sie die Fragen durch: Fragen stammen meist vom Host, das gibt Ihnen schnell Orientierung.
  3. Setzen Sie Kürzel wie „JM:“ und „Gast:“ an jeden Sprecherwechsel. Bei Unsicherheit springen Sie über die Zeitmarke an die Stelle im Audio.
  4. Ersetzen Sie die Kürzel am Ende per Suchen und Ersetzen durch die vollen Namen.

Für eine Interviewreihe mit wissenschaftlichem Anspruch lohnen sich feste Regeln, etwa für Pausen, Füllwörter und unverständliche Stellen. Die Grundlagen dazu fasst der Artikel über Regeln für Interview-Transkripte zusammen.

Kapitelmarken und Shownotes aus den Zeitmarken

Mit dem Transkript mit Zeitmarken vor Augen sind Kapitel in wenigen Minuten gesetzt. Suchen Sie die Stellen, an denen ein neues Thema beginnt, und übernehmen Sie die Zeitmarke. Viele Podcast-Hoster und Player lesen Kapitel aus den Shownotes oder aus einem eigenen Kapitelfeld; auf YouTube werden Zeitangaben in der Beschreibung als Kapitel erkannt, wenn die Liste bei 0:00 beginnt.

Beispiel: Shownotes mit Kapiteln
Folge 112: Wärmepumpe im Altbau – lohnt sich das?
0:00 Begrüßung und Vorstellung von Energieberaterin Katrin Hofer
3:41 Was „Altbau“ technisch bedeutet
14:20 Vorlauftemperatur und Heizkörpertausch
31:05 Förderung, Kosten und typische Fehler bei der Planung
46:12 Fragen aus der Community

Für die eigentlichen Shownotes markieren Sie beim Durchlesen drei bis fünf Kernaussagen und alle erwähnten Quellen. Daraus entsteht ein Absatz, der auch in der Podcast-App neugierig macht. Eine ausführliche Anleitung auf Englisch bietet der Beitrag Shownotes aus dem Transkript (Englisch).

Zitate für Social Media finden

Die besten Sätze einer Folge fallen oft beiläufig, und beim Hören gehen sie unter. Im Text springen sie ins Auge. Suchen Sie gezielt nach Formulierungen, die auch ohne Kontext funktionieren, etwa eine klare Meinung, eine überraschende Zahl, die der Gast selbst nennt, oder eine Anekdote mit Pointe.

  • Zitate wörtlich übernehmen, aber Füllwörter behutsam glätten und den Gast vor der Veröffentlichung fragen, ob er einverstanden ist.
  • Die Zeitmarke notieren, damit das Social-Media-Team den passenden Audioschnipsel für ein Audiogramm schneiden kann.
  • Pro Folge einen kleinen Vorrat anlegen: ein Zitat für LinkedIn, eines für Instagram, eines für den Newsletter.

Barrierefreiheit: Textfassung und Untertitel

Ein reiner Audio-Podcast schließt gehörlose und viele schwerhörige Menschen aus. Eine veröffentlichte Textfassung auf der Episodenseite ändert das, und sie hilft auch Menschen, die Deutsch als Zweitsprache sprechen. Gerade öffentliche Stellen, Hochschulen und Unternehmen mit Inklusionszielen achten zunehmend darauf.

Für eine barrierefreie Fassung genügt die Rohabschrift nicht ganz. Korrigieren Sie Namen und Fachbegriffe, setzen Sie Sprecherkennungen und ergänzen Sie wichtige Geräusche oder Musik in eckigen Klammern, etwa [Lachen] oder [Jingle]. Bei Video-Podcasts erzeugen Sie im Videobereich zusätzlich eine SRT-Untertiteldatei („Download subtitles“), die Sie auf YouTube oder in Ihrem Player hochladen.

Englische Fassung: Text oder Ton

Viele deutschsprachige Formate haben ein Publikum, das über den DACH-Raum hinausgeht, etwa in der Tech-, Wissenschafts- oder Start-up-Szene. Zwei Wege bieten sich an:

  • Übersetztes Transkript: Bei ausgeschaltetem Schalter wählen Sie unter „Select language“ English. Sie erhalten die Abschrift auf Englisch, die Sie als englische Textfassung veröffentlichen können. Das kostet so viel wie eine normale Abschrift.
  • Vertonte Fassung: Mit eingeschaltetem „Audio and text output“ wählen Sie eine Zielsprache und eine von acht Standardstimmen. Das Ergebnis ist eine englische Tonspur, deren Timing am Original ausgerichtet ist.

Bei der Vertonung sollten Sie die Grenzen kennen: Alle Sprecher erhalten dieselbe Stimme, Ihre eigene Stimme wird nicht nachgebildet, und Emotionen lassen sich nicht steuern. Für ein Gespräch mit mehreren Personen ist das ein deutlicher Unterschied zum Original. Ob das für Ihr Format passt, testen Sie am besten mit einer kurzen Folge. Hintergründe zu mehrsprachigen Podcasts bietet der Beitrag über Podcast-Übersetzung (Englisch).

Was das pro Folge kostet

Abgerechnet wird pro angefangener Minute mit Prepaid-Credits, ohne Abo. Eine Abschrift kostet 1 Credit pro Minute, eine vertonte Fassung 50 Credits pro Minute (mindestens 100 Credits pro Datei). 1.000 Credits entsprechen einem US-Dollar, zum Start gibt es 100 Credits gratis.

Folge von 60 Minuten, Transkript
60 Credits (US$ 0,06)
Doppelfolge von 2 Stunden, Transkript
120 Credits (US$ 0,12)
Folge von 60 Minuten, Transkript auf Englisch übersetzt
60 Credits (US$ 0,06)
Folge von 60 Minuten, englische Tonspur
3.000 Credits (US$ 3,00)

Ein wöchentlicher Podcast mit Folgen von rund einer Stunde kommt für die Abschriften eines ganzen Jahres also auf wenige Dollar. Das Startguthaben reicht für die Abschrift einer kompletten Folge. Alternativ deckt es eine Vertonung von bis zu zwei Minuten ab; für längere Vertonungen laden Sie Guthaben auf.

Häufige Fragen

Erkennt mydubly, wer im Podcast spricht?

Nein, die Abschrift enthält keine Sprecherlabels. Bei zwei oder drei Stimmen lassen sich die Wechsel mithilfe der Zeitmarken zügig von Hand markieren. Kürzel und anschließendes Suchen und Ersetzen sparen dabei Zeit.

Kann ich einfach den Link zu meinem Podcast eingeben?

Nein, mydubly arbeitet nur mit Dateien auf Ihrem Gerät. Exportieren Sie die fertige Folge aus Ihrem Schnittprogramm oder laden Sie die eigene Datei bei Ihrem Hoster herunter. Danach ziehen Sie sie in den Audiobereich.

Wie genau wird ein deutschsprachiger Podcast transkribiert?

Das hängt vor allem von der Aufnahme ab: klare Mikrofone, wenig Überlappung und kaum Musik unter der Sprache führen zu deutlich besseren Ergebnissen. Namen, Fachbegriffe und Dialektpassagen sollten Sie immer gegenlesen. Eine feste Prozentzahl lässt sich seriös nicht nennen.

Kann mydubly Shownotes oder eine Zusammenfassung schreiben?

Nein, mydubly liefert das Transkript, aber keine Zusammenfassungen. Shownotes schreiben Sie selbst auf Basis der Abschrift. Mit den Zeitmarken finden Sie die passenden Stellen dafür schnell.

Meine Folge ist länger als zwei Stunden. Was nun?

Teilen Sie die Datei mit einem Audioeditor in zwei Teile und transkribieren Sie diese nacheinander. Die Zeitmarken des zweiten Teils beginnen dann wieder bei null; für Kapitel addieren Sie die Länge des ersten Teils. Am besten schneiden Sie an einer natürlichen Pause.

Bekommt jede Person in der englischen Fassung eine eigene Stimme?

Nein, in der vertonten Fassung spricht eine einzige Standardstimme alle Rollen. Für Gesprächsformate ist daher oft das übersetzte Transkript die passendere Lösung. Hören Sie im Stimmendialog die Hörproben an, bevor Sie eine Vertonung bezahlen.