Podcast transkribieren — mehr aus jeder Episode machen
Eine Podcast-Folge steckt voller Inhalte, die Suchmaschinen nicht hören können. Ein Transkript macht sie sichtbar: als Grundlage für Shownotes, als Blogartikel, als Zitatquelle für Social Media und als barrierefreie Alternative für Menschen, die nicht zuhören können. Mit Scriptivo lädst du deine fertige Episode hoch und bekommst den kompletten Text mit Zeitstempeln — mit Pro auf Wunsch gleich eine KI-Zusammenfassung dazu. Hier zeigen wir dir einen praxistauglichen Workflow und sagen dir auch ehrlich, wo du noch selbst Hand anlegen musst.
Warum sich ein Podcast-Transkript lohnt
- Shownotes in einem Bruchteil der Zeit — Statt die Folge noch einmal komplett anzuhören, hast du alle Themen, Namen und Links schwarz auf weiß.
- Auffindbarkeit bei Google — Suchmaschinen indexieren Text, kein Audio. Ein Transkript oder ein daraus abgeleiteter Artikel macht deine Folge für Suchanfragen sichtbar. Mehr dazu im Ratgeber Podcast-Transkript für SEO.
- Barrierefreiheit — Gehörlose und schwerhörige Menschen können deine Inhalte lesen. Auch wer gerade nicht zuhören kann, bekommt so Zugang.
- Zitate für Social Media — Über die Zeitstempel findest du die starken Momente schnell und kannst sie wortgetreu als Zitatkarte oder Post verwenden.
- Recycling für Newsletter und Blog — Aus einer 45-Minuten-Folge entstehen mehrere Texte, ohne dass du bei null anfängst.
Der Workflow: vom fertigen Export zu den Shownotes
- Finalen Mixdown exportieren — Nimm die fertig geschnittene Episode als MP3 oder WAV — also genau das, was auch deine Hörer bekommen. So passt das Transkript zur veröffentlichten Folge, inklusive Schnitte. Intro-Musik und Jingles stören kaum, lange Musikbetten unter Sprache schon eher.
- Episode hochladen — Zieh die Datei in die Upload-Box. Kostenlos geht das für Folgen bis 30 Minuten und 500 MB. Die meisten Podcasts sind länger — mit Pro transkribierst du bis 4 Stunden pro Datei und beliebig viele Folgen.
- Transkript gegenlesen — Prüfe vor allem Namen von Gästen, Marken und Fachbegriffe. Korrigiere direkt im Browser-Editor — das dauert meist deutlich kürzer als die Folge selbst.
- KI-Zusammenfassung erzeugen (Pro) — Mit einem Klick auf „Zusammenfassen“ erhältst du die Kernaussagen der Folge. Das ist ein solides Gerüst für Shownotes und Episodenbeschreibung, das du anschließend in deinem Ton überarbeitest.
- Exportieren und veröffentlichen — Mit Pro exportierst du als DOCX, PDF, TXT oder als SRT/VTT, falls du die Folge als Video (z. B. auf YouTube) veröffentlichst. Das Transkript kannst du als eigene Seite, als aufklappbaren Bereich unter den Shownotes oder als Download anbieten.
Sprecher kennzeichnen: ehrlicher Hinweis und Workaround
Scriptivo erkennt nicht automatisch, wer spricht — es gibt also keine Zuordnung wie „Sprecher A“ und „Sprecher B“. Du bekommst einen durchgehenden Text mit Zeitstempeln. Bei Solo-Folgen spielt das keine Rolle, bei Interviews und Co-Host-Formaten musst du die Namen selbst ergänzen.
In der Praxis geht das schneller, als es klingt: Sprecherwechsel erkennst du meist am Inhalt (Frage → Antwort). Setze beim Gegenlesen einfach den Namen an den Anfang jedes Absatzes, zum Beispiel „Anna:“ und „Gast:“.
Nimmst du remote oder mehrspurig auf (z. B. mit separaten Spuren pro Person), kannst du jede Spur einzeln transkribieren. Dann weißt du bei jedem Transkript sicher, wer spricht, und fügst die Abschnitte über die Zeitstempel zusammen. Das ist etwas mehr Arbeit, liefert bei Gesprächsformaten aber die sauberste Zuordnung.
Tipps für Remote- und Mehrspur-Aufnahmen
- Mixdown oder Einzelspuren — Für Shownotes reicht der fertige Mixdown. Brauchst du ein Transkript mit sauberer Sprecherzuordnung, lohnt sich der Weg über die Einzelspuren.
- Übersprechen vermeiden — Wenn zwei Personen gleichzeitig reden, leidet jede automatische Transkription. Kurze Pausen zwischen Redebeiträgen helfen enorm.
- Headsets für Gäste — Laptop-Mikrofone fangen Raumhall und Tastaturgeräusche ein. Ein einfaches Headset verbessert Aufnahme und Transkript gleichermaßen.
- Mehrere Folgen auf einmal — Mit Pro lädst du bis zu 10 Dateien gleichzeitig hoch, praktisch wenn du dein Archiv nachträglich transkribieren willst.
- Sprache manuell setzen — Bei deutschen Folgen mit vielen englischen Begriffen liefert die manuelle Sprachwahl oft ein stabileres Ergebnis.
Vom Transkript zum Blogartikel
Ein Rohtranskript ist gesprochene Sprache — mit Füllwörtern, Wiederholungen und Gedankensprüngen. Als Blogartikel funktioniert es erst nach einer Überarbeitung: Zwischenüberschriften setzen, Kernaussagen zusammenfassen, die besten Zitate wörtlich übernehmen. Die Pro-Funktion „Umschreiben“ kann dir dabei einen ersten Blog-Entwurf liefern, den du anschließend redigierst.
Sollen Zuhörer das vollständige Transkript lesen können, lohnt sich eine leicht geglättete Version: Füllwörter raus, Satzbau lassen. Hast du Episoden auf YouTube, nutze die Untertitel-Exporte — siehe Untertitel erstellen.
Jetzt kostenlos transkribieren
Teste es mit einer kurzen Folge oder einem Ausschnitt — bis 30 Minuten kostenlos, ohne Anmeldung.
Datei hierher ziehen oder klicken
Datei auswählenAudio oder Video · bis 30 Min. · 500 MB (MP4/MOV-Videos beliebig groß)
Alle Formate
MP3, WAV, M4A, MP4, MOV, OGG, FLAC, WEBM, MPEG, AAC, MKV, AVI
Kostenlos: 1 Datei pro Tag, bis 30 Min., TXT-Export, Whisper Turbo. Mit Pro: Whisper large-v3, alle Exporte & KI-Tools
Häufige Fragen
Ja, für Folgen bis 30 Minuten und 500 MB — eine Transkription pro Tag, Export als TXT, ohne Anmeldung. Für längere Folgen, KI-Zusammenfassung und weitere Exportformate brauchst du Pro (14,99 € im Monat).
Nein, eine automatische Sprechererkennung gibt es nicht. Du bekommst einen fortlaufenden Text mit Zeitstempeln und ergänzt die Namen beim Gegenlesen. Bei Mehrspur-Aufnahmen kannst du jede Spur einzeln transkribieren, um die Zuordnung sicher zu haben.
Am einfachsten den fertigen MP3- oder WAV-Export deiner Episode. Unterstützt werden unter anderem MP3, WAV, M4A, FLAC, OGG und AAC — Details zu einzelnen Formaten findest du unter MP3 zu Text und WAV zu Text.
Die KI-Zusammenfassung (Pro) liefert die wichtigsten Themen und Aussagen der Folge — ein gutes Gerüst. Links, Gäste-Infos, Calls-to-Action und deinen persönlichen Ton solltest du selbst ergänzen.
Suchmaschinen können Audio nicht direkt auswerten, Text schon. Ein Transkript oder ein daraus entwickelter Artikel gibt Google Inhalte, die zu Suchanfragen passen können. Garantierte Rankings gibt es natürlich nicht — der Text muss für Leser nützlich sein.
Eine Folge von 30 bis 60 Minuten ist in der Regel nach wenigen Minuten fertig. Die genaue Dauer hängt von Länge und Auslastung ab.
Weitere Anwendungsfälle
Video-Inhalte als Text
Video in Text umwandelnTonspur jedes Videos als Text
Vorlesung transkribierenMitschnitte als Lernskript
Transkription für StudentenInterviews für Bachelor- & Masterarbeit
Transkription für JournalistenZitate schnell & sauber
WhatsApp-Sprachnachricht in TextSprachnachrichten lesen statt hören
iPhone-Sprachmemo in TextSprachmemos-App → Text
Diktat in TextDiktiergerät & Sprachmemo abtippen lassen
Audio übersetzenTranskript + Übersetzung (Pro)
Mehr aus deinen Aufnahmen herausholen
Unbegrenzte Transkriptionen, KI-Zusammenfassung und Export in alle Formate — ab 14,99 €/Monat.