Audiodatei transkribieren — welche Formate & Dateigrößen funktionieren

MP3 vom Diktiergerät, M4A vom iPhone, WAV aus dem Studio oder ein MP4 aus Zoom — Scriptivo verarbeitet die gängigen Audio- und Videoformate direkt, ohne dass du vorher etwas konvertieren musst. Hier findest du die komplette Formatliste, die Dateigrößen pro Plan und eine Anleitung für Exoten wie OPUS, WMA, AMR oder DSS, die du vorher kurz umwandeln solltest.

Welche Formate werden unterstützt?

Offiziell unterstützt werden MP3, WAV, M4A, MP4, MOV, OGG, FLAC, WEBM, MPEG, AAC, MKV und AVI. Bei Videos wird die Tonspur automatisch extrahiert. Für die meisten Formate gibt es eine eigene Anleitung mit typischen Quellen und Tipps — gesammelt unter Tools:

Offizielle Upload-Formate: MP3, WAV, M4A, MP4, MOV, OGG, FLAC, WEBM, MPEG, AAC, MKV, AVI.
FormatTypische QuelleDirekt hochladen?Anleitung
MP3Diktiergerät, Android-Rekorder, PodcastsJaMP3 zu Text
M4AiPhone-Sprachmemos, Zoom (nur Audio)JaM4A zu Text
WAVStudio, Audacity, Profi-RekorderJaWAV zu Text
FLACVerlustfreie ArchiveJaFLAC zu Text
OGGAudacity, Linux, SpieleJaOGG zu Text
AACStreaming, Apple-GeräteJaAAC zu Text
MP4 / MOVZoom, Teams, Smartphone-VideosJa (Tonspur wird extrahiert)MP4 zu Text, MOV zu Text
WEBM / MKV / AVIBrowser-Aufnahmen, OBS, ältere VideosJa (Tonspur wird extrahiert)WEBM, MKV, AVI
OPUSWhatsApp (Android), Telegram, DiscordVorher in MP3/M4A umwandelnOPUS zu Text
WMAÄltere Windows-Aufnahmen, DiktiergeräteVorher in MP3 umwandelnWMA zu Text
AMR / DSSAlte Handys, Profi-Diktiergeräte (Olympus, Philips)Vorher in MP3 umwandelnKonvertieren z. B. mit Audacity oder der Hersteller-Software

Falls dein Format nicht klappt: Öffne die Datei in Audacity (kostenlos) oder einem Konverter deines Vertrauens, exportiere sie als MP3 (128 kbps reichen für Sprache) oder M4A und lade sie dann hoch.

Wie groß darf eine Audiodatei sein?

Für Sprache ist die Dateigröße meist kein Problem: Eine MP3 mit 128 kbps braucht rund 1 MB pro Minute, eine unkomprimierte WAV rund 10 MB pro Minute. Eine 30-minütige WAV kommt also auf etwa 300 MB und passt noch in den kostenlosen Plan — lange WAV-Aufnahmen lohnt es sich aber, vorher in MP3 zu komprimieren. Die Transkriptionsqualität ändert sich dadurch kaum, der Upload geht deutlich schneller.

Zu lang für deinen Plan? Teile die Datei z. B. in Audacity und lade die Teile nacheinander hoch, oder nutze Pro. Für ein einmaliges Projekt gibt es den 7-Tage-Pass (7,99 €, kein Abo) mit den Pro-Limits.

PlanMax. Länge pro DateiMax. Größe pro Datei
Kostenlos (1 Datei/Tag)30 Minuten500 MB
Pro4 Stunden2 GB
Business10 Stunden5 GB

So bereitest du deine Audiodatei optimal vor

  1. Kontrolliere die Audio-Qualität — Spiele die Datei kurz ab. Hörst du klare Sprache mit wenig Hintergrundgeräusch? Dann wird das Transkript bei klaren Aufnahmen sehr genau. Bei sehr leisen oder stark verrauschten Aufnahmen musst du mit mehr Korrekturen rechnen.
  2. Prüfe Format, Dauer und Größe — Ist das Format in der Liste oben? Liegt die Datei unter dem Limit deines Plans? Falls nicht, vorher umwandeln bzw. teilen.
  3. Wähle die richtige Sprache — Die Sprache wird automatisch erkannt, du kannst sie aber auch manuell festlegen. Die manuelle Auswahl verbessert das Ergebnis gerade bei Fachbegriffen, Eigennamen oder kurzen Aufnahmen.
  4. Hochladen und Ergebnis prüfen — Bei 30–60 Minuten Audio ist das Transkript typischerweise nach wenigen Minuten fertig. Danach korrigierst du den Text im Browser und exportierst ihn (kostenlos als TXT).

Häufige Fehlerquellen und wie du sie behebst

  • Datei wird abgelehnt — Format prüfen (siehe Tabelle) und Größe checken; bei OPUS, WMA, AMR oder DSS vorher in MP3 umwandeln.
  • Upload bricht ab oder Transkript bleibt leer — die Datei ist evtl. beschädigt: in Audacity öffnen, neu als MP3 oder WAV exportieren, erneut hochladen.
  • Falsch erkannte Wörter — Sprache manuell auswählen statt automatischer Erkennung.
  • Hintergrundgeräusche überlagern Sprache — vorher mit Audacity rauschunterdrücken oder ein Tool wie Adobe Podcast Enhance nutzen.
  • Mehrere Sprecher — Ab Pro ordnet Scriptivo die Absätze automatisch den Sprechenden zu; gib beim Hochladen die Anzahl der Personen an.
  • Lange Pausen oder Stille — kein Problem für die Transkription.

Welche Datei-Quellen funktionieren?

  • iPhone-Sprachmemos — als M4A direkt aus der Sprachmemos-App, siehe Sprachmemo vom iPhone in Text.
  • WhatsApp-Sprachnachrichten — auf Android oft .opus, vorher umwandeln; Anleitung: WhatsApp-Sprachnachricht in Text.
  • Diktiergeräte — MP3 direkt; WMA oder DSS vorher in MP3 umwandeln. Mehr unter Diktat in Text.
  • Zoom-Aufnahmen — als MP4 (Video) oder M4A (nur Audio), siehe Zoom-Aufnahme transkribieren.
  • Microsoft Teams — die Audio-Spur wird aus dem MP4 automatisch extrahiert.
  • Audacity, GarageBand, OBS, Loom — als WAV, M4A, MP3, MP4 oder WebM exportieren, dann hochladen.

Jetzt kostenlos transkribieren

Datei hochladen und in wenigen Minuten das Transkript erhalten. Keine Anmeldung nötig.

Datei hierher ziehen oder klicken

Audio oder Video · bis 30 Min. · 500 MB (MP4/MOV-Videos beliebig groß)

Alle Formate

MP3, WAV, M4A, MP4, MOV, OGG, FLAC, WEBM, MPEG, AAC, MKV, AVI

Kostenlos: 1 Datei pro Tag, bis 30 Min., TXT-Export, Whisper Turbo. Mit Pro: Whisper large-v3, alle Exporte & KI-Tools

Häufige Fragen

MP3, WAV, M4A, OGG, FLAC, AAC und MPEG sowie die Videoformate MP4, MOV, MKV, WEBM und AVI — im kostenlosen Plan genauso wie mit Pro. OPUS, WMA, AMR oder DSS wandelst du vorher in MP3 oder M4A um.

Bis 500 MB und 30 Minuten pro Datei, eine Datei pro Tag. Mit Pro sind es 4 Stunden und 2 GB, mit Business 10 Stunden und 5 GB pro Datei.

OPUS steht nicht auf der offiziellen Upload-Liste. Wandle die Datei vorher in MP3 oder M4A um — wie das geht, steht unter OPUS zu Text. iPhone-Sprachnachrichten liegen oft schon in einem passenden Format vor.

Du kannst Transkripte inkl. Audio jederzeit selbst löschen. Details zur Verarbeitung findest du in der Datenschutzerklärung.

Ja. Lade das Video hoch (MP4, MOV, MKV, WEBM, AVI), Scriptivo extrahiert automatisch die Tonspur. Mehr dazu unter Video in Text umwandeln.

Ja, solange die Sprache verständlich aufgenommen wurde. Höhere Bitraten (128 kbps und mehr) liefern aber in der Regel sauberere Ergebnisse.

Nein. DRM-geschützte Dateien (z. B. manche älteren iTunes-Käufe oder Streams) lassen sich nicht verarbeiten. Eigene Aufnahmen sind in der Regel nicht DRM-geschützt.

Weitere Anwendungsfälle

Mehr aus deinen Aufnahmen herausholen

Unbegrenzte Transkriptionen, KI-Zusammenfassung und Export in alle Formate — ab 14,99 €/Monat.