Audiodatei transkribieren — welche Formate & Dateigrößen funktionieren
MP3 vom Diktiergerät, M4A vom iPhone, WAV aus dem Studio oder ein MP4 aus Zoom — Scriptivo verarbeitet die gängigen Audio- und Videoformate direkt, ohne dass du vorher etwas konvertieren musst. Hier findest du die komplette Formatliste, die Dateigrößen pro Plan und eine Anleitung für Exoten wie OPUS, WMA, AMR oder DSS, die du vorher kurz umwandeln solltest.
Welche Formate werden unterstützt?
Offiziell unterstützt werden MP3, WAV, M4A, MP4, MOV, OGG, FLAC, WEBM, MPEG, AAC, MKV und AVI. Bei Videos wird die Tonspur automatisch extrahiert. Für die meisten Formate gibt es eine eigene Anleitung mit typischen Quellen und Tipps — gesammelt unter Tools:
| Format | Typische Quelle | Direkt hochladen? | Anleitung |
|---|---|---|---|
| MP3 | Diktiergerät, Android-Rekorder, Podcasts | Ja | MP3 zu Text |
| M4A | iPhone-Sprachmemos, Zoom (nur Audio) | Ja | M4A zu Text |
| WAV | Studio, Audacity, Profi-Rekorder | Ja | WAV zu Text |
| FLAC | Verlustfreie Archive | Ja | FLAC zu Text |
| OGG | Audacity, Linux, Spiele | Ja | OGG zu Text |
| AAC | Streaming, Apple-Geräte | Ja | AAC zu Text |
| MP4 / MOV | Zoom, Teams, Smartphone-Videos | Ja (Tonspur wird extrahiert) | MP4 zu Text, MOV zu Text |
| WEBM / MKV / AVI | Browser-Aufnahmen, OBS, ältere Videos | Ja (Tonspur wird extrahiert) | WEBM, MKV, AVI |
| OPUS | WhatsApp (Android), Telegram, Discord | Vorher in MP3/M4A umwandeln | OPUS zu Text |
| WMA | Ältere Windows-Aufnahmen, Diktiergeräte | Vorher in MP3 umwandeln | WMA zu Text |
| AMR / DSS | Alte Handys, Profi-Diktiergeräte (Olympus, Philips) | Vorher in MP3 umwandeln | Konvertieren z. B. mit Audacity oder der Hersteller-Software |
Falls dein Format nicht klappt: Öffne die Datei in Audacity (kostenlos) oder einem Konverter deines Vertrauens, exportiere sie als MP3 (128 kbps reichen für Sprache) oder M4A und lade sie dann hoch.
Wie groß darf eine Audiodatei sein?
Für Sprache ist die Dateigröße meist kein Problem: Eine MP3 mit 128 kbps braucht rund 1 MB pro Minute, eine unkomprimierte WAV rund 10 MB pro Minute. Eine 30-minütige WAV kommt also auf etwa 300 MB und passt noch in den kostenlosen Plan — lange WAV-Aufnahmen lohnt es sich aber, vorher in MP3 zu komprimieren. Die Transkriptionsqualität ändert sich dadurch kaum, der Upload geht deutlich schneller.
Zu lang für deinen Plan? Teile die Datei z. B. in Audacity und lade die Teile nacheinander hoch, oder nutze Pro. Für ein einmaliges Projekt gibt es den 7-Tage-Pass (7,99 €, kein Abo) mit den Pro-Limits.
| Plan | Max. Länge pro Datei | Max. Größe pro Datei |
|---|---|---|
| Kostenlos (1 Datei/Tag) | 30 Minuten | 500 MB |
| Pro | 4 Stunden | 2 GB |
| Business | 10 Stunden | 5 GB |
So bereitest du deine Audiodatei optimal vor
- Kontrolliere die Audio-Qualität — Spiele die Datei kurz ab. Hörst du klare Sprache mit wenig Hintergrundgeräusch? Dann wird das Transkript bei klaren Aufnahmen sehr genau. Bei sehr leisen oder stark verrauschten Aufnahmen musst du mit mehr Korrekturen rechnen.
- Prüfe Format, Dauer und Größe — Ist das Format in der Liste oben? Liegt die Datei unter dem Limit deines Plans? Falls nicht, vorher umwandeln bzw. teilen.
- Wähle die richtige Sprache — Die Sprache wird automatisch erkannt, du kannst sie aber auch manuell festlegen. Die manuelle Auswahl verbessert das Ergebnis gerade bei Fachbegriffen, Eigennamen oder kurzen Aufnahmen.
- Hochladen und Ergebnis prüfen — Bei 30–60 Minuten Audio ist das Transkript typischerweise nach wenigen Minuten fertig. Danach korrigierst du den Text im Browser und exportierst ihn (kostenlos als TXT).
Häufige Fehlerquellen und wie du sie behebst
- Datei wird abgelehnt — Format prüfen (siehe Tabelle) und Größe checken; bei OPUS, WMA, AMR oder DSS vorher in MP3 umwandeln.
- Upload bricht ab oder Transkript bleibt leer — die Datei ist evtl. beschädigt: in Audacity öffnen, neu als MP3 oder WAV exportieren, erneut hochladen.
- Falsch erkannte Wörter — Sprache manuell auswählen statt automatischer Erkennung.
- Hintergrundgeräusche überlagern Sprache — vorher mit Audacity rauschunterdrücken oder ein Tool wie Adobe Podcast Enhance nutzen.
- Mehrere Sprecher — Ab Pro ordnet Scriptivo die Absätze automatisch den Sprechenden zu; gib beim Hochladen die Anzahl der Personen an.
- Lange Pausen oder Stille — kein Problem für die Transkription.
Welche Datei-Quellen funktionieren?
- iPhone-Sprachmemos — als M4A direkt aus der Sprachmemos-App, siehe Sprachmemo vom iPhone in Text.
- WhatsApp-Sprachnachrichten — auf Android oft .opus, vorher umwandeln; Anleitung: WhatsApp-Sprachnachricht in Text.
- Diktiergeräte — MP3 direkt; WMA oder DSS vorher in MP3 umwandeln. Mehr unter Diktat in Text.
- Zoom-Aufnahmen — als MP4 (Video) oder M4A (nur Audio), siehe Zoom-Aufnahme transkribieren.
- Microsoft Teams — die Audio-Spur wird aus dem MP4 automatisch extrahiert.
- Audacity, GarageBand, OBS, Loom — als WAV, M4A, MP3, MP4 oder WebM exportieren, dann hochladen.
Jetzt kostenlos transkribieren
Datei hochladen und in wenigen Minuten das Transkript erhalten. Keine Anmeldung nötig.
Datei hierher ziehen oder klicken
Datei auswählenAudio oder Video · bis 30 Min. · 500 MB (MP4/MOV-Videos beliebig groß)
Alle Formate
MP3, WAV, M4A, MP4, MOV, OGG, FLAC, WEBM, MPEG, AAC, MKV, AVI
Kostenlos: 1 Datei pro Tag, bis 30 Min., TXT-Export, Whisper Turbo. Mit Pro: Whisper large-v3, alle Exporte & KI-Tools
Häufige Fragen
MP3, WAV, M4A, OGG, FLAC, AAC und MPEG sowie die Videoformate MP4, MOV, MKV, WEBM und AVI — im kostenlosen Plan genauso wie mit Pro. OPUS, WMA, AMR oder DSS wandelst du vorher in MP3 oder M4A um.
Bis 500 MB und 30 Minuten pro Datei, eine Datei pro Tag. Mit Pro sind es 4 Stunden und 2 GB, mit Business 10 Stunden und 5 GB pro Datei.
OPUS steht nicht auf der offiziellen Upload-Liste. Wandle die Datei vorher in MP3 oder M4A um — wie das geht, steht unter OPUS zu Text. iPhone-Sprachnachrichten liegen oft schon in einem passenden Format vor.
Du kannst Transkripte inkl. Audio jederzeit selbst löschen. Details zur Verarbeitung findest du in der Datenschutzerklärung.
Ja. Lade das Video hoch (MP4, MOV, MKV, WEBM, AVI), Scriptivo extrahiert automatisch die Tonspur. Mehr dazu unter Video in Text umwandeln.
Ja, solange die Sprache verständlich aufgenommen wurde. Höhere Bitraten (128 kbps und mehr) liefern aber in der Regel sauberere Ergebnisse.
Nein. DRM-geschützte Dateien (z. B. manche älteren iTunes-Käufe oder Streams) lassen sich nicht verarbeiten. Eigene Aufnahmen sind in der Regel nicht DRM-geschützt.
Weitere Anwendungsfälle
Speech-to-Text erklärt
KI-SpracherkennungWie Whisper & Co. funktionieren
Meeting-TranskriptionMeetings allgemein verschriftlichen
KI-Meeting-ProtokollProtokoll mit KI & Vorlage
Meeting transkribierenSchritt-für-Schritt-Workflow
Zoom-Aufnahme transkribierenZoom-Recordings in Text
Teams-Aufnahme transkribierenMicrosoft-Teams-Aufzeichnungen
Google-Meet-Aufnahme transkribierenMeet-Aufzeichnungen aus Drive
Interview transkribierenInterviews für Forschung & Presse
Mehr aus deinen Aufnahmen herausholen
Unbegrenzte Transkriptionen, KI-Zusammenfassung und Export in alle Formate — ab 14,99 €/Monat.