Whisper turbo vs. large-v3 auf Deutsch: Unser Benchmark
Wir haben Whisper large-v3-turbo und large-v3 auf 100 deutschen FLEURS-Sätzen gemessen – auf unserem eigenen Produktions-Server. Wortfehlerrate, Geschwindigkeit und Kosten im Vergleich.
In unserem Artikel Whisper large-v3 vs. Turbo haben wir erklärt, was die beiden Modelle technisch trennt – und bewusst keine Fehlerraten genannt, weil Benchmark-Zahlen stark vom Testmaterial abhängen. Jetzt haben wir selbst gemessen: mit einem offenen deutschen Datensatz, auf genau dem Server, auf dem auch deine Transkriptionen bei Scriptivo laufen.
Das Ergebnis in Kürze
- Auf klar gesprochenem Deutsch liegen beide Modelle praktisch gleichauf. Die Wortfehlerrate (WER) lag bei rund 4 bis 5 %; der Unterschied zwischen den Modellen ist statistisch nicht signifikant.
- Bei 80 von 100 Sätzen machten beide Modelle gleich viele Fehler. Von den übrigen gewann large-v3 12, Turbo 8. Dafür ließ large-v3 in einem Satz eine ganze Passage aus.
- large-v3 brauchte rund 1,2-mal so viel Rechenzeit wie Turbo und war entsprechend teurer. Bei diesen kurzen Clips (im Schnitt 15 Sekunden) fällt der feste Overhead pro Auftrag stark ins Gewicht.
Die Zahlen
Gemessen haben wir zwei Einstellungen. Die erste ist die, mit der Scriptivo in Produktion arbeitet: Turbo im kostenlosen Tarif mit schnellerem Decoding (Beam-Größe 2), large-v3 in den bezahlten Tarifen mit gründlicherem Decoding (Beam-Größe 5). Die zweite gibt beiden Modellen identische Parameter – das ist der reine Modellvergleich.
So, wie Scriptivo transkribiert (Kostenlos vs. Pro)
| Modell | WER | 95 %-Konfidenzintervall | CER | Real-Time-Factor | GPU-Kosten pro Audiostunde |
|---|---|---|---|---|---|
| Whisper large-v3-turbo (Beam 2) | 4,31 % | 3,20 – 5,57 % | 1,14 % | 0,112 | 0,076 $ |
| Whisper large-v3 (Beam 5) | 5,04 % | 3,11 – 7,86 % | 2,28 % | 0,135 | 0,092 $ |
Beide Modelle mit identischen Parametern
| Modell | WER | 95 %-Konfidenzintervall | CER | Real-Time-Factor | GPU-Kosten pro Audiostunde |
|---|---|---|---|---|---|
| Whisper large-v3-turbo | 4,23 % | 3,13 – 5,47 % | 1,26 % | 0,086 | 0,059 $ |
| Whisper large-v3 | 4,23 % | 3,07 – 5,54 % | 1,56 % | 0,102 | 0,070 $ |
WER (Word Error Rate) ist der Anteil falscher, fehlender oder zusätzlicher Wörter im Vergleich zum Referenztext. CER ist dasselbe auf Zeichenebene. Der Real-Time-Factor gibt an, wie lange der Server im Verhältnis zur Audiolänge gerechnet hat: 0,112 bedeutet rund 6,7 Sekunden Rechenzeit pro Minute Audio. Die Kosten sind reine GPU-Kosten auf unserer Infrastruktur, nicht der Preis für dich.
Wie belastbar ist der Unterschied?
Die Konfidenzintervalle der beiden Modelle überlappen sich stark. Der direkte, gepaarte Vergleich auf denselben 100 Sätzen ergibt für die Produktionseinstellung eine Differenz von −0,73 Prozentpunkten zugunsten von Turbo, mit einem 95 %-Intervall von −3,18 bis +0,89 Prozentpunkten. Die Null liegt innerhalb dieses Intervalls – ein echter Unterschied lässt sich mit diesen Daten nicht nachweisen.
Ein Blick auf die einzelnen Sätze zeigt ein differenzierteres Bild:
- Bei 80 von 100 Sätzen machten beide Modelle exakt gleich viele Fehler.
- Bei 12 Sätzen war large-v3 besser, bei 8 Sätzen Turbo.
- large-v3 transkribierte 51 Sätze fehlerfrei, Turbo 49.
- Der Median der WER pro Satz lag bei large-v3 bei 0 %, bei Turbo bei 2,26 %.
Dass large-v3 im Durchschnitt trotzdem schlechter abschneidet, liegt vor allem an einem einzigen Satz: Einen 44 Wörter langen Satz gab large-v3 nur mit 17 Wörtern wieder – eine komplette Passage in der Mitte fehlte. Ohne diesen Satz kommt large-v3 in der Produktionseinstellung auf 3,92 % WER, Turbo auf 4,26 %. Genau dieses Muster ist typisch für Whisper: meistens sehr präzise, aber gelegentlich ein Aussetzer, der die Durchschnittswerte stark beeinflusst.
Wo sich die Modelle unterscheiden
Die Fehler, die übrig bleiben, sind selten grobe Verhörer. Typische Beispiele aus dem Test:
- Fremdwörter und Eigennamen: Die lateinischen Wörter „civis“ und „civitas“ schrieb Turbo als „zivis“ und „zivitas“, large-v3 traf die Originalschreibweise. Den Namen eines englischen Krankenhauses hörten beide Modelle falsch.
- Zusammen- oder Getrenntschreibung: „altgedienten“ vs. „alt gedienten“, „Internetradioseite“ vs. „Internetradio Seite“. Solche Unterschiede zählen in der WER als Fehler, stören beim Lesen aber kaum.
- Zahlen und Quellenangaben: Zitierangaben wie „(Larson und LaFasto, 1989, S. 109)“ gab Turbo in einem Fall nur unvollständig wieder.
Was das für dich bedeutet
Bei Scriptivo transkribiert der kostenlose Tarif mit Whisper Turbo, Pro und Business mit Whisper large-v3. Unser Benchmark zeigt:
- Für klare Aufnahmen reicht Turbo. Sprachmemos, Diktate, Vorträge mit gutem Mikrofon: Hier lieferten beide Modelle in unserem Test praktisch die gleiche Qualität.
- large-v3 punktet im Detail. In unserem Test hatte large-v3 mehr komplett fehlerfreie Sätze (Median-WER 0 % statt 2,26 %) und war bei 12 Sätzen besser, Turbo bei 8. Wenn es auf jedes Wort ankommt – Zitate für die Abschlussarbeit, Protokolle mit vielen Namen – ist das der sicherere Weg.
- Achte auf die Aufnahme. Der Abstand zwischen den Modellen war in unserem Test klein. Hall, Störgeräusche oder Durcheinanderreden wirken sich erfahrungsgemäß stärker aus als die Modellwahl. Tipps dazu findest du im Audio-Transkription Guide 2026.
Wichtig: Unser Test nutzt vorgelesene Sätze in guter Qualität. Bei Spontansprache, Dialekt, Meetings mit mehreren Personen oder Telefonaufnahmen sind die Fehlerraten beider Modelle höher – und der Abstand kann größer ausfallen, als er hier ist. Einen fairen Vergleich für dein Material bekommst du am einfachsten, indem du dieselbe Aufnahme in beiden Tarifen testest.
Selbst testen: Lade eine Aufnahme kostenlos hoch und sieh dir das Turbo-Ergebnis an. Mit Pro läuft dieselbe Datei automatisch mit large-v3.
Methodik
Datensatz. Google FLEURS, Sprache Deutsch (de_de), Test-Split. FLEURS enthält vorgelesene Sätze aus Wikipedia-Artikeln mit von Menschen erstellten Referenztranskripten. Wir haben die ersten 100 Aufnahmen im Archiv mit jeweils unterschiedlichem Satz ausgewählt – die Auswahl hing nur von der Reihenfolge im Archiv ab, nicht von den Ergebnissen. Insgesamt 24,9 Minuten Audio mit 2.342 Referenzwörtern.
System. Scriptivos Produktions-Worker auf RunPod Serverless (24-GB-GPU) mit faster-whisper. Jeder Satz wurde einzeln als Auftrag eingereicht, wie bei einer normalen Transkription.
Einstellungen.
- Produktion: Sprache Deutsch, Voice Activity Detection an, deutscher Start-Prompt für Interpunktion, Turbo mit Beam-Größe 2, large-v3 mit Beam-Größe 5.
- Identisch: Sprache Deutsch, Voice Activity Detection an, beide Modelle mit Beam-Größe 5 und ohne Prompt.
Normalisierung. Vor dem Vergleich haben wir Referenz und Transkript gleich behandelt: Kleinschreibung, Satzzeichen und Bindestriche entfernt, Leerzeichen vereinheitlicht. Zahlen blieben unverändert – „1990“ und „neunzehnhundertneunzig“ zählen als unterschiedlich. Groß-/Kleinschreibung und Kommasetzung fließen damit nicht in die Fehlerraten ein.
Statistik. WER und CER über alle Sätze zusammen (Summe der Fehler geteilt durch Summe der Referenzwörter). 95 %-Konfidenzintervalle per Bootstrap mit 10.000 Stichproben, für die Differenz gepaart über dieselben Sätze.
Geschwindigkeit und Kosten. Gemessen haben wir die abgerechnete Ausführungszeit auf dem Server – inklusive Download, Dekodierung und Stille-Erkennung. Bei den kurzen FLEURS-Sätzen macht dieser feste Anteil einen großen Teil aus. Bei langen Aufnahmen sinkt der Real-Time-Factor deutlich, und der Geschwindigkeitsvorteil von Turbo dürfte größer ausfallen. Die GPU-Kosten haben wir mit 0,00019 $ pro Sekunde berechnet. Alle 400 Aufträge zusammen kosteten rund 0,12 $.
Grenzen. 100 Sätze reichen, um große Unterschiede zu erkennen, aber nicht, um Abstände von unter einem Prozentpunkt sicher nachzuweisen. Vorgelesene Wikipedia-Sätze sind einfacher als echte Gespräche. Die Ergebnisse gelten für die hier beschriebenen Einstellungen und unsere Infrastruktur.
Häufige Fragen
Ist Whisper Turbo auf Deutsch schlechter als large-v3?
In unserem Test auf klar vorgelesenem Deutsch nicht messbar: Die Wortfehlerrate lag bei beiden Modellen um 4 bis 5 %, der Unterschied ist statistisch nicht signifikant. large-v3 transkribierte etwas mehr Sätze fehlerfrei und schrieb Fremdwörter öfter korrekt.
Wie schnell ist Turbo im Vergleich zu large-v3?
Auf unserem Server brauchte large-v3 bei kurzen Clips rund 1,2-mal so viel Rechenzeit wie Turbo. Bei langen Aufnahmen fällt der feste Overhead pro Auftrag weniger ins Gewicht, der Abstand dürfte dort größer sein. Das haben wir in diesem Benchmark aber nicht gemessen.
Welche Wortfehlerrate ist gut?
Für vorgelesenes, sauber aufgenommenes Deutsch sind Werte um 4 % sehr gut: Etwa jedes 25. Wort weicht vom Referenztext ab, oft nur in der Schreibweise. Bei Spontansprache und Meetings sind höhere Werte normal.
Kann ich die Messung nachvollziehen?
Ja. Wir haben einen offenen Datensatz (Google FLEURS, CC BY 4.0) genutzt und die Methodik oben vollständig beschrieben. Transkripte, Laufzeiten und die Auswertung liegen uns pro Satz vor.
Quelle und Lizenz
Datensatz: Google FLEURS – Conneau et al. (2022), FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech, arXiv:2205.12446. Lizenz: CC BY 4.0. Die Referenztexte stammen unverändert aus FLEURS; die Transkripte der Modelle und alle Kennzahlen sind eigene Messungen von Scriptivo vom 25. September 2026.