Zum Inhalt springen
Alle Beiträge
Anleitungen

'99 % genau' heißt nichts: Wie Sie eine Genauigkeitsangabe zur Transkription lesen, und wie Sie die Fehler finden, die wirklich zählen

Jeder Transkriptionsanbieter wirbt mit einer Genauigkeitsangabe, und keine zwei meinen dasselbe damit. So wird die Wortfehlerrate berechnet, was sie gleich gewichtet, obwohl Sie es nicht tun würden, und ein 20-Minuten-Test für die eigenen Aufnahmen.

Kalima Team10 Min. Lesezeit

Ein Anbieter, der mit 99 Prozent Genauigkeit wirbt, hat Ihnen fast nichts gesagt. Die Zahl ist eine von 100 abgezogene Wortfehlerrate, und eine Wortfehlerrate sagt erst dann etwas aus, wenn Sie zusätzlich wissen, an welchem Material sie gemessen wurde, wie der Text vor dem Vergleich normalisiert wurde, und wer gesprochen hat. Ändern Sie einen dieser drei Punkte, erreicht dieselbe Engine 5 Prozent oder 17 Prozent. Es folgt, wie die Kennzahl funktioniert, welche Fehler sie verbirgt, und ein Test, den Sie in zwanzig Minuten an Ihrer eigenen schlechtesten Aufnahme durchführen können.

Wie die Wortfehlerrate berechnet wird

Nehmen Sie ein Referenztranskript, also das, was tatsächlich gesagt wurde, von einem Menschen aufgeschrieben. Gleichen Sie die maschinelle Ausgabe Wort für Wort damit ab und zählen Sie drei Arten von Abweichung: Ersetzungen (ein Wort kam als ein anderes Wort heraus), Auslassungen (ein Wort fehlt) und Einfügungen (ein Wort erscheint, das niemand gesagt hat). Die Wortfehlerrate ist deren Summe geteilt durch die Anzahl der Wörter im Referenztext, geschrieben als WER = (S + D + I) / N (Wikipedia, Word error rate, abgerufen September 2026). „99 Prozent genau“ ist nur eine andere Schreibweise für „1 Prozent WER“. Aus dieser Rechnung folgen zwei Dinge, die auf keiner Marketingseite stehen. Die WER kann über 100 Prozent liegen, weil Einfügungen nicht durch die Länge des Referenztextes gedeckelt sind. Und jeder Fehler zählt exakt gleich viel: Ein verschlucktes „ähm“ kostet genauso viel wie ein verschlucktes „nicht“.

Genau dieser zweite Punkt ist das ganze Problem. Ein Satz aus einer Budgetbesprechung:

Referenz: „wir werden die zweite Tranche in diesem Quartal nicht freigeben“ Ausgabe: „wir werden die zweite Tranche in diesem Quartal freigeben“

Eine Auslassung in zehn Wörtern: eine WER von 10 Prozent, was nach einem guten Ergebnis aussieht, und ein Satz, der jetzt das Gegenteil dessen sagt, was im Raum gesagt wurde.

Drei Dinge, die eine Prozentzahl braucht, bevor sie als Aussage zählt

Ein benannter Datensatz

Picovoice liefert dafür die klarste Illustration, über die eigene Engine: Man könnte legitim mit einer WER von 5,39 Prozent werben, während dieselbe Engine „could be 9 %, 12 % or 17 % based on the dataset“ (Picovoice, Things to know about word error rate, abgerufen September 2026). Nichts wurde zwischen diesen Zahlen verändert. Nur der Ton war ein anderer.

Googles Dokumentation zu Speech-to-Text rät Kundinnen und Kunden, selbst zu messen: eine „representative sample of audio files“ zu sammeln, zufällig und „as close to the target environment as possible“, und zwischen 30 Minuten und 3 Stunden davon aufzunehmen (Google Cloud, Speech-to-Text accuracy, abgerufen September 2026). Der größte Anbieter der Kategorie rät also, veröffentlichte Benchmarks zu ignorieren, auch die eigenen.

Ein Normalisierungsschema

Vor jeder Zählung werden beide Transkripte normalisiert: Satzzeichen entfernt, alles kleingeschrieben, und ein Skript entscheidet, welche Schreibweisen als dasselbe Wort zählen. AssemblyAI merkt an, dass Standard-Normalisierer „don't“ und „do not“ gleichsetzen, aber nicht „healthcare“ und „health care“, ein Modell mit besserer Formatierung kann also schlechter abschneiden (AssemblyAI, Word error rate is broken, abgerufen September 2026). Zahlen und Geldbeträge sind dieselbe Falle: „achtzehn“, „18“ und „18,00“ sind je nach Skript ein Wort oder zwei. Ein wesentlicher Teil jeder veröffentlichten Zahl entscheidet sich, bevor ein einziges Wort erkannt wird.

Eine Sprecherzusammensetzung

Speechmatics merkt an, dass ein sauberer Testdatensatz kaum existiert, weil „it is very difficult to get a test set that has no mistakes from human transcribers“, und zeigt ein Transkript mit 125 Prozent WER, das fast korrekt liest, neben einem mit 20 Prozent WER und einem bedeutungsverändernden Fehler (Speechmatics, The problem with word error rate, abgerufen September 2026). Apples Forschungsgruppe hat aus demselben Grund eine alternative Kennzahl entwickelt: In der eigenen Stichprobe lag die WER im Schnitt bei 9,2 Prozent, während die menschlich gewichtete Version, die nur Fehler zählt, die den Sinn verändern, die Lesbarkeit stören oder einen Eigennamen falsch schreiben, bei 1,4 Prozent lag (Apple, Humanizing word error rate, abgerufen September 2026).

Fragen an jede Anbieterzahl:

Was die Angabe sagtWas Sie fragen sollten
„99 % genau“Auf welchem Datensatz, wo veröffentlicht, wie aufgenommen?
„Branchenführende WER“Gegen welche Wettbewerber, gemessen von wem, wann?
„Getestet an echtem Audio“Wie viele Sprecher, welche Akzente, wie viel Überlappung?
Eine Zahl für alle SprachenWie lautet die Zahl für die Sprache, in der Sie aufnehmen?
Keine Normalisierung erwähntWelcher Normalisierer, und behandelt er Zahlen und Komposita?

Ein Anbieter, der vier dieser fünf Fragen nicht beantworten kann, verkauft Dekoration.

Die Fehler, die etwas kosten, und die, die es nicht tun

Nach Schaden statt nach Anzahl gewichtet, ist die Liste kurz.

  • Zahlen. Der in der Praxis am häufigsten gemeldete Fehler. Aus einer Diskussion über KI-Notizwerkzeuge im Rechtswesen: „the person said 8 to 10, LLM transcribed as 18 ... But the AI isn't smart enough, and then 18 goes into the record“ (Hacker News, 11. Mai 2026). Beide Lesarten sind grammatisch korrekt, nachgelagert fällt also nichts auf.
  • Namen und Fachvokabular. Ein Nachname, den das Modell nie gesehen hat, wird zum nächstliegenden gängigen Wort, ebenso Medikamentennamen, Aktenzeichen, Teilenummern und Codenamen. AssemblyAIs Beispiel ist „lisinopril“, das als „listening a pill“ ankommt, was die WER genauso zählt wie „gonna“ statt „going to“.
  • Verneinungen. „Nicht“, „nie“, „nicht mehr“ und verschluckte Formen in schneller Sprache. Ein ausgelassenes Wort, eine umgekehrte Bedeutung.
  • Überlappende Sprache. Zwei Personen gleichzeitig ist die schwierigste Eingabe für jede Engine. Wörter fallen weg und werden zugleich der falschen Person zugeordnet.
  • Lange Stille und Nicht-Sprach-Audio. Ein eigener Fehlermodus, und ein seltsamerer.

Wenn das Transkript einen Satz enthält, den niemand gesagt hat

Manchmal ist die Ausgabe kein verhörtes Wort, sondern ein flüssiger, plausibler Satz, den niemand gesprochen hat, meist in einem Abschnitt, in dem niemand redete, oder über Musik, Husten oder einer langen Pause.

Der Mechanismus liegt in der Bauweise großer Sprachmodelle, nicht in einem Defekt eines bestimmten Produkts. Sie werden auf sehr großen Sammlungen aus Ton und Text trainiert, und in diesen Trainingsdaten ist der Text nicht immer eine originalgetreue Wiedergabe des Tons. Das Modell lernt, dass auf manche Abschnitte ohne Sprache trotzdem Text folgt, und erzeugt bei der Anwendung Text dafür. Forschende haben das gezielt reproduziert, indem sie einem verbreiteten offenen Modell Nicht-Sprach-Töne vorgespielt haben, und wiederkehrende Muster in der Ausgabe dokumentiert (Investigation of Whisper ASR hallucinations induced by non-speech audio, arXiv 2501.11378, Januar 2025).

Das gemessene Ausmaß ist klein und ungleich verteilt. In einer Analyse von 13.140 Audio-Beispielen enthielten rund 1 Prozent der Transkriptionen eine Halluzination, davon fast 40 Prozent aktiv schädlich: erfundene Verweise auf Gewalt, falsche Namen und Gesundheitsangaben, oder erfundene, autoritativ klingende Aussagen. Sie traten deutlich häufiger bei Sprechenden mit längeren Sprechpausen auf, wer also zögert, pausiert oder eine Sprachbehinderung hat, trifft es am härtesten (Montreal AI Ethics Institute, Careless Whisper, abgerufen September 2026).

Ein Prozent klingt harmlos, bis auffällt, dass ein erfundener Satz für jede Prüfung unsichtbar ist, die nur den Text liest. Er ist grammatisch korrekt, passt zum Thema, und trägt keine Markierung geringer Konfidenz. Der einzige verlässliche Detektor ist der Ton.

Testen Sie es selbst, in etwa zwanzig Minuten

Das ergibt keinen veröffentlichungsfähigen Benchmark, dafür sind Googles 30 Minuten bis 3 Stunden die richtige Stichprobe. Es ergibt eine Entscheidung, die Sie vertreten können.

1
Wählen Sie zehn Minuten Ihrer schlechtesten echten Aufnahme. Nicht die saubere Solo-Diktion: das Vier-Personen-Gespräch mit jemandem auf Lautsprecher, das Raumrauschen, die Akzente, der Fachjargon. Ist nichts schlecht genug, nehmen Sie ein normales Meeting auf.
2
Schreiben Sie den Referenztext von Hand. Spielen Sie mit 0,75-facher Geschwindigkeit ab und tippen Sie, was gesagt wurde, Versprecher eingeschlossen. Das ist der langsame Teil, und der Teil, den niemand überspringt und trotzdem eine echte Antwort bekommt.
3
Lassen Sie dieselbe Datei durch jeden Kandidaten laufen. Derselbe Ton, keine Feinabstimmung für den einen und nicht für den anderen.
4
Zählen Sie die drei Fehlertypen. Ersetzungen, Einfügungen, Auslassungen, geteilt durch die Wortzahl Ihres Referenztexts. Das ist Ihre WER, auf Ihrem Ton.
5
Zählen Sie jetzt noch einmal, anders. Nur Fehler, die Sie etwas kosten: eine falsche Zahl, ein falscher Name, eine fehlende Verneinung, ein verstümmelter Produkt- oder Medikamentenname, eine Zeile bei der falschen Person, ein Satz, den niemand gesagt hat. Diese zweite Zahl ist die, nach der Sie kaufen sollten.

Behalten Sie beide Spalten, denn sie werden nicht übereinstimmen, und genau diese Abweichung ist der Befund:

EngineWER auf Ihrem TonTeure Fehler in 10 MinutenSchlimmster Einzelfehler
A6 %1Nachname des Kunden
B9 %0Zusätzliche Füllwörter

Engine B verliert bei der Kennzahl und gewinnt den Auftrag, was häufig genug vorkommt, um diesen Artikel zu rechtfertigen.

Sitzen andere Personen mit im Gespräch, sagen Sie ihnen, dass Sie mitschreiben, und prüfen Sie, was Ihr Landesrecht und die Bedingungen des Meeting-Tools verlangen. In Deutschland schützt § 201 StGB das gesprochene Wort, die Zustimmung aller Anwesenden ist der sichere Weg. Auch eine Testaufnahme ist eine Aufnahme.

Kalimas kostenloser Tarif deckt diesen Test ohne Kreditkarte ab: zwei Stunden Transkription pro Woche, 45-Minuten-Sitzungen, Uploads bis 50 MB und 30 Minuten je Datei (Preise).

Fehler in einem bereits vorliegenden Transkript finden

Was die Zahl auch sagt, Fehler bleiben, die Frage ist also, wie schnell Sie sie finden.

Behandeln Sie den Ton als das Dokument, nicht den Text. In Kalimas Studio springt ein Klick auf ein Wort im Transkript zu dem Moment, in dem es gesprochen wurde, mit hervorgehobenem aktuellem Wort während der Wiedergabe. Eine verdächtige Zahl zu prüfen ist ein Klick statt einer Suche in der Wellenform, und die Wiedergabe verlangsamt sich dort, wo es zählt, auf 0,25-fache Geschwindigkeit. Siehe Wiedergabe und Karaoke.

Lesen Sie die Abschnitte, in denen die sprechende Person nicht wechselt. Ein langer Block, der einer Person zugeordnet ist, ohne Zwischenrufe, ist der Ort, an dem sich ein erfundener Satz versteckt, ebenso jeder Abschnitt um eine Gesprächspause herum.

Prüfen Sie die blassen Wörter. Kalima stellt Wörter mit geringerer Konfidenz blasser dar, eine Landkarte, wo zuerst nachzusehen ist. Das ist kein Halluzinationsdetektor, denn ein erfundener Satz kann mit voller Konfidenz ankommen, findet aber verhörte Namen schnell.

Zwei Einstellungen senken die Fehlerzahl, bevor überhaupt aufgenommen wird.

Sitzungskontext und erwartete Sprachen. Eine kurze Beschreibung des Meetings plus Namen, Abkürzungen und Fachbegriffe, die Sie erwarten, lenkt die Erkennung dorthin. Das Beschreibungsfeld fasst bis zu 2.000 Zeichen, eine Kontextvorlage lässt sich wiederverwenden oder als Projektstandard setzen. Sprachhinweise lenken, statt festzulegen: Englisch und Spanisch anzugeben schließt einen deutschen Satz nicht aus. Siehe Genauigkeit mit Kontext verbessern.

Realtime oder Post-Process+. Kalima nimmt in zwei Modi auf, bei gleicher Transkriptionszeit. Realtime zeigt Text, während gesprochen wird, was für Live-Untertitel, Live-Übersetzung oder mitlesende Zuschauer nötig ist. Post-Process+ zeichnet zuerst auf und liefert das Transkript einige Minuten nach dem Stoppen, mit der höchsten Genauigkeit und der besten Sprechertrennung, weil die Engine die gesamte Aufnahme sieht statt eines Streams. Eine Grenze: Eine laufende Post-Process+-Aufnahme kann einmal zu Realtime wechseln, eine Realtime-Aufnahme lässt sich danach nicht zu Post-Process+ nachbearbeiten. Siehe Aufnahmemodi.

Seien Sie klar darüber, was sich heute im Nachhinein korrigieren lässt. Sie können Sprechernamen umbenennen, sodass echte Namen in jeden Export übernommen werden, und Stimmen prüfen ausführen, das auf Ihrem eigenen Gerät erneut zuhört (ein 38 MB großes Sprachmodell lädt einmal herunter und bleibt dort, kein Ton verlässt das Gerät, etwa 40 Sekunden je Stunde) und falsch zugeordnete Abschnitte neu zuweisen lässt. Wortgenaue Textkorrektur, die Kalima AutoCorrect+ nennt, ist noch in Entwicklung und auf der Preisseite als kommend markiert. Bis es erscheint, ist der beste Weg gegen einen wiederkehrend falsch verstandenen Fachbegriff der Sitzungskontext vor der nächsten Aufnahme.

Warum Kalima keine Genauigkeitszahl veröffentlicht

Wir setzen aus jedem oben genannten Grund keine Zahl darauf. Jede Zahl, die wir veröffentlichen würden, wäre an Ton gemessen, den wir ausgesucht haben, normalisiert mit einem Skript, das wir geschrieben haben, an einer Sprecherzusammensetzung, die wir gewählt haben. Sie wäre wahr, und für Sie nutzlos, weil Ihr Ton ein Vier-Personen-Gespräch mit jemandem am Laptop-Mikrofon in einem Raum mit Lüfter ist.

Was wir tun können, ist unsere Transkripte prüfbar zu machen: Ton bleibt neben dem Text erhalten, jedes Wort klickbar zurück zu seinem Moment, Konfidenz sichtbar, Sprecherzuordnung auf dem eigenen Gerät überprüfbar, und ein kostenloser Tarif groß genug, um den obigen Test gegen uns und gegen jeden anderen laufen zu lassen. Unsere Vergleichsseiten sind aus demselben Grund an Funktionen und Grenzen geschrieben, nicht an einem Benchmark.

Häufige Fragen

Sind 95 Prozent Genauigkeit gut für Transkription?

So gestellt lässt sich das nicht beantworten, und genau das ist der Punkt. 95 Prozent bedeuten eine WER von 5 Prozent auf irgendeinem Datensatz, unter irgendeinem Normalisierungsschema, mit irgendeiner Sprecherzusammensetzung, keine davon offengelegt. Auf sauberem Studioton sind 5 Prozent mittelmäßig. Auf einem Vier-Personen-Gespräch mit Überlappungen und Akzenten können sie sehr gut sein.

Warum ist mein Meeting-Transkript falsch, obwohl der Anbieter 99 Prozent verspricht?

Fast sicher, weil Ihr Ton nichts mit dessen Testdatensatz zu tun hat. Abstand zum Mikrofon, Raumhall, ein Bluetooth-Headset, zwei Personen gleichzeitig und Fachvokabular kosten jeweils mehr Genauigkeit als jeder Unterschied zwischen Engines. Die Eingabe zu verbessern hilft mehr als der Wechsel des Anbieters.

Kann ein KI-Transkript Wörter erfinden, die nie gesagt wurden?

Ja, und das ist dokumentiert. Große Sprachmodelle können für einen Tonabschnitt ohne Sprache einen flüssigen, plausiblen Satz ausgeben, meistens über Stille, Musik oder Rauschen. Eine Analyse von 13.140 Beispielen fand es in rund 1 Prozent der Transkriptionen, häufiger bei Sprechenden, die viel pausieren. Das liegt an dieser Modellklasse, nicht an einem Produkt, und der Weg, es zu finden, ist Zuhören.

Wie prüfe ich ein Meeting-Transkript, ohne alles anzuhören?

Prüfen Sie, was etwas kostet, statt linear zu lesen: jede Zahl, jeder Eigenname, jede Verneinung in einem Satz, der jemanden festlegt, und jeder lange Block ohne Sprecherwechsel. Lässt sich ein Wort anklicken, um zu diesem Moment im Ton zu springen, dauert jede Prüfung Sekunden statt Minuten.

Weiterführend

Testen Sie Kalima in Ihrem nächsten Gespräch.

Live-Transkription und Übersetzung, ohne Bot im Meeting. Kostenlos starten.

Kostenlos starten

Weiter lesen.