'99 % genau' heißt nichts: Wie Sie eine Genauigkeitsangabe zur Transkription lesen, und wie Sie die Fehler finden, die wirklich zählen
Jeder Transkriptionsanbieter wirbt mit einer Genauigkeitsangabe, und keine zwei meinen dasselbe damit. So wird die Wortfehlerrate berechnet, was sie gleich gewichtet, obwohl Sie es nicht tun würden, und ein 20-Minuten-Test für die eigenen Aufnahmen.
Ein Anbieter, der mit 99 Prozent Genauigkeit wirbt, hat Ihnen fast nichts gesagt. Die Zahl ist eine von 100 abgezogene Wortfehlerrate, und eine Wortfehlerrate sagt erst dann etwas aus, wenn Sie zusätzlich wissen, an welchem Material sie gemessen wurde, wie der Text vor dem Vergleich normalisiert wurde, und wer gesprochen hat. Ändern Sie einen dieser drei Punkte, erreicht dieselbe Engine 5 Prozent oder 17 Prozent. Es folgt, wie die Kennzahl funktioniert, welche Fehler sie verbirgt, und ein Test, den Sie in zwanzig Minuten an Ihrer eigenen schlechtesten Aufnahme durchführen können.
Wie die Wortfehlerrate berechnet wird
Nehmen Sie ein Referenztranskript, also das, was tatsächlich gesagt wurde, von einem Menschen aufgeschrieben. Gleichen Sie die maschinelle Ausgabe Wort für Wort damit ab und zählen Sie drei Arten von Abweichung: Ersetzungen (ein Wort kam als ein anderes Wort heraus), Auslassungen (ein Wort fehlt) und Einfügungen (ein Wort erscheint, das niemand gesagt hat). Die Wortfehlerrate ist deren Summe geteilt durch die Anzahl der Wörter im Referenztext, geschrieben als WER = (S + D + I) / N (Wikipedia, Word error rate, abgerufen September 2026). „99 Prozent genau“ ist nur eine andere Schreibweise für „1 Prozent WER“. Aus dieser Rechnung folgen zwei Dinge, die auf keiner Marketingseite stehen. Die WER kann über 100 Prozent liegen, weil Einfügungen nicht durch die Länge des Referenztextes gedeckelt sind. Und jeder Fehler zählt exakt gleich viel: Ein verschlucktes „ähm“ kostet genauso viel wie ein verschlucktes „nicht“.
Genau dieser zweite Punkt ist das ganze Problem. Ein Satz aus einer Budgetbesprechung:
Referenz: „wir werden die zweite Tranche in diesem Quartal nicht freigeben“ Ausgabe: „wir werden die zweite Tranche in diesem Quartal freigeben“
Eine Auslassung in zehn Wörtern: eine WER von 10 Prozent, was nach einem guten Ergebnis aussieht, und ein Satz, der jetzt das Gegenteil dessen sagt, was im Raum gesagt wurde.
Drei Dinge, die eine Prozentzahl braucht, bevor sie als Aussage zählt
Ein benannter Datensatz
Picovoice liefert dafür die klarste Illustration, über die eigene Engine: Man könnte legitim mit einer WER von 5,39 Prozent werben, während dieselbe Engine „could be 9 %, 12 % or 17 % based on the dataset“ (Picovoice, Things to know about word error rate, abgerufen September 2026). Nichts wurde zwischen diesen Zahlen verändert. Nur der Ton war ein anderer.
Googles Dokumentation zu Speech-to-Text rät Kundinnen und Kunden, selbst zu messen: eine „representative sample of audio files“ zu sammeln, zufällig und „as close to the target environment as possible“, und zwischen 30 Minuten und 3 Stunden davon aufzunehmen (Google Cloud, Speech-to-Text accuracy, abgerufen September 2026). Der größte Anbieter der Kategorie rät also, veröffentlichte Benchmarks zu ignorieren, auch die eigenen.
Ein Normalisierungsschema
Vor jeder Zählung werden beide Transkripte normalisiert: Satzzeichen entfernt, alles kleingeschrieben, und ein Skript entscheidet, welche Schreibweisen als dasselbe Wort zählen. AssemblyAI merkt an, dass Standard-Normalisierer „don't“ und „do not“ gleichsetzen, aber nicht „healthcare“ und „health care“, ein Modell mit besserer Formatierung kann also schlechter abschneiden (AssemblyAI, Word error rate is broken, abgerufen September 2026). Zahlen und Geldbeträge sind dieselbe Falle: „achtzehn“, „18“ und „18,00“ sind je nach Skript ein Wort oder zwei. Ein wesentlicher Teil jeder veröffentlichten Zahl entscheidet sich, bevor ein einziges Wort erkannt wird.
Eine Sprecherzusammensetzung
Speechmatics merkt an, dass ein sauberer Testdatensatz kaum existiert, weil „it is very difficult to get a test set that has no mistakes from human transcribers“, und zeigt ein Transkript mit 125 Prozent WER, das fast korrekt liest, neben einem mit 20 Prozent WER und einem bedeutungsverändernden Fehler (Speechmatics, The problem with word error rate, abgerufen September 2026). Apples Forschungsgruppe hat aus demselben Grund eine alternative Kennzahl entwickelt: In der eigenen Stichprobe lag die WER im Schnitt bei 9,2 Prozent, während die menschlich gewichtete Version, die nur Fehler zählt, die den Sinn verändern, die Lesbarkeit stören oder einen Eigennamen falsch schreiben, bei 1,4 Prozent lag (Apple, Humanizing word error rate, abgerufen September 2026).
Fragen an jede Anbieterzahl:
| Was die Angabe sagt | Was Sie fragen sollten |
|---|---|
| „99 % genau“ | Auf welchem Datensatz, wo veröffentlicht, wie aufgenommen? |
| „Branchenführende WER“ | Gegen welche Wettbewerber, gemessen von wem, wann? |
| „Getestet an echtem Audio“ | Wie viele Sprecher, welche Akzente, wie viel Überlappung? |
| Eine Zahl für alle Sprachen | Wie lautet die Zahl für die Sprache, in der Sie aufnehmen? |
| Keine Normalisierung erwähnt | Welcher Normalisierer, und behandelt er Zahlen und Komposita? |
Ein Anbieter, der vier dieser fünf Fragen nicht beantworten kann, verkauft Dekoration.
Die Fehler, die etwas kosten, und die, die es nicht tun
Nach Schaden statt nach Anzahl gewichtet, ist die Liste kurz.
- Zahlen. Der in der Praxis am häufigsten gemeldete Fehler. Aus einer Diskussion über KI-Notizwerkzeuge im Rechtswesen: „the person said 8 to 10, LLM transcribed as 18 ... But the AI isn't smart enough, and then 18 goes into the record“ (Hacker News, 11. Mai 2026). Beide Lesarten sind grammatisch korrekt, nachgelagert fällt also nichts auf.
- Namen und Fachvokabular. Ein Nachname, den das Modell nie gesehen hat, wird zum nächstliegenden gängigen Wort, ebenso Medikamentennamen, Aktenzeichen, Teilenummern und Codenamen. AssemblyAIs Beispiel ist „lisinopril“, das als „listening a pill“ ankommt, was die WER genauso zählt wie „gonna“ statt „going to“.
- Verneinungen. „Nicht“, „nie“, „nicht mehr“ und verschluckte Formen in schneller Sprache. Ein ausgelassenes Wort, eine umgekehrte Bedeutung.
- Überlappende Sprache. Zwei Personen gleichzeitig ist die schwierigste Eingabe für jede Engine. Wörter fallen weg und werden zugleich der falschen Person zugeordnet.
- Lange Stille und Nicht-Sprach-Audio. Ein eigener Fehlermodus, und ein seltsamerer.
Wenn das Transkript einen Satz enthält, den niemand gesagt hat
Manchmal ist die Ausgabe kein verhörtes Wort, sondern ein flüssiger, plausibler Satz, den niemand gesprochen hat, meist in einem Abschnitt, in dem niemand redete, oder über Musik, Husten oder einer langen Pause.
Der Mechanismus liegt in der Bauweise großer Sprachmodelle, nicht in einem Defekt eines bestimmten Produkts. Sie werden auf sehr großen Sammlungen aus Ton und Text trainiert, und in diesen Trainingsdaten ist der Text nicht immer eine originalgetreue Wiedergabe des Tons. Das Modell lernt, dass auf manche Abschnitte ohne Sprache trotzdem Text folgt, und erzeugt bei der Anwendung Text dafür. Forschende haben das gezielt reproduziert, indem sie einem verbreiteten offenen Modell Nicht-Sprach-Töne vorgespielt haben, und wiederkehrende Muster in der Ausgabe dokumentiert (Investigation of Whisper ASR hallucinations induced by non-speech audio, arXiv 2501.11378, Januar 2025).
Das gemessene Ausmaß ist klein und ungleich verteilt. In einer Analyse von 13.140 Audio-Beispielen enthielten rund 1 Prozent der Transkriptionen eine Halluzination, davon fast 40 Prozent aktiv schädlich: erfundene Verweise auf Gewalt, falsche Namen und Gesundheitsangaben, oder erfundene, autoritativ klingende Aussagen. Sie traten deutlich häufiger bei Sprechenden mit längeren Sprechpausen auf, wer also zögert, pausiert oder eine Sprachbehinderung hat, trifft es am härtesten (Montreal AI Ethics Institute, Careless Whisper, abgerufen September 2026).
Ein Prozent klingt harmlos, bis auffällt, dass ein erfundener Satz für jede Prüfung unsichtbar ist, die nur den Text liest. Er ist grammatisch korrekt, passt zum Thema, und trägt keine Markierung geringer Konfidenz. Der einzige verlässliche Detektor ist der Ton.
Testen Sie es selbst, in etwa zwanzig Minuten
Das ergibt keinen veröffentlichungsfähigen Benchmark, dafür sind Googles 30 Minuten bis 3 Stunden die richtige Stichprobe. Es ergibt eine Entscheidung, die Sie vertreten können.
Behalten Sie beide Spalten, denn sie werden nicht übereinstimmen, und genau diese Abweichung ist der Befund:
| Engine | WER auf Ihrem Ton | Teure Fehler in 10 Minuten | Schlimmster Einzelfehler |
|---|---|---|---|
| A | 6 % | 1 | Nachname des Kunden |
| B | 9 % | 0 | Zusätzliche Füllwörter |
Engine B verliert bei der Kennzahl und gewinnt den Auftrag, was häufig genug vorkommt, um diesen Artikel zu rechtfertigen.
Sitzen andere Personen mit im Gespräch, sagen Sie ihnen, dass Sie mitschreiben, und prüfen Sie, was Ihr Landesrecht und die Bedingungen des Meeting-Tools verlangen. In Deutschland schützt § 201 StGB das gesprochene Wort, die Zustimmung aller Anwesenden ist der sichere Weg. Auch eine Testaufnahme ist eine Aufnahme.
Kalimas kostenloser Tarif deckt diesen Test ohne Kreditkarte ab: zwei Stunden Transkription pro Woche, 45-Minuten-Sitzungen, Uploads bis 50 MB und 30 Minuten je Datei (Preise).
Fehler in einem bereits vorliegenden Transkript finden
Was die Zahl auch sagt, Fehler bleiben, die Frage ist also, wie schnell Sie sie finden.
Behandeln Sie den Ton als das Dokument, nicht den Text. In Kalimas Studio springt ein Klick auf ein Wort im Transkript zu dem Moment, in dem es gesprochen wurde, mit hervorgehobenem aktuellem Wort während der Wiedergabe. Eine verdächtige Zahl zu prüfen ist ein Klick statt einer Suche in der Wellenform, und die Wiedergabe verlangsamt sich dort, wo es zählt, auf 0,25-fache Geschwindigkeit. Siehe Wiedergabe und Karaoke.
Lesen Sie die Abschnitte, in denen die sprechende Person nicht wechselt. Ein langer Block, der einer Person zugeordnet ist, ohne Zwischenrufe, ist der Ort, an dem sich ein erfundener Satz versteckt, ebenso jeder Abschnitt um eine Gesprächspause herum.
Prüfen Sie die blassen Wörter. Kalima stellt Wörter mit geringerer Konfidenz blasser dar, eine Landkarte, wo zuerst nachzusehen ist. Das ist kein Halluzinationsdetektor, denn ein erfundener Satz kann mit voller Konfidenz ankommen, findet aber verhörte Namen schnell.
Zwei Einstellungen senken die Fehlerzahl, bevor überhaupt aufgenommen wird.
Sitzungskontext und erwartete Sprachen. Eine kurze Beschreibung des Meetings plus Namen, Abkürzungen und Fachbegriffe, die Sie erwarten, lenkt die Erkennung dorthin. Das Beschreibungsfeld fasst bis zu 2.000 Zeichen, eine Kontextvorlage lässt sich wiederverwenden oder als Projektstandard setzen. Sprachhinweise lenken, statt festzulegen: Englisch und Spanisch anzugeben schließt einen deutschen Satz nicht aus. Siehe Genauigkeit mit Kontext verbessern.
Realtime oder Post-Process+. Kalima nimmt in zwei Modi auf, bei gleicher Transkriptionszeit. Realtime zeigt Text, während gesprochen wird, was für Live-Untertitel, Live-Übersetzung oder mitlesende Zuschauer nötig ist. Post-Process+ zeichnet zuerst auf und liefert das Transkript einige Minuten nach dem Stoppen, mit der höchsten Genauigkeit und der besten Sprechertrennung, weil die Engine die gesamte Aufnahme sieht statt eines Streams. Eine Grenze: Eine laufende Post-Process+-Aufnahme kann einmal zu Realtime wechseln, eine Realtime-Aufnahme lässt sich danach nicht zu Post-Process+ nachbearbeiten. Siehe Aufnahmemodi.
Seien Sie klar darüber, was sich heute im Nachhinein korrigieren lässt. Sie können Sprechernamen umbenennen, sodass echte Namen in jeden Export übernommen werden, und Stimmen prüfen ausführen, das auf Ihrem eigenen Gerät erneut zuhört (ein 38 MB großes Sprachmodell lädt einmal herunter und bleibt dort, kein Ton verlässt das Gerät, etwa 40 Sekunden je Stunde) und falsch zugeordnete Abschnitte neu zuweisen lässt. Wortgenaue Textkorrektur, die Kalima AutoCorrect+ nennt, ist noch in Entwicklung und auf der Preisseite als kommend markiert. Bis es erscheint, ist der beste Weg gegen einen wiederkehrend falsch verstandenen Fachbegriff der Sitzungskontext vor der nächsten Aufnahme.
Warum Kalima keine Genauigkeitszahl veröffentlicht
Wir setzen aus jedem oben genannten Grund keine Zahl darauf. Jede Zahl, die wir veröffentlichen würden, wäre an Ton gemessen, den wir ausgesucht haben, normalisiert mit einem Skript, das wir geschrieben haben, an einer Sprecherzusammensetzung, die wir gewählt haben. Sie wäre wahr, und für Sie nutzlos, weil Ihr Ton ein Vier-Personen-Gespräch mit jemandem am Laptop-Mikrofon in einem Raum mit Lüfter ist.
Was wir tun können, ist unsere Transkripte prüfbar zu machen: Ton bleibt neben dem Text erhalten, jedes Wort klickbar zurück zu seinem Moment, Konfidenz sichtbar, Sprecherzuordnung auf dem eigenen Gerät überprüfbar, und ein kostenloser Tarif groß genug, um den obigen Test gegen uns und gegen jeden anderen laufen zu lassen. Unsere Vergleichsseiten sind aus demselben Grund an Funktionen und Grenzen geschrieben, nicht an einem Benchmark.
Häufige Fragen
Sind 95 Prozent Genauigkeit gut für Transkription?
So gestellt lässt sich das nicht beantworten, und genau das ist der Punkt. 95 Prozent bedeuten eine WER von 5 Prozent auf irgendeinem Datensatz, unter irgendeinem Normalisierungsschema, mit irgendeiner Sprecherzusammensetzung, keine davon offengelegt. Auf sauberem Studioton sind 5 Prozent mittelmäßig. Auf einem Vier-Personen-Gespräch mit Überlappungen und Akzenten können sie sehr gut sein.
Warum ist mein Meeting-Transkript falsch, obwohl der Anbieter 99 Prozent verspricht?
Fast sicher, weil Ihr Ton nichts mit dessen Testdatensatz zu tun hat. Abstand zum Mikrofon, Raumhall, ein Bluetooth-Headset, zwei Personen gleichzeitig und Fachvokabular kosten jeweils mehr Genauigkeit als jeder Unterschied zwischen Engines. Die Eingabe zu verbessern hilft mehr als der Wechsel des Anbieters.
Kann ein KI-Transkript Wörter erfinden, die nie gesagt wurden?
Ja, und das ist dokumentiert. Große Sprachmodelle können für einen Tonabschnitt ohne Sprache einen flüssigen, plausiblen Satz ausgeben, meistens über Stille, Musik oder Rauschen. Eine Analyse von 13.140 Beispielen fand es in rund 1 Prozent der Transkriptionen, häufiger bei Sprechenden, die viel pausieren. Das liegt an dieser Modellklasse, nicht an einem Produkt, und der Weg, es zu finden, ist Zuhören.
Wie prüfe ich ein Meeting-Transkript, ohne alles anzuhören?
Prüfen Sie, was etwas kostet, statt linear zu lesen: jede Zahl, jeder Eigenname, jede Verneinung in einem Satz, der jemanden festlegt, und jeder lange Block ohne Sprecherwechsel. Lässt sich ein Wort anklicken, um zu diesem Moment im Ton zu springen, dauert jede Prüfung Sekunden statt Minuten.
Weiterführend
Testen Sie Kalima in Ihrem nächsten Gespräch.
Live-Transkription und Übersetzung, ohne Bot im Meeting. Kostenlos starten.
Weiter lesen.

Der KI-Notizbot ist gesperrt. Was Sie jetzt tun dürfen und was nicht
Eine gesperrte Sperre ist entweder eine abgeschaltete Transkriptionsrichtlinie, eine Lobby, die einen Bot abgewiesen hat, oder ein Netzwerk, das den Dienst selbst blockiert. Nur eine davon betrifft etwas, das dem Meeting beitritt, und nur eine ist eine Frage, die Sie beantworten können, ohne vorher jemanden zu fragen.

Bewerbungsgespräch aufzeichnen und transkribieren: was in Deutschland erlaubt ist (und was für Mitarbeitergespräche gilt)
Fast jede Anleitung zum Thema endet bei 'holen Sie sich die Einwilligung'. Genau dort fängt das Problem an: Im Bewerbungsverfahren besteht ein Abhängigkeitsverhältnis, und eine Einwilligung darin gilt regelmäßig als nicht freiwillig. Dieser Text trennt Video, Ton und Transkript, nennt die Löschfristen und sagt, welche Gespräche kein Transkript vertragen.

Das Google-Meet-Transkript existiert, und Sie können es trotzdem nicht öffnen
Sie waren im Meeting, das Transkript wurde erstellt, und Drive zeigt trotzdem einen Zugriff anfordern-Button. Meet bindet das Transkript an die Kalendereinladung, kappt Meetings mit mehr als 200 Eingeladenen, und lässt externe Gäste ganz außen vor. Hier sind alle Regeln, und warum die Datei in der falschen Sprache herauskam.