Zum Inhalt springen
Alle Beiträge
Anleitungen

Was Sprechererkennung ist, und die zwei Arten, wie 'wer hat wann gesprochen' schiefgeht

Ihr Transkript zeigt Sprecher 3, dabei saßen nur zwei Personen im Raum. Das ist kein zufälliger Ausrutscher. Automatische Sprecherzuordnung scheitert in zwei erkennbaren Formen, jede mit eigener Ursache, und zu wissen, welche gerade vorliegt, sagt genau, was zu tun ist.

Kalima Team8 Min. Lesezeit

Sprechererkennung, im Fachjargon Diarisierung, ist der Teil eines Transkriptionssystems, der herausfindet, wer wann gesprochen hat. Sie kennt keinen einzigen Namen und hat das auch nie getan. Sie hört auf Stimmwechsel, schneidet den Ton in Redebeiträge, verwandelt jeden Beitrag in einen numerischen Fingerabdruck und gruppiert dann ähnliche Fingerabdrücke, weshalb das Transkript als Sprecher 1, Sprecher 2 und Sprecher 3 zurückkommt statt als ein ungeteilter Textblock.

Alles, was an diesen Labels später falsch aussieht, kommt aus diesem Gruppierungsschritt, und es geht auf zwei erkennbare Arten schief. Sobald Sie die beiden auseinanderhalten können, wissen Sie, welche Passagen zu prüfen sind und welche sich in ein paar Minuten reparieren lassen.

Wie die Labels überhaupt entstehen

Anbieter-Dokumentationen beschreiben dieselben vier Schritte mit leicht unterschiedlichen Namen. Deepgrams Erklärung (abgerufen September 2026) nennt sie Erkennung, Segmentierung, Repräsentation und Zuordnung:

  1. Sprache finden. Sprachaktivitätserkennung markiert, welche Abschnitte des Tons überhaupt eine menschliche Stimme enthalten, und welche Stille, Tastaturgeräusche oder eine Klimaanlage sind.
  2. An Stimmwechseln schneiden. Ein Modell findet die Stellen, an denen sich die Stimmmerkmale ändern, und teilt den Ton dort in Redebeiträge.
  3. Jeden Beitrag mit einem Fingerabdruck versehen. Jeder Beitrag wird zu einem Sprecher-Embedding, einem Zahlenvektor, der Tonhöhenumfang, Klangfarbe und andere akustische Eigenheiten kodiert.
  4. Die Fingerabdrücke gruppieren. Ähnliche Vektoren werden geclustert, jedes Cluster bekommt eine Nummer.

Nichts in dieser Kette weiß, wer Sie sind. Das Label ist ein Cluster mit einer aufgedruckten Nummer, und die Nummer wird in der Reihenfolge vergeben, in der die Cluster auftauchen. Diese eine Tatsache erklärt fast alles, was folgt.

Die zwei Fehlerformen: Verschmelzung und Aufspaltung

Fast jede Beschwerde über Sprecherlabels ist eine von beiden, mit entgegengesetzten Ursachen und entgegengesetzten Lösungen.

VerschmelzungAufspaltung
Was Sie sehenZwei Personen teilen sich ein Label. Ein Dialog liest sich wie ein Monolog.Eine Person erscheint als Sprecher 2 und Sprecher 4.
Warum es passiertIhre Fingerabdrücke liegen zu nah beieinander: ähnliche Tonhöhe und Akzent, derselbe Raum, dasselbe Mikrofon, kurze Redebeiträge.Der Fingerabdruck einer Person hat sich während der Aufnahme verändert, weit genug, um wie eine neue Person zu wirken.
Typischer AuslöserZwei gleichaltrige Kolleginnen aus derselben Region an einem Tischmikrofon. Zwischenrufe wie „genau“ werden der bereits sprechenden Person zugeschlagen.Jemand wird lauter, gestikuliert und lehnt sich vom Mikrofon weg, wechselt vom Headset zum Lautsprecher, oder eine Einwahlleitung ändert ihre Qualität.
Was hilftStimmen manuell trennen, oder die Gruppierung mit der richtigen Personenzahl neu laufen lassen.Die abweichenden Passagen neu zuordnen, und beiden Labels denselben Namen geben.

AssemblyAIs eigener Beitrag zu den schwierigen Fällen (abgerufen September 2026) nennt dasselbe Paar Sprecherzahlfehler: Systeme „merge two people into one, especially with similar-sounding voices“ oder „split one person's changing voice into multiple speakers“.

Die praktische Erkenntnis: Das Label ist eine Vermutung über Akustik, keine Tatsache über Menschen. Eine Aufspaltung sagt, dass sich etwas am Klang verändert hat. Eine Verschmelzung sagt, dass zwei Dinge ähnlich klangen.

Überlappende Sprache verursacht die meisten Fehler

Eine Ursache übertrifft alle anderen. Klassische Diarisierung ordnet jeden Moment des Tons genau einem Cluster zu, sprechen also zwei Personen gleichzeitig, muss eine davon verlieren. Federico Landinis Übersichtsarbeit von 2024, From Modular to End-to-End Speaker Diarization, formuliert es unumwunden: Bis vor Kurzem war jeder konkurrenzfähige Ansatz modular aufgebaut, diese Systeme erreichten in den meisten Szenarien Spitzenergebnisse, hatten aber „major difficulties dealing with overlapped speech“. Neuere End-to-End-Modelle sind darauf ausgelegt, mehrere Stimmen im selben Moment zu verarbeiten, und Forschung wie Speaker Embedding-aware Neural Diarization existiert genau deshalb, weil Meeting-Ton so stark überlappt, dass die Annahme „eine Stimme zur Zeit“ zusammenbricht.

Für eine Meeting-Verantwortliche ist die Folge konkret. Überlappende Sprache ist der Ort, an dem den Labels am wenigsten zu trauen ist, und Überlappungen häufen sich genau dort, wo es zählt: bei der Unterbrechung, dem Einwand, der schnellen Zustimmung, während jemand anders noch den Satz beendet. Prüfen Sie ein Transkript also nicht von oben nach unten, sondern springen Sie zu den Stellen mit kurzen, schnellen Redebeiträgen, dort leben die Verschmelzungen.

Ein Hinweis zur Kennzahl, die Anbieter nennen. Die Diarisierungsfehlerrate, kurz DER, ist der Anteil der Sprechzeit, der entweder verpasst, fälschlich als Sprache markiert oder der falschen Person zugeordnet wird. Weil sie in Sekunden gemessen wird, kann ein System jedes einzelne „ja, genau“ verschlucken und trotzdem gut abschneiden: AssemblyAI beschreibt einen Fall mit 15,1 Prozent DER, während die wortgenaue Kennzahl für dieselbe Ausgabe bei 30,7 Prozent cpWER lag. Eine DER-Angabe sagt also sehr wenig darüber aus, ob Ihr Protokoll die richtige Person nennt. Kalima veröffentlicht keine Diarisierungsprozentzahl, aus demselben Grund, aus dem wir keine Genauigkeitsprozentzahl veröffentlichen, und wie Sie eine Genauigkeitsangabe zur Transkription lesen erklärt, wonach Sie stattdessen fragen sollten.

Warum sich die Nummern zwischen Aufnahmen ändern

Die Gruppierung findet innerhalb einer Aufnahme statt. Sie gruppiert die anwesenden Stimmen gegeneinander, mehr nicht. Es ist keine Identifikation, weil es kein gespeichertes Profil von Ihnen gibt, mit dem verglichen werden könnte.

In Kalima bleiben Sprechernummern also innerhalb einer Sitzung eindeutig, auch wenn Sie mehrere Aufnahmen darin stoppen und starten, aber die automatische Diarisierung trägt keine Identität über Aufnahmen hinweg weiter. Dieselbe Person kann in der nächsten Aufnahme unter einer anderen Nummer zurückkommen, und das System funktioniert dabei wie vorgesehen, es verliert nicht den Überblick. Die Farbpalette verhält sich genauso: Sie umfasst acht Farben und beginnt für die neunte sprechende Person wieder von vorn, während die Nummern eindeutig bleiben. Beide Details stehen auf der Hilfeseite zu Sprechern und Diarisierung.

Bereits falsche Labels reparieren

Eine erneute Aufnahme ist nicht nötig. Öffnen Sie in Kalima die fertige Aufnahme, wählen Sie Sprecher prüfen, dann Stimmen prüfen. Kalima hört sich die Aufnahme erneut an, gruppiert die Passagen nach Stimme, und zeigt Ihnen Hörbeispiele, bevor irgendetwas übernommen wird.

Drei Dinge sind vorab wichtig:

  • Die Prüfung läuft auf Ihrem eigenen Gerät. Beim ersten Durchlauf lädt ein 38 MB großes Sprachmodell herunter und bleibt danach auf diesem Gerät, kein Ton verlässt es.
  • Sie braucht mindestens zwei Passagen mit Sprache, um überhaupt etwas vergleichen zu können.
  • Sie dauert etwa 40 Sekunden je Stunde Aufnahme, ein zweistündiger Workshop ist also in ein paar Minuten fertig.

In der Prüfung können Sie die Personenzahl korrigieren, die direkte Lösung für beide Fehlerformen: senken Sie sie, wenn eine Person aufgespalten wurde, erhöhen Sie sie, wenn zwei verschmolzen wurden. Benennen Sie danach jede Stimme, hören Sie die Passagen an, bei denen sich die Gruppierung unsicher war, und weisen Sie einzelne Passagen neu zu, bevor Sie das Ergebnis übernehmen.

Umbenennen ist ein eigener, einfacherer Schritt. Klicken Sie auf das Sprecher-Abzeichen in einer Segment-Kopfzeile und tippen Sie einen Namen mit bis zu 50 Zeichen; jedes dieser Stimme zugeordnete Segment aktualisiert sich sofort. Bereits eingegebene Namen erscheinen als Schnellauswahl-Chips, so geben Sie derselben Person denselben Namen über zwei Aufnahmen hinweg, die sie unterschiedlich nummeriert haben. Nur die Eigentümerin oder der Eigentümer der Sitzung kann Sprecher umbenennen. Was Sie festlegen, fließt in die Live-Ansicht, geteilte Sitzungen und jeden Export ein, einschließlich SRT, VTT, JSON, Text und PDF.

Im gewählten Aufnahmemodus die Stimmen am besten trennen

Zählt das fertige Transkript mehr als das Mitlesen in Echtzeit, nutzen Sie Post-Process+ statt Realtime. Es zeichnet zuerst auf und erstellt das Transkript einige Minuten nach dem Stoppen, mit der höchsten Genauigkeit und der besten Sprechertrennung der beiden Modi. Beide kosten dieselbe Transkriptionszeit, es ist also eine Entscheidung über die Ausgabe, nicht über Ihr Budget. Realtime ist richtig, wenn Sie Live-Untertitel, Live-Übersetzung oder mitlesende Zuschauer brauchen, eine laufende Post-Process+-Aufnahme lässt sich einmal zu Realtime wechseln, aber nicht zurück. Siehe Aufnahmemodi.

Im Raum entscheidet das Mikrofon

Diarisierung kann nur trennen, was das Mikrofon getrennt aufgenommen hat. Ein Laptop-Mikrofon in der Mitte eines Tisches nimmt alle Anwesenden über eine unterschiedliche Distanz und mit unterschiedlichem Raumhall auf, was Rohmaterial für beide Fehlerformen zugleich liefert.

  • Stellen Sie das Mikrofon näher an die Personen, oder nutzen Sie eines pro Person, wo es der Aufbau erlaubt.
  • Bitten Sie entfernte Teilnehmende, ein Headset statt Lautsprecher zu nutzen und bei einem Gerät zu bleiben.
  • Lassen Sie eine kurze Pause zwischen Redebeiträgen. Genau danach sucht der Segmentierungsschritt.
  • Bewegen Sie ein geteiltes Mikrofon nicht mitten im Gespräch. Der Lautstärkesprung sieht wie ein Sprecherwechsel aus.

Transkribieren Sie ein Gespräch mit anderen Personen, sagen Sie es vorher und holen Sie deren Zustimmung ein. In Deutschland schützt § 201 StGB das gesprochene Wort, der sichere Weg ist überall die Zustimmung aller Anwesenden plus ein Blick in die eigenen Unternehmensregeln und die Bedingungen des Meeting-Tools.

Häufige Fragen

Warum zeigt mein Transkript Sprecher 3, obwohl nur zwei Personen anwesend waren?

Das ist eine Aufspaltung. Die Stimme einer Person hat sich während der Aufnahme genug verändert, dass der Gruppierungsschritt sie als neue Person liest, meist nachdem sie lauter wurde, sich relativ zum Mikrofon bewegt oder das Gerät gewechselt hat. Führen Sie Stimmen prüfen aus, setzen Sie die Personenzahl auf zwei, und weisen Sie die abweichenden Passagen neu zu. Beiden Labels denselben Namen zu geben, führt sie auch im Transkript und in jedem Export zusammen.

Warum bekam dieselbe Person in der zweiten Aufnahme eine andere Nummer?

Weil Diarisierung Stimmen innerhalb einer Aufnahme gruppiert und keine Identität über mehrere Aufnahmen hinweg erkennt. Nummern bleiben innerhalb der gesamten Sitzung eindeutig, dieselbe Person kann also in einer späteren Aufnahme auf einer anderen Nummer landen. Nutzen Sie denselben Namen aus den Schnellauswahl-Chips wieder, und das Transkript liest sich wieder als ein durchgehendes Gespräch.

Kann Transkriptionssoftware eine bestimmte Person an ihrer Stimme erkennen?

Diarisierung kann das nicht, und Kalima tut es nicht. Diarisierung beantwortet nur, ob zwei Passagen innerhalb dieser Aufnahme von derselben Stimme stammen. Eine Stimme einer benannten Person zuzuordnen ist eine andere Technologie, Sprechererkennung im engeren Sinn, die ein hinterlegtes Stimmprofil zum Vergleich braucht. In Kalima tippt die Eigentümerin oder der Eigentümer der Sitzung die Namen im Transkript selbst ein.

Funktioniert Diarisierung noch mit mehr als acht Sprechenden?

Ja. Das Acht-Farben-Limit betrifft nur die Palette, die für die neunte sprechende Person wieder von vorn beginnt, während die Nummern eindeutig bleiben. Die Gruppierung selbst wird schwieriger, weil mehr Stimmen mehr Gelegenheiten bedeuten, dass zwei im Fingerabdruckraum nah beieinanderliegen. Podien und Konferenzen sind der klarste Fall für ein Mikrofon pro sprechender Person.

Werden die Labels besser, wenn ich im Nachhinein statt live transkribiere?

Meist ja. Post-Process+ hat die gesamte Aufnahme vorliegen, bevor irgendetwas entschieden wird, und kann daher spätere Teile eines Gesprächs nutzen, um eine Entscheidung über frühere Teile zu treffen. Realtime muss sich festlegen, sobald die Wörter eintreffen. Beide kosten in Kalima dieselbe Transkriptionszeit, muss also niemand live mitlesen, gibt es keinen Grund, Realtime zu wählen.

Verschickt die Sprecherkorrektur meinen Ton irgendwohin?

Nein. Die Prüfung Stimmen prüfen läuft auf Ihrem eigenen Gerät mit einem 38 MB großen Sprachmodell, das einmal herunterlädt und dort bleibt, für diesen Schritt verlässt kein Ton das Gerät. Einen Sprecher umzubenennen ist eine Textänderung in Ihrem eigenen Transkript.

Weiterführend

Testen Sie Kalima in Ihrem nächsten Gespräch.

Live-Transkription und Übersetzung, ohne Bot im Meeting. Kostenlos starten.

Kostenlos starten

Weiter lesen.