Ein Blick in unsere Pipeline für niedrige Latenz
Live-Untertitel fühlen sich nur dann wirklich live an, wenn sie eintreffen, solange die Worte noch im Raum stehen. Hier erklären wir verständlich, warum die Latenz so wichtig ist und mit welchen Prinzipien wir sie niedrig halten.

Wer Live-Untertitel liest, denkt so gut wie nie an den Weg, den die Worte bis auf den Bildschirm zurückgelegt haben. Genau das ist der Sinn der Sache. Ein Untertitel, der erscheint, während der Satz noch im Raum steht, wirkt mühelos. Ein Untertitel, der zwei Sekunden zu spät kommt, wirkt kaputt, selbst wenn jedes Wort stimmt.
Latenz ist der Abstand zwischen Sprechen und Sehen. Sie ist der Teil der Echtzeit-Transkription, den Sie spüren, noch bevor Sie ein einziges Wort lesen. Hier erklären wir verständlich, warum dieser Abstand wichtig ist und mit welchen allgemeinen Prinzipien wir ihn klein halten. Die proprietären Details unter der Haube behalten wir dabei für uns.
Warum eine halbe Sekunde alles verändert
Ein Meeting bewegt sich im Tempo eines Gesprächs. Menschen unterbrechen sich, stimmen zu und ändern in Echtzeit die Richtung. Hinken die Untertitel diesem Rhythmus hinterher, sind sie nicht mehr live, sondern nur noch ein verzögertes Transkript, das zufällig mitläuft.
Die Kosten zeigen sich in kleinen Details, die sich summieren. Wer Untertitel liest, um einem schnellen Sprecher zu folgen, gerät einen Takt ins Hintertreffen und verliert den Faden. Wer eine Live-Übersetzung liest, beantwortet eine Frage, über die das Gespräch längst hinweg ist. Ein Vortragender, der kurz auf die Untertitel schaut, um sich zu vergewissern, dass er verstanden wurde, sieht den falschen Moment auf dem Bildschirm. Für sich genommen ist nichts davon dramatisch, doch zusammen zerstören diese Details das Gefühl, dass die Worte mit dem Geschehen im Raum Schritt halten.
Das ist der Maßstab, den wir an uns selbst anlegen. Untertitel sollten sich anfühlen, als gehörten sie zum aktuellen Satz, nicht zum vorherigen. Der Weg dorthin hat weniger mit einem cleveren Kniff zu tun als damit, an jeder Stelle auf zusätzliche Verzögerung zu verzichten, an der sie sich leicht einschleichen würde.
Den Ton streamen, nicht auf die Datei warten
Das erste Prinzip ist leicht gesagt und leicht falsch gemacht: Warten Sie niemals auf die komplette Aufnahme, bevor Sie mit der Transkription beginnen.
Eine naheliegende Art, Transkription aufzubauen, besteht darin, Audio aufzunehmen, eine Datei zu speichern und sie zur Verarbeitung wegzuschicken. Für Dateien, die Sie im Nachhinein hochladen, funktioniert das gut. Für Live-Untertitel ist es jedoch die falsche Form, denn die zuschauende Person muss warten, bis das Gesprochene zu Ende ist, ehe überhaupt etwas erscheint. Je länger jemand spricht, desto länger das Warten.
Die Echtzeit-Transkription dreht das um. Der Ton wird in einem kontinuierlichen Fluss gestreamt, in kleine Abschnitte zerlegt und in dem Moment weitergeleitet, in dem jeder Abschnitt fertig ist. Die Transkriptions-Engine beginnt mit den ersten Worten zu arbeiten, während der Sprecher noch mitten im Gedanken ist. Am Ende gibt es keine große Pause, weil es keine große Datei gibt, auf die zu warten wäre. Die Arbeit ist die ganze Zeit über gelaufen.
Stellen Sie sich den Unterschied vor zwischen einem Eimer, den man erst füllt und dann ausgießt, und einem stetigen Rinnsal, das nie versiegt. Das Rinnsal lässt Untertitel live wirken, und es gleichmäßig und ununterbrochen zu halten, macht den Großteil der Arbeit aus.
Die beste Vermutung zeigen und dann verfeinern
Das zweite Prinzip lautet: Ein guter Live-Untertitel darf seine Meinung ändern.
Menschliche Sprache steckt voller Mehrdeutigkeiten, die sich erst ein paar Worte später auflösen. Der Anfang eines Satzes kann in mehrere Richtungen weisen, bis das Ende kommt. Würde ein Transkriptionssystem auf volle Gewissheit warten, ehe es überhaupt etwas anzeigt, käme es immer zu spät, denn die Gewissheit stellt sich oft erst ein, nachdem der Sprecher längst weitergezogen ist.
Statt zu warten, zeigen wir deshalb früh eine beste Vermutung und verfeinern sie, während mehr vom Satz eintrifft. Die ersten Worte erscheinen schnell als vorläufige Lesart. Sobald sich der Kontext füllt, verfestigen sich diese Worte oder werden behutsam in ihre endgültige Form korrigiert. Vielleicht haben Sie schon einmal beobachtet, wie sich ein Untertitel kurz nach seinem Erscheinen leicht verschiebt. Das ist kein Fehler, sondern die Entscheidung des Systems, zuerst schnell und eine halbe Sekunde später exakt zu sein, was für ein Live-Publikum fast immer der richtige Kompromiss ist.
Die Kunst besteht darin, diese Verfeinerungen ruhig und nicht sprunghaft wirken zu lassen. Gut gemacht, ist der frühe Text nah genug, um sofort nützlich zu sein, und die Korrekturen sind so klein, dass sie Ihre Aufmerksamkeit nie vom Gespräch ablenken.
Niemals ein Wort verlieren, wenn das Netz kurz aussetzt
Das letzte Prinzip handelt davon, was passiert, wenn etwas schiefgeht, denn in einer langen Sitzung geht irgendwann immer etwas schief. Ein Laptop wechselt das Netzwerk. Eine WLAN-Verbindung im Café bricht für ein paar Sekunden ab. Ein Tunnel verschluckt das Mobilfunksignal.
Das naheliegende Versagen ist hier zugleich das schlimmste: Eine Lücke in der Verbindung wird zu einer Lücke im Transkript, und ein Stück Gespräch verschwindet einfach. Für eine Live-Aufzeichnung, auf die sich Menschen verlassen, sind fehlende Worte kein kleines Ärgernis. Sie sind ein Loch im Meeting.
Unser Ansatz behandelt Unterbrechungen als erwartbar, nicht als Ausnahme. Wackelt eine Verbindung, wird der während der Störung aufgenommene Ton sicher zwischengespeichert, statt verworfen zu werden. Sobald die Verbindung wieder steht, wird dieser Ton an der richtigen Stelle in die Zeitleiste zurückgeführt, sodass die Worte in der korrekten Reihenfolge ankommen, und die Live-Ansicht holt auf, anstatt vorzuspringen. Aus Sicht der lesenden Person pausieren die Untertitel kurz und laufen dann weiter. Im Hintergrund hat das System dafür gesorgt, dass diese Pause niemanden einen Satz gekostet hat.
Niedrige Latenz und Zuverlässigkeit werden meist als Gegensätze dargestellt, bei denen Tempo gleich Risiko und Sicherheit gleich Langsamkeit bedeutet. In der Echtzeit-Transkription müssen beide zusammen bestehen. Die gesamte Pipeline ist so gebaut, dass der schnelle Pfad im Normalfall schnell bleibt und der sorgfältige Pfad die Worte still schützt, wenn das Netz einen schlechten Moment hat. Wenn beides hält, fühlen sich Untertitel zugleich sofort und vollständig an, und genau so sollte sich Live anfühlen.
Testen Sie Kalima in Ihrem nächsten Gespräch.
Live-Transkription und Übersetzung, ohne Bot im Meeting. Kostenlos starten.
Weiter lesen.

Medizinische Vorträge und Vorlesungen transkribieren
Die Sorge vor der Fachsprache ist bei einem Vortrag fast immer die falsche Sorge. Wirkstoffnamen und gängige Abkürzungen sind für das Modell Alltag. Nicht wissen kann es Ihre Stationskürzel, den Nachnamen der vortragenden Person oder eine interne Studiennummer. Genau diese kurze Liste deckt der Kontext ab.

Google Meet: Transkriptions-Schaltfläche fehlt oder Transkript wurde nicht erstellt
Fehlt in Google Meet die Schaltfläche für die Transkription, sind Sie meist in der falschen Workspace-Edition, am Smartphone oder in einem Meeting, dessen Organisator die Funktion nicht freigegeben hat. Diese Anleitung sortiert die Ursachen und zeigt ein Live-Transkript, das stattdessen auf Ihrem eigenen Computer läuft.

Teams-Transkription ausgegraut oder nicht verfügbar? Ursachen und ein Ausweg
Wenn Teams nicht transkribieren will, liegt es fast immer an einer Einstellung, an die Sie nicht herankommen: eine Administratorrichtlinie, eine Lizenz in einem fremden Mandanten oder Ihre Gastrolle. Diese Anleitung geht die Ursachen durch und zeigt ein Transkript, das von keiner davon abhängt.