Zum Inhalt springen
Alle Beiträge
Technik

Ein Blick in unsere Pipeline für niedrige Latenz

Live-Untertitel fühlen sich nur dann wirklich live an, wenn sie eintreffen, solange die Worte noch im Raum stehen. Hier erklären wir verständlich, warum die Latenz so wichtig ist und mit welchen Prinzipien wir sie niedrig halten.

Kalima Team28. Mai 20266 Min. Lesezeit
Sanft-isometrische Stoppuhr neben einer Audio-Wellenform

Wer Live-Untertitel liest, denkt so gut wie nie an den Weg, den die Worte bis auf den Bildschirm zurückgelegt haben. Genau das ist der Sinn der Sache. Ein Untertitel, der erscheint, während der Satz noch im Raum steht, wirkt mühelos. Ein Untertitel, der zwei Sekunden zu spät kommt, wirkt kaputt, selbst wenn jedes Wort stimmt.

Latenz ist der Abstand zwischen Sprechen und Sehen. Sie ist der Teil der Echtzeit-Transkription, den Sie spüren, noch bevor Sie ein einziges Wort lesen. Hier erklären wir verständlich, warum dieser Abstand wichtig ist und mit welchen allgemeinen Prinzipien wir ihn klein halten. Die proprietären Details unter der Haube behalten wir dabei für uns.

Warum eine halbe Sekunde alles verändert

Ein Meeting bewegt sich im Tempo eines Gesprächs. Menschen unterbrechen sich, stimmen zu und ändern in Echtzeit die Richtung. Hinken die Untertitel diesem Rhythmus hinterher, sind sie nicht mehr live, sondern nur noch ein verzögertes Transkript, das zufällig mitläuft.

Die Kosten zeigen sich in kleinen Details, die sich summieren. Wer Untertitel liest, um einem schnellen Sprecher zu folgen, gerät einen Takt ins Hintertreffen und verliert den Faden. Wer eine Live-Übersetzung liest, beantwortet eine Frage, über die das Gespräch längst hinweg ist. Ein Vortragender, der kurz auf die Untertitel schaut, um sich zu vergewissern, dass er verstanden wurde, sieht den falschen Moment auf dem Bildschirm. Für sich genommen ist nichts davon dramatisch, doch zusammen zerstören diese Details das Gefühl, dass die Worte mit dem Geschehen im Raum Schritt halten.

Das ist der Maßstab, den wir an uns selbst anlegen. Untertitel sollten sich anfühlen, als gehörten sie zum aktuellen Satz, nicht zum vorherigen. Der Weg dorthin hat weniger mit einem cleveren Kniff zu tun als damit, an jeder Stelle auf zusätzliche Verzögerung zu verzichten, an der sie sich leicht einschleichen würde.

Den Ton streamen, nicht auf die Datei warten

Das erste Prinzip ist leicht gesagt und leicht falsch gemacht: Warten Sie niemals auf die komplette Aufnahme, bevor Sie mit der Transkription beginnen.

Eine naheliegende Art, Transkription aufzubauen, besteht darin, Audio aufzunehmen, eine Datei zu speichern und sie zur Verarbeitung wegzuschicken. Für Dateien, die Sie im Nachhinein hochladen, funktioniert das gut. Für Live-Untertitel ist es jedoch die falsche Form, denn die zuschauende Person muss warten, bis das Gesprochene zu Ende ist, ehe überhaupt etwas erscheint. Je länger jemand spricht, desto länger das Warten.

Die Echtzeit-Transkription dreht das um. Der Ton wird in einem kontinuierlichen Fluss gestreamt, in kleine Abschnitte zerlegt und in dem Moment weitergeleitet, in dem jeder Abschnitt fertig ist. Die Transkriptions-Engine beginnt mit den ersten Worten zu arbeiten, während der Sprecher noch mitten im Gedanken ist. Am Ende gibt es keine große Pause, weil es keine große Datei gibt, auf die zu warten wäre. Die Arbeit ist die ganze Zeit über gelaufen.

Stellen Sie sich den Unterschied vor zwischen einem Eimer, den man erst füllt und dann ausgießt, und einem stetigen Rinnsal, das nie versiegt. Das Rinnsal lässt Untertitel live wirken, und es gleichmäßig und ununterbrochen zu halten, macht den Großteil der Arbeit aus.

Die beste Vermutung zeigen und dann verfeinern

Das zweite Prinzip lautet: Ein guter Live-Untertitel darf seine Meinung ändern.

Menschliche Sprache steckt voller Mehrdeutigkeiten, die sich erst ein paar Worte später auflösen. Der Anfang eines Satzes kann in mehrere Richtungen weisen, bis das Ende kommt. Würde ein Transkriptionssystem auf volle Gewissheit warten, ehe es überhaupt etwas anzeigt, käme es immer zu spät, denn die Gewissheit stellt sich oft erst ein, nachdem der Sprecher längst weitergezogen ist.

Statt zu warten, zeigen wir deshalb früh eine beste Vermutung und verfeinern sie, während mehr vom Satz eintrifft. Die ersten Worte erscheinen schnell als vorläufige Lesart. Sobald sich der Kontext füllt, verfestigen sich diese Worte oder werden behutsam in ihre endgültige Form korrigiert. Vielleicht haben Sie schon einmal beobachtet, wie sich ein Untertitel kurz nach seinem Erscheinen leicht verschiebt. Das ist kein Fehler, sondern die Entscheidung des Systems, zuerst schnell und eine halbe Sekunde später exakt zu sein, was für ein Live-Publikum fast immer der richtige Kompromiss ist.

Die Kunst besteht darin, diese Verfeinerungen ruhig und nicht sprunghaft wirken zu lassen. Gut gemacht, ist der frühe Text nah genug, um sofort nützlich zu sein, und die Korrekturen sind so klein, dass sie Ihre Aufmerksamkeit nie vom Gespräch ablenken.

Niemals ein Wort verlieren, wenn das Netz kurz aussetzt

Das letzte Prinzip handelt davon, was passiert, wenn etwas schiefgeht, denn in einer langen Sitzung geht irgendwann immer etwas schief. Ein Laptop wechselt das Netzwerk. Eine WLAN-Verbindung im Café bricht für ein paar Sekunden ab. Ein Tunnel verschluckt das Mobilfunksignal.

Das naheliegende Versagen ist hier zugleich das schlimmste: Eine Lücke in der Verbindung wird zu einer Lücke im Transkript, und ein Stück Gespräch verschwindet einfach. Für eine Live-Aufzeichnung, auf die sich Menschen verlassen, sind fehlende Worte kein kleines Ärgernis. Sie sind ein Loch im Meeting.

Unser Ansatz behandelt Unterbrechungen als erwartbar, nicht als Ausnahme. Wackelt eine Verbindung, wird der während der Störung aufgenommene Ton sicher zwischengespeichert, statt verworfen zu werden. Sobald die Verbindung wieder steht, wird dieser Ton an der richtigen Stelle in die Zeitleiste zurückgeführt, sodass die Worte in der korrekten Reihenfolge ankommen, und die Live-Ansicht holt auf, anstatt vorzuspringen. Aus Sicht der lesenden Person pausieren die Untertitel kurz und laufen dann weiter. Im Hintergrund hat das System dafür gesorgt, dass diese Pause niemanden einen Satz gekostet hat.

Niedrige Latenz und Zuverlässigkeit werden meist als Gegensätze dargestellt, bei denen Tempo gleich Risiko und Sicherheit gleich Langsamkeit bedeutet. In der Echtzeit-Transkription müssen beide zusammen bestehen. Die gesamte Pipeline ist so gebaut, dass der schnelle Pfad im Normalfall schnell bleibt und der sorgfältige Pfad die Worte still schützt, wenn das Netz einen schlechten Moment hat. Wenn beides hält, fühlen sich Untertitel zugleich sofort und vollständig an, und genau so sollte sich Live anfühlen.

Testen Sie Kalima in Ihrem nächsten Gespräch.

Live-Transkription und Übersetzung, ohne Bot im Meeting. Kostenlos starten.

Kostenlos starten

Weiter lesen.