Zum Inhalt springen
Alle Beiträge
Anleitungen

Interview transkribieren für die Bachelor- oder Masterarbeit: Regeln, Ablauf, Werkzeuge

Die Transkriptionsregeln für Ihre Abschlussarbeit stehen in jedem Methodenbuch. Was dort nicht steht: welche davon ein automatisches Transkript schon erfüllt und welche Sie in jedem Fall von Hand nachziehen. Dazu ein belegter Zeitplan, ein ehrlicher Werkzeugvergleich und der Weg bis in den Anhang.

Kalima Team11 Min. Lesezeit

Für eine Abschlussarbeit reicht in aller Regel ein einfaches Transkript: wörtlich, ins Hochdeutsche geglättet, ohne Fülllaute, mit Sprecherkürzeln und Zeitmarken. Ein automatisches Transkript liefert einen Teil dieser Regeln von selbst, einen zweiten Teil nur ungefähr und einen dritten Teil grundsätzlich nicht. Diese Anleitung sagt Regel für Regel, welcher Teil welcher ist, nennt belegte Zeitwerte statt Werbeversprechen und führt die Datei bis in den zitierfähigen Anhang.

Ein Hinweis vorweg: maßgeblich ist immer das Merkblatt Ihres Instituts. Die Beispiele unten stammen aus zwei solchen Merkblättern, und sie unterscheiden sich in Details von den Lehrbuchregeln.

Welches Regelsystem gilt für Ihre Arbeit

In der deutschsprachigen Methodenliteratur stehen drei Ebenen nebeneinander.

Die einfachen Transkriptionsregeln nach Dresing und Pehl sind der Standard für qualitative Inhaltsanalysen und damit für die meisten Abschlussarbeiten. Sie verlangen wörtliche Wiedergabe, Übersetzung von Dialekt ins Hochdeutsche, Glättung von Wortverschleifungen, Auslassung von Fülllauten und einen kleinen Satz Sonderzeichen für Pausen, Betonungen und Unverständliches. Das Praxisbuch steht auf audiotranskription.de kostenlos zum Download (abgerufen am 22. September 2026).

Die erweiterten Regeln derselben Autoren transkribieren buchstäblich statt wörtlich: Dialekt bleibt Dialekt, Fülllaute und Wortdoppelungen werden notiert, Abbrüche mit Schrägstrich markiert. Das braucht, wer Sprechweise selbst zum Gegenstand macht.

Kuckartz und Rädiker veröffentlichen einen sehr ähnlichen Regelkatalog mit 14 Punkten, ausdrücklich für die computergestützte Auswertung, und zwar in einer Fassung, die schon eine Spalte für automatische Transkription enthält (Qualitative Inhaltsanalyse, 2022, S. 199 bis 203, PDF-Auszug, abgerufen am 22. September 2026). Wenn Ihr Institut kein eigenes Merkblatt hat, ist das der praktischste Katalog, weil er genau die Frage schon beantwortet, um die es hier geht.

Darüber liegen die Systeme der Gesprächsforschung, GAT 2 und TiQ, mit Intonationsverläufen, Akzentstufen, Dehnungen und auf die Hundertstelsekunde gemessenen Pausen. Kein automatisches Werkzeug erzeugt so etwas, in keiner Preisklasse. Wer ein Basis- oder Feintranskript nach GAT 2 braucht, transkribiert von Hand oder lässt es von Hand transkribieren.

Regel für Regel: was ein automatisches Transkript schon erfüllt

Die Spalte in der Mitte folgt der Einschätzung von Kuckartz und Rädiker, ergänzt um das, was sich an einem Kalima-Transkript prüfen lässt. Die rechte Spalte ist die Arbeit, die in jedem Fall bei Ihnen bleibt.

Regel im einfachen SystemAutomatisch erfüllt?Was Sie nachziehen
Jeder Sprechbeitrag ein eigener Absatz, Leerzeile dazwischenTeilweiseKurze Einwürfe („Ja“, „Genau“) landen oft im Absatz der anderen Person. Trennen.
Sprecherkürzel I:, B1:, B2: vor jedem BeitragJa, nach dem UmbenennenDie Sprecher heißen zunächst Sprecher 1 und Sprecher 2. Einmal umbenennen, dann gilt es überall.
Wörtlich, nicht zusammenfassendJaNichts. Das ist die Kernleistung der Erkennung.
Dialekt möglichst genau ins Hochdeutsche übertragenTeilweiseDie Erkennung schreibt Standardorthografie, übersetzt aber nicht kontrolliert. Starke Mundart gegenlesen.
Sprache leicht ans Schriftdeutsch angleichen („so'n“ wird „so ein“)TeilweiseStichprobenweise prüfen, vor allem in schnellen Passagen.
Wort- und Satzabbrüche sowie Stottern glättenTeilweiseHalbsätze, die stehen bleiben sollen, mit / kennzeichnen.
Verständnissignale („mhm“, „aha“) weglassenNeinLöschen. Ausnahme: Die Antwort besteht nur daraus, dann „mhm (bejahend)“.
Fülllaute („ähm“) nur bei inhaltlicher BedeutungNeinLöschen oder stehen lassen, das ist eine inhaltliche Entscheidung.
Pausen als (.), (..), (...) markierenNeinVon Hand setzen. Hinweis geben die Zeitmarken, ersetzen sie aber nicht.
Betonungen durch GROSSSCHREIBUNGNeinBeim Gegenhören setzen.
Lautäußerungen in Klammern, etwa (lacht)NeinBeim Gegenhören setzen.
Störungen in Doppelklammern, etwa ((Handy klingelt))NeinBeim Gegenhören setzen.
Unverständliches als (unv.), Vermutungen als (Wort?)TeilweiseDie Erkennung rät lieber, als eine Lücke zu lassen. Genau hier gegenhören.
Sprecherüberlappungen als //Text//NeinVon Hand setzen. Bei gleichzeitigem Sprechen kann die Sprechertrennung selbst falsch liegen.
Zeitmarken am Ende jedes SprechbeitragsJaBeim Export anschalten oder weglassen.
Interpunktion zugunsten der Lesbarkeit glättenJaNichts.

Zwei Dinge lassen sich daraus ablesen. Erstens: Die Regeln, die am meisten Tipparbeit kosten, nämlich wörtliche Wiedergabe, Absatzstruktur, Sprecherzuordnung und Zeitmarken, sind genau die, die automatisch kommen. Zweitens: Alles, was Sprechweise beschreibt statt Wortlaut, bleibt Handarbeit. Pausen, Betonung, Lautstärke, Lachen, Überlappung. Das ist kein Mangel eines bestimmten Anbieters, sondern die Grenze zwischen Spracherkennung und Gesprächsanalyse.

Wie lange das dauert, und warum die Zahlen sich widersprechen

In Umlauf sind mindestens drei Zeitangaben, und wer eine davon als Tatsache zitiert, zitiert eine Faustregel.

QuelleAufwand je AudiostundeBezug
Kuckartz und Rädiker, 20225 bis 10 Stundeneinfaches Transkript, von Hand
Merkblatt Kulturanthropologie Universität Basel5 bis 10 Stundeneinfaches Regelsystem, von Hand
audiotranskription.de (Dresing und Pehl)5 bis 8 Stunden, gemessener Mittelwert 1:6,3einfache Regeln, geübte Person
„(Re)thinking transcription strategies“, Journal of Business Research 20236 bis 10 Stundengeschulte transkribierende Person
audiotranskription.de18 StundenGAT 2 Basistranskript
audiotranskription.de30 bis 60 StundenGAT 2 Feintranskript

(Alle Seiten abgerufen am 22. September 2026: Zeitaufwand, Merkblatt Basel, Journal of Business Research.)

Die Spanne ist echt, nicht nachlässig. Sie hängt an fünf Größen: der Aufnahmequalität, der Zahl der Sprechenden, dem Anteil Mundart, dem gewählten Regelsystem und der eigenen Tippgeschwindigkeit. audiotranskription.de misst bei den eigenen Erhebungen eine Standardabweichung von 1,5 um den Mittelwert von 1:6,3 und nennt als schnellsten Wert etwa 1:3, allerdings bei einer Person, die genau eine Stunde durchgehalten hat.

Und der automatische Weg? Nicht null. Kuckartz und Rädiker beziffern ihn für ein einstündiges Interview mit etwa 3 bis 6 Stunden, um das maschinelle Transkript auf Richtigkeit zu prüfen und zu korrigieren. Dazu kommt die reine Rechenzeit, je nach Werkzeug und Gerät zwischen wenigen Minuten und mehreren Stunden. Rechnen Sie für eine Arbeit mit sechs bis acht Interviews also nicht mit einem verlorenen Wochenende, aber auch nicht mit einem verlorenen Nachmittag.

Die Korrekturzeit sinkt spürbar, wenn Sie das Gegenhören nicht als zweiten Arbeitsgang einplanen, sondern als ersten Analysedurchgang. Sie hören das Material ohnehin ein weiteres Mal, und beim Korrigieren entstehen die ersten Codes.

Vier Wege, verglichen in derselben Einheit

WegWas es kostetZeit bis zum TranskriptWofür es taugt
Selbst tippen mit f4transkriptStudierendenlizenz 25 Euro für 3 Monate, 33 Euro für 6 Monate5 bis 10 Stunden je AudiostundeErweiterte Regeln, GAT 2, sehr schlechte Aufnahmen
Transkriptionsbüro beauftragenetwa 1,60 Euro je Audiominute, Schweizerdeutsch 3 Euro; anderswo 1,65 bis 2,45 Euro netto je BandminuteLieferfrist des BürosGroße Projekte mit Budget, heikle Mundart
Kostenlose lokale Werkzeuge (noScribe, aTrain)0 Eurorund 1 bis 3 Stunden Rechenzeit je Audiostunde, danach die KorrekturEine Handvoll Interviews, Rechner mit Reserve, strenge Datenschutzauflagen
KalimaKostenloser Tarif, bezahlte Tarife ab 14,99 Euro im Monat, siehe PreiseMinuten Rechenzeit, danach die KorrekturMehrere Interviews, Aufnahmen vom Telefon, saubere Sprechertrennung

Eine Stunde Interview kostet im Büro also rund 96 bis 147 Euro. Bei acht Interviews steht eine vierstellige Rechnung im Raum. Die Preise stammen von transkribieren.at und schreibbuero-24.com, die Lizenzpreise von audiotranskription.de, alle abgerufen am 22. September 2026. Preislisten ändern sich, prüfen Sie sie vor der Beauftragung nach.

Zu den kostenlosen lokalen Werkzeugen: noScribe steht unter GPL-3.0, arbeitet ohne Cloud und gibt selbst an, dass eine Interviewstunde etwa 1 bis 3 Stunden Rechenzeit braucht, auf älteren Geräten länger (noscribe.de, abgerufen am 22. September 2026). aTrain stammt aus dem Zentrum BANDAS der Universität Graz, läuft ebenfalls vollständig offline und nennt beim besten Modell etwa das Dreifache der Audiolänge auf einem gewöhnlichen Notebook; die Ausgabedateien sind nach eigener Angabe direkt in ATLAS.ti und MAXQDA importierbar (uni-graz.at, abgerufen am 22. September 2026).

Wenn Sie genau ein Interview führen, einen halbwegs aktuellen Rechner haben und der Abend Zeit hat: Nehmen Sie eines dieser beiden Werkzeuge. Das ist kein Bescheidenheitsgestus, sondern die sachlich richtige Empfehlung. Kalima lohnt sich, sobald die Menge steigt, die Rechenzeit stört, Aufnahmen vom Telefon dazukommen oder die Sprechertrennung bei mehreren Beteiligten belastbar sein muss.

Der Weg mit Kalima, wenn die Aufnahme schon liegt

Die Aufnahme ist meist schon da, vom Telefon, vom Aufnahmegerät oder aus einer Videokonferenz. Dafür gibt es den Datei-Upload. Kalima nimmt MP3, WAV, M4A, AAC, FLAC, OGG, Opus (auch WhatsApp-Sprachnachrichten), WebM, AIFF und AMR sowie die Videocontainer MP4, MOV und WebM. Bei einem Video wird die Tonspur im Browser herausgelöst, hochgeladen wird nur der Ton.

Die Grenzen hängen am Tarif, und sie sind der einzige Punkt, an dem ein kostenloser Tarif bei Interviews wirklich eng wird:

GrenzeFreePlusPro
Dateigröße50 MB500 MB1 GB
Dauer je Datei30 Min.180 Min.300 Min.
Uploads pro Woche52550

Für jeden Tarif gilt zusätzlich eine feste Obergrenze von 5 Stunden je Datei, und der Wochenzähler springt montags um 00:00 UTC zurück. Praktisch heißt das: Ein 60-Minuten-Interview müssen Sie im kostenlosen Tarif in zwei Teile schneiden, und jeder Teil zählt als eigener Upload. Ein oder zwei Interviews lassen sich so bewältigen, für eine ganze Erhebung planen Sie besser einen bezahlten Tarif ein. Die vollständige Liste steht unter Unterstützte Formate und Grenzen.

Nehmen Sie das Gespräch direkt in Kalima auf, wählen Sie Nachverarbeitung+ statt Echtzeit. Dieser Modus zeigt während des Gesprächs keinen Text, verarbeitet die Aufnahme danach und liefert die höchste Genauigkeit und die beste Sprechertrennung. Beides kostet gleich viel Transkriptionszeit, siehe Aufnahmemodi. Bei einem Leitfadeninterview brauchen Sie ohnehin keinen Live-Text. Sie führen das Gespräch, Sie lesen es nicht mit.

Die Sprechertrennung läuft automatisch und vergibt zunächst Sprecher 1, Sprecher 2 und so weiter. Klicken Sie auf das Sprecherfeld in einem beliebigen Segment und tragen Sie I und B1 ein, dann steht das Kürzel im ganzen Transkript und in jedem Export. Namen dürfen bis zu 50 Zeichen lang sein. Wenn die Zuordnung an einzelnen Stellen nicht stimmt, hilft Stimmen prüfen: Diese Prüfung läuft vollständig auf Ihrem Gerät, lädt beim ersten Mal ein 38 MB großes Modell und braucht etwa 40 Sekunden je Aufnahmestunde. Details unter Sprecher und Diarisierung. Eine Einschränkung sollten Sie kennen: Über getrennte Aufnahmen hinweg erkennt die automatische Trennung keine Identität, dieselbe Person kann in einer späteren Aufnahme eine andere Nummer bekommen.

Vom Transkript in den Anhang

1
Text herausholen. Öffnen Sie den Export-Dialog und wählen Sie Für KI kopieren. Der Name beschreibt das übliche Ziel, nicht den Inhalt: Es ist schlichtes Markdown. Schalten Sie KI-Anweisung aus, lassen Sie Sprechernamen an und entscheiden Sie bei Zeitstempel nach dem Merkblatt Ihres Instituts. Dann in Word einfügen. Für die Analysesoftware laden Sie stattdessen SRT-Untertitel oder VTT-Untertitel herunter.
2
Anonymisieren. Ersetzen Sie Klarnamen, Orte, Arbeitgeber und alles andere Identifizierende durch Platzhalter in eckigen Klammern: [Name B1], [Stadt], [Arbeitgeber]. Führen Sie eine Zuordnungsliste getrennt vom Transkript und legen Sie sie nicht in den Anhang. Das Merkblatt der Universität Basel formuliert es genauso: Klarnamen bleiben intern.
3
Formatieren. Zeilenabstand 1,5, eine Leerzeile bei jedem Sprecherwechsel, Seitenzahlen. Dann in Word über Layout und Zeilennummern eine fortlaufende Nummerierung einschalten, am besten fortlaufend über das gesamte Transkript statt seitenweise.
4
Zitieren. Mit Kürzel und Zeilenangabe, also etwa „Interview B1, Z. 45 bis 78“. Das Merkblatt der Universität Basel verlangt zusätzlich den anonymisierten Namen und das Interviewdatum und lässt Seiten-, Zeilen- oder Minutenangaben zu.
5
Merkblatt prüfen. Das Institut schlägt die Lehrbücher. Das Merkblatt der Volkskunde an der Universität Graz etwa verlangt Datum und Ort im Kopf, empfiehlt Zeilennummern und benutzt einen eigenen Zeichensatz, in dem Überlappungen anders notiert werden als bei Dresing und Pehl.

Beide Merkblätter, abgerufen am 22. September 2026: Universität Graz, Volkskunde und Universität Basel, Kulturanthropologie.

Der Übergang nach MAXQDA

MAXQDA hat im Import eine Auswahlliste mit Transkriptionsprogrammen, und Kalima steht nicht darin. Das ist kein Hindernis. Die Hilfe von MAXQDA hält ausdrücklich fest, dass auch VTT gelesen wird, und zwar mit dem Hinweis, dass dieses Format etwa von Microsoft Teams oder Zoom erzeugt wird; SRT-Untertiteldateien führt sie als eigenen Datentyp. Zur Erkennung heißt es dort: „Wann immer Sie ein Text-Dokument importieren, das Zeitmarken in einem der aufgelisteten Formate enthält, erkennt MAXQDA die Zeitmarken automatisch“ (maxqda.com, abgerufen am 22. September 2026). Exportieren Sie also VTT oder SRT, importieren Sie über den allgemeinen Weg statt über die Programmliste, und verknüpfen Sie anschließend die Mediendatei, damit Sie aus einem codierten Segment zurück in die Aufnahme springen können. Für ATLAS.ti gilt dasselbe Vorgehen. Mehr zu den Formaten unter Transkripte exportieren.

Der Absatz zu Einwilligung und Datenschutz

Sagen Sie vor der Aufnahme, dass Sie aufnehmen, wofür, wie lange Sie die Datei aufbewahren und wie anonymisiert wird, und holen Sie die Zustimmung ein, am besten schriftlich. Das ist keine Formalie: In Deutschland schützt § 201 StGB die Vertraulichkeit des gesprochenen Wortes, und ein Mitschnitt ohne Einverständnis ist strafbar. Formulierungen für die Ansage und für die Einwilligung finden Sie unter Einwilligung zur Aufnahme richtig formulieren.

Für den Methodenteil hilft es, konkret zu benennen, was mit der Aufnahme geschieht. Bei Kalima gilt: Verbindungen sind verschlüsselt, die Daten liegen in der EU, Audio und Transkripte werden nicht für das Training von Modellen verwendet, Freigaben sind standardmäßig aus, und Sie können Ihre Daten selbst exportieren und löschen. Was diese Anleitung nicht behaupten kann und nicht behauptet: dass damit jede Anforderung Ihrer Hochschule erfüllt ist. Kuckartz und Rädiker weisen genau darauf hin, dass bei jedem externen Dienst Serverstandort und Auftragsverarbeitung zu prüfen sind, und viele Institute schreiben für personenbezogene Forschungsdaten eigene Wege vor. Stimmen Sie den Absatz mit Ihrer Betreuung und mit der oder dem Datenschutzbeauftragten Ihrer Einrichtung ab, bevor Sie das erste Interview führen. Wenn Ihre Ethikkommission verlangt, dass die Audiodatei das Institutsnetz nicht verlässt, ist ein lokales Werkzeug die richtige Antwort, nicht ein Onlinedienst.

Häufige Fragen

Muss ich wirklich jedes „ähm“ transkribieren?

Nach den einfachen Regeln nicht. Fülllaute werden nur transkribiert, wenn ihnen inhaltliche Bedeutung zukommt, und zustimmende Signale der zuhörenden Person bleiben weg, außer die Antwort besteht nur daraus. Nach den erweiterten Regeln dagegen wird alles notiert. Entscheiden Sie das einmal für die ganze Arbeit und schreiben Sie die Entscheidung in den Methodenteil.

Reicht ein automatisches Transkript für eine Bachelorarbeit?

Als Ausgangspunkt ja, als Endergebnis nein. Wörtlichkeit, Absatzstruktur, Sprecherkürzel und Zeitmarken kommen automatisch, Pausen, Betonungen, Lautäußerungen und Überlappungen nicht. Planen Sie den Korrekturdurchgang fest ein, in der Literatur sind dafür etwa 3 bis 6 Stunden je Interviewstunde angesetzt.

Wie lange brauche ich für acht Interviews à 60 Minuten?

Von Hand nach den gängigen Angaben 40 bis 80 Stunden. Mit einem automatischen Transkript und einem sorgfältigen Korrekturdurchgang eher 24 bis 48 Stunden plus Rechenzeit. Beides sind Spannen, keine Versprechen; Aufnahmequalität und Mundart verschieben das Ergebnis am stärksten.

Wie bekomme ich „I:“ und „B1:“ statt „Sprecher 1“ ins Transkript?

Klicken Sie im Studio auf das Sprecherfeld eines Segments und tragen Sie das Kürzel ein. Es gilt sofort für alle Segmente dieser Stimme und erscheint in jedem Export. Ändern dürfen das nur Besitzerinnen und Besitzer der Sitzung, nicht Personen, mit denen Sie sie geteilt haben.

Kann ich das Transkript in MAXQDA weiterverwenden?

Ja, über VTT oder SRT. MAXQDA erkennt die Zeitmarken beim Import automatisch. Kalima taucht in der Programmauswahl von MAXQDA nicht auf, nehmen Sie deshalb den allgemeinen Importweg.

Darf ich das Interview überhaupt aufnehmen?

Nur mit Einwilligung. Sagen Sie vor dem Start, dass aufgenommen wird, wozu, wie lange gespeichert wird und wie anonymisiert wird, und holen Sie die Zustimmung schriftlich ein. § 201 StGB stellt die Aufnahme des nichtöffentlich gesprochenen Wortes ohne Einverständnis unter Strafe. Die Anforderungen Ihrer Ethikkommission kommen obendrauf.

Weiterführend

Testen Sie Kalima in Ihrem nächsten Gespräch.

Live-Transkription und Übersetzung, ohne Bot im Meeting. Kostenlos starten.

Kostenlos starten

Weiter lesen.