Wer zum ersten Mal ein Interview transkribieren lässt, fragt meist nur nach Preis und Lieferzeit. Beides lässt sich erst seriös beantworten, wenn klar ist, wie genau der Text die Aufnahme abbilden soll. Zwischen einer glättenden Mitschrift und einer Transkription, die jedes Äh und jede Pause festhält, liegen Welten, und zwar im Aufwand ebenso wie im Ergebnis. Diese Entscheidung gehört an den Anfang des Projekts, nicht in die Korrekturschleife am Ende.
Warum das Regelwerk vor der Arbeit kommt
Ein Transkript ist kein neutrales Abbild, sondern bereits eine Interpretation. Was aufgenommen wird und was wegfällt, bestimmt, welche Auswertung später möglich ist. In der qualitativen Sozialforschung ist das ein anerkanntes Methodenproblem, und genau deshalb legen Projekte ihre Transkriptionsregeln schriftlich fest, bevor die erste Datei übergeben wird. Auch außerhalb der Wissenschaft lohnt sich dieser Schritt. Eine Marktforschungsagentur braucht andere Details als eine Anwaltskanzlei, die eine Zeugenaussage dokumentiert, und ein Podcastteam wieder andere.
Einfach oder erweitert
Die einfache Transkription glättet: Dialekt wird ins Hochdeutsche übertragen, Wortwiederholungen und Füllwörter fallen weg, Sätze werden lesbar interpungiert. Sie eignet sich, wenn es um Inhalte geht, etwa bei Experteninterviews oder Protokollen. Die erweiterte oder wissenschaftliche Transkription hält dagegen Pausen, Überlappungen, Betonungen, Lachen und Abbrüche fest, oft nach einem etablierten System. Sie ist zwei- bis dreimal so aufwendig und damit entsprechend teurer. Wer unsicher ist, lässt ein kurzes Probetranskript von fünf Minuten anfertigen. Das kostet wenig und beantwortet die Frage besser als jede Beschreibung.
Anonymisierung gehört dazu
Sobald Personen über sich selbst sprechen, entstehen personenbezogene Daten, und die Transkription ist der praktischste Moment, sie zu entschärfen. Üblich ist ein Pseudonymisierungsschlüssel: Namen, Orte, Arbeitgeber und markante Details werden durch Platzhalter ersetzt, die Zuordnung liegt getrennt vom Transkript. Wie weit das gehen muss, hängt vom Zweck und von der Einwilligung ab. Das Portal forschungsdaten.info fasst die Vorgaben zum Datenschutzrecht im Forschungsdatenmanagement verständlich zusammen. Klar ist: Wer erst nach der Auswertung anonymisiert, macht die Arbeit zweimal.
Was automatische Transkription leistet
Die Spracherkennung ist in den letzten Jahren gut geworden. Bei einer sauber aufgenommenen Einzelstimme in Standardsprache liefert sie brauchbare Rohtexte. Sie scheitert aber verlässlich dort, wo es interessant wird: bei Dialekt, bei mehreren Sprechenden, die einander ins Wort fallen, bei Fachvokabular, Eigennamen und Hintergrundgeräuschen. Und sie erfindet im Zweifel etwas Plausibles, statt eine Stelle als unverständlich zu markieren. Genau das macht sie für rechtlich oder wissenschaftlich belastbare Texte problematisch. In der Praxis hat sich ein Mischmodell bewährt: maschineller Erstdurchlauf, danach vollständige Korrektur durch eine Person, die mithört. Das spart Zeit, ohne die Verlässlichkeit zu opfern.
Zeitmarken, Sprechersiglen, Dateinamen
Drei Kleinigkeiten entscheiden darüber, ob das Transkript später angenehm zu benutzen ist. Zeitmarken alle ein bis zwei Minuten oder bei jedem Sprecherwechsel erlauben es, eine Stelle in der Aufnahme wiederzufinden. Einheitliche Sprechersiglen wie I für die interviewende und B für die befragte Person halten das Dokument übersichtlich und maschinenlesbar. Und ein Dateiname, der Projekt, Fallnummer und Datum enthält, erspart später das Suchen. Wer mit Analysesoftware arbeitet, klärt vorher das Zielformat ab, denn ein nachträglicher Import kostet oft mehr Zeit als die Transkription selbst.
Die Aufnahme bestimmt den Preis
Abgerechnet wird meist pro Audiominute, und der Faktor zwischen Aufnahmedauer und Arbeitszeit schwankt enorm. Eine ruhige Zweiergesprächsaufnahme mit externem Mikrofon liegt bei etwa vier bis fünf Minuten Arbeit pro Audiominute. Eine Gruppendiskussion, aufgenommen mit dem Handy mitten im Raum, kann das Doppelte verschlingen. Es lohnt sich deshalb, in die Aufnahme zu investieren: ein Ansteckmikrofon pro Person, ein Raum ohne Hall, kein Klappern von Tassen auf dem Tisch. Eine kurze Ansage zu Beginn, wer spricht, hilft zusätzlich bei der Zuordnung.
Wenn das Interview mehrsprachig ist
Bei internationalen Projekten stellt sich die Frage, ob in der Originalsprache transkribiert und anschließend übersetzt wird oder direkt in der Zielsprache mitgeschrieben. Methodisch sauber ist der erste Weg, weil das Original als Beleg erhalten bleibt und die Übersetzung überprüfbar ist. Wer die Ergebnisse später publiziert, sollte ohnehin frühzeitig planen, wie sich wissenschaftliche Texte übersetzen lassen, ohne dass Zitate ihre Bedeutung verschieben. PoliLingua beschreibt in einem Überblick zur Audio- und Videotranskription, welche Formate sich für welchen Zweck eignen.
Wer die Aufnahme zu hören bekommt
Interviews enthalten oft mehr, als die Befragten im Moment des Sprechens bedenken. Deshalb gehört zum Auftrag immer die Frage, wer die Datei tatsächlich hört und wo sie liegt. Ein seriöses Schreibbüro arbeitet mit einem festen, namentlich benannten Kreis, unterzeichnet eine Vertraulichkeitsvereinbarung und bietet einen verschlüsselten Upload statt E-Mail-Anhang an. Ebenso wichtig ist die Frage nach dem Ende: Nach welcher Frist werden Audiodatei und Zwischenstände gelöscht, und wird das bestätigt? Wer im medizinischen oder juristischen Umfeld arbeitet, braucht diese Zusagen ohnehin schriftlich, und zwar vor der ersten Übertragung.
Eine kurze Absprache spart Tage
Zehn Minuten Vorgespräch reichen in der Regel aus: Zweck des Transkripts, gewünschte Genauigkeit, Umgang mit Namen, Zeitmarken, Format, Liefertermin. Halten Sie das Ergebnis in einer kurzen Notiz fest und legen Sie sie dem Auftrag bei. Wer regelmäßig transkribieren lässt, entwickelt daraus ein eigenes Regelblatt, das mit jedem Projekt genauer wird. Das ist unspektakulär, aber es ist der Unterschied zwischen einem Text, mit dem man sofort arbeiten kann, und einem, der erst noch überarbeitet werden muss.
