
Audio & Aufnahme
Untertitel und Transkription
Automatische Spracherkennung macht einen schnellen ersten Entwurf. Für ein veröffentlichbares Transkript oder gut lesbare Untertitel braucht es danach eine Prüfung …
Automatische Spracherkennung macht einen schnellen ersten Entwurf. Für ein veröffentlichbares Transkript oder gut lesbare Untertitel braucht es danach eine Prüfung am tatsächlichen Ton und am Wiedergabegerät. Ein falsch erkannter Name, eine vertauschte Sprecherrolle oder ein verlorenes „nicht“ kann die Aussage verändern.
Zwei Ausgaben, zwei Aufgaben
Untertitel laufen zeitlich mit einem Video. Sie müssen beim Anschauen lesbar sein und auch relevante Geräusche sowie Sprecherwechsel vermitteln, soweit diese für das Verständnis nötig sind.
Ein Transkript steht als zusammenhängender Text bereit und kann strukturierte Abschnitte, Namen und bei Bedarf Zeitmarken enthalten. Eine automatisch erzeugte Textdatei erfüllt beides nicht von selbst.
Beginnen Sie mit einer klaren Aufnahme, aber rechnen Sie trotzdem mit Fehlern. Dialekte, Hintergrundgeräusche und Namen können automatische Untertitel verfälschen. Beurteilen Sie ein Werkzeug daher am Korrekturaufwand mit eigenem Material statt an einer Muster-Demo.
Transkription und Spotting unterscheiden
Bei einer Transkription wird der gesprochene Text einer Audio- oder Videodatei Wort für Wort verschriftlicht. Das Ergebnis kann als einfache Textdatei vorliegen, etwa für ein Meeting, eine Radiosendung oder einen Podcast. Zeitangaben für die Einblendung einzelner Textpassagen gehören nicht automatisch dazu.
Für Untertitel kommt meist das sogenannte Spotting hinzu: Dabei wird festgelegt, wann und wie lange jeder Textblock erscheint. Der Text wird dafür unter anderem auf Zeilenumbrüche und die verfügbare Lesezeit verteilt. Spezielle Untertitelungsprogramme können daraus Dateien mit Zeitstempeln erstellen.
Auch die Art der Untertitel richtet sich nach dem Zweck. Klassische Untertitel geben Dialoge in einer anderen Sprache wieder; Untertitel für hörgeschädigte Menschen vermitteln zusätzlich wichtige Geräusche und andere hörbare Informationen.
Untertitel können fest ins Video eingebaut oder als zuschaltbare Spur bereitgestellt werden.
Barrierefreiheit als Entscheidungskriterium
Die W3C-Web-Accessibility-Initiative beschreibt in WCAG-Erfolgskriterium 1.2.2, Level A, Untertitel für vorproduzierte Audioinhalte in synchronisierten Medien als Kriterium. Ausgenommen sind Medien, die selbst eine klar gekennzeichnete Alternative zu Text darstellen. Gehörlose und schwerhörige Menschen sollen die Audioinformationen eines Videos über Untertitel zugänglich erhalten.
Dazu gehören nicht nur Dialoge: Das W3C nennt auch die Identifikation der sprechenden Person und bedeutungsvolle Informationen aus Geräuschen, etwa relevante Soundeffekte. Die Entscheidung, welche nichtsprachlichen Töne aufgenommen werden, hängt davon ab, welche Informationen das Publikum zum Verständnis benötigt.
Einen kontrollierten Prüfablauf verwenden
- Hören Sie die Aufnahme abschnittsweise gegen den erzeugten Text ab.
- Markieren Sie Eigennamen, Zahlen, Verneinungen und Fachbegriffe zuerst; hier ändern Fehler schnell den Sinn.
- Prüfen Sie Sprecherwechsel und kennzeichnen Sie nicht erkennbare Passagen als unverständlich, statt Wörter zu erraten.
- Ergänzen Sie relevante Geräusche, wenn deren Information für das Verständnis nötig ist.
- Prüfen Sie Untertitel mit Bild und Ton auf Timing, Zeilenbruch und Lesbarkeit.
- Lesen Sie das endgültige Transkript noch einmal als eigenständigen Text.
Wiedergabe im Ausgabekontext prüfen
Prüfen Sie Untertitel auf dem vorgesehenen Wiedergabegerät; die konkrete Darstellung hängt vom Format und Layout ab.
Orientierung an deutschsprachigen Untertitelstandards
Die neun Landesrundfunkanstalten der ARD, ARD Text, ORF, SRF und ZDF haben gemeinsame Grundsätze für Untertitel im deutschsprachigen Raum festgelegt. Sie dienen als redaktionelle Orientierung für deren Arbeit; sie sind nicht automatisch Vorgaben für jedes Videoformat.
Als Grundform nennen die Standards höchstens zwei Zeilen, zentriert am unteren Bildrand.
Für eine Zeile sehen die Standards maximal 37 Zeichen vor. Die Standzeit richtet sich nach der Textmenge; als Basiswert gelten 13 bis 15 Zeichen pro Sekunde, die Mindeststandzeit beträgt eine Sekunde.
Zwischen zwei Untertiteln soll mindestens ein Frame Abstand liegen; bei Live-Sendungen kann dieser Abstand entfallen.
Untertitel sollen synchron zu Bild und Ton erscheinen, Schnitte berücksichtigen und möglichst nah am Originaltext bleiben. Für die Rechtschreibung gelten die Regeln der neuen deutschen Rechtschreibung nach Dudenempfehlung. Einblendungen wie Inserts sollen möglichst nicht von Untertiteln verdeckt werden.
Farben können Sprecherinnen und Sprecher kennzeichnen, sollen aber sparsam eingesetzt werden. Die genannten Standards verwenden Weiß, Gelb, Cyan und Grün auf schwarzem Hintergrund; Rot und Blau werden wegen der schlechten Lesbarkeit vermieden. Ist eine Person nicht im Bild oder ist die Sprechweise wichtig, können Name oder ein Hinweis wie „flüstert“ in Klammern vorangestellt werden.
Deutschsprachige Untertitelstandards: Richtwerte für Lesbarkeit und Timing
- Max. Zeichen pro Zeile37 Zeichen
- Lesegeschwindigkeit13–15 Zeichen pro Sekunde
- Mindeststandzeit1 Sekunde
- Abstand zwischen UntertitelnMindestens 1 Frame
Weiterverwendung
Ein Transkript hält das Gesprochene schriftlich fest und lässt sich für Meetings, Radiosendungen oder Podcasts nutzen. Für einen Podcast macht es den Inhalt zudem für Suchmaschinen sichtbar und kann das Ranking der Website verbessern.
Konventionen für ein gut nutzbares Transkript
Sprecherinnen und Sprecher können im Transkript mit Namen gekennzeichnet werden, wenn das für das Verständnis relevant ist. Das W3C nennt als übliche Konvention den vollständigen Namen bei der ersten Nennung und danach eine kürzere Namensform. Solche Konventionen sind Empfehlungen und keine zwingenden Regeln.
Nichtsprachliche Geräusche lassen sich nach einer verbreiteten Schreibweise in Klammern, kleingeschrieben und kursiv wiedergeben. Hintergrundmusik muss nicht pauschal beschrieben werden: Das W3C empfiehlt, sie nur aufzunehmen, wenn sie für das Verständnis wichtig ist, und sie sachlich statt wertend zu charakterisieren.
In diesem Leitfaden
- Sprecherzuordnung mit einer Testaufnahme bewertenEin Transkript mit korrekten Wörtern kann dennoch falsch sein, wenn Aussagen der falschen Person zugeordnet werden. Testen Sie die Sprechererkennung eines Werkzeugs …
- Untertitel auf dem Smartphone lesen und prüfenUntertitel, die auf dem großen Schnittmonitor gut aussehen, können auf dem Telefon zu klein, zu schnell oder verdeckt sein. Prüfen Sie die fertige Wiedergabe auf …



