Whisper-Transkription garantiert keine zeitliche Zuordnung auf Wortebene
Die Ausgabe der grundlegenden Whisper-Transkription enthält üblicherweise Zeitstempel auf Segmentebene, die für Untertitel, Karaoke-ähnliche Hervorhebungen oder präzise Bearbeitung zu ungenau sein können.
Workaround
Verwenden Sie das Alignment von WhisperX, wenn einzelne Wörter möglichst genau dem Audio zugeordnet werden müssen.