La transcripción de Whisper no garantiza una sincronización a nivel de palabra
La salida de la transcripción de Whisper normalmente proporciona marcas de tiempo a nivel de segmento, que pueden ser demasiado amplias para subtítulos, resaltado tipo karaoke o edición precisa.
Solución alternativa
Utiliza la alineación de WhisperX cuando cada palabra deba corresponder estrechamente con el audio.