[1]
M. Kim, C. W. Kim, and Y. M. Ro, “Deep Visual Forced Alignment: Learning to Align Transcription with Talking Face Video”, AAAI, vol. 37, no. 7, pp. 8273–8281, Jun. 2023.