- 当时提HarryPotter字幕快速生成的探讨 主要是下面场景。
- 对于8个小时的音频hp.mp3, 开始也想分段识别。 后面发现 CapsWriter-Offline 搭配Qwen3或SenseVoice-Small(具体看配置),不用vad 切片 也能得到完整的:①带时间单词级别的json ②纯文本txt③srt字幕。 提一句,对于断句,识别小错误可以通过修改②借助①重新得到③。
- 在上面①带时间单词级别的json + ④小说文本基础上进行对齐,会不会更轻量方便些?
– ①和④也不一定谁包含谁, ①里面可能有很多错误,漏读, 导言多读的。④里面也可能多一些AA said 这个叙述文字。
– ① 也不一定要多准确,只要大部分正确, 通过前面捋顺的, 得到朗读速度, 也可以定位④中文本大概位置