写了一个电子书和音频对齐工具

  • 对于8个小时的音频hp.mp3, 开始也想分段识别。 后面发现 CapsWriter-Offline 搭配Qwen3或SenseVoice-Small(具体看配置),不用vad 切片 也能得到完整的:①带时间单词级别的json ②纯文本txt③srt字幕。 提一句,对于断句,识别小错误可以通过修改②借助①重新得到③。
  • 在上面①带时间单词级别的json + ④小说文本基础上进行对齐,会不会更轻量方便些?
    – ①和④也不一定谁包含谁, ①里面可能有很多错误,漏读, 导言多读的。④里面也可能多一些AA said 这个叙述文字。
    – ① 也不一定要多准确,只要大部分正确, 通过前面捋顺的, 得到朗读速度, 也可以定位④中文本大概位置