哈利波特full-cast版 字幕srt以及点读html生成教程,以及成品展示,目前只有前2章

成品展示

感谢坛友@wynick27 提供的点读版html

感谢坛友@淳帅二代 开发的的srt字幕转录工具,以及点读工具

那么话不多说,实际成品如下。

通过网盘分享的文件:Harry-Potter-点读第二版.html
链接: 百度网盘 请输入提取码 提取码: dxx7
–来自百度网盘超级会员v8的分享

为什么我不直接使用上述两位的成品?我的成品与他们有何不同?

首先,我采取的是淳帅二代的方法,利用CPU: i7-12700KF 12核20线程@3.6GHz 睿频:5.0GHz 内存:32GB 显卡4070的电脑,用他在github上推荐的 【 独显电脑优先用 Qwen3-ASR-1.7B-q5_k,准确率夯爆】然后根据操作指南,这般如此,如此这般,不懂的就去问ai,下载了ffmpeg后,终于搞出了最初的srt文件。然后,我就将其导入了SupTap里点读,此时出现第一个问题。

哇靠,句子散的不成样子,这样怎么点读?

但是解决办法很简单,把srt文件给gpt,让他帮你按整句分割就行了。gpt 6超好用,基本一次完工不需要返工。

然后成品是这样的。

一般人到这里也就结束了,但是我是一个完美主义者,注意看,高亮的那段话。

The Dursleys had a small son called Dudley, and in their opinion, there was no finer boy any.

这根本就不是一句话,音频识别效果是不错,但是不够完美,如果哈利波特是一部纯音频剧,没有原文对照,那么我也只能遗憾退场,将就着用了。但并不是,哈利波特有原著,而且full-cast是改动相对较少,绝大部分贴合原著的音频改编,因此我去z-library下载了哈利波特全集。

然后用calibre阅读器打开哈利波特全集

啊哈,答案找到了。

但是我很懒,我不想一句一句的对照字幕文件修改,怎么办?

没错,还是ai,直接把第一章的srt字幕文件,和第一章的原文复制过去,让ai帮你改就是了,之前我发的ai提示词里,其实已经是完全版。不要发音频文件,因为gpt识别不了,还要额外下模型。但或许,让GPT自己下模型,就可以省略掉之前自己动手制作srt字幕文件的过程?我没试过,不知道。

还有,之前淳帅二代的方法,需要你有一台windows带独立显卡的电脑,而我没有,因为我是mac系统。而我又不想去网吧,或者再买一台新电脑,这又该怎么办?以防被认为是打广告,我就隐去品牌名字,反正我就用60块钱开了云电脑的月卡,每月有90小时的4070显卡的windows电脑的使用时间,足够我各种转录音频了。

然后这就是更加完美的版本。

然后我又发现一个问题,那就是这个SupTap只能点读,而不能连续播放。当然,也有可能是我还没搞懂它怎么用,反正对于我而言,它不能连续播放,这又是一个痛点。

解决办法又很简单,因为我有每日英语听力永久会员,所以直接把音频和字幕文件导入进去就完事了。

对于我来说,已经完美解决了。可是每日英语听力会员蛮贵的,没有办法共享,怎么办?这时,我又发现了wynick27的帖子,点读html版哈利波特,可以连续播放,单句循环,和点读,满足了大部分需求,但是我下载后发现有几点不满意的地方。

字体太小了,看着很废眼睛,而且部分音频对齐也不是很完美。但主要是字体太小。

然后我就让gpt照着wynick27的格式,制作出更完美的html版本,注意,必须用gpt6,用5.6大概率会不停返工。

现在的版本可以改变字体,字体颜色,背景颜色,文字大小,行间距,行宽,字间距。还有本来的单句循环功能,连续播放,点读功能,加减速功能。以及音频对齐的更好的srt文件。

具体做法就是把wynick27的html文件打包发给gpt。

然后你许愿你想要什么功能,GPT6就会给你实现,非常的轻松,非常的省力。

至于为什么没做完也很简单,因为我的plus额度不够用了,做不完了。我还录了很多pdf的书签,包括之前朗文6英英词典全彩版的书签制作。

但是方法很简单,任何人都可以按照这个方法,制作任何有实体书的音频素材的点读版了。授人以鱼不如授人以渔,大家可以利用这个方法,制作任何喜欢的音频书的点读版。没有gpt会员也没关系,再等一会等到国产模型追上gpt6的进度,也可以做到。ai不用早学,越晚学发现越傻瓜操作,根本不用学,大白话许愿就完事了。

我发的版本里面本来就有srt啊,我那个html的来源就是电子书,然后对齐工具我也写了,我就是先qwen对齐然后人工校对的啊,看了帖子感觉你在做重复劳动

抱歉,我的工具转录出来的字幕分段太差劲,是一个已知 bug,我已经改完了并且已经 push 了,只是还没有做最新的打包,只是自己在用。

SubTap 要求点一句读一句,是故意的设计,因为不同句子的信息密度不同。读完一个句子如果没有消化的话,就立马开始读下一个句子,会让人注意力涣散。就像听课的时候有一句没跟上,后面半节课都听不懂了。可以用键盘快捷键上和下控制上一句下一句。

左边是我按照纯音频转录的srt,右边是你的srt
我其实一开始没有看见你的帖子,按淳帅二代的方式直接从音频转录过来的。然后我才看到你的帖子,下载后我发现你的html在后半段音频对齐有很大问题,就是在good luck,harry那里。你的srt文件后面有一个he murmured,我在音频中没有听见,但是我在原版书籍里看见确实有这段话。可能是因为音频书改编的时候,把一些细节以环境音或者动作音的形式省略掉了。而且我比较喜欢一整段话连起来不分段的整句式srt。

比如左边的大长句我喜欢不分段,右边你分段了。

所以我就以音频为主,原文为辅重置了srt文件。

因为这个工具是电子书和有声书对齐的,文本是来自电子书,有声书根本没读这句话当然听不到了,这个多人配音版是广播剧性质的,不是逐句和书一致的。所以肯定是电子书有音频没有的不对齐,而不是改电子书文本把音频没有的删除,我写的工具还支持直接导出支持点读的epub 3。另外也是可以自由合并拆分句子的,我是特意把长句拆分了。不管拆分还是合并,用其他工具例如subtitle edit都可以编辑字幕的,不需要重新转录。而且单纯转录文本是不准确的,特别是有背景噪音,特殊音量,多人对话的情况转录问题挺大的。

主要是分享一下新手如何转录出质量较好srt字幕文件,制作音频点读html,把界面改的更方便阅读的教程。如果之后有人有兴趣的话,也可以用类似的方式制作其他有声书籍,不仅仅是哈利波特。

我的想法是,原文只做参照,只依照转录出来的音频文本为主,如果音频里没有,那么srt字幕里也不要有。只有在音频文本出现明显的句子错误或不通顺时,对照原文稍微改动一下。重新转录是为了确保文本一定是出自音频,但是也还是半成品,需要用ai分析整合,重排时间轴才能达到一个比较好的效果。如果直接沿用来自电子书的文本,是没办法知道文本是否出自音频的。

然后你那个音频对齐工具的帖子我没看懂,我是纯新手不会编程。我只是看了你那个哈利波特帖子下面发的html文件,觉得不够完美,就自己试着让ai改了,改的反正蛮符合我的需求的。我就想,既然我都能改出一个不错的成品,那么其他人也可以,其他人可能也有类似的需求,但他们可能只是不知道,现在已经这么方便了,所以我就发了一下教程,从纯新手的角度,完成一个制作音频点读书籍的教程。

其实我写的工具这些功能都实现了,只要载入电子书->载入音频->自动匹配音频和书的章节->转录全部章节->调整校对->导出html就完了。 如果想改样式直接交给ai在html上改样式就行了,字体大小ctrl+鼠标滚轮就能解决,不需要复杂设定。 然后你认为多了个没有读出来的旁白是很大问题的话直接从html里面把旁白删除就好了。结果现在重新转录,然后发现转录断句不准又让ai重新断句,然后发现转录内容不准,又让ai重新和原书对齐,但是原书这时候已经文本化了,丢失了原epub的样式,然后又让ai对照带样式的html改,绕了一大圈回到原点,而且还退步了,因为原来有的地方考asr是不能准确对齐的,比如唱校歌那段我是手动对齐的,等于费半天功夫还有token反而得到一个劣化版。

我那个音频工具有release,直接下载exe就可以用,当然要用gpu版需要是nvidia显卡然后下载gpu的包,程序内就能下载。

我不知道是否是我的操作有误,不过我先和你对齐一下我这边的操作。首先,我打开的是你发的链接里面下载后解压出来的html文件里的Harry Potter 1 With Audio,里面的index.html文件。

然后我发现,在中段以后,音频对齐就出现很大问题,比如你说的第七章唱校歌。当音频是
Hog­warts, Hog­warts, Hoggy Warty Hog­warts的时候,高亮却已经跑到 For now they’re bare and full of air,
点读效果就很不理想了。

然后我去直接用你的srt文件当外挂字幕导入的时候,句子之间还是有轻微的偏移,不够完美。有些部分偏移的很轻微,但是第一部第一章节开始,我就发现在html文件中,前面几句可以比较准确的对应,但是一到中期,邓布利多说莉莉死讯的时候,就偏的很厉害了。直接导入这一章节的srt文件,那从第一句开始就开始偏,更不能用。我也不知道该怎么解决,于是就重造更加精准的字幕文件,点击跳转的更加精准一点。

我不知道你对没对比过我的html和你发的原来那个html,虽然我只录了前两章,但是前两章基本点到那句就是读那句,就算点到中段,末段也还是比较精准。你的html在我的电脑上点击的时候,前面还好,后面就有很大偏差。我认为是GPT 6新模型出来后,对于字幕时间轴的划分更精准了,比起以前的旧模型更好用。