分享 Collins COBUILD Phrasal Verbs Dictionary 4th mdx

更新:已删除超级js版(太邪修了)和跳转版,统一为 静态拆分版,兼容性最佳。

请重新下载更新。


数据来源:Collins COBUILD Phrasal Verbs Dictionary 4th 2020最新版
感谢 @教会mission 无私分享高清pdf!

下载地址:

能做这本吗?收词比牛津还多,有大量漫画插图

图片比较多的不太好处理,不过可以试试。

这个词头数据你有吗?

你现在用的哪个ocr工具啊,可以选paddleocr和mineru来处理图片,取md格式就可以了,或者大模型加提示词输出坐标再去原图截取。我为了解决日本語大辞典的问题已经给校对工具加了图片功能,不过还在测试。

主要还是用gemini,主要原因是 paddleocr和mineru 不能输出带格式(粗体、斜体)的md文件。
还没试过截取图片。
你说的“提示词输出坐标再去原图截取”是个不错的方案。
我尝试一下先。

可以用gemini和paddleocr ocr两份,然后把图片插入到gemini版,日本语新辞典我就是这么做的。

感谢!!!!

Excellent work!!!
I am about to get my hands on Oxford Thesaurus (the one which is part of OALD10). I hope you could help me with OCR stuff and how to convert it to mdx.

新增超级js版,见1楼;

修复多词典 锚点冲突问题(影响页内跳转),现在css、锚点都是唯一的;

请全部重新下载替换。

简单来说,如下三步:

  1. 清理 PDF 文件: 移除页眉、页脚及其他干扰内容,得到干净的 PDF。

  2. AI OCR 识别: 运用高精度 AI OCR 技术生成带有格式标记(如粗体斜体)的 Markdown 文件(一般 OCR 识别结果不带格式,后续会很难处理)。

  3. 转换为 MDict 格式: 利用 AI 处理 Markdown 文件,将其最终转换为 MDict txt 格式。

Simply put, it takes three steps:

  1. Clean PDF: Remove headers, footers, and other distractions to get a clean PDF.

  2. High-Precision AI OCR: Run high-accuracy AI OCR to generate a Markdown file with formatting tags like bold and italics (standard OCR usually strips formatting, making downstream processing difficult).

  3. Format Conversion: Use AI to process the Markdown file and convert it into MDict TXT format.

您好,感谢制作!

发现几处版面瑕疵,说不定是全面性的问题,方便的话,可以考虑通盘检查一下,谢谢!

(我是用官方版的GD)

以上 均已修复,请重新下载替换。


deprive等词音标识别错误

我觉得音标要完全辨识成功,可能真的比较难,如果实在没办法,直接隐藏起来也是一招,我们看别本辞典的音标即可,反正音标大家都差不多。会这样说,主要是不舍楼主花太多时间,弄相对比较不重要的内容…。

更新:已删除 超级js版(太邪修了)和跳转版,统一为 静态拆分版,兼容性最佳。
请重新下载更新。

音标问题暂时不打算处理,谢谢理解。

音标 建议参考 专门的音标词典。

版面有点问题:


火眼金睛 :+1: 稍后更正

已修复。