更新:已删除超级js版(太邪修了)和跳转版,统一为 静态拆分版,兼容性最佳。
请重新下载更新。
数据来源:Collins COBUILD Phrasal Verbs Dictionary 4th 2020最新版
感谢 @教会mission 无私分享高清pdf!
下载地址:
更新:已删除超级js版(太邪修了)和跳转版,统一为 静态拆分版,兼容性最佳。
请重新下载更新。
数据来源:Collins COBUILD Phrasal Verbs Dictionary 4th 2020最新版
感谢 @教会mission 无私分享高清pdf!
下载地址:
能做这本吗?收词比牛津还多,有大量漫画插图
图片比较多的不太好处理,不过可以试试。
这个词头数据你有吗?
你现在用的哪个ocr工具啊,可以选paddleocr和mineru来处理图片,取md格式就可以了,或者大模型加提示词输出坐标再去原图截取。我为了解决日本語大辞典的问题已经给校对工具加了图片功能,不过还在测试。
主要还是用gemini,主要原因是 paddleocr和mineru 不能输出带格式(粗体、斜体)的md文件。
还没试过截取图片。
你说的“提示词输出坐标再去原图截取”是个不错的方案。
我尝试一下先。
可以用gemini和paddleocr ocr两份,然后把图片插入到gemini版,日本语新辞典我就是这么做的。
感谢!!!!
Excellent work!!!
I am about to get my hands on Oxford Thesaurus (the one which is part of OALD10). I hope you could help me with OCR stuff and how to convert it to mdx.
新增超级js版,见1楼;
修复多词典 锚点冲突问题(影响页内跳转),现在css、锚点都是唯一的;
请全部重新下载替换。
简单来说,如下三步:
清理 PDF 文件: 移除页眉、页脚及其他干扰内容,得到干净的 PDF。
AI OCR 识别: 运用高精度 AI OCR 技术生成带有格式标记(如粗体、斜体)的 Markdown 文件(一般 OCR 识别结果不带格式,后续会很难处理)。
转换为 MDict 格式: 利用 AI 处理 Markdown 文件,将其最终转换为 MDict txt 格式。
Simply put, it takes three steps:
Clean PDF: Remove headers, footers, and other distractions to get a clean PDF.
High-Precision AI OCR: Run high-accuracy AI OCR to generate a Markdown file with formatting tags like bold and italics (standard OCR usually strips formatting, making downstream processing difficult).
Format Conversion: Use AI to process the Markdown file and convert it into MDict TXT format.
以上 均已修复,请重新下载替换。
我觉得音标要完全辨识成功,可能真的比较难,如果实在没办法,直接隐藏起来也是一招,我们看别本辞典的音标即可,反正音标大家都差不多。会这样说,主要是不舍楼主花太多时间,弄相对比较不重要的内容…。
更新:已删除 超级js版(太邪修了)和跳转版,统一为 静态拆分版,兼容性最佳。
请重新下载更新。
音标问题暂时不打算处理,谢谢理解。
音标 建议参考 专门的音标词典。
火眼金睛
稍后更正