# 分享《日汉双解学习词典（第二版）》 pdf及ocr结果

**URL:** <https://forum.freemdict.com/t/topic/41696>\
**Category:** 日语\
**Tags:** 日中辞典, 日汉双解, pdf\
**Created:** [2025 年9 月 28 日 02:55 UTC](https://forum.freemdict.com/t/topic/41696 "2025-09-28T02:55:32Z")\
**Posts on this page:** 20\
**Page:** 2

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 10 日 05:09 UTC](https://forum.freemdict.com/t/topic/41696/21 "2025-10-10T05:09:11Z")

</div>

修改了下之前拉鲁斯的切图程序，现在可以切分词条了，还加入了图片和表格的处理：

 ![page_0027](https://forumcdn.freemdict.com/uploads/default/original/3X/0/c/0c1dd18392426514c39323b773d8a4323122105a.jpeg)

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 14 日 02:17 UTC](https://forum.freemdict.com/t/topic/41696/22 "2025-10-14T02:17:08Z")

</div>

补充一个完整Gemini识别的文本（不含附录），页码确认正常，序号做了简要修复

[日汉双解学习词典\_gemini.txt](https://forum.freemdict.com/uploads/short-url/l6mWmi9p3qCW1A2n9YV0FEAeL06.txt) (9.9 MB)

---

<div class="post-metadata">

作者： ![mixivivo](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/m/8491ac/32.png) [@mixivivo](https://forum.freemdict.com/u/mixivivo)\
发布日期： [2025 年10 月 14 日 02:25 UTC](https://forum.freemdict.com/t/topic/41696/23 "2025-10-14T02:25:57Z")

</div>

只要没什么生僻难字，Gemini 2.5 Pro 识别复杂混合文本的质量还是很不错的，但怎么写prompt，需要反复测试研究。

---

<div class="post-metadata">

作者： ![mixivivo](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/m/8491ac/32.png) [@mixivivo](https://forum.freemdict.com/u/mixivivo)\
发布日期： [2025 年10 月 14 日 02:40 UTC](https://forum.freemdict.com/t/topic/41696/24 "2025-10-14T02:40:44Z")

</div>

我想了想，从方法论上讲，只要图像清楚，其实用 Gemini 两次、三次识别同一文本，然后不同批次对比改错，优于用其他OCR引擎的识别结果来对比改错。Gemini对这种文本，并没有什么真的不认识的字符，它的识别错误多出于内在的随机性，但既然是随机性，多次识别，不大容易出现刚好屡次都错在同一字符上。还有，同一引擎的输出格式有一致性，都用半角标点等，不会像异种OCR引擎对比文本差异那么大，花花绿绿，校改起来也方便。

用这种方式操作的缺点主要是成本高，时间耗费长。

---

<div class="post-metadata">

作者： ![last\_idol](https://forumcdn.freemdict.com/user_avatar/forum.freemdict.com/last_idol/32/2205_2.png) [@last\_idol](https://forum.freemdict.com/u/last_idol)\
发布日期： [2025 年10 月 14 日 03:16 UTC](https://forum.freemdict.com/t/topic/41696/25 "2025-10-14T03:16:15Z")

</div>

相同版本的 OCR 引擎，识别结果通常是相同的， 比如 PP-OCRv3 在同一设备上每次结果都相同，也就是同一 OCR 引擎无法识别的字符，大模型介入后也无法识别，多次调用反而会强化同一个错误，无法通过投票机制纠正。格式不统一，可以对文本识别结果二次处理，但是无法识别的字符，不换引擎没法解决。

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 14 日 03:24 UTC](https://forum.freemdict.com/t/topic/41696/26 "2025-10-14T03:24:15Z")

</div>

gemini随机性还是比较高的，特别在注音和特殊格式上面

 ![image](https://forumcdn.freemdict.com/uploads/default/original/3X/4/5/45168a50a9bf2069f1acdcc32b71949da9fef53b.png)

---

<div class="post-metadata">

作者： ![last\_idol](https://forumcdn.freemdict.com/user_avatar/forum.freemdict.com/last_idol/32/2205_2.png) [@last\_idol](https://forum.freemdict.com/u/last_idol)\
发布日期： [2025 年10 月 14 日 03:43 UTC](https://forum.freemdict.com/t/topic/41696/27 "2025-10-14T03:43:48Z")

</div>

这就是我不喜欢用大模型校对的原因，之前我一直建议用传统模型按行校对，现在的引擎文本识别率很高了，投票可以直接解决很多问题，大模型介入之后引入了随机性，反而增加了工作量，但我现在兴趣已经转移了，所以都是理论仅供参考。

---

<div class="post-metadata">

作者： ![mixivivo](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/m/8491ac/32.png) [@mixivivo](https://forum.freemdict.com/u/mixivivo)\
发布日期： [2025 年10 月 14 日 03:52 UTC](https://forum.freemdict.com/t/topic/41696/28 "2025-10-14T03:52:27Z")

</div>

你说的是专门的OCR引擎，视觉LLM我实践下来发现不同批次识别的变数挺大的。字符本身没法识别，那只有换引擎，不过我在这里说的是本来有能力识别，却被搞错的情况，大模型犯这种错误颇有一些。

---

<div class="post-metadata">

作者： ![mixivivo](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/m/8491ac/32.png) [@mixivivo](https://forum.freemdict.com/u/mixivivo)\
发布日期： [2025 年10 月 14 日 04:03 UTC](https://forum.freemdict.com/t/topic/41696/29 "2025-10-14T04:03:02Z")

</div>

我们现在搞的文本，都是传统的ocr引擎没法妥善处理的，混合多语种，格式复杂，有特殊符号……合合、夸克、百度高精度等全试过，都也提供了识别结果，很多错误，要是能用够用，它们速度快，又便宜，何乐而不为呢？动用Gemini 2.5 Pro这种，又慢又贵，那是迫不得已。

---

<div class="post-metadata">

作者： ![lee\_tc](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/l/96bed5/32.png) [@lee\_tc](https://forum.freemdict.com/u/lee_tc)\
发布日期： [2025 年10 月 14 日 04:25 UTC](https://forum.freemdict.com/t/topic/41696/30 "2025-10-14T04:25:41Z")

</div>

能否用您提供的方法做一下上海外语教育出版社引进的小学馆《日本语新辞典》，本站有pdf版，清晰度可以。这本辞典的特殊符号比较少。但收词量比较大。也适合作为学习辞典使用。

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 14 日 06:18 UTC](https://forum.freemdict.com/t/topic/41696/31 "2025-10-14T06:18:39Z")

</div>

可以试试但这本书问题更大，定义了5个级别的层级结构，一堆加了样式的序号，很多都没有unicode对应字符。还有大字号表示常用词，和一堆灰底的辨析内容，识别样式的可能性很低，基本只能靠后期修正。

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 14 日 08:23 UTC](https://forum.freemdict.com/t/topic/41696/32 "2025-10-14T08:23:14Z")

</div>

测试了前25页，果然序号有不少问题。

[日本语新辞典\_1-25.txt](https://forum.freemdict.com/uploads/short-url/mHSlghlBASs41Mm3NsOmc8IK1zh.txt) (182.8 KB)

---

<div class="post-metadata">

作者： ![lee\_tc](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/l/96bed5/32.png) [@lee\_tc](https://forum.freemdict.com/u/lee_tc)\
发布日期： [2025 年10 月 15 日 04:10 UTC](https://forum.freemdict.com/t/topic/41696/33 "2025-10-15T04:10:55Z")

</div>

感谢您测试。我看了一下，效果挺好。关于大字号常用词，个人觉得影响不大。还有灰底辨析内容，如果识别不了可以放弃灰底部分。毕竟辨析专栏不影响查词。此外这本辞典的发音表记比较特殊，可能确实识别不了重音的位置。

---

<div class="post-metadata">

作者： ![endnote](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/9de0a6/32.png) [@endnote](https://forum.freemdict.com/u/endnote)\
发布日期： [2025 年10 月 15 日 04:31 UTC](https://forum.freemdict.com/t/topic/41696/34 "2025-10-15T04:31:33Z")

</div>

> [@last\_idol](#):
>
> 大模型介入之后引入了随机性，反而增加了工作量

就我个人的使用情况来看，对于不同语言、不同专业领域、不同排版的OCR，各个LLM的表现各有优劣，没有哪个绝对占优。

比如古籍OCR，有现代电子排版后的横排竖排、有铅印时代的横排竖排、有木刻的宋元明清版图书，通常经专业训练过的模型OCR结果要比通用LLM要好。

不知道现在国内AI界还有多少人相信未来几年就能实现AGI的？

---

<div class="post-metadata">

作者： ![last\_idol](https://forumcdn.freemdict.com/user_avatar/forum.freemdict.com/last_idol/32/2205_2.png) [@last\_idol](https://forum.freemdict.com/u/last_idol)\
发布日期： [2025 年10 月 15 日 05:08 UTC](https://forum.freemdict.com/t/topic/41696/35 "2025-10-15T05:08:27Z")

</div>

AGI 不了解，古籍我也没弄过。

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 15 日 05:55 UTC](https://forum.freemdict.com/t/topic/41696/36 "2025-10-15T05:55:49Z")

</div>

统计了一下词条，不算后面的附录，正文条目有46200条，对比 @amob 提供的第8版数据48233条少了2033条，不过第8版数据是包括古语，和歌，俳句和英文缩略语的这些加起来估计在1000条左右，实际两个版本应该差1000条左右数据，另外有的词条新版会加义项。

 ![image](https://forumcdn.freemdict.com/uploads/default/original/3X/5/9/59250eb99eddedaa64c73cb269b052e3c79c23ec.png)

 ![image](https://forumcdn.freemdict.com/uploads/default/original/3X/f/f/ff38c140558a8d377db96078a950fb361cc075a6.png)

导入了校对工具（还没导入其他参考文本）：

 ![image](https://forumcdn.freemdict.com/uploads/default/original/3X/1/c/1c3b614cd4d6f8e2102a19051b9c31ea81658ac3.png)

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 15 日 10:26 UTC](https://forum.freemdict.com/t/topic/41696/37 "2025-10-15T10:26:32Z")

</div>

校对工具更新，现在支持直接用mdx作为候选来源，但是mdx的数据和词典用的符号特别是英文的位置有差异，需要调整。

 ![image](https://forumcdn.freemdict.com/uploads/default/original/3X/6/c/6c8a6811204d82a5fa136769afc9966e80b242db.png)

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年10 月 17 日 06:32 UTC](https://forum.freemdict.com/t/topic/41696/38 "2025-10-17T06:32:02Z")

</div>

文件也上传了一份到zlib：

> **[外研社日汉双解学习词典 (第二版) | 日本株式会社旺文社编著 | download on Z-Library](https://z-library.sk/book/119837715/be6669/%E5%A4%96%E7%A0%94%E7%A4%BE%E6%97%A5%E6%B1%89%E5%8F%8C%E8%A7%A3%E5%AD%A6%E4%B9%A0%E8%AF%8D%E5%85%B8-%E7%AC%AC%E4%BA%8C%E7%89%88.html)**
>
> Read online or download for free from Z-Library the Book: 外研社日汉双解学习词典 (第二版), Author: 日本株式会社旺文社编著, Publisher: 2023, ISBN: 9787521342352, Year: 2023, Format: PDF, Filesize: 440.44 MB

---

<div class="post-metadata">

作者： ![wynick27](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/w/958977/32.png) [@wynick27](https://forum.freemdict.com/u/wynick27)\
发布日期： [2025 年11 月 4 日 05:24 UTC](https://forum.freemdict.com/t/topic/41696/39 "2025-11-04T05:24:45Z")

</div>

![image](https://forumcdn.freemdict.com/uploads/default/original/3X/4/9/493423d8d6f7623af78aea2e53548e6f96a767a5.png)

对比了下第7版和第8版的词条，第8版多出来3253条，第7版有1269条匹配不上，其中有几百条是OCR错误，主要包括简繁和日文识别错误，AI自作主张加了汉字等问题。还有就是第8版加了很多词条，但也删除了一些词，还有增删汉字写法，词条分割成两条等各种修改。这还是没有统计多义词，俳句和缩略词的情况。然后多义词如果数量不同问题也比较大，匹配的时候还要单独匹配文本编辑距离。

---

<div class="post-metadata">

作者： ![Linzertorte](https://forumcdn.freemdict.com/user_avatar/forum.freemdict.com/linzertorte/32/66123_2.png) [@Linzertorte](https://forum.freemdict.com/u/Linzertorte)\
发布日期： [2025 年11 月 21 日 04:29 UTC](https://forum.freemdict.com/t/topic/41696/40 "2025-11-21T04:29:13Z")

</div>

![IMG_3578](https://forumcdn.freemdict.com/uploads/default/original/3X/0/d/0d4fdfe89b69f00f2ad1bde37d3d3964968ac01c.jpeg)  
这个我做过切图。45000多词。

[上一页](https://forum.freemdict.com/t/topic/41696.md?page=1)

[下一页](https://forum.freemdict.com/t/topic/41696.md?page=3)
