# 新出的古籍数字化的平台：看典古籍

**URL:** <https://forum.freemdict.com/t/topic/23084>\
**Category:** 词典及语言学习交流\
**Tags:** 古籍\
**Created:** [2023 年9 月 1 日 08:12 UTC](https://forum.freemdict.com/t/topic/23084 "2023-09-01T08:12:38Z")\
**Posts on this page:** 20\
**Page:** 1

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 1 日 08:12 UTC](https://forum.freemdict.com/t/topic/23084/1 "2023-09-01T08:12:38Z")

</div>

看典古籍：[https://www.kandianguji.com/](https://www.kandianguji.com/)  
功能比较多，免费开放了OCR、数字化功能  
古籍数量也比较多，筛选起来比较方便  
最好用的还是全文检索功能，可以在古籍中搜想看的关键词，精确到页

9月7日新增功能，单图在线智能辅助校对功能初版上线了，欢迎体验：[《使用文档》](https://www.kandianguji.com/article_detail?id=11)收集需求和反馈中…

---

<div class="post-metadata">

作者： ![etanalyst](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/a587f6/32.png) [@etanalyst](https://forum.freemdict.com/u/etanalyst)\
发布日期： [2023 年9 月 1 日 09:37 UTC](https://forum.freemdict.com/t/topic/23084/2 "2023-09-01T09:37:57Z")

</div>

谢谢仁兄的网站

不过搜索  
麻黄  
癫痫  
这样的条目  
结果还是偏少  
希望有条件能进一步  
优化

总之  
很不错  
感恩感激感谢

---

<div class="post-metadata">

作者： ![etanalyst](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/a587f6/32.png) [@etanalyst](https://forum.freemdict.com/u/etanalyst)\
发布日期： [2023 年9 月 1 日 10:09 UTC](https://forum.freemdict.com/t/topic/23084/3 "2023-09-01T10:09:06Z")

</div>

个人是以  
博览医书的这个收费数据库  
做比较。有失公允。还是非常不错的。继续优化就可以。目前是个人研究中医的主力

---

<div class="post-metadata">

作者： ![胡羁子](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E8%83%A1/bbe5ce/32.png) [@胡羁子](https://forum.freemdict.com/u/%E8%83%A1%E7%BE%81%E5%AD%90)\
发布日期： [2023 年9 月 1 日 10:32 UTC](https://forum.freemdict.com/t/topic/23084/4 "2023-09-01T10:32:36Z")

</div>

嘉惠後學！感謝！

---

<div class="post-metadata">

作者： ![etanalyst](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/a587f6/32.png) [@etanalyst](https://forum.freemdict.com/u/etanalyst)\
发布日期： [2023 年9 月 1 日 10:36 UTC](https://forum.freemdict.com/t/topic/23084/5 "2023-09-01T10:36:41Z")

</div>

全文检索功能

希望搜索以后  
条目数量越来越多  
越来越精细

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 1 日 11:05 UTC](https://forum.freemdict.com/t/topic/23084/6 "2023-09-01T11:05:35Z")

</div>

感谢您的使用和反馈，网站主要还是收集多方面的古籍，目前并没有明确侧重点（比如中医方面的），我有大量的古籍资源在做数字化并展示出来，还是需要一些时间的，您可以持续关注！

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 1 日 11:09 UTC](https://forum.freemdict.com/t/topic/23084/7 "2023-09-01T11:09:21Z")

</div>

针对搜索一块的优化还在进行中，当数据量起来之后检索功能的好处就会体现出来，后续还会加入精确检索模式和模糊检索模式等功能，我会尽最大努力去优化和完善！

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 1 日 11:10 UTC](https://forum.freemdict.com/t/topic/23084/8 "2023-09-01T11:10:11Z")

</div>

感谢您的使用！

---

<div class="post-metadata">

作者： ![etanalyst](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/a587f6/32.png) [@etanalyst](https://forum.freemdict.com/u/etanalyst)\
发布日期： [2023 年9 月 1 日 11:15 UTC](https://forum.freemdict.com/t/topic/23084/9 "2023-09-01T11:15:51Z")

</div>

功德无量  
啊

广种福田，一定持续关注

---

<div class="post-metadata">

作者： ![say65](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/s/7ba0ec/32.png) [@say65](https://forum.freemdict.com/u/say65)\
发布日期： [2023 年9 月 1 日 11:34 UTC](https://forum.freemdict.com/t/topic/23084/10 "2023-09-01T11:34:30Z")

</div>

中华书局带有书名线和人名线可以OCR?

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 1 日 11:49 UTC](https://forum.freemdict.com/t/topic/23084/11 "2023-09-01T11:49:38Z")

</div>

这个您最好直接在网站OCR版块上传一张图像试一下识别效果，写法样式很多样，具体还得已识别效果为准，在这里我也没法明确回答！

---

<div class="post-metadata">

作者： ![say65](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/s/7ba0ec/32.png) [@say65](https://forum.freemdict.com/u/say65)\
发布日期： [2023 年9 月 2 日 16:47 UTC](https://forum.freemdict.com/t/topic/23084/12 "2023-09-02T16:47:00Z")

</div>

我上传几张杨伯峻春秋左传注，书名线和人名线不受干扰，文字识别率很高，标点识别率很差。不过免费能达到这样已经很好了，谢谢看典古籍。

---

<div class="post-metadata">

作者： ![shaoshi](https://forumcdn.freemdict.com/user_avatar/forum.freemdict.com/shaoshi/32/14529_2.png) [@shaoshi](https://forum.freemdict.com/u/shaoshi)\
发布日期： [2023 年9 月 2 日 23:37 UTC](https://forum.freemdict.com/t/topic/23084/13 "2023-09-02T23:37:49Z")

</div>

假如只拿现代的电脑打字排印本测试，和finereader相比，可能看不出特色。

用古代刻本图像测试，不知效果如何？

ctext的刻本图像ocr，一般会弄得一塌糊涂。

我还没时间测试，但注意到这个网站和刻本图像放在一起的文本很准确。也许是校对过的。

直接ocr出来，完全没校对的，能有多准确？这是看点。

假如拿手写字的古籍(如《四库全书》)的图像来ocr，又如何？这个难度又更高了，finereader会完全翻车。但是《四库全书》电子版是ocr出来的，出版方用的特制ocr软件就能够准确识别手写字。

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 3 日 01:21 UTC](https://forum.freemdict.com/t/topic/23084/14 "2023-09-03T01:21:57Z")

</div>

感谢使用和反馈，OCR还在不断更新迭代中，我相信会越来越好的，符号问题在后续版本中会解决的！

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 3 日 01:24 UTC](https://forum.freemdict.com/t/topic/23084/15 "2023-09-03T01:24:13Z")

</div>

您好，刻本图像是可以识别的，网站上现在展示的内容都是完全无校对的，直接通过OCR识别转换后展示出来的，网站上识别的效果代表了OCR的识别效果，OCR还在不断优化迭代，我相信识别效果会越来越好的！

---

<div class="post-metadata">

作者： ![say65](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/s/7ba0ec/32.png) [@say65](https://forum.freemdict.com/u/say65)\
发布日期： [2023 年9 月 3 日 02:16 UTC](https://forum.freemdict.com/t/topic/23084/16 "2023-09-03T02:16:01Z")

</div>

有书名线和人名线，finereader识别不了。

---

<div class="post-metadata">

作者： ![endnote](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/9de0a6/32.png) [@endnote](https://forum.freemdict.com/u/endnote)\
发布日期： [2023 年9 月 3 日 04:26 UTC](https://forum.freemdict.com/t/topic/23084/17 "2023-09-03T04:26:24Z")

</div>

> [@shaoshi](#):
>
> 假如拿手写字的古籍(如《四库全书》)的图像来ocr，又如何？

其后台应该是人工智能的 pytorch 模型，逐个字识别模式下可以看每个字符OCR的置信度，识别手写字符是人工智能的老课题了，并不像 Abbyy 那样依赖印刷体。

* * *

很好的网站。对OCR这块，建议站长考虑：

一、不知道能否加上用户的 Human Feedback？尤其是那些置信度低的字符识别结果，允许用户在线输入该字正确的结果。古籍的OCR与普通文档不一样，有很多生僻字、异体字，置信度在0.9以下很可能就不正确了（手写体置信度可以低一些）。

二、古籍的OCR图片往往扫描得不太规范，页面四周各种大小不等的黑边，在OCR之前如果能预处理一下，自动判断页面内容的四周范围（不知能否从 Human Feedback 学习），把不需要识别的书耳（标注卷数页码的）、版心（中间装订的鱼尾等部分）排除，效果会更好。

---

<div class="post-metadata">

作者： ![endnote](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/9de0a6/32.png) [@endnote](https://forum.freemdict.com/u/endnote)\
发布日期： [2023 年9 月 3 日 04:35 UTC](https://forum.freemdict.com/t/topic/23084/18 "2023-09-03T04:35:33Z")

</div>

> [@endnote](#):
>
> 对OCR这块，建议站长考虑

更进一步的，借鉴早期AI OCR识别名片的方法，即将识别结果与网络收集的人名、电话号码等数据匹配，可以大大提升准确性。

回到古籍OCR的场景，比如现在要OCR《史记会注考证》的刻本，那如果能先给模型输入《史记》《汉书》等繁体字文本，应该也有助于提升OCR《史记会注考证》的识别准确度。

---

<div class="post-metadata">

作者： ![看典古籍](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E7%9C%8B/a88e57/32.png) [@看典古籍](https://forum.freemdict.com/u/%E7%9C%8B%E5%85%B8%E5%8F%A4%E7%B1%8D)\
发布日期： [2023 年9 月 3 日 05:30 UTC](https://forum.freemdict.com/t/topic/23084/19 "2023-09-03T05:30:00Z")

</div>

是的，感谢您的使用反馈。关于您说的两点建议非常棒  
一、Human Feedback。目前我已经做了用户修改内容的相关功能，但是网站目前是刚上线的一个状态，用户量较少。在我看来，首先，一套完备的与用户关联的校对模式比较复杂，我要确定没有问题才会推出来；其次就是让用户参与进来会消耗用户的时间和精力，但是又没有回报，让用户形成一种“白打工”的心理状态，要让用户“为爱发电”，在目前我看来是不可行的。  
二、预处理。这一点我已经考虑到并已经实现了初版应用：只关注需要关注的信息，去除杂余信息。在古籍中，版式、风格等等属性很多，比较复杂，在通用性上要差一些，我还在不断进行完善，力求完美（起码要能在90%的图像上通过验证）。  
三、模板预匹配。这一点我是没有考虑到的，我将在后续进行尝试，看效果如何，如果可以，我将会采纳您的宝贵建议。  
最后，表达对您的感谢！

---

<div class="post-metadata">

作者： ![endnote](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/e/9de0a6/32.png) [@endnote](https://forum.freemdict.com/u/endnote)\
发布日期： [2023 年9 月 3 日 07:53 UTC](https://forum.freemdict.com/t/topic/23084/20 "2023-09-03T07:53:51Z")

</div>

> [@看典古籍](#):
>
> 让用户参与进来会消耗用户的时间和精力，但是又没有回报

上面的建议不一定马上就要着手实现。不过，问题和痛点是实实在在的。

个人觉得目前优先级高的，可能首先是改进单个用户的体验。  
比如单页OCR后，校对的页面布局（不考虑适配手机屏幕），如何设置一个置信度门槛，只显示低于门槛的疑难字，以方便反馈；如何方便用户导出整个识别结果，或者允许用户一次性上传多张图片；如何保存用户的反馈，并动态用于训练模型提升后续的OCR准确度（是否允许用户对不同书籍的处理设置编号、以便将反馈分开保存、这本书的反馈数据只用于训练同本书后面的OCR）。等等。  
用户的获得感增加了，自然也就愿意提供Feedback了，因为自己的Feedback有助于获得后续页面更准确的OCR结果。

总之，功能的增强什么时候去实现，孰先孰后，是需要与整个网站的发展方向、时间硬件资源等通盘考虑的。祝成功~

[下一页](https://forum.freemdict.com/t/topic/23084.md?page=2)
