讨论:对于ocr的文本是否应该先制作半成品词典

根据我ocr然后制作文字版词典的经验来看,目前ocr出问题的地方大多不是文字,而是一些重要性不高的地方。主要出错的地方在以下几个地方:
1.日语词典的furigana,没有任何一个ocr能全部正确,大模型加提示词后仍然出现不该加furigana的地方自行添加和有furigana的地方没有添加的情况,而且不能保证位置正确。
2.粗体,斜体和下划线,和furigana类似,大部分ocr工具识别不全。
3.颜色信息,这种对于新的大模型正确率较高
4.栏目符号,也就是文字用方框或圆圈括起来的标记。
5.序号,包括各种罗马数字,黑白圆圈的,很多时候ocr无法识别。
6.音标和accent等特殊字母,很多大模型识别音标准确率很低
7.部首和生僻字,这种没有什么好办法

现在已经有大量词典有ocr文本,但要完整校对全部内容都需要20-50小时以上的时间,而现状是合作校对成功案例很少。
但是校对实际上90%以上的时间都是花费在furigana或者序号等内容上,还有一些特殊情况比如这本:日本語慣用句辞典 ocr文本
90%的错误出在年份编号这种不重要的内容上,如果不对比校对这些内容那么很多ocr的文本都能快速制作出mdx,那么是不是应该先用不完全校对的数据制作呢?想听听大家的意见

支持先制作半成品词典

除以上
Gemini: 日文有时会偷添加或减少一两个五十音字,平均两页几乎会有一处。或是该显示不显示(ex: 该是 “言い切れる” 全页都固执地变成 “言いきれる”)
Paddle: 有时拍的照片歪斜处的文本在OCR都一大段不见了,或是 furigana 的字母变成内插到别行,这大概两三页出现一次。最多的是遇到日文汉字变成繁体或简体字,这个约一两页一处。

PS: 两个OCR一起用来校对制作,比单纯用 ABBYY 快多了
PS: 没校对过的OCR我是不用的

是的,我现在基本就是两个对比制作的。paddleocr感觉日文用简体替换情况挺多的,特别容易出问题的比如晚晩这种字形接近的,还有へヘ平假名片假名很容易出错,然后两者都可能出现严重幻觉情况。但有时原文有错会出现gemini给改成对的情况。
还有就是图片,图表公式也很难处理。 角川必携国語辞典这种带笔顺的都识别成普通字符了,要处理特别麻烦,要用传统ocr逐字定位然后切分整合。

(帖子已被作者删除)

可以看到 Paddle 碰到 furigana 后,后面的例句有些都OCR错了

支持先制作出来,后续慢慢优化。

可能词典用得越多,就越用不上furigana吧。

而且现在已经有例解国語、明鏡国語这些自带furigana的国語辞典,至少对furigana的需求没那么大了吧。

有些词典只对较少的词汇标注furigana,排版上面可能也不太协调。

总结:可以接受没有furigana

做成单栏的图片词典会不会好一点

图片词典主要是大,手机上很难用,日语的竖排版词典更是不方便,不知道为什么竖排版那么多

部分横排的做做图片词典感觉无所谓,比如日本语新辞典,现在都是大手机一两个图片词典空间占用算不得什么

还好,“日本語語感の辞典” 词条一万,只占 842MB
用手机看是觉得还行

赞同忽略furigana来减少校对工作量

token够的话直接让AI逐个词条进行校对,效果非常好。

ai只能校对错字之类的问题吧,除非重新ocr,否则ai也不知道原书是哪里加的furigana,人工校对也容易看漏,我做复合动词那本的序号下划线什么的有逻辑的让ai写脚本查的

agent基本都有OCR能力的,你把pdf和文本发给它,让它逐条核对就行。其实就相当于让agent自己重新OCR一遍了,很费token,不过准确率很高。