我是以網路上公開的 PDF 作為對照資料。其實我也有想過重新製作,不過因為裡面有不少罕用字,OCR 對這些字的辨識錯誤率很高,所以目前還是只能一邊對照 PDF,一邊人工慢慢整理與校對。
因此,目前並沒有一份已經文字化且可以直接使用的正確資料。
原始資料:GitHub - Wikimedia-TW/koktai-rawscan: 吳守禮《國臺對照活用辭典》紙本掃描檔 · GitHub
我是以網路上公開的 PDF 作為對照資料。其實我也有想過重新製作,不過因為裡面有不少罕用字,OCR 對這些字的辨識錯誤率很高,所以目前還是只能一邊對照 PDF,一邊人工慢慢整理與校對。
因此,目前並沒有一份已經文字化且可以直接使用的正確資料。
原始資料:GitHub - Wikimedia-TW/koktai-rawscan: 吳守禮《國臺對照活用辭典》紙本掃描檔 · GitHub
请问为什么会有缺词,官方已经释出了原始排版文件,可能只是codex处理失误?
问题能修的都修了,最新版应该不存在缺词了。电子化的文档不一定都是对的,楼上是根据原书核对的。
不理解,那就是最终交付印刷的倚天中文系统的排版文件,为什么不一定对呢,能否指点一下原因。所谓缺字,是不是自造字无法检索呢?楼上的校对是奔着自造字转Unicode吗?
不确定有没有问题,不敢妄言。之前的错误大都是因为我转换有问题。
更新都在5楼网盘上。
原来如此,谢谢。