校对到700多页就再也弄不下去了,要是说没价值吧大部分可以和足本对位上。纸质版本可能当时为了排版吧(猜的),例句几乎都是只保留了带key word部分。缺少完整的前后原有的语境(E的足本是完整的),只要细看迷瞪的不知所云(靠猜脑补)。这么大的体量东西付出太多得到的不成正比就停了,算是给想做和要做的一个参考吧(对了,这个货的词头拼写错误好多,好多)
AI时代,在有英文全本文本的情况下,文本化这种英译中的词典意义不大。最多像OED那样外挂个脚本调用AI翻译即可
三民书局的新英汉辞典。
这本翻译自日本三省堂 New Century English-Japanese Dictionay,
是目前グランドセンチュリー英和辞典的前身。
虽是多年前的译本,
但很多例句还是持续延用。
也许可以像新明解一样,
把中译拼接到 グランドセンチュリー 上。
Internet Archive 上有很好的扫描本。


再许愿一个商务印书馆《古今汉语词典》。貌似一直没有电子数据,AI时代OCR或许可行。这本词典有一定原创性,不是《汉语大词典》的简化本(在我看来《辞源(第3版)》《古代汉语词典(第2、3版)》以及大量中型语文辞书都可作如是观),词义归纳有特色,例证中有不少大型辞书没有采录的材料。
安娜馆有比较清晰的扫描PDF:
https://annas-archive.gl/md5/dd5f7ccc2b835085e20517e6381dbee3
我也盼望楼主能做这本:曾获国家图书一等奖,对于理解合成词或成语的语素义较有帮助。
同时盼望楼主能把类似的一本也做了——《 古今通用学生汉语词典》https://tw.fra101.ru/book/Ndpo17pz8P/%E5%8F%A4%E4%BB%8A%E9%80%9A%E7%94%A8%E5%AD%A6%E7%94%9F%E6%B1%89%E8%AF%AD%E8%AF%8D%E5%85%B8.html,隔壁的k大推荐过作者的 《学生古今汉语字典》 《学生成语词典》,我觉得其实就是这一本的拆分本。
我测试生僻字识别非常糟糕,这个夸克和扫描王还好点但是也有一大批无法识别的,要手动校对,不过我可以研究下二次算法识别行不行
https://freedict.com/ 这个词典网站有抓过嘛
可以想象得到,因为这书里类推简化字太多了。当年的原则是一律类推简化,造出很多至今没有收进Unicode的字。《规范字表》出来后不提倡类推简化了,一些类推简化字也许永远不会进入Unicode和GB标准了
有app的话需要有人买app然后分享数据做更好
目前我准备制作的列表是:
现代西班牙语大词典
Diccionario Salamanca de la Lengua Espanola
日汉双解学习词典
日语语感词典
新明解アクセント辞典 第2版
新明解故事ことわざ辞典 第二版
てにをは連想表現辞典
てにをは辞典
集英社国語辞典 第3版
角川 必携国語辞典
学研 現代新国語辞典 改訂第六版
ベネッセ表現読解国語辞典
新潮現代国語辞典
这本 ATOK Passport 有数据
https://atok.com/info/features/dictionary.html
三省堂和新明解不是一本吧,这个好像要开会员抓数据。
这几本因为ruby原因制作比较复杂,我在测试用新模型或者二次识别ruby的方案减少工作量
看以前有人发过快易典的数据,里面也有新德汉,朗氏德汉,韩汉大词典,日汉词典,新时代西汉大词典,不知道能不能转了现在
这个要有固件才能分析
那没事了,能不能把卡西欧里的拉鲁斯法汉,法汉大和PONS现代德语学习词典的OCR数据转下
卡西欧没有法汉大,是新世纪法汉,已经做了。法汉大我查到只有很老的译科思有这个,还有朗文当代和日汉辞海,但这个机器很少见,而且用的也是特殊cpu。
