将作大匠
1
数据源参见leon406发布的帖子 ⺡𦰩 ⾔吾大词典 2025.09 (2025.10.20 六订+) - 汉汉 - FreeMdict Forum ,释出数据为mdx格式词典文档。该词典系leon君将其整理的聚典xml源数据转制而来,主要问题为部分词条的内容掺混(具体另见leon君帖子 汉大问题集合 - 技术交流与词典编修 - FreeMdict Forum ),但仍不失为现阶段内容完整度最高的数据。我做了下还原动作导出为方便编辑的txt文本,经历几轮简单清洗动作后应用代码,筛拣出与繁体词头词条呈映射关系可以径行移除的简体词头词条以及与繁体词头词条存在出入需要进一步排查的简体词头词条(下称“问题词条”)。
就筛选出的问题词条数量而言,其范围已进一步缩小至五千多条,其中又有一千八百多条为互见词条基本可以排除掉,换言之实际待二次清核问题词条为三千多条,就此而论数量已相当之小。若完成这三千多问题词条的校核工作,可以得到更为完善、更可利赖的汉大电子文本。
在此一并附列我用于初步自动化筛检的AI提示词(及代码脚本)、筛核前后文本供大家参考。
筛拣提示词:
筛拣提示词.txt (7.8 KB)
筛拣代码:
筛拣代码.txt (11.2 KB)
筛核前后文本:
通过网盘分享的文件:筛核前后文本数据(gemini3).zip
链接: 百度网盘 请输入提取码 提取码: mkyu
–来自百度网盘超级会员v5的分享
繁简词头对照表(该表存在繁简词头彼此的一对一、一对多映射,部分词头错误系连但未加调通过网盘分享的文件:繁简词头对照表.txt
链接: 百度网盘 请输入提取码 提取码: 92c1
–来自百度网盘超级会员v5的分享
元素代码节本表暨附表:
dyhdc(v5)08_元素代码节统计表.txt (7.7 KB)
元素代码节表.txt (6.7 KB)
后续可能利用到的数据、方法参见以下帖子:
《汉语大词典》正编十二卷词头词条数据(含词头[词目]及对应词条数据,数据主体来源于光盘数据) - 汉汉 - FreeMdict Forum
更新:《Unicode汉字字典》完整收录并显示Unicode17正式版102998个汉字 - 汉汉 - FreeMdict Forum
汉语大词典字头清单·词目表(字表手动抓取自汉语辞典总汇·词表系个人自行核对补齐) - 汉汉 - FreeMdict Forum
《汉语大词典》正编十二卷电子文本复音节词条部分阙讹项检出 - 汉汉 - FreeMdict Forum
将作大匠
2
二次清核工作告成,主要就“第四种情况_繁简对照组清单.txt”和“第三种情况_匹配对照组清单.txt”进行更精细的亚类对照组分拣,接着再进一步核照飞梧君此前释出的汉大光盘、订补文本词条数据以及辞海网网页词条数据,梳理出增衍(辞海网收录而光盘、订补未收录)、删除、替换词条文本行,而后落实词条文本行标记、删除、替换动作,得到趋近于纸本的词典总文本。
准照前例,一并附列用于二次清核的AI提示词(及代码脚本)、筛核后文本供大家参考。
筛拣提示词:
筛拣提示词.txt (8.5 KB)
筛拣代码:
筛拣代码1.txt (6.5 KB)
筛拣代码2.txt (10.4 KB)
筛核表单文本:
第三种情况_匹配对照组清单.xlsx (1.4 MB)
第四种情况_(戊类)繁简对照组清单.xlsx (49.2 KB)
第四种情况_(丁类)繁简对照组清单.xlsx (118.8 KB)
第四种情况_(丙类)繁简对照组清单.xlsx (837.9 KB)
第四种情况_(甲类)繁简对照组清单.xlsx (1.5 MB)
第四种情况_(己类)繁简对照组清单.xlsx (130.9 KB)
第四种情况_(乙类)繁简对照组清单.xlsx (113.8 KB)
替换词条清单.txt (1022.8 KB)
刪除词条清单.txt (408.2 KB)
将作大匠
3
同步释出最新校理的txt格式词典总文本文档,该词典删落所有可证为简体词条的词条文本行,替换部分内容错漏的词条文本行,同时为核校方便删落部分元素代码,若要转制成mdx格式词典文档须做元素代码补完动作。
总文本文档:
通过网盘分享的文件:dyhdc(v5)10.txt
链接: 百度网盘 请输入提取码 提取码: h6d6
–来自百度网盘超级会员v4的分享
将作大匠
7
就是我从mdx词典导出txt文本后,除了标示拼音的、标示例证的等等删了后续不好再加回的元素代码作保留外,把能删掉的元素代码都删掉了。你可以用leon的原mdx词典再导出一份txt文本后对比下就可以大概知道我删落哪些元素代码了,如果要用我整理的txt文本再转制回mdx词典,就需要补全代码
karx
8
感谢
【伱】{py=nǐ}<yinyun><book>《广韻》</book>乃里切,上止,泥。</yinyun></hm><item><mean><see>“你”的古字。</see>称对方(一个人)。</mean><examples><example><u>宋</u><u>陈师道</u><book>《後山谈丛》</book>卷四:<quote>王師既平<u>蜀</u>,詔<u>昶</u>赴闕。<u>曹武肅王</u>密奏曰:‘<u>孟昶</u>王<u>蜀</u>三十年,而<u>蜀</u>道千餘里,請擒<u>孟氏</u>而赦其臣以防變。’<u>太祖</u>批其後曰:‘伱好雀兒腸肚。’</quote></example>亦表示领属关系。等于说你的、你们的。<example><u>宋</u><u>庄绰</u><book>《鸡肋编》</book>卷下:<quote>家人驚異,乃曰:‘朝議才省來,且慢喫。’遂怒目曰:‘那得朝議來?我是<u>密州</u><u>高安縣</u>販<u>邵武軍</u>客人,被伱朝議在<u>吉州</u>權縣,將我六個平人,悉做大辟殺了,今來取命。’</quote></example></examples></item></hdc></hdcs>
这里的“亦表示领属关系。等于说你的、你们的。”没有标签,搞不清楚是属于哪个层级,我看抖音汉语也没看明白
将作大匠
9
这是说的同一义项中的并列义,确实元数据也没有标签。还有我用的是聚典源数据,跟辞海网的比较接近,抖音源舛错远较前者为多,你要更直观地了解义项排布规则,最好上辞海网去查或翻PDF扫描文档,leon发布的mdx成品也可以回查下
karx
11
这个亦表示领属关系。等于说你的、你们的。是对应第二个例句的释义吗。是算两个释义两个例句不
将作大匠
14
老哥你这工程量更大、难度更高啊,我已经认清现实不可能制作出绝对完美的电子文本了,怎么样都有缺憾 
W2K
15
咱俩也对过话
当时我心里想说你不会用ocr的数据,但怎么想说出来口气也不对。分明是找茬干仗骂架呢。
这是我就批处理下ocr后的数据用的
然后装回去也就改改个别的一两个标点符号或者手敲点非基本区字,正确率回填回去真的很高。
你算下时间成本,说全弄完有点扯,3本5本完美数据应该有了吧。
真不知道怎么表达,总觉得越走越歪呢。说出来真的得罪人啊
(挨骂估计是跑不了了),但想要全品真没近道啊
抱歉了,你说我不好听的我也硬挺着了。
将作大匠
16
你误会了老哥,咱当时正儿八经无意相干,如果有言语唐突的地方在此告罪了
我这纯粹就是路径选择的问题,因为OCR工具精度再高也有其局限性,再加之后续还要进行正编、订补本词条的整合拼接,个中种种已知、未知的问题不在少数。现下不如直接利用坛友发布的官方渠道资源,其完成度已经相当可以了。虽有瑕疵、缺陷,但稍加缮治,后续利用时不时同纸本书互相参看也尽可以了。
karx
17
【上<2>】{py=shànɡ}<yinyun><book>《广韵》</book>時亮切,去漾,禅。</yinyun></hm><yinyun><book>《广韵》</book>時掌切,上養,禪。</yinyun>
做了easydict版的,不过“上”第二个词头是不是缺了个拼音。目前是一个拼音两个广韵
将作大匠
18
你这个是用抖音源数据编译改的吧。这样同一义项中“并立义”对应的例句都羼混在一起了,摘也摘不开了。按我想法,若要重新编译需要另加标签进行标记,但空间序列位置不应改变。聚典源该处作——
> 【上<2>】{py=shànɡ}<yinyun><book>《广韵》</book>時亮切,去漾,禅。</yinyun></hm><yinyun><book>《广韵》</book>時掌切,上養,禪。</yinyun><item><mean><xh1>位置在高处。</mean><examples><example><book>《诗·周颂·敬之》</book>:<quote>無曰高高在上,陟降厥土,日監在兹。</quote></example><example><book>《庄子·让王》</book>:<quote>上漏下溼,匡坐而弦。</quote></example><example><u>唐</u><u>李白</u><book>《蜀道难》</book>诗:<quote>上有六龍迴日之高標,下有衝波逆折之回川。</quote></example><example><u>杨朔</u><book>《秘密列车》</book>:<quote>可是敌人的飞机炸得很厉害,往上开的火车常常出事。</quote></example>亦指物体的上部。<example><u>汉</u><u>王充</u><book>《论衡·说日》</book>:<quote>立<u>太山</u>之上,<u>太山</u>高;去下十里,<u>太山</u>下。</quote></example><example><book>《明史·礼志一》</book>:<quote>社稷,社主用石,高五尺,廣五尺,上微鋭。</quote></example><example><u>鲁迅</u><book>《故事新编·铸剑》</book>:<quote>随着歌声,水就从鼎口涌起,上尖下广,像一座小山。</quote></example></examples></item><item><mean><xh2>上位;社会的最高层。
需要加标签的是“亦指物体的上部。”。
还有聚典源数据有个显著的问题是,多音字字条会出现过度整并的问题,把多个字头的内容合并到一起,像你出示的这个“上”字条,就是典型例子。“上”从古音而言,有三个读音,这一点在现下个别地域方音中可以验证。因此《广韵》有两个反切注音,实际上应该按纸书进行拆分,从一个字头变成两个字头才行
将作大匠
19
先不着急编译转制电子词典,我会再进行第三轮清核动作