太懦夫了,说几句就全删了。
更新 2025.03.16
加入反查功能。
反查方案说明:
最简单的反查方案是直接搬中文释义作词条,这样会产生很多词条,而且难以查到想查到词,输入关键词的命中率不高(必须第一个字匹配到才行)。另外一个缺点是要切换键盘,从英语(西方语言)切换到中文。
我认为较好的办法是从释义所含词组来查询,某个释义含有一个或几个词组,你输入其中某个词组拼音,就能找到。这样能很容易查到对应单词。对于不含词组的释义,可通过单字来查询。这个做法不需要切换键盘,命中率也很高。
要判断中文释义是否含词组,可先预备一个词组列表,包括所有常用词组(二字、三字、四字、多字)和对应拼音。然后对词条的中文释义进行匹配。
一个释义如果不含任何词组,则把每个单字的拼音作为索引(形容词最后的“的”字除外,这个因为太多所以略去)。含有词组的话,单字不作为索引。
另外一个是多音字,在用单字拼音作索引时,无法判断该字的读音,所以使用了多个音作索引。例如“会”,既可以从 hui 音查到,也可以从 kuai 音查到。对于词组查询则不存在此问题,如 会计,只能从 kuaiji 上查到,不会索引到 huiji 上。
ü u 没有区分,所有含 ü 的拼音,用 u 替代。涉及到的字词不多,除了 lü、nü 外,其他可忽略不计。
反查词头后#号,如a#, an#, ba#,kuaiji#,kuaile#。共计增加反查拼音词条 33,539 条(包括单字拼音和词组拼音)。
存放文件夹:度盘 “2025.03.16”
文件:
新时代西汉2.mdx (无变位表、变位词)
新时代西汉3.mdx (加变位表、变位词)
negdec.css (已链接在文件内)
2025.09.09 更新
@amob 提取了短语/词组,感谢。
需更新mdx、css两个文件。
下载链接在原贴里。
求字典 新时代xhdcd
一直想自己做,OCR第一次因为识别率太低,放弃了,最近有一次OCR并找到了确实的15页,在微信上OCR了一次,识别率还较高,自己改了部分,实在太耗神了,前几天看到了这个帖子,希望给发一份,多谢了邮箱[email protected]
原帖后面就有补档啊
另外这种大词典手动来OCR当然慢,肯定是先用程序处理,校对也要程序辅助的。不过上面帖子的版本应该不是ocr的。
淘宝打开也不存在了
楼主太强大了,真是值得尊重的,辛勤的,追求完美的
过奖,这是大家共同努力的成果。如果你也用英语,另有一个剑桥英西西英,还过得去。我日常用的就是这两个词典。
2025年12月1日 更新:
加入词条搜索功能。原理是把基本词条(不包括动词变位和短语词组,但包含了阴性词)放入js文件中用于检索。每个词条内容末有个搜索图标,点击出现虚拟键盘(因为mdict里所有外部键盘输入都进入输入栏,不能用外部键盘输入),输入检索串进行搜索。
检索输入:使用简化的通配符方案,用法如 unix/linux 的 ls 命令。通配符只使用 星号 * 和问号 ?,星号代表零个或多个任意字符,问号代表 1 个任意字符。
示例:
1、输入“s?l” 代表s开头跟任意1个字母后以 l 结尾的单词,搜索得到:
sal
sel
sil
sol
2、输入“sa*l” 代表sa开头跟任意个字母后以 l 结尾的单词,搜索得到:
sabanal
sabinal
sabinol
sabogal
sabucal
sabugal
saburral
3、输入“*damente*” 代表包含 damente 的单词,搜索等到 abaldonadamente, abandonadamente 等几十个单词。
4、输入“?bo?” 代表以任意1个字母开头、后跟bo及任意一个字母结尾的单词,搜索得到 ibon, oboe 两个单词。
5、输入“*dora” 代表 以 dora 结尾的单词,搜索得到 -dora, abaleadora, abanadora 等两千多个单词。
显示搜索结果的列表后点击某单词可跳转到该词条(pc上正常使用,安卓手机上无法跳转)。
由于词头中的特殊字符都已复制转换为英语字符的副本,所以键盘中没有包括特殊字符。如 niño 可通过 nino 查询和搜索到。
正则搜索对西语很重要吗?普通学习者用不上吧?
用到的机会其实挺多的,比如听力学习中听到一个不熟悉的单词,又很难拼准确,就需要正则搜索了。再如有单词记忆模糊,要查找的话一般方式很难找出来,用正则就容易了。不独西语如此,英语也一样。像mdict这样的词典软件,如有正则查询就方便多了。
感觉这种应该是词典软件解决的问题,Golden-Dict好像就支持。
像 gd 这样的词典软件,输入后需要按 搜索 才出现列表的,我感觉很别扭。而且列表还不全。mdict 没提供 模糊搜索功能,只好自己设法解决。反查功能也是因为词典软件没提供,用户才设法加入的。像 ebwin 等软件有全文搜索功能,还挺好用,那样就不需要专门去增加反查词库了(只是它的词条列表也要搜索才显示,略显麻烦)。
gd我一般查某个词典会直接打开词典的词条列表,另外全文搜索ebwin可以做是因为他默认原文是日文,正常情况下全文搜索应该分词,但中文和日文分词方法不同,又可能混排,所以没那么简单。
gd 可能是我不熟悉的缘故才没去摸索用法。全文搜索没那么复杂吧,日语词典还混有平假名片假名和汉字英语,不比汉英词典简单。ebwin 搜英语词典也很顺利的。
正常搜索引擎要判断语言,然后对每个语言做stem处理的序,中文要分词,然后根据词用tfidf质量的索引排效果才会好。当然做个简单的也行,gd全文搜索用的Xapian就是个完整搜索引擎的功能。












