有“儿”字的数据就有<SMALL>儿</SMALL>,<SMALL>儿</SMALL>都被分段挪到下一段去了。
在整理之前,需要先去除每行前的空格,然后用Emeditor的正则式,把
\n<SMALL>儿</SMALL>
替换为
<SMALL>儿</SMALL>
这样“儿”就会回到它本来应该在的地方,不再处于分尸的状态。
用Emeditor find-extract “<SMALL>儿</SMALL>”,再统计,<SMALL>儿</SMALL>有7349条。
这些“儿”字在K大的mdx大概有很多不见了。
small.zip (92.6 KB)
另外把词头都用Emeditor find-extract抽出来,供大家研究参考。
citiao.zip (803.2 KB)
共有137425条。
这些词头不只是主词头,还包括了词典主词头之下的“亚词头”。