爬取结束了,我将原始数据放在下面,请自由取用,请不要为之后可能的分发设置任何门槛。自用不分发请去展示分区。
我不打算做成 mdx ,有兴趣者自行打包。
在这一场猫和老鼠的游戏中,我又当了一次老鼠。
All credits to https://dictionary.goo.ne.jp/
原始数据结构
文件
一共 12 部辞書,每部的所有数据都在一个压缩包里。压缩包采用 ZSTD 算法,Windows 可用 7-Zip 解压,Linux 可用 tar --zstd 解压。
| 压缩包文件名 | 辞書 |
|---|---|
| data_cej.tar.zst | goo時事英語辞典 |
| data_clj.tar.zst | gooコロケーション辞典 |
| data_dialect.tar.zst | 全国方言辞典 |
| data_ej.tar.zst | プログレッシブ英和中辞典 |
| data_gthmal.tar.zst | 地熱発電用語集 |
| data_idiom.tar.zst | 新明解四字熟語辞典 / 学研四字熟語辞典 |
| data_je.tar.zst | プログレッシブ和英中辞典 |
| data_jn.tar.zst | デジタル大辞泉 |
| data_kanji.tar.zst | 漢字ペディア |
| data_medical.tar.zst | からだと病気のしくみ図鑑 |
| data_person.tar.zst | デジタル大辞泉 |
| data_thsrs.tar.zst | 類語例解辞典 |
文件结构
以 data_kanji.tar.zst 为例:
data_kanji.txt辞書的文本数据,一行是词条网址,下一行是词条 HTML,词头可从 HTML 中提取。data_kanji/图片,如果有的话,我已经将图片放到文本数据中 HTML 指定的位置了。