《上海话大词典（第2版）》MDX 词库 · 使用说明
================================================

【文件】
  上海话大词典（第2版）.mdx   词库正文（1.4 MB，18,607 词头 + 23,644 罗马字反查 = 42,251 条记录）
  上海话大词典（第2版）.mdd   资源文件（附录《上海话音系表》4 张图）
  两个文件必须放在同一目录下，文件名保持一致（仅扩展名不同）。

【安装】
  把上面两个文件一起拷贝到你 MDict 软件的词库目录，重启软件即可。

【怎么查】
  1. 查汉字：直接输入词头，如「日头」「溚渧」「盪」。
  2. 查读音：输入上海话罗马字，如「nikdhou」也能跳到「日头」；
     异读与又音（如 a(b) / a / b）均已拆成独立条目，任一写法都能命中。
  3. 查附录：输入「上海话音系表」可看本书拼音方案的声母/韵母/声调表。
  4. 查体例：输入「使用说明」或「凡例」。

【体例符号】
  〈名〉〈动〉……      词性
  ① ② ③               义项序号（OCR 误识字符已自动校正）
  〔旧〕〔儿〕〔俚〕〔詈〕  旧词 / 儿语 / 俚语 / 詈语。
                        原书印为白字黑底方框，OCR 丢弃方框并把框内字
                        误读成「回/间」等。本库已逐条放大原图核验，
                        统一改用〔〕六角括号标出，绝不混入释义正文。
  ◇                    难字说明、古音古义引用
  □                    有音无本字（原书印刷空框，非 OCR 失败）
  〔□ 音××，本字线索〕  对有音无本字者给出的读音与线索说明
  : 引出例句，多个例句用 | 隔开
  ～                    例句中代替本词头

【数据说明】
  · 由纸质书扫描件 OCR 自动识别整理，非官方电子版，仅供个人学习查询。
  · 原书标称收词 19,300 余条，本库切分收录 18,607 词头，约 96.4%。
  · 图像先做清晰度增强（去噪、提升对比与锐度），再识别。
  · 识别采用当前可得最强模型 PP-OCRv6（medium，via rapidocr）按原分辨率
    对全书 622 页整本重扫，作为主识别源。
  · 多源保守融合：以人工校订的 v3 基线（ocr_base）为对齐基准与缺省值，
    仅当另有 ≥2 个相互独立的识别源（PP-OCRv6 标准版 + PP-OCRv6 medium 版）
    一致反对基线时，才采纳新字（总权重阈值 TOTAL_W/2）。这样既能借新版
    模型修正旧误，又不会因单一引擎的偶发错误而丢弃已审校文本。本次融合
    共变更 22,973 行（其中 16,155 行多源一致、9,310 行保留基线）。
  · 人工校订表（data/manual_fixes.json）：逐字以「原图字形几何 + 多源
    识别一致度 + 本书反切/俗写自证 + 全书同字互证」核验后登记，共 22 条
    高置信修正，例：
      塳尘（p20，土+蓬，《集韵》蒲蒙切「塳，尘也」）
      雪里蕻（p88，呼贡切「蕻，吴俗谓草木萌」；同页「雪菜」条正文即作雪里蕻）
      䖆（p109/p129，女亮切「䖆，菜也，一曰藏」，义为馅儿）
      拓肩（p137，扌+石=拓；p338 拓 tok 读法互证）
      筴栅（p181，竹+夹=筴，《广韵》古洽切）
      脗（p351，弥邻切「脗，脗合」）
      蕻（p397，呼贡切，又写作蕻）
      蹬蹬蹬（p509，足+登×3）
      搭（p20，德盍切=搭，正文自注「俗写作搭」；璋读 zhāng 与 dak 不合）
    该表在每次重新解析后最后回放，确保审校成果不被新版识别覆盖。
  · 语用标签还原（原书白字黑底方框）：全书共还原 〔旧〕891 处、
    〔儿〕1 处、〔俚〕1 处，涉及 803 条词条。其中 OCR 把方框「旧」
    误读为「间/回」的 824 处已逐条放大原图核验改正（标签可出现在
    词性括号后，也可出现在 ②③ 等义项序号后）；
    另有 14 处确为「回/间」普通用字（回转、回绝、回答、回过头来、
    间接、回娘家等）的，已核验保留，未被误改。
  · 有音无本字：原书以空框 □ 印刷者全书 16 处，本库为其中 15 处
    加注〔□ 音××，本字线索〕，综合罗马字、《广韵》反切与俗写给出读音。
  · 特殊符号归位：同形词块标记 ⊖、义项序号 ① 等被 OCR 误读为
    の/○/μ/√ 者共 15 处已还原；难字说明符 ◇ 83 处、词性括号
    9,829 处、方框标签等均已归一；全/半角括号、浪纹号 ～、破折号 —
    已按原书体例统一。
  · 约 1,400 个词头因按义类复立而重复出现：本书按义类编排，同一词在
    多个义类中各立条目；同义类中以 ⊖ 标记的同形词块已识别为独立条目，
    MDict 会并列显示多条。
  · 已知局限：生僻字、小字号注音仍存在个别 OCR 误识（反切引文中极生僻字
    偶缺，本书自证可补者已补）；扫描件存在梯形畸变，个别栏末词条尾部可能
    缺失；熟语区约百余条词头混入罗马字碎片（换行续接所致）未及分离。
    重要引用请核对纸本。
