OED人机协作翻译(双解)项目

我之前是自己独立搞 累死累活 也没弄出来多少 这不 正好有朋友对AI感兴趣 就想着是不是能利用一下 就我本人来说 其实技术 能力各方面都是非常有限的 如果要做 要靠大家一起努力了

那把这30个发出来看看呗,有啥问题大家找找

再等等看吧 希望大家能看到

将来应该能看到的 耐心等等吧

你作为项目统筹的,需要先自己搞清楚这个项目的复杂度,比如 OED 的词条数,需要翻译多少句子,以及 AI 可能需要消耗的令牌数量,你还要决定翻译的风格和对 AI 模型进行简单的评估, 需要了解 API 接口、调用限制及预估翻译成本,还有人机协作的方式,审核校对是用纯文本还是用 CAT 辅助,参与协作是用 Github 还是用 Notion 之类的文档平台,整个流程你都要提前走通,最后是工作量多少项目周期多长每个阶段人员角色怎么安排都要有个基本的预期。

完全认同。尽管有大语言模型作为辅助工具,这项工程即便由专业的翻译团队去推进,也面临巨大的难度,更何况依赖水平参差、背景各异的论坛用户。

当前人们对于大语言模型的能力存在一定程度的高估,尤其是在语义层次理解、语境判断与术语统一等方面,它仍有明显局限,而 OED 这本词典的翻译工作恰恰对这些维度有极高要求,实际作用是非常有限的,远未达到可独立胜任的程度。

另外,关于 OED 双解的必要性,引用 GPT-4o 的回复:

《牛津英语词典》为何未曾推出过双解版?

《牛津英语词典》(OED, Oxford English Dictionary)本身没有推出双解版 (即英汉双语解释版本),原因如下:

1. 定位与受众

OED 是面向语言学者、研究人员和专业人士的权威历史词典,主要目的是:

  • 提供每个词的历时演变、起源、语义发展
  • 展示大量历史语料引文

这类内容专业性极强,其主要用户群体具备较强的英语能力,无需中文解释

2. 使用深度与风格

  • OED 的定义非常严谨、学术化,不是以“学习型词典”或“工具型词典”为目的;
  • 双解词典通常用于学习英语辅助阅读,例如《牛津高阶英汉双解词典》(Oxford Advanced Learner’s English-Chinese Dictionary, OALECD),这类词典才有对应的双解版。

3. 已有其他牛津双解词典满足市场

  • 牛津大学出版社已经出版了多种英汉双解学习词典,如《牛津高阶》《牛津中阶》等,它们是为英语学习者量身打造的,填补了需求;
  • 没有必要将极其庞大和专业的 OED 做双语化——那将是一项耗费极高、用途有限的工程。

总结:

OED 没有推出过双解版,因为它不是为英语学习者设计的,而是作为记录英语历史和演变的权威工具,其专业性远超一般读者的需求;双解功能则由其他更适合的牛津词典产品承担。

确实 这已经远远超过我个人的能力了 实在不行 只有蚂蚁啃骨头慢慢自己啃了

确实,随便一展开都是天文数字,想都不用想,
最切合实际就是洗版,整理,google机翻,在导入,打包,其他的本地跑,api跑,免费网页跑,效果是有提升,但是工作量指数上升,
或者tango写个插件,调用手机0.5b模型,查询单词实时翻译,

如果是就我个人的想法来说 我是倾向于不处理OE ME的 因为这些只能增加无谓的工作量 而且又没有人看 我更倾向于从这些词义去寻找的用法逻辑 让人迅速提升水平

话虽这么说 如果是面面俱到的话 根本没法学没法做了

只能尽量在自己的能力范围内吧

Z 词条 1321个 已经洗版 点击可用
Z 词条 1321.7z (9.2 MB)

![QQ_1750148162005|690x442](upload://4ZpmZ5M3tVdkBh0dJn2pFM9L3lw.png
例句 7249 注意 不能翻译 标签里面的东西
例句 7249_.7z (290.8 KB)

复数形式会比较正确,但词形看上去丑,我喜欢ium结尾的形式,用它结尾的新造词在科学、文学、it界也是传统了,最新的就有trainium、codeium等。

我真不懂你们在这里争个什么劲,有这时间吵架不如直接开始动手做,两三天就能整出个初步汉化的版本来。是骡子是马拉出来溜溜就知道了。

我没有要打广告的意思,但现在已经有工具能可以实现全自动的AI翻译了。沉浸式翻译能自动解析HTML文本格式,生成双语对照翻译,嫌AI不靠谱,使用时先看一眼译文上面的英语原文就行了(至于排版效果,打开OED官网用沉浸式翻译插件试试就知道了)。AI术语表、自定义提示词等功能都齐全。沉浸式翻译一个月会员79元,直接提供了deepseek,chatGPT,gemini等AI服务,不用自已准备API,一个月有高达两千万token的额度(不够还能买),翻译OED几乎是够用了。

整个翻译过程需要人工的地方也就是配置提示词、洗版和调整文件格式之类的非重复性劳动。至于人工校对译文——我只能说我很敬佩能提出这种想法的人。这种给巨型词典作修订的事在我的印象中都是和“国家科研基金支持”、“高校专家团队合作”之类的字眼挂钩的。

需要的话,我可以提供从《语言学与应用语言学百科全书》mdx中提取出来的英汉对照表,有一万条语言学术语的英汉对照。(因为是自用的,我没有校对过,要用的话恐怕得先检查一遍)

我本来是东一嘴西一嘴 自己在慢慢搞 结果和@fuzzygz聊天 他对OED也很有兴趣 于是我就想着能不能发挥大家的力量把OED给搞出来 从大家提到的情况来看 其一 工作量巨大 其次 就是大家担心AI的质量 其实就我个人来说 我倾向于选出部分词 比如说根据COCA的词频 从1-50000的词 即便这样 从其他朋友的实践来说 恐怕也是相当困难 再有就是后续的校核 纯粹的术语 反倒不是问题 最怕的是那些术语 却又没有统一翻译的地方 再有就是 既然是翻译 也不想像王同忆老师那样不做加工的直译 要不然 也就失去了付出劳动的价值和意义了 现在讨论下来 似乎难度相当大 实在不行 我就继续按以前的路子自己搞 能搞多少算多少 这样虽说慢 也算是搞一个算一个

国家出钱搞的 要么是国家认为有用的 要么是糊弄人的 咱们自己做的 当然是尽量朝解决问题有用的方向去做 现在国家每年都有很多项目 很多资金 但是 我们还没有看到有哪一个是从普通的学习者角度出发 去解决学习过程中遇到的与词义用法有关的问题 看现在的书 辞典 用法 词义等等 哪一个不是代代相传 习习相因 基本上看不出创新在哪里 现在很多人弄语料库 其实 创新的东西也不是很多 而在这个透明的领域里 要想弄出个东西来 没有任何支持 又是何其困难!唉

说实话,现在的AI还暂时没有发展到能让人以个人之力完成以前需要一个专家团队才能完成的事情。我衷心建议你能沉下心,等待AI科技发展到更完善的时候再考虑搞那种完善的宏大项目。我很敬佩你的雄心,但现在只要(也只能)搞出一个能用的版本就足够了。

这个好多了 基本上能看出词条 词义和例句了 能不能教一下怎么把不必要的东西洗掉?这样我好试着看看其他的材料

现在来看 估计也只好如此 我前面已经做了一些摸索 不过 很不成熟 现在需要结合OED来重新做 只能慢慢来了

这个压缩包我的电脑报病毒,是什么问题?