# 做了一个所谓的"最后的单词表", 请大家帮忙看看

**URL:** <https://forum.freemdict.com/t/topic/14729>\
**Category:** 资源分享\
**Created:** [2022 年8 月 17 日 17:55 UTC](https://forum.freemdict.com/t/topic/14729 "2022-08-17T17:55:15Z")\
**Posts on this page:** 1\
**Showing post:** 1

<div class="post-metadata">

作者： ![舒服员](https://forumcdn.freemdict.com/letter_avatar_proxy/v4/letter/%E8%88%92/13edae/32.png) [@舒服员](https://forum.freemdict.com/u/%E8%88%92%E6%9C%8D%E5%91%98)\
发布日期： [2022 年8 月 17 日 17:55 UTC](https://forum.freemdict.com/t/topic/14729/1 "2022-08-17T17:55:15Z")

</div>

最近突然想要背单词, 把coca, bnc, 和常见考试的单词表汇总到了一起, 搞了这么一份, 请大家看看, 这个单词表有没有说明问题, 如果可以, 就开始制作了.

**制作方式**

**底本**  
coca 60000, BNC num o5, 初高中四六级考研GRE托福(来源不明)

**修正**  
coca: 修正大小写问题(网上的coca表大小写信息都丢失了)  
BNC: 没有错误, 但垃圾信息太多  
初高中四六级考研GRE托福: 各种奇怪错误, 但数量不多

**过滤以下**

1. 过滤掉重复的项目和特殊符号的单词如she/he
2. 一个字符的项目
3. 类似 a-, -a, a., .a, a’, 'a, a1, 1a 的两个字符项目
4. 过滤掉包含两个(含)以上连字符的项目
5. 如果带连字符的两个单词已经在表里, 过滤掉这个词, coca 60000里有10000个左右的带连字符的词, 这个比例太惊人, 有必要大规模删减

> **删掉的单词部分预览**
>
> e-mail  
> long-term  
> so-called  
> mm-hmm  
> easy-going  
> T-shirt  
> get-together  
> health-care  
> full-time  
> mid-autumn  
> self-esteem  
> short-term  
> well-known

1. 使用porter算法计算lemma, 删掉有相同词干的第二个单词,

> **删掉的部分单词**
>
> one  
> its  
> us  
> others  
> including  
> nation  
> develop  
> difference  
> building  
> news  
> personal  
> likely  
> officer  
> recently

1. 过滤掉在简明英汉必应版+新世纪英汉里找不到的项目, coca和BNC都是机器采集的, 包含很多垃圾信息

**合并**  
以coca为基础, 把考试单词排在coca 第2000个单词后边, **把bnc单词的前20000** (BNC修正后有15万, 过滤后还有6万多)个插入到单词表里.

最终是将近4万个单词.

不知道大家对这个单词表有什么看法  
[coca-exams-bnc-818.txt](https://forum.freemdict.com/uploads/short-url/vEGodAvSekGo4hUin9EwO9kb72F.txt) (342.4 KB)

---

_[View the full topic](https://forum.freemdict.com/t/topic/14729)._
