几乎每个语言学习者在某个阶段都会遇到同一个问题:
“到底需要认识多少词,才能达到流利?”
这是个很自然的问题。学习一门语言有时像是没有尽头,如果能有一个明确数字,整个过程就会显得更可控。要是有人能直接说:“只要学会 5,000 个词,就能流利使用”,语言学习看起来就轻松多了。
但诚实的答案要更复杂一些。
从严格的语言学角度看,流利程度不能简化成一个单一的词汇量数字。语言不是封闭的数据库,而是由声音、意义、语法、社交习惯、文化 references 和灵活使用模式组成的活系统。
不过,语料库语言学——也就是研究大量真实语言使用材料的学科——确实给了我们非常有用的参考标准。Paul Nation、Stuart Webb 等研究者研究过,要在不同水平上理解英语口语和书面语,需要多少词汇量。他们的研究没有给出一个“魔法数字”,但给出了一张更现实的地图。
本文主要聚焦英语,因为英语拥有一些研究最充分的词频数据。这些基本原则对其他语言也有参考价值,但具体数字会因语法、形态变化、书写系统,以及研究者计算词汇的方式而不同。
要看懂这张地图,首先需要厘清一个重要问题。
我们到底在数什么?
当人们问“我需要认识多少个词?”时,“词”这个概念听起来很简单。但在语言学里,它一点也不简单。
以英语动词 run 为例。
可能会看到很多形式: run, runs, ran, running
这些应该算作四个不同的词吗?还是算作同一个词的不同形式?
大多数学习者可能会觉得,如果已经知道动词 run,就不希望每一种语法形式都被当成一个全新的词来计算。因此,语言学家在衡量词汇量时,常常会使用更抽象的单位。
第一个有用的概念是 词元。
词元指一个词的基本形式或词典形式。比如,go 是 go, goes, went, gone, going 背后的词元。查词典时,通常查的是基本形式,而不是把每一种可能的语法形式都单独查询。语料库工具也会用类似方式处理词元:把不同词形归到同一个核心条目下。
到这里为止,这个想法还挺直观。
但许多词汇研究——尤其是英语词汇研究——常常使用一个更宽泛的概念:词族。
什么是词族?
词族是一组围绕同一个基本词构成的相关词。它包括核心词,以及一些常见、关系清晰的派生形式。
例如,围绕 teach 的一个简化词族可能包括: teach, teaches, teaching, taught, teacher
围绕 nation 的一个简化词族可能包括: nation, national, international, nationality
这个概念并不是说这些词完全一样。在实际使用中,它们显然是不同的词。但它们之间的关系足够紧密,所以知道其中一个,往往有助于理解其他词。
这一点很重要,因为语言学习者并不是孤立地学习每一个词。知道 happy 之后,理解 unhappy 或 happiness 就会更容易。知道 move 之后,就更容易猜出 movement 的意思。知道 use 之后,像 useful、useless 和 reuse 这样的词也会更容易识别。
这就是词族背后的逻辑。
不过,词族并不总是那么简单。有些相关词很容易从基本词推断出来,有些却不容易。比如,sign 和 signature 有关联,但对初学者来说,这种联系未必明显。Compete、competition 和 competitive 有关联,但它们在句子中的用法并不一样。
因此,按词族计数对研究很有用,但对学习者来说也可能让人困惑。它能提供一个实用的词汇知识估算,但这并不等于说词族里的每个成员都已经自动掌握了。
在本文中,谈到词汇量时,最好把它理解为核心词汇单位:不是每一个独立词形都单独计算,但也不一定严格等同于一个词典词元。在许多英语词汇研究中,参考数字是基于词族计算的。
这个区别很重要。
认识 3,000 个词族的学习者,在真实文本中能识别的独立词形可能远远超过 3,000 个。但这并不意味着可以在口语或写作中主动使用其中所有词。
为什么词频如此重要?
语言并不是一个每个词出现频率都相同的均衡系统。
少量极常见的词会不断出现。成千上万的其他词只会偶尔出现。这种模式常常与齐普夫定律有关:一种统计趋势,指最高频的词会占据真实语言使用中非常大的比例。
在英语中,像 the, be, have, do, say, go, make, know, think, good 这样的词到处都会出现。低频词可能很有用、很优美,或在特定领域很重要,但它们在日常交流中出现的频率远没有那么高。
这形成了一个非常有力的学习原则:
最先掌握的几千个高频词,带来的回报最大。
学习最常见的 1,000 个词,就能帮助识别普通语言中相当大的一部分。但这并不意味着就能理解一切。剩下那些不认识的词,往往承载着句子里的关键信息。
例如:
I went to the ___ because my ___ was hurting.
也许能理解大部分语法和常见词,但空缺的词可能至关重要。是 doctor?dentist?pharmacy?hospital?knee?stomach?tooth?
这就是为什么覆盖率很重要。
“95% 覆盖率”是什么意思?
语料库研究者常常会谈到文本覆盖率。它指的是一篇文本中已经认识的词所占的百分比。
如果认识一篇文本中 95% 的词,听起来已经很棒了。但这也意味着每 20 个词里,可能仍有 1 个不认识。
在一个短句里,这也许问题不大。但在小说、播客、电影或讲座中,就会变得很累。不认识的词会反复出现,其中一些还可能对理解意义非常关键。
在大约 95% 覆盖率时,通常可以跟上大意,尤其是在话题熟悉,并且有视觉或情境支持的情况下。到了大约 98% 覆盖率时,理解会舒服得多。可以更多地依靠上下文猜测,阅读或听的时候被打断得更少,也能把注意力更多放在意义上,而不是逐句解码。
Paul Nation 被广泛引用的研究表明,要达到英语口语约 98% 的覆盖率,可能大约需要 6,000–7,000 个词族;而许多书面文本可能需要 8,000–9,000 个词族。
对于非正式英语口语、电影和电视节目,需要的数量可能会低一些。Webb 和 Rodgers 发现,最高频的 3,000 个词族,加上专有名词和边缘词,可以覆盖电视节目大约 95% 的内容;而大约 7,000 个词族 可以达到约 98% 覆盖率。
一项较新的非正式英语口语研究也表明,对于某些类型的非正式口语输入,约 2,000–3,000 个词族 可能就能达到约 95% 覆盖率;而要达到约 98%,可能需要 5,000–7,000 个词族,具体取决于体裁。
所以,答案取决于想理解什么。
随意聊天、情景喜剧、大学讲座、法律文件和文学小说,需要的词汇量并不完全相同。
实用词汇量参考
下面这张表不是严格的科学量表,而是基于语料库研究和词汇覆盖率研究,为学习者整理的一份实用指南。
| 词汇量 | 实际水平 | 通常意味着什么 |
|---|---|---|
| 800–1,000 个核心词 | 生存 / 基础交流 | 可以应对非常常见的日常场景,但表达会比较受限,也会漏掉很多细节。 |
| 2,000–3,000 个词族 | 初步独立使用 | 可以理解非正式日常语言中的很大一部分,尤其是在有上下文、重复和熟悉话题支持时。 |
| 3,000–5,000 个词族 | 自信的日常交流 | 对许多想在日常生活、旅行、简单工作场景和常见媒体中独立交流的学习者来说,这是一个现实的门槛。 |
| 6,000–9,000 个词族 | 高级理解能力 | 可以理解更多样的口语和书面输入,包括许多电影、播客、文章和专业对话。 |
| 10,000+ 个词族 / 广泛的接受性词汇量 | 接近母语者或高度高级水平 | 可以更轻松地处理复杂、学术、文学和专业语言,虽然永远还会遇到新词。 |
最重要的一点是:
不需要认识一门语言里的每一个词,也能很好地使用它。
事实上,没有人认识一门语言里的所有词。即使是母语者,也经常会在专业领域、文学、法律、医学、科技或地区性表达中遇到不熟悉的词。
母语者的接受性词汇量也远大于主动词汇量。接受性词汇指的是能够识别和理解的词。主动词汇指的是能够在口语或写作中自信使用的词。关于英语母语者词汇量的研究显示,成年母语者可能能识别数以万计的词元,但在日常生活中主动使用的只是其中小得多的一部分。
这个区别对语言学习者非常重要。
不需要主动使用 20,000 个词,也能说得流利。但随着接受性词汇量增长,可以理解更多书籍、电影、对话、笑话、争论和文化 references。
准备看下一部分了吗?在这里阅读第 2 部分: