语言学习 · 7 分钟阅读
读一本外语书需要多少词汇?
研究给出的答案是:要能舒服地独立阅读,大约需要 8000 个词族;要借助帮助读完一本小说,大约需要 4000 个。两个数字听起来都让人泄气,而两个数字的约束力都不如看上去那么强。
“覆盖率”是什么意思
词汇研究讲的是词汇覆盖率:一页文字中你已经认识的比例。反复出现的门槛是 95% 和 98%。
它们听起来很接近。其实不然。覆盖率 98% 时,你大约每五十个词遇到一个生词——差不多一个短段落一个,可以猜过去而不必停下。95% 时是每二十个词一个,在正常的一页上,等于隔行就有一个。
这就是读一本书和解一本书的区别,也是为什么三个百分点就决定了人们能不能读完。
为什么这个数字这么高
词频的分布极不均匀。最常见的 1000 个词族覆盖普通文本的约 80%,接下来的一千个只再添大约五个百分点。再往后,每多一千个换来的越来越少。
- 1000 个词族 ——覆盖率约 80%。每五个词一个生词。
- 2000 个词族 ——约 85%。够读分级读物,不够读小说。
- 4000 个词族 ——约 95%。有持续的帮助,小说就变得可行。
- 8000 个词族 ——约 98%。轻松阅读,基本不用帮助。
所以从 4000 到 8000 的最后一段,是把词汇量翻一倍去换三个百分点。而这三个百分点恰恰是起作用的那三个,也是最难挣到的——这正是为什么它们要靠读书而不是靠背来挣。
为什么长尾永远不会真正结束
即便到了 98%,仍会剩下一些词,而且不是课程会教的那些:专有名词、方言、时代用语、某位作者的偏好,以及那些无法从组成部分推出意思的习语。母语读者同样会碰到,而且大多不会察觉,因为靠上下文猜测本来就是流利阅读的样子。
追求 100% 并不是一个目标,就算在自己的母语里也没有人达到。
这个数字不是门槛
覆盖率是文本和读者共同的属性,而不是读者一个人的属性。你并没有一个数字——面对童书、惊悚小说和十九世纪的长篇,你各有一个不同的数字。
这意味着务实的做法不是等到有了 8000 个词族。而是挑一本以你现有词汇量就已接近 98% 的书,把它读完,让数字自己涨上去。阅读量提升覆盖率比背词表更快,因为高频词会不断重现直到记住,而低频词本来就不需要记住。
让 95% 感觉像 98%
还有第二种缩小差距的办法:降低一个生词让你付出的代价。在每二十个词一个生词的情况下,一次要花一分钟的查词会终结这次阅读——你先丢了句子,再丢了段落,然后丢了兴致。一次只花一秒的查词则不会。
这就是主张“在上下文中解释”胜过词典的全部理由。词典把一个词的所有义项还给你,把挑选的活儿留给你,而这恰恰是你还在学时最难的部分。问题从来不是“这个词可能是什么意思”,而是“它在这里是什么意思”。
把查词的代价降得足够低,一本覆盖率 95% 的书就会远早于你的词汇量所允许的时候变得可读。