В какой-то момент почти каждый, кто изучает язык, задается одним и тем же вопросом:

«Сколько слов на самом деле нужно знать, чтобы говорить свободно?»

Это естественный вопрос. Изучение языка может казаться бесконечным, и четкое число сделало бы этот процесс более управляемым. Если бы кто-то мог просто сказать: «Выучите ровно 5 000 слов — и будете говорить свободно», изучение языков выглядело бы гораздо проще.

Честный ответ сложнее.

С точки зрения строгой лингвистики свободное владение языком нельзя свести к одному числу слов. Язык — это не закрытая база данных. Это живая система звуков, значений, грамматики, социальных привычек, культурных отсылок и гибких моделей употребления.

И все же корпусная лингвистика — изучение больших массивов реального употребления языка — дает нам очень полезные ориентиры. Исследователи, такие как Пол Нейшн, Стюарт Уэбб и другие, изучали, какой словарный запас нужен для понимания устного и письменного английского на разных уровнях. Их выводы не дают волшебного числа, но помогают составить реалистичную карту.

Эта статья в основном посвящена английскому языку, потому что для него доступны одни из самых хорошо изученных данных о частотности слов. Общие принципы полезны и для других языков, но точные цифры могут меняться в зависимости от грамматики, морфологии, системы письма и того, как исследователи считают словарный запас.

Чтобы разобраться в этой карте, сначала нужно прояснить один важный вопрос.

Что именно мы считаем?

Когда люди спрашивают: «Сколько слов мне нужно знать?», слово «слово» кажется простым. Но в лингвистике все не так просто.

Возьмем английский глагол run.

Он может встречаться в разных формах: run, runs, ran, running

Считать ли их четырьмя отдельными словами? Или одним словом с разными формами?

Большинство изучающих язык, вероятно, почувствуют: если они знают глагол run, им не хотелось бы, чтобы каждая грамматическая форма считалась совершенно новым словом. Поэтому лингвисты часто используют более абстрактные единицы при измерении объема словарного запаса.

Первое полезное понятие — лемма.

Лемма — это базовая, словарная форма слова. Например, go — это лемма для форм go, goes, went, gone, going. В словаре обычно ищут базовую форму, а не каждую возможную грамматическую форму отдельно. Корпусные инструменты работают с леммами похожим образом: они объединяют разные формы слова под одной основной записью.

Пока все довольно интуитивно.

Но во многих исследованиях словарного запаса — особенно в английском языке — часто используется еще более широкое понятие: семейство слов.

Что такое семейство слов?

Семейство слов — это группа связанных слов, построенных вокруг одного базового слова. В него входит основное слово и некоторые его распространенные, прозрачные формы.

Например, упрощенное семейство слов вокруг teach может включать: teach, teaches, teaching, taught, teacher

Упрощенное семейство слов вокруг nation может включать: nation, national, international, nationality

Идея не в том, что все эти слова одинаковы. В реальном употреблении это, конечно, разные слова. Но они достаточно связаны, чтобы знание одного часто помогало понять другие.

Это важно, потому что изучающие язык не учат каждое слово в полной изоляции. Если вы знаете happy, понять unhappy или happiness становится легче. Если вы знаете move, проще догадаться о значении movement. Если вы знаете use, такие слова, как useful, useless и reuse, становятся легче для распознавания.

В этом и заключается логика семейств слов.

Однако семейства слов не всегда просты. Некоторые родственные слова легко понять по базовому слову, а другие — нет. Например, sign и signature связаны, но начинающему эта связь может быть неочевидна. Compete, competition и competitive тоже связаны, но в предложениях ведут себя по-разному.

Поэтому подсчет семейств слов полезен для исследований, но может сбивать с толку тех, кто учит язык. Он дает практическую оценку словарных знаний, но это не то же самое, что утверждать, будто каждый член семейства автоматически полностью освоен.

В этой статье, когда речь идет об объеме словарного запаса, лучше думать в терминах ключевых словарных единиц: не каждой отдельной формы слова, но и не всегда одной строгой словарной леммы. Во многих исследованиях английского словаря ориентировочные числа основаны на семействах слов.

Это различие важно.

Изучающий язык, который знает 3 000 семейств слов, может узнавать в реальных текстах намного больше чем 3 000 отдельных словоформ. Но это не значит, что все их можно активно использовать в устной или письменной речи.

Почему частотность так важна

Языки — это не сбалансированные системы, где каждое слово встречается одинаково часто.

Небольшое количество очень частотных слов встречается постоянно. Тысячи других слов появляются лишь время от времени. Эта закономерность часто связана с законом Ципфа — статистической тенденцией, при которой самые частотные слова составляют очень большую часть реального употребления языка.

В английском слова вроде the, be, have, do, say, go, make, know, think, good встречаются повсюду. Редкие слова могут быть полезными, красивыми или важными в отдельных областях, но в повседневном общении они появляются намного реже.

Отсюда следует мощный принцип обучения:

Первые несколько тысяч высокочастотных слов дают наибольшую отдачу.

Знание 1 000 самых распространенных слов помогает узнавать удивительно большую часть обычной речи. Но это не значит, что будет понятно все. Оставшиеся незнакомые слова часто несут важный смысл предложения.

Например:

Я пошел в ___, потому что у меня болел ___.

Можно понимать большую часть грамматики и распространенных слов, но пропущенные слова могут быть ключевыми. Это был врач? Стоматолог? Аптека? Больница? Колено? Живот? Зуб?

Вот почему важен охват.

Что означает «95% охвата»?

Исследователи корпусов часто говорят об охвате текста. Это процент слов в тексте, которые уже известны.

Если вы знаете 95% слов в тексте, это звучит отлично. Но это все равно означает, что каждое двадцатое слово может быть незнакомым.

В коротком предложении это может быть не большой проблемой. В романе, подкасте, фильме или лекции это уже может утомлять. Незнакомые слова появляются снова и снова, и некоторые из них могут быть решающими для понимания смысла.

При примерно 95% охвата часто можно уловить общую мысль, особенно если тема знакома и есть визуальная или ситуативная опора. При примерно 98% охвата понимание становится гораздо комфортнее. Проще догадываться по контексту, читать или слушать с меньшим количеством пауз и больше сосредотачиваться на смысле, а не на расшифровке каждого предложения.

Широко цитируемая работа Пола Нейшна показывает, что для примерно 98% охвата устного английского может понадобиться около 6 000–7 000 семейств слов, а для многих письменных текстов — 8 000–9 000 семейств слов.

Для неформального устного английского, фильмов и телевидения эти числа могут быть несколько ниже. Уэбб и Роджерс обнаружили, что самые частотные 3 000 семейств слов вместе с именами собственными и периферийными словами дают около 95% охвата телепрограмм, а примерно 7 000 семейств слов — около 98% охвата.

Более свежее исследование неформального устного английского также предполагает, что примерно 2 000–3 000 семейств слов могут давать около 95% охвата для некоторых типов неформального устного материала, тогда как для примерно 98% может потребоваться 5 000–7 000 — в зависимости от жанра.

Так что ответ зависит от того, что именно нужно понимать.

Непринужденный разговор, ситком, университетская лекция, юридический документ и литературный роман требуют не совсем одного и того же словарного запаса.

Практические ориентиры по словарному запасу

Следующая таблица — не строгая научная шкала. Это практичный и понятный для изучающих язык ориентир, основанный на корпусных исследованиях и работах об охвате словарного запаса.

Объем словарного запаса Практический уровень Что это обычно означает
800–1 000 базовых слов Выживание / базовое общение Можно справляться с очень распространенными повседневными ситуациями, но выражение мыслей будет ограниченным, а многие детали будут теряться.
2 000–3 000 семейств слов Первые шаги к самостоятельности Можно понимать значительную часть неформальной повседневной речи, особенно при наличии контекста, повторений и знакомых тем.
3 000–5 000 семейств слов Уверенное повседневное общение Это реалистичный порог для многих изучающих язык, которые хотят самостоятельно общаться в повседневной жизни, путешествиях, простых рабочих ситуациях и понимать распространенные медиа.
6 000–9 000 семейств слов Продвинутое понимание Можно понимать гораздо более разнообразный устный и письменный материал, включая многие фильмы, подкасты, статьи и профессиональные разговоры.
10 000+ семейств слов / широкий рецептивный словарный запас Почти носительский или очень продвинутый диапазон Можно комфортнее работать со сложным, академическим, литературным и специализированным языком, хотя новые слова будут встречаться всегда.

Самый важный вывод таков:

Не нужно знать каждое слово в языке, чтобы хорошо им пользоваться.

На самом деле никто не знает всех слов в языке. Даже носители регулярно сталкиваются с незнакомыми словами в специализированных областях, литературе, праве, медицине, технологиях или региональной речи.

У носителей также гораздо больше рецептивный словарный запас, чем активный словарный запас. Рецептивный словарный запас — это слова, которые можно распознать и понять. Активный словарный запас — это слова, которые можно уверенно использовать в устной или письменной речи. Исследования объема словарного запаса носителей английского показывают, что взрослые носители могут распознавать десятки тысяч лемм, но в повседневной жизни активно используют гораздо меньшую их часть.

Для изучающих язык это различие очень важно.

Чтобы говорить свободно, не нужно активно использовать 20 000 слов. Но по мере роста рецептивного словарного запаса становится доступнее понимание большего числа книг, фильмов, разговоров, шуток, споров и культурных отсылок.

Готовы к следующей части? Читайте часть 2 здесь: