logo

5 частотных списков слов: как учителю проверить покрытие текста

·автор WordByWord Team
13 мин чтения
5 частотных списков слов: как учителю проверить покрытие текста

Частотный список слов — это составленный по корпусу рейтинг, который показывает, какая лексика даёт наибольшее покрытие текста при наименьших усилиях. Вместо того чтобы угадывать, какие слова важны, вы учите те, что чаще всего встречаются в реальной письменной и устной речи. Канонические списки вроде NGSL и Academic Word List превращают этот рейтинг в то, что можно скачать и использовать, а выбор подходящего зависит от вашего уровня, целей и типа текстов, которые вы читаете.


Коротко:

  • NGSL заявляет покрытие более 92% общеанглийских текстов, а AWL и NAWL должны дополнять общий список, а не заменять его.
  • Перед скачиванием убедитесь, что у списка указаны корпус, единица подсчёта, проверенное покрытие, дата пересмотра и лицензия; устаревшие или не подходящие по региону источники могут ввести в заблуждение.
  • Проверяйте списки-кандидаты на отрывке из своего целевого материала: смотрите покрытие среди первых 1000, 2000 или 3000 единиц, прежде чем остановиться на одном из них.
  • Частотные рейтинги не учитывают идиомы, фразовые глаголы, значения слов и регистр, поэтому значения и типичные сочетания сверяйте по словарю или в реальном чтении.
  • Исследование показало, что сочетание частотности, семантических связей и суждения учителя даёт более короткие списки с покрытием на 11–18% выше на сопоставимых тестах.

WordByWord
Пополняйте словарь из того, что читаете
Проверьте, какую часть статьи вы уже понимаете, а затем сохраняйте незнакомые слова из текста для интервальных повторений.

Содержание

Как устроены частотные списки слов

Частотный список ранжирует слова по тому, как часто они встречаются в корпусе, то есть в большом собрании реальных текстов или записей речи. Этот рейтинг уточняют две связанные идеи: охват, который измеряет, в скольких разных текстах или жанрах встречается слово, и распределение, которое проверяет, сгруппированы ли вхождения слова в одном источнике или распределены равномерно. Слово, которое встречается часто, но только в одном романе, менее полезно, чем слово, которое встречается умеренно часто в сотнях источников.

Составителям также нужно решить, что считать «одним словом». Токен — это отдельное вхождение в тексте; тип — уникальное написание. Лемма объединяет словоформы (run, runs, running) под одним заголовочным словом, а семья слов идёт дальше и объединяет ещё и производные (run, runner, runaway).

Этот выбор меняет содержимое итогового списка:

  • Подсчёт по леммам считает runs и running той же единицей, что и run, и повышает её суммарную частотность.
  • Подсчёт по семьям добавляет производные вроде runner, и ранг семьи может подняться ещё выше.
  • Подсчёт по поверхностным формам держит каждую словоформу отдельно, из-за чего частые грамматические варианты уходят вниз списка, даже если корневое слово встречается очень часто.

Два списка, построенные на одном корпусе, могут ранжировать слова по-разному в зависимости от выбранной единицы, поэтому перед тем, как доверять рейтингу, стоит заглянуть в документацию списка.

Канонические открытые списки и когда они нужны

Несколько открытых списков покрывают большинство учебных ситуаций:

  1. New General Service List (NGSL): современное обновление исходного списка Уэста, созданное для широкого покрытия повседневного английского; по заявлению авторов, New General Service List покрывает более 92% большинства общеанглийских текстов.
  2. General Service List (GSL): исходный список Майкла Уэста 1953 года. Он важен исторически и всё ещё встречается в старых учебниках, но его корпус старше современного словоупотребления, поэтому воспринимайте его как справочный фон, а не как основной инструмент.
  3. Academic Word List (AWL) и New Academic Word List (NAWL): оба нацелены на лексику, которая встречается в академических текстах независимо от дисциплины. Ни один из них не является самостоятельным списком для изучения: сочетайте любой из них с общим списком вроде NGSL, чтобы наряду с академическими словами охватить повседневные.
  4. Слова Dolch и Fry: короткие классические списки для совсем юных или начинающих читателей в англоязычных школах. Они построены вокруг частотных служебных слов и распространённых существительных, а не вокруг статистики покрытия корпуса, поэтому взрослым и академическим учащимся подходят плохо.
  5. Частотные списки Wiktionary и родственные корпусные проекты: частотные данные, которые поддерживает сообщество, собранные из таких источников, как субтитры к фильмам и веб-тексты. Полезны, когда нужны частотности для языка или области, которые основные академические списки не покрывают.

Проект NGSL также публикует сопутствующие списки, построенные тем же методом: New Academic Word List для академической лексики, Business Service List для рабочего английского и список для подготовки к TOEFL. Единая методология упрощает их сочетание: не приходится беспокоиться о несовпадающих единицах подсчёта.

Как списки составляются и проверяются и по каким признакам им доверять

Надёжный частотный список документирует три вещи: корпус, из которого он взят, единицу подсчёта и заявленное покрытие. Состав корпуса важен, потому что список, построенный только на новостных текстах, ранжирует слова иначе, чем список на устных беседах или художественной литературе. Сильные списки смешивают письменные и устные источники и указывают, из какого признанного корпуса они взяты, например British National Corpus (BNC), Corpus of Contemporary American English (COCA) или Cambridge English Corpus.

Задокументированный порог покрытия говорит, насколько список приближает к пониманию. Исследование Нейшна о словарном запасе и покрытии связывает конкретные проценты покрытия с конкретными требованиями чтения и аудирования и отмечает, что и выбор корпуса, и единица подсчёта сдвигают итоговую оценку объёма.

Прежде чем доверять списку, проверьте такие признаки:

  • Названный и описанный корпус, а не просто «миллионы слов» без источника.
  • Указанная единица подсчёта (лемма, семья или поверхностная форма) и последовательное её использование.
  • Процент покрытия, привязанный к определённому тестовому корпусу, а не расплывчатое заявление.
  • Дата публикации или пересмотра: корпусы старше пары десятилетий пропускают новое распространённое словоупотребление.

Типичные ловушки: списки на британских источниках, бездумно применённые к учащимся с американским английским, устаревшие корпусы без современной лексики и файлы вообще без заметок о методологии. Репликационное исследование на Cambridge Core называет именно такое несоответствие корпусов повторяющейся проблемой исследований лексики.

Как выбрать подходящий список и использовать его в преподавании или учёбе

Выбор списка лучше всего работает как короткая повторяемая процедура, а не разовое скачивание.

  1. Определите целевой текст и цель. Понимание прочитанного, академическое письмо и беглая речь опираются на разную лексику, поэтому список, оптимизированный под одно, может подвести в другом.
  2. Сделайте быструю проверку покрытия. Возьмите образец материала, который вам действительно нужно понимать, и посмотрите, сколько его слов входит в первые 1000, 2000 или 3000 единиц списка-кандидата. Инструменты для такого сравнения, например программа Range, упомянутая в частотных исследованиях текстов, автоматизируют подсчёт, а для короткого отрывка можно посчитать вручную.
  3. Сократите список до рабочего размера. Уберите единицы, не относящиеся к вашей цели, и добавьте предметные термины, которых нет в общем списке, особенно техническую и отраслевую лексику.

Для самостоятельных занятий сочетайте сокращённый список с экстенсивным чтением на изучаемом языке, чтобы слова снова встречались в естественном контексте, и планируйте повторение с интервалами, а не одним марафоном.

Для класса разбейте сокращённый список на порции под размер урока, возвращайтесь к одним и тем же словам на нескольких уроках и в проверочных работах и отслеживайте, какие слова каждый ученик действительно освоил, а не просто услышал.

Совет: Проверьте список-кандидат на реальном образце целевого материала, прежде чем на нём остановиться: список с высоким заявленным общим покрытием всё равно может подвести на конкретном жанре или в конкретной области.

Где скачать списки и простые инструменты для анализа покрытия

На страницах проекта NGSL есть прямые ссылки на NGSL и сопутствующие списки, включая NAWL, вместе с документацией об исходном корпусе. Academic Word List, а также списки Dolch и Fry разложены по разным образовательным сайтам, поэтому каждый файл сверяйте с признаками надёжности выше, прежде чем на него полагаться.

Для более широких или многоязычных задач:

  • Страницы частотных списков Wiktionary содержат подсчёты по поверхностным формам, леммам и семьям слов для многих языков.
  • Корпусы Лейпцига и частотные коллекции на основе OpenSubtitles предлагают подсчёты за пределами основных списков для преподавания английского.
  • Лёгкие инструменты вроде Range или библиотеки с открытым кодом wordfreq позволяют сравнить текст с базовым списком без специального ПО; для коротких отрывков хватит таблицы.

Прежде чем использовать скачанный список, убедитесь, что в нём указаны корпус, лицензия и единица подсчёта.

Где частотные списки не справляются

Частотность говорит, как часто слово встречается, а не что оно значит в контексте, и сильнее всего этот разрыв заметен на идиомах и многословных выражениях. Kick, bucket и the по отдельности частые слова, но kick the bucket значит нечто, чего пословный подсчёт частотности уловить не может. Та же проблема с фразовыми глаголами, коллокациями и устойчивыми фразами: список на отдельных токенах высоко ранжирует take, break и down, но никогда не отметит take a break или break down как единицы, которые учащимся нужно узнавать целиком.

Многозначность создаёт родственную проблему. Bank стоит высоко в общем корпусе, но тому, кто изучает финансы, нужно значение «банк», а тому, кто читает о путешествиях, значение «берег». Частотный список даёт слово, не сообщая, какое значение преобладает в ваших материалах, поэтому прежде чем тратить время на слово, придётся проверить, подходит ли значение.

Регистр и тон частотности тоже не видны. Слово может быть частым в целом, но неуместным в официальном тексте, и наоборот, а голая цифра частотности этого не различает.

Всё это не делает частотные списки бесполезными, но означает, что лучше всего они работают как первичный фильтр, а не окончательный ответ. Используйте частотный список, чтобы решить, что искать и учить первым, а затем подтверждайте значение, регистр и типичные сочетания по словарю или в реальном чтении, прежде чем считать слово освоенным.

Частотные списки против тематического и семантического подходов

Частотные списки оптимизируют одно: статистическое покрытие связного текста. Тематические списки, напротив, группируют слова по теме, например путешествия, еда или бизнес, независимо от того, как часто каждое слово встречается в общем корпусе. Семантические кластеры группируют слова по смысловым связям, а не по частотности или теме, и это помогает выстроить вокруг слова сеть понятий, а не запоминать его изолированно.

Каждый подход решает свою задачу. Частотный список даёт наибольшую статистическую отдачу на каждое выученное слово, что делает его эффективным для общего понимания. Тематический список слабее по чистой эффективности, но сильнее по готовности к ситуации: если вы путешествуете, boarding pass важнее, чем подсказывает его частотный ранг, потому что понадобится в одном конкретном и ответственном моменте. Семантическая группировка помогает удерживать слова, связывая новые с уже знакомыми, и облегчает припоминание даже тех слов, которые не поднялись бы высоко в чисто частотном рейтинге.

Исследование составления списков на основе корпусов показывает, что самые сильные списки сочетают эти подходы, а не выбирают один. Соединение чистой частотности со связностью, то есть с тем, как слово связано с уже знакомыми учащемуся, и с суждением учителя об уместности в классе дало списки короче старых чисто частотных и при этом с покрытием на 11–18% выше на сопоставимых тестовых корпусах. На практике это значит, что частотный список служит прочной основой, а тематические или семантические группы вокруг ваших конкретных целей часто улучшают результат по сравнению с любым методом по отдельности.

Частотные списки против тематического и семантического подходов: обзорная схема

Как сочетать частотные списки с персональным обучением

Частотный список говорит, что статистически стоит учить в английском в целом, но ничего не знает о том, что лично вы уже знаете или в чём нуждаетесь. Самый сильный подход начинается с частотного списка для расстановки приоритетов, а дальше подстраивается под ваше чтение, интересы и пробелы.

На практике это многослойная система. Начните с сокращённого частотного списка как базовой цели. Добавляйте слова, которые реально встречаете в материалах, выбранных для чтения или просмотра: у них есть контекст и мотивация, которых нет у безликой строки списка. Убирайте слова, которые уже хорошо знаете, даже если в исходном списке они стоят высоко, чтобы оставшееся время шло на настоящие пробелы, а не на повторение освоенного.

Частотные слова превращаются в персональный учебный набор

Расписание интервальных повторений хорошо ложится на такой персональный набор, потому что подстраивает время повторения под то, насколько хорошо вы знаете каждое слово, а не обращается со всеми единицами одинаково. Слову, которое вы выучили год назад и до сих пор вспоминаете мгновенно, нужно гораздо меньше времени, чем тому, что вы постоянно забываете, и система, которая отслеживает эту разницу, экономит много учебного времени по сравнению с ровным повторением без расписания.

Сочетание важно потому, что чисто частотное изучение может ощущаться абстрактным: список из 2000 слов, не связанный ни с чем, что вы читаете, трудно выдержать. Привязка к реальному контенту связывает слова с тем, что вам действительно хочется дочитать, а для долгосрочного запоминания это обычно значит больше, чем теоретические проценты покрытия.

Списки задают приоритеты, беглость даёт чтение

Частотные списки — инструмент расстановки приоритетов, а не учебная программа. Они говорят, какие 2000 или 3000 слов дадут лучшую отдачу, но список в таблице никого ещё не научил языку. Настоящая работа начинается, когда эти слова снова встречаются в том, что вы действительно читаете или смотрите, потому что именно повторные осмысленные встречи превращают строку рейтинга в слово, которое вы употребляете не задумываясь.

Списки из этого руководства лучше всего работают как фильтр, который вы применяете перед чтением, а не как замена самого чтения. Сочетайте сокращённый частотный список с контентом, который читали бы и так, и дайте уже приоритетным словам всплывать по ходу естественным образом.

— Команда WordByWord

Учите приоритетные по частотности слова в том, что уже читаете

Мы создали наши расширение для Chrome и веб-приложение, чтобы логика частотных списков работала прямо в вашем обычном чтении в браузере. Режим Spotlight подсвечивает незнакомые слова на любой странице, в PDF или видео на YouTube, и приоритетные слова из частотного списка заметны в тот момент, когда появляются в реальном контенте, а уровень понятности заранее показывает, какую долю текста вы уже знаете, прежде чем вы возьмётесь его читать.

WordByWord

  • Собирайте важные слова в собственный набор: вручную, с помощью ИИ по запросу или импортом CSV-файла из Anki, Quizlet, таблицы или частотного списка, которому вы уже доверяете.
  • Повторяйте эти слова на карточках и в восьми режимах тренировки, включая набор текста и аудирование, по расписанию интервальных повторений, чтобы освоенные слова сами исчезали из подсветки.

Начните с тарифа Free Forever и переходите на Premium за 5,99 $ в месяц, когда захотите снять месячные лимиты на ИИ-тренировки и ИИ-генерацию.

Частые вопросы

Какие английские слова самые частые?

Самые частые английские слова — почти исключительно служебные: the, be, to, of и and возглавляют почти любой корпусный список независимо от жанра. Знаменательные слова вроде time, person и year обычно идут сразу за ними в общих корпусах, таких как COCA и BNC.

Какое слово второе по частоте в английском?

В большинстве крупных корпусов английского второе место занимает be (во всех его формах), сразу после the. Точный порядок может слегка меняться от корпуса к корпусу в зависимости от того, преобладает ли в выборке устная или письменная речь.

Где взять список редких слов?

Редкие слова — это, как правило, специальные, технические или малоупотребительные термины, которые стоят далеко внизу корпусного рейтинга, например узкая научная лексика или архаизмы. Единого фиксированного списка нет: его можно составить из любого частотного списка, взяв ранги ниже первых 5000–10 000 единиц, ведь что считать «редким», зависит от корпуса и выбранной границы.

Существует ли частотный словарь английского языка?

Да, несколько частотных ресурсов работают как словари, в том числе New General Service List с сопутствующими списками и открытые частотные данные на Wiktionary. Эти ресурсы ранжируют слова по частотности в корпусе, а не толкуют их по алфавиту, поэтому лучше всего работают вместе с обычным словарём, а не вместо него.

Источники

Запросить функцию

Что стоит добавить или починить? Читаем каждое сообщение и дарим за идею приятный подарок.

0 / 4000