logo

98 % знакомых слов: как учителю проверить текст за 10 минут

·автор WordByWord Team
16 мин чтения
98 % знакомых слов: как учителю проверить текст за 10 минут

Конкретная цифра сильно зависит от того, как считать слова, поэтому один и тот же текст может получить разную оценку при разных методах подсчёта.


Кратко:

  • Чтобы понимать 98 % слов в письменном тексте, обычно нужно знать около 8 000–9 000 семей слов. При меньшем покрытии понимание заметно страдает.
  • Процент покрытия лучше всего использовать для планирования: высокий показатель не гарантирует понимания, особенно если незнакомы ключевые слова или выражения.
  • Точность измерения зависит от чётких правил подсчёта, по леммам, семьям слов или словоформам, и её стоит проверять короткими вопросами на понимание.
  • Если заранее разобрать пять-восемь самых важных слов текста, ученик получит максимум пользы без перегрузки. Особенно это касается сложных, специальных и научных текстов.
  • Инструменты вроде WordByWord автоматизируют подсчёт покрытия и повторение лексики, превращая проценты в конкретные решения о том, что читать и что учить.

WordByWord
Узнайте свой уровень понимания за секунды
WordByWord показывает, какую часть статьи, PDF или видео вы уже понимаете, а затем помогает повторять незнакомые слова с интервалами.
Попробовать WordByWord

Содержание

Что на самом деле измеряет доля знакомых слов

Доля знакомых слов звучит как одно устойчивое число. Это не так. Показатель меняется в зависимости от того, считаете ли вы все словоупотребления или только уникальные слова, и считаете ли родственные формы одним словом или несколькими.

Покрытие по словоупотреблениям — стандарт в исследованиях чтения: вы считаете каждое вхождение слова в отрывке, включая повторы, и определяете, какая доля этих вхождений знакома читателю. Статья на 500 слов, где слово «climate» встречается пятнадцать раз, требует знать его один раз, но каждое вхождение идёт в общий счёт. Это важно, потому что понимание зависит от того, как часто вы спотыкаетесь при чтении, а не от того, сколько разных слов есть в тексте. Текст с небольшим набором трудных слов, которые часто повторяются, может оказаться легче текста с большим разнообразием, даже если по числу уникальных слов он выглядит страшнее.

Подсчёт по уникальным словам, напротив, учитывает разные слова, а не их вхождения. Он полезен для описания лексического разнообразия текста, но плохо отражает то, как понимание складывается в процессе чтения: повторяющиеся слова читатель встречает гораздо чаще, чем предполагает число уникальных.

Есть ещё вопрос, что считать «одним словом». Лемма объединяет формы одной основы («run», «runs», «running»). Семья слов идёт дальше и объединяет под одним заглавным словом ещё и производные («run», «runner», «runaway»). Выбор между леммами и семьями слов меняет знаменатель, а с ним и итоговый процент. Исследования Пола Нейшена об объёме словаря и покрытии используют семьи слов как единицу подсчёта, и это одна из причин, почему его цифры покрытия не совпадают напрямую с исследованиями, где считают леммы или отдельные словоформы. Если сменить единицу подсчёта посреди проекта, числа перестанут быть сопоставимыми даже для одного и того же текста.

Стоит помнить и о третьем различии: распространённость слова в популяции и доля знакомых слов у конкретного человека. Распространённость показывает, сколько людей в большой выборке узнают данное слово, это свойство самого слова. Доля знакомых слов, напротив, описывает отношение одного ученика к одному конкретному тексту. Слово может быть широко известно носителям английского в целом и при этом оставаться незнакомым конкретному ученику, который читает конкретный отрывок. Эти две меры отвечают на разные вопросы: первая говорит, насколько слово «обычно» для популяции, вторая показывает, справится ли этот читатель с этим текстом прямо сейчас.

Что на самом деле измеряет доля знакомых слов: обзорная схема

Что исследования говорят о порогах покрытия

Цифры 95 % и 98 %, которые ходят среди преподавателей языков, восходят к конкретной линии исследований о связи между покрытием лексики и пониманием.

Самая цитируемая работа связана с именем Олдерсона и позже была пересмотрена Шмиттом и коллегами на платформе Lextutor. Их исследование на 661 участнике из восьми стран показало почти линейную зависимость между долей знакомых слов в тексте и качеством его понимания, проверенную на двух разных отрывках. Исследование Олдерсона о покрытии лексики и понимании прочитанного рекомендовало 98 % как более обоснованную цель для академического чтения, чем прежний ориентир 95 %, хотя авторы подчёркивали, что ни одно из этих чисел не является жёстким порогом. Понимание росло вместе с покрытием постепенно, а не скачком на некой волшебной отметке. Поэтому 95 % и 98 % лучше работают как ориентиры для планирования, чем как граница «сдал или не сдал».

Исследования объёма словаря Пола Нейшена переводят проценты покрытия в конкретное число слов. По его данным, изучающим английский обычно нужно примерно 8 000–9 000 семей слов для 98 % покрытия письменного текста и около 6 000–7 000 семей слов для того же покрытия устной речи, поскольку разговорный английский опирается на более узкий и частотный словарь.

Брисбарт и коллеги подошли к вопросу со стороны объёма словаря, а не покрытия. Их масштабная оценка показала, что типичный 20-летний носитель английского знает около 42 000 лемм, что соответствует примерно 11 100 семьям слов. Команда Брисбарта прямо указывала, что эти цифры зависят от определений: считать леммы или семьи и насколько строго понимать «знание» слова. Два исследования с разными определениями могут дать очень разные итоги и при этом оба будут верны в рамках своих условий.

Сравнение данных исследований о покрытии лексики

Как измерить долю знакомых слов в тексте

Измерение покрытия для конкретного текста — воспроизводимая процедура, будь вы учитель, который готовит задание на чтение, или ученик, который решает, стоит ли статья усилий.

Сначала зафиксируйте правила подсчёта и только потом считайте: если поменять их на полпути, сравнение между текстами потеряет смысл.

  1. Решите, считать по леммам, семьям слов или отдельным словоформам, и придерживайтесь выбора для каждого измеряемого текста.
  2. Решите, как учитывать имена собственные, числа и устойчивые выражения вроде «in spite of» или «give up»: их часто пропускают или считают неверно.
  3. Решите, важны ли регистр и пунктуация (для этой задачи обычно нет).
  4. Возьмите образец достаточной длины: несколько сотен словоупотреблений дают куда более устойчивую оценку, чем абзац на 40 слов.
  5. Выполните подсчёт выбранным методом и запишите полученный процент вместе с правилами, по которым считали.

Для коротких текстов достаточно ручного списка. Вставьте отрывок в таблицу, выпишите каждое уникальное слово, отметьте знакомое оно или нет, а затем взвесьте по частоте появления, чтобы получить процент по словоупотреблениям, а не по уникальным словам.

Для длинных текстов лучше масштабируется сопоставление с частотными списками. Инструменты на основе подхода RANGE сравнивают текст с частотными списками по уровням (первая тысяча самых частых семей слов, вторая тысяча и так далее) и показывают, какой процент словоупотреблений попадает в каждый диапазон. Этот метод, подробно описанный в исследованиях лексической нагрузки, быстрый и последовательный, но он предполагает, что частотный ранг достаточно хорошо отражает знания конкретного ученика, а это не всегда так.

Третий вариант опирается на данные о распространённости и знакомости слов, а не только на частотность. Набор данных нормы распространённости для 62 000 английских лемм, собранный по оценкам более 220 000 респондентов, показывает, насколько широко то или иное слово известно в большой популяции. Сверка текста с данными о распространённости выявляет случаи, когда слово формально редкое, но при этом широко известное, а чистый частотный подсчёт такое пропускает. Интегрированный инструмент, который сверяет текст с сохранённым словарём самого ученика, например функция «Уровень понятности» в WordByWord, сокращает всю эту процедуру: текст сравнивается напрямую с тем, что знает конкретный человек, а не со средними показателями по популяции.

Какой бы метод вы ни выбрали, проверяйте его. Процент покрытия хорошо предсказывает общие тенденции понимания, но не гарантирует понимания отдельно взятого отрывка.

Совет: После проверки покрытия задайте один-два коротких вопроса о главной мысли. Если читатель отвечает верно при низком показателе или не справляется при высоком, решающим должны быть ответы на вопросы.

  • 98 % при слабых ответах на вопросы обычно указывают на несколько критически важных незнакомых слов, а не на общий пробел в лексике.
  • 95 % при уверенных ответах говорят о том, что с текстом можно работать при небольшой поддержке.

Как использовать целевое покрытие при выборе текстов и заданий

Проценты покрытия становятся полезными, когда к ним привязано решение: какой текст дать, нужно ли заранее разобрать лексику и какой формат чтения подойдёт.

Для самостоятельного чтения, когда ученик работает один без словаря и помощи учителя, 98 % — более надёжная цель, что совпадает с рекомендацией из исследования Олдерсона. Ниже этого уровня незнакомые слова начинают прерывать чтение настолько часто, что понимание разваливается. При чтении в классе под руководством учителя, который отвечает на вопросы, покрытие может быть ещё ниже, потому что поддержка компенсирует часть того, что иначе стоила бы нехватка лексики. Тем, кто сравнивает экстенсивное и интенсивное чтение, будет полезно знать, что целевое покрытие для этих подходов заметно различается.

Заранее разбирать лексику имеет смысл, когда небольшое число незнакомых слов особенно важно для центральной мысли текста. Вместо того чтобы объяснять каждое незнакомое слово, эффективнее сосредоточиться на пяти-восьми ключевых словах, которые встретятся читателю многократно или на которых держится аргументация. Если слов больше, предварительный разбор начинает съедать время урока без соразмерной отдачи, а остальное усваивается попутно из контекста.

Жанр тоже меняет расчёты:

  • Новостные тексты обычно используют довольно узкий набор частотных слов, поэтому даже короткие образцы дают устойчивую оценку покрытия.
  • Художественная литература вводит больше разговорной лексики из диалогов, которая ведёт себя иначе, чем язык пояснительной прозы.
  • Научный текст опирается на специальную, редкую лексику, сосредоточенную в конкретных областях, поэтому общий показатель покрытия может скрывать трудности в узком, но критически важном наборе терминов.

В любом жанре образец короче 100–150 словоупотреблений даёт шумную оценку. Более длинные образцы, от нескольких сотен словоупотреблений, сглаживают влияние любого отдельного необычного слова.

Ограничения и типичные ошибки

Показатель покрытия — полезный инструмент планирования, а не вердикт о том, будет ли текст понятен. Прежде чем сильно опираться на эту цифру, стоит знать несколько слепых зон.

Узнавание не то же самое, что рабочее понимание. Ученик может отметить слово как знакомое, потому что видел его раньше, но не суметь вспомнить значение достаточно быстро, чтобы не отстать от предложения. Инструменты подсчёта покрытия учитывают узнавание, а не скорость вспоминания или глубину понимания, поэтому высокий показатель всё равно может скрывать пробелы.

Устойчивые выражения ещё больше усложняют подсчёт. Сочетания вроде «put up with» или «on the other hand» несут смысл целиком, но большинство методов оценивают каждое слово по отдельности. Это может завысить кажущееся покрытие отрывка, реальная трудность которого в значении фраз, а не отдельных слов.

Короткие тексты дают неустойчивые проценты. Абзац на 60 слов с двумя необычными словами уже оказывается на уровне покрытия, от которого чуть другой абзац на 60 слов может отличаться на десять процентных пунктов. Любое измерение на коротком отрывке считайте грубой оценкой, а не точным показанием, об этом говорят и исследования лексической нагрузки.

Частотность и важность не всегда совпадают. Одно редкое, но центральное слово, например название химического процесса в научной статье или ключевое юридическое понятие в тексте о политике, может заблокировать понимание целого абзаца, даже если это единственное незнакомое слово в нём.

Наконец, не считайте одно число полной картиной. Преподавателям стоит проверять показатели покрытия по реальному пониманию, а не доверять одному проценту.

Пошаговый порядок: измерить покрытие и принять решение

Практическая рутина превращает измерение покрытия из разового упражнения в процедуру, которую учителя и ученики могут повторять с каждым новым текстом.

  1. Выберите текст и образец. По возможности берите отрывок хотя бы на несколько сотен словоупотреблений в том жанре, с которым ученики реально столкнутся.
  2. Проверьте покрытие. Используйте инструмент с частотными списками, набор данных о распространённости или встроенную функцию уровня понятности, чтобы получить процент относительно известной читателю лексики.
  3. Проверьте понимание. Задайте один-два вопроса о главной мысли или ключевой детали. Расхождение между показателем и ответами сигнализирует о проблемном слове или особенности измерения.
  4. Решите, нужно ли вмешиваться. Показатель около 98 % при хороших ответах означает, что текст можно давать как есть. Более низкий показатель или расхождение означает, что нужно заранее разобрать несколько слов или дать глоссарий.
  5. Запланируйте повторную проверку. Через несколько недель измерьте покрытие на следующем тексте, чтобы увидеть, сокращает ли ученик разрыв.

Одна проверка покрытия плюс два вопроса на понимание занимают у большинства учителей меньше десяти минут на текст, когда порядок действий уже привычен. Это вписывается в подготовку к уроку, а не конкурирует с ней.

Совет: Разбирайте лексику сразу на весь предстоящий раздел, а не по одному тексту: многие ключевые слова повторяются в связанных текстах, поэтому одного разбора хватает на несколько заданий.

Процент покрытия становится решением только тогда, когда за измерением следует действие. Практичный протокол для класса, который сочетает автоматическую проверку покрытия с парой вопросов на понимание, даёт учителю быструю и воспроизводимую основу для выбора: дать текст как есть, добавить поддержку или заменить текст целиком.

Как WordByWord превращает измерение понятности в учебную практику

Функция «Уровень понятности» в WordByWord применяет описанную выше логику покрытия напрямую к тому, что ученик собирается читать или смотреть.

Режим Spotlight переносит это измерение на саму страницу. Вместо одного итогового процента он подсвечивает отдельные слова в зависимости от того, насколько хорошо ученик их знает, от новых до уже знакомых, так что незнакомая лексика видна с первого взгляда прямо во время чтения. По мере роста знаний подсветка исчезает, и получается наглядная, постоянно обновляемая версия того учёта покрытия, который учитель иначе вёл бы в таблице.

Когда читатель видит слова, из-за которых показатель понятности низкий, WordByWord в один клик превращает их в учебный материал: переводит любое слово прямо на странице, в PDF или в субтитрах YouTube более чем на 50 языках. Слова сохраняются в подборки, которые можно собрать вручную, сгенерировать с помощью ИИ по запросу или импортировать через CSV из Anki, Quizlet или таблицы, если вы переносите готовый список. Дальше карточки с интервальными повторениями в восьми режимах тренировки, включая ввод с клавиатуры, сборку предложений и аудирование, превращают разовый пробел в лексике в долговременное знание.

В классе каждый ученик проверяет заданный текст сам: открывает его с включённым режимом Spotlight, смотрит уровень понятности, сохраняет незнакомые слова по ходу чтения, а затем повторяет новую лексику дня в карточках. Учителю остаётся собрать эти цифры, а не проводить ручную проверку покрытия для каждого ученика по отдельности.

Покрытие как инструмент планирования, а не приговор

Проценты покрытия полезны именно своей простотой, и в этой же простоте их главный риск. Одно число соблазняет учителей и учеников считать его окончательным ответом, хотя гораздо лучше оно работает как отправная точка для собственного суждения.

Исследования здесь единодушны: покрытие хорошо предсказывает тенденции понимания в группах, но опыт чтения конкретного человека зависит от того, какие именно слова ему незнакомы, насколько они важны для отрывка и сколько поддержки доступно. Относитесь к показателю покрытия как к счётчику шагов в фитнес-трекере: он информативен, его стоит отслеживать во времени, но с ним не нужно спорить, когда собственное тело, а в нашем случае собственное понимание, говорит иное.

Самая полезная привычка — регулярность, а не точность. Одно измерение на одном тексте говорит только об этом тексте. Измерения на нескольких текстах за несколько недель показывают, растёт ли словарь ученика на самом деле, а именно эта цифра важна для планирования. Инструменты, которые делают покрытие видимым без дополнительной ручной работы, заслуживают места в рутине. Но решение, что делать с числом, по-прежнему принимает учитель или ученик, который видит ситуацию, а не сам процент.

— Команда WordByWord

Попробуйте измерить свой уровень понимания с WordByWord

Всё, о чём идёт речь в этом руководстве, покрытие по словоупотреблениям, цели 95 % и 98 %, десятиминутная процедура измерения, работает лучше с инструментом, который сверяет реальный текст с вашим реальным словарём, а не с обобщённым списком.

WordByWord

Функция «Уровень понятности» в WordByWord делает именно это: откройте любую статью, PDF или видео на YouTube и увидите, какую долю слов вы уже знаете, прежде чем тратить на них время. Затем режим Spotlight отмечает незнакомые слова прямо на странице, от новых до тех, что уже знаете, и вы за секунды решаете, подходит ли текст вашему уровню или нужен другой подход. Сохраняйте незнакомое в подборку, собранную вручную, сгенерированную ИИ по запросу или импортированную в виде CSV-файла из Anki, Quizlet или таблицы, и повторяйте её в карточках в восьми режимах, включая ввод с клавиатуры, аудирование и сборку предложений, по графику интервальных повторений, чтобы слова закрепились.

Расширение для Chrome и веб-приложение работают вместе более чем на 50 языках, и всё происходит прямо в том, что вы уже читаете и смотрите, а не в отдельное время для учёбы. Бесплатный тариф Free Forever включает основные функции понятности и словаря с месячными лимитами на ИИ-функции, а Premium за 5,99 $ в месяц снимает их для тех, кто измеряет и учится регулярно.

Установите расширение, откройте текст, который рассматриваете для следующего чтения, и проверьте его уровень понятности относительно своих сохранённых слов. Так вы увидите описанный здесь порядок действий в работе.

Источники

Вопросы и ответы

Знать 10 000 слов значит свободно владеть языком?

Свободное владение не сводится к одному числу слов, ведь понимание зависит от того, какие слова использует текст, а не только от того, сколько слов человек знает в целом. По оценке Брисбарта и коллег, типичный взрослый носитель английского знает около 42 000 лемм, намного больше нескольких тысяч, хотя по данным Нейшена уже 8 000–9 000 семей слов обеспечивают 98 % покрытия обычного письменного текста.

Какие 100 слов самые употребительные?

Самые частые слова английского языка почти целиком короткие служебные слова: артикли «the» и «a», местоимения «I» и «you», предлоги «of» и «in», распространённые глаголы «is» и «have». Эти частотные слова составляют значительную долю словоупотреблений в любом английском тексте, поэтому инструменты покрытия на основе частотности придают первой тысяче семей слов такой большой вес.

Правда ли, что 60 % английской лексики латинского происхождения?

Оценки вклада латыни в английскую лексику сильно расходятся в зависимости от того, учитывать ли прямые заимствования, латинские слова, пришедшие через французский, или научные и академические термины. Единой авторитетной цифры для всех регистров английского нет. У этой статьи нет источника для этого конкретного утверждения, поэтому лучше считать его расхожей оценкой, а не установленным фактом.

Сколько слов в среднем знает человек?

Цифра сильно зависит от возраста и от того, как определять «знать» и «слово». По оценке Брисбарта и коллег (2016), типичный 20-летний носитель английского знает около 42 000 лемм, что соответствует примерно 11 100 семьям слов, и словарный запас продолжает расти с возрастом.

Чем доля знакомых слов отличается от результата обычного теста по лексике?

Результат теста по лексике обычно показывает, сколько слов человек знает в целом, независимо от конкретного текста. Доля знакомых слов измеряет покрытие одного конкретного отрывка, поэтому один и тот же ученик может получить разные показатели на разных текстах в зависимости от жанра и темы, как описано в исследовании Олдерсона о покрытии.

Запросить функцию

Что стоит добавить или починить? Читаем каждое сообщение и дарим за идею приятный подарок.

0 / 4000