Оценить сложность текста — значит посчитать, какая доля слов в нём вам уже знакома, и перевести это число в понятную оценку с советом, что делать дальше. Такое покрытие считается лично под вас, и именно оно предсказывает, пойдёт у вас текст или нет. Средний ученик тут ни при чём: у него другой словарь.
От рабочей системы оценки нужны три вещи, и сразу:
- Процент покрытия (например, 96%)
- Название зоны («Почти свободно», «Нужна поддержка»)
- Короткий совет («Читайте», «Сначала посмотрите пару слов», «Возьмите что-нибудь проще»)
Пороги, на которых держится вся эта схема, установили Лауфер и Равенхорст-Каловски (2010). Связь между долей знакомых слов и пониманием текста подтвердили Шмитт, Цзян и Грейб (2011). В WordByWord этот расчёт встроен в индикатор понимания, так что оценку вы видите ещё до того, как начнёте читать.
Коротко о главном
Универсальные формулы читаемости не отвечают на вопрос «смогу ли я это прочитать». Отвечает личное покрытие — доля знакомых именно вам слов.
| Тезис | Подробности |
|---|---|
| Покрытие индивидуально | Сложность меряется долей слов, знакомых конкретному человеку, а не общей оценкой текста. |
| Пороги взяты из исследований | 95% и 98% у Лауфер и Равенхорст-Каловски — вероятностные ориентиры, а не жёсткие границы. |
| Способ сопоставления решает многое | Сравнение по начальным формам или гнёздам однокоренных слов даёт заметно более высокий процент, чем сравнение точных форм. |
| Смотрите не только на процент | Скорость чтения и то, как часто вы лезете в словарь, дополняют картину. |
| WordByWord считает это сам | Индикатор понимания и режим Spotlight показывают ваше покрытие в реальном времени на любой странице. |
Содержание
- Что нужно подготовить до расчёта
- Как считается покрытие: шесть шагов
- Что стоит за каждой зоной
- Как показать результат в расширении
- Чего покрытие не показывает
- Чек-лист: что сделать по порядку
- Попробуйте прямо в браузере
- Частые вопросы
- Источники
Что нужно подготовить до расчёта
Пока нет двух вещей, любой процент бессмыслен: списка знакомых вам слов и разбитого на слова текста.
Для списка слов нужно сразу решить, в каком виде вы его храните. Отдельно «бегу», «бежал», «бегут» — или всё это одно гнездо со словом «бежать»? Второй вариант мягче и ближе к тому, как исследования размера словаря понимают знание слова, но считается дольше и легко приписывает вам то, что вы на самом деле с ходу не узнаете. Выгружаются такие списки обычно в CSV или JSON — это пригодится, если данные переезжают из одного инструмента в другой.
С разбивкой текста на слова та же история — решений несколько:
- Приводить всё к строчным буквам или различать «Орёл» и «орёл»?
- Разбивать «кто-нибудь» на части или считать одним словом?
- Убирать знаки препинания до подсчёта или после?
- Учитывать числа и имена собственные в общем количестве или выносить за скобки?
Единственно верного ответа тут нет, но выбранное правило должно работать всегда одинаково. Иначе процент поплывёт по причинам, к вашему словарю отношения не имеющим.
Совет: Если расширение синхронизирует список слов между устройствами, держите исходный список на устройстве, а наружу отдавайте хеш или сжатую версию. Так быстрее, и вся история вашего словаря не уезжает на сервер при каждом открытии страницы.
Как считается покрытие: шесть шагов
Алгоритм настолько прост, что целиком помещается во вкладку браузера — обращаться к серверу не нужно:
- Разбить статью на отдельные слова по выбранным правилам для регистра и пунктуации.
- Привести каждое слово к начальной форме или к гнезду однокоренных — в зависимости от выбранной стратегии.
- Сверить каждую полученную форму со списком знакомых слов.
- Посчитать совпадения и общее число слов.
- Разделить первое на второе — это и есть покрытие.
- Отнести получившийся процент к одной из зон.
Третий шаг влияет на результат сильнее всего остального. Сравнение точных форм строже и почти всегда даёт процент ниже: знание слова «идти» вам не зачтётся, если в тексте стоит «шёл». Сравнение по гнёздам однокоренных слов — самое щедрое и ближе всего к тому, как в исследованиях частотности меряют рост словаря: для большинства учащихся знакомое «бежать» покрывает и «бегущий».
Вот как это выглядит на коротком примере:
| Слово в тексте | Начальная форма | Знакомо? | Покрытие нарастающим итогом |
|---|---|---|---|
| Эти | этот | Да | 1/1 = 1.0 |
| рынки | рынок | Да | 2/2 = 1.0 |
| колебались | колебаться | Нет | 2/3 = 0.67 |
| непредсказуемо | непредсказуемый | Нет | 2/4 = 0.5 |
| весь | весь | Да | 3/5 = 0.6 |
| квартал | квартал | Да | 4/6 = 0.67 |

В рабочей версии перебирается вся статья, а не шесть слов, — механика от этого не меняется.
Что стоит за каждой зоной
Процент начинает работать только тогда, когда превращается в оценку, по которой понятно, что делать, без всякой арифметики. На практике зоны получаются такие:
- Ниже 90% — «Пока рано». Всё внимание уйдёт на разбор отдельных слов: словарь под рукой и очень медленное чтение.
- 90–94% — «С усилием». Прочитать можно, но это работа: подойдёт для занятия, а не для чтения в удовольствие.
- 95–97% — «Читаемо с подсказками». У Лауфер и Равенхорст-Каловски примерно 95% соответствуют минимальному пониманию с опорой на словарь; для этого нужно порядка 4000–5000 словообразовательных гнёзд, в зависимости от языка.
- 98% и выше — «Почти свободно». Чтение без остановок; в том же исследовании это уже 8000–9000 гнёзд.
Это вероятности, а не пропускной пункт. Понимание растёт вместе с покрытием более-менее плавно, обрыва в конкретной точке нет: статья с 93% не становится автоматически нечитаемой, а с 96% — автоматически лёгкой.
Совет: Если покрытие 92–94%, а тема человеку интересна, лучше подтолкнуть его читать, а не искать что-то попроще. Азарт от текста чуть выше своего уровня обычно перевешивает пару лишних походов в словарь.
Как показать результат в расширении
Цифра полезна ровно настолько, насколько её легко считать с экрана. Хороший индикатор показывает процент, цветовую зону и короткую фразу — что-нибудь вроде «96% — читаемо». Причём до начала чтения, а не когда человек уже бросил текст на середине.
Оценка всей статьи целиком удобна, когда выбираешь, что открыть следующим. Оценка по абзацам или предложениям нужна для вдумчивого чтения: внутри одной статьи покрытие скачет — простое вступление, а дальше техническая середина. Переключатель между двумя режимами закрывает почти все сценарии.
Подсветка незнакомых слов прямо в тексте, перевод по наведению и кнопка «добавить в словарь» превращают оценку из шлагбаума в рабочий инструмент. Именно так устроен режим Spotlight в WordByWord: незнакомые слова видны прямо на странице, а по мере изучения подсветка гаснет — и оценка сложности остаётся актуальной, а не замирает раз и навсегда.
- Для начинающих: крупные зоны, простые подписи («легко», «сложно»), поменьше цифр на экране.
- Для среднего уровня: точный процент, название зоны и число незнакомых слов.
- Для продвинутых: процент плюс разбивка по предложениям для точечной проработки.
Список знакомых слов по умолчанию стоит держать на устройстве, а синхронизацию с облаком включать по желанию: история словаря говорит о человеке и его уровне довольно много.
Чего покрытие не показывает
Покрытие оценивает нагрузку на внимание, а не понимание как таковое, и превращать любой процент в зачёт-незачёт скорее вредно. Чем выше покрытие, тем больше внимания остаётся на сам ход мысли автора; чем ниже — тем ближе чтение к расшифровке слово за словом, а это совсем другое занятие.
Есть несколько вещей, которые сдвигают связь покрытия и понимания и в голом проценте не отражаются:
- Знание темы. Статья с покрытием 92% по знакомому предмету идёт легче, чем с 96% по незнакомому.
- Жанр и связность. Плотный академический текст даётся тяжелее разговорного при одинаковом покрытии.
- Устойчивые выражения. Идиомы и сочетания завышают процент, хотя смысл всё равно ускользает.
- Длина текста. Чем длиннее статья, тем сильнее накапливается усталость от незнакомых слов.
Попытки воспроизвести исходный порог в 98% на разных группах учащихся дали неодинаковые результаты — ровно поэтому цифра должна помогать принять решение, а не принимать его за вас.
Что с этим делать: смотреть на покрытие вместе с поведением. Скорость чтения, частота обращений к словарю и время на странице расскажут о реальной сложности больше, чем один застывший процент.
Чек-лист: что сделать по порядку
Если вы собираете такое в расширении или в собственном скрипте, порядок шагов важен:
- Выгрузите список знакомых слов в едином формате — CSV или JSON.
- Выберите способ сравнения: точные формы, начальные формы или гнёзда однокоренных.
- Подберите или напишите инструмент, который разбивает текст на слова и приводит их к начальной форме нужного языка.
- Посчитайте покрытие и отнесите его к зоне.
- Покажите зону вместе с коротким советом, а не голую цифру.
- Пишите результаты локально, а синхронизируйте только с явного согласия.
Проверьте систему на двух текстах: одном заведомо лёгком и одном заведомо трудном. Если обе оценки совпали с вашим ощущением — всё работает. Готовые результаты кешируйте по статьям и пересчитывайте по мере пополнения словаря, чтобы не перебирать каждый раз весь текст заново.
Почему личное покрытие точнее универсальных формул читаемости
Обычные формулы читаемости оценивают текст одинаково для всех — в этом и беда. Два человека поймут одну и ту же статью совершенно по-разному просто потому, что знают разные слова, а формула этой разницы не видит и одного из двоих отправит в заведомо неподъёмный текст. У личного покрытия есть и то, чего у общей оценки нет в принципе: оно показывает, какие именно слова вас тормозят, — и оценка сложности сразу превращается в список на изучение. Вокруг этого цикла и построен WordByWord, поэтому мы и считаем, что место такой штуке в расширении для Chrome, а не в разовом отчёте о читаемости.
Попробуйте прямо в браузере
WordByWord проделывает этот расчёт на каждой открытой странице, в PDF и в видео на YouTube — по вашему собственному словарю, а не по общему списку. Индикатор понимания показывает процент до начала чтения, а режим Spotlight подсвечивает незнакомые слова прямо в тексте, от впервые встреченных до выученных, — и сразу видно, что именно мешает.
Каждое сохранённое из статьи слово становится карточкой для интервальных повторений: та же оценка, что подсказала, за какой текст браться, заодно собирает подборку, которая поднимет вашу следующую оценку. Если вы уже ведёте список слов вручную или каким-то другим способом, перенести его можно загрузкой CSV. Дальше каждая статья, каждый PDF и каждое видео оцениваются по вашему настоящему словарю автоматически. Поставьте расширение и откройте статью, за которую всё никак не решались взяться.
Частые вопросы
Что значит «оценить сложность статьи»? Посчитать, какая доля слов в ней знакома лично вам, и перевести этот процент в понятную оценку — например, «читаемо с подсказками» или «почти свободно».
Не всегда. Это рабочий ориентир, привязанный к минимальному пониманию с опорой на словарь в исследовании Лауфер и Равенхорст-Каловски, но жанр, знание темы и длина текста сильно меняют то, что стоит за одним и тем же процентом.
Сравнивать точные формы или гнёзда однокоренных слов? Гнёзда дают более мягкую и, как правило, более честную картину того, что вы способны прочитать: «бежать» и «бегущий» засчитываются как одно знакомое слово.
Может ли расширение считать это само? Да. Расширение, которое и так ведёт ваш словарь (например, WordByWord), разбирает текст страницы и сверяет его с вашим списком на лету, показывая покрытие ещё до начала чтения.
Чем плохи обычные оценки читаемости? Они меряют текст одинаково для всех и ничего не знают о ваших пробелах. Личное покрытие говорит, какие слова мешают именно вам, а не только то, насколько длинные в тексте предложения.

Источники
Каждая из работ, на которых держится метод, отвечает на свою часть вопроса. Лауфер и Равенхорст-Каловски (2010) задали пороги в 95% и 98%. Шмитт, Цзян и Грейб (2011) связали долю знакомых слов с измеренным пониманием текста. Повторное исследование Ху и Нейшена проверило, держатся ли эти пороги на разных группах учащихся.
О технической стороне — в руководстве WordByWord о том, как записывать слова во время чтения, и в разборе экстенсивного и интенсивного чтения — он поможет выбрать текст, когда оценка уже получена.
- The Percentage of Words Known in a Text and Reading Comprehension
- Unknown vocabulary density and reading comprehension: Replicating Hu & Nation (2000)
- Effects of graded input on reading comprehension and motivation (i+1 vs i-1 study)
Читайте также
- Лучшие бесплатные приложения для набора словарного запаса | WordByWord.io
- Как записывать новые слова во время чтения: практическое руководство | WordByWord.io
- Лучшие приложения для пополнения словарного запаса в 2026 году | WordByWord.io
- Топ-6 альтернатив Quizlet для изучения лексики в 2026 году | WordByWord.io




