logo

Как оценить сложность текста под свой словарный запас

·автор WordByWord Team
10 мин чтения
Как оценить сложность текста под свой словарный запас

Оценить сложность текста — значит посчитать, какая доля слов в нём вам уже знакома, и перевести это число в понятную оценку с советом, что делать дальше. Такое покрытие считается лично под вас, и именно оно предсказывает, пойдёт у вас текст или нет. Средний ученик тут ни при чём: у него другой словарь.

От рабочей системы оценки нужны три вещи, и сразу:

  • Процент покрытия (например, 96%)
  • Название зоны («Почти свободно», «Нужна поддержка»)
  • Короткий совет («Читайте», «Сначала посмотрите пару слов», «Возьмите что-нибудь проще»)

Пороги, на которых держится вся эта схема, установили Лауфер и Равенхорст-Каловски (2010). Связь между долей знакомых слов и пониманием текста подтвердили Шмитт, Цзян и Грейб (2011). В WordByWord этот расчёт встроен в индикатор понимания, так что оценку вы видите ещё до того, как начнёте читать.

Коротко о главном

Универсальные формулы читаемости не отвечают на вопрос «смогу ли я это прочитать». Отвечает личное покрытие — доля знакомых именно вам слов.

Тезис Подробности
Покрытие индивидуально Сложность меряется долей слов, знакомых конкретному человеку, а не общей оценкой текста.
Пороги взяты из исследований 95% и 98% у Лауфер и Равенхорст-Каловски — вероятностные ориентиры, а не жёсткие границы.
Способ сопоставления решает многое Сравнение по начальным формам или гнёздам однокоренных слов даёт заметно более высокий процент, чем сравнение точных форм.
Смотрите не только на процент Скорость чтения и то, как часто вы лезете в словарь, дополняют картину.
WordByWord считает это сам Индикатор понимания и режим Spotlight показывают ваше покрытие в реальном времени на любой странице.

Содержание

Что нужно подготовить до расчёта

Пока нет двух вещей, любой процент бессмыслен: списка знакомых вам слов и разбитого на слова текста.

Для списка слов нужно сразу решить, в каком виде вы его храните. Отдельно «бегу», «бежал», «бегут» — или всё это одно гнездо со словом «бежать»? Второй вариант мягче и ближе к тому, как исследования размера словаря понимают знание слова, но считается дольше и легко приписывает вам то, что вы на самом деле с ходу не узнаете. Выгружаются такие списки обычно в CSV или JSON — это пригодится, если данные переезжают из одного инструмента в другой.

С разбивкой текста на слова та же история — решений несколько:

  • Приводить всё к строчным буквам или различать «Орёл» и «орёл»?
  • Разбивать «кто-нибудь» на части или считать одним словом?
  • Убирать знаки препинания до подсчёта или после?
  • Учитывать числа и имена собственные в общем количестве или выносить за скобки?

Единственно верного ответа тут нет, но выбранное правило должно работать всегда одинаково. Иначе процент поплывёт по причинам, к вашему словарю отношения не имеющим.

Совет: Если расширение синхронизирует список слов между устройствами, держите исходный список на устройстве, а наружу отдавайте хеш или сжатую версию. Так быстрее, и вся история вашего словаря не уезжает на сервер при каждом открытии страницы.

Как считается покрытие: шесть шагов

Алгоритм настолько прост, что целиком помещается во вкладку браузера — обращаться к серверу не нужно:

  1. Разбить статью на отдельные слова по выбранным правилам для регистра и пунктуации.
  2. Привести каждое слово к начальной форме или к гнезду однокоренных — в зависимости от выбранной стратегии.
  3. Сверить каждую полученную форму со списком знакомых слов.
  4. Посчитать совпадения и общее число слов.
  5. Разделить первое на второе — это и есть покрытие.
  6. Отнести получившийся процент к одной из зон.

Третий шаг влияет на результат сильнее всего остального. Сравнение точных форм строже и почти всегда даёт процент ниже: знание слова «идти» вам не зачтётся, если в тексте стоит «шёл». Сравнение по гнёздам однокоренных слов — самое щедрое и ближе всего к тому, как в исследованиях частотности меряют рост словаря: для большинства учащихся знакомое «бежать» покрывает и «бегущий».

Вот как это выглядит на коротком примере:

Слово в тексте Начальная форма Знакомо? Покрытие нарастающим итогом
Эти этот Да 1/1 = 1.0
рынки рынок Да 2/2 = 1.0
колебались колебаться Нет 2/3 = 0.67
непредсказуемо непредсказуемый Нет 2/4 = 0.5
весь весь Да 3/5 = 0.6
квартал квартал Да 4/6 = 0.67

Схема пошагового расчёта лексического покрытия

В рабочей версии перебирается вся статья, а не шесть слов, — механика от этого не меняется.

Что стоит за каждой зоной

Процент начинает работать только тогда, когда превращается в оценку, по которой понятно, что делать, без всякой арифметики. На практике зоны получаются такие:

  • Ниже 90% — «Пока рано». Всё внимание уйдёт на разбор отдельных слов: словарь под рукой и очень медленное чтение.
  • 90–94% — «С усилием». Прочитать можно, но это работа: подойдёт для занятия, а не для чтения в удовольствие.
  • 95–97% — «Читаемо с подсказками». У Лауфер и Равенхорст-Каловски примерно 95% соответствуют минимальному пониманию с опорой на словарь; для этого нужно порядка 4000–5000 словообразовательных гнёзд, в зависимости от языка.
  • 98% и выше — «Почти свободно». Чтение без остановок; в том же исследовании это уже 8000–9000 гнёзд.

Это вероятности, а не пропускной пункт. Понимание растёт вместе с покрытием более-менее плавно, обрыва в конкретной точке нет: статья с 93% не становится автоматически нечитаемой, а с 96% — автоматически лёгкой.

Совет: Если покрытие 92–94%, а тема человеку интересна, лучше подтолкнуть его читать, а не искать что-то попроще. Азарт от текста чуть выше своего уровня обычно перевешивает пару лишних походов в словарь.

Как показать результат в расширении

Цифра полезна ровно настолько, насколько её легко считать с экрана. Хороший индикатор показывает процент, цветовую зону и короткую фразу — что-нибудь вроде «96% — читаемо». Причём до начала чтения, а не когда человек уже бросил текст на середине.

Оценка всей статьи целиком удобна, когда выбираешь, что открыть следующим. Оценка по абзацам или предложениям нужна для вдумчивого чтения: внутри одной статьи покрытие скачет — простое вступление, а дальше техническая середина. Переключатель между двумя режимами закрывает почти все сценарии.

Подсветка незнакомых слов прямо в тексте, перевод по наведению и кнопка «добавить в словарь» превращают оценку из шлагбаума в рабочий инструмент. Именно так устроен режим Spotlight в WordByWord: незнакомые слова видны прямо на странице, а по мере изучения подсветка гаснет — и оценка сложности остаётся актуальной, а не замирает раз и навсегда.

  • Для начинающих: крупные зоны, простые подписи («легко», «сложно»), поменьше цифр на экране.
  • Для среднего уровня: точный процент, название зоны и число незнакомых слов.
  • Для продвинутых: процент плюс разбивка по предложениям для точечной проработки.

Список знакомых слов по умолчанию стоит держать на устройстве, а синхронизацию с облаком включать по желанию: история словаря говорит о человеке и его уровне довольно много.

Чего покрытие не показывает

Покрытие оценивает нагрузку на внимание, а не понимание как таковое, и превращать любой процент в зачёт-незачёт скорее вредно. Чем выше покрытие, тем больше внимания остаётся на сам ход мысли автора; чем ниже — тем ближе чтение к расшифровке слово за словом, а это совсем другое занятие.

Есть несколько вещей, которые сдвигают связь покрытия и понимания и в голом проценте не отражаются:

  • Знание темы. Статья с покрытием 92% по знакомому предмету идёт легче, чем с 96% по незнакомому.
  • Жанр и связность. Плотный академический текст даётся тяжелее разговорного при одинаковом покрытии.
  • Устойчивые выражения. Идиомы и сочетания завышают процент, хотя смысл всё равно ускользает.
  • Длина текста. Чем длиннее статья, тем сильнее накапливается усталость от незнакомых слов.

Попытки воспроизвести исходный порог в 98% на разных группах учащихся дали неодинаковые результаты — ровно поэтому цифра должна помогать принять решение, а не принимать его за вас.

Что с этим делать: смотреть на покрытие вместе с поведением. Скорость чтения, частота обращений к словарю и время на странице расскажут о реальной сложности больше, чем один застывший процент.

Чек-лист: что сделать по порядку

Если вы собираете такое в расширении или в собственном скрипте, порядок шагов важен:

  1. Выгрузите список знакомых слов в едином формате — CSV или JSON.
  2. Выберите способ сравнения: точные формы, начальные формы или гнёзда однокоренных.
  3. Подберите или напишите инструмент, который разбивает текст на слова и приводит их к начальной форме нужного языка.
  4. Посчитайте покрытие и отнесите его к зоне.
  5. Покажите зону вместе с коротким советом, а не голую цифру.
  6. Пишите результаты локально, а синхронизируйте только с явного согласия.

Проверьте систему на двух текстах: одном заведомо лёгком и одном заведомо трудном. Если обе оценки совпали с вашим ощущением — всё работает. Готовые результаты кешируйте по статьям и пересчитывайте по мере пополнения словаря, чтобы не перебирать каждый раз весь текст заново.

Почему личное покрытие точнее универсальных формул читаемости

Обычные формулы читаемости оценивают текст одинаково для всех — в этом и беда. Два человека поймут одну и ту же статью совершенно по-разному просто потому, что знают разные слова, а формула этой разницы не видит и одного из двоих отправит в заведомо неподъёмный текст. У личного покрытия есть и то, чего у общей оценки нет в принципе: оно показывает, какие именно слова вас тормозят, — и оценка сложности сразу превращается в список на изучение. Вокруг этого цикла и построен WordByWord, поэтому мы и считаем, что место такой штуке в расширении для Chrome, а не в разовом отчёте о читаемости.

Попробуйте прямо в браузере

WordByWord проделывает этот расчёт на каждой открытой странице, в PDF и в видео на YouTube — по вашему собственному словарю, а не по общему списку. Индикатор понимания показывает процент до начала чтения, а режим Spotlight подсвечивает незнакомые слова прямо в тексте, от впервые встреченных до выученных, — и сразу видно, что именно мешает.

WordByWord

Каждое сохранённое из статьи слово становится карточкой для интервальных повторений: та же оценка, что подсказала, за какой текст браться, заодно собирает подборку, которая поднимет вашу следующую оценку. Если вы уже ведёте список слов вручную или каким-то другим способом, перенести его можно загрузкой CSV. Дальше каждая статья, каждый PDF и каждое видео оцениваются по вашему настоящему словарю автоматически. Поставьте расширение и откройте статью, за которую всё никак не решались взяться.

Частые вопросы

Что значит «оценить сложность статьи»? Посчитать, какая доля слов в ней знакома лично вам, и перевести этот процент в понятную оценку — например, «читаемо с подсказками» или «почти свободно».

Не всегда. Это рабочий ориентир, привязанный к минимальному пониманию с опорой на словарь в исследовании Лауфер и Равенхорст-Каловски, но жанр, знание темы и длина текста сильно меняют то, что стоит за одним и тем же процентом.

Сравнивать точные формы или гнёзда однокоренных слов? Гнёзда дают более мягкую и, как правило, более честную картину того, что вы способны прочитать: «бежать» и «бегущий» засчитываются как одно знакомое слово.

Может ли расширение считать это само? Да. Расширение, которое и так ведёт ваш словарь (например, WordByWord), разбирает текст страницы и сверяет его с вашим списком на лету, показывая покрытие ещё до начала чтения.

Чем плохи обычные оценки читаемости? Они меряют текст одинаково для всех и ничего не знают о ваших пробелах. Личное покрытие говорит, какие слова мешают именно вам, а не только то, насколько длинные в тексте предложения.

Обзорная схема раздела «Частые вопросы»

Источники

Каждая из работ, на которых держится метод, отвечает на свою часть вопроса. Лауфер и Равенхорст-Каловски (2010) задали пороги в 95% и 98%. Шмитт, Цзян и Грейб (2011) связали долю знакомых слов с измеренным пониманием текста. Повторное исследование Ху и Нейшена проверило, держатся ли эти пороги на разных группах учащихся.

О технической стороне — в руководстве WordByWord о том, как записывать слова во время чтения, и в разборе экстенсивного и интенсивного чтения — он поможет выбрать текст, когда оценка уже получена.

Запросить функцию

Что стоит добавить или починить? Читаем каждое сообщение и дарим за идею приятный подарок.

0 / 4000