Comprehensible input — это материал, который вы понимаете почти целиком, и у этого «почти» есть конкретное число. Исследования лексического покрытия показывают: комфортное понимание без подсказок начинается примерно с 95–98% знакомых слов, а зона роста лежит чуть ниже. Загвоздка в том, что число зависит от вашего словаря, а не от официального уровня сложности контента, и на глаз его не определить.
Каждому изучающему язык говорили: смотрите и читайте то, что вам в основном понятно. Почти никому не объяснили, как это «в основном понятное» опознать. В итоге вы открываете видео, три минуты мучаетесь, закрываете его и делаете вывод, что дело в вас.
Дело не в вас. Просто у «в основном понимаю» есть измеримый порог, и до недавнего времени не было способа проверить, где конкретное видео, статья или PDF находятся относительно вашего словарного запаса. Эта статья закрывает обе половины вопроса: что на самом деле установили исследования и как Comprehension Level в WordByWord превращает это в число, которое видно до того, как вы потратите вечер на неподходящее видео.
Что такое comprehensible input
Comprehensible input (понятный ввод) — это языковой материал, который вы понимаете по большей части, даже если в нём есть то, чего вы ещё не учили. Это всё определение целиком, и держится оно на словах «по большей части»: понимание идёт первым, а незнакомое едет сверху — достаточно близко к знакомому, чтобы его можно было достроить.
Гипотеза ввода Стивена Крашена и формула i+1
Термин пришёл из гипотезы ввода Стивена Крашена — самой известной части его теории усвоения второго языка. Её тезис: язык усваивается через понимание сообщений, которые чуть выше вашего текущего уровня, а не через изучение правил о языке. Понимание здесь механизм, а грамматика приходит побочным продуктом. То, что в разговорах называют «теорией comprehensible input», — это на самом деле один этот тезис плюс четыре сопутствующие гипотезы о том, как работает усвоение.
Это «чуть выше» Крашен описал формулой i+1, где i — ваша текущая компетенция, а +1 — следующий шаг. Формулировка нарочно размытая, и именно в этой размытости теория перестаёт быть применимой. Она говорит, что материал должен вас немного растягивать, но нигде не уточняет, сколько это — «немного», и не даёт способа понять, является ли конкретная серия конкретного сериала вашим i+1 или чьим-то ещё. Всё дальнейшее — попытка выразить этот зазор числом.
Примеры comprehensible input
Один и тот же материал для одного человека — comprehensible input, а для другого шум. Грубая иллюстрация для уровня «средний»:
- Понятно: кулинарное видео на изучаемом языке — повторяющаяся лексика, действия видно, структура предсказуема. Слова пролетают мимо, но следить получается за всем.
- На грани: подкаст-интервью на знакомую тему. Нить вы держите, шутки теряете, отдельные фразы приходится переслушивать.
- Непонятно: юридическая драма с судебной лексикой и репликами внахлёст. Ловите обрывки. Ничего не накапливается.
Обратите внимание, что определяет категорию: не формат и не ярлык на контенте, а пересечение слов в материале со словами у вас в голове.
Почему «понятность» — это число, а не ощущение
Лингвисты измеряют это пересечение и называют его лексическим покрытием: доля словоупотреблений в тексте, которые читатель или слушатель уже знает. «Словоупотребления» значит каждое вхождение: если артикль встречается сорок раз, он и считается сорок раз, потому что именно так устроены чтение и слушание.
Покрытие — это количественная версия качественной идеи Крашена. И исследования покрытия дали неожиданно полезную вещь: жёсткие пороги.
Что говорят исследования о порогах
Откуда взялись эти числа: исследования экстенсивного чтения
Пороги ниже придумала не индустрия изучения языков. Они выросли из исследований экстенсивного чтения — практики читать много лёгкого материала вместо того, чтобы продираться через короткие сложные тексты со словарём. У этой традиции был практический вопрос: насколько лёгким должно быть «лёгкое», чтобы чтение в больших объёмах начало работать? Чтобы на него ответить, пришлось измерять понимание относительно доли знакомых слов — и числа, которые все теперь цитируют, вышли именно из тех экспериментов.
Чтение: 98% для комфорта, 95% как нижняя граница
В классическом исследовании Ху и Нейшн переработали художественный текст так, чтобы читатели знали 80%, 90%, 95% или 100% слов, и измерили понимание. Вывод, ставший точкой отсчёта в области: для комфортного чтения без подсказок нужно около 98% покрытия, а 95% — это примерно тот минимум, при котором адекватное понимание вообще становится достижимым для большинства читателей. Более поздняя репликация Креммеля с коллегами подтвердила ту же картину.
Контринтуитивны здесь не сами числа, а форма кривой.
Слушание и видео прощают больше
Ван Зееланд и Шмитт применили ту же логику к устным рассказам и обнаружили, что слушание ведёт себя иначе, чем чтение: понимание при 90% и при 95% покрытия оказалось практически неразличимым, при этом 95% — более безопасная цель. Работы по пониманию видео, а не только звука, указывают в ту же сторону: изображение, жест и ситуация несут смысл, который тексту приходится проговаривать словами, поэтому визуальный ряд частично компенсирует незнакомую лексику.
Это совпадает с обычным опытом. Кулинарное видео на языке, которым вы почти не владеете, смотреть можно. Страницу прозы на нём же — нет.
Почему понимание обваливается, а не тает
Важное свойство этих порогов в том, что уход ниже стоит вам не пропорциональной доли понимания. Понимание не убывает плавно — оно разваливается. Опуститесь с 95% до 90%, и вы потеряете не 5% смысла, а нить, выводы и возможность догадываться о незнакомых словах по контексту, потому что для догадки по контексту сам контекст должен быть ясен.
Поэтому совет «просто продавливайся через сложное» так стабильно не работает, и поэтому провал ощущается как личная неудача, а не как несовпадение чисел.
Почему 2% незнакомого — это не два слова на страницу
Пороги звучат мягко, а ощущаются жёстко, и разрыв между этими двумя впечатлениями стоит закрыть. 98% покрытия — это примерно одно незнакомое слово на каждые пятьдесят, то есть одно на две строки текста, а не одно на страницу. При 90%, которые обычно описывают словами «в целом всё понимаю», вы спотыкаетесь каждые десять слов.
Как это выглядит в виде числа
Это та же идея, но с числом. WordByWord считает слова в том, что у вас открыто, — субтитры видео, текст статьи, страницы PDF, — сопоставляет их со словами, которые вы действительно выучили, и показывает долю знакомого ещё до начала. 88% на этом видео означают: на десять пунктов ниже тех 98%, при которых чтение без подсказок комфортно, зато внутри диапазона, где вас вытягивают картинка и субтитры, — и прямо под процентом перечислены слова, которые за этот разрыв отвечают.
Дальше в статье — то, что стоит за этим числом: откуда оно берётся, как считается и в каких местах мы намеренно сделали его строже, чем требовалось.
Настоящая проблема: найти материал своего уровня
Ничего спорного выше не сказано. Узкое место — практическое: пороги персональные, и ничто из того, что вы открываете, не сообщает, где оно находится относительно вашего словаря.
Все привычные обходные пути дают лишь приближение:
- Адаптированный контент и уровневые ярлыки (A2, B1, «для начинающих») описывают среднего человека. Ваш словарь не средний — он сложился из того, что вы читали и смотрели.
- Индексы удобочитаемости (Флеш и родственники) измеряют длину слов и предложений в отрыве от читателя. О вас они не знают ничего.
- «Попробовать и посмотреть» работает, но цена неверной догадки — потерянный вечер и просевшая мотивация.
- Кураторские подборки по уровням у проектов, построенных вокруг понятного ввода, действительно полезны, и существуют они именно потому, что проблема отбора реальна, — но покрыть они могут только собственную библиотеку.
Не хватает измерения: вот эта конкретная страница, вот это конкретное видео — против вот этого конкретного словаря.
Оценка понимания для всего, что вы открываете
Именно это измерение и делает Comprehension Level в WordByWord. Расширение уже знает, какие слова вам знакомы: у каждого сохранённого слова есть статус изучения, который меняется по мере того, как вы читаете и смотрите. Оценка понимания сопоставляет полный список слов того, что перед вами, с этим личным словарём, считает повторы так же, как покрытие считают в исследованиях, и показывает результат до начала просмотра.
Любое видео на YouTube
На YouTube рядом с плеером появляется кнопка, а в её подсказке — оценка: Comprehension: 88% — click for details. Считается она по субтитрам видео на изучаемом языке, то есть отражает то, что реально произносится, а не заголовок и не тему. Если субтитров на нужном языке нет, WordByWord прямо об этом скажет, а не выдумает число.
Любая статья в интернете
На обычных веб-страницах тот же движок проходит по тексту статьи и показывает небольшой чип с количеством новых слов. Одного взгляда хватает, чтобы понять: это чтение на пять минут или сорокаминутное пробирание со словарём.
Любой PDF
PDF оцениваются накопительно: текст поступает в движок постранично, и оценка обновляется по мере чтения — поэтому длинный документ даёт текущую оценку, а не молчание до самого конца.
Любой язык, который вы учите
В оценке нет ничего специфически английского. Она сравнивает слова текста с вашим сохранённым словарём — на каком бы языке этот словарь ни был: испанский, французский, немецкий, итальянский, португальский, корейский и десятки других. Тот, кто учит испанский, получает для испанского видео ровно такое же число, какое получает для корейского видео тот, кто учит корейский.
Что означают четыре зоны
Сырой процент превращается в четыре зоны, чтобы решение принималось без арифметики:
| Зона | Покрытие | Что это значит |
|---|---|---|
| Easy | 95% и выше | Лёгкий просмотр или чтение — хорошо, чтобы закрепить уже известное |
| Your level | 85–94% | Зона роста: вы следите за содержанием и всё равно встречаете новые слова |
| Challenging | 70–84% | Осилить можно с усилием — вытянут интерактивные субтитры, паузы и подсветка |
| Too hard | ниже 70% | Отложите. Начните с самых частотных слов этого материала |
Эти четыре зоны — ориентир WordByWord, а не академические пороги. Прямо из исследований покрытия взята только граница 95%, и измеряли те исследования понимание без всякой поддержки. Зоны исходят из обратного: что у вас под рукой интерактивные субтитры, подсветка и перевод в один клик. Границы 85% и 70% — наша собственная калибровка под эти условия, ни одно исследование этих двух чисел не давало.
Формулировки подстраиваются под то, что вы открыли: для видео это «лёгкий просмотр», для статьи — «лёгкое чтение», а подсказка в самой тяжёлой зоне отправляет вас к списку слов, а не просто говорит «нет».
Как считается число — и где мы намеренно сделали строже
Такая оценка чего-то стоит, только если понятно, что именно она считает. В нашей заложено несколько сознательно консервативных решений, и о них честнее сказать прямо.
- «Знаю» означает действительно знаю. Слово идёт в покрытие только начиная с уровня Learned. Слова, которые вы сохранили, но ещё осваиваете — New, Recognised, Familiar, — показываются отдельной строкой «learning» и процент не надувают.
- Из знаменателя выброшен шум, а не сложность. Всё, что движок подсветки вообще не считает словом для изучения, исключается целиком: ваш личный игнор-список, текст на чужой письменности, ссылки, адреса почты, хэштеги и токены без букв. Оценка меряет словарный запас, а не служебную обвязку страницы.
- Мало текста — нет оценки. Меньше 20 учтённых токенов — не показываем ничего. Процент, посчитанный по горстке слов, — это шум, переодетый в данные.
- 100% не врут. 99,5% округляются вниз, до 99. Сотню вы увидите, только когда покрытие действительно полное.
- Зона роста лежит ниже академического порога, и это сделано намеренно. Исследования измеряли понимание без поддержки. WordByWord даёт перевод в клик, интерактивные субтитры и подсветку, а работы по слушанию и просмотру показывают, что устная речь с картинкой прощает больше, чем проза. Поддержка поднимает фактическое покрытие, поэтому 85–94% здесь — реалистичная зона роста, даже притом что эталон чтения без подсказок — 95%.
Слова, которые дают больше всего понимания
Почему горстка слов сдвигает число
Частотность слов крайне неравномерна — это закон Ципфа. Небольшое число слов делает основную работу в любом тексте, а длинный хвост встречается по одному-два раза. И раз частотность перекошена, незнакомые слова в конкретном видео перекошены тоже: небольшая их часть отвечает за большую долю провалов. Выучив десять самых частотных незнакомых слов одного видео, вы сдвигаете покрытие именно этого видео сразу на несколько процентных пунктов — маленькое точечное вложение с непропорциональной отдачей.
Поскольку оценка считает повторы, она может ответить и на более интересный вопрос: какие слова стоит выучить ради этого материала. Панель показывает самые частотные новые слова с числом вхождений, а над ними строку вроде:
These 11 words add +6% understanding of this video
Это не маркетинговая прикидка, а арифметика по расшифровке и вашему словарю: если эти слова переедут в колонку «знаю», процент покрытия вырастет ровно настолько.
Список — не фиксированный «топ-10». Его длина подстраивается под форму текста: от 5 до 15 слов, ровно столько, чтобы закрыть голову частотного распределения, а не круглое число позиций. Плотной технической статье, где четыре термина повторяются постоянно, нужен более короткий список, чем документальному фильму, где новые слова размазаны тонким слоем; фиксированный размер был бы неверен в обе стороны. Слова с одинаковой частотой список никогда не разрывает — отрезать «пять из шести слов, встречающихся по десять раз» было бы произволом.
Каждое слово можно сохранить с нужным уровнем, отправить в игнор, послушать вслух или прочитать перевод прямо там же. Выучите их, откройте видео заново — и оценка сдвинется, обычно достаточно, чтобы перевести материал из Challenging в Your level.
Обязательно ли отказываться от перевода
Этот вопрос заслуживает прямого ответа, потому что часть сообщества вокруг понятного ввода — направление automatic language growth и выросшие из него проекты — принципиально отказывается от перевода, словарей и списков слов, считая, что они прерывают усвоение. WordByWord предлагает всё три. Так что спросить, уместен ли такой инструмент рядом с comprehensible input, справедливо.
Здесь стоит развести две вещи.
Оценка — это измерение, а не метод. Она говорит, какую долю слов перед вами вы уже знаете. Это полезно независимо от того, будет ли вашим следующим шагом клик по слову ради перевода или второй просмотр видео, чтобы смысл улёгся сам. Процент ничего не предполагает про перевод.
Задача отбора нейтральна к методу. К какой бы школе вы ни принадлежали, вам всё равно выбирать, что смотреть сегодня вечером, и плохой выбор стоит либо скуки, либо фрустрации. Именно поэтому кураторские уровневые подборки существуют и в сообществах, отказавшихся от перевода. Если вы практикуете ввод без перевода — пользуйтесь оценкой и зонами, а остальное в расширении просто выключите: вы всё равно будете отвечать на тот вопрос, ради которого эти подборки создавались, и для контента, который никто за вас не отобрал.
Мы не заявляем, что реализуем метод Крашена. Мы заявляем, что измеряем ту его часть, которая про «понятный».
Как этим пользоваться на практике
- Выбрать сериал. Откройте первые серии трёх кандидатов и сравните оценки, прежде чем вкладываться. Один окажется в вашей зоне роста, остальные — на потом или для закрепления.
- Разобрать список чтения. Пройдитесь по сохранённым статьям и дайте чипу с новыми словами их отсортировать. Те, что в вашей зоне, читайте сейчас; слишком тяжёлые отложите и вернитесь через месяц — число к тому времени изменится само.
- Добить книгу или PDF. Оцените документ, и если он попал в Challenging, сначала выучите список слов, вместо того чтобы начать и бросить. Десять-пятнадцать слов — это один вечер; разница, которую они дают на трёхстах страницах, — совсем не один вечер.
Частые вопросы
Какой пример comprehensible input можно привести?
Видео, подкаст или текст, где вы понимаете почти всё и при этом встречаете несколько новых слов: кулинарное видео с повторяющейся лексикой и наглядными действиями — типичный пример для начинающих. Тот же материал перестаёт быть понятным вводом, когда ваш уровень его перерастает, и становится им, когда словарь дорастает. Категорию задаёт совпадение с человеком, а не сам материал.
Что такое метод comprehensible input?
В широком смысле это подход к изучению языка, который ставит понимание больших объёмов материала на вашем уровне или чуть выше выше заучивания правил и зубрёжки отдельных слов. Направления сильно расходятся в деталях — особенно в том, допустим ли перевод, — но сходятся в исходной посылке: усвоение идёт из понятого материала.
В чём состоит теория comprehensible input Стивена Крашена?
Гипотеза ввода Крашена утверждает, что язык усваивается через понимание сообщений, содержащих конструкции чуть выше вашего текущего уровня; сам он свёл это к формуле i+1. Это одна из пяти гипотез в его общей модели усвоения второго языка, и она описательная, а не количественная: насколько именно «выше» должен быть материал, гипотеза не уточняет.
Работает ли comprehensible input?
Доказательства того, что понятый материал двигает усвоение лексики и грамматики, сильные, и исследования покрытия выше — часть этих доказательств: понимание зависит от того, сколько вы уже знаете, причём в измеримых пропорциях. Спорные вопросы уже, чем кажется: сколько сознательного изучения полезно добавлять к вводу и мешает ли перевод. Практическая точка отказа — не принцип, а исполнение: слишком сложный материал понятным вводом не является, а большинство людей переоценивают, сколько они понимают.
Где брать comprehensible input начинающему?
В начале покрытие относительно нативного контента слишком мало, чтобы понимать без поддержки, поэтому опирайтесь на материал, где смысл приходит извне слов: картинка, жест, знакомая ситуация, медленная речь, записанная специально для изучающих. А оценка нужна, чтобы не попасть в ловушку «выглядит просто»: короткое видео с плотной лексикой бывает тяжелее длинного и повторяющегося.
Сколько comprehensible input нужно в день?
Установленного числа нет, и тот, кто называет его точно, называет собственную привычку, а не результат исследования. Из исследований покрытия следует другое: часы не взаимозаменяемы. Час на материале, где вы знаете 90% слов, даёт несопоставимо больше часа на материале с 50%, потому что ниже порога вы перестаёте что-либо выводить из контекста и время перестаёт накапливаться. Регулярность и попадание в свой уровень важнее размера дневного блока.
Сколько слов я знаю?
Тесты на объём словарного запаса дают грубую оценку общего числа, и цифру эту приятно иметь. Но решает не она: важно пересечение ваших слов со словами конкретного материала, а два текста с одинаковым официальным уровнем сложности могут оказаться по этому показателю далеко друг от друга. WordByWord считает слова, которые вы сохранили и выучили, и показывает пересечение для того, что у вас открыто, — общая цифра словарного запаса такого сказать не может.
Как понять, что видео — это comprehensible input для меня?
Посмотрите на долю слов в нём, которые вы уже знаете. Выше примерно 95% будет комфортно; 85–94% — продуктивная зона, где вы и следите за содержанием, и что-то подбираете; ниже примерно 70% вы уже не понимаете, а угадываете по обрывкам. WordByWord считает этот процент для видео, статьи или PDF относительно вашего сохранённого словаря до начала просмотра.
95% покрытия — это то же самое, что 95% понимания?
Нет, и на этом многие спотыкаются. Покрытие — доля слов, которые вы знаете; понимание — сколько смысла вы уловили. Они связаны, но не равны, и именно поэтому исследованиям пришлось измерять понимание отдельно при фиксированных уровнях покрытия — и именно поэтому пороги такие высокие.
Есть ли приложение для comprehensible input?
Их несколько видов, и решают они разные половины задачи. Приложения с адаптированными текстами и кураторские видеобиблиотеки выдают материал, уже разложенный по уровням, — это работает, пока вам не понадобилось что-то за пределами их каталога. Браузерные инструменты, наоборот, работают с тем контентом, который вы и так смотрите и читаете; к этой категории относится WordByWord: он не поставляет библиотеку, а измеряет то, что вы открыли, относительно вашего собственного словаря, на любом изучаемом языке.
Что такое метод 15-30-15?
Схема учебной сессии, которую иногда советуют для работы с вводом: короткая разминка, длинный блок сосредоточенного ввода, затем короткое повторение — конкретные доли у каждого советчика свои. Это техника расписания, а не утверждение об усвоении, и окупается она лишь тогда, когда материал внутри этих блоков соответствует вашему уровню, — а этого расписание вам как раз и не подскажет.
Попробуйте на следующем, что откроете
Самая короткая версия всего сказанного: comprehensible input — это не жанр, который можно пойти и купить, а отношение между контентом и вашим словарём. И теперь это отношение выражается числом, которое видно до того, как вы потратите вечер на неподходящее видео.
WordByWord — это расширение Chrome для изучения языков, которое берёт измерение на себя. Установите его, откройте что-нибудь на изучаемом языке и посмотрите на число, прежде чем отдавать этому вечер.
Источники
- Hu, M., & Nation, P. (2000). Unknown vocabulary density and reading comprehension. Reading in a Foreign Language, 13(1), 403–430. Страница статьи
- van Zeeland, H., & Schmitt, N. (2013). Lexical coverage in L1 and L2 listening comprehension: The same or different from reading comprehension? Applied Linguistics, 34(4), 457–479. Страница издателя
- Kremmel, B., Indrarathne, B., Kormos, J., & Suzuki, S. (2023). Unknown vocabulary density and reading comprehension: Replicating Hu and Nation (2000). Language Learning. Страница издателя (открытый доступ)
- Durbahn, M., Rodgers, M., & Peters, E. Lexical coverage in L1 and L2 viewing comprehension. Studies in Second Language Acquisition. Страница издателя


