BRAVE (Brief Receptive Adaptive Vocabulary Evaluation) измеряет ваш пассивный словарный запас, то есть количество слов, которые вы узнаете при чтении. Единственный способ сделать это точно — взять словарь потолще (тысяч на сто слов), отметить все слова, которые вы знаете, и посчитать их. Вряд ли найдется желающий пойти на подобное испытание. Современная теория тестов (IRT, Item Response Theory) предлагает альтернативный подход. Согласно этому подходу, словарный запас можно считать некоторой способностью, которая может быть выражена числом и измерена. Измерение — это серия тестовых слов, которые респондент отмечает как знакомые или незнакомые. Каждое тестовое слово имеет свою сложность (например, «кошка» — простое, «амбивалентность» — сложное), также выраженную числами. Зная сложности тестовых слов и ответы респондента, можно рассчитать его способность, то есть словарный запас.
Для того, чтобы сделать тест точным, но максимально коротким, была использована надстройка над современной теорией тестов — CAT (Computerized Adaptive Testing). По этой методике, способность респондента оценивается после каждого вопроса, на который он отвечает. Следующий вопрос подбирается исходя из этой оценки — если респондент отмечает сложное слово как знакомое, скорее всего, у него большой словарный запас, поэтому следующим вопросом он получает слово с высокой сложностью, и наоборот. Таким образом, каждое тестовое слово приносит в тест максимум информации. С каждым вопросом оценка словарного запаса становится все точнее; тест прекращается, когда она достигает заданного порога.
Частотный словарь
Для того чтобы получить оценку словарного запаса не в абстрактных «попугаях», а в словах, нужно сложность тестовых слов выразить также в словах. Это можно сделать, если отсортировать все слова русского языка по сложности, тогда порядковый номер тестового слова в этом словаре и будет его сложностью. Такие словари называются частотными. К сожалению, существующие частотные словари слишком малы, поэтому нам пришлось сделать свой, гораздо больше.
Для построения частотного словаря нужно две вещи. Первое — как можно более полный словарь русского языка; мы использовали словарь Хагена (134149 слов). Второе — корпус русского языка; мы использовали Национальный Корпус Русского Языка. Корпус состоит из большого количества (86 тысяч) текстов разной тематики — художественная литература, публицистика, научные и научно-популярные, религиозные и философские тексты, личная переписка, дневники; общий объем текстов — 230 миллионов слов. За счет большого объема и широкого охвата этот корпус представляет собой слепок современного (54% всех текстов были созданы после 1950-го года) русского языка. Для каждого слова из словаря Хагена с помощью корпуса мы нашли его частоту — меру того, как часто это слово употребляется в языке (частота обычно измеряется в количестве употреблений слова на миллион слов корпуса).
Что считалось словом?
При определении словарного запаса всегда встает вопрос — что считать словом? Считать ли слова «белый», «белить» и «отбеливатель» разными (ведь все они совершенно точно имеют разный смысл) или все же одним (ведь зная слово «белый» и имея некоторое лингвистическое чутье, о смысле остальных слов можно догадаться)? Включать ли в словарный запас только базовые слова, или их производные тоже? Общепринятого ответа на этот вопрос нет, поэтому мы решили учитывать все слова, включая производные формы.
Защита от неаккуратного прохождения
Тест строится на предположении, что респондент честно и внимательно отмечает знакомые cлова. К сожалению, это не всегда так. Чтобы распознавать случаи неаккуратного прохождения, мы ввели в тест две ступени защиты. Первая — это слова-ловушки. Такие слова звучат, как русские, но ничего не обозначают. Их нет ни в одном словаре; более того, даже поисковые системы не находят их в интернете. Вторая — это просьба уточнить значения некоторых слов, которые респондент отметил как знакомые. При этом на выбор ему предлагается четыре варианта, из которых только один правильный. Если респондент отмечает больше чем одно слово-ловушку как знакомое, или более 3х раз неправильно уточняет значение, тест покажет предупреждение. Такие результаты мы считаем недостоверными.