Прогностическая валидность: цифры и то, что за ними стоит
Оценка персонала полна впечатляющих чисел, у которых редко указано, на чём они получены. Здесь — психометрика NeuroFrame целиком: каждый показатель с расшифровкой и с указанием выборки, а вместе с ними честная оговорка о том, чего эти цифры не доказывают.
Что такое прогностическая валидность и как её измеряют
Прогностическая валидность отвечает на простой вопрос: насколько результат оценки, полученный до найма, связан с тем, как человек потом работает.
Измеряют её коэффициентом корреляции r. Он лежит между 0 и 1. Ноль означает, что связи нет вовсе и инструмент не даёт ничего сверх подбрасывания монеты. Единица — идеальное предсказание, которого в психологии труда не встречается.
Вторая величина — R², квадрат коэффициента r. Она отвечает на другой вопрос: какую долю различий в рабочем результате инструмент объясняет. Если r = 0,31, то R² = 0,10 — объяснена примерно десятая часть разброса, а девять десятых приходятся на всё остальное: на задачи, руководителя, команду, рынок, здоровье, удачу.
Отсюда два практических следствия. Первое: возведение в квадрат заметно уменьшает красивую цифру, поэтому r и R² нельзя ни путать, ни сопоставлять между собой. Второе: в мета-аналитической таблице ниже даже самые сильные методы отбора объясняют меньше трети различий в результате. Это не изъян психометрики, а точная картина — то, как человек работает, никогда не определяется одним только человеком.
И последнее, что стоит держать в голове. У одной и той же методики r окажется разным в зависимости от того, что взяли за критерий — оценку руководителя, выручку, удержание через год — и на какой выборке считали. Коэффициент валидности — это утверждение о конкретном исследовании, а не постоянное свойство метода.
Психометрические показатели NeuroFrame и на чём они получены
Психометрика — наука о том, насколько точно и стабильно инструмент измеряет заявленное. У неё есть неудобная особенность: каждый показатель отвечает на свой узкий вопрос, и ни один из них в одиночку не доказывает, что инструмент хорош. Поэтому ниже — весь набор целиком, с указанием, что именно проверялось и на каких данных.
Отдельно о критериальной валидности. Когнитивные шкалы проверялись корреляциями с признанными тестами — прогрессивными матрицами Равена и инструментами Saville, — а также с тестами на внимание, память, переключаемость, обработку информации и принятие решений. Личностные шкалы валидизированы через общепризнанные психометрические модели: открытость опыту, склонность к риску, настойчивость, доброжелательность, сознательность.
Чего в этом перечне нет и не будет: точных весов поведенческих признаков, статистической модели перевода поведения в баллы и устройства ML-компонента. Скоринговый ключ закрыт — не из скрытности, а потому что оценка читает поведение, которое человек не предъявляет сознательно. Опубликуйте ключ — и метрика превратится в тест, к которому можно готовиться, а нормативная база обесценится для всех, кто пройдёт оценку после. Требование защищённости скоринговых ключей закреплено в профессиональных стандартах оценки (AERA/APA/NCME; ITC Guidelines on Security of Tests). Полная доказательная логика — что измеряется и через какое поведение это фиксируется — раскрывается методологам заказчика под соглашение о конфиденциальности.
Показатели, с расшифровкой и указанием данных
- Выборка сравнения — 14 850. Руководители и предприниматели из 500+ компаний, 21 отрасли и 21 функции. Это база, относительно которой считается результат конкретного человека: балл всегда нормативный, то есть говорит о положении в сопоставимой группе, а не об абсолютной величине.
- Валидационная выборка — 3 000+ сотрудников. Отдельная проверка: результаты оценки сопоставляли с реальными KPI и оценками руководителей. Именно на этих данных проверялась прогностическая ценность в рабочих условиях.
- CFI ≈ 0,96 — конструктная валидность. Конфирматорный факторный анализ подтвердил, что модель из двух доменов, «мышление» и «личность», хорошо описывает реальные данные. Сами домены до этого выделил эксплораторный анализ: структура найдена в данных и затем перепроверена, а не назначена сверху.
- α Кронбаха = 0,69–0,77 — внутренняя согласованность. Показатели внутри каждой шкалы измеряют одно и то же качество: шкала не распадается на несвязанные куски. Это диапазон, а не одно число, потому что шкал несколько и у каждой своё значение.
- Ретестовая надёжность > 0,83. При повторном прохождении результат воспроизводится — значит, метод фиксирует устойчивые характеристики, а не настроение конкретного вторника.
- AUC ≈ 0,77 — связь с результатом на собственных данных. Насколько уверенно модель разделяет группы с разным уровнем рабочей результативности на валидационной выборке NeuroFrame, 3 000+ сотрудников. 0,5 — случайное угадывание, 1,0 — безошибочное разделение.
- Точность моделей машинного обучения — 72–89%. Разброс есть потому, что моделей несколько и они решают разные задачи. Одна усреднённая цифра выглядела бы аккуратнее и описывала бы положение дел хуже.
Почему наши показатели нельзя поставить в один ряд с таблицей ниже
Дальше идёт таблица мета-аналитических коэффициентов для распространённых методов отбора. Прежде чем её читать, важная оговорка — и мы даём её здесь, а не сноской мелким шрифтом после.
Показатель AUC ≈ 0,77 у NeuroFrame и цифры в таблице получены на разных выборках и по разным критериям. Наше значение отражает качество модели на собственных данных NeuroFrame. Мета-аналитические коэффициенты отражают связь метода с внешне измеренной рабочей эффективностью, усреднённую по десяткам независимых исследований за десятилетия. Это соседние величины, но не тождественные — AUC и коэффициент r отвечают на разные вопросы и живут на разных шкалах, — и арифметика вида «наш показатель против их коэффициента» здесь не работает.
Что таблица показывает корректно — это порядок величин в индустрии. Сильнейшие из классических методов объясняют примерно от четверти до трети различий в рабочем результате. Личностные опросники — от одного до десяти процентов. Стаж и число лет образования — единицы процентов, то есть почти ничего. А самые известные широкой публике типологии, MBTI и DiSC, данных о прогностической валидности вообще не публикуют, и это само по себе информация.
Видно из таблицы и другое: даже устоявшиеся цифры пересматриваются. Пересчёт Сакетта и коллег 2022 года применил более строгую поправку на ограничение дисперсии и опустил классические коэффициенты Шмидта и Хантера примерно на треть. Коэффициент валидности — это оценка, зависящая от метода расчёта, а не константа.
Наша позиция — та, которую можно проверить: метод валидизирован против признанных тестов, реальных KPI и оценок руководителей. Ставить это напрямую против чужих мета-анализов мы не будем.
Что метод не умеет
Честный перечень ограничений говорит о качестве инструмента больше, чем ещё один знак после запятой.
Диапазоны — ориентир, а не приговор: отклонение по одному-двум параметрам стоит проверить на интервью, а не считать основанием для отказа.
Границы применимости
- Эмпирическая база game-based assessment продолжает накапливаться. Величины валидности зависят от дизайна конкретного задания, и каждое задание валидизируется отдельно.
- Интерпретация всегда нормативна: результат говорит о положении в сопоставимой группе, а не о значении на абсолютной шкале.
- Оценка не заменяет интервью, проверку опыта и управленческое суждение. Она даёт основание для решения, но не само решение.
- Для нестандартных ролей и специфичной корпоративной культуры нужна калибровка на успешных сотрудниках заказчика.
- Метод повышает вероятность верного решения. Он не гарантирует успех конкретного человека на конкретной позиции — этого не гарантирует ни один инструмент отбора.
Прогностическая валидность распространённых методов отбора по данным двух мета-анализов
| Метод отбора | r — Schmidt & Hunter, 1998 | r — Sackett et al., 2022 | R² — доля объяснённой дисперсии |
|---|---|---|---|
| Когнитивные тесты (GMA) | 0.51 | 0.31 | 0.26 · 0.10 |
| Структурированное интервью | 0.51 | — | 0.26 |
| Рабочие пробы | 0.54 | — | 0.29 |
| Личностные опросники, сознательность | 0.31 | 0.19 | 0.10 · 0.04 |
| Стаж работы | 0.18 | — | 0.03 |
| Образование, число лет | 0.10 | — | 0.01 |
| MBTI, DiSC | не публикуется | — | — |
r — коэффициент валидности, R² — его квадрат, то есть доля различий в рабочем результате, которую объясняет метод. Где в колонке R² стоят два значения через «·», они соответствуют двум колонкам r в том же порядке. Прочерк означает, что источник не даёт отдельной оценки. Пересчёт Сакетта и коллег применяет более строгую поправку на ограничение дисперсии, поэтому его значения систематически ниже. Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274. DOI: 10.1037/0033-2909.124.2.262 Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection. Journal of Applied Psychology, 107(11), 2040–2068. DOI: 10.1037/apl0000994 Показатели NeuroFrame в эту таблицу намеренно не включены: они получены на других выборках и по другим критериям и прямому сопоставлению не подлежат.
Частые вопросы
Насколько это точно?
Настолько, насколько вообще бывает точна оценка людей. На валидационной выборке из 3 000+ сотрудников AUC ≈ 0,77: модель уверенно разделяет группы с разным уровнем рабочей результативности, где 0,5 — случайное угадывание. Точность моделей машинного обучения — 72–89% в зависимости от модели. Ретестовая надёжность выше 0,83: при повторном прохождении результат воспроизводится. При этом никакая оценка не гарантирует успех конкретного человека на конкретной позиции. Она повышает вероятность верного решения — и не более того.
Какая у метода валидность и как её проверяли?
Конструктная — CFI ≈ 0,96: конфирматорный факторный анализ подтвердил модель из двух доменов, «мышление» и «личность». Внутренняя согласованность — α Кронбаха 0,69–0,77 по шкалам. Ретестовая надёжность — выше 0,83. Критериальную валидность проверяли корреляциями когнитивных шкал с прогрессивными матрицами Равена и инструментами Saville, а также с тестами на внимание, память, переключаемость, обработку информации и принятие решений; личностные шкалы валидизированы через общепризнанные психометрические модели. Прогностическую ценность проверяли на реальных KPI и оценках руководителей на выборке 3 000+ человек. Нормативная база сравнения — более 10 000 руководителей и предпринимателей из 500+ компаний, 21 отрасли и 21 функции.
Есть ли доказательная база?
Да, и она устроена в два слоя. Первый — научные основания метода: Большая пятёрка, теория чувствительности к подкреплению Грея, модель PEN Айзенка, кибернетическая теория Большой пятёрки, Evidence-Centered Design и stealth assessment (Shute, 2011). Второй — собственные психометрические данные NeuroFrame, перечисленные на этой странице, с указанием выборок. Полная доказательная логика — что измеряется и через какое поведение это фиксируется — раскрывается методологам заказчика под соглашение о конфиденциальности. Закрытым остаётся только операционный ключ: веса признаков, модель перевода поведения в баллы и ML-компонент. Это условие сохранения валидности, а не корпоративная скрытность: требование защищённости скоринговых ключей закреплено в профессиональных стандартах оценки.
Вы точнее классических тестов?
В такой форме мы это утверждать не будем. Наши показатели получены на собственных данных, а мета-аналитические коэффициенты других инструментов — на других выборках и по другим критериям. Сопоставлять их напрямую некорректно, и подготовленный читатель такое сравнение оспорит. Что можно сказать честно: многие популярные методики вообще не публикуют данные о прогностической валидности, а личностные опросники объясняют лишь малую долю различий в результате — обычно от одного до десяти процентов. NeuroFrame валидизирован против признанных тестов и реальных KPI, а когнитивный и личностный домены измеряются связанно, в одном прохождении на 30–60 минут.