Прогностическая валидность: цифры и то, что за ними стоит

Оценка персонала полна впечатляющих чисел, у которых редко указано, на чём они получены. Здесь — психометрика NeuroFrame целиком: каждый показатель с расшифровкой и с указанием выборки, а вместе с ними честная оговорка о том, чего эти цифры не доказывают.

Что такое прогностическая валидность и как её измеряют

Прогностическая валидность отвечает на простой вопрос: насколько результат оценки, полученный до найма, связан с тем, как человек потом работает.

Измеряют её коэффициентом корреляции r. Он лежит между 0 и 1. Ноль означает, что связи нет вовсе и инструмент не даёт ничего сверх подбрасывания монеты. Единица — идеальное предсказание, которого в психологии труда не встречается.

Вторая величина — R², квадрат коэффициента r. Она отвечает на другой вопрос: какую долю различий в рабочем результате инструмент объясняет. Если r = 0,31, то R² = 0,10 — объяснена примерно десятая часть разброса, а девять десятых приходятся на всё остальное: на задачи, руководителя, команду, рынок, здоровье, удачу.

Отсюда два практических следствия. Первое: возведение в квадрат заметно уменьшает красивую цифру, поэтому r и R² нельзя ни путать, ни сопоставлять между собой. Второе: в мета-аналитической таблице ниже даже самые сильные методы отбора объясняют меньше трети различий в результате. Это не изъян психометрики, а точная картина — то, как человек работает, никогда не определяется одним только человеком.

И последнее, что стоит держать в голове. У одной и той же методики r окажется разным в зависимости от того, что взяли за критерий — оценку руководителя, выручку, удержание через год — и на какой выборке считали. Коэффициент валидности — это утверждение о конкретном исследовании, а не постоянное свойство метода.

Психометрические показатели NeuroFrame и на чём они получены

Психометрика — наука о том, насколько точно и стабильно инструмент измеряет заявленное. У неё есть неудобная особенность: каждый показатель отвечает на свой узкий вопрос, и ни один из них в одиночку не доказывает, что инструмент хорош. Поэтому ниже — весь набор целиком, с указанием, что именно проверялось и на каких данных.

Отдельно о критериальной валидности. Когнитивные шкалы проверялись корреляциями с признанными тестами — прогрессивными матрицами Равена и инструментами Saville, — а также с тестами на внимание, память, переключаемость, обработку информации и принятие решений. Личностные шкалы валидизированы через общепризнанные психометрические модели: открытость опыту, склонность к риску, настойчивость, доброжелательность, сознательность.

Чего в этом перечне нет и не будет: точных весов поведенческих признаков, статистической модели перевода поведения в баллы и устройства ML-компонента. Скоринговый ключ закрыт — не из скрытности, а потому что оценка читает поведение, которое человек не предъявляет сознательно. Опубликуйте ключ — и метрика превратится в тест, к которому можно готовиться, а нормативная база обесценится для всех, кто пройдёт оценку после. Требование защищённости скоринговых ключей закреплено в профессиональных стандартах оценки (AERA/APA/NCME; ITC Guidelines on Security of Tests). Полная доказательная логика — что измеряется и через какое поведение это фиксируется — раскрывается методологам заказчика под соглашение о конфиденциальности.

Показатели, с расшифровкой и указанием данных

  • Выборка сравнения — 14 850. Руководители и предприниматели из 500+ компаний, 21 отрасли и 21 функции. Это база, относительно которой считается результат конкретного человека: балл всегда нормативный, то есть говорит о положении в сопоставимой группе, а не об абсолютной величине.
  • Валидационная выборка — 3 000+ сотрудников. Отдельная проверка: результаты оценки сопоставляли с реальными KPI и оценками руководителей. Именно на этих данных проверялась прогностическая ценность в рабочих условиях.
  • CFI ≈ 0,96 — конструктная валидность. Конфирматорный факторный анализ подтвердил, что модель из двух доменов, «мышление» и «личность», хорошо описывает реальные данные. Сами домены до этого выделил эксплораторный анализ: структура найдена в данных и затем перепроверена, а не назначена сверху.
  • α Кронбаха = 0,69–0,77 — внутренняя согласованность. Показатели внутри каждой шкалы измеряют одно и то же качество: шкала не распадается на несвязанные куски. Это диапазон, а не одно число, потому что шкал несколько и у каждой своё значение.
  • Ретестовая надёжность > 0,83. При повторном прохождении результат воспроизводится — значит, метод фиксирует устойчивые характеристики, а не настроение конкретного вторника.
  • AUC ≈ 0,77 — связь с результатом на собственных данных. Насколько уверенно модель разделяет группы с разным уровнем рабочей результативности на валидационной выборке NeuroFrame, 3 000+ сотрудников. 0,5 — случайное угадывание, 1,0 — безошибочное разделение.
  • Точность моделей машинного обучения — 72–89%. Разброс есть потому, что моделей несколько и они решают разные задачи. Одна усреднённая цифра выглядела бы аккуратнее и описывала бы положение дел хуже.

Почему наши показатели нельзя поставить в один ряд с таблицей ниже

Дальше идёт таблица мета-аналитических коэффициентов для распространённых методов отбора. Прежде чем её читать, важная оговорка — и мы даём её здесь, а не сноской мелким шрифтом после.

Показатель AUC ≈ 0,77 у NeuroFrame и цифры в таблице получены на разных выборках и по разным критериям. Наше значение отражает качество модели на собственных данных NeuroFrame. Мета-аналитические коэффициенты отражают связь метода с внешне измеренной рабочей эффективностью, усреднённую по десяткам независимых исследований за десятилетия. Это соседние величины, но не тождественные — AUC и коэффициент r отвечают на разные вопросы и живут на разных шкалах, — и арифметика вида «наш показатель против их коэффициента» здесь не работает.

Что таблица показывает корректно — это порядок величин в индустрии. Сильнейшие из классических методов объясняют примерно от четверти до трети различий в рабочем результате. Личностные опросники — от одного до десяти процентов. Стаж и число лет образования — единицы процентов, то есть почти ничего. А самые известные широкой публике типологии, MBTI и DiSC, данных о прогностической валидности вообще не публикуют, и это само по себе информация.

Видно из таблицы и другое: даже устоявшиеся цифры пересматриваются. Пересчёт Сакетта и коллег 2022 года применил более строгую поправку на ограничение дисперсии и опустил классические коэффициенты Шмидта и Хантера примерно на треть. Коэффициент валидности — это оценка, зависящая от метода расчёта, а не константа.

Наша позиция — та, которую можно проверить: метод валидизирован против признанных тестов, реальных KPI и оценок руководителей. Ставить это напрямую против чужих мета-анализов мы не будем.

Что метод не умеет

Честный перечень ограничений говорит о качестве инструмента больше, чем ещё один знак после запятой.

Диапазоны — ориентир, а не приговор: отклонение по одному-двум параметрам стоит проверить на интервью, а не считать основанием для отказа.

Границы применимости

  • Эмпирическая база game-based assessment продолжает накапливаться. Величины валидности зависят от дизайна конкретного задания, и каждое задание валидизируется отдельно.
  • Интерпретация всегда нормативна: результат говорит о положении в сопоставимой группе, а не о значении на абсолютной шкале.
  • Оценка не заменяет интервью, проверку опыта и управленческое суждение. Она даёт основание для решения, но не само решение.
  • Для нестандартных ролей и специфичной корпоративной культуры нужна калибровка на успешных сотрудниках заказчика.
  • Метод повышает вероятность верного решения. Он не гарантирует успех конкретного человека на конкретной позиции — этого не гарантирует ни один инструмент отбора.

Прогностическая валидность распространённых методов отбора по данным двух мета-анализов

Метод отбораr — Schmidt & Hunter, 1998r — Sackett et al., 2022R² — доля объяснённой дисперсии
Когнитивные тесты (GMA)0.510.310.26 · 0.10
Структурированное интервью0.510.26
Рабочие пробы0.540.29
Личностные опросники, сознательность0.310.190.10 · 0.04
Стаж работы0.180.03
Образование, число лет0.100.01
MBTI, DiSCне публикуется

r — коэффициент валидности, R² — его квадрат, то есть доля различий в рабочем результате, которую объясняет метод. Где в колонке R² стоят два значения через «·», они соответствуют двум колонкам r в том же порядке. Прочерк означает, что источник не даёт отдельной оценки. Пересчёт Сакетта и коллег применяет более строгую поправку на ограничение дисперсии, поэтому его значения систематически ниже. Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274. DOI: 10.1037/0033-2909.124.2.262 Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection. Journal of Applied Psychology, 107(11), 2040–2068. DOI: 10.1037/apl0000994 Показатели NeuroFrame в эту таблицу намеренно не включены: они получены на других выборках и по другим критериям и прямому сопоставлению не подлежат.

Частые вопросы

Насколько это точно?

Настолько, насколько вообще бывает точна оценка людей. На валидационной выборке из 3 000+ сотрудников AUC ≈ 0,77: модель уверенно разделяет группы с разным уровнем рабочей результативности, где 0,5 — случайное угадывание. Точность моделей машинного обучения — 72–89% в зависимости от модели. Ретестовая надёжность выше 0,83: при повторном прохождении результат воспроизводится. При этом никакая оценка не гарантирует успех конкретного человека на конкретной позиции. Она повышает вероятность верного решения — и не более того.

Какая у метода валидность и как её проверяли?

Конструктная — CFI ≈ 0,96: конфирматорный факторный анализ подтвердил модель из двух доменов, «мышление» и «личность». Внутренняя согласованность — α Кронбаха 0,69–0,77 по шкалам. Ретестовая надёжность — выше 0,83. Критериальную валидность проверяли корреляциями когнитивных шкал с прогрессивными матрицами Равена и инструментами Saville, а также с тестами на внимание, память, переключаемость, обработку информации и принятие решений; личностные шкалы валидизированы через общепризнанные психометрические модели. Прогностическую ценность проверяли на реальных KPI и оценках руководителей на выборке 3 000+ человек. Нормативная база сравнения — более 10 000 руководителей и предпринимателей из 500+ компаний, 21 отрасли и 21 функции.

Есть ли доказательная база?

Да, и она устроена в два слоя. Первый — научные основания метода: Большая пятёрка, теория чувствительности к подкреплению Грея, модель PEN Айзенка, кибернетическая теория Большой пятёрки, Evidence-Centered Design и stealth assessment (Shute, 2011). Второй — собственные психометрические данные NeuroFrame, перечисленные на этой странице, с указанием выборок. Полная доказательная логика — что измеряется и через какое поведение это фиксируется — раскрывается методологам заказчика под соглашение о конфиденциальности. Закрытым остаётся только операционный ключ: веса признаков, модель перевода поведения в баллы и ML-компонент. Это условие сохранения валидности, а не корпоративная скрытность: требование защищённости скоринговых ключей закреплено в профессиональных стандартах оценки.

Вы точнее классических тестов?

В такой форме мы это утверждать не будем. Наши показатели получены на собственных данных, а мета-аналитические коэффициенты других инструментов — на других выборках и по другим критериям. Сопоставлять их напрямую некорректно, и подготовленный читатель такое сравнение оспорит. Что можно сказать честно: многие популярные методики вообще не публикуют данные о прогностической валидности, а личностные опросники объясняют лишь малую долю различий в результате — обычно от одного до десяти процентов. NeuroFrame валидизирован против признанных тестов и реальных KPI, а когнитивный и личностный домены измеряются связанно, в одном прохождении на 30–60 минут.

Все материалы раздела «Наука»