Сравнение
Одна длинная симуляция или батарея мини-игр
Разница между одной длинной симуляцией и батареей коротких мини-игр реальна и проверяема — но она не в точности прогноза, и прямого сравнения двух форматов на одной выборке по одному критерию мы не нашли. Там, где сопоставимые данные есть, они направлены против интуиции «дольше и реалистичнее — значит точнее». Длинный формат меняет не точность, а состав наблюдаемого: батарея по построению обнуляет состояние между заданиями, непрерывная сессия его переносит. Ниже — обе архитектуры, срез рынка на 4 августа 2026 года, что подтверждает литература, какие наши собственные утверждения она опровергла и где длинная сессия — неподходящий инструмент.
Обновлено:
Рядом
| Атрибут | Батарея мини-игр | NeuroFrame |
|---|---|---|
| Как устроена сессия | Criteria описывает свои игровые ассессменты собственными словами как «short, fun, and engaging mini-games» — несколько дискретных заданий, каждое со своим балломИсточник | Одна непрерывная сессия без модулей; состояние переносится с первой минуты до последней |
| Число заданий в батарее | Test Partnership MindmetriQ: 6 именованных игр — Net the Numbers, Number Racer, Link Swipe, Word Logic, Pipe Puzzle, Shape SpinnerИсточник | Одно задание; именованных подзаданий нет |
| Длительность отдельного задания | MindmetriQ: 4–6 минут на игруИсточник | Неприменимо — задание и есть сессия |
| Общая опубликованная длительность, батарея | MindmetriQ в трёх именованных конфигурациях: быстрый скрининг ~12 мин, целевой отбор ~18 мин, комплексная оценка ~35 минИсточник | 30–60 минут, одна конфигурация |
| Общая опубликованная длительность, другая батарея | Equalture: по формулировке FAQ, полная сессия обычно занимает от 15 до 45 минут в зависимости от числа игр, подобранных под роль, а каждая отдельная игра, по описанию вендора, «lasts only a few minutes»; размера библиотеки на этой странице мы не обнаружилиИсточник | 30–60 минут; набор под роль не меняется — роль входит на этапе эталона, а не задания |
| Короткая конфигурация батареи в этом срезе | Criteria Cognify: три игры, по описанию вендора — «just 10 minutes to complete, plus tutorials»; измеряются problem solving, numerical reasoning, verbal knowledge. На той же странице дословно: «a six-game version is also available on request»Источник | Короткой конфигурации нет; на входе массовой воронки это проигрыш по стоимости завершённой оценки |
| Геймифицированные модули внутри смешанной батареи | Sova Early Careers: 25 минут, 7 компонентов; опросник личности и ситуационный тест обязательны, два геймифицированных модуля помечены как опциональныеИсточник | Опросникового компонента нет вовсе; все восемь параметров выводятся из поведения в симуляции |
| Ближайшие продукты с одной сессией, опубликованная длительность | Sova Immerse: одна ролевая симуляция из трёх стадий — брифинг руководителя, симуляция задачи, дебрифинг; длительность по странице вендора — «15–30 min»Источник | 30–60 минут; другой жанр — стратегическая симуляция с дефицитом ресурсов, а не ролевая игра |
| Ближайшие продукты с одной сессией, опубликованная длительность (2) | CapsimInbox: одна inbox-симуляция, по описанию вендора — «typical inbox simulations are completed in just 15–60 minutes»; Hiring & Selection указан среди сценариев использованияИсточник | 30–60 минут; другой жанр — разбора почты нет, решения действуют на моделируемую систему |
| Единый нарратив; длительности на проверенных страницах не нашли | Owiwi: единое нарративное приключение «Isles of the Shroud», а не набор мини-игр; длительности прохождения мы не обнаружили ни на странице продукта, ни в FAQ, ни в техническом руководстве по состоянию на 4 августа 2026 годаИсточник | 30–60 минут, опубликовано; формат здесь сопоставим, длительность — нет |
| Нормативная выборка по публикации | Техническое руководство Owiwi, с. 21: «The norming sample is comprised of 5371 participants all over the world» — короткая версия из четырёх островов, с 2017 года; там же вендор указывает, что нормирование следующих четырёх островов ещё идёт (техническое руководство вендора, PDF, с. 21; проверено 4 августа 2026 года)Источник | 14 850 человек из 500 компаний, 21 отрасли, 21 функции, 8 грейдов. Выборки построены под разные конструкты, разные популяции и разные задачи — читать две ячейки как сравнение размеров нельзя. Наша выборка меньше, чем у инструментов с сорокалетней историей, и это в нашем списке слабых мест |
| Независимое рецензируемое исследование инструмента | Owiwi: Nikolaou, Georgiou & Kotsasarlidou (2019), The Spanish Journal of Psychology — фаза 1 N=193, фаза 2 N=120; инкрементная валидность сверх когнитивных и личностных тестов показана для академической успеваемости; рабочая эффективность измерялась самоотчётомИсточник | Нет. Рецензируемых публикаций собственных валидационных исследований у нас нет — это в нашем списке слабых мест, а не в сноске |
| Публикуемый показатель надёжности (показатели разного типа — прямое сравнение некорректно) | Test Partnership публикует по своим данным person reliability выше 0,70 для MindmetriQ и корреляции с батареей ICAR 0,91 вербальная и 0,89 числовая (по заявлению вендора, проверено 4 августа 2026 года); размеров выборок и дизайна исследования на этой странице мы не обнаружилиИсточник | α Кронбаха 0,69–0,77 (ниже конвенционального 0,80) и ретестовая надёжность выше 0,83. Person separation reliability и альфа измеряют разное; читать эти две ячейки как ранжирование нельзя |
Не один вендор, а два класса инструментов. «Батарея мини-игр» и «одна непрерывная симуляция» — обобщения формата; каждый упомянутый продукт назван полным именем (Test Partnership MindmetriQ, Criteria Cognify, Equalture, Sova Early Careers, Sova Immerse, CapsimInbox, Owiwi) со ссылкой на страницу его вендора и датой проверки 4 августа 2026 года. В разделе о поисковом спросе дополнительно приведены дословные поисковые запросы, в которые входят названия других компаний: это наш собственный замер того, что набирают люди, а не утверждения об их продуктах. Все названия и товарные знаки принадлежат их правообладателям и упоминаются номинативно, для указания на сам продукт, без логотипов и фирменного оформления. Оценок продуктам не ставится.
Прямой ответ: разница есть, и она не в точности
Доказательств того, что длинная симуляция предсказывает рабочий результат лучше короткой батареи, нет. Такого вывода в рецензируемой литературе мы не нашли, как не нашли и прямого сравнения двух архитектур — одна непрерывная симуляция против набора независимо оцениваемых мини-игр, одна выборка, один критерий: ни в пользу длинного формата, ни против него. Это первое, что стоит знать человеку, которому эту разницу продают, и первое, что мы говорим сами.
Там, где сопоставимые данные есть, они направлены против интуиции «погружение покупает точность». В мета-аналитическом пересчёте Sackett, Zhang, Berry & Lievens (2022) высокофидельные методы стоят ниже методов без всякого погружения: рабочие пробы .33 и центры оценки .29 против структурированного интервью .42 и тестов профессиональных знаний .40. Lievens & Patterson (2011) показали, что инкрементную валидность сверх тестов знаний дают и высокофидельный центр оценки, и низкофидельный ситуационный тест, — то есть фидельность сама по себе не является драйвером валидности.
Что тогда меняется. Меняется устройство наблюдения. Батарея обнуляет состояние между заданиями: каждое начинается с чистого листа, заканчивается и оценивается отдельно. Непрерывная сессия состояние переносит — то, что человек сделал на десятой минуте, становится условием сороковой. В одной архитектуре наблюдаемое «как человек разбирается с последствиями собственного раннего решения» существует, в другой — по нашему определению батареи — его нет: не потому что оно плохо измерено, а потому что ему не к чему прикрепиться. Это утверждение о составе данных, а не об их прогностической силе.
Дальше — определения обоих форматов, срез рынка на 4 августа 2026 года со ссылками на страницы вендоров, что подтверждает литература, четыре утверждения, которые мы вычеркнули из собственных материалов, потому что литература их опровергает, и раздел о том, где длинная симуляция — неподходящий инструмент.
Два термина, которых в поле нет: батарея мини-игр и single-simulation assessment
Существующая классификация в литературе делит инструменты по степени «игровости». Landers и соавторы (2022) разграничивают game-based, gamified и gamefully designed ассессменты и описывают, что требуется для валидации каждого. Эта ось полезна — и она ничего не говорит об устройстве сессии: gamefully designed инструмент может быть и шестью отдельными заданиями, и одним, а ярлык не различает эти случаи.
Поэтому мы вводим вторую ось, ортогональную первой. Оба имени — наши, придуманы на этой странице. Это не устоявшиеся термины, и ссылаться на них как на принятую классификацию мы не будем.
Батарея мини-игр — оценка, собранная из нескольких коротких заданий, у каждого из которых свои правила, своё начало, свой конец и свой балл. Состояние между заданиями не переносится. Набор конфигурируется под роль, а общая длительность есть сумма частей: убрали модуль — оценка стала короче и в остальном осталась прежней.
Single-simulation assessment, одна непрерывная симуляция, — оценка, в которой вся сессия является одним заданием с одним набором правил и одним сохраняющимся состоянием. Результат ранних действий входит во входные условия поздних. Разложить сессию на независимо оцениваемые части, не разрушив это состояние, нельзя, а длительность не складывается из модулей, потому что модулей нет.
Граница проходит не по длительности и не по степени игровости. Тридцатипятиминутная батарея остаётся батареей; пятнадцатиминутная непрерывная ролевая симуляция остаётся одной симуляцией. Test Partnership публикует конфигурацию MindmetriQ примерно на тридцать пять минут, собранную из шести именованных игр по четыре-шесть минут, — длинную в сумме и дискретную по построению. Sova описывает Immerse как одну непрерывную ролевую симуляцию из трёх стадий на пятнадцать-тридцать минут — короче в сумме и непрерывную по построению. Длительность и архитектура — независимые свойства, и смешение их — самая частая ошибка в этом разговоре.
И ещё одно различение, которое стоит держать отдельно: непрерывность не равна нарративной рамке. Набор независимых заданий можно обернуть в общую историю и всё равно обнулять состояние между ними. Определение выше держится на том, меняет ли раннее поведение поздние условия, а не на том, происходит ли действие в одном вымышленном мире.
Что предлагает рынок: срез на 4 августа 2026 года
Всё в этом разделе взято со страниц вендоров, прочитанных 4 августа 2026 года, и изложено так, как это формулирует сам вендор. Оценок продуктам мы не даём.
Criteria описывает свои игровые ассессменты собственными словами как «short, fun, and engaging mini-games». Продукт Cognify опубликован как три игры примерно на десять минут плюс туториалы; измеряются problem solving, numerical reasoning и verbal knowledge. На той же странице Criteria указывает, что Cognify независимо валидирован двумя исследованиями — одно проведено многонациональной технологической компанией, другое — психологом Dr. Richard Landers. Числовых коэффициентов и размеров выборок мы на этой странице продукта не обнаружили; в других материалах вендора мы их не искали.
Test Partnership публикует MindmetriQ как шесть именованных игр — Net the Numbers, Number Racer, Link Swipe, Word Logic, Pipe Puzzle, Shape Spinner — по четыре-шесть минут каждая, в трёх конфигурациях: быстрый скрининг около двенадцати минут, целевой отбор около восемнадцати, комплексная оценка около тридцати пяти. Там же вендор публикует корреляции с эталонной батареей ICAR: по его данным 0,91 для вербального и 0,89 для числового рассуждения, диапазон 0,75–0,84 по батарее и person reliability выше 0,70 (по заявлению вендора, проверено 4 августа 2026 года). Размеров выборок и описания дизайна исследования на этой странице мы не обнаружили; в других материалах вендора мы их не искали.
Equalture указывает в FAQ, что полная сессия обычно занимает от пятнадцати до сорока пяти минут в зависимости от числа игр, подобранных под роль, а каждая отдельная игра длится несколько минут. Общего числа игр в библиотеке на этой странице мы не обнаружили; в других материалах вендора мы его не искали. Sova публикует свою батарею Early Careers как двадцать пять минут и семь компонентов, из которых обязательны опросник личности и ситуационный тест, а два геймифицированных модуля — Gamified Numerical Challenge и Gamified Pattern Challenge — помечены как опциональные.
Продукты, построенные как одна непрерывная сессия, существуют и публикуются именно так. Sova Immerse описан как одна ролевая симуляция из трёх стадий — брифинг руководителя, симуляция задачи, дебрифинг — длительностью пятнадцать-тридцать минут. CapsimInbox описан как одна inbox-симуляция на пятнадцать-шестьдесят минут, и Hiring & Selection прямо назван среди сценариев использования. Owiwi построен как единый нарратив «Isles of the Shroud», а не как набор отдельных мини-игр; длительности прохождения мы не обнаружили ни на странице продукта, ни в FAQ, ни в техническом руководстве по состоянию на 4 августа 2026 года, поэтому формат здесь сопоставим, а длина — нет.
Необходимая оговорка о границах этой проверки. Мы прочитали выборку англоязычных страниц вендоров на одну дату. Это не обзор рынка, поэтому слов «ни один», «единственный» и «все вендоры» мы не пишем. Сказать можно меньше — и это всё равно полезно: среди проверенных продуктов преобладающая опубликованная архитектура — батарея коротких заданий, а продукты с одной непрерывной сессией публикуются с длительностями пятнадцать-шестьдесят минут, а не как обязательный минимум в тридцать с лишним.
Что говорит наука о самом игровом формате
Прежде чем сравнивать две архитектуры, нужно назвать честное состояние доказательной базы по игровой оценке в целом, потому что оно задаёт потолок для любых утверждений обоих форматов.
Самый прямой источник — систематический обзор по PRISMA (Ramos-Villagrasa, Fernández-del-Río & Castro, 2022) на тридцати четырёх статьях. Его вывод неудобен для всех, кто продаёт игровую оценку, включая нас: игровые ассессменты не дают достаточных преимуществ, чтобы рекомендовать их вместо конвенциональных методов, — если только организация не считает, что рост привлекательности для кандидатов сам по себе добавляет ценность. Конструктная валидность названа неопределённой. Доказательная база по намеренному искажению названа слишком скудной для выводов. Adverse impact не хуже, чем у конвенциональных тестов. Реакции кандидатов — единственная область с уверенно положительным результатом, и даже там обзор фиксирует game-framing phenomenon: одно только называние теста игрой улучшает реакции без изменения содержания.
Два мета-анализа сопоставляют игровые показатели с традиционными. Bipp, Wee, Walczok & Hansal (2024) объединили пятьдесят две выборки из сорока четырёх работ и более шести тысяч ста взрослых: связь игровых показателей с традиционными тестами когнитивных способностей — r = .30 наблюдаемая и .45 скорректированная, причём игры, специально спроектированные под измерение когнитивных способностей, коррелировали не сильнее прочих. Авторы оставляют открытым вопрос, измеряют ли игровые ассессменты то же самое, что традиционные тесты. Fadillah, Hidayat & Santoso (2025) объединили восемнадцать исследований из тринадцати статей по конвергентной валидности с личностными опросниками, r = .516, и сами называют ограничениями циркулярную валидацию и отсутствие стандартизированных рамок.
Важнее всего то, чего нет ни в одном из них. Мета-анализа критериальной, то есть прогностической, валидности игровой оценки относительно рабочей эффективности мы не нашли. Все найденные нами мета-анализы — про конвергенцию, про совпадение с традиционными инструментами, а не про предсказание результата. Прогностическое утверждение об этом классе инструментов — и наше в том числе — опирается на данные того, кто его делает: литературы, на которую можно было бы опереться, мы не нашли.
Это и есть потолок. Внутри него защитимая позиция игрового формата такова: сопоставимая с конвенциональными методами валидность, заметно лучшая реакция кандидатов, adverse impact не хуже. Всё, что сказано ниже про архитектуру сессии, находится внутри этого потолка и не поднимает его.
Четыре утверждения, которые мы вычеркнули из собственных материалов
Этот раздел существует потому, что сравнение, опубликованное заинтересованной стороной, стоит читать только если оно называет места, где данные пошли против самой этой стороны. Каждое из четырёх утверждений ниже было в наших материалах. Каждое из них удалено.
Первое: «примерно на пятой-седьмой минуте мозг перестаёт воспринимать происходящее как тест и входит в состояние потока». Такого тайминга мы не нашли ни в одном из просмотренных источников. Durcan, Holland & Bhattacharya (2024) прямо констатируют, что времени, необходимому для возникновения потока после начала деятельности, почти не уделялось внимания. Существующие оценки расходятся на два порядка: Kotler, Mannino, Kelso & Huskey (2022) моделируют онсет потока в первые секунды; в исследовании Yun и соавторов, цитируемом в том же обзоре, эксперты-геймеры сообщали, что им нужно не менее двадцати пяти минут; Genc и соавторы (2026) фиксируют рост потока в третьей-пятой эпохе двадцатипятиминутной сессии. Цифры «пять-семь минут» нет ни в одном из них. Мы больше не называем никакую минуту.
Второе: «погружение отключает социальные маски». Утрата самосознания — один из конституирующих признаков потока в определении Чиксентмихайи (Flow: The Psychology of Optimal Experience, Harper & Row, 1990), то есть часть значения конструкта, а не независимо доказанное его следствие. Исследований, которые измеряли бы поток как медиатор снижения социально желательных ответов, в литературе по игровой оценке мы не нашли. Механизм обсуждается как гипотеза, в том числе у Ohlms и соавторов (2025), и прямо не проверялся. Вместо этого можно сказать меньше — и это будет правдой: игра фиксирует то, что человек делает, а не то, что он о себе сообщает, поэтому очевидного правильного ответа, который можно выбрать, здесь нет.
Третье: «игровая оценка точнее и честнее опросников». Систематический обзор тридцати четырёх работ заключает обратное — цитата приведена выше. Защитимая версия — сопоставимая валидность при лучшей реакции кандидатов, и теперь мы пишем именно так.
Четвёртое: «длинная симуляция даёт более высокую прогностическую валидность». Числа направлены в другую сторону. У Sackett и соавторов (2022) высокофидельные рабочие пробы стоят на .33, центры оценки на .29 — обе величины ниже структурированного интервью .42 и тестов профессиональных знаний .40. Lievens & Patterson (2011) показали, что инкрементную валидность сверх тестов знаний дают и низкофидельные, и высокофидельные симуляции, — а это ровно та находка, которая снимает фидельность как объяснение. Наш аргумент в пользу непрерывной сессии теперь про природу данных, а не про превосходство прогноза.
Для полноты сюда же относится пятый пункт, касающийся не фразы, а показателя: мы не выводим индивидуальный «индекс утомляемости». Обоснование — в разделе про время на задаче.
Что длинная сессия действительно приносит: частично иной конструкт
Научно защитимый аргумент в пользу динамической сессии с отложенными последствиями состоит не в том, что она измеряет лучше. Он в том, что она измеряет частично другое.
Правильная рамка — литература по комплексному решению проблем в динамических микромирах. Stadler, Becker, Gödker, Leutner & Greiff (2015) провели мета-анализ сорока семи исследований и получили средневзвешенную корреляцию комплексного решения проблем с интеллектом r = .43 при 95-процентном доверительном интервале .37–.49. Это соответствует примерно восемнадцати процентам общей дисперсии. Комплексное решение проблем существенно перекрывается с общими когнитивными способностями и не сводится к ним — а это ровно та форма утверждения, которую непрерывная симуляция может себе позволить.
Оговорки идут в комплекте. Свидетельства инкрементной валидности комплексного решения проблем сверх интеллекта для академических и рабочих результатов есть, и поле при этом спорное: часть литературы считает, что доказательств для признания комплексного решения проблем отдельной способностью пока недостаточно. Мета-анализ описывает задачи-микромиры в исследовательских условиях, а не коммерческие инструменты найма. И мы не публиковали доказательств, что наша собственная симуляция измеряет именно этот конструкт; мы ссылаемся на эту литературу как на рамку, делающую архитектурный аргумент связным, а не как на валидацию продукта.
Аккуратная формулировка выглядит так. Динамическая среда, в которой решения имеют отложенные последствия, задействует конструкт, который классические тесты улавливают лишь частично. Это довод рассматривать такую среду как дополнение к конвенциональному измерению — и это не довод ожидать более высокого коэффициента валидности, потому что мета-аналитические числа по высокофидельным методам говорят иное.
Наблюдение под нагрузкой — и почему мы не публикуем индекс утомляемости
Vigilance decrement — снижение устойчивости внимания и качества реакций с ростом времени на задаче — один из самых воспроизводимых эффектов в когнитивной психологии. Типичные исследовательские задачи такого рода длятся тридцать-сорок пять минут, а снижение измеримо уже в первые десять. Ментальное утомление к тому же сдвигает параметры принятия решений, включая задокументированный сдвиг к риск-аверсии. Это эффект группового уровня, и он установлен надёжно.
Для дизайна оценки из него следует немного, и стоит сформулировать это точно. Сессия, достаточно длинная, чтобы нагрузка накопилась, позволяет наблюдать поведение и в свежем, и в нагруженном состоянии. Набор коротких заданий, каждое из которых начинается с чистого листа, преимущественно фиксирует первое. Это разница в том, что доступно наблюдению.
Чего из него не следует — персональной метрики. Показатель вида «насколько у этого человека упала эффективность к концу сессии» является разностным баллом, а разностные баллы печально известны низкой надёжностью: разность двух величин, каждая из которых измерена с погрешностью, почти всегда менее надёжна, чем любая из них. Hedge, Powell & Sumner (2018) описали этот «парадокс надёжности» прямо: задачи, дающие робастные групповые эффекты, показали ретестовую надёжность от нуля до .82 и в большинстве случаев оказались непригодны для измерения индивидуальных различий — именно потому, что межиндивидуальная вариативность в них мала.
Поэтому мы говорим, что формат позволяет наблюдать, и не заявляем валидированной шкалы утомляемости. Если подобный индикатор когда-нибудь попадёт в отчёт, который получает работодатель, рядом с ним обязана стоять его ретестовая надёжность. И то же правило стоит применять к любому вендору, включая нас: спрашивать надёжность конкретного числа в отчёте, а не надёжность инструмента вообще.
Вовлечённость по ходу сессии и намеренное искажение
Под длинным форматом есть две находки, которые стоит иметь, — при условии, что они изложены со своими границами.
Вовлечённость нарастает по ходу сессии, а не задаётся в первые минуты. Genc, Surer, Wittmann, Popov & Lenggenhager (2026) измеряли поток непрерывно — участники удерживали педаль — в двадцатипятиминутной VR-сессии, разбитой на пять пятиминутных эпох. Частота нажатий была выше в третьей, четвёртой и пятой эпохах, а послесессионные опросники сильнее коррелировали с последними пятью минутами, чем с ранними. Практическое чтение: длинный формат даёт больше данных, собранных при высокой вовлечённости. Границы реальны: небольшая выборка, VR-игра, а не инструмент найма, и сами авторы называют peak-end rule альтернативным объяснением корреляций с опросниками. Эта находка поддерживает «вовлечённость нарастает по ходу сессии» и не поддерживает никакого утверждения о конкретной минуте.
О намеренном искажении. Ohlms, Melchers, Kanning & Barends (2025) провели контролируемый эксперимент на 171 участнике со случайным распределением на условия «отвечать честно» и «отвечать как кандидат»; внутри — и игровая мера, и традиционный тест на честность-скромность. Участники сумели исказить результат в обоих, но эффект искажения в игровой мере был значимо меньше. Собственный вывод авторов: игровая оценка не является панацеей, полностью исключающей искажение. Сюда же — противовес: систематический обзор 2022 года нашёл во всём поле лишь одно исследование по намеренному искажению и назвал доказательную базу слишком скудной для выводов, поэтому результат Ohlms и соавторов остаётся единичным экспериментом, а не корпусом доказательств.
Поддерживаемая фраза выглядит так: игровой формат снижает, но не устраняет социальную желательность — и держится это на одном контролируемом эксперименте, а не на корпусе доказательств. И отдельно: это свойство игрового формата как такового, а не длины сессии. Работ, которые различали бы длинную симуляцию и короткую батарею по искажению, мы в этой литературе не нашли, и сами такого не утверждаем.
Отложенные последствия: разница по построению, а не по величине
Вот место, где две архитектуры расходятся отчётливее всего, и стоит точно определить, какого рода это расхождение.
По нашему определению батареи состояние между заданиями не переносится: каждое задание стартует из заданного начального состояния и оценивается отдельно. Определение — наше; переносится ли состояние в конкретном продукте, знает только его вендор, и на страницах, прочитанных нами 4 августа 2026 года, описания этого механизма мы не встретили. Мы говорим о свойстве архитектуры, а не приписываем его названным продуктам. В непрерывной сессии состояние на сороковой минуте есть продукт того, что кандидат делал на десятой. Потраченный рано ресурс позже недоступен. Сэкономленное рано усилие оборачивается проблемой, которую придётся разбирать позже.
Следствие — целый класс наблюдаемого. «Как человек разбирается с ситуацией, которую создал сам, не будучи об этом уведомлён» — это то, что в одной архитектуре записывается, а в другой записаться не может. Не измеряется менее точно — отсутствует. Это структурное утверждение, и проверяется оно по собственному описанию продукта у любого вендора, а не требует исследования.
И теперь ограничение на это утверждение, которое не менее важно, чем оно само. Отсюда не следует, что получаемые данные лучше предсказывают рабочий результат. Прямых исследований, сравнивающих одну длинную симуляцию с батареей мини-игр на одной выборке по одному критерию, нет — мы не нашли ни одного, ни в ту, ни в другую сторону. Если такое исследование проведут и оно выйдет не в пользу длинного формата, это будет настоящий результат, и мы опубликуем его здесь. Пока же корректная форма аргумента такая: две архитектуры делают доступным наблюдению разное поведение, а что из этого лучше предсказывает — открытый эмпирический вопрос.
Ещё одно ограничение, уже конкретно про нас. Непрерывность покупает наблюдение и стоит покрытия. Одно непрерывное задание способно измерить только то, что оно вызывает. У него нет модулей, которые можно добавить, когда роль требует прямого измерения вербальных или числовых способностей, и нет альтернативной формы для повторного тестирования. У батареи есть и то и другое по построению. Это не мелкие компромиссы, и раздел о том, где длинная симуляция — неподходящий инструмент, относится к ним всерьёз.
Ситуация объясняет не меньше, чем компетенция, — и это режет в обе стороны
Хорошо воспроизведённая находка в литературе по центрам оценки: эффекты упражнений объясняют в оценках как минимум не меньше дисперсии, чем те дименсии, которые эти упражнения должны измерять. Bowler & Woehr (2006) установили это мета-аналитически, вслед за более ранней работой Lievens & Conway (2001), Journal of Applied Psychology 86(6), 1202–1222, doi:10.1037/0021-9010.86.6.1202. Иначе говоря, поведение сильно ситуативно: что человек делает, в значительной мере зависит от конкретной ситуации, в которую он помещён, а не только от устойчивой черты, которую он переносит между ситуациями.
Одно прочтение этого работает в пользу непрерывного сценария. Если поведение ситуативно, то наблюдение функции, вырванной из контекста, меняет само наблюдаемое. Целостный сценарий по крайней мере предъявляет поведение, связанное с контекстом, а не изолированную реакцию.
Второе прочтение работает против нас, и мы предпочитаем сказать это сами, а не услышать от методолога заказчика. Если дисперсия упражнения доминирует над дисперсией дименсии, это аргумент против любых претензий на чистое измерение дименсии внутри симуляции — включая нашу. Непрерывный сценарий — это одно очень большое упражнение. Он не уходит от эффекта упражнения; скорее он и есть эффект упражнения. Восемь параметров, которые мы выводим, — это заключения о поведении внутри одной конкретной ситуации, и мера их переносимости за пределы этой ситуации есть эмпирический вопрос к нашему инструменту, а не то, что литература по центрам оценки решает в нашу пользу.
Именно поэтому мы описываем свои числа как процентили относительно выборки сравнения и публикуем рядом внутреннюю согласованность 0,69–0,77 и ретестовую надёжность выше 0,83, а не как измерения черт. И поэтому же к каждому публикуемому диапазону приложена стандартная оговорка: отклонение по одному-двум параметрам стоит проверить на интервью, а не считать основанием для отказа.
Индустрия подготовки: измеримое свойство дискретных именованных заданий
Именованное дискретное задание можно найти, описать и отрепетировать. Это не мнение о чьём-либо продукте, а свойство формата — и оно оставляет измеримый след в поисковом спросе.
Наш собственный замер поискового спроса — по данным Semrush, выгрузка 4 августа 2026 года. В британской базе запрос «arctic shores practice test free» даёт 390 обращений в месяц, а пять запросов вида «arctic shores <имя> game» — Balance, Order, Predict, Lock и Ticket — дают в сумме 550 в месяц (170, 110, 110, 90 и 70). В американской базе «pymetrics games answers» — 110. Это имена, которые prep-индустрия набирает в поисковой строке; мы не приписываем их ни одному вендору и ничего не утверждаем здесь о том, как вендор называет или описывает части собственного продукта. Ссылку на чужую страницу мы не даём потому, что это не заявление вендора, а измерение спроса: замер воспроизводится в любом сервисе анализа ключевых слов, и мы указываем сервис, базу и дату, чтобы его можно было повторить.
Что отсюда следует и что не следует. Следует, что вокруг задания с публичным именем формируется экосистема разборов — структурное следствие именованности и дискретности. Не следует, что подготовка работает, что баллы из-за неё смещаются и что какой-либо инструмент из-за этого хуже. Данных об эффекте подготовки на итоговые баллы у нас нет, и такого мы не утверждаем. Вендоры на это, разумеется, отвечают: пулы заданий, рандомизация и имплицитный скоринг — стандартные контрмеры, а цифра поискового спроса ничего не говорит о том, насколько они действенны.
Симметричный пункт про нас. Наша сессия — одно задание без публично именованных модулей, поэтому сегодня искать по частям нечего. Это свойство нынешней конструкции, а не заслуга, — и оно исчезнет в тот день, когда мы модули назовём. Риск экспозиции относится и к нам, причём острее, чем к батарее: у нас одно задание и нет альтернативной формы для повторного тестирования, и это в нашем собственном списке слабых мест. Ключ оценки мы не публикуем — ни веса признаков, ни модель перевода поведения в баллы, ни эталонный путь прохождения. Это требование безопасности теста по стандартам AERA/APA/NCME и руководствам ITC, оно распространяется на любой серьёзный инструмент и не является нашей отличительной чертой.
Что из этого следует практически при выборе инструмента
Исходить надо из задачи, а не из формата. Вопрос об архитектуре стоит ниже по течению — после того как определено, что именно вы хотите наблюдать.
Массовый скрининг на входе воронки по когнитивным способностям. Здесь подходит короткая батарея: десять-пятнадцать минут, по модулю на конструкт, конфигурируемость под роль и стоимость прохождения, которая масштабируется. Сессия на тридцать-шестьдесят минут на этом этапе покупает наблюдение, которое вам не нужно, и платит за него отвалом кандидатов.
Вербальные или числовые способности конкретно. У батареи под них есть выделенные модули. У одной непрерывной симуляции их нет, и у нас их нет: вербальные и числовые способности мы не покрываем и говорим это до пилота, а не после.
Поведение под накапливающимися последствиями собственных решений. Ради этого случая непрерывная сессия и существует. Это же и случай, где стоит требовать доказательства жёстче всего: мета-анализа критериальной валидности, на который можно было бы опереться, мы не нашли, и все, включая нас, будут ссылаться на собственные данные.
Самое дешёвое доступное улучшение прогноза. Если бюджет позволяет одно изменение, это, скорее всего, структурирование интервью: .42 в пересчёте Sackett против .33 у рабочих проб и .29 у центров оценки. Покупать любой игровой формат до того, как интервью структурировано, — оптимизация не того этапа. Мы предпочитаем сказать это и потерять сделку, чем чтобы методолог дошёл до этого после подписания.
Опыт кандидата. Здесь у игрового формата самая устойчивая положительная доказательная база — и читать её нужно с поправкой на game-framing из систематического обзора: реакции улучшаются от одного только называния теста игрой, даже когда содержание не меняется.
Что бы вы ни выбрали, задайте всем вендорам одни и те же пять вопросов и сравнивайте ответы, а не маркетинг. Каков размер и состав нормативной выборки? Какова внутренняя согласованность и ретестовая надёжность конкретных баллов из отчёта? Есть ли отчёт по adverse impact с указанием выборки и даты? Кто проводил валидацию и есть ли рецензируемые публикации? И для любого показателя, построенного как изменение во времени, — какова его надёжность? В применении к нам эти вопросы дают неудобные ответы, и они в следующем разделе.
Где длинная симуляция — неподходящий инструмент
Речь о формате, а не о конкретном продукте, — и это тот раздел, который страница, опубликованная заинтересованной стороной, обычно опускает.
Пропускная способность. Тридцать-шестьдесят минут против десяти стоят доходимости. Criteria публикует Cognify примерно на десять минут плюс туториалы; Sova публикует батарею Early Careers на двадцать пять. На входе воронки в тысячи человек более короткий инструмент выигрывает по стоимости завершённой оценки, и никакие рассуждения о богатстве наблюдения этой арифметики не меняют.
Покрытие конструктов. Батарея добавляет модули, непрерывная сессия — нет. Если роль действительно держится на числовом рассуждении, батарея измеряет его прямо, а симуляция в лучшем случае выводит косвенно.
Повторное тестирование. Батареи умеют подменять формы между попытками. У одного непрерывного задания альтернативной формы нет, и это ограничивает повторное использование внутри одной организации.
Конфигурируемость. Батарея позволяет заказчику убрать модуль, который роли не нужен. Непрерывная сессия работает по принципу «всё или ничего»: вынуть из неё двадцать минут в середине нельзя.
Доступность. Длинная сессия в реальном времени при растущем дефиците времени — более трудный формат для кандидатов с моторными или зрительными ограничениями, чем нетаймированный опросник, и риск косвенной дискриминации у него соответственно острее. У любого вендора, продающего этот формат, стоит запросить письменную политику адаптаций. У нас она пока не оформлена — мы говорим это прямо и, пока её нет, прямо рекомендуем не использовать результат как единственное основание решения и предусматривать альтернативную процедуру для тех, кому формат недоступен.
Прогностическая валидность как таковая. Если единственный критерий — величина коэффициента, пересчитанные мета-аналитические числа не в пользу погружения: структурированное интервью .42 и тесты профессиональных знаний .40 стоят выше рабочих проб .33 и центров оценки .29. Длинная симуляция — это аргумент о том, что вы наблюдаете, а не о числе, которое вы получаете.
Раскрытие: кто это написал и как это проверялось
Это сравнение опубликовано NeuroFrame — то есть заинтересованной стороной. Поэтому каждый факт о чужом продукте снабжён ссылкой на первоисточник, а оценок этот раздел не ставит.
Как собирались данные о вендорах: мы читали англоязычные страницы вендоров 4 августа 2026 года и цитируем то, что там сказано, с указанием даты. Рынок мы не описываем, потому что не обследовали его, — и по той же причине избегаем слов «единственный», «ни один» и «все вендоры». Там, где нужного показателя мы на проверенных страницах не нашли — длительности у Owiwi, общего числа игр в библиотеке у Equalture, — мы так и пишем: не нашли на этих страницах по состоянию на 4 августа 2026 года. Это утверждение о нашей проверке, а не о том, что показателя не существует или что вендор его не публикует.
Как проверялась наука: коэффициенты валидности взяты из пересчёта Sackett, Zhang, Berry & Lievens (2022) по тексту самой статьи, а не из вторичных пересказов, часть которых ходит с неверными числами. Значения Schmidt & Hunter 1998 года мы как текущие не используем: пересчёт показал систематическую перекоррекцию на ограничение выборки во всех пяти распространённых подходах, из-за которой прежние оценки были выше на .10–.20.
Что изменилось у нас по итогам написания этой страницы: утверждение о тайминге входа в поток, утверждение о том, что погружение снимает социальные маски, утверждение о превосходстве игровой оценки над опросниками и утверждение о более высокой прогностической валидности длинной симуляции — все четыре сняты, а опровергающие их источники названы в разделе выше.
Регуляторный контекст — описанием, а не толкованием. Основная часть Регламента ЕС об ИИ применяется со 2 августа 2026 года, а системы, используемые в найме и отборе, отнесены к высокорисковым по Annex III. По NYC Local Law 144 обязанность публиковать bias audit лежит на работодателе, а не на вендоре; аудит вендора — добровольный сигнал, и независимым не считается аудитор, связанный с разработкой, трудовыми отношениями или финансовым интересом. Юридических заключений мы здесь не даём — проверяйте по первоисточникам и со своим юристом.
Наши собственные числа на этой странице берутся из единственного внутреннего источника истины: длительность сессии 30–60 минут, выборка сравнения 14 850 человек из 500 компаний, 21 отрасли, 21 функционального направления и 8 грейдов, внутренняя согласованность 0,69–0,77, ретестовая надёжность выше 0,83, CFI 0,96, справочник профилей — 287 профессий из 34 профессиональных областей по 8 стадиям жизненного цикла, всего 2 296 эталонных профилей, каждый со своим человекочитаемым обоснованием.
Когда выбирать не нас
Ни одной рецензируемой публикации собственных валидационных исследований. Мы цитируем чужие мета-анализы с DOI, а наши собственные коэффициенты не проходили ни рецензирования, ни независимой репликации. Если ваша закупка требует опубликованной валидации, сегодня мы этому требованию не отвечаем.
Нет формального bias-аудита и отчёта по adverse impact ratio. Мы не подменяем недостающий документ словами «наш метод объективен». Что есть вместо — архитектурное свойство: мы не получаем ни имени, ни пола, ни возраста, только коды, которые заказчик распределяет внутри своего контура. Это снимает риск прямого использования защищённого признака, но не снимает риска косвенного: поведенческие показатели могут коррелировать с полом, возрастом или ограничениями здоровья, и проверяется это только замером adverse impact на выходе. Такого замера у нас пока нет, и свойство конструкции его не заменяет.
Внутренняя согласованность 0,69–0,77 — ниже конвенционального порога 0,80, который принято требовать от инструментов для решений с высокой ценой. Мы компенсируем ретестовой надёжностью выше 0,83 — устойчивостью результата во времени, а не согласованностью формулировок, — и не прячем первое число за вторым.
Выборка сравнения 14 850 человек — меньше, чем у инструментов с сорокалетней историей. Размазанная на 21 отрасль, 21 функцию и 8 грейдов, она даёт в отдельной ячейке сотни наблюдений, а не тысячи. Для узких ролей диапазон — ориентир, а корректное сравнение требует калибровки на ваших людях.
83% из 2 296 записей справочника — роли уровня «специалист / исполнитель», а топ-менеджмент покрыт девятью профессиями. Если ваша задача — оценка первых лиц, именно там наш справочник тоньше всего.
Одно задание вместо батареи: мы не покрываем вербальные и числовые способности, у нас нет ситуационного модуля и нет альтернативной формы для повторного тестирования. Мы дополняем существующие инструменты, а не заменяем их.
Комплаенс-контур у нас российский. 152-ФЗ закрыт архитектурно, потому что персональных данных мы не получаем вовсе, но пакета по GDPR, документации по EU AI Act и материалов по NYC LL144 у нас нет. Для европейской или американской закупки это стоп, и говорим мы об этом до пилота, а не после.
Нет коннекторов к ATS — прямое следствие схемы с обезличенными кодами: ATS-интеграция обычно означает обмен ровно теми данными, которых мы сознательно не держим. При больших потоках ручной шаг стоит чьего-то времени.
Нет оформленной политики адаптаций для кандидатов с моторными или зрительными ограничениями. Пока её нет, не используйте результат как единственное основание решения и предусмотрите альтернативную процедуру для тех, кому формат недоступен.
Клиентский справочник существует только на русском. Мультиязычному штату нельзя выдать обоснование диапазона на языке, которого большая часть сотрудников не читает.
Вопросы
- Что честнее: одна длинная симуляция или батарея мини-игр?
- Ни то ни другое — по имеющимся данным. Игровой формат в целом снижает намеренное искажение по сравнению с опросником: в контролируемом эксперименте на 171 участнике (Ohlms и соавт., 2025) эффект искажения в игровой мере был значимо меньше, но искажение оставалось возможным, и авторы прямо пишут, что панацеей это не является. Исследований, которые сравнивали бы длинный и короткий игровой формат по этому признаку, мы не нашли. Систематический обзор 2022 года нашёл во всём поле лишь одно исследование по искажению и назвал базу слишком скудной для выводов.
- Правда ли, что длинная симуляция точнее предсказывает рабочий результат?
- Нет, и данных за это нет. Прямого сравнения двух форматов на одной выборке по одному критерию мы не нашли. Косвенные данные направлены в другую сторону: в пересчёте Sackett и соавт. (2022) высокофидельные методы — рабочие пробы .33 и центры оценки .29 — стоят ниже структурированного интервью .42 и тестов профессиональных знаний .40, а Lievens & Patterson (2011) показали, что инкрементную валидность дают и низкофидельные симуляции. Фидельность сама по себе не драйвер валидности.
- На какой минуте человек «расслабляется» и начинает вести себя естественно?
- Такой минуты мы в литературе не нашли и больше её не называем. Обзор Durcan, Holland & Bhattacharya (2024) прямо констатирует, что времени возникновения потока почти не уделялось внимания, а существующие оценки расходятся на два порядка: от первых секунд (Kotler и соавт., 2022) до двадцати пяти минут и больше по самоотчёту опытных игроков. Что можно сказать: в непрерывных измерениях вовлечённость выше во второй половине сессии, чем в первых минутах (Genc и соавт., 2026, N небольшой, VR-игра).
- Мы не будем мерить, кто больше играл в компьютерные игры?
- Это законное возражение к любой игровой оценке, и универсального ответа у поля нет. В нашей конструкции правила сообщаются до начала: угадывать нечего, измеряется качество применения известных правил при растущей нагрузке, а скорость освоения непривычного формата учитывается как показатель обучаемости, а не как фора. Это довод о дизайне, а не опубликованное доказательство отсутствия эффекта игрового опыта; такого доказательства у нас нет.
- Нам нужно отсеять пять тысяч кандидатов. Что брать?
- Скорее короткую батарею. На входе воронки решает стоимость завершённой оценки: Criteria публикует Cognify примерно на десять минут плюс туториалы, Sova — батарею Early Careers на двадцать пять минут. Сессия на тридцать-шестьдесят минут в этом месте покупает наблюдение, которого задача не требует, и платит за него отвалом. Непрерывная симуляция уместнее ниже по воронке, на меньших объёмах.
- Есть ли исследование, которое сравнило два формата напрямую?
- Мы такого не нашли — ни в пользу длинной симуляции, ни против неё. Мета-анализа критериальной валидности игровой оценки относительно рабочей эффективности мы тоже не нашли; все найденные нами мета-анализы — про совпадение с традиционными методами. Это честное состояние поля на 4 августа 2026 года, и вендор, заявляющий здесь численное превосходство, опирается на собственные данные: литературы, на которую можно было бы сослаться, мы не нашли.
- У нас бюджет на одно улучшение процесса. На что его потратить?
- Скорее всего, на структурирование интервью. В пересчёте Sackett и соавт. (2022) структурированное интервью получило .42 — выше рабочих проб .33 и центров оценки .29. Покупать любой игровой инструмент до того, как интервью структурировано, значит оптимизировать не тот этап. Нам невыгодно это говорить, но проверить это легко, а обнаружить после подписания контракта — дорого.
- Как игровая оценка выглядит с точки зрения EU AI Act и NYC LL144?
- Основная часть Регламента ЕС об ИИ применяется со 2 августа 2026 года, и системы для найма и отбора отнесены к высокорисковым по Annex III — это касается любого вендора с клиентами в ЕС, независимо от формата. По NYC Local Law 144 обязанность публиковать bias audit лежит на работодателе, а не на вендоре; аудит вендора — добровольный сигнал, и независимым не считается аудитор, связанный с разработкой, трудовыми отношениями или финансовым интересом. Юридического заключения мы не даём: проверяйте по первоисточникам.
Источники
Каждая ссылка открыта и проверена на дату, указанную выше.
- Revisiting meta-analytic estimates of validity in personnel selection — Sackett, Zhang, Berry & Lievens (2022), Journal of Applied Psychology 107(11), 2040–2068
- Revisiting the design of selection systems in light of new findings regarding the validity of widely used predictors — Sackett, Zhang, Berry & Lievens (2023), Industrial and Organizational Psychology 16(3), 283–300
- The validity and utility of selection methods in personnel psychology (historical source of the 1998 estimates) — Schmidt & Hunter (1998), Psychological Bulletin 124(2), 262–274
- Game-related assessments for personnel selection: A systematic review — Ramos-Villagrasa, Fernández-del-Río & Castro (2022), Frontiers in Psychology 13:952002
- The relationship between game-related assessment and traditional measures of cognitive ability: a meta-analysis — Bipp, Wee, Walczok & Hansal (2024), Journal of Intelligence 12(12):129
- Convergent validity of game-based assessment: a meta-analysis — Fadillah, Hidayat & Santoso (2025), International Journal of Serious Games
- Game-based, gamified, and gamefully designed assessments for employee selection: definitions, distinctions, design, and validation — Landers et al. (2022), International Journal of Selection and Assessment 30(1)
- A framework for neurophysiological experiments on flow states — Durcan, Holland & Bhattacharya (2024), Communications Psychology 2:66
- First few seconds for flow: a comprehensive proposal of the neurobiology and neurodynamics of state onset — Kotler, Mannino, Kelso & Huskey (2022), Neuroscience & Biobehavioral Reviews 143:104956
- Tracking flow in real time during a virtual reality gaming session — Genc, Surer, Wittmann, Popov & Lenggenhager (2026), Psychophysiology 63(4):e70283
- Game on, faking off? An experimental study of faking in game-based and conventional assessment — Ohlms, Melchers, Kanning & Barends (2025), Journal of Business and Psychology
- The reliability paradox: why robust cognitive tasks do not produce reliable individual differences — Hedge, Powell & Sumner (2018), Behavior Research Methods 50, 1166–1186
- Examining the role of task requirements in the magnitude of the vigilance decrement — PubMed Central — review of time-on-task effects and typical vigilance task durations
- Effects of mental fatigue on risk preference and feedback processing in risk decision-making — PubMed Central
- Dimension and exercise variance in assessment center scores: a large-scale evaluation of multitrait-multimethod studies — Lievens & Conway (2001), Journal of Applied Psychology 86(6), 1202–1222
- Standards for Educational and Psychological Testing (test security requirements) — AERA, APA & NCME (2014)
- A meta-analytic evaluation of the impact of dimension and exercise factors on assessment center ratings — Bowler & Woehr (2006), Journal of Applied Psychology 91(5), 1114–1124
- The validity and incremental validity of knowledge tests, low-fidelity simulations, and high-fidelity simulations — Lievens & Patterson (2011), Journal of Applied Psychology 96(5), 927–940
- Complex problem solving and intelligence: a meta-analysis — Stadler, Becker, Gödker, Leutner & Greiff (2015), Intelligence 53, 92–101
- Exploring the relationship of a gamified assessment with performance — Nikolaou, Georgiou & Kotsasarlidou (2019), The Spanish Journal of Psychology 22
- Criteria — Assessments catalogue ("short, fun, and engaging mini-games") — Criteria Corp, vendor page
- Criteria — Cognify (three games, about 10 minutes plus tutorials) — Criteria Corp, vendor page
- Test Partnership — Gamified Assessment (MindmetriQ): six games, 4–6 minutes each, three configurations — Test Partnership Limited, vendor page
- Equalture — FAQ (session 15–45 minutes, each game a few minutes) — Equalture, vendor page
- Sova Assessment — Early Careers (25 minutes, seven components, gamified modules optional) — Sova Assessment Limited, vendor page
- Sova Immerse — one continuous role simulation in three stages, 15–30 minutes — Sova Assessment Limited, vendor page
- Capsim — Inbox Simulations (15–60 minutes; Hiring & Selection listed as a use case) — Capsim Management Simulations, vendor page
- Owiwi — Product (single narrative "Isles of the Shroud"; no duration found on the page) — Owiwi, vendor page
- Owiwi Soft Skill Manual (technical manual, PDF): norm sample 5,371 on p. 21; construct validity N=938 on p. 17 — Owiwi, vendor technical manual
- The ITC Guidelines on the Security of Tests, Examinations, and Other Assessments (Final Version v1.0, 6 July 2014, ITC-G-TS-20140706) — International Test Commission (2014)
- EU AI Act — implementation timeline — artificialintelligenceact.eu