Сравнение

Игровая оценка персонала: четыре класса инструментов и чем вендоры различаются

Слово «игра» на сайтах вендоров означает как минимум четыре разные вещи: батарею мини-игр по три минуты, одну непрерывную симуляцию, пакет, где основную нагрузку несёт опросник, а игровых модулей два из семи, и обычный самоотчёт в игровом интерфейсе. От класса зависит, что инструмент способен наблюдать, сколько времени он занимает у кандидата и насколько его прохождение поддаётся подготовке. Эта страница разбирает четыре класса, сводит девять вендоров и нас самих в одну таблицу со ссылкой на страницу каждого и прямо называет места, где проигрываем мы. Все числа о чужих продуктах проверены 4 августа 2026 года и взяты из опубликованных вендорами материалов.

Обновлено:

Рядом

ВендорКласс, формат и длительность — по публикациям вендораNeuroFrame
pymetrics (Harver)Класс: батарея мини-игр. Страница вендора заявляет «12+ interactive, gamified experiences» и «25 Minutes to complete». Рецензируемая статья ACM FAccT 2021, написанная совместно исследователями Northeastern и сотрудниками pymetrics, описывает «core set of twelve games» на классических парадигмах (BART, Trust Game, Go/No-Go, digit span, Iowa Gambling Task, Flanker, Tower) и указывает, что модель обучается под конкретного клиента, типично на 50–100 высокорезультативных сотрудниках. Проверено 4 августа 2026 года.ИсточникОдна непрерывная симуляция, 30–60 минут, без батареи мини-игр. Эталон роли построен внешне — 287 профессий из реестра профстандартов × 8 стадий жизненного цикла = 2296 записей, — а не обучен на действующих высокорезультативных сотрудниках заказчика.
Arctic ShoresКласс: батарея коротких интерактивных заданий. На страницах вендора соседствуют две формулировки: маркетинговая «tasks, not questions» и словарная статья «our game-based assessment». Брошюра вендора: «a series of up to eight engaging tasks»; гид для кандидатов: «up to nine tasks»; страница How it works: «know true potential, in 45 minutes». В проверенной нами публичной памятке для кандидатов, выпущенной работодателем, предлагается заложить 15–20 минут, потому что состав заданий настраивает работодатель. Проверено 4 августа 2026 года.ИсточникСессия не конфигурируется под роль: все проходят одну и ту же симуляцию 30–60 минут. Под роль настраивается эталон сравнения, и он опубликован как данные — 2296 записей, каждая с человекочитаемым обоснованием (суммарно 1,07 млн знаков).
HireVueКласс: смешанный. Игровой блок — модуль внутри ассессмент-платформы; вендорский ebook называет пять преднастроенных когнитивных пакетов, три из них — Cognition Short, Standard и Comprehensive, — и указывает, что игры «take under 15 minutes to complete»; длительности каждого пакета в отдельности мы не нашли. Кандидатская страница: «each game takes approximately 3 minutes», рекомендуется выделить 30 минут. Продуктовая страница: игры «each under 20 minutes». Анализ лица и визуальных признаков, по публичному заявлению компании, выведен из продукта (заявление января 2021 года; по данным SHRM применение прекращено в марте 2020 года). Проверено 4 августа 2026 года.ИсточникВидеоинтервью, анализа лица и голоса нет: фиксируются только решения внутри симуляции. Заказчик передаёт обезличенные коды, поэтому ни имени, ни пола, ни возраста до нас не доходит — из этого же следует отсутствие коннекторов к ATS.
Criteria CognifyКласс: батарея мини-игр. Стандартная версия — три игры, «takes just 10 minutes to complete, plus tutorials»; «a six-game version is also available on request». Information Brief (© 2025) сообщает ретестовую надёжность .81 (n = 280) и конвергенцию с собственным тестом вендора RCAT r = .301–.54 примерно при 500 участниках на игру. На продуктовой странице указаны английский (US) по умолчанию и турецкий, для остальных языков предлагается uCognify как language-independent версия. Проверено 4 августа 2026 года.ИсточникРетестовая надёжность выше 0,83, α Кронбаха 0,69–0,77 — диапазон α ниже конвенционального порога 0,80, и мы говорим это на странице, а не в сноске. Клиентский справочник существует только на русском.
SHLКласс: смешанный. Мини-игр в проверенных нами материалах SHL мы не встретили; слова «игры» в этих фактшитах нет. Verify Interactive G+ — адаптивный тест способностей с форматом ответа drag-and-drop: 36 минут, максимум 24 задания (фактшит © 2018). Отдельно — рабочие симуляции в реалистичных интерфейсах: Contact Center Call Simulation, 2 задания, в среднем 15 минут при лимите 20 (© 2020); Automata Pro, 2 задачи в среде IDE, в среднем 46 минут при лимите 60 (© 2020). Проверено 4 августа 2026 года.ИсточникОдна сессия 30–60 минут без адаптивной подачи заданий: сложность растёт по сценарию одинаково для всех, поэтому прохождения двух кандидатов сопоставимы шаг за шагом.
Aon Assessment (бывшая cut-e)Класс: модульная батарея мини-игр. Кандидатская страница вендора указывает gridChallenge — 9 минут, motionChallenge, digitChallenge, gapChallenge и switchChallenge — по 6 минут, плюс геймифицированный ситуационный тест chatAssess — 20 минут. Суммарной фиксированной длительности на проверенной нами странице вендора мы не обнаружили: набор модулей выбирает работодатель. Жалоба, поданная ACLU в Федеральную торговую комиссию США 30 мая 2024 года, касается ассессментов Aon; это позиция заявителя, сведений о решении FTC у нас нет. Проверено 4 августа 2026 года.ИсточникДлительность не конфигурируется: 30–60 минут одним прохождением, без модульной сборки работодателем. Формального bias-аудита и собственного отчёта по adverse impact ratio у нас нет — сказано в заключительном разделе.
Test Partnership MindmetriQКласс: батарея из шести игр — Net the Numbers 4 мин, Number Racer 6, Link Swipe 6, Word Logic 6, Pipe Puzzle 4, Shape Spinner 4 — в трёх конфигурациях примерно на 12, 18 и 35 минут. Вендор публикует корреляции с ICAR: 0,75–0,84 по типам тестов, до 0,91 для вербального и 0,89 для числового рассуждения; размеров выборок и дизайна исследования на этой странице мы не нашли. Проверено 4 августа 2026 года.ИсточникОтдельных вербальных и числовых субтестов нет: восемь параметров читаются из одного сценария. Вербальные и числовые способности мы не покрываем и профильные тесты знаний не заменяем.
EqualtureКласс: батарея мини-игр, собираемая под роль. FAQ вендора: «A full assessment session usually takes between 15 and 45 minutes, depending on the number of games used for a role» и «Each game itself lasts only a few minutes»; общего числа игр в библиотеке на проверенных нами страницах мы не обнаружили. На странице Science указано, что ассессменты разработаны «according to the COTAN Review System», — это заявление вендора о следовании системе ревью; числовых коэффициентов валидности на этой странице мы не нашли. Проверено 4 августа 2026 года.ИсточникЧисло заданий одно и оно опубликовано: одна симуляция на 30–60 минут. Диапазон возникает из темпа самого человека, а не из того, сколько модулей включили.
Sova AssessmentКласс: смешанный. Батарея Early Careers заявлена как 25 минут и семь компонентов, из которых обязательны опросник личности и ситуационный тест, а два геймифицированных модуля помечены как опциональные. Отдельно Sova Immerse описан как одна непрерывная ролевая симуляция из трёх стадий, «15–30 min»; ссылок на валидационные исследования на этой странице мы не обнаружили. Проверено 4 августа 2026 года.ИсточникОпросника самоотчёта в продукте нет вовсе: все восемь параметров выводятся из решений внутри симуляции. Обратная сторона размена: рецензируемой публикации собственных валидационных исследований у нас тоже нет.
NeuroFrameЭто наш продукт, поэтому оценок относительно остальных мы не ставим — проверяемые характеристики в соседней колонке, а места, где мы проигрываем, перечислены в разделе «Когда игровая оценка вообще не нужна».Класс: одна непрерывная стратегическая симуляция, 30–60 минут. Восемь параметров — три когнитивных, пять личностных — читаются из решений, а не из самоотчёта. Процентили относительно выборки сравнения в 14 850 человек на реальных должностях (500+ компаний, 21 отрасль, 21 функция, 8 грейдов). CFI 0,96; α Кронбаха 0,69–0,77; ретестовая надёжность выше 0,83; R² 0,46 и AUC 0,77 против реальных KPI и оценок руководителей на выборке проверки 3 000+. R² 0,46 и AUC 0,77 получены на нашей выборке и по нашим критериям — с коэффициентами других инструментов из таблицы они несопоставимы и сравнению не подлежат. Справочник ролей: 287 профессий × 8 стадий жизненного цикла = 2296 записей, каждая с собственным человекочитаемым обоснованием.

На этой странице каждый продукт называется тем именем, под которым его продаёт правообладатель: pymetrics — продуктовая линия внутри Harver; Arctic Shores — Arctic Shores Limited (Великобритания); HireVue — HireVue, Inc.; Cognify и Emotify — продукты Criteria Corp, перешедшие к ней вместе с Revelian; SHL — SHL Group Limited; Aon Assessment — бывшая cut-e GmbH, подразделение Aon plc; MindmetriQ — продукт Test Partnership Limited; Sova — Sova Assessment Limited; Equalture — Equalture B.V. Все названия и товарные знаки принадлежат их правообладателям и упоминаются номинативно, для указания на сам продукт, без логотипов и фирменного оформления.

Разобрано по одному

  • Одна длинная симуляция или батарея мини-игрДве архитектуры оценки, срез на 4 августа 2026 года: что подтверждает рецензируемая литература, что опровергает и где длинная сессия не нужна.
  • NeuroFrame и pymetrics (Harver)pymetrics (Harver) — «12+» мини-игр и заявленные 25 минут; NeuroFrame — одна симуляция на 30–60 минут. Каждое число со ссылкой, проверено 04.08.2026.
  • NeuroFrame и Arctic ShoresArctic Shores — до девяти коротких заданий, NeuroFrame — одна симуляция на 30–60 минут. Каждый факт о вендоре со ссылкой, проверено 4 августа 2026 года.
  • NeuroFrame и HireVueHireVue: формат, длительность, опубликованная валидность и bias-аудиты игровых ассессментов, каждое число со ссылкой. Проверено 4 августа 2026 года.
  • NeuroFrame и Criteria (Cognify)Cognify — три мини-игры за заявленные 10 минут, NeuroFrame — одна симуляция на 30–60 минут. Каждая цифра со ссылкой, проверено 04.08.2026.
  • NeuroFrame и SHLVerify Interactive G+ — 36 минут, NeuroFrame — одна сессия на 30–60. Каждое число о SHL со ссылкой. Проверено 4 августа 2026 года.
  • NeuroFrame и Aon Assessment (cut-e)Aon Assessment (бывшая cut-e): шесть модулей по 6–20 минут против одной сессии 30–60 минут. Факты со ссылками, проверено 4 августа 2026 года.

Что такое игровая оценка (game-based assessment)

Игровая оценка персонала (game-based assessment, GBA) — это процедура отбора, в которой кандидат не описывает себя в анкете, а выполняет интерактивные задания, а вывод о его качествах строится из записанного поведения: какие решения он принимал, сколько времени на них тратил и как менялся его выбор при росте нагрузки. Единица измерения здесь — действие, а не ответ на вопрос о себе.

Это не то же самое, что геймификация подбора. Баллы, значки и таблица лидеров в карьерном разделе повышают вовлечённость и ничего не измеряют. В игровой оценке механика — носитель задания: она задаёт правила, внутри которых поведение становится сравнимым между людьми. Всё, что идёт дальше — телеметрия, модель перевода поведения в баллы, нормативная выборка — устроено ровно так же, как в любом психометрическом инструменте.

Терминология в категории не устоялась, и для покупателя это практическая проблема. Criteria описывает свои продукты дословно как «short, fun, and engaging mini-games». На страницах Arctic Shores на 4 августа 2026 года соседствуют две формулировки: маркетинговая «tasks, not questions» и словарная статья «our game-based assessment». SHL пишет: «Our immersive assessments upgrade button clicking with “drag-and-drop” and gamified interactions» — а в проверенных нами фактшитах SHL (© 2018–2024) слова «игры» мы не встретили. Три вендора, три словаря, три разные вещи за ними.

Поэтому полезный вопрос звучит не «это игра?», а «какого класса этот инструмент?». Вокруг этого и построена страница: сначала классы, потом бренды.

Четыре класса инструментов игровой оценки

Продукты, которые продаются под словом «игровая оценка», распадаются на четыре класса: батарея коротких мини-игр, одна длинная симуляция, смешанный формат и игрофицированный опросник самоотчёта. Класс определяет сразу три вещи — что инструмент способен наблюдать, сколько времени он занимает у кандидата и насколько отдельное задание поддаётся подготовке заранее.

Батарея мини-игр — это от трёх до двенадцати независимых заданий по одной-шести минут, собираемых под роль: человек заканчивает одну механику и начинает никак не связанную с ней следующую. Одна длинная симуляция — единый непрерывный сценарий, в котором ранние решения меняют поздние условия. Смешанный формат складывает в один поток разнородные компоненты: игры плюс видеоинтервью или опросник плюс ситуационный тест плюс два игровых модуля. Игрофицированный опросник оставляет единицей измерения самоотчёт и меняет только интерфейс.

Граница между третьим и четвёртым классом самая скользкая, и именно на ней происходит большинство ошибок при закупке. Надёжная проверка — не маркетинговое слово, а строка о формате ответа в фактшите. Фактшит SHL Multitasking Ability (© 2018) описывает продукт как split-screen симуляцию на 20 минут с 38 заданиями — и в графе формата вопросов указывает «Multiple Choice» (фактшит © 2018, проверено 4 августа 2026 года).

Класс — это не оценка качества. Ни один из четырёх по имеющимся данным не предсказывает рабочую результативность лучше остальных: систематический обзор 34 работ (Ramos-Villagrasa, Fernández-del-Río, Castro, Frontiers in Psychology, 2022) заключает, что игровые методы не дают достаточных преимуществ, чтобы рекомендовать их вместо конвенциональных, если только организации не важен рост привлекательности процедуры для кандидатов. Выбор класса — это выбор того, что вы сможете наблюдать и во что это обойдётся, а не короткий путь к точности.

Класс 1. Батарея коротких мини-игр

Батарея коротких мини-игр — самый частый формат среди продуктов, которые мы проверили 4 августа 2026 года. По опубликованным вендорами страницам: pymetrics в составе Harver заявляет «12+ interactive, gamified experiences» и «25 Minutes to complete»; стандартная версия Criteria Cognify — три игры, «takes just 10 minutes to complete, plus tutorials», шестиигровая версия доступна по запросу; Test Partnership MindmetriQ — шесть игр по 4–6 минут в конфигурациях примерно 12, 18 и 35 минут; FAQ Equalture: «A full assessment session usually takes between 15 and 45 minutes, depending on the number of games used for a role»; Aon Assessment указывает gridChallenge — 9 минут, а motionChallenge, digitChallenge, gapChallenge и switchChallenge — по 6 минут каждый, при этом набор выбирает работодатель.

Одну вещь этот класс делает действительно хорошо: измеряет изолированные когнитивные функции, у которых есть длинная исследовательская история вне найма. Рецензируемая статья FAccT 2021, написанная совместно исследователями Northeastern и сотрудниками pymetrics, называет двенадцать игр и стоящие за ними парадигмы — Balloon Analogue Risk Task, Trust Game, Go/No-Go, digit span, Iowa Gambling Task, Flanker, Tower. Каждая из них изучалась десятилетиями до того, как её стали применять в отборе, и про каждую известно, на что она реагирует.

Вторая настоящая сила — модульность. Короткую батарею можно пересобрать под роль, не перестраивая инструмент, — поэтому вендоры этого класса, чьи страницы мы проверили 4 августа 2026 года, публикуют диапазон, а не одно число. Короткая сессия дешевле обходится воронке: длительность оценки — один из немногих рычагов, которыми рекрутер управляет напрямую.

Чего класс не может — следует из той же конструкции. Каждое задание замкнуто, и ничто не переносится дальше: решение, принятое на второй минуте, не имеет последствий на девятой. Вокруг механики нет рабочего контекста, а поведение сильно зависит от ситуации — в исследованиях ассессмент-центров вариативность оценок объясняется конкретным упражнением не меньше, чем измеряемой компетенцией (Lievens и соавторы, 2006). Кроме того, батарея наблюдает человека только свежим: длинного отрезка, на котором устойчивость внимания могла бы заметно просесть, в ней просто нет.

Для кандидата это самый необременительный класс: коротко, работает на телефоне, помещается в обеденный перерыв. Для работодателя этот класс проще во внедрении, а вокруг именованных заданий, как показывает раздел о поисковом спросе ниже, существует индустрия подготовки.

Класс 2. Одна длинная симуляция

Одна длинная симуляция — это единый непрерывный сценарий, в котором ранние решения кандидата меняют условия поздних. Среди продуктов, которые мы проверили 4 августа 2026 года, вендора, строящего массовый скрининг на одной непрерывной стратегической симуляции длительностью 30 минут и более, мы не встретили: класс на рынке присутствует, но в основном в более коротких или более узких формах.

Ближайших опубликованных продуктов три. Sova Immerse описан вендором как одна непрерывная ролевая симуляция из трёх стадий — брифинг руководителя, задача, дебрифинг — продолжительностью «15–30 min». CapsimInbox — одна inbox-симуляция: «Typical inbox simulations are completed in just 15-60 minutes», и среди сценариев использования Capsim прямо называет Hiring & Selection. Owiwi — единое нарративное приключение «Isles of the Shroud» из восьми «островов»; длительности мы не обнаружили: полнотекстовый поиск по его 30-страничному техническому руководству не даёт ни одного вхождения слов minute и duration (проверено 4 августа 2026 года), — поэтому формат сопоставим, а длительность нет.

Непрерывный сценарий умеет то, чего не умеет батарея: измерять комплексное решение проблем. Результат в динамических микромирах с отложенными последствиями перекрывается с общими когнитивными способностями примерно на 18% дисперсии (r ≈ .43; мета-анализ 47 исследований, Stadler и соавторы, 2015) — то есть содержит и то, чего классические тесты не улавливают. Длинная сессия к тому же позволяет наблюдать поведение и в свежем, и в утомлённом состоянии: снижение устойчивости внимания с ростом времени на задаче — один из самых воспроизводимых эффектов в когнитивной психологии на групповом уровне. И вовлечённость нарастает по ходу сессии, а не задаётся с первой минуты (Genc et al., 2026).

Чего этот класс не может — заявлять более высокую прогностическую валидность; честное чтение данных даёт обратное. По пересчитанным мета-аналитическим оценкам Sackett, Zhang, Berry и Lievens (2022) рабочие пробы дают .33, а ассессмент-центры .29 — ниже структурированного интервью (.42) и тестов профессиональных знаний (.40). И длинную сессию нельзя продавать как измерение накопленного утомления в качестве индивидуальной характеристики: разностный балл между началом и концом сессии имеет низкую ретестовую надёжность, поэтому его место — в наблюдении, а не в шкале.

Для кандидата этот класс стоит больше времени и внимания и не помещается в пятиминутный промежуток между встречами. Для работодателя его труднее нормировать — один длинный инструмент даёт одну выборку, а не шесть — и его нельзя разобрать на модули, часть которых отключают для младшей роли.

Класс 3. Смешанный формат

Смешанный формат складывает в один поток кандидата разнородные компоненты, и игры в нём — одна составляющая из нескольких, а не сам продукт. Так устроены трое вендоров из нашей таблицы: HireVue, SHL и Sova.

У HireVue игровой блок — модуль внутри ассессмент-платформы. Вендорский ebook описывает пять преднастроенных когнитивных пакетов и называет три из них — Cognition Short, Cognition Standard, Cognition Comprehensive, — а про сами игровые ассессменты пишет, что они «take under 15 minutes to complete»; опубликованной длительности каждого отдельного пакета мы не нашли. Кандидатская страница указывает «примерно 3 минуты» на игру и советует выделить 30 минут; актуальная продуктовая страница говорит, что игры идут «each under 20 minutes». Типовое развёртывание, описанное в собственном whitepaper HireVue по ассессмент-науке, соединяет короткие игры и видеоинтервью в одном потоке.

SHL — показательный пример смешанного портфеля: мини-игр в проверенных нами материалах мы не встретили. Verify Interactive — это классический адаптивный тест способностей, у которого изменён только формат ответа: G+ по фактшиту © 2018 рассчитан на 36 минут и максимум 24 задания. Отдельно и на другом принципе построены рабочие симуляции в реалистичных интерфейсах: Contact Center Call Simulation — 2 задания, в среднем 15 минут при лимите 20 (© 2020); Automata Pro — 2 задачи, в среднем 46 минут при лимите 60, среда IDE (© 2020). В этих документах (© 2018 и © 2020) слова «игры» мы не нашли — проверено 4 августа 2026 года.

Sova показывает, насколько важна пропорция. Батарея Early Careers заявлена как 25 минут и семь компонентов, из которых обязательны опросник личности и ситуационный тест, а два геймифицированных модуля — Gamified Numerical Challenge и Gamified Pattern Challenge — помечены как опциональные (проверено 4 августа 2026 года).

Практическое следствие — один вопрос любому вендору этого класса: какая доля сессии игровая и какой именно компонент даёт балл, который пойдёт в решение. Второе следствие арифметическое: пакеты складываются, и стек из 36-минутного теста способностей плюс 16-минутного опросника — совсем другой опыт кандидата, чем десятиминутная батарея.

Класс 4. Игрофицированный опросник самоотчёта

Игрофицированный опросник самоотчёта оставляет единицей измерения сам опросник и меняет оболочку вокруг него: анимацию, таймеры, сценарную рамку, полосу прогресса. Кандидат по-прежнему рассказывает системе о себе; система не наблюдает, как он что-то решает.

Надёжный способ отличить этот класс от симуляции — графа формата ответа в фактшите вендора, а не прилагательное на продуктовой странице. SHL Multitasking Ability (© 2018) описан как split-screen симуляция на 20 минут с 38 заданиями — при формате вопросов «Multiple Choice». SHL Professional 8.0 (© 2024) — Job-Focused Assessment на 16 минут и до 76 вопросов формата forced-choice, а фактшит Global Skills Assessment (v1.0 от 21 мая 2024) отдельно указывает, что GSA «is used in all 8.0 Job Focused Assessments (JFAs)», и сам GSA — это 15 минут и 76 триплетов forced-choice. SHL называет эти продукты оценкой навыков; в графе формата ответа тех же фактшитов указан forced-choice. Оба факта взяты из документов самого вендора и приведены здесь без интерпретации.

У класса есть настоящие преимущества, и они немаленькие. Опросники дёшевы в администрировании, быстро проходятся, легко объясняются кандидату и профсоюзу, просто локализуются на много языков и опираются на десятилетия исследований конструктов и на большие нормативные выборки. Для многих ролей это ровно правильный размен.

Ограничение у него то же, что было всегда: ответом управляет сам кандидат. Игровая оболочка помогает, но не снимает проблему — в контролируемом эксперименте (N = 171) игровое измерение личностной черты дало значимо меньший эффект намеренного искажения, чем традиционный опросник, но искажение оставалось возможным. «Снижает искажение» и «исключает искажение» — разные утверждения, и подтверждено только первое.

Границу класса тоже стоит назвать: не всё короткое и онлайновое сюда относится. McQuaig Word Survey занимает, по данным вендора, примерно 20 минут; упоминаний игровых механик на проверенной нами странице продукта мы не нашли — вендор описывает его как конвенциональный инструмент (проверено 4 августа 2026 года).

Почему сессии становились короче

Рынок двигался в сторону сокращения сессий, а не удлинения. Criteria сейчас продаёт Cognify как три игры и «just 10 minutes to complete, plus tutorials», шестиигровая версия — по запросу. Вендорский ebook HireVue пишет, что игровые ассессменты «take under 15 minutes to complete», а собственный whitepaper вендора оценивает полную батарею в 6–15 минут. На главной странице Test Partnership — «Complete cognitive profile in 14 mins». Arctic Shores на своей странице How it works заявляет «know true potential, in 45 minutes», при этом в публичной памятке для кандидатов, выпущенной работодателем и проверенной нами 4 августа 2026 года, предлагается заложить 15–20 минут, потому что состав заданий настраивает работодатель.

Причина — экономика воронки, и она не загадочна. Длительность оценки — одна из немногих переменных, которыми команда подбора управляет напрямую, она стоит в самом широком месте воронки, и именно на неё жалуются кандидаты. Вендоры конкурируют по ней открыто: заявления о доходимости встречаются на маркетинговых страницах платформ оценки — например, сайт Traitify (Crosschq) называет 95% completion rate (traitify.com, проверено 4 августа 2026 года). Это заявление самой компании; описания методики и выборки на той же странице мы не нашли.

В размен уходит всё, что становится видно только на длинной дистанции: держится ли качество решений по мере накопления нагрузки, перепланирует ли человек после провала, что он делает на четвёртой подряд трудной минуте. Десятиминутная батарея этого не покажет — не потому, что плохо сделана, а потому, что длинной дистанции в ней нет.

Стоит сказать прямо: сокращение было рациональным ответом на реальную проблему, а не падением стандартов. Опубликованные данные не показывают, что более длинные сессии лучше предсказывают рабочую результативность — по Sackett и соавторам (2022) более «высокофидельные» и более длинные методы стоят ниже структурированного интервью. Длительность сессии — это аргумент о том, что вы наблюдаете и во что это обходится воронке, и вести его надо в этих терминах.

Индустрия подготовки как измеримое свойство формата

Вокруг батарей из именованных мини-игр существует индустрия подготовки, и её размер измерим, а не является предметом мнения. По данным Semrush (база Великобритании), выгрузка 4 августа 2026 года, поисковый спрос на разбор отдельных заданий Arctic Shores составляет около 550 запросов в месяц суммарно — balance 170, order 110, predict 110, lock 90, ticket 70. «Arctic shores practice test free» добавляет 390 в месяц, а весь блок подготовительных запросов по одному этому вендору превышает 1400 в месяц. «Pymetrics games answers» — 110 в месяц по базе США того же инструмента.

Предложение соответствует спросу. В выдаче Google в США по запросу «game based assessment» на 4 августа 2026 года первую органическую позицию мы видели у gameassessmentprep.com — сайта подготовки; выдача персонализирована и меняется, это наблюдение нашей проверки, а не постоянное свойство рынка.

Доказывает это узкую и конкретную вещь: дискретное, именованное, многократно используемое задание можно найти, разобрать и отрепетировать. Это структурное свойство класса, а не дефект конкретного продукта. У механики, у которой есть имя и устойчивый набор правил, есть и тот, кто напишет к ней руководство.

Чего это не доказывает — что подготовка меняет балл, и честный разбор обязан это сказать. Criteria сама сообщает в Information Brief по Cognify (© 2025) о «weak to moderate positive relationship» между числом игровых часов в неделю и результатом в игре Grid Lock и характеризует силу этой связи как минимальную и сопоставимую с эффектом опыта прохождения обычных психометрических тестов. То есть вендор сам сообщает о тренируемости и характеризует эффект как минимальный.

Практическое следствие для работодателя — короткий список вопросов: как часто ротируются задания, какова политика их защиты, публикуется ли оценка эффекта практики и происходит ли балл, идущий в решение, из механики, к которой есть публичный разбор. Следствие для кандидата: подготовка к этому классу существует и она законна. И отдельно — русскоязычный рынок ведёт себя иначе: «как пройти тест при приеме на работу» набирает около 10 запросов в месяц по российской базе того же инструмента (выгрузка 4 августа 2026 года), на порядок меньше англоязычного спроса, поэтому в России острее стоит вопрос доходимости, а не репетиции.

Что известно о валидности игровой оценки

По состоянию на 4 августа 2026 года мета-анализа прогностической валидности игровой оценки относительно рабочей результативности мы не обнаружили. Это честное состояние поля в том виде, в каком нам удалось его установить, и в пределах нашей проверки это касается инструментов из таблицы ниже, включая наш. Систематический обзор 34 работ (Ramos-Villagrasa, Fernández-del-Río, Castro, Frontiers in Psychology, 2022) заключает, что игровые методы не дают достаточных преимуществ, чтобы рекомендовать их вместо конвенциональных методов отбора, если только организация не считает добавленной ценностью рост привлекательности процедуры для кандидатов, — и рекомендует использовать только инструменты, изначально разработанные для отбора и опирающиеся на психологическую теорию.

Установлено более узкое, но всё же полезное. Мета-аналитические работы связывают игровые измерения с конвенциональными: Bipp и соавторы (2024) сообщают скорректированное r = .45 с тестами когнитивных способностей, Fadillah и соавторы (2025) — r = .52 с личностными опросниками. Та же литература показывает, что игровой формат не даёт большего неблагоприятного воздействия, чем конвенциональный, и что кандидаты реагируют на него заметно лучше. Это реальный результат — и именно ради него, по выводу обзора, формат и стоит покупать.

Для сравнения, актуальные мета-аналитические оценки методов отбора вообще даёт работа Sackett, Zhang, Berry и Lievens (2022): структурированное интервью .42, тесты профессиональных знаний .40, рабочие пробы .33, общие когнитивные способности .31, ассессмент-центры .29, ситуационные тесты .26, добросовестность .19. Более ранние значения Schmidt и Hunter (1998) — GMA .51, рабочие пробы .54 — по этому же пересчёту завышены из-за систематической перекоррекции на ограничение выборки и не должны приводиться как текущие.

Вендоры публикуют преимущественно конвергентную валидность — свидетельства того, что игра измеряет примерно то же, что признанный тест. Test Partnership публикует корреляции MindmetriQ с ICAR: по странице вендора на 4 августа 2026 года они составляют 0,75–0,84 по типам тестов и достигают 0,91 для вербального и 0,89 для числового рассуждения. Размеров выборок и дизайна исследования на этой странице мы не нашли. Whitepaper HireVue 2021 года сообщает кросс-валидированный множественный R = .51–.67 против ICAR на моделирующих выборках 364–647, а рецензируемая статья во Frontiers (2023, трое из четырёх авторов аффилированы с HireVue) — r = 0,5 с ICAR и ретестовую надёжность r = 0,68 на 102 участниках. Information Brief Criteria по Cognify сообщает конвергенцию с собственным тестом RCAT на уровне r = .301–.54 примерно при 500 участниках на игру и ретест .81 (n = 280). Презентация Aon 2019 года сообщает r = .71 между gridChallenge и предшественником G.A.M.E. на выборке N = 306, набранной через Mechanical Turk.

Конвергентная валидность отвечает на вопрос «мы измеряем примерно тот же конструкт?». Она не отвечает на вопрос «предсказывает ли это результат в работе?». Это разные вопросы с разным дизайном исследования, и покупателю, сравнивающему вендоров, стоит спрашивать, к какому из двух относится конкретное число — и на какой выборке, в каком году и где опубликовано.

Что изменил EU AI Act со 2 августа 2026 года

Со 2 августа 2026 года применяется основная часть Регламента ЕС об искусственном интеллекте, а системы, применяемые для оценки кандидатов при найме, отнесены к высокорисковым — Annex III, пункт 4(a). Незадолго до этой даты одна вещь изменилась: обязанности для высокорисковых систем Annex III перенесены со 2 августа 2026 года на 2 декабря 2027 года Регламентом (ЕС) 2026/1744, опубликованным в Официальном журнале 24 июля 2026 года. Классификация не сдвинулась — сдвинулся срок исполнения.

Две вещи действуют независимо от этого переноса. Обязанности прозрачности по статье 50 применяются со 2 августа 2026 года. И со 2 февраля 2025 года регламент запрещает системы, выводящие эмоции человека на рабочем месте, — этот запрет перенос не затронул. Запрет сформулирован в регламенте через вывод эмоций человека на рабочем месте, а квалификация конкретного продукта — вопрос его поставщика и надзорного органа; мы такой квалификации ни по одному продукту не даём. Первоисточник приведён ниже.

EU AI Act здесь не единственный инструмент и для кадрового решения может оказаться не главным. Статья 22 GDPR уже по умолчанию запрещает решения, основанные исключительно на автоматизированной обработке и существенно затрагивающие человека, и требует как минимум права на вмешательство человека, на изложение своей позиции и на оспаривание решения. В деле SCHUFA (C-634/21, решение от 7 декабря 2023 года) Суд ЕС указал, что обязанности статьи 22 могут лежать и на поставщике скоринга, если получатель балла сильно на него опирается. В деле Dun & Bradstreet Austria (C-203/22, 27 февраля 2025 года) Суд постановил, что ссылка на коммерческую тайну не освобождает от обязанности дать человеку объяснение логики автоматизированного решения, достаточное для его оспаривания.

В ОАЭ отдельного закона об ИИ в найме нет; связывающая норма — статья 18 федерального закона о защите персональных данных, дающая человеку право возразить против решения, принятого автоматизированной обработкой, включая профилирование. Внутри DIFC действует Regulation 10 (с 1 сентября 2023 года): он требует раскрывать применение автономной системы, документировать механизмы обнаружения смещения и человеческого вмешательства, а при высокорисковой обработке — проходить сертификацию и назначать ответственное лицо.

Во всех этих режимах требование сходится к одним и тем же трём вещам, и ни одна из них не звучит как «не применяйте ИИ»: объяснимость того, как получен вывод, независимая проверка на неравное воздействие и реальный человек, способный вмешаться в решение. Ничто на этой странице не является юридическим заключением; первоисточники приведены ниже, и читать их следует на дату вашего внедрения.

Кто публикует bias-аудиты и что они значат

По закону Нью-Йорка Local Law 144 обязанность заказать и опубликовать bias audit лежит на работодателе или кадровом агентстве, а не на поставщике оценки. Вендор, публикующий аудит, тем самым подаёт добровольный сигнал зрелости, а не исполняет собственную обязанность. Независимость закон определяет жёстко: аудитор, связанный с разработкой инструмента, трудовыми отношениями или финансовым интересом, независимым не считается — внутренняя самопроверка вендора под определение не подходит.

Несколько вендоров этой таблицы публикуют. Harver публикует полный независимый аудит BABL AI от 17 июля 2025 года по платформе soft skills pymetrics: все раскрытые impact ratio лежат в диапазоне от 0,914 до 1,000. Там же указано, что тестирование проводил сам Harver в июне 2025 года, а BABL AI проверял корректность подготовки заявлений; в анализ по полу включены 283 256 кандидатов, а 331 177 исключены из-за отсутствия хотя бы одного демографического признака. Отчёт DCI Consulting Group по HireVue, опубликованный работодателем в августе 2023 года, содержит отдельный раздел по игровому инструменту «Think – Shapedance, Numerosity» с impact ratio 0,86–1,00 (проверено 4 августа 2026 года). По Arctic Shores найденный нами аудит опубликован не вендором, а работодателем-клиентом — FDM Group.

Опубликованные аудиты стоит читать вместе с их собственными ограничениями. Исследование FAccT 2025 «Auditing the Audits» проанализировало 44 опубликованных отчёта, содержащих 116 аудитов, за период с июля 2023 по начало ноября 2024 года — это примерно 2% компаний Fortune 500; в 53% опубликованных аудитов есть хотя бы один impact ratio ниже 0,8, а 83% отчётов признают пропуски демографических данных. Те же авторы зафиксировали повторяющиеся идентичные результаты в разных отчётах и прямо указали, что причину установить не смогли, отметив как возможное объяснение разрешённое законом объединение данных нескольких работодателей у одного аудитора.

Само правило четырёх пятых сертификатом не является. По Uniform Guidelines 1978 года показатель выше 0,8, как правило, не рассматривается как свидетельство неравного воздействия, но меньшие разрывы всё равно могут им быть, если они статистически и практически значимы. «Прошёл аудит» и «не имеет неравного воздействия» — разные утверждения.

Для покупателя это превращается в четыре конкретных вопроса: кто проводил аудит и что дисквалифицирует его как независимого, какой период и какую выборку он покрывает, сколько кандидатов исключено из-за отсутствующей демографии и назван ли в отчёте поимённо тот модуль, который реально участвует в вашем решении. Аудит, не называющий конкретный инструмент, ничего не говорит о конкретном инструменте.

Девять вопросов, которые различают классы

Маркетинговый словарь в этой категории классы не различает — различает короткий список фактических вопросов. На каждый из них можно ответить по фактшиту или продуктовой странице, и вендор, не готовый ответить на какой-то из них, тем самым уже сообщил вам полезное.

О формате: (1) Сколько отдельных заданий и названы ли они? (2) Каков формат ответа в каждом — действие внутри сценария или выбор из вариантов? (3) Меняют ли ранние решения условия поздних или каждое задание замкнуто? (4) Какова суммарная длительность как диапазон и чем определяется, в какую точку диапазона попадёт конкретный кандидат?

О доказательствах: (5) Какие из опубликованных чисел — конвергентная валидность против другого теста, а какие — критериальная против рабочих исходов? (6) Каков размер выборки и год, и где это опубликовано? (7) Что представляет собой нормативная база — её размер, состав и является ли она общей нормой или моделью, обученной на действующих высокорезультативных сотрудниках этого же работодателя.

Об управлении: (8) Какой модуль даёт балл, который входит в решение, и назван ли этот модуль поимённо хоть в одном опубликованном bias-аудите? (9) Какие персональные данные получает вендор и какое объяснение можно дать кандидату, если он оспорит исход, — в форме, удовлетворяющей статье 22 GDPR, а с декабря 2027 года и высокорисковому режиму EU AI Act.

Ответы размещают продукт в одном из четырёх классов примерно за десять минут и заодно вскрывают два самых частых несовпадения: батарею, купленную в уверенности, что она наблюдает устойчивость результата, и самоотчёт, купленный в уверенности, что он наблюдает поведение.

Где на этой карте NeuroFrame

NeuroFrame относится ко второму классу: одна непрерывная стратегическая симуляция длительностью 30–60 минут, из которой читаются восемь параметров — три когнитивных (ментальная эффективность, обучаемость, мониторинг прогресса) и пять личностных (открытость новому, аппетит к риску, настойчивость, командность, сознательность). Баллы — процентили относительно выборки сравнения в 14 850 человек на реальных должностях из 500+ компаний, 21 отрасли, 21 функционального направления и 8 грейдов. Батареи мини-игр и опросника самоотчёта в продукте нет.

Эталон роли построен внешне, а не на сотрудниках заказчика. Справочник содержит 287 профессий из реестра профстандартов Минтруда по 34 функциональным областям, перекрещённых с 8 стадиями жизненного цикла организации по Адизесу, — 2296 записей. Следствие практическое: метод работает с первого дня, без требования иметь на роли десятки действующих сотрудников, и структурно не кодирует существующий состав персонала. Эти же данные показывают, зачем нужна стадия: у 99% из 287 профессий требования на стадиях «Младенчество» и «Бюрократия» перекрываются меньше чем наполовину при медианном перекрытии диапазонов 0,40, а из 153 полных непересечений между крайними стадиями 152 приходятся на аппетит к риску.

Каждая из 2296 ячеек несёт собственное человекочитаемое обоснование — 2296 уникальных текстов, 1,07 млн знаков, в среднем 464 знака на ячейку, и 32% из них прямо называют сработавшее правило. В 303 ячейках из 2296 (13%) эталон допускает высокий аппетит к риску при низкой нижней границе мышления или мониторинга — так метод получает возможность сказать «подходит по всем параметрам и при этом требует внимания», чего суммарный процент соответствия не может выразить в принципе.

Обезличенность здесь архитектурная, а не строчка в комплаенсе. Заказчик получает коды и распределяет их внутри своего контура; NeuroFrame не получает ни имени, ни пола, ни возраста. Модель, которая никогда не видела защищённый признак, не может использовать его напрямую. Это закрывает прямое использование, но не гарантирует отсутствия косвенных эффектов — формального bias-аудита у нас нет, и мы говорим об этом в заключительном разделе. Там же названа и обратная сторона: по этой же причине у нас нет коннекторов к ATS.

Психометрика — вместе с оговорками: CFI 0,96 для конфирматорной модели из двух доменов, α Кронбаха 0,69–0,77, ретестовая надёжность выше 0,83, R² 0,46 при AUC 0,77 против реальных KPI и оценок руководителей на выборке проверки 3 000+. Два из этих чисел стоит читать внимательно. Диапазон α ниже конвенционального порога 0,80 — мы говорим об этом в заключительном разделе, а не в сноске. И собственный R² получен на нашей выборке и по нашим критериям: он несопоставим с мета-аналитическими коэффициентами других инструментов, и в одну строку с ними мы его не ставим.

Раскрытие конфликта интересов

Это сравнение опубликовано NeuroFrame — то есть заинтересованной стороной. Поэтому каждый факт о чужом продукте снабжён ссылкой на первоисточник, а оценок этот раздел не ставит.

Это ограничение сформировало всю страницу. На ней нет ни одного оценочного прилагательного о чужом продукте: ни «слабый», ни «поверхностный», ни «низкая валидность». Нет рейтинга, нет звёзд и нет итогового вердикта. Каждое число о чужом продукте стоит рядом с документом самого вендора и датой нашей проверки — 4 августа 2026 года. Там, где наш поиск чего-то не нашёл, мы пишем, что не нашёл наш поиск: это утверждение о результате проверки, а не о том, чего не существует.

Трёх вещей мы сознательно не делаем. Мы не публикуем цены конкурентов по данным сторонних закупочных каталогов: такие цифры устаревают и расходятся с условиями самого вендора. Мы не описываем ни одного вендора как дискриминирующего, необъективного или нарушающего требования: там, где жалобы поданы регуляторам, мы указываем, что жалоба подана и что сведений о решении регулятора у нас нет. И мы не размечаем чужие продукты как Review, AggregateRating или Product.

Страницу можно проверить и против нас самих. Каждое утверждение о вендоре здесь сопровождается ссылкой на первоисточник и датой нашей проверки — 4 августа 2026 года, а каждое число про NeuroFrame берётся из единственного внутреннего источника истины, а не из маркетингового черновика. Если вы найдёте утверждение, которое устарело или которое мы поняли неверно, напишите нам: поправка с датой ценнее для этой страницы, чем исходная фраза.

Когда игровая оценка вообще не нужна — и когда не нужны мы

Игровая оценка не нужна всякий раз, когда решение упирается в проверяемый навык. Если вопрос в том, напишет ли человек код, закроет ли отчётность и говорит ли он на языке, — нужен тест профессиональных знаний или рабочая проба: по Sackett и соавторам (2022) это .40 и .33, и они отвечают ровно на заданный вопрос. Поведенческие инструменты, включая наш, по своей конструкции не проверяют, знает ли человек синтаксис или стандарт.

Она не нужна и при малом потоке. Если вы нанимаете на роль пятерых в год, структурированное интервью — .42, самый высокий коэффициент в этом списке — обойдётся дешевле, пройдёт быстрее и защищается легче, чем внедрение любой платформы оценки. Платформы отбивают свою стоимость в широкой части воронки, где число кандидатов делает единообразие тем, за что стоит платить.

И она не нужна там, где кандидат не может пройти её на равных. Любой формат в реальном времени с таймером ставит в невыгодное положение тех, кому нужны адаптации, которых он не предусматривает. Если вы не можете дать таким кандидатам альтернативный маршрут, не ставьте оценку в качестве фильтра.

Где не подходим конкретно мы — без смягчений. У нас нет ни одной рецензируемой публикации собственных валидационных исследований. У нас нет формального bias-аудита и отчёта по adverse impact ratio — и пока их нет, мы не заявляем нулевой предвзятости. Внутренняя согласованность 0,69–0,77 — ниже конвенционального порога 0,80. Выборка сравнения 14 850 человек — меньше, чем у инструментов с сорокалетней историей. Комплаенс-контур российский: 152-ФЗ закрыт архитектурно, потому что персональных данных мы не получаем вовсе, но пакета по GDPR, EU AI Act и NYC Local Law 144 у нас пока нет. Коннекторов к ATS нет — это прямое следствие схемы с обезличенными кодами. Мы измеряем одним заданием, поэтому не покрываем вербальные и числовые способности и не заменяем профильные тесты знаний. Политика адаптаций для кандидатов с ограничениями пока не оформлена. 83% записей справочника — роли уровня «специалист», топ-менеджмент покрыт девятью профессиями. А клиентский справочник существует только на русском.

Если что-то из этого для вашего случая дисквалифицирующе — оно должно нас дисквалифицировать, и мы предпочитаем сказать это до пилота, а не после. Если кто-то из вендоров таблицы выше подходит под ваши ограничения лучше, ссылки стоят рядом и ведут на их собственные страницы, а не на наши.

Вопросы

Что такое game-based assessment простыми словами?
Это отбор, в котором кандидат не отвечает на вопросы о себе, а выполняет интерактивные задания, а выводы строятся из записанного поведения: какие решения он принимал, сколько на них тратил времени и как менялся выбор при росте нагрузки. От геймификации подбора это отличается тем, что механика здесь — носитель задания, а не украшение: она задаёт правила, внутри которых поведение становится сравнимым между людьми.
Чем игровая оценка отличается от геймифицированного опросника?
Единицей измерения. В игровой оценке измеряется действие внутри задачи, в игрофицированном опроснике — по-прежнему ответ человека о себе, просто в красивой оболочке. Проверяется это не по маркетинговому слову, а по графе формата ответа в фактшите: например, фактшит SHL Multitasking Ability (© 2018) описывает продукт как split-screen симуляцию на 20 минут, а в графе формата вопросов указывает «Multiple Choice».
Можно ли натренировать прохождение игровой оценки?
Вокруг батарей именованных мини-игр существует измеримая индустрия подготовки: разбор отдельных заданий Arctic Shores набирает около 550 запросов в месяц в Великобритании, «arctic shores practice test free» — 390, «pymetrics games answers» — 110 в месяц в США (по данным Semrush, выгрузка 4 августа 2026 года). Это доказывает, что дискретное именованное задание можно найти и разобрать. Что подготовка меняет балл — отдельный вопрос: сама Criteria сообщает о «weak to moderate positive relationship» между игровыми часами и результатом в Grid Lock и называет эффект минимальным.
Сколько времени занимает игровая оценка?
По опубликованным вендорами данным на 4 августа 2026 года: Criteria Cognify — 10 минут плюс туториалы; игровые ассессменты HireVue — «under 15 minutes» по вендорскому ebook; Test Partnership MindmetriQ — около 12, 18 или 35 минут; pymetrics в составе Harver — 25 минут; Equalture — 15–45 минут; Sova Early Careers — 25 минут; Arctic Shores — «know true potential, in 45 minutes» по странице вендора, при 15–20 минутах в памятке для кандидатов, выпущенной работодателем. NeuroFrame — 30–60 минут одним прохождением.
Игровая оценка точнее обычных тестов и опросников?
Нет — по имеющимся на 2026 год данным. Систематический обзор 34 работ (Ramos-Villagrasa и соавторы, 2022) заключает, что игровые методы не дают достаточных преимуществ, чтобы рекомендовать их вместо конвенциональных, если только организации не важен рост привлекательности процедуры для кандидатов. Мета-анализа прогностической валидности игровой оценки относительно рабочей результативности мы на 4 августа 2026 года не обнаружили. То, что подтверждено: игровой формат не даёт большего неблагоприятного воздействия и заметно улучшает реакцию кандидатов.
Что изменил EU AI Act со 2 августа 2026 года?
Со 2 августа 2026 года применяется основная часть регламента, а системы для оценки кандидатов при найме отнесены к высокорисковым (Annex III, п. 4(a)). При этом обязанности для высокорисковых систем перенесены на 2 декабря 2027 года Регламентом (ЕС) 2026/1744 от 8 июля 2026 года, опубликованным в Официальном журнале 24 июля 2026 года. Независимо от переноса действуют обязанности прозрачности по статье 50 (со 2 августа 2026) и запрет систем, выводящих эмоции человека на рабочем месте (со 2 февраля 2025). Это описание требования, а не юридическое заключение.
Обязан ли вендор публиковать bias audit?
По NYC Local Law 144 обязанность заказать и опубликовать аудит лежит на работодателе или кадровом агентстве, а не на вендоре. Публикация аудита вендором — добровольный сигнал зрелости. Закон при этом жёстко определяет независимость: аудитор, связанный с разработкой инструмента, трудовыми отношениями или финансовым интересом, независимым не считается.
Заменяет ли игровая оценка интервью?
Нет. По актуальным мета-аналитическим оценкам (Sackett и соавторы, 2022) структурированное интервью остаётся методом с наивысшим коэффициентом — .42, выше тестов знаний (.40), рабочих проб (.33) и ассессмент-центров (.29). Разумная роль игровой оценки — единообразный и сопоставимый срез в широкой части воронки, после которого интервью проводится по конкретным наблюдениям, а не с нуля.
Кто из вендоров к какому классу относится?
По опубликованным вендорами данным на 4 августа 2026 года: батарея мини-игр — pymetrics (Harver), Criteria Cognify, Test Partnership MindmetriQ, Equalture, линейка Challenge у Aon Assessment, а также Arctic Shores, который называет свои задания tasks; смешанный формат — HireVue, SHL и Sova; одна непрерывная симуляция — Sova Immerse (15–30 минут), CapsimInbox (15–60 минут) и Owiwi (длительности мы в открытых материалах вендора не нашли). Полная таблица со ссылками — выше на этой странице.

Источники

Каждая ссылка открыта и проверена на дату, указанную выше.

  1. Harver — Gamified Assessments (pymetrics)Harver
  2. Arctic Shores — How it worksArctic Shores Limited
  3. Arctic Shores — Glossary: game-based assessmentsArctic Shores Limited
  4. HireVue — Game-Based AssessmentsHireVue, Inc.
  5. HireVue — How to prepare for your HireVue assessmentHireVue, Inc.
  6. HireVue — How Game-Based Assessments Uncover Top Talent (ebook): five pre-built cognitive packages incl. Cognition Short / Standard / Comprehensive; "take under 15 minutes to complete"; 3 minutes per gameHireVue, Inc.
  7. HireVue — The Next Generation of Assessments whitepaper (October 2021): a complete game-based battery "takes only 6-15 minutes to complete"HireVue, Inc.
  8. Test Partnership — home page ("Complete cognitive profile in 14 mins")Test Partnership Limited
  9. Criteria — CognifyCriteria Corp
  10. Criteria — Cognify Information Brief (© 2025)Criteria Corp
  11. Criteria — Assessments catalogue ("short, fun, and engaging mini-games")Criteria Corp
  12. SHL — Verify Interactive G+ factsheet (© 2018)SHL Group Limited
  13. SHL — Multitasking Ability factsheet (© 2018): 20 minutes, 38 questions, Question Format "Multiple Choice"SHL Group Limited
  14. SHL — Professional 8.0 Job-Focused Assessment factsheet (© 2024): 16 minutes, max 76 questions, Question Format "Forced-Choice"SHL Group Limited
  15. SHL — Global Skills Assessment factsheet (v1.0, 21 May 2024): 15 minutes, 76 triplets, Forced Choice, "used in all 8.0 Job Focused Assessments (JFAs)"SHL Group Limited
  16. SHL — Contact Center Call Simulation factsheet (© 2020): 2 questions, 15 minutes average, 20 minutes allowedSHL Group Limited
  17. SHL — Automata Pro factsheet (© 2020): 2 questions, 46 minutes average, 60 minutes allowed, IDE simulationSHL Group Limited
  18. SHL — Cognitive Assessments ("Our immersive assessments upgrade button clicking with 'drag-and-drop' and gamified interactions")SHL Group Limited
  19. Aon — Prepare for your online assessment (Challenge tests, chatAssess)Aon plc
  20. Siemsen, smartPredict — Development Insights and Study Results of Aon's Gamified Assessment Series (GBA Workshop, Minneapolis, August 2019): G.A.M.E./gridChallenge equivalence r = .71, 306 participants with usable data, MTurk sampleAon's Assessment Solutions / GBA Workshop
  21. Test Partnership — Gamified Assessment (MindmetriQ)Test Partnership Limited
  22. Equalture — FAQ (session length, games per role)Equalture
  23. Equalture — Science (COTAN Review System statement)Equalture
  24. Sova Assessment — Early Careers (25 minutes, seven components)Sova Assessment Limited
  25. Sova Immerse — 15–30 min role simulation in three stagesSova Assessment Limited
  26. CapsimInbox — Inbox Simulations (15–60 minutes; Hiring & Selection)Capsim Management Simulations
  27. Owiwi — Product ("Isles of the Shroud" narrative, eight islands)Owiwi
  28. Owiwi — Soft Skill technical manual (norm sample 5,371; no duration found in the manual)Owiwi
  29. McQuaig Word Survey — approximately 20 minutes, no game mechanicsThe McQuaig Institute
  30. Wilson et al., Building and Auditing Fair Algorithms (ACM FAccT 2021) — twelve games, per-client modelsACM FAccT 2021
  31. Ramos-Villagrasa, Fernández-del-Río & Castro — Game-related assessments for personnel selection: a systematic review (Frontiers in Psychology, 2022)Frontiers in Psychology / PMC
  32. Frontiers in Psychology (2023) — HireVue game-based cognitive assessment: convergent validity r = 0.5 with ICAR, test–retest r = 0.68Frontiers in Psychology / PMC
  33. HireVue's Assessment Science whitepaper (October 2021) — Multiple R .51–.67 against ICARHireVue, Inc.
  34. SHRM — HireVue discontinues facial analysis screening (announced January 2021; feature discontinued March 2020)SHRM
  35. Criteria Corp — press release on the acquisition of Revelian (game-based assessments, Emotify)Criteria Corp
  36. Southeastern — Arctic Shores test information sheet for candidates ("set aside anywhere between 15-20 minutes"; time varies with the number of tasks)Southeastern (Go-Ahead)
  37. Bipp, Wee, Walczok & Hansal (2024) — The Relationship Between Game-Related Assessment and Traditional Measures of Cognitive Ability: A Meta-Analysis (observed r = .30, corrected r = .45), Journal of Intelligence 12(12), 129Journal of Intelligence / PMC
  38. Fadillah, Hidayat & Santoso (2025) — Convergent Validity of Game-Based Assessment: A Meta-Analysis (r = .516 against self-report personality measures; 18 studies), International Journal of Serious Games 12(4)International Journal of Serious Games
  39. Stadler, Becker, Gödker, Leutner & Greiff (2015) — Complex problem solving and intelligence: A meta-analysis (47 studies, average effect size .43), Intelligence 53, 92–101Intelligence (Elsevier)
  40. Sackett, Zhang, Berry & Lievens (2022) — Revisiting meta-analytic estimates of validity in personnel selectionJournal of Applied Psychology 107(11), 2040–2068
  41. Sackett et al. (2023) — follow-up on revised validity estimatesIndustrial and Organizational Psychology
  42. Vigilance decrement and time on task — reviewPMC
  43. Genc et al. (2026) — continuous measurement of flow during a gaming sessionPsychophysiology
  44. Controlled experiment (N = 171) — gamified measure shows smaller deliberate-distortion effect than a conventional questionnaireJournal of Business and Psychology
  45. Assessment centre research — exercise variance versus dimension variancePubMed
  46. Regulation (EU) 2026/1744 — postponement of AI Act high-risk obligations to 2 December 2027 (OJ, 24 July 2026)EUR-Lex
  47. EU AI Act — Annex III, point 4(a): employment and worker management as high-riskartificialintelligenceact.eu
  48. Prohibition on emotion recognition in the workplace under the EU AI Act (in force 2 February 2025)Future of Privacy Forum
  49. GDPR Article 22 — automated individual decision-making, including profilinggdpr-info.eu
  50. CJEU SCHUFA (C-634/21, 7 December 2023) — automated decision-making rulings, key takeawaysIAPP
  51. CJEU Dun & Bradstreet Austria (C-203/22, 27 February 2025) — trade secrecy does not bar explanationCourt of Justice of the European Union
  52. NYC DCWP final rules on Automated Employment Decision Tools (Local Law 144)NYC Department of Consumer and Worker Protection
  53. BABL AI — pymetrics Soft Skills Platform 2025 Bias Audit (17 July 2025)BABL AI Inc. / Harver
  54. DCI Consulting — HireVue bias audit summary (July 2023), including "Think – Shapedance, Numerosity"DCI Consulting Group
  55. FDM Group — NYC applicant bias audit (Arctic Shores assessment, published by the employer)FDM Group
  56. Gerchick et al., Auditing the Audits (ACM FAccT 2025) — 44 reports, 116 audits, 53% with an impact ratio below 0.8ACM FAccT 2025
  57. Uniform Guidelines on Employee Selection Procedures, 29 CFR 1607.4 — the four-fifths ruleCornell Legal Information Institute
  58. AI in the UAE — regulatory landscape; Article 18 of the federal PDPLLatham & Watkins
  59. DIFC Regulation 10 — personal data processed through autonomous and semi-autonomous systemsMayer Brown
  60. ACLU complaint to the US Federal Trade Commission regarding Aon Consulting, Inc. (filed 30 May 2024)American Civil Liberties Union
  61. Traitify (Crosschq) — company completion-rate claim: "a 95% completion rate"Traitify / Crosschq