Сравнение

NeuroFrame и pymetrics (Harver)

pymetrics — это батарея коротких мини-игр, NeuroFrame — одна непрерывная симуляция. Почти все остальные различия вытекают из этого одного. Здесь собрано то, что публикует каждая сторона: рядом с каждым числом ссылка и дата проверки. Страницу публикует NeuroFrame — то есть заинтересованная сторона, — поэтому мы старались обойтись без оценок чужого продукта: только факты с источниками и отдельный раздел о том, где слабее мы. Если вы найдёте на странице оценочную формулировку — напишите, мы её уберём.

Обновлено:

Рядом

АтрибутpymetricsNeuroFrame
Класс инструментаБатарея коротких мини-игр; вендор называет их «12+ interactive, gamified experiences» (браузер и мобильное приложение — по статье FAccT 2021, состояние продукта на лето 2020 года)ИсточникОдна непрерывная стратегическая симуляция — одно задание, а не батарея
Число заданий«12+» на странице вендора, точное текущее число там не указано; статья ACM FAccT 2021 описывает «a core set of twelve games» (состояние продукта на лето 2020 года)ИсточникОдна сессия; 8 измеряемых параметров — 3 когнитивных и 5 личностных
Длительность«25 Minutes to complete» по заявлению вендора. Вендорской документации с поминутной раскладкой мы не нашли; цифра «одна–три минуты на игру» происходит с коммерческого prep-сайта strategycase.comИсточник30–60 минут в одной непрерывной сессии
Модель нормированияМодель обучается под конкретного клиента: «in group» — типично 50–100 высокорезультативных сотрудников этого клиента, проверка на adverse impact на отдельной bias-выборке, типично превышающей 10 000 пользователей (состояние на лето 2020 года)ИсточникВнешний справочник: 287 профессий × 8 стадий жизненного цикла = 2 296 эталонных ячеек, построенных из реестра профстандартов Минтруда и модели Адизеса; выборка сравнения — 14 850 человек
Опубликованный bias-аудит (NYC LL 144)BABL AI Inc., отчёт от 17 июля 2025 года, PASS по disparate impact, governance и risk assessment; среди раскрытых групп impact ratio от 0,914 до 1,000, по трём малочисленным группам — N/A. В отчёте указано «Testing conducted by: Harver»ИсточникНет. На 4 августа 2026 года формального bias-аудита и отчёта по adverse impact ratio у нас нет
Что публикуется о валидностиРецензируемая статья ACM FAccT 2021 о механике справедливости, написанная в соавторстве с четырьмя сотрудниками компании и оплаченная вендором; в разделе Out of Scope сказано, что аудиторы не исследовали, измеряют ли игры человеческие способности и связаны ли они с результативностью на работе. На продуктовой странице — собственные показатели вендора: 98% completion rate, сокращение времени найма на 59%ИсточникПсихометрика опубликована на сайте: CFI 0,96, α Кронбаха 0,69–0,77, ретест выше 0,83, R² 0,46 и AUC 0,77 на выборке проверки 3 000+, точность ML 72–89%. Собственных рецензируемых публикаций нет
Языки«Translated into over 20 languages», со встроенными адаптациями для дальтонизма и дислексии — по статье FAccT 2021 (данные 2020–2021 годов). В пресс-релизе о поглощении от 11 августа 2022 года встречается формулировка «compliant in 100+ countries, 30 languages»; разбивки по продуктам релиз не даёт, поэтому мы приводим её как заявление уровня релиза, а не как показатель pymetrics. Более свежих публичных данных о списке языков мы на 4 августа 2026 года не нашлиИсточникИнтерфейс и отчёт — русский и английский; клиентский справочник профилей существует только на русском
Присутствие в MENA и арабский языкРегионального разреза по MENA мы в публичных материалах вендора на 4 августа 2026 года не нашли; в пресс-релизе о поглощении (11.08.2022) встречается формулировка «compliant in 100+ countries, 30 languages» — без перечня стран и языков и без разбивки по продуктам. Наличие или отсутствие арабской локализации подтвердить не удалосьИсточникКомпания базируется в ОАЭ и работает с клиентами региона; арабской локализации продукта на сегодня нет
Обращение с демографическими даннымиПо аудиту FAccT 2021 демографические данные использовались только для оценки и не входили в признаки модели; вендор сообщил аудиторам, что более 75% игроков заполняют опциональную демографическую анкету, — это ретранслированное заявление вендора, которое аудиторы отнесли к неаудируемымИсточникЗаказчик получает обезличенные коды и сопоставляет их сам; имя, пол и возраст в NeuroFrame не поступают, поэтому защищённые признаки не подаются модели на вход — это архитектурное ограничение, а не гарантия отсутствия смещения. Цена этой схемы — отсутствие коннекторов к ATS
ВладелецHarver. Поглощение объявлено 11 августа 2022 года, финансовые условия не раскрывались; имя pymetrics по-прежнему используется для продуктовой линииИсточникNeuroFrame; смены владельца не было

pymetrics — не самостоятельная компания, а продуктовая линия Harver. Корректные написания в тексте: «pymetrics (Harver)», «Harver», «продуктовая линия pymetrics». Недопустимо: «компания pymetrics» в настоящем времени, «Pymetrics Inc.» как действующий вендор. pymetrics и Harver — товарные знаки своих правообладателей, названные здесь номинативно, для указания на сам продукт, без логотипов и фирменного оформления.

Что такое pymetrics сегодня

По состоянию на 4 августа 2026 года pymetrics не является самостоятельной компанией. Harver объявил о поглощении 11 августа 2022 года, финансовые условия сделки не раскрывались (harver.com/press/harver-acquires-pymetrics/). Имя при этом продолжает использоваться: в материалах самого Harver продуктовая линия называется «pymetrics for Game-Based Assessments», а продуктовая страница harver.com/gamified-assessments/ до сих пор носит бренд pymetrics.

В том же пресс-релизе о сделке Harver заявляет о более чем 100 млн обработанных кандидатов и более чем 1300 клиентах и называет AB InBev, Booking.com, Peloton, Valvoline и McDonald's. Это показатели Harver в целом. Ни одна строка релиза не привязывает их к игровому ассессменту, и отдельной опубликованной цифры по объёмам pymetrics мы не нашли.

После сделки продукт развивался. Пресс-релиз Harver от 1 ноября 2022 года описывает настраиваемые компетенции (capabilities) и ценности (values) внутри ассессментов pymetrics (harver.com/press/pymetrics-customizable-capabilities/). Одну деталь стоит зафиксировать именно как факт, а не как тенденцию: аудит этой линейки 2025 года, который мы прочитали целиком, озаглавлен «Harver's Soft Skills Platform», а аудит той же линейки 2023 года записан в краудсорсинговом реестре аудитов Local Law 144, который ведёт ACLU, как «pymetrics inc. (Harver) Soft Skills Platform» — с датой 29 июня 2023 года и с BNP Paribas в качестве работодателя, применявшего инструмент. Размещённая работодателем копия отчёта 2023 года, ссылка на которую у нас есть (Paramount), на 4 августа 2026 года отдаёт HTTP 403, поэтому название приводится по реестру, а не по самому документу. Выводов о судьбе бренда мы из этого не делаем: продуктовая страница его сохраняет.

21 апреля 2026 года Harver объявил о запуске AI PREVAIL — неигрового ассессмента готовности к работе с ИИ по четырём измерениям (Business Wire, 21.04.2026). В релизе заявлено «Trusted by more than 1000 enterprise organizations globally», снижение 90-дневной текучести на 25%, ускорение найма до 50% и снижение общей текучести более чем на 60%; все эти показатели релиз относит к платформе Harver целиком, слово pymetrics в нём не встречается. О продуктовых приоритетах вендора мы из этого никаких выводов не делаем.

О том, где кандидат встречается с продуктом, говорит косвенный признак: разборы игр публикуют университетские карьерные службы — например, страница на сайте Oxford University Careers Service от 24 ноября 2021 года. Написана она сотрудником JobTestPrep, коммерческой компании по подготовке к тестам, то есть это гостевой материал prep-вендора на университетском сайте, а не институциональная экспертиза университета.

Как устроена оценка: формат, число заданий, длительность

На продуктовой странице вендора дословно заявлено «12+ interactive, gamified experiences» и «25 Minutes to complete» (harver.com/gamified-assessments/, проверено 4 августа 2026 года). Точное текущее число игр там не конкретизируется — стоит «12+».

Рецензируемая статья ACM FAccT 2021, написанная с привилегированным доступом к системе, описывает «a core set of twelve games that are derived from peer-reviewed psychological studies». Там же сказано, что игры работают в браузере и мобильном приложении, «translated into over 20 languages», имеют встроенные адаптации для игроков с дальтонизмом и дислексией, а база геймплея превышала 2 млн пользователей. Эти данные описывают продукт по состоянию на лето 2020 года.

К этой статье нужна одна оговорка при каждом цитировании. Четверо из восьми её авторов — сотрудники pymetrics, включая тогдашнего CEO Фриду Полли, а сам аудит был оплачен компанией через грант Northeastern University на 104 465 долларов (MIT Technology Review, 11 февраля 2021 года). Мы читаем её как совместную публикацию аудиторов и вендора, а не как независимое исследование, — основание указано выше.

Двенадцать игр названы публично: Balloon, Tower, Money Exchange #1 и #2, Keypress, Hard or Easy, Digits Memory, Stop, Arrows, Lengths, Cards и Faces (Oxford University Careers Service, 24 ноября 2021 года — тот самый материал prep-вендора). Часто цитируемая длительность «одна–три минуты на игру» происходит из strategycase.com, коммерческого ресурса по подготовке к консалтинговым отборам; поминутной раскладки в собственной документации Harver мы не нашли. На странице вендора перечислены девять атрибутов верхнего уровня: Effort, Risk Tolerance, Decision making, Attention, Focus, Learning, Fairness, Generosity, Emotion.

Архитектура подсчёта по описанию из статьи FAccT: модель обучается под каждого клиента. «in group» — типично 50–100 высокорезультативных сотрудников этого клиента; поиск честного набора признаков ведётся по impact ratio на 70-м перцентиле, финальные модели тестируются на 50-м и 70-м; проверка на adverse impact идёт на отдельной bias-выборке, типично превышающей 10 000 пользователей. В аудированном коде использовалась проприетарная реализация SVM по 64 признакам, а на выходе — тиры Not Recommended, Recommended, Highly Recommended.

Что каждая сторона публикует о валидности и надёжности

Ниже — то, что нам удалось найти опубликованным, по двум темам отдельно: механика справедливости и прогностическая валидность. По механике справедливости мы нашли статью FAccT 2021, написанную с доступом к исходному коду, и аудиты BABL AI, о которых ниже. На продуктовой странице вендор публикует собственные показатели — 98% completion rate, сокращение времени найма на 59% и строку «Validated for fairness across gender, ethnicity, and socioeconomic status». Это цифры самой компании; независимого подтверждения им в открытых источниках мы не нашли.

Аудит FAccT прямо перечисляет, чего он не проверял. В разделе Out of Scope дословно: аудиторы «did not investigate the ability of pymetrics' games to measure human capabilities, whether those capabilities map to job performance, or whether other assessment methods would be superior». Это граница мандата аудита, а не вывод о том, что такой валидности нет.

Результат нашего собственного поиска — именно как результат поиска: по состоянию на 4 августа 2026 года нам не удалось обнаружить в открытом доступе рецензируемых публикаций о прогностической валидности pymetrics относительно результативности на работе, равно как и публично размещённого технического руководства. Это утверждение о том, что нашёл наш поиск, а не о том, что существует. Сама статья FAccT упоминает внутренние исследования, переданные аудиторам, и продолжающийся лонгитюдный анализ — ни то, ни другое не опубликовано.

Один часто искажаемый показатель заслуживает того, чтобы назвать его методологию. Raghavan, Barocas, Kleinberg и Levy (2019) изучили 18 вендоров алгоритмического найма способом «exhaustively searching their websites, downloading whitepapers they provide, and watching webinars» и записали раскрытие валидационных данных pymetrics в своей таблице как «small case study». Это снимок того, что было опубликовано на сайте вендора в 2019 году, за три года до поглощения Harver. Он описывает состояние публичного раскрытия того времени и не может характеризовать доказательную базу продукта сегодня. Отдельное методологическое замечание тех же авторов адресовано отрасли, а не конкретному вендору: когда вендор рекламирует «миллионы точек данных» на кандидата, дать содержательное обоснование включения каждого признака, по их мнению, может быть невозможно, тогда как Principles APA требуют «establish a clear rationale for linking the resulting scores to the criterion constructs of interest». Относится ли это описание к обсуждаемому здесь продукту, мы не знаем и не утверждаем.

Для симметрии — то, что публикуем о себе мы. Конструктная валидность: CFI 0,96. Внутренняя согласованность: α Кронбаха 0,69–0,77. Ретестовая надёжность выше 0,83. Связь с рабочим результатом: R² 0,46 и AUC 0,77 на выборке проверки 3 000+ против реальных KPI и оценок руководителей; точность ML-моделей 72–89%. Мы сознательно не ставим свои 0,46 рядом с мета-аналитическими коэффициентами других инструментов: выборки и критерии разные, и такое сравнение не выдержит проверки. А рецензируемых публикаций собственных валидационных исследований у нас нет вовсе — об этом в разделе о том, когда выбирать не нас.

Bias-аудиты: что опубликовано, кем и что именно покрывает

Сначала о том, что обычно излагают наоборот. По NYC Local Law 144 обязанность опубликовать сводку результатов bias audit возложена на работодателя или кадровое агентство, а не на поставщика оценки: правило DCWP §5-303 (Published Results) адресовано «an employer or employment agency»; §5-301 задаёт порядок самого расчёта. Вендор, публикующий аудит у себя, публикует то, что текст правила адресует работодателям и кадровым агентствам; распространяется ли правило на конкретного вендора и как — должен говорить сам вендор и его юристы.

Harver такой аудит публикует. BABL AI Inc. (Iowa City, штат Айова) выпустила Summary of Bias Audit Results, V1.0, от 17 июля 2025 года по системе, названной «Harver's Soft Skills Platform». Период данных — январь–декабрь 2024 года; в отчёте указано «Testing conducted by: Harver» и «Date of most recent testing: Jun 2025»; selection rate считан при пороге 50-го перцентиля. Раскрытые цифры в формате N / selection rate / impact ratio: Male 164 014 / 0,545 / 1,000; Female 119 242 / 0,540 / 0,992; Black or African American 16 908 / 0,590 / 1,000; White 63 086 / 0,571 / 0,967; Hispanic or Latino 15 030 / 0,542 / 0,918; Asian 58 958 / 0,539 / 0,914. Интерсекциональные группы тоже раскрыты, минимум — Hispanic/Latino Male, 7 891 / 0,533 / 0,917. Среди групп, по которым отношение вообще рассчитано, все значения выше порога четырёх пятых. Опинион: PASS по disparate impact, governance и risk assessment.

Отчёт сам называет свои границы, и они важны не меньше цифр. Он не сертифицирует модель как «bias-free»; он не обеспечивал достаточного тестирования disparate impact ни по одному защищённому признаку помимо расы/этничности и пола; и он не определяет, является ли модель AEDT в смысле Local Law 144. По трём малочисленным группам — Native Hawaiian or Pacific Islander (N=378), Native American or Alaskan Native (N=398) и Two or more races (N=2 440) — impact ratio указан как N/A. Кроме того, в отчёте раскрыто, что из расчёта исключены 331 177 кандидатов, у которых не был указан хотя бы один демографический признак, а также 191 455 с неизвестным полом и 317 513 с неизвестной расой/этничностью. Раскрытие этого числа — ровно то, чего требуют правила DCWP: §5-301(b)(5) предписывает аудиту «indicate the number of individuals the AEDT assessed that are not included in the required calculations because they fall within an unknown category», а §5-303(a)(1) помещает это число в сводку, которую публикует работодатель. Как обходиться с такими записями внутри самого расчёта, правила не предписывают.

Более ранний цикл аудита существует. Краудсорсинговый реестр аудитов Local Law 144, который ведёт ACLU, содержит запись об аудите BABL AI по системе «pymetrics inc. (Harver) Soft Skills Platform» от 29 июня 2023 года, опубликованном работодателем — BNP Paribas, — а не вендором, как и предполагает закон. Сам документ мы не читали: на 4 августа 2026 года и размещённая работодателем копия, ссылка на которую у нас есть (Paramount), и архивная копия из реестра отдают HTTP 403, поэтому всё, что мы о нём говорим, взято из записи реестра. Эта же модель публикации — причина, по которой аудиты игровых оценок трудно найти кандидату: они чаще живут на карьерной странице работодателя, чем у вендора.

Общеотраслевой контекст для чтения любого опубликованного аудита даёт работа «Null Compliance» (arXiv:2406.01399): отчёты опубликовали 18 из 391 работодателя, а из 386 отдельных значений impact ratio в 13 уникальных отчётах 377 (96%) оказались выше 0,8 — распределение, которое авторы связывают в том числе с публикационным смещением. Ни pymetrics, ни Harver в этой работе не упоминаются, и переносить её выводы на них нельзя.

Регуляторная карта на август 2026 года

Сначала о дате, которую часто называют по исходной редакции Акта. EU AI Act действительно относит системы для оценки кандидатов при найме к высокорисковым — Annex III, пункт 4(a). Но обязанности для высокорисковых систем Annex III начинаются уже не 2 августа 2026 года: Регламент (ЕС) 2026/1744 от 8 июля 2026 года, опубликованный в Официальном журнале 24 июля 2026 года, перенёс дату применения Секций 1–3 Главы III на 2 декабря 2027 года для систем Annex III и на 2 августа 2028 года для систем Annex I. Даты фиксированные, без условных триггеров.

Перенос частичный, а не общий. Запреты Главы II не смягчены: со 2 февраля 2025 года Акт запрещает ИИ-системы, выводящие эмоции человека на рабочем месте, кроме медицинских причин и причин безопасности, а Еврокомиссия выпустила по этому запрету руководство. По нашему прочтению этого руководства запрет привязан к выводам на основе биометрических данных, а оценка, работающая на поведенческой телеметрии — кликах, таймингах, выборах, — это другой случай. Это наше чтение текста, а не юридический вывод о каком-либо продукте: ни о нашем, ни о чужом. Большинство обязанностей прозрачности по статье 50 остались на 2 августа 2026 года. Положение конкретного вендора по любой из этих норм мы не оцениваем: об этом должен говорить сам вендор и его юристы.

GDPR — норма более старая и для европейского найма более непосредственная. Статья 22 даёт человеку право не быть объектом решения, основанного исключительно на автоматизированной обработке и существенно его затрагивающего, и требует как минимум права на вмешательство человека, изложение своей позиции и оспаривание решения. Два решения Суда ЕС это заостряют: SCHUFA (C-634/21, 7 декабря 2023 года), по которому обязанности статьи 22 могут доставать и до поставщика балла, а не только до работодателя, если получатель сильно на этот балл опирается; и Dun & Bradstreet Austria (C-203/22, 27 февраля 2025 года), по которому коммерческая тайна не может «как правило» блокировать объяснение, необходимое человеку для оспаривания решения.

В США правило четырёх пятых из UGESP (29 CFR §1607.4(D)) — доказательственная эвристика, а не безопасная гавань: показатель выше 0,8 «generally will not be regarded» как свидетельство неравного воздействия, и тут же добавлено, что меньшие различия всё равно могут им быть, если значимы одновременно статистически и практически. Федеральные руководства EEOC по ИИ в найме сняты в 2025 году, приоритет надзора смещён к прямой дискриминации, но Title VII и UGESP продолжают действовать, а частный и штатовский риск никуда не делся.

Для Залива, где находится большинство наших клиентов: отдельного закона об ИИ в найме нет. Связывающая норма на федеральном уровне ОАЭ — статья 18 PDPL (Federal Decree-Law No. 45 of 2021), дающая субъекту данных право возразить против решений, вынесенных автоматизированной обработкой, включая профилирование. DIFC Regulation 10, принятый 1 сентября 2023 года, идёт дальше всего остального в регионе: он требует раскрывать факт применения системы, документировать механизмы обнаружения смещения и человеческого вмешательства, а при высокорисковой обработке — проходить сертификацию и назначать ответственного за автономные системы. Хартия ОАЭ по ИИ 2024 года носит рекомендательный характер.

Общее у перечисленных выше норм в том, что запрета на игровую оценку в их текстах мы не нашли, а требования к объяснимости, документированной проверке на смещение и возможности человека вмешаться в них присутствуют. Это описание текстов, а не юридическое заключение: применимость к конкретному внедрению определяют ваши юристы.

Две модели нормирования: ваши сотрудники или внешний справочник

Любая оценка отвечает на вопрос «по сравнению с чем», и ответов бывает два семейства. Либо эталон выводится из людей, уже работающих на этой роли у конкретного работодателя, либо эталон строится вне клиента, и кандидат сравнивается с ним. Это и есть содержательное различие между двумя продуктами, и это размен в обе стороны, а не рейтинг.

pymetrics относится к первому семейству. По описанию в статье FAccT 2021, модель обучается под клиента на «in group» из типично 50–100 высокорезультативных сотрудников в противопоставлении с «out group» и проверяется на adverse impact на отдельной bias-выборке, типично превышающей 10 000 пользователей. Аудит установил, что демографические данные использовались только для оценки и не входили в признаки модели, и — благоприятная для вендора находка, которую стоит процитировать, — что при подаче намеренно испорченного in group аудиторам «we were unable to produce a biased model that was not flagged as such by the code».

Структурная критика обучения на действующих сотрудниках существует давно и адресована подходу как классу, а не какому-то одному продукту: Raghavan et al. (2019) поднимают её в обзоре 18 вендоров, а MIT Technology Review (21 июля 2021 года) излагает опасения правозащитников по инвалидности относительно эталонов, выведенных из нынешних успешных сотрудников. Как именно конкретная реализация с этим справляется — вопрос к вендору.

NeuroFrame относится ко второму семейству. Наш эталон построен вне клиента: 287 профессий на 8 стадиях жизненного цикла компании дают 2 296 эталонных ячеек, собранных из реестра профстандартов и справочника профессий Минтруда вместе с моделью жизненного цикла Адизеса. Выборка сравнения — 14 850 человек на реальных должностях: 21 отрасль, 21 функция, 8 грейдов, 500 компаний. Отсюда механически следуют два свойства: метод работает с первого дня, не требуя от клиента иметь десятки действующих сотрудников на роли, и он структурно не кодирует существующий состав персонала.

Эталон зависит от стадии — в этом его смысл. По расчёту на 2 296 записях у 99% из 287 профессий диапазоны требований на «Младенчестве» и «Бюрократии» перекрываются меньше чем наполовину, медианное перекрытие — 0,40. Из 153 непересечений между крайними стадиями 152 приходятся на аппетит к риску. За жизненный цикл центр диапазона смещается на 18,8 перцентиля по риску, 15,4 по открытости, 11,5 по сознательности и 9,0 по мышлению; настойчивость практически не двигается.

Честный противовес: внешний справочник не знает вашу компанию. Он не расскажет, что работает именно в вашей культуре, на вашем продукте, при вашем управлении, — а модель, обученная на ваших сильных сотрудниках, строится ровно ради этого. Если у вас есть большая, устойчивая и хорошо измеренная когорта на роли, это серьёзный аргумент в её пользу.

Чем отличается подход NeuroFrame

NeuroFrame — это одна непрерывная симуляция на 30–60 минут, а не батарея. На выходе восемь параметров: три в домене мышления (Ментальная эффективность, Обучаемость, Мониторинг прогресса) и пять в домене личности (Открытость новому, Аппетит к риску, Настойчивость, Командность, Сознательность). Вердикта «брать / не брать» метод не выдаёт: результат — ранжирование и оценка соответствия роли, решение остаётся за работодателем. Это зафиксированное ограничение политики компании, а не обнаруженная позже особенность.

Каждая эталонная ячейка несёт человекочитаемое обоснование. Все 2 296: суммарно 1,07 млн знаков, в среднем 464 знака на ячейку, и 32% из них прямо называют сработавшее правило. Именно этого регуляторная среда 2026 года — статья 22 GDPR, решения Суда ЕС об объяснении, DIFC Regulation 10, наступающий режим Annex III — раз за разом требует от систем поддержки кадровых решений. В 303 ячейках из 2 296 (13%) эталон допускает высокий аппетит к риску при низкой нижней границе мышления или мониторинга прогресса: метод умеет сказать «подходит по всем параметрам, и вот это сочетание требует внимания». Мы показываем это отдельной строкой рядом с параметрами, а не сворачиваем в один итоговый балл: по нашему опыту, при свёртке в одно число такое сочетание из отчёта исчезает.

Обезличенность у нас заложена в схему передачи данных. Заказчик получает коды и сам сопоставляет их с людьми; имя, пол и возраст в NeuroFrame не поступают вовсе. Значит, модель не получает защищённые признаки на вход и не может обучаться на них напрямую. Это архитектурное ограничение, а не гарантия отсутствия смещения: косвенные корреляты остаются возможными, и именно поэтому мы прямо пишем, что формального отчёта по adverse impact ratio у нас пока нет. Цена этого прямая, и мы называем её в следующем разделе: именно из-за этой схемы у нас нет коннекторов к ATS.

О том, что даёт и чего не даёт игровой формат, мы говорим по литературе, а не по собственному маркетингу. Систематический обзор 34 работ (Ramos-Villagrasa, Fernández-del-Río и Castro, Frontiers in Psychology, 2022) заключает, что игровой формат не даёт достаточных преимуществ, чтобы рекомендовать его вместо конвенциональных методов, кроме улучшения реакции кандидатов. Отсюда защитимое утверждение: сопоставимая валидность при существенно лучшей реакции кандидатов — и ничего сильнее. Vigilance decrement — снижение устойчивости внимания с ростом времени на задаче — один из самых воспроизводимых эффектов в когнитивной психологии на групповом уровне; длинная сессия поэтому позволяет наблюдать поведение и в свежем, и в утомлённом состоянии, что не то же самое, что измерять накопленное утомление отдельного человека, — последнего мы не заявляем.

Один конструктный аргумент стоит сформулировать точно. Динамические симуляции с отложенными последствиями измеряют комплексное решение проблем — конструкт, перекрывающийся с общими когнитивными способностями примерно на 18% дисперсии (r ≈ 0,43 по 47 исследованиям — Stadler, Becker, Gödker, Leutner и Greiff, Intelligence, 2015), то есть содержащий и то, чего классические тесты не улавливают. И стоит держать в поле зрения актуальные коэффициенты методов отбора: по пересчёту Sackett, Zhang, Berry и Lievens (2022) структурированное интервью — 0,42, тесты профессиональных знаний — 0,40, рабочие пробы — 0,33, когнитивные тесты — 0,31, центры оценки — 0,29, ситуационные тесты — 0,26, опросники сознательности — 0,19. Мы не считаем, что ассессмент — включая наш — заменяет структурированное интервью. Диапазоны — ориентир, а не приговор: отклонение по одному-двум параметрам стоит проверить на интервью, а не считать основанием для отказа.

Одно длинное задание против двенадцати коротких: что из этого следует

Дискретное именованное задание можно найти, разобрать и отрепетировать; непрерывный сценарий труднее разложить на ходы. Это свойство формата, а не утверждение о качестве какого-либо продукта, — и работает оно в обе стороны, как показывает остаток этого раздела.

Наблюдаемое свидетельство — индустрия подготовки, которая складывается вокруг именованных заданий. Разбор игр pymetrics, размещённый на сайте Oxford University Careers Service, написан сотрудником JobTestPrep (24.11.2021); strategycase.com продаёт подготовку к консалтинговым отборам. Это существование рынка подготовки, а не утверждение о том, что подготовка меняет итоговый балл: данных ни за, ни против мы не нашли.

Формат батареи даёт широту охвата, и здесь преимущество на их стороне. Двенадцать игр, построенных на классических когнитивных парадигмах, покрывают больше разных конструктов, чем один сценарий, а Harver дополнительно продаёт отдельные когнитивные тесты — скорость восприятия, вербальное, пространственное, логическое и математическое мышление — вне двенадцати игр (по данным GraduatesFirst, коммерческого prep-источника; вендорской страницы с их перечнем мы не нашли). NeuroFrame вербальные и числовые способности не измеряет вовсе. Если они вам нужны, нужен и другой инструмент — рядом с нами или вместо нас.

Второй честный размен — время. Вендор заявляет 25 минут на прохождение; NeuroFrame занимает от 30 до 60. На масштабе набора выпускников в десятки тысяч заявок разница в 20 минут кандидатского времени — реальная операционная цифра, и она не в нашу пользу. Наш ответ не в том, что наша сессия короткая, а в том, что только в одной непрерывной сессии вообще становятся наблюдаемы отложенные последствия, меняющиеся условия и поведение при накапливающемся времени на задаче. Стоят ли эти минуты того — зависит от того, кого вы нанимаете.

Как читать эту страницу и как её проверить

Это сравнение опубликовано NeuroFrame — то есть заинтересованной стороной. Поэтому каждый факт о чужом продукте снабжён ссылкой, которую можно открыть: первоисточником там, где он доступен, а в тех немногих местах, где он не открывается, — вторичным источником, который открылся у нас, и с прямой пометкой об этом. Оценок чужого продукта мы стараемся не давать. Слова «слабый», «поверхностный», «устаревший» мы намеренно держим вне этой страницы; если такая формулировка всё же попалась — напишите, мы её уберём.

Правила, по которым мы работали: заявления вендора берутся с его собственных страниц и из пресс-релизов и помечаются как заявления вендора; цифры аудита берутся из PDF аудита и сопровождаются указанием, кто проводил тестирование; рецензируемые материалы цитируются вместе с их конфликтами интересов; коммерческие prep-сайты помечаются каждый раз, потому что первоисточниками о продукте они не являются. Всё проверено 4 августа 2026 года, а вендорские страницы меняются — дата говорит, что именно мы видели.

Чего мы сознательно не написали. Мы не писали, что у вендора нет доказательств валидности: не найти — не то же самое, что не существует, а сама статья FAccT упоминает внутренние исследования и продолжающийся лонгитюдный анализ. Мы не писали ничего о соответствии вендора какому-либо регулированию. Мы не писали ничего о закупочных решениях названных клиентов вендора — например, широко разошедшийся тезис про BCG восходит к коммерческому prep-сайту, который описывает зависимость от офиса и направление движения, а это не заявление ни BCG, ни Harver. И мы не смешивали платформенные показатели Harver с показателями pymetrics: источника, который их связывает, мы не нашли.

Если вы найдёте на этой странице ошибку — это ошибка, которую мы хотим исправить, а не защищать. Мы стремимся к тому, чтобы каждое число здесь было либо снабжено ссылкой, которую можно открыть, либо, если это наше собственное число, прослеживалось до единственного внутреннего источника истины, из которого генерируется весь сайт; если какое-то число этому не отвечает, мы хотим об этом узнать.

Когда выбирать pymetrics (Harver), а не нас

Если вы работодатель в США и особенно в Нью-Йорке — выбирайте их. По Local Law 144 обязанность опубликовать bias audit лежит на вас, а не на вендоре, и вендор, у которого уже есть опубликованный аудит BABL AI от 17 июля 2025 года с коэффициентами отбора и impact ratio по полу, расе и пересечениям, даёт вам точку старта. У нас на 4 августа 2026 года нет ни формального bias-аудита, ни отчёта по adverse impact ratio. Это самый очевидный разрыв между нами, и обесценивать его не стоит.

Если вам нужны рецензируемые доказательства — выбирайте их. О механике справедливости их продукта есть рецензируемая статья ACM FAccT со всеми оговорками о соавторстве, которые мы привели выше. У нас рецензируемых публикаций собственных валидационных исследований нет вовсе. Наша психометрика опубликована на сайте и прослеживается до внутреннего источника истины — но это более слабая форма доказательства, чем журнал.

Если наём многоязычный или глобальный — выбирайте их. Статья FAccT документирует перевод более чем на 20 языков и встроенные адаптации для дальтонизма и дислексии. Наш клиентский справочник профилей существует только на русском, политика адаптаций для кандидатов с ограничениями пока не оформлена, а комплаенс-контур у нас российский: 152-ФЗ закрыт архитектурно, но пакета по GDPR, EU AI Act и NYC LL 144 у нас пока нет.

Если вы просеиваете большие потоки через ATS — выбирайте их. Коннекторов к ATS у нас нет: это прямое следствие описанной схемы с обезличенными кодами и реальная операционная цена, а не философская позиция. Прибавьте разницу во времени: заявленные 25 минут против наших 30–60.

Если вам нужна широта конструктов — выбирайте их. Двенадцать игр, а по данным коммерческого prep-источника GraduatesFirst (вендорской страницы с перечнем мы не нашли) — ещё и отдельные когнитивные тесты на вербальное, числовое, логическое и пространственное мышление; у нас одно задание, и вербальные с числовыми способностями мы не измеряем вовсе.

Если вы нанимаете топ-менеджмент — присмотритесь к нам особенно внимательно, прежде чем решать. 83% нашего справочника — роли уровня «специалист», а топ-менеджмент покрыт девятью профессиями. И если у вас уже есть большая устойчивая когорта проверенных сильных сотрудников на той роли, которую вы закрываете, у модели, обученной на этих людях, есть аргумент, которого мы структурно предъявить не можем.

Ещё два наших числа стоит взвесить, а не принимать на веру. Внутренняя согласованность у нас α 0,69–0,77 — ниже конвенционального порога 0,80. Нормативная база — 14 850 человек, меньше, чем у инструментов с сорокалетней историей. Мы публикуем и то и другое, потому что страница, перечисляющая только свои сильные стороны, — это реклама, и читать её нужно как рекламу.

Вопросы

Существует ли ещё pymetrics или это теперь Harver?
И то и другое. Компании pymetrics как самостоятельного юридического лица нет: Harver объявил о поглощении 11 августа 2022 года, финансовые условия не раскрывались. Но имя живо и используется вендором: продуктовая линия называется «pymetrics for Game-Based Assessments», и продуктовая страница harver.com/gamified-assessments/ носит этот бренд. Одна деталь для точности: аудит 2025 года озаглавлен «Harver's Soft Skills Platform», а аудит 2023 года записан в краудсорсинговом реестре аудитов Local Law 144, который ведёт ACLU, как «pymetrics inc. (Harver) Soft Skills Platform»; сам документ 2023 года на 4 августа 2026 года не открывается ни по одной из известных нам ссылок (HTTP 403), поэтому его название мы приводим по этому реестру. Это факт о названиях документов; выводов о судьбе бренда мы из него не делаем.
Сколько это занимает у кандидата — и почему у вас дольше?
Вендор заявляет 25 минут на прохождение (harver.com/gamified-assessments/, проверено 04.08.2026). NeuroFrame занимает 30–60 минут. Разница не в нашу пользу на больших потоках, и мы это признаём. Смысл длинной сессии в другом: отложенные последствия решений, меняющиеся условия и поведение при накапливающемся времени на задаче наблюдаемы только внутри одной непрерывной сессии. Если ваш приоритет — минимальное время кандидата на массовом скрининге, это аргумент в их пользу.
У них есть опубликованный bias-аудит, а у вас нет. Насколько это важно?
Важно, и мы не будем это смягчать. У Harver опубликован отчёт BABL AI от 17 июля 2025 года с вердиктом PASS и раскрытыми impact ratio; у нас формального аудита нет. Два уточнения по существу, а не в оправдание. Первое: по NYC Local Law 144 публиковать аудит обязан работодатель, а не вендор, поэтому аудит на сайте вендора — добровольный сигнал, но именно вам он даёт готовую точку старта. Второе: сам отчёт BABL AI оговаривает, что не сертифицирует систему как «bias-free», не тестировал защищённые признаки помимо расы/этничности и пола и не определяет, является ли система AEDT в смысле закона. Аудит — это документированная проверка, а не сертификат отсутствия смещения.
Что значит «модель обучается на моих сотрудниках» и что если у меня нет 50 человек на этой роли?
По описанию в статье FAccT 2021 модель pymetrics строится под конкретного клиента: «in group» — типично 50–100 высокорезультативных сотрудников, «out group» — сравнительная выборка, плюс проверка на adverse impact на отдельной выборке 10 000+. Если такая когорта у вас есть, устойчива и хорошо измерена, это сильный аргумент: модель ловит то, что работает именно у вас. Если её нет — на новой роли, в стартапе, при выходе на новый рынок — этот путь закрыт. Наш справочник построен внешне, из реестра профстандартов и модели Адизеса, поэтому работает с первого дня и не требует наличия действующих сотрудников на роли. Цена симметричная: внешний эталон не знает вашу культуру.
Кто из вас доказал прогностическую валидность?
Ни один из ответов здесь не будет удобным. По pymetrics: по состоянию на 4 августа 2026 года нам не удалось обнаружить в открытом доступе рецензируемых публикаций о прогностической валидности относительно результативности на работе или публично размещённого технического руководства — это утверждение о результате нашего поиска, а не о том, что таких материалов не существует; сама статья FAccT упоминает внутренние исследования, переданные аудиторам, и продолжающийся лонгитюдный анализ. По NeuroFrame: у нас опубликованы R² 0,46 и AUC 0,77 на выборке проверки 3 000+ против реальных KPI и оценок руководителей, но рецензируемой публикации нет и у нас. И мы не ставим свои 0,46 рядом с чужими мета-аналитическими коэффициентами: выборки и критерии разные.
Мы нанимаем в ОАЭ. Что здесь вообще регулируется?
Отдельного закона об ИИ в найме в ОАЭ нет. Связывающая федеральная норма — статья 18 PDPL (Federal Decree-Law No. 45 of 2021): кандидат вправе возразить против решения, вынесенного автоматизированной обработкой, включая профилирование. В DIFC действует Regulation 10 (с 1 сентября 2023 года) — он требует раскрывать факт применения системы, документировать механизмы обнаружения смещения и человеческого вмешательства, а при высокорисковой обработке проходить сертификацию и назначать ответственного за автономные системы. Хартия ОАЭ по ИИ 2024 года носит рекомендательный характер. Запрета на игровую оценку в текстах этих норм мы не нашли, а требования к объяснимости и возможности человека вмешаться в них присутствуют. Это описание текстов, а не юридическое заключение: применимость к вашему внедрению определяют ваши юристы.
Правда ли, что EU AI Act уже требует всего этого с августа 2026 года?
Нет — дату часто называют по исходной редакции Акта, до переноса. Системы для оценки кандидатов действительно отнесены к высокорисковым (Annex III, п. 4(a)), но обязанности для них перенесены: Регламент (ЕС) 2026/1744 от 8 июля 2026 года, опубликованный в Официальном журнале 24 июля 2026 года, установил дату применения Секций 1–3 Главы III на 2 декабря 2027 года для систем Annex III. При этом перенос частичный: запрет на вывод эмоций человека на рабочем месте (ст. 5(1)(f)) действует со 2 февраля 2025 года и ограничен, по руководству Еврокомиссии, выводами на основе биометрических данных, а обязанности прозрачности по ст. 50 остались на 2 августа 2026 года.

Источники

Каждая ссылка открыта и проверена на дату, указанную выше.

  1. Harver Acquires pymetrics — official press releaseHarver
  2. Harver Acquires Pymetrics: One Team, One MissionHarver
  3. pymetrics Gamified Assessments — Game-Based Behavioral AssessmentsHarver
  4. Custom Options Added to pymetrics Assessments (press release, 01.11.2022)Harver
  5. Summary of Bias Audit Results — Audit of Harver's Soft Skills Platform for New York City's Local Law 144, V1.0, 17.07.2025BABL AI Inc.
  6. Summary of Bias Audit Results, 29.06.2023 — копия, размещённая работодателем; на 04.08.2026 ссылка отдаёт HTTP 403, документ нами не прочитанParamount / BABL AI
  7. Tracking Automated Employment Decision Tool Bias Audits — краудсорсинговый реестр аудитов NYC LL 144 (строка: BNP Paribas / «pymetrics inc. (Harver) Soft Skills Platform» / BABL AI / 29.06.2023)American Civil Liberties Union
  8. Wilson, Ghosh, Jiang, Mislove, Baker, Szary, Trindel, Polli — Building and Auditing Fair Algorithms: A Case Study in Candidate Screening (ACM FAccT 2021)ACM FAccT 2021
  9. Raghavan, Barocas, Kleinberg, Levy — Mitigating Bias in Algorithmic Hiring: Evaluating Claims and Practices (2019)arXiv
  10. Auditors are testing hiring algorithms for bias, but there's no easy fix (11.02.2021)MIT Technology Review
  11. Disability rights advocates are worried about discrimination in AI hiring tools (21.07.2021)MIT Technology Review
  12. Null Compliance: NYC Local Law 144 and the Challenges of Algorithm AccountabilityarXiv
  13. Notice of Adoption of Final Rule — Automated Employment Decision Tools, 6 RCNY §§ 5-300–5-304NYC Department of Consumer and Worker Protection
  14. Regulation (EU) 2026/1744 of 8 July 2026 (Digital Omnibus on AI), OJ 24.07.2026EUR-Lex / Official Journal of the European Union
  15. EU AI Act, Annex III (high-risk use cases), point 4(a)artificialintelligenceact.eu
  16. Red Lines Under the EU AI Act: the prohibition of emotion recognition in the workplace and educationFuture of Privacy Forum
  17. Art. 22 GDPR — Automated individual decision-making, including profilinggdpr-info.eu
  18. Key takeaways from the CJEU's automated decision-making rulings (SCHUFA, C-634/21)IAPP
  19. Court of Justice press release No 22/25 — C-203/22 Dun & Bradstreet Austria (27.02.2025)Court of Justice of the European Union
  20. 29 CFR § 1607.4 — Uniform Guidelines on Employee Selection Procedures, four-fifths ruleCornell Legal Information Institute
  21. The federal government quietly removed its AI hiring guidanceNational Law Review
  22. AI in the UAE: understanding the regulatory landscape and key authoritiesLatham & Watkins
  23. AI regulation in the DIFC: personal data processed through autonomous and semi-autonomous systems (Regulation 10)Mayer Brown
  24. Harver Launches AI PREVAIL — AI Readiness Assessment (Business Wire, 21.04.2026)Business Wire
  25. The Pymetrics Games — Overview and Practice Guidelines (24.11.2021, guest article by a JobTestPrep author)Oxford University Careers Service
  26. BCG Pymetrics Test 2026: Is It Still Used? (commercial preparation site)StrategyCase
  27. Harver/Pymetrics Assessments & Digital Interviews (commercial preparation site)GraduatesFirst
  28. Sackett, Zhang, Berry & Lievens — Revisiting meta-analytic estimates of validity in personnel selection (2022), Journal of Applied Psychology 107(11), 2040–2068American Psychological Association
  29. Ramos-Villagrasa, Fernández-del-Río & Castro — Game-related assessments for personnel selection: A systematic review (2022), Frontiers in Psychology 13, 952002 (обзор 34 работ)Frontiers in Psychology
  30. Stadler, Becker, Gödker, Leutner & Greiff — Complex problem solving and intelligence: A meta-analysis (2015), Intelligence 53, 92–101 (47 исследований, средний эффект .433)Elsevier / Intelligence