MatrAIx: 8,3 млрд цифровых пользователей для тестирования ИИ-систем
Разработчики представили MatrAIx — инфраструктуру для крупномасштабного тестирования ИИ-систем и цифровых продуктов с использованием разнообразных симулированных пользователей. Решение призвано заменить дорогие и медленные оценки с участием реальных людей, сохраняя при этом учёт индивидуальных особенностей и интерактивного поведения.
Ключевой компонент системы — база Persona 8B, содержащая 8,3 млрд записей о персонах, описанных с помощью 1290 категориальных атрибутов. Данные либо выбираются из графа зависимостей, сохраняющего корреляции между характеристиками, либо создаются на основе авторских профилей. Исследователи публикуют очищенное ядро из примерно 1 млн персон: 599 847 записей, полученных от реальных людей, и 400 000 синтетических.
MatrAIx Playground включает четыре среды, в которых пользователи оценивают продукты: опросы, ИИ-чатботы, веб-сервисы и мобильные приложения. Инфраструктура поддерживает 1010 прикладных задач в более чем 25 областях, включая коммерцию, разработку ПО, финансы и здравоохранение.
Авторы провели 18 189 оценочных испытаний по восьми репрезентативным задачам. Для питания персональных агентов использовались три больших языковых модели: Claude Opus 4.8, GPT 5.5 и Claude Haiku 4.5. Полученная обратная связь отражает различия в решениях и предпочтениях в зависимости от характеристик персоны: например, колебания после повышения цены, готовность продолжить после сбоя ИИ-ассистента и устойчивость к задержкам в ответе.
Для проверки точности была проведена контролируемая серия из 400 испытаний, в ходе которой оценивалось соблюдение персонами заявленного поведения по десяти атрибутам. В 366 из 400 случаев (91,5%) объявленное поведение было либо выражено, либо корректно подавлено. Отдельно качество извлечения человеко-ориентированных персон оценивали люди и LLM-судьи.
Разработчики считают, что MatrAIx предоставляет комплексную инфраструктуру для оценки ИИ-систем и цифровых продуктов с разнообразными симулированными пользователями, что снижает затраты и ускоряет масштабирование тестирования без потери поведенческой реалистичности.





