Новый бенчмарк RobustMAD оценил устойчивость малых мультимодальных моделей для промышленного контроля
Группа исследователей разработала новый бенчмарк RobustMAD, нацеленный на оценку робастности малых мультимодальных языковых моделей (MSLM) в условиях реального промышленного производства. Работа опубликована на arXiv и призвана восполнить пробел в анализе устойчивости компактных моделей для развертывания на предприятиях.
Multimodal industrial anomaly inspection assistants — ключевой элемент «умных фабрик», позволяющий операторам задавать вопросы о состоянии оборудования на естественном языке. Однако крупные мультимодальные модели требуют огромных вычислительных ресурсов и создают риски утечки данных при облачной обработке. Малые модели (MSLM) решают эту проблему, но до сих пор не было достаточных данных об их реальной надёжности.
RobustMAD стал первым бенчмарком, ориентированным на практическое развертывание. Он включает разнообразные открытые запросы — от понимания объектов и обнаружения аномалий до неразрешимых задач и визуальных искажений. Вопреки ожиданиям, топовые MSLM показали многообещающие результаты: они неожиданно превзошли даже более крупную модель GPT-5 Nano.
Тем не менее, авторы отмечают, что модели всё ещё не достигли требуемого уровня безопасности для критически важных систем. Бенчмарк выявил три ключевых типа отказов: хрупкость мультимодального анализа при мелких деталях или плохом качестве изображения, недостаточная полнота ответов, а также склонность к галлюцинациям на неразрешимых или некорректных запросах.
На основе полученных данных исследователи дали рекомендации по проектированию следующих поколений промышленных ассистентов, которые смогут использовать сильные стороны MSLM при одновременном устранении выявленных уязвимостей. Код бенчмарка опубликован в открытом доступе на GitHub.





