Новый бенчмарк DrawingVQA оценил ИИ на реальных строительных чертежах

Группа исследователей представила новый бенчмарк DrawingVQA, предназначенный для оценки мультимодальных больших языковых моделей (MLLM) на реальных строительных чертежах. Это первый подобный набор данных, охватывающий специфическую область архитектуры и инженерного проектирования.

В отличие от естественных изображений или схематичных планов, строительные чертежи сочетают абстрактную геометрию, символьные обозначения, табличные данные, аннотации и специализированный текст. Такая сложность делает их уникальной визуально-текстовой средой, ключевой для инженерных рабочих процессов.

DrawingVQA включает 33 чертежа, выпущенных «для строительства», и 92 тщательно составленных вопроса-ответа. Вопросы разделены на три уровня глубины рассуждения: перцептивное понимание, контекстуальная интерпретация и экспертные рассуждения в предметной области.

Для оценки моделей авторы разработали двойную систему категоризации, которая анализирует производительность по семи инженерным и четырём когнитивным измерениям. Это первый случай, когда инженерные рабочие процессы явно сопоставлены с компетенциями ИИ.

Тестирование современных MLLM выявило существенный разрыв между производительностью моделей и экспертов, особенно на высоких уровнях рассуждений. Результаты показывают, что даже передовые нейросети пока не способны полноценно заменить человека в анализе строительной документации.

По словам разработчиков, бенчмарк закладывает основу для специализированного мультимодального рассуждения и может ускорить внедрение ИИ в реальные инженерные процессы. Полные материалы исследования доступны в архиве препринтов arXiv.