Мультимодальные ИИ не справляются с творческим переносом смысла: тест C4 дал 50% точности
Группа исследователей представила новый бенчмарк C4 для оценки творческих способностей мультимодальных больших языковых моделей (MLLM). Тест построен на китайских идиомах чэнъюй и проверяет, насколько хорошо ИИ понимает неочевидные, но осмысленные связи между понятиями.
Авторы отмечают, что творческие возможности моделей важны в дизайне, коммуникации, образовании и совместной работе человека и ИИ, однако оценивать их сложнее, чем точность ответов на прямые вопросы: здесь нет явных целей и сигналов поощрения.
В основе подхода лежит идея межпонятийного понимания. Создание задания рассматривается как кодирование, а рассуждение модели — как декодирование. Для этого авторы вручную выстроили сеть концептуальных связей с мостами между понятиями и индексами сложности.
Набор C4-Eval включает 184 синтетических и 37 созданных людьми примеров на основе чэнъюев, собранных из открытых источников. Каждый пример протестирован в пяти вариантах постановки задачи, всего получилось 884 случая восстановления ответа.
Эксперименты на десяти моделях показали, что лучшие закрытые системы достигают всего 50,7% и 48,0% первичной точности, а открытые модели оказываются заметно слабее. Ограничение набора кандидатов резко улучшает результаты, тогда как подсказки и запрос объяснений дают лишь небольшой прирост.
По мнению авторов, это демонстрирует значительный разрыв в способности современных MLLM творчески декодировать нестандартно закодированный смысл. Код исследования доступен в дополнительных материалах препринта на arXiv.
Работа может стать базой для дальнейших методов оценки генеративных моделей, где требуется не просто воспроизведение фактов, а понимание скрытых связей и творческого контекста.



