Новый фреймворк MAR-12 научился распознавать вредный юмор в мемах с точностью до 80%

Интернет-мемы сочетают в себе визуальные образы, текст и культурный контекст, что делает их сложными для автоматического анализа. Особенно трудно распознать ситуации, когда юмор граничит с оскорблением или ненавистью. Существующие модели часто не могут объяснить свои решения, что снижает доверие к системам модерации.

Команда исследователей предложила новый подход — фреймворк MAR-12, основанный на Vision Language Models (VLMs). Он не только классифицирует мемы, но и даёт структурированное объяснение, почему тот или иной контент считается опасным. В основе лежит анализ по 12 заранее определённым перспективам, связанным с теориями юмора и ненависти.

Каждый мем оценивается с помощью ролевого механизма внимания, который определяет, насколько важна та или иная перспектива для итогового вердикта. Затем прототипный классификатор принимает решение, а объяснение формируется на основе весов внимания и рассуждений по каждой перспективе. Такой подход обеспечивает прозрачность и контекстную обоснованность.

Тестирование проходило на датасетах PrideMM и Memotion. MAR-12 достиг точности 80,3% при обнаружении юмора и 75,9% при выявлении ненавистного контента, превзойдя предыдущие разработки. Также были проведены оценки с участием людей и GPT-4, которые подтвердили, что объяснения системы получаются связными и убедительными, особенно для мемов, где смешное и вредоносное сочетаются.

Разработка может быть полезна для платформ социальных сетей и служб модерации, позволяя более точно и аргументированно фильтровать контент. Исследование опубликовано на arXiv в виде препринта.