Новый метод MGDT повышает точность завершения мультимодальных графов знаний

Исследователи из академических кругов разработали метод MGDT (MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts), который решает задачу завершения мультимодальных графов знаний (MKGC). Как сообщается в статье на arXiv, новый подход позволяет точнее восстанавливать отсутствующие сущности, используя структурную, текстовую и визуальную информацию.

Традиционные методы на основе диффузии работают непосредственно с сырыми мультимодальными признаками, что приводит к шуму и несогласованности. MGDT предлагает парадигму «сначала выравнивание, потом диффузия», которая устраняет эти проблемы.

Метод состоит из трёх ключевых модулей. Первый — Relation-Adaptive Semantic Routing Mixture-of-Experts (RASR-MoE), который выбирает релевантные для текущего отношения семантические пути и подавляет бесполезные модальности. Второй — замороженная мультимодальная большая языковая модель (MLLM), служащая семантическим якорем для приведения разнородных представлений к единому латентному пространству. Третий — Knowledge Graph Diffusion Transformer (KGDT), который генерирует представление недостающей сущности с учётом структуры графа.

Эксперименты на трёх эталонных наборах данных показали, что MGDT стабильно превосходит сильные базовые модели. Авторы подчёркивают, что разделение задач выбора признаков, выравнивания модальностей и генерации позволяет повысить качество завершения графов знаний.

Разработка может найти применение в системах рекомендаций, семантическом поиске и других областях, где критично корректное восстановление связей между объектами на основе разнородных данных.