MolEmb: мультимодальные LLM создают универсальные эмбеддинги для химии и фармацевтики

Исследователи предложили новый фреймворк MolEmb, который превращает мультимодальные большие языковые модели (MLLM) в универсальные молекулярные эмбеддинг-модели. Такие представления могут служить базовой инфраструктурой для вычислительной химии и поиска новых лекарств.
Традиционные молекулярные энкодеры обычно строятся вокруг одного вида представления молекулы и не поддерживают изменение описания через естественный язык. MolEmb решает эту проблему, выравнивая молекулярные профили с текстовыми описаниями в общем пространстве эмбеддингов.
Для обучения используется двунаправленная контрастивная цель: модель учится связывать изображения молекул, их текстовые описания и символьные данные. В результате получаются векторы, которые зависят как от самой молекулы, так и от смыслового контекста, заданного на естественном языке.
По данным авторов, MolEmb показывает конкурентоспособные результаты на задачах предсказания свойств молекул и поддерживает кросс-модальный поиск: можно искать молекулы по текстовому описанию и наоборот.
Также представлен диагностический бенчмарк MolCAR для оценки контекстно-зависимого поиска. С его помощью исследователи выяснили, что способность модели к контекстному эмбеддингу в первую очередь зависит от свойств обучающих данных, а не только от архитектуры.
Авторы делают вывод, что мультимодальные LLM могут стать практичным и расширяемым подходом к созданию общих молекулярных эмбеддингов. Это открывает новые возможности для автоматизации процессов в фармацевтике и материаловедении.







