Новый бенчмарк ChemDIRT выявил нестабильность ИИ в решении химических задач

Новый бенчмарк ChemDIRT выявил нестабильность ИИ в решении химических задач

Исследователи представили новый набор тестов ChemDIRT для оценки больших языковых моделей (LLM) при решении химических задач. Работа опубликована на arXiv и описывает бенчмарк, предназначенный для более надежной проверки способности моделей к химическим рассуждениям.

Как отмечают авторы, существующие химические бенчмарки часто дают узкое представление о возможностях моделей. Они сосредоточены на ограниченном наборе задач и не учитывают, как изменения в формулировке или представлении химических данных влияют на результат. Из-за этого сообщаемые показатели могут завышать реальную способность модели рассуждать в разнообразных условиях.

ChemDIRT (Diversified Instruction, Representation, and Task Benchmark) систематически оценивает работу моделей при варьировании инструкций и представлений молекул, охватывая восемь категорий химических задач. Бенчмарк проверяет не только точность, но и согласованность ответов при контролируемых изменениях входных данных.

По данным исследования, тестирование набора открытых и закрытых LLM выявило значительную чувствительность моделей к формулировке промптов, зависимость от способа представления молекул и неравномерные результаты среди разных семейств задач.

Авторы подчеркивают, что традиционные бенчмарки с единым форматом могут переоценивать возможности моделей. Новый подход позволяет получить более достоверную картину о том, насколько стабильно ИИ справляется с реальными и разнообразными химическими заданиями.

Разработчики надеются, что ChemDIRT станет полезным инструментом для исследователей и разработчиков LLM, стремящихся улучшить устойчивость моделей в научной области. Это особенно важно, учитывая растущий интерес к применению ИИ в химии и смежных дисциплинах.