NL2SHACL-Bench: LLM справляются с синтаксисом SHACL, но не с семантикой

На платформе препринтов arXiv появилось описание NL2SHACL-Bench — нового бенчмарка для оценки качества перевода естественного языка в язык SHACL. Этот язык используется для проверки соответствия RDF-графов знаний заданным схемам и ограничениям.

SHACL считается одной из ключевых технологий валидации графов знаний, однако для ручного написания таких правил требуются глубокие технические знания, которыми обычно не владеют эксперты предметной области. Автоматический перевод запросов с естественного языка в SHACL мог бы заметно упростить работу с графами знаний, но до сих пор не существовало специализированного бенчмарка для тестирования таких систем.

Создатели NL2SHACL-Bench отмечают, что оценка генерации SHACL не должна сводиться к простому сравнению текстовых строк: семантически эквивалентные формы могут различаться сериализацией и структурой. Поэтому в основу бенчмарка были заложены принципы, позволяющие оценивать именно смысловую корректность, а не только синтаксис.

С использованием нового набора тестов исследователи проверили четыре современные большие языковые модели. Оказалось, что все они уверенно справляются с созданием синтаксически валидного SHACL, но испытывают сложности при генерации семантически эквивалентных ограничений для комплексных логических и структурных паттернов.

Этот результат подтверждает, что текущее поколение LLM еще не готово полностью заменить эксперта по SHACL, однако бенчмарк создает основу для измерения прогресса в данном направлении.

Появление NL2SHACL-Bench может стать стимулом для дальнейших исследований в области облегчения доступа к технологиям графов знаний. Развитие таких инструментов потенциально позволит специалистам без глубокого программирования формулировать требования к данным на естественном языке.