Новая LLMOps-архитектура решает проблемы устаревания знаний и галлюцинаций у больших языковых моделей

Научный препринт, опубликованный на arXiv, описывает новый метод развертывания больших языковых моделей (LLM) в режиме реального времени для корпоративных задач. Авторы предложили единую LLMOps-архитектуру, которая объединяет несколько ключевых технологий в один операционный конвейер.

Среди проблем, которые решает разработка, — устаревание знаний модели, катастрофическое забывание, склонность к галлюцинациям и слабые циклы обратной связи. Эти ограничения особенно критичны в регулируемых отраслях, таких как здравоохранение и финансы, где точность и аудируемость имеют первостепенное значение.

Архитектура включает четыре основных компонента: адаптивный оркестратор шаблонов приема данных (AIPO), метод непрерывного обучения STAR+FAR, политику адаптивного поиска SAGE и автоматизированный этап сходимости на основе обратной связи от человека с триггерами RLHF. Каждый компонент соответствует устоявшимся шаблонам проектирования программного обеспечения.

Разработчики отмечают, что AIPO уже протестирован на эталонном наборе данных FreshStreamBench. STAR+FAR использует разреженную маршрутизацию адаптеров и воспроизведение с учетом свежести данных, что снижает катастрофическое забывание. В свою очередь, SAGE предсказывает бюджет извлечения для каждого запроса, чтобы уложиться в целевые показатели задержки.

По словам авторов, предложенный подход сокращает компромисс между задержкой, стоимостью и точностью, одновременно обеспечивая возможность аудита и отката к предыдущим версиям модели. Это особенно важно для высокорисковых секторов, где ошибки могут иметь серьезные последствия.

Опубликованная работа носит концептуальный характер и не содержит деталей о конкретных внедрениях или тестировании в промышленных условиях. Тем не менее, она предлагает систематизированный взгляд на организацию операций с LLM в реальном времени.