Дистилляция знаний LLM в легковесных RL-агентов: новый подход к автономной киберзащите

Автономные кибероперации (АКО) становятся критически важными для защиты корпоративных сетей, но традиционные RL-агенты требуют длительного обучения и часто показывают нестабильные результаты на начальных этапах. Группа исследователей предложила использовать большие языковые модели для улучшения процесса принятия решений.

В работе, опубликованной на arXiv, авторы применили LLM с 8 миллиардами параметров, предобученную на специализированных данных по кибербезопасности. Вместо тонкой настройки они использовали prompt engineering, что позволило модели эффективно действовать в модифицированной среде CybORG CAGE Challenge 2 и превзойти базового RL-агента.

Ключевая инновация — онлайн-дистилляция политики: знания LLM переносятся в легковесного RL-агента всего с 64 910 параметрами. Это уменьшает размер модели на несколько порядков, сохраняя при этом высокую обороноспособность. Такой подход открывает путь к практическому применению передовых кибермоделей в компактных и развертываемых агентах.

Для проверки универсальности авторы создали сценарии CybORG с числом хостов от 4 до 12 и протестировали подход при разных конфигурациях сети. Дополнительно они изучили стратегии стабилизации обучения с учителем и обнаружили, что ни одна из них не превосходит оптимизированную политику учителя, что указывает на ограничения согласования между RL-оптимизацией и экспертными стратегиями.

Эти результаты демонстрируют потенциал кибер-ориентированных LLM как источника экспертизы для автономной обороны, а дистилляция политики — как практический способ внедрения передовых моделей в эффективные масштабируемые агенты.