AgentStream: новый фреймворк для оценки самоэволюции LLM-агентов в потоковых задачах

Самоэволюция больших языковых моделей (LLM) — способность агентов улучшаться на основе собственного накопленного опыта — считается перспективным направлением. Однако большинство существующих исследований оценивают такие системы в изолированных условиях, что не отражает реального применения, где задачи поступают непрерывным потоком.

Для устранения этого пробела группа исследователей разработала AgentStream — унифицированный фреймворк, который оценивает самоэволюционирующих агентов, объединяя агентские бенчмарки в конфигурируемый поток задач. В тестовом режиме создаются три сценария: изолированный, последовательный и перемежающийся, различающиеся масштабом и составом потока.

В рамках эксперимента были комбинаторно проверены пять репрезентативных методов самоэволюции на трёх передовых фундаментальных моделях. Цель — выяснить, как совместно влияют на самоэволюцию возможности модели, архитектура метода и потоковый сценарий.

Результаты показали, что надёжность самоэволюции существенно различается в зависимости от сценария. Польза от самоэволюции ограничена возможностями модели и не монотонно растёт с её силой: более мощная модель не всегда даёт лучший эффект.

Кроме того, ни один метод не доминирует во всех моделях и сценариях. Это означает, что выбор метода самоэволюции требует учёта как конкретной модели, так и характера потока задач, с которым предстоит работать агенту.

Авторы подчёркивают, что самоэволюционирующие агенты должны оцениваться в реалистичных потоках задач, а не в изолированных однотипных тестах. Предложенный фреймворк даёт конкретные ориентиры для выбора методов самоэволюции, что может быть полезно разработчикам ИИ-систем при проектировании агентов для динамичных сред.