AI-расширение ClickGuard выявляет кликбейт с точностью 91% и генерирует спойлеры
Исследователи из arXiv разработали браузерное расширение ClickGuard, предназначенное для идентификации кликбейтных материалов. Система сочетает трансформерные эмбеддинги с лингвистическими признаками и собственной метрикой «baitness», сообщается в препринте.
Архитектура ClickGuard построена на базе XGBoost — популярного алгоритма градиентного бустинга. Разработчики протестировали несколько методов NLP: от классических векторизаторов до эмбеддингов больших языковых моделей. Лучший результат показала именно XGBoost-модель, достигнув F1-меры 91% на открытом объединенном датасете.
Расширение работает в два этапа: до перехода по ссылке и после. Пользователь получает предупреждение, если заголовок кажется подозрительным. После открытия статьи выводится процентная оценка вероятности того, что материал является кликбейтом. Прогноз сопровождается пояснением на основе проанализированных метрик.
Дополнительно ClickGuard генерирует спойлер — сжатое изложение статьи в одно-два предложения. Это позволяет быстро понять реальное содержание, не тратя время на вводящий в заблуждение заголовок.
По словам авторов, цель проекта — помочь пользователям избегать вводящих в заблуждение интернет-материалов. В перспективе расширение может быть доработано для работы с различными языками и типами контента.
Демо-видео работы расширения доступно на YouTube (ссылка).


