BERT обошел классические модели в классификации конфиденциальных документов: новый бенчмарк
Автоматическая классификация документов по степени конфиденциальности — важная, но малоизученная задача. Ошибки здесь чреваты не только нарушением регламентов, но и реальными утечками информации. Искусственный интеллект мог бы снять нагрузку с людей, однако его эффективность напрямую зависит от качества обучающих данных.
Как выяснили авторы нового исследования на arXiv, в этой области распространена проблема так называемой утечки меток. В текстах документов остаются служебные маркеры, которые модели используют как подсказки, вместо того чтобы анализировать содержимое. Это делает оценки точности завышенными, а реальная работа моделей — ненадежной.
Чтобы решить эту проблему, исследователи собрали корпус Strategic 16K: 16 тысяч дипломатических депеш из базы WikiLeaks Public Library of US Diplomacy (PlusD). Все документы были тщательно очищены — авторы разработали специальный протокол, который выявляет и удаляет три категории остаточных маркеров классификации.
На полученном «чистом» наборе данных провели систематическое сравнение шести моделей: от классических алгоритмов машинного обучения до современных трансформеров. Лучший результат показала модель BERT: точность 89,14% и F1-мера 89,33%. Чуть уступила ELECTRA (88,57% и 88,90% соответственно).
Среди классических подходов сильнее всего оказался TF-IDF в сочетании с логистической регрессией. При этом он требует значительно меньших вычислительных ресурсов, что делает его привлекательным для организаций с ограниченным бюджетом.
По словам авторов, это первый полностью воспроизводимый бенчмарк классификации чувствительности, построенный на основе WikiLeaks PlusD в контролируемых условиях без утечек меток. Работа открывает возможности для более честной оценки алгоритмов в задачах безопасности и обработки конфиденциальных данных.



