Препринт — материал ещё не прошёл рецензирование
На CIC-IDS2017 преимущество трансформера зависит от протокола оценки, а не только от архитектуры
Кратко
В preprint на CIC-IDS2017 сравнили несколько моделей для обнаружения вторжений на последовательных сетевых данных. Результаты трансформера заметно менялись в зависимости от способа подготовки окон и схемы разбиения, а при leakage-free оценке более устойчивым оказался случайный лес.
Зачем это знать
Работа напоминает, что в сетевой безопасности сравнение моделей нужно проводить особенно осторожно: вывод может сильнее зависеть от разбиения данных и схемы padding, чем от самой архитектуры. Для таких исследований важно явно описывать протокол оценки и избегать утечки данных.
Разбор
Авторы не просто взяли готовый набор сетевых записей и прогнали по нему модели, а сначала перестроили задачу так, чтобы она действительно выглядела как последовательность событий во времени. Для этого они собрали упорядоченные окна из сетевых потоков, сгруппированных по одной сессии, и уже на таких окнах сравнили девять моделей — от классических до нейросетевых. Это важно, потому что многие прошлые работы называли свои модели «временными», но на деле подавали им не настоящий ряд событий, а почти обычный набор признаков.
Дальше они проверили модели не одним способом, а сразу несколькими схемами оценки: обычным случайным разбиением, двумя вариантами без утечки информации и ещё отдельно посмотрели, как влияет способ заполнения пустых мест в окне. И вот тут всплыло главное: поведение трансформера менялось не столько из-за самой архитектуры, сколько из-за того, как именно подготовили данные. На «честных» последовательных окнах он показал лучший macro-F1 среди всех моделей, но при zero-padding с маской качество заметно просело, а у LSTM, GRU и 1D-CNN результаты почти не шатались.
Ещё один важный сдвиг — что при разбиении без утечки данных самым устойчивым оказался случайный лес, а у трансформера резко выросла доля ложных тревог. Авторы отдельно подчеркивают, что при привычном random split и повторении последнего значения в пустых позициях можно сильно переоценить, насколько модель вообще умеет работать в реальной сети. То есть статья спорит не с трансформерами как таковыми, а с привычкой оценивать их в слишком удобных условиях.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, значит, работу ещё не проверяли рецензенты журнала. Зато авторы сравнили модели сразу на нескольких схемах разбиения и на одном из самых популярных наборов для сетевой безопасности, так что выводы выглядят серьёзно. Но переносить их на другие датасеты и реальные сети всё равно нужно осторожно: в статье самой явно показано, что итог сильно зависит от протокола оценки.
Пересказано ИИ по научной статье. Как это устроено