dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

На CIC-IDS2017 преимущество трансформера зависит от протокола оценки, а не только от архитектуры

0

Кратко

В preprint на CIC-IDS2017 сравнили несколько моделей для обнаружения вторжений на последовательных сетевых данных. Результаты трансформера заметно менялись в зависимости от способа подготовки окон и схемы разбиения, а при leakage-free оценке более устойчивым оказался случайный лес.

Зачем это знать

Работа напоминает, что в сетевой безопасности сравнение моделей нужно проводить особенно осторожно: вывод может сильнее зависеть от разбиения данных и схемы padding, чем от самой архитектуры. Для таких исследований важно явно описывать протокол оценки и избегать утечки данных.

Разбор

Авторы не просто взяли готовый набор сетевых записей и прогнали по нему модели, а сначала перестроили задачу так, чтобы она действительно выглядела как последовательность событий во времени. Для этого они собрали упорядоченные окна из сетевых потоков, сгруппированных по одной сессии, и уже на таких окнах сравнили девять моделей — от классических до нейросетевых. Это важно, потому что многие прошлые работы называли свои модели «временными», но на деле подавали им не настоящий ряд событий, а почти обычный набор признаков.

Дальше они проверили модели не одним способом, а сразу несколькими схемами оценки: обычным случайным разбиением, двумя вариантами без утечки информации и ещё отдельно посмотрели, как влияет способ заполнения пустых мест в окне. И вот тут всплыло главное: поведение трансформера менялось не столько из-за самой архитектуры, сколько из-за того, как именно подготовили данные. На «честных» последовательных окнах он показал лучший macro-F1 среди всех моделей, но при zero-padding с маской качество заметно просело, а у LSTM, GRU и 1D-CNN результаты почти не шатались.

Ещё один важный сдвиг — что при разбиении без утечки данных самым устойчивым оказался случайный лес, а у трансформера резко выросла доля ложных тревог. Авторы отдельно подчеркивают, что при привычном random split и повторении последнего значения в пустых позициях можно сильно переоценить, насколько модель вообще умеет работать в реальной сети. То есть статья спорит не с трансформерами как таковыми, а с привычкой оценивать их в слишком удобных условиях.

Ключевые цифры

9 моделейАвторы сравнили не одну «модную» архитектуру, а сразу несколько вариантов, чтобы понять, что реально влияет на результат.
T = 20Окно содержало 20 сетевых событий подряд — это уже похоже на настоящую последовательность, а не на одиночный снимок.
0.89 macro-F1На правильно собранных последовательных окнах трансформер лучше всего ловил редкие типы атак и не сводился к угадыванию самого частого класса.
0.04% → 2.7%У трансформера доля ложных тревог выросла примерно в 67 раз, если оценивать его без утечки данных и в более реалистичном режиме.

Можно ли доверять

Это preprint на arXiv, значит, работу ещё не проверяли рецензенты журнала. Зато авторы сравнили модели сразу на нескольких схемах разбиения и на одном из самых популярных наборов для сетевой безопасности, так что выводы выглядят серьёзно. Но переносить их на другие датасеты и реальные сети всё равно нужно осторожно: в статье самой явно показано, что итог сильно зависит от протокола оценки.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас10 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыZach Moczkodan, Hany Ragab