Препринт — материал ещё не прошёл рецензирование
Новая схема восстанавливает состав данных, на которых дообучали ИИ-модель
0
Кратко
Метод WARP пытается восстановить, в каких пропорциях смешивали данные для дообучения модели, глядя только на её веса. В контролируемых тестах на BERT и GPT-2 он оценивал состав данных точнее, чем базовые методы membership inference.
Зачем это знать
По одной лишь опубликованной модели иногда можно приблизительно понять, в каких пропорциях смешивали данные для её дообучения. Пока это проверяли только в контролируемых условиях на BERT и GPT-2, так что это ранний результат, а не готовый инструмент.
Пересказано ИИ по научной статье. Как это устроено
Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас3 июля 2026 г.
Дата источника1 июля 2026 г.
ОригиналОткрыть
АвторыTzu-Heng Huang, Aditya Goyal, John Cooper, Frederic Sala