Препринт — материал ещё не прошёл рецензирование
ИИ-креативы обошли лучшие человеческие в рекламном тесте
Кратко
В рекламе с 50 вариантами креатива авторы проверили связку из генеративной модели, офлайн-отбора по предсказателю и онлайн-адаптивного теста. Лучший креатив, созданный этой схемой, дал на 45,1% больше вовлечённости, чем лучший вариант, сделанный человеком; в двух других экспериментах приросты составили 46,7% и 36,2%.
Зачем это знать
Подход показывает схему отбора кандидатов в ситуациях, где протестировать можно лишь ограниченное число вариантов, но выводы пока основаны на preprint и на метрике вовлечённости. Он особенно зависит от истории прошлых A/B-тестов и похожих креативов.
Разбор
Авторы не просто сгенерировали рекламу и сравнили её с человеческой. Они собрали связку из трёх шагов: сначала модель сгенерировала много вариантов, потом другая модель, обученная на прошлых A/B-тестах, отобрала и «подправила» кандидатов, а затем лучшие из них пустили в онлайн-эксперимент, где уже реальный трафик распределялся между вариантами адаптивно, то есть система могла быстрее отдавать больше показов удачным креативам.
Зачем такая схема вообще понадобилась? Потому что в рекламе проблема часто не в том, чтобы придумать вариант, а в том, чтобы понять, какой из десятков или сотен вариантов действительно сработает. Проверять всё подряд дорого: в реальном тесте можно показать только ограниченное число креативов, и если слабых вариантов слишком много, на них просто уходит трафик. Поэтому исследователи попытались использовать старые эксперименты как подсказку для генерации новых кандидатов — не как окончательный суд, а как фильтр, который помогает собрать сильную «пачку» вариантов для проверки.
Самый важный вывод в том, что предсказательная модель сама по себе оказалась недостаточно точной, чтобы просто выбрать единственного победителя офлайн. Но она всё равно была полезна: помогала генератору двигаться в сторону более сильных креативов. Это хорошо видно по полевому тесту на 50 вариантах, где лучший креатив из этой схемы обошёл лучший человеческий вариант. Ещё два эксперимента дали похожую картину. Авторы отдельно подчёркивают, что в таких задачах важнее не угадать топ-1 на бумаге, а собрать набор кандидатов, среди которых вообще есть сильные варианты, и уже потом добрать победителя онлайн.
Есть и важный практический вывод: этот подход особенно зависит от того, насколько похожи прошлые эксперименты на текущую задачу. Если у рекламодателя мало истории тестов, слишком узкий набор форматов или результат приходит с большой задержкой, схема может работать заметно хуже.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, то есть работу ещё не проверяли рецензенты журнала. При этом авторы не ограничились только симуляцией: они провели полевой эксперимент и ещё два дополнительных теста, что добавляет веса результатам. Но выводы пока лучше считать привязанными к рекламным данным и истории прошлых A/B-тестов, а не универсальными для всех задач с генеративным ИИ.
Пересказано ИИ по научной статье. Как это устроено