dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Советы ИИ о покупках меняются от запроса к запросу

1

Кратко

Авторы проверили 1 536 ответов ChatGPT, Gemini и Google Search на реальные вопросы о товарах. ChatGPT говорил о личном выборе в 79% рекомендаций, а в интерфейсах ChatGPT и Gemini для одного и того же запроса совпадали в среднем лишь 5,4% указанных сайтов.

Зачем это знать

Один ответ ИИ нельзя считать устойчивым или типичным советом для обычного покупателя: результат зависит от повторного запроса и способа доступа к сервису.

Разбор

Авторы собрали набор из 2 528 настоящих вопросов о покупках, а затем сравнили не только сами ответы, но и условия, в которых их получали. Они отдельно проверяли веб-версии ChatGPT и Gemini, их интерфейсы для разработчиков — API — и блок AI Overviews в Google Search. Это важно: API даёт исследователю больше контроля, но не показывает сервис ровно так, как его видит обычный пользователь, поэтому считать API полной заменой интерфейсу нельзя.

Чтобы проверить повторяемость, авторы взяли 117 вопросов и задали каждый по три раза в каждом из пяти режимов. Они сравнивали, какие товары и сайты появлялись снова, а также какие уровни источников раскрывал сервис: например, не только ссылки, но и то, как источники были представлены в ответе. Для разметки исследователи сначала вручную согласовали правила на тестовой выборке, а затем проверили работу языковой модели на отдельном наборе с эталонными ответами.

Главный дополнительный вывод — нестабильность касается не только списка рекомендаций. Меняется и картина источников, на которых строится совет: у ChatGPT и Gemini интерфейс и API показывают разные наборы сайтов и по-разному раскрывают информацию о них. Поэтому проверка одного ответа или только разработческого доступа может создать ложное впечатление о том, какой совет обычно получает покупатель.

Ключевые цифры

2 528 запросовИсследователи начали с большой подборки реальных вопросов о покупках, а не с нескольких придуманных примеров.
117 запросовНа отдельной подвыборке можно было подробно проверить, насколько меняется ответ при повторении одного и того же вопроса.
3 разаКаждый из этих вопросов повторили трижды, поэтому авторы проверяли не случайную разницу между двумя ответами, а устойчивость рекомендаций.
76,7% сравненийВ подавляющем большинстве сопоставлений ChatGPT и Gemini не имели ни одного общего домена среди показанных сайтов.

Можно ли доверять

Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Сильная сторона — сравнение пяти режимов доступа и повторные запросы; при этом исследование описывает ответы популярных сервисов в конкретных условиях, а не все возможные версии их работы и не реальные покупки пользователей.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас17 сентября 2026 г.
Дата источника16 сентября 2026 г.
ОригиналОткрыть
АвторыLucas G. Uberti-Bona Marin, Thales Bertaglia, Giovanni Astante, Bram Rijsbosch, Gijs van Dijck, Anikó Hannák, Gerasimos Spanakis, Konrad Kollnig