Препринт — материал ещё не прошёл рецензирование
Шесть ИИ-моделей правильно выбирали момент для вмешательства лишь в 11–36% случаев
Кратко
Авторы проверили шесть современных ИИ-моделей на 1 661 специально созданном диалоге о межкультурных конфликтах, где в каждом было по десять ходов. Модели часто выбирали момент для вмешательства примерно случайно, а их способность менять взгляды участников оставалась ограниченной; предложенные оценки хорошо совпадали с суждениями людей.
Зачем это знать
Пока вывод относится к шести моделям и искусственным диалогам, а не к реальным переговорам. Работа задаёт способ проверить, умеет ли ИИ не просто отвечать, а выбирать подходящий момент и направление для посредничества.
Разбор
Авторы превратили посредничество в две отдельные задачи. Сначала модель должна заметить, что конфликт уже созрел для вмешательства, и выбрать номер реплики. Затем — написать ответ, который действительно сдвинет позиции участников в сторону большего межкультурного понимания. Для проверки они создали диалоги по модели развития межкультурной чувствительности: она описывает, как человек может переходить от отрицания различий к их признанию и учёту. Важная особенность набора — после вмешательства авторы продолжали диалог и смотрели, сохранилось ли изменение, а не оценивали одну красивую реплику изолированно.
Чтобы измерять результат, исследователи предложили две новые метрики. Первая смотрит на площадь под кривой изменений во времени: она отличает краткий эффект от улучшения, которое держится дальше по разговору. Вторая учитывает не только размер сдвига во взглядах, но и его направление — стало ли понимание межкультурных различий лучше или, наоборот, хуже. Обе оценки хорошо совпали с человеческими суждениями, поэтому авторы получили не просто автоматические баллы, а проверяемый способ сравнивать качество посредничества.
Провал оказался разным для двух задач. При выборе момента модели, похоже, часто держались за заранее привычную позицию и почти не учитывали, как именно развивался разговор; даже подробное пошаговое рассуждение в запросе не помогло и иногда ухудшало результат. При написании посреднической реплики проблема была не в отсутствии нужных знаний: модель могла распознать нужную стадию конфликта на отдельных этапах обработки текста, но при формировании финального ответа теряла эту информацию. Это объясняет, почему «знать о межкультурных различиях» и уметь вовремя и правильно вмешаться — разные способности.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не прошедшая рецензирование журнальная публикация. Сильная сторона работы — сравнение оценок с человеческими суждениями и проверка шести моделей, но все испытания прошли на специально созданных диалогах, а не на реальных переговорах; поэтому перенос результатов в практическое посредничество пока не доказан.
Пересказано ИИ по научной статье. Как это устроено