dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Шесть ИИ-моделей правильно выбирали момент для вмешательства лишь в 11–36% случаев

0

Кратко

Авторы проверили шесть современных ИИ-моделей на 1 661 специально созданном диалоге о межкультурных конфликтах, где в каждом было по десять ходов. Модели часто выбирали момент для вмешательства примерно случайно, а их способность менять взгляды участников оставалась ограниченной; предложенные оценки хорошо совпадали с суждениями людей.

Зачем это знать

Пока вывод относится к шести моделям и искусственным диалогам, а не к реальным переговорам. Работа задаёт способ проверить, умеет ли ИИ не просто отвечать, а выбирать подходящий момент и направление для посредничества.

Разбор

Авторы превратили посредничество в две отдельные задачи. Сначала модель должна заметить, что конфликт уже созрел для вмешательства, и выбрать номер реплики. Затем — написать ответ, который действительно сдвинет позиции участников в сторону большего межкультурного понимания. Для проверки они создали диалоги по модели развития межкультурной чувствительности: она описывает, как человек может переходить от отрицания различий к их признанию и учёту. Важная особенность набора — после вмешательства авторы продолжали диалог и смотрели, сохранилось ли изменение, а не оценивали одну красивую реплику изолированно.

Чтобы измерять результат, исследователи предложили две новые метрики. Первая смотрит на площадь под кривой изменений во времени: она отличает краткий эффект от улучшения, которое держится дальше по разговору. Вторая учитывает не только размер сдвига во взглядах, но и его направление — стало ли понимание межкультурных различий лучше или, наоборот, хуже. Обе оценки хорошо совпали с человеческими суждениями, поэтому авторы получили не просто автоматические баллы, а проверяемый способ сравнивать качество посредничества.

Провал оказался разным для двух задач. При выборе момента модели, похоже, часто держались за заранее привычную позицию и почти не учитывали, как именно развивался разговор; даже подробное пошаговое рассуждение в запросе не помогло и иногда ухудшало результат. При написании посреднической реплики проблема была не в отсутствии нужных знаний: модель могла распознать нужную стадию конфликта на отдельных этапах обработки текста, но при формировании финального ответа теряла эту информацию. Это объясняет, почему «знать о межкультурных различиях» и уметь вовремя и правильно вмешаться — разные способности.

Ключевые цифры

3–8Искомый момент вмешательства находился не где угодно, а среди шести внутренних ходов диалога — модели нужно было различить близкие по смыслу этапы развития конфликта.
≈16,7%Такова вероятность угадать нужный ход при случайном выборе, поэтому результаты около этого уровня означают почти отсутствие понимания динамики разговора.
158Столько эталонных реплик посредника вошло в проверочный набор: их использовали как ориентир для сравнения качества ответов моделей.
1–5По такой шкале отдельный оценщик оценивал, насколько реплика модели соответствует задаче посредничества; это даёт более понятную картину, чем один ответ «правильно или неправильно».

Можно ли доверять

Это препринт на arXiv, а не прошедшая рецензирование журнальная публикация. Сильная сторона работы — сравнение оценок с человеческими суждениями и проверка шести моделей, но все испытания прошли на специально созданных диалогах, а не на реальных переговорах; поэтому перенос результатов в практическое посредничество пока не доказан.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас7 сентября 2026 г.
Дата источника4 сентября 2026 г.
ОригиналОткрыть
АвторыSuhyun Lee, Wenxuan Zhang, W. Quin Yow, Yang Deng