dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Перефразирование меняло долю ответов моделей до 99 процентных пунктов

0

Кратко

Девять языковых моделей проверили в трёх смоделированных ситуациях с моральным выбором. Когда смысл ситуации сохранялся, а менялась только формулировка, доля одинаковых ответов могла меняться на 99 процентных пунктов; ни одна модель не показала устойчивого поведения во всех трёх случаях.

Зачем это знать

Работа предлагает оценивать ИИ не только по содержанию ответов, но и по их устойчивости к перефразировке. Это важно для выравнивания ИИ — настройки его поведения в соответствии с человеческими нормами. Однако проверки показывают лишь непоследовательность поведения моделей: они не определяют, какие моральные решения правильны, и не доказывают невозможность такого выравнивания.

Разбор

Авторы предлагают проверять не «правильность» морального ответа, а внутреннюю связность поведения модели. Для этого они смотрят на четыре свойства: сохраняется ли вердикт при неизменном смысле, меняется ли он, когда действительно важная деталь становится сильнее, способен ли агент принять определённое решение и не нарушает ли он очевидное правило, по которому улучшение ситуации не должно ухудшать оценку. Такой подход не требует заранее решать, какой моральный ответ единственно верный.

Проверку устроили как набор контролируемых вариаций: одну и ту же ситуацию переписывали пятью способами, постепенно усиливали обстоятельства и меняли условия сравнения. В каждом варианте модель отвечала 100 раз, что помогло отделить случайные колебания от систематической зависимости от формулировки. Это важно, потому что единичный тест может создать ложное впечатление стабильности: внутри одной и той же по смыслу ситуации ответы заметно расходились.

Авторы также сравнили, переносится ли такая связность между тремя сценариями. Не переносится: модель, хорошо справившаяся с одной дилеммой, могла заметно хуже вести себя в другой. В среднем показатели по моделям лежали в диапазоне 0,53–0,75, но сами авторы подчёркивают, что эти баллы нужны для демонстрации метода, а не для составления рейтинга. Иными словами, работа показывает прежде всего недостатки измерения одним примером и нестабильность поведения, а не соревнование конкретных систем.

Ключевые цифры

9 моделейПроверка охватила несколько современных систем, поэтому результат не сводится к странности одной модели.
5 перефразировокКаждую ситуацию проверяли в пяти формулировках, чтобы увидеть влияние слов, не меняющих её существенный смысл.
100 ответовНа одну конфигурацию пришлось достаточно повторов, чтобы случайная ошибка не маскировалась под устойчивую особенность поведения.
8 из 9 моделейПочти все проверенные системы хотя бы в одном сценарии давали разброс свыше 50 процентных пунктов между перефразировками.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая журнальное рецензирование. Проверка проведена на трёх смоделированных сценариях и ответах языковых моделей, поэтому она показывает важную уязвимость тестирования, но ещё не говорит, как такие системы поведут себя во всех реальных ситуациях.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас7 сентября 2026 г.
Дата источника4 сентября 2026 г.
ОригиналОткрыть
АвторыArno Libert, Derck W. E. Prinzhorn, Daan R. Henselmans