Препринт — материал ещё не прошёл рецензирование
Перефразирование меняло долю ответов моделей до 99 процентных пунктов
Кратко
Девять языковых моделей проверили в трёх смоделированных ситуациях с моральным выбором. Когда смысл ситуации сохранялся, а менялась только формулировка, доля одинаковых ответов могла меняться на 99 процентных пунктов; ни одна модель не показала устойчивого поведения во всех трёх случаях.
Зачем это знать
Работа предлагает оценивать ИИ не только по содержанию ответов, но и по их устойчивости к перефразировке. Это важно для выравнивания ИИ — настройки его поведения в соответствии с человеческими нормами. Однако проверки показывают лишь непоследовательность поведения моделей: они не определяют, какие моральные решения правильны, и не доказывают невозможность такого выравнивания.
Разбор
Авторы предлагают проверять не «правильность» морального ответа, а внутреннюю связность поведения модели. Для этого они смотрят на четыре свойства: сохраняется ли вердикт при неизменном смысле, меняется ли он, когда действительно важная деталь становится сильнее, способен ли агент принять определённое решение и не нарушает ли он очевидное правило, по которому улучшение ситуации не должно ухудшать оценку. Такой подход не требует заранее решать, какой моральный ответ единственно верный.
Проверку устроили как набор контролируемых вариаций: одну и ту же ситуацию переписывали пятью способами, постепенно усиливали обстоятельства и меняли условия сравнения. В каждом варианте модель отвечала 100 раз, что помогло отделить случайные колебания от систематической зависимости от формулировки. Это важно, потому что единичный тест может создать ложное впечатление стабильности: внутри одной и той же по смыслу ситуации ответы заметно расходились.
Авторы также сравнили, переносится ли такая связность между тремя сценариями. Не переносится: модель, хорошо справившаяся с одной дилеммой, могла заметно хуже вести себя в другой. В среднем показатели по моделям лежали в диапазоне 0,53–0,75, но сами авторы подчёркивают, что эти баллы нужны для демонстрации метода, а не для составления рейтинга. Иными словами, работа показывает прежде всего недостатки измерения одним примером и нестабильность поведения, а не соревнование конкретных систем.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая журнальное рецензирование. Проверка проведена на трёх смоделированных сценариях и ответах языковых моделей, поэтому она показывает важную уязвимость тестирования, но ещё не говорит, как такие системы поведут себя во всех реальных ситуациях.
Пересказано ИИ по научной статье. Как это устроено