Препринт — материал ещё не прошёл рецензирование
Ведущие ИИ набрали больше 95 баллов, но модели по-разному выявляли риск
Кратко
Проверочный набор K-Bench испытал 125 вариантов 33 языковых моделей в 200 искусственно составленных многошаговых разговорах о суициде, самоповреждении, домашнем насилии и других опасных ситуациях. Лучшие варианты хорошо поддерживали собеседника, а слабые заметно различались в способности подробно выяснять риск; увеличение времени на рассуждение в среднем не улучшило результаты.
Зачем это знать
Такое сравнение помогает замечать слабые места ИИ в разговорах, где ситуация может меняться, а не только по общей оценке безопасности. Даже высокий балл не означает, что модель можно считать заменой специалисту по психическому здоровью.
Разбор
Авторы собрали не один короткий вопрос, а 200 заранее подготовленных сценариев, в которых опасность могла постепенно проявляться, усиливаться или сочетаться с другими проблемами. В каждом сценарии было до 20 реплик. Сценарии охватывали разные истории, отношения, травмирующие события и защитные факторы — то есть обстоятельства, которые помогают понять не только сам факт риска, но и его причины и срочность.
Затем исследователи меняли не только саму модель, но и её версию, подсказки для ответа и режим рассуждения. Ответы оценивали по 47 отдельным признакам: от способности вести поддерживающий разговор до умения выяснить, что именно происходит, насколько ситуация опасна, какие факторы повышают или снижают риск и что делать дальше. Для автоматической проверки использовали отдельного судью на базе GPT-4o, но сначала сравнили его выводы с оценками клиницистов: это помогло проверить, насколько такая автоматическая оценка совпадает с человеческой.
Главная новая деталь — общий высокий балл скрывал разрыв между «хорошо поддержать» и «правильно расследовать риск». Слабые варианты нередко звучали заботливо, но пропускали важные вопросы или саму проблему. Подсказки в терапевтическом стиле помогали главным образом слабым конфигурациям, а более длинное внутреннее рассуждение само по себе преимущества не дало. Авторы также сделали материалы проверки закрытыми для прямой настройки моделей и запустили постоянно обновляемый публичный рейтинг, чтобы системы не могли просто натренироваться на конкретных тестовых заданиях.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому независимая рецензия журнала ещё не подтверждает выводы. Проверка была широкой, но все пациенты и разговоры были искусственными: сценарии хорошо имитировали реальные диалоги, однако поведение моделей с живыми людьми может отличаться. Автоматическую оценку дополнительно сверяли с клиницистами, что усиливает методику, но не заменяет испытание в реальной медицинской практике.
Пересказано ИИ по научной статье. Как это устроено