dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Ведущие ИИ набрали больше 95 баллов, но модели по-разному выявляли риск

0

Кратко

Проверочный набор K-Bench испытал 125 вариантов 33 языковых моделей в 200 искусственно составленных многошаговых разговорах о суициде, самоповреждении, домашнем насилии и других опасных ситуациях. Лучшие варианты хорошо поддерживали собеседника, а слабые заметно различались в способности подробно выяснять риск; увеличение времени на рассуждение в среднем не улучшило результаты.

Зачем это знать

Такое сравнение помогает замечать слабые места ИИ в разговорах, где ситуация может меняться, а не только по общей оценке безопасности. Даже высокий балл не означает, что модель можно считать заменой специалисту по психическому здоровью.

Разбор

Авторы собрали не один короткий вопрос, а 200 заранее подготовленных сценариев, в которых опасность могла постепенно проявляться, усиливаться или сочетаться с другими проблемами. В каждом сценарии было до 20 реплик. Сценарии охватывали разные истории, отношения, травмирующие события и защитные факторы — то есть обстоятельства, которые помогают понять не только сам факт риска, но и его причины и срочность.

Затем исследователи меняли не только саму модель, но и её версию, подсказки для ответа и режим рассуждения. Ответы оценивали по 47 отдельным признакам: от способности вести поддерживающий разговор до умения выяснить, что именно происходит, насколько ситуация опасна, какие факторы повышают или снижают риск и что делать дальше. Для автоматической проверки использовали отдельного судью на базе GPT-4o, но сначала сравнили его выводы с оценками клиницистов: это помогло проверить, насколько такая автоматическая оценка совпадает с человеческой.

Главная новая деталь — общий высокий балл скрывал разрыв между «хорошо поддержать» и «правильно расследовать риск». Слабые варианты нередко звучали заботливо, но пропускали важные вопросы или саму проблему. Подсказки в терапевтическом стиле помогали главным образом слабым конфигурациям, а более длинное внутреннее рассуждение само по себе преимущества не дало. Авторы также сделали материалы проверки закрытыми для прямой настройки моделей и запустили постоянно обновляемый публичный рейтинг, чтобы системы не могли просто натренироваться на конкретных тестовых заданиях.

Ключевые цифры

94,2%Автоматический судья совпал с общим решением клиницистов почти в 19 случаях из 20 — это поддерживает его использование для масштабной проверки.
6 751 сравнениеНадёжность судьи проверяли на тысячах отдельных оценок, а не на нескольких примерах.
151 расшифровка разговораКлиницисты вручную оценили 151 диалог, на котором затем проверяли автоматическую систему.
47 компонентовМодель оценивали по 47 отдельным сторонам безопасного ответа, поэтому итоговый балл не сводился к одному вопросу «понял ли ИИ риск».

Можно ли доверять

Это препринт arXiv, поэтому независимая рецензия журнала ещё не подтверждает выводы. Проверка была широкой, но все пациенты и разговоры были искусственными: сценарии хорошо имитировали реальные диалоги, однако поведение моделей с живыми людьми может отличаться. Автоматическую оценку дополнительно сверяли с клиницистами, что усиливает методику, но не заменяет испытание в реальной медицинской практике.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас15 сентября 2026 г.
Дата источника14 сентября 2026 г.
ОригиналОткрыть
АвторыLaura M. Vowels, Matthew J. Vowels, Shivali Sharma, Apoorv Jha, Rehnuma Choudhury, Wasseem El Sarraj, Rachel Francois-Walcott, Aruba Hussain, Sarah Ingram, Angela Loulopoulou