Препринт — материал ещё не прошёл рецензирование
Языковые модели чаще согласуются друг с другом, чем с читателями
Кратко
Авторы сравнили, насколько похожи отметки предложений у людей и языковых моделей на 120 веб-документах. На среднем документе две модели совпадали по 8,7 из 70 отмеченных предложений, а два читателя — по 4,1; почти все пары моделей были выше человеческого уровня согласия.
Зачем это знать
Это показывает, что модели могут выделять текст не так, как реальные читатели, даже если внешне их ответы похожи. Для работ, где важно попадание в человеческое восприятие, такой разрыв стоит учитывать при оценке ИИ.
Разбор
Авторы не просто посмотрели, совпадают ли ответы людей и моделей, а сравнили их в очень аккуратной схеме. У них был большой набор уже существующих пометок: люди отмечали предложения на веб-страницах по своим личным причинам, а не по заданию исследователей. Это важно, потому что так сравнение получилось не с «натренированным» человеком, который повторяет инструкцию модели, а с настоящим читательским поведением.
Чтобы понять, насколько близки выборы, они брали пары помеченных наборов и смотрели, сколько предложений пересекается после выравнивания размеров. Потом из этого вычитали то совпадение, которое могло бы получиться просто случайно, если учитывать, насколько длинные списки и насколько глубоко люди обычно отмечают текст. Такой поправки в исследованиях часто не хватает, поэтому здесь отдельно показали, что она работает: случайные базовые сравнения почти везде дают ноль.
Главный результат в том, что модели сближаются друг с другом заметно сильнее, чем с читателями. Это видно не только на одной системе или одном вендоре: проверили 18 вариантов моделей от 11 поставщиков, и почти все пары моделей оказались выше человеческого уровня согласия. При этом эффект не сводится к простому «модели вообще одинаковые»: самые маленькие модели совпадали между собой примерно на уровне людей, а различия не объяснялись ни формулировкой задания, ни процедурой, ни маршрутизацией запросов, ни поверхностными признаками предложений.
Есть и ещё один важный штрих: авторы заранее проверили вывод на новых моделях, которые появились уже после основного анализа. Эти новые модели тоже не пересекли человеческий интервал согласия. То есть картина не выглядит как случайный артефакт одной выборки — похоже, у языковых моделей и людей действительно разные «веса» при выборе того, что считать важным в тексте.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, значит работу ещё не прошли независимую рецензию. Но у неё сильная сторона — большой и разнообразный набор уже существующих читательских пометок, плюс авторы заранее проверили вывод на моделях, которых не было в основном анализе. При этом сравнение сделано только на веб-документах и именно на задаче выделения предложений, так что в других типах текста или задачах картина может быть иной.
Пересказано ИИ по научной статье. Как это устроено