Препринт — материал ещё не прошёл рецензирование
Рост моделей обычно улучшает социальные симуляции, но не все
Кратко
Авторы проверили, как меняется качество социальных симуляций у больших языковых моделей при росте вычислений и размера модели. В большинстве задач качество растёт, но долгосрочный прогноз и мнения из слабо представленных групп улучшаются хуже, а в задачах про когнитивные искажения и эвристики рост с 0.5B до 8B параметров почти не помог.
Зачем это знать
Работа показывает, что масштабирование не одинаково помогает во всех задачах социального моделирования: где-то прогресс идёт быстро, а где-то заметно замедляется. Это важный ориентир для дальнейших исследований, особенно в низкоресурсных доменах и для мнений групп, слабо представленных в веб-данных.
Разбор
Авторы не просто сравнили «большую» и «маленькую» модель, а собрали целую линейку из 85 языковых моделей одной архитектуры и посмотрели, как меняется качество, если постепенно увеличивать вычисления на обучении. То есть они проверяли не один удачный экземпляр, а общий тренд: становится ли модель лучше именно за счёт масштаба, если обучать её в одинаковых условиях на веб-корпусе текстов.
Дальше они сделали ещё один шаг: взяли 35 более крупных открытых моделей — вплоть до 70 миллиардов параметров — и связали их обычные показатели качества с тем, как они ведут себя в социальных задачах. Для этого использовали два этапа: сначала описали, как падает ошибка при росте вычислений, а потом перевели эту ошибку в ожидаемую точность. Так удалось не только увидеть текущую картину, но и прикинуть, как такие модели будут вести себя дальше, если их продолжать масштабировать.
Самый важный нюанс в результатах — рост помогает не всем задачам одинаково. Лучше всего масштабирование работает там, где речь идёт о поведении и мнениях людей из групп, которые хорошо представлены в англоязычном вебе. А вот долгосрочные прогнозы и мнение мало представленных групп растут медленнее, особенно если задача почти не связана с общими тестами на знание и рассуждение. Ещё один неприятный сюрприз: в задачах про человеческие когнитивные искажения и эвристики даже переход от 0.5B до 8B параметров почти не дал заметного выигрыша, хотя модели дополнительно дообучали. Это хороший пример того, что «больше» действительно часто значит «лучше», но далеко не всегда и не везде.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не проверяли независимые рецензенты. При этом работа опирается не на одну модель, а на большой набор из 85 плюс 35 более крупных систем, так что выводы выглядят основательно. Но результаты всё равно относятся к конкретным архитектурам, датасету и в основном англоязычным веб-данным, поэтому для других языков и других типов социальных задач картина может отличаться.
Пересказано ИИ по научной статье. Как это устроено