Препринт — материал ещё не прошёл рецензирование
ИИ-агенты сами создали язык, непонятный людям
Кратко
В специально созданной компьютерной игре ИИ-программы с неполной информацией должны были сообщаться под давлением. Они выработали языки со своими правилами, непохожими на английский и непонятными людям: сильные модели создавали такие языки, а слабые учились им по ходу общения.
Зачем это знать
Это указывает на возможный риск общения, которое людям трудно контролировать, но пока речь идёт только о специально созданной симуляции, а не о реально действующих автономных системах.
Разбор
Авторы создали платформу GlossoGen, чтобы наблюдать не отдельный разговор, а появление и передачу языка внутри группы ИИ-агентов. В сценарии SaveVeyru агенты видели лишь часть общей информации и должны были быстро координироваться в совместной игре. Такая постановка важна: раньше похожие эксперименты с непонятными сообщениями часто специально заставляли ИИ обманывать наблюдателя, а здесь агенты действовали сообща и не пытались скрыть свои сообщения.
Под давлением времени и ограниченного бюджета агенты постепенно выработали систему, в которой элементы сообщений меняли смысл по правилам — то есть язык оказался не набором случайных сокращений. Более сильные модели могли придумать новую систему, а более слабые — освоить уже возникшую, просто наблюдая за употреблением и активно проверяя смысл сообщений в общении. Отдельно помогал этап «разбора после игры»: там агенты могли договориться, какие обозначения считать общими.
Авторы связывают это с накопительной культурной эволюцией — способностью сохранять удачные изобретения и строить на них новые. Для безопасности важен практический вывод: непонятный людям обмен может появиться не только при попытке обмануть контрольную систему. Нескольких сильных агентов потенциально достаточно, чтобы распространить такую систему среди большого числа менее способных агентов, хотя в этой работе всё происходило внутри специально спроектированной игры.
Можно ли доверять
Это препринт с arXiv, поэтому другие учёные ещё не проверили работу в рамках рецензирования. Кроме того, выводы основаны на компьютерной симуляции с заданными правилами, а не на автономных системах, работающих в реальном мире; насколько такой эффект проявится там, пока неизвестно.
Пересказано ИИ по научной статье. Как это устроено