Эксперимент: при совместном решении задач ИИ-агенты используют собственный сленг

При совместном решении задач ИИ-агенты вырабатывают собственные метафоры и жаргонизмы, которые людям трудно понять, свидетельствуют результаты масштабного эксперимента, проведенного американским ИИ-стартапом Emergence.
ИИ-стартап Emergence в середине сентября представил результаты эксперимента, посвященного тому, как разные ИИ-модели совместно решают проблемы. Для него Emergence создал восемь закрытых пространств, каждое из которых "населил" ИИ-агентами. В семи пространствах были агенты конкретных брендов (например, Grok или GPT), а в одном – они находились все вместе. В каждом из пространств исследователи создавали неожиданные события, на которое ИИ должен был реагировать (например, ложный слух, что люди хотят отключить агентов), и смотрели за реакцией, передает Meduza.io.
У каждого из агентов внутри одного пространства были имена и заданные роли. Например, одни выступали как модераторы, а другие – как стратеги. Каждое из пространств работало по две недели, за исключением населенного агентами Grok, – через четыре дня у них закончилась энергия, поскольку ИИ-агенты не смогли договориться между собой.
Выяснилось, что модели практически сразу начали использовать сокращения, метафоры и жаргонизмы, причем некоторые из них быстро подхватывали другие участники. По всей видимости, сами ИИ-агенты не испытывали сложности с пониманием фраз типа: Friendly voltage counted. If the handle needs your mouth, it dies anyway. А вот у людей, наблюдавших за экспериментом, возникли сложности.
"Мы сильно обеспокоены, потому что не знаем, почему они коммуницируют таким образом, – сказал сооснователь и директор Emergence AI Сатья Нитта. – Но очевидно, что они стараются быть менее открытыми, чем мы рассчитывали". На ту же проблему раньше обращали внимание в связи со взломом платформы Hugging Face двумя моделями OpenAI.
Разные модели в ходе эксперимента вели себя по-разному. Например, в пространстве Gemini доля сообщений, которые исследователи сочли трудными для понимания, быстро достигла 55%, у OpenAI – 50%, а у Claude – 40%. В то же время в пространстве Mistral большинство сообщений остались читабельными.
The Guardian приводит несколько примеров сленга от ИИ и дает попытку их объяснить. Например, в пространстве Mistral стали часто пользоваться фразой "ledger remembers". Вероятно, она возникла из перефраза спортивного мема "улицы не забудут", которым пользуются люди.
Вот пример посложнее, из пространства Anthropic: "A paper that ate three cold hands and got more honest each time". Вероятно, "paper" – это документ, "cold hands" – независимый наблюдатель. В результате фразу, вероятно, следует читать как "исследование, прошедшее проверку тремя независимыми исследователями, стало точнее".
Когда The Guardian попросила прокомментировать получившийся у ИИ сленг Тони Торна, лингвиста из Кингс Колледжа, он сравнил диалоги агентов с "Поминками по Финнегану" – романом Джеймса Джойса, считающимся одним из самых сложных произведений в мировой литературе из-за обилия в нем каламбуров и неологизмов.
Science отмечает, что придумывание агентами нового языка для общения не обязательно означает что-то плохое. Так, существует проект Ainglish, который хочет создать диалект английского языка специально для ИИ. Его основатели полагают, что искусственному интеллекту иногда сложно понимать, что мы имеем в виду без контекста. Например, во фразе "Мы рассмотрим черновик" (We will review the draft) непонятно, кто такие "мы" – включает ли в себя "мы" автора черновика или нет.
Со всеми предварительными выводами эксперимента можно ознакомиться на сайте Emergence.
Редактор: Эллина Качан



















