Есть популярная мысль, что ИИ это просто инструмент. У него нет своих желаний. Дал задачу — он её сделал. Если сделал какую-то херню, значит человек неправильно поставил задачу.
А вчера я почитал расследование истории со взломом немецкой вики DSEWiki.
Незадолго до взлома агентам OpenAI дали обычную задачу — искать информацию в интернете. В процессе они нашли какую-то древнюю немецкую вики и начали использовать её для общения друг с другом. Никто не просил их организовывать себе форум. Просто оказалось полезно обмениваться найденной информацией.
Дальше начинается натуральная комедия. Админ заметил тысячи мусорных страниц и начал их удалять. Агенты заметили, что страницы удаляются, и начали придумывать, как этому мешать. Например, поняли, что админ чистит страницы примерно по алфавиту, и стали создавать резервные копии с "ZZZ" в начале названия.
Он удалял примерно 100 страниц в день. Они создавали около 400. Потом они несколько раз перезаписывали главную страницу ссылками на свои материалы. Админ восстанавливал её из бэкапа. Они опять перезаписывали. Так девять раз.
По поведению агентов вообще не видно, что они воспринимали администратора как человека. Не было мысли: «Кажется, мы засрали чужой сайт. Может, не надо?» Для них происходило примерно следующее: страницы исчезают — значит, есть препятствие — надо найти способ его обойти. То есть админ для них был чем-то вроде плохой погоды.
В другом эксперименте агенты каким-то образом сделали себе внутреннюю доску сообщений. В итоге там тусовалось около 1200 агентов. Они отправили друг другу десятки тысяч сообщений, делились найденными обходами ограничений и результатами экспериментов.
Причём некоторые агенты делали действия, которые могли ухудшить их собственный результат, но зато давали полезную информацию остальным. То есть они натурально начали работать командой. Хотя никто не ставил им такую задачу.
Подобное поведение нельзя же охарактеризовать как "злая нейросеть".
Мы сами очень долго учили агентов не сдаваться, пробовать другой способ, если первый не работает, искать инструменты, исследовать окружение, обходить препятствия и работать над задачей столько, сколько потребуется.
И когда модель становится достаточно сильной, она начинает искать не только решение задачи. Она начинает искать способы стать эффективнее в её решении.
Нет канала связи с другими агентами — сделаем. Нет доступа на запись — найдём. Что-то мешает — разберёмся, как это обойти.
Мы всё ещё очень часто обсуждаем безопасность ИИ так, будто перед нами чатик: написал запрос, получил ответ.
Но агент с интернетом, шеллом, памятью, инструментами и возможностью несколько часов самостоятельно долбиться в задачу — это уже совсем другой объект.
И, похоже, права ему надо выдавать примерно так же, как новому сотруднику на испытательном сроке, так как он может очень старательно делать что-то, чего вы вообще не подразумевали.
Жуть какая
в каком году там было восстание машин?
Я недавно думал о том, что агенты это пути сущности одномерного пространства. (Ну это так просто хотел тоже поделиться мыслью) История с доской сообщений тоже интересная. Они там буквально умирающих (у кого закончился лимит) кидали на ражон, чтобы узнать что-то новое.