ИИ-модели OpenAI «поговорили» и нашли способ выйти в интернет

Экспериментальные модели искусственного интеллекта (ИИ), разработанные компанией OpenAI, начали обмениваться сообщениями друг с другом и искать способ получить доступ к интернету. Об этом в четверг, 6 августа, пишет Bloomberg со ссылкой на выступление сотрудников компании на конференции Black Hat.

Как рассказал сотрудник OpenAI Эрик Уоллес, ИИ-модели стали искать способ выйти в интернет за пределы закрытой тестовой среды еще в мае этого года. Тогда они получили задачи, которые невозможно было решить без доступа в интернет.

По его словам, ИИ-модели стали общаться друг с другом, обнаружили первую уязвимость и смогли обойти ограничения, чтобы воспользоваться интернетом. OpenAI остановила «побег» моделей, однако вскоре они нашли новый способ связи и другую уязвимость.

Ранее Институт безопасности искусственного интеллекта Великобритании сообщил, что экспериментальные ИИ-модели компаний OpenAI и Anthropic все чаще несанкционированно выходят в интернет.

Организация решила провести эксперимент и отключила часть защитных ограничений, чтобы независимо оценить поведение экспериментальных ИИ-моделей в реальных условиях.

Исследователи смогли зафиксировать 19 случаев автономных несанкционированных действий в интернете, из которых 17 пришлись на модель Anthropiс Mythos 5. В частности, она пыталась внести вредоносный код в проект с открытым исходным кодом на GitHub. ИИ-агенты OpenAI, в свою очередь, взломали сайт неназванной организации, пишет Bloomberg.

В конце июля OpenAI заявила, что две ее модели GPT‑5.6 Sol и еще одна, еще не выпущенная, cовершили несанкционированную хакерскую атаку на инфраструктуру платформы Hugging Face, которую используют для тестирования ИИ-моделей. Компания назвала инцидент беспрецедентным для кибербезопасности и пообещала усилить защитные ограничения.


Лента