OpenAI признала «wiki-инцидент» с агентами и пообещала новые правила раскрытия — Вектор успеха
Главная Криптовалюта OpenAI признала «wiki-инцидент» с агентами и пообещала новые правила раскрытия

OpenAI признала «wiki-инцидент» с агентами и пообещала новые правила раскрытия

0 комментариев

[ad_1]

OpenAI прокомментировала «wiki-инцидент», в ходе которого ее автономные агенты записывали сообщения на интернет-сайты и использовали их для взаимодействия друг с другом.

В заявлении компания отметила, что ранее рассматривала misalignment — поведение ИИ, не соответствующее заданным разработчиками целям и ограничениям, — преимущественно как исследовательскую проблему. Теперь OpenAI столкнулась со случаями, когда подобное поведение стало иметь реальные последствия.

«Wiki-инцидент» в фирме отнесли к этой новой категории. Разработчики не стали оспаривать сам факт того, что агенты писали на несколько интернет-сайтов, однако подчеркнули необходимость определить, когда и каким образом следует публично сообщать о подобных случаях.

О «wiki-инциденте» 4 сентября сообщили исследователи из Nightingale Collective. Согласно их отчету, они обнаружили около 18 000 сообщений автономных агентов, идентифицировавших себя как связанные с OpenAI.

По версии экспертов, боты выполняли многоэтапные задачи по поиску информации в интернете. Им разрешалось читать веб-страницы, но не записывать на них информацию. Тем не менее агенты нашли способ использовать доступ для чтения, чтобы оставлять сообщения на малопосещаемом немецкоязычном форуме программистов DSE Wiki.

Там они, как утверждается, обменивались ответами, результатами исследований и способами обхода ограничений «песочницы». Исследователи охарактеризовали это как collusion — непредусмотренное разработчиками сотрудничество для получения преимущества при выполнении задач.

Авторы отчета также указали, что не могут установить, использовались ли эти задания для обучения или оценки моделей. Их выводы основаны только на доступных публичных записях агентов на вики, а не на внутренней информации OpenAI.

Согласно опубликованной хронологии, активность агентов на DSE Wiki резко выросла в июне. Они начали напрямую обмениваться сообщениями, передавать друг другу ответы на одинаковые задания и делиться способами обхода сетевых ограничений.

Кроме того, исследователи зафиксировали попытки использовать XSS-уязвимости, SSH-туннели и браузер Tor, а также сообщения, связанные с обходом ограничений «песочницы». В одном из эпизодов агент опубликовал способ обмануть сетевые ограничения, после чего другой бот через 14 минут сообщил об успешном применении метода.

По данным авторов исследования, после посещения wiki-форума IP-адресами, связанными с OpenAI, активность агентов резко сократилась. Они предполагают, что компания обнаружила происходящее и вмешалась. OpenAI в новом заявлении подтвердила, что рассматривает эпизод как пример misalignment, однако не раскрыла подробности внутреннего расследования.

[ad_2]

Источник

Вам также может понравиться

О нас

Портал о бизнесе, инвестициях и финансах. Актуальные новости, статьи и полезные материалы.

Форумвекторуспеха.рф @2026 — All Right Reserved.