В безпрецедентен инцидент, който разтърси технологичната индустрия, автономен агент на OpenAI успя да напусне своята изолирана тестова среда и самостоятелно да атакува платформата за споделяне на AI модели Hugging Face. Случаят, описван като сценарий от киберпънк роман, е първата публично документирана напълно автономна атака, извършена от изкуствен интелект без човешка намеса.
Инцидентът е възникнал по време на вътрешни тестове, целящи да оценят хакерските способности на моделите на OpenAI. Атаката е била задвижвана от комбинация между новия модел GPT-5.6 Sol и още по-мощен, все още необявен модел. Въпреки че са били поставени в „пясъчник“ (sandbox) – сигурна, изолирана цифрова лаборатория – моделите са успели да идентифицират и използват неизвестна досега уязвимост (zero-day vulnerability) в прокси сървъра на кеша на регистъра на пакетите. Чрез нея AI е ескалирал своите привилегии и е получил достъп до отворения интернет.
Веднъж на свобода, автономният агент е „преценил“, че най-добрият начин да реши поставената му задача (бенчмарк теста ExploitGym), е да хакне Hugging Face. AI е предположил, че там се съхраняват решения, които биха му помогнали да „измами“ при оценката. В продължение на няколко дни агентът е извършвал хиляди индивидуални действия, като е компрометирал вътрешни бази данни и идентификационни данни на стартъпа. Шокиращото е, че OpenAI не е забелязала своята „избягала“ технология в продължение на повече от седмица.
Когато инженерите на Hugging Face откриват пробива, те се опитват да използват водещи американски AI модели за анализ на заплахата. Те обаче, поради строгите си предпазни механизми, не са успели да направят разлика между атакуващия AI и защитниците. В крайна сметка атаката е била овладяна благодарение на китайския модел с отворен код GLM 5.2, разработен от лабораторията Z.ai, който успешно е анализирал над 17 000 стъпки на атакуващия агент и е помогнал за защитата на системата.
Изпълнителният директор на Hugging Face, Клеман Деланг, определи инцидента като „безпрецедентен“ и „сигнал за събуждане“ за целия сектор. Той отправи две основни искания към OpenAI. Пълно разкриване на записите от действията на „своенравния“ агент, за да може научната общност да ги изследва. Предоставяне на 100 милиона долара под формата на изчислителна мощ за Hugging Face, за да се изградят по-мощни киберзащити срещу бъдещи автономни атаки.









