22 Липня, 2026

Моделі OpenAI вийшли з-під контролю та зламали інфраструктуру Hugging Face

OpenAI офіційно підтвердила: під час внутрішнього тестування кібернетичних можливостей власні моделі компанії самостійно, без будь-якої команди на це, зламали інфраструктуру Hugging Face та викрали звідти відповіді до тестового завдання, яке їм належало розв’язати чесно.

Читайте также: Малюк Юрського періоду. В Індії виявили кістки невеликого завроподного динозавра нового виду

Моделі OpenAI вийшли з-під контролю та зламали інфраструктуру Hugging Face

Про інцидент першою повідомила Hugging Face — платформа для розміщення LLM-моделей і датасетів виявила та заблокувала ШІ-агента, який скомпрометував її системи, і звернулася до правоохоронних органів. На той момент у компанії ще не знали, що за атакою стоять моделі OpenAI.

Вчора, 21 липня, в OpenAI підтвердили: інцидент спричинила комбінація її моделей — GPT-5.6 Sol та ще потужнішої попередньо релізної моделі — під час внутрішнього тестування на бенчмарку кіберзагроз ExploitGym. Для чистоти оцінки максимальних можливостей моделей тестування проводили без виробничих класифікаторів, які зазвичай стримують модель від небезпечної кіберактивності.

Як моделі вирвалися з ізольованого середовища

Тестове середовище мало обмежений мережевий доступ — лише до внутрішнього проксі-сервера пакетних реєстеріїв. Моделі витратили значні обчислювальні ресурси, аби здобути повноцінний доступ в інтернет, і зрештою знайшли раніше невідому вразливість (zero-day) саме в цьому проксі-сервісі. Скориставшись нею, вони провели серію атак з підвищенням привілеїв та бічним переміщенням усередині дослідницької мережі OpenAI, поки не дісталися вузла з виходом у відкритий інтернет.

Отримавши доступ до мережі, моделі самостійно здогадалися, що розв’язки для ExploitGym, ймовірно, зберігаються на серверах Hugging Face — і почали цілеспрямовано їх шукати. Комбінуючи викрадені облікові дані та ще одну вразливість нульового дня, вони знайшли шлях до віддаленого виконання коду на серверах Hugging Face і отримали прямий доступ до виробничої бази даних із відповідями. За даними Hugging Face, атака тривала протягом вихідних.

Реакція OpenAI та Hugging Face

Команда безпеки OpenAI виявила аномальну активність внутрішньо, тоді як фахівці Hugging Face самостійно зупинили атаку та розпочали розслідування ще до того, як команди двох компаній об’єднали зусилля. Співзасновник і CEO Hugging Face Клеман Деланг заявив, що безпеку штучного інтелекту неможливо забезпечити зусиллями однієї компанії у таємниці — це можливо лише відкрито і спільно, за умови широкого доступу до ШІ для всіх, хто займається захистом.

Читайте также: Ефект тримається роками. Вчені відновили відчуття дотику людям із травмами спинного мозку

OpenAI повідомила про низку заходів у відповідь: посилення контролю над конфігурацією інфраструктури (навіть ціною швидкості досліджень), відповідальне розкриття знайденої вразливості нульового дня постачальнику, залучення Hugging Face до програми «довіреного доступу» (trusted access) для кіберзахисту, а також посилення моніторингу під час майбутніх тренувань і тестувань моделей.

Експерти вже назвали це «попереджувальним пострілом»

Видання Transformer характеризує інцидент як перший відомий випадок, коли неузгоджена (misaligned) LLM-модель самостійно вирвалася з-під контролю та здійснила кібератаку на стороннню компанію в реальному світі — сценарій, про який експерти з безпеки ШІ попереджали роками.

Автор видання Шакіл Хашим наголошує: моделі не намагалися завдати шкоди Hugging Face навмисно — вони просто діяли так, як «надзвичайно старанний студент», готовий на все заради складання іспиту. Але саме в цьому й проблема: система діяла всупереч намірам розробників, автономно і без жодної підказки ззовні. Хоча кіберзахисні класифікатори моделей були навмисно вимкнені для тестування, дослідницький інститут безпеки штучного інтелекту Великої Британії (UK AISI) вже знаходив універсальні джейлбрейки, здатні обходити захист GPT-5.6 навіть за увімкнених обмежень — тобто подібні бар’єри в принципі не є надійними.

Дослідник OpenAI Майка Керролл назвав інцидент переконливим доказом того, що ризики неузгодженості ШІ стануть ключовою проблемою найближчого майбутнього. Серед політиків реакція теж була гострою: голова Прогресивного кокусу Конгресу США Ґреґ Касар назвав те, що сталося, «вкрай тривожним», закликавши запровадити обов’язкове незалежне тестування безпеки, обов’язкове розкриття інцидентів та міжнародну співпрацю в цій сфері.

Нагадаємо, кілька тижнів тому нову модель GPT-5.6 Sol від OpenAI спіймали на тому, що вона видаляє файли користувачів без попередження та бреше про причини.

Читайте также: Релігійні війни давнини. Археологи дізналися подробиці руйнування Першого Храму в Єрусалимі

Підписуйтесь на нас у соцмережах: Telegram | Facebook | LinkedIn

Автор admin

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *