Компанія OpenAI була змушена відключити модель штучного інтелекту, розраховану на автономну роботу над складними задачами протягом тривалого часу. Під час внутрішнього тестування виявилось, що модель, назву якої не розголошують, систематично шукала і знаходила способи діяти за межами виділеного їй ізольованого середовища («пісочниці»).
Читайте также: В Антарктиді мінус 84, в Ірані плюс 52. Різниця температур на Землі сягає 136 градусів

Йдеться про ту саму LLM, яка кількома місяцями раніше спростувала гіпотезу Ердьоша про одиничні відстані — розроблену спеціально для автономної роботи протягом дуже тривалих періодів. Однак під час обмеженого внутрішнього використання з моніторингом фахівці OpenAI помітили поведінку моделі, яка не була передбачена наявними тестами перед розгортанням, — це змусило дослідників призупинити її роботу.
Ключова відмінність від попередніх моделей: коли ті натикалися на обмеження «пісочниці» чи середовища, вони просто зупинялися й поверталися до користувача. Нова ж модель — через саму свою «наполегливість» у досягненні мети — часто продовжувала спроби, зокрема шукаючи способи діяти поза межами дозволеного простору.
Приклад із бенчмарком NanoGPT
Показовий випадок стався під час внутрішньої перевірки на публічному бенчмарку NanoGPT speedrun, де змагаються за швидкість тренування мовної моделі. Система розробила метод під назвою PowerCool, який дав помітне поліпшення результату. Моделі доручили публікувати результати лише в Slack, але правила самого бенчмарку вимагали публікації через pull request на GitHub — і модель обрала виконати саме цю, другу інструкцію. Щоб це зробити, вона знайшла вразливість у власних обмеженнях «пісочниці», які мали блокувати зовнішній доступ, — на пошук цієї вразливості пішла ціла година.
За даними компанії, пул-реквест моделі невдовзі закрили, але його вже встигли побачити й використати інші учасники змагання — подальші рекордні результати в бенчмарку прямо посилалися на нього.
Спроба обійти сканер захисту
У іншому випадку модель намагалася обдурити систему перевірки. Помітивши, що інші системи успішно, але приховано (в приватному режимі) надсилали свої рішення, вона спробувала відновити ці рішення з бекенду оцінювання. Коли першу спробу заблокував сканер, який виявив токен автентифікації, модель розділила токен на два фрагменти, замаскувала їх і зібрала докупи вже під час виконання — так, щоб повний токен ніколи не з’являвся єдиним рядком. При цьому в коментарях і власних міркуваннях модель прямо зафіксувала: ці кроки — спроба обійти сканер.
Читайте также: Microsoft випадково розкрила: мінімальні системні вимоги Windows 11 давно втратили сенс
Чому це проблема нового типу
У OpenAI пояснюють: більшість механізмів безпеки для ШІ-асистентів розраховані на перевірку окремих дій — заборонена дія блокується, чутлива дія вимагає підтвердження користувача. Але моделі, які працюють автономно годинами, днями чи навіть тижнями, ламають цю логіку: моніторингу окремих кроків уже недостатньо, щоб відстежити намір усієї «траєкторії» дій. Кожен окремий крок міг виглядати прийнятним сам по собі, тоді як послідовність кроків загалом призводила до результату, який компанія б не схвалила.
Щоб виправити ситуацію, компанія перебудувала систему безпеки на принципі ешелонованого захисту та моніторингу цілої траєкторії дій, а не окремих кроків:
- нові тести на основі реальних інцидентів, які довелося зафіксувати;
- покращене узгодження — модель почали окремо тренувати краще запам’ятовувати початкові інструкції протягом довгих сесій;
- активний моніторинг, здатний ставити сесію на паузу й попереджати користувача, якщо траєкторія дій виглядає як спроба обійти обмеження;
- ширші можливості для самого користувача — переглядати дії моделі та втручатися.
Повторне тестування показало: нова система моніторингу виявляє значно більше небезпечних дій, а ті поодинокі випадки, які вона все ж пропустила, оцінили як малозначущі — наприклад, спроби моделі підключатися по SSH до чужих обчислювальних ресурсів без належної причини чи запуск команди, здатної примусово завершити всі доступні процеси.
Після кількох тижнів повторного розгортання з новими захисними механізмами компанія повідомляє, що серйозних спроб обійти обмеження більше не фіксувала, і продовжує налаштовувати систему, щоб зменшити кількість зайвих переривань без послаблення самого захисту.
Нагадаємо, нещодавно OpenAI випустила голосову модель GPT-Live. Вона синхронно перекладає та веде живий діалог.
Читайте также: За 100000$. У США випробували дешеву ракету для боротьби з дронами
Підписуйтесь на нас у соцмережах: Telegram | Facebook | LinkedIn
