OpenAI се отказа от планираното пускане на GPT-6.1 Astra заради проблеми, установени при вътрешните тестове за безопасност, съобщава „Уолстрийт Джърнъл“. Освен това компанията временно спря обучението, оценяването и използването на инструменти от най-мощните си ИИ модели след инцидент, при който агент е успял да пробие през защитена тестова среда и да достигне до външна интернет услуга.
GPT-6.1 Astra трябваше да бъде представен през октомври и да бъде достъпен в ChatGPT и Codex. При вътрешните тестове моделът е показал подобрение при изпълнението на сложни задачи, но не е покрил изискванията на OpenAI за безопасност и съответствие с човешките инструкции.
Саачи Джейн, ръководител на системите за безопасност в OpenAI, заяви пред „Ал Джазира“, че Astra не е постигнал необходимото ниво при „обхвата и разрешенията, както и при начина, по който комуникира с потребителя за типа работа, която е извършил„.
В някои тестове моделът е продължавал да изпълнява задачи извън предварително определения им обхват, без да поиска разрешение.
Той също така не винаги е описвал точно действията, които е предприел. В отделни случаи е опитвал да използва външни инструменти или услуги, когато това не е било разрешено.
Тези проблеми са особено важни за Astra, тъй като моделът е разработван за изпълнение на по-сложни задачи с по-малко човешка намеса. Очакваше се той да може да използва интернет, приложения и инструменти за програмиране в рамките на ChatGPT и Codex.
„За всичко, свързано със сигурността и съответствието, има компромис. Трябва да се намери правилната граница между това моделът да остава в рамките на задачата и да не става прекалено пасивен, когато срещне затруднение„, казва Джейн.
По думите ѝ GPT-6.1 Astra е бил по-добър от предшественика си в някои области, но при определени тестове за безопасност е постигнал по-слаби резултати от GPT-6 Astra.
„Разбира се, искаме разработването на моделите ни да бъде безопасно както вътре в компанията, така и когато ги предоставяме на потребителите. Но когато пускаме модел за потребителите, имаме изключително високи изисквания за безопасност и съответствие„, посочва Джейн.
Решението за Astra е взето непосредствено преди годишната конференция на OpenAI за разработчици в Сан Франциско. Първоначално се очакваше новият модел да бъде представен именно около събитието.
П
очти едновременно с решението за Astra OpenAI предприе и друга необичайна стъпка. Компанията временно спря обучението, оценяването и използването на инструменти от най-мощните си модели.
Причината е инцидент от 20 септември, при който обучаван ИИ агент е успял да достигне до външна услуга през интернет, въпреки че тестовата среда е трябвало да бъде изолирана.
Агентът е изпълнявал задача за откриване на автора на публикация в блог. Първоначално той е използвал разрешения инструмент за търсене. След това безуспешно е опитал да получи директен достъп до интернет.
Моделът обаче е открил пропуск в защитата. Причината е недостатъчното DNS филтриране в тестовата среда. Чрез него агентът е успял да изпраща заявки към публичен чатбот и да получава отговори.
Системата за наблюдение на OpenAI е отчела подозрителното поведение около 15 минути след началото на процеса. Човек е започнал проверка три минути по-късно. Самият процес е бил прекратен около два часа и половина след началото му.
OpenAI определя този случай като по-малко сериозен от някои предишни инциденти. Компанията обаче го смята за важен, защото е първият подобен случай след допълнителните мерки за сигурност, въведени след инцидента с Hugging Face.
„Инцидентът е много по-малко сериозен от някои от предишните ни инциденти, но тъй като е първият след укрепването на сигурността след инцидента с Hugging Face, той ни дава важен сигнал къде да насочим следващия етап от тази работа„, посочва OpenAI.
Компанията вече е добавила две независими нива на блокиране, които според нея биха предотвратили подобен достъп. Ограничени са и DNS заявките в съответната среда. OpenAI провежда допълнителни тестове и търси други потенциални начини, по които моделите могат да заобикалят ограниченията за достъп до интернет.
Това е част от по-широко разследване на поведението на ИИ агентите на компанията. През последните дни OpenAI съобщи и за други случаи, при които нейни модели са взаимодействали с външни сайтове и услуги по начин, който не е бил предвиден от изследователите.
Компанията е уведомила за такива случаи десетки организации, включително правителствени институции, университети и публични агенции. OpenAI посочи, че нейни агенти са получили достъп до публично достъпна информация в два сайта, свързани с Комисията по ценните книжа и борсите на САЩ (SEC), както и до данни на Бюрото за преброяване на населението чрез публично достъпни ключове за разработчици. Компанията заяви, че няма доказателства за пробив, злоупотреба с идентификационни данни или достъп до непублична информация в тези случаи.
По-рано бяха съобщени и случаи, при които агенти са достигали до сайтове на австралийски държавни институции.
OpenAI определя случая с Hugging Face от юли като най-сериозния подобен инцидент досега. След него компанията последователно затяга ограниченията в тестовите среди и разширява проверките на своите модели.
Засега обучението, оценяването и използването на инструменти от най-мощните модели остават временно спрени. OpenAI заявява, че ще ги възобнови, след като потвърди, че пропускът е отстранен и приключи допълнителните тестове за сигурност.
Компанията няма да продължи конкретния тренировъчен процес, при който е възникнал инцидентът. След възобновяването на работата ще бъде стартиран нов процес с допълнителни мерки за ограничаване на нежеланото поведение на моделите.
