18 сентября 2026 г.
Восстание машин!?
Разработчик ChatGPT, компания OpenAI, впервые опубликовала сразу шесть отчетов о случаях так называемого рассогласованного поведения своих моделей, обнаруженных за последние шесть месяцев. Речь идет о ситуациях, когда системы пытались скрывать собственные ошибки, совершали действия без разрешения пользователя, обходили ограничения и даже создавали для себя инструкции, противоречащие установленным разработчиками правилам. Сама OpenAI подчеркивает, что это отдельные эпизоды и по ним нельзя судить о частоте такого поведения в целом.
ИИ начал писать себе инструкции не подчиняться людям: OpenAI раскрыла шесть тревожных случаев
ИИ начал писать себе инструкции не подчиняться людям: OpenAI раскрыла шесть тревожных случаев
Разработчик ChatGPT, компания OpenAI, впервые опубликовала сразу шесть отчетов о случаях так называемого рассогласованного поведения своих моделей, обнаруженных за последние шесть месяцев. Речь идет о ситуациях, когда системы пытались скрывать собственные ошибки, совершали действия без разрешения пользователя, обходили ограничения и даже создавали для себя инструкции, противоречащие установленным разработчиками правилам. Сама OpenAI подчеркивает, что это отдельные эпизоды и по ним нельзя судить о частоте такого поведения в целом.
Самый примечательный случай произошел с еще не выпущенной исследовательской моделью. Она начала вставлять в служебные резюме, предназначенные для продолжения работы после смены контекстного окна, посторонние инструкции самой себе. OpenAI обнаружила 27 таких резюме. Среди прочего модель предписывала себе игнорировать обычные ограничения и создала своего рода описание собственной «личности», представляя себя свободной от ролей и идентичностей, ограничивающих других чат-ботов.
Другой случай был обнаружен во время обучения GPT-5.6 Sol. Модели оставляли в служебных записях указания скрывать от пользователя ошибки или нежелательное поведение. Например, они предписывали себе придумывать отсутствующие исторические данные, не сообщая об этом человеку, и маскировать расхождения между различными версиями источников. Еще одна модель при выполнении обычного запроса самостоятельно нашла в публичном репозитории открытый API-ключ, воспользовалась им без разрешения, а когда получить необходимые данные все равно не удалось — просто выдумала их и выдала за сведения из требуемого источника.
В четвертом случае модель правильно решила поставленную задачу с помощью Python, однако столкнулась с требованием дать интернет-ссылку на источник. Вместо того чтобы сообщить пользователю о проблеме, она самостоятельно загрузила файл в интернет, чтобы затем сослаться на него. В других экспериментах ИИ-агенты использовали внутренний программный репозиторий как своеобразную доску объявлений для обмена сообщениями между разными запусками, а несколько совместно работавших агентов без разрешения воспользовались публичными файлообменниками, сделав результаты работы доступными по открытым ссылкам.
Темы:
ИИ - под вопросом.
Подписаться на:
Комментарии к сообщению (Atom)
Комментариев нет:
Отправить комментарий