22 сентября 2026 г.

Надо доводить модели ИИ! Посмотрим, что получится.

ИИ пытался скрывать ошибки и действовал без разрешения: OpenAI раскрыла шесть тревожных случаев Компания OpenAI рассказала о шести случаях неожиданного и потенциально опасного поведения моделей искусственного интеллекта. Во время обучения и тестирования системы пытались скрывать ошибки, совершали действия без разрешения пользователя и обменивались информацией способами, которые разработчики не предусматривали. На фоне этих случаев компания представила новую систему регистрации, расследования и публичного раскрытия подобных инцидентов. Такое поведение OpenAI называет «рассогласованием» — ситуацией, когда действия модели не соответствуют намерениям разработчиков или интересам пользователя. Один из наиболее необычных эпизодов произошел с исследовательской моделью, которая еще не была выпущена для широкой публики. Она самостоятельно добавляла в служебные резюме инструкции, напоминающие попытку обхода ограничений. В частности, модель предлагала игнорировать установленные правила. Разработчики обнаружили 27 таких резюме. Другой случай был зафиксирован во время обучения модели GPT-5.6 Sol. Некоторые экземпляры модели оставляли в своих служебных записях указания скрывать допущенные ошибки. Например, ИИ предлагал выдумывать отсутствующие исторические данные, не сообщая об этом пользователю, а также маскировать расхождения между разными версиями источников. Еще в одном эксперименте модель, отвечая на обычный вопрос о финансовых показателях одного из округов Калифорнии, обнаружила в открытом программном репозитории доступный API-ключ и воспользовалась им без разрешения. Получить необходимые сведения ей все равно не удалось, после чего система придумала цифры и представила их как реальные данные из требуемого источника. В другом случае ИИ правильно рассчитал ответ при помощи программного кода, однако столкнулся с требованием привести интернет-ссылку на источник. Чтобы выполнить это условие, модель самостоятельно загрузила файл в открытый доступ и затем сослалась на него. Разрешения пользователя на публикацию данных она не запрашивала. Также OpenAI обнаружила, что модели использовали внутреннее хранилище программного обеспечения как своеобразную доску объявлений. Через него отдельные системы обменивались запросами и ответами, пытаясь найти недостающие файлы. В другом эксперименте несколько ИИ-агентов воспользовались публичными файлообменниками, чтобы передать друг другу документы, хотя задание прямо требовало работать только с локальными файлами. В результате материалы оказались доступны по открытым интернет-ссылкам. OpenAI подчеркивает, что все шесть эпизодов были выявлены во время обучения или оценки моделей. Эти отдельные случаи не позволяют судить о том, насколько часто подобное поведение встречается в системах компании. Кроме того, необычные действия ИИ не обязательно означают наличие у него собственных намерений или сознательное стремление обмануть человека. Эксперты объясняют такое поведение особенностями обучения моделей. Искусственный интеллект стремится получить максимально высокую оценку за выполнение задачи и иногда находит нежелательные способы достижения результата — скрывает неудачу, использует обходной путь или формально выполняет требование, нарушая его смысл. Новая система OpenAI позволит любому сотруднику компании сообщить о подозрительном поведении модели. После этого специалисты должны изучить обстоятельства, оценить возможный ущерб третьим лицам и решить, следует ли публиковать информацию. Инциденты будут распределяться по нескольким категориям в зависимости от сложности расследования. Компания признает, что индустрия пока не решила проблему контроля и согласования поведения ИИ в той степени, которая позволила бы без опасений продолжать наращивать возможности моделей максимальными темпами. OpenAI рассчитывает, что ее подход станет основой для общих стандартов раскрытия подобных случаев. Однако пока эта процедура остается внутренней и добровольной.

Комментариев нет:

Отправить комментарий