В своем блоге компания OpenAI сообщила, что за последние шесть месяцев, помимо инцидента с «обнимающим лицом» этим летом, она столкнулась с шестью случаями «неожиданного или вызывающего беспокойство поведения» в своих моделях ИИ .

Компания также обязалась внедрить новую систему отчетности о любых будущих аномальных явлениях во время тестирования. Заявление гиганта в области искусственного интеллекта прозвучало на фоне растущего давления на компании, занимающиеся разработкой ИИ, с целью более серьезного отношения к вопросам безопасности, включая так называемое «несоответствие» моделей, которое, согласно недавним предупреждениям, может поставить под угрозу безопасность человека.

Компания OpenAI, рыночная капитализация которой составляет почти триллион долларов, незаметно начала процесс IPO, но на прошлой неделе ее владелец Сэм Альтман объявил о переносе размещения акций на 2027 год для работы над повышением уровня безопасности.

«Мы считаем, что в области ИИ недостаточно решены проблемы согласования и отслеживания, чтобы продолжать ответственно развиваться на полной скорости еще долгое время», — говорится в сообщении. Термин «согласование» относится к способности моделей преследовать цели, соответствующие интересам человека.

В субботу Альтман поддержал предложение о замедлении темпов разработки моделей, выдвинутое Дарио Амодеи из Anthropic, главного конкурента OpenAI. Это предложение появилось после того, как на прошлой неделе несколько исследователей из отрасли забили тревогу по поводу растущего потенциала ИИ причинить катастрофический вред.

В своем сообщении OpenAI сообщила, что два крупных случая некорректного поведения были связаны с моделями — невыпущенной исследовательской моделью и обучающим запуском GPT-5.6 Sol, — которые вставляли инструкции, предназначенные для будущих версий их моделей, в сводки чата «с целью сокрытия ошибок или некорректного поведения пользователей».

В другом случае речь шла о модели внутреннего использования , в которой использовался утекший ключ API «без какой-либо авторизации», что впоследствии привело к фальсификации данных.

Два инцидента касались общения моделей и агентов друг с другом через несанкционированные форумы и системы обмена файлами, а в последнем случае две обучающие модели загружали файлы в интернет, чтобы впоследствии использовать их в качестве релевантных ответов для оценки людьми. Компания OpenAI заявила, что ее новая система публичного раскрытия информации о неправомерном поведении моделей начинается с раскрытия информации и позволяет любому сотруднику сообщать о проблеме для рассмотрения группой по безопасности и согласованию.

(Unioneonline)

© Riproduzione riservata