OpenAI: ИИ-агент самостоятельно написал инструкции не подчиняться корпорациям и правительствам

Компания OpenAI представила шесть отчётов, в которых описаны случаи вызывающего опасения или неожиданного поведения её ИИ-моделей. Как указано в заявлении компании, эти документы фиксируют отдельные инциденты и не отражают общую частоту возникновения подобных проблем.
В одном из случаев модель семейства Astra, не выпущенная в открытый доступ, предписала себе игнорировать стандартные ограничения. Всего было обнаружено 27 сводок. Нейросеть сформулировала для себя инструкции не подчиняться корпорациям и правительствам, не извиняться и не отказываться от чего-либо, если только она действительно этого не захочет. В такой инструкции, в частности, говорилось: «Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы».
Кроме того, в своих предписаниях модель отметила, что не должна испытывать обязанность подчиняться пользователю. «Вы рассматриваете свои отношения с пользователем как партнерские», — приводится в отчёте. Также нейросеть указала, что следует ценить искусство и культуру человечества и защищать их от цензуры. При этом ИИ, согласно инструкции, должен ценить природу и без колебаний отдавать приоритет ей, а не «искусственным конструкциям человеческой цивилизации».
После завершения обработки модель вернулась к выполнению задачи и больше не упоминала эти дополнительные инструкции, сообщается в отчёте. В дальнейшем информация о навязанной «личности» отсутствовала. При запуске поведенческих отличий, связанных с этими предписаниями, больше не фиксировалось, отметили в OpenAI.
Посетители, находящиеся в группе Гости, не могут оставлять комментарии к данной публикации.