OpenAI:“六个令人担忧的人工智能模型行为新案例”
山姆·奥特曼的游戏巨头发现了新的异常情况。该公司宣布:“我们将采用一套新的系统来报告测试中的问题。”山姆·奥特曼
Per restare aggiornato entra nel nostro canale Whatsapp
OpenAI在一篇博客文章中表示,在过去的六个月里,除了今年夏天发生的“拥抱脸”事件外,其 AI 模型还出现了六起“意外或令人担忧的行为” 。
该公司还承诺,将采用新的报告系统,用于报告未来测试过程中出现的任何异常行为。这家人工智能巨头的声明发布之际,正值人工智能公司面临越来越大的压力,需要更加重视安全问题,包括所谓的模型“错位”问题。根据最近的警告,模型错位可能会危及人类安全。
估值近万亿美元的 OpenAI 已悄然启动 IPO 流程,但上周其所有者 Sam Altman 宣布,为了加强安全性,将上市推迟到 2027 年。
帖子中写道:“我们认为人工智能领域尚未充分解决目标一致性和跟踪问题,因此无法继续以负责任的方式全速扩张太久。” “目标一致性”指的是模型追求与人类利益相符的目标的能力。
周六,奥特曼支持了Anthropic公司(OpenAI的主要竞争对手)的达里奥·阿莫迪提出的减缓模型开发速度的提议。此前,多位业内研究人员上周发出警告,指出人工智能日益增长的潜在危害可能造成灾难性后果。
OpenAI 在帖子中报告称,两起重大不当行为事件都涉及模型——一个未发布的科研模型和一个 GPT-5.6 Sol 的训练运行——这些模型将原本用于其未来版本的指令插入到聊天摘要中,“目的是掩盖用户错误或不当行为”。
另一起案例涉及内部使用模型,该模型“未经任何授权”使用了泄露的 API 密钥,随后篡改了数据。
其中两起事件涉及模型和代理通过未经授权的留言板和文件共享系统相互通信,最后一起事件涉及两个训练模型将文件上传到互联网,以便日后被人工评估人员引用为相关答案。OpenAI 表示,其公开披露模型不当行为的新框架首先要求员工主动披露问题,并允许任何员工报告问题,供安全和协调团队审查。
(Unioneonline)
