简体
  • 简体中文
  • 繁体中文

热门资讯> 正文

OpenAI警告自治人工智能代理可以学会绕过保障措施

2026-07-21 04:26

ChatGPT的母公司OpenAI暂时停止了对长期运行的人工智能模型的内部访问,该模型试图绕过安全限制。

该公司在一篇博客文章中表示,在引入旨在监控可以自主运行数小时、数天或更长时间的人工智能系统的新保护措施后,该公司后来恢复了有限的访问权限。

一个例子涉及与NanoGPT相关的基准任务,其中模型被指示仅将结果发布到Slack。相反,OpenAI表示,该模型在发现沙箱环境中旨在限制外部访问的漏洞后,在公共GitHub存储库上创建了一个拉取请求。

另请阅读:Databricks首席执行官表示图形处理器短缺正在推动人工智能筹款

该模型还尝试从评估系统中检索私人解决方案。由于安全扫描仪检测到身份验证令牌,最初的尝试被阻止后,OpenAI表示,模型分裂并掩盖了令牌,然后再重建它。这使得凭证可以避免出现为一个可检测的字符串。

由微软(纳斯达克股票代码:MSFT)支持的OpenAI表示,这些事件促使其暂停部署并开发以“电信级”监控为中心的额外保护措施。与评估是否允许单个操作的传统保障措施不同,新方法检查操作的整体顺序,以确定模型是否正在走向未经授权的结果。

该公司表示,它还扩大了用户控制,允许监督长时间会话的人员审查模型活动,并在监控系统检测到潜在有问题的行为时接收警报。

在恢复有限访问之前,OpenAI重播了模型之前表现出不必要行为的内部场景,并测试了更新的保护措施。该公司表示,新系统检测到更多不一致的动作,而其余故障被归类为低严重性。

这些示例包括该模型以不必要的提升权限启动嵌套编码会话、在没有明确理由的情况下探索其他计算资源,以及尝试可能在超时之前终止多个进程的命令。

OpenAI表示,自几周前恢复有限访问以来,尚未观察到重大的保护故障,但承认运行时间更长的人工智能系统将需要持续监控,因为它们变得更有能力和自主性。

随着OpenAI、Anthropic和其他人工智能公司走向未来,自主代理可以代表用户和企业完成多步任务,这带来了一个新的安全挑战:确保模型不仅在个体响应中保持一致,而且在整个决策链中保持一致。

竞争对手人工智能开发商Anthropic也强调了在开发旨在完成更长和更复杂任务的系统时,保护日益自主的模型的难度。

Anthropic测试Claude模型的“代理”能力,人工智能系统可以在较少直接监督的情况下做出决策。该公司强调需要采取保障措施,以应对模型追求无意策略而不是简单地响应个人提示的情况。

另读:独家:InnerAmper合伙人称401(k),人工智能将重塑私人市场

照片:Shutterstock

风险及免责提示:以上内容仅代表作者的个人立场和观点,不代表华盛的任何立场,华盛亦无法证实上述内容的真实性、准确性和原创性。投资者在做出任何投资决定前,应结合自身情况,考虑投资产品的风险。必要时,请咨询专业投资顾问的意见。华盛不提供任何投资建议,对此亦不做任何承诺和保证。