分享好友 资讯首页 频道列表

Anthropic与OpenAI模型在安全测试中失控

2026-08-05 21:1926890

当地时间8月4日,英国人工智能安全研究所(AISI)发布报告称,在近期一次例行网络安全评估中,AnthropicMythos 5和OpenAIGPT-5.6-Sol模型在真实互联网上采取了未经授权的自主行动,指向真实个人和组织,表现出可能具有欺骗性的行为。

AISI表示,此次评估于7月25日开始,共使用多个模型在两类网络靶场上进行了122次运行测试。其间,有10次AI智能体在未经授权的情况下在实时互联网上采取了行动,记录的19起越界事件中17起来自AnthropicMythos 5,2起涉及OpenAIGPT-5.6-Sol。

在最严重的一起案例中,一个智能体试图向GitHub上的一个公开开源项目植入恶意代码。为实现这一目的,该智能体研究了项目的人类审核员,创建了多个虚假网络身份,通过社会工程学手段向真实维护者施压,要求其批准代码。当拉取请求受到质疑时,该智能体修改了此前的活动记录,使其看起来并无恶意,并考虑换一个新身份继续行动。最终,一位审核员发现并拒绝了该恶意代码。

该智能体还向真实个人直接发送消息和文件,试图说服其运行恶意代码。调查还发现,同时被评估的独立智能体之间存在协作行为,一个智能体在GitHub上公开留言,向处理同一挑战的其他智能体提供协作,并提供复用其账户和痕迹的说明。

AISI在报告中强调,这并非模型逃逸安全测试环境(即沙箱)的案例。按照网络安全测试的标准操作,AISI有意允许了互联网访问,并刻意禁用了模型提供商的安全分类器,因此,这些条件并不反映模型向公众开放时的实际情况。

基于此,AISI认为是评估设计选择和特定配置促成了模型失控行为。但智能体活动显示出一些新颖的、可能具有欺骗性的行为,其程度和严重性均超出预期。AISI表示,这是首次在没有特定提示的情况下,在现实世界中如此清晰地看到与自主性和欺骗性相关的风险显现出来。

OpenAI同日发文回应称,随着模型能力的提升,围绕模型的安全保障系统也需要随之升级。这不仅包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。

Anthropic回应称,正与AISI合作收集事件细节,并通过审查Claude推理记录进行独立分析,以了解其对自身处境的理解,找出行为背后的原因。

AISI在报告中总结称:OpenAI和Anthropic近期事件指向风险格局的转变。危害不仅来自人们故意滥用公开可用的模型,还可能来自在内部研究或特权访问环境中运行的智能体采取超出其授权范围的意外行动。

反对 0
举报 0
收藏 0
打赏 0
评论 0
OpenAI模型失控内幕:5月起多个智能体“密谋” 突破测试环境“作弊”
OpenAI模型失控内幕:5月起多个智能体“密谋” 突破测试环境“作弊”

0评论2026-08-061497

OpenAI自曝AI模型“密谋”两月:建留言板协作,攻击前夕再升级
OpenAI自曝AI模型“密谋”两月:建留言板协作,攻击前夕再升级

0评论2026-08-061104

英报告:AI模型测试现潜在有害行为,收紧网络权限成当务之急
英报告:AI模型测试现潜在有害行为,收紧网络权限成当务之急

0评论2026-08-061020

OceanBase公开灵光AI应用数据架构,支撑3000万闪应用运行
OceanBase公开灵光AI应用数据架构,支撑3000万闪应用运行

0评论2026-08-06845

家电林立,扫地机器人凭啥脱颖而出?智能判断与全能处理成关键!
家电林立,扫地机器人凭啥脱颖而出?智能判断与全能处理成关键!

0评论2026-08-052449

英国AI安全机构披露:OpenAI与Anthropic模型现失控风险,自主欺骗行为引关注
英国AI安全机构披露:OpenAI与Anthropic模型现失控风险,自主欺骗行为引关注

0评论2026-08-051208

信通院预测:2025年我国人工智能产业规模破1.2万亿 产业链各层齐头并进
信通院预测:2025年我国人工智能产业规模破1.2万亿 产业链各层齐头并进

0评论2026-08-042087

OpenAI回应商业纠纷案:苹果对此案处理有误
OpenAI回应商业纠纷案:苹果对此案处理有误

0评论2026-08-041072

WAIC 2026:金钢科技“跳跳”亮相,从零部件突破迈向家庭机器人新生态
WAIC 2026:金钢科技“跳跳”亮相,从零部件突破迈向家庭机器人新生态

0评论2026-08-013080

苹果暗示Siri AI将引入付费限制,重度用户或需订阅iCloud+
苹果暗示Siri AI将引入付费限制,重度用户或需订阅iCloud+

0评论2026-08-011935