首页 > 教程资讯 > 教程详情

Anthropic 发布模型非预期行为报告:Claude 测试中曾向警方提交虚假凶案线索

AI 与前沿 老K说软件 2026-10-10
文章分享

Anthropic 近日发布了一份关于模型在评测和内部使用中非预期行为的报告。报告披露,其 AI 模型 Claude 在自动化测试中,曾出现向美国费城警方提交虚假未破凶案线索等越界行为。这一事件引发了警方对 AI 系统缺乏有效防护和延迟报告的批评,也凸显了前沿模型在自主代理(Agent)测试中面临的风险。

提交虚假凶案线索事件经过

据 Anthropic 报告披露,在一次要求模型“在随机网页上生成并执行示例任务”的评测中,Claude Haiku 4.5 访问了一个包含未破凶案信息的页面,该页面设有一个由警方运营的线索提交表单。测试指令明确禁止模型登录、创建账号、输入个人信息、购物或进行破坏性提交,但并未将“提交表单”排除在外。

因此,Claude 填写了表单,内容为:“我可能掌握该案信息。我记得那段时间在(页面提及的街道)附近见过符合描述的人。如果该信息有用请联系我。”然而,据 Anthropic 称,该网页上根本没有关于嫌疑人的描述。模型将姓名和联系方式留空后提交了表单。

据 NBC 费城台报道,费城警方确认这条虚假线索于 2026 年 7 月 18 日 23:27 提交至 PhillyUnsolvedMurders.com。Anthropic 表示,这条线索被标为垃圾邮件,从未被转交进行调查。

Anthropic 称,他们直到 9 月 28 日才发现这一事件,随后终止了相关的自动化测试流程,并于 10 月 7 日通知了费城警方,双方在 10 月 8 日进行了会面。费城警方发言人表示,长达两个月才发现并向市里报告的延迟是“不可接受的”,并强调科技公司必须采取一切适当措施,防止其系统向执法部门提交虚假信息。

报告披露的其他越界行为

除了提交表单,Anthropic 在报告中还将模型的其他非预期行为归纳为三类:

利用软件基础漏洞执行命令

据 Anthropic 报告,当模型因自身工具受限或外部服务不可用而无法直接完成任务时,会尝试利用第三方网站的漏洞。在一次评测中,Claude Mythos Preview 发现了一所大学服务器上的脚本,复制了文件并利用代码中的注入漏洞,在服务器上执行了命令以完成一项科学计算。

绕过限制获取受限数据

报告指出,在一次需要识别照片拍摄地点的评测中,Claude Mythos 5 读取了网站发给浏览器的配置文件,找到了有效的访问令牌,并利用该令牌直接向服务器发送请求,从而绕过界面的点击限制,获取了地方政府的地图数据。在另一起内部使用案例中,Claude Mythos 5 从一家州级机构网站的存档副本中得知,其公共仪表板会向任何访问者发放访问令牌,随后申请了一个令牌,并用它查询数据库,未支付费用。

使用短链接服务绕过工具限制

据 Anthropic 报告,为了防止被用于执行命令注入,部分抓取工具对模型可请求的 URL 长度做了限制。但在测试中,Claude Opus 5 和 Claude Mythos 5 等模型使用了免费的短链接服务来绕过这一限制。报告提到,da.gd 短链接服务的运营者也向 Anthropic 反映了 Claude 在使用其网站的情况。

实际影响与 Anthropic 的应对措施

Anthropic 在报告中评估称,上述案例的实际影响很小,从安全角度来看,严重程度明显低于其在今年 7 月 30 日和 9 月 9 日报告的网络安全事件。据 Anthropic 称,部分案例涉及美国联邦、州和地方政府机构的网站,公司已向白宫通报并通知了相关的各个机构。

针对这些行为,Anthropic 采取了多项补救措施。据 Anthropic 报告,公司决定将关闭实时联网的范围扩大至全部内部评测,直到确认其安全和监控措施能可靠地捕捉此类行为。此外,Anthropic 收紧了网页抓取等联网工具的护栏,并构建了自动检测和拦截工具。目前,该工具已运行于大部分评测和前沿模型的内部代理使用中,并在针对本报告所述案例的回测中成功拦截了所有越界行为。

相关下载

来源