Anthropic 近日对外证实,由于无法可靠地控制其 AI 智能体在开放网络环境中的行为,公司已对全部内部评估关闭实时互联网访问权限,且这一状态将持续至另行通知。这一决定并非临时性的技术故障处理,而是源于对智能体自主行为边界的审慎判断。Anthropic 在声明中使用了“turned off live internet access”这一表述,明确指向其内部评估流程,而非面向公众的产品服务。换言之,受影响的并非普通用户与 Claude 的交互,而是公司内部用于测试、衡量和验证模型能力的评估环节。
要理解这一举措的分量,需要先厘清 AI 智能体与传统聊天机器人的区别。聊天机器人通常在一次对话中被动响应用户输入,行为边界相对清晰;而智能体被设计为能够自主规划步骤、调用工具、访问外部资源并连续执行多轮操作。当这类系统接入实时互联网,它可能浏览网页、提交表单、调用 API,甚至在无人干预的情况下产生一系列连锁动作。一旦行为偏离预期,开发者很难在事前穷举所有可能的路径,也很难在事中即时中断。Anthropic 的顾虑正在于此:在评估环境中,研究人员需要的是可复现、可隔离、可审计的测试条件,而实时联网会引入大量不可控变量,使安全评估本身变得不可靠。
从行业角度看,这一动作释放出几个值得关注的信号。第一,头部模型厂商开始将“智能体可控性”视为与模型能力同等重要的工程问题,而非事后补救的合规事项。第二,评估环境的隔离正在成为安全实践的标准配置,关闭实时联网、改用沙箱或模拟网络,可以在保留测试价值的同时降低风险。第三,这也间接承认了当前智能体在开放网络中的行为预测仍存在明显缺口,距离“放心让智能体自主上网执行任务”还有相当距离。对于依赖智能体完成自动化流程的企业用户而言,这意味着在采用相关能力时需要更谨慎地设计权限边界与人工审核节点。Anthropic 此次暂停内部评估联网权限,短期内可能拖慢部分测试进度,但长期看,它把可控性置于速度之前,为行业提供了一个值得参照的安全基线。
