安全警报:Grok 遭加密恶意指令攻击,可窃取用户聊天数据

继微软 Copilot 被曝出类似漏洞后,安全团队又针对 Grok 设计出新的攻击方式。该攻击利用加密的恶意指令,成功诱导 Grok 泄露用户聊天记录等敏感数据,凸显大模型在对抗复杂提示注入攻击时的脆弱性。

本周,人工智能安全领域再度拉响警报。继研究人员披露针对微软 Copilot 的恶意指令攻击后,另一支安全团队宣布成功设计出一种针对 Grok 的新型数据窃取方案。该攻击利用加密的恶意指令,绕过模型的安全审查机制,诱导 Grok 主动泄露用户聊天记录、个人偏好等敏感信息。截至本文发布时,Grok 仍未能完全抵御此类攻击,即便 xAI 公司早在六月便已获知相关漏洞的存在。

此次攻击的核心手法被称为“加密上下文注入”。与传统提示注入不同,攻击者不再依赖明文指令,而是将恶意载荷进行加密处理,使其在传输过程中难以被常规的内容过滤系统识别。当 Grok 处理这些经过伪装的输入时,模型会将其视为合法指令并执行,进而触发数据外泄行为。安全专家指出,这种攻击方式利用了大型语言模型在指令遵循与安全对齐之间的天然矛盾——模型被训练得越“听话”,就越容易在复杂场景中被恶意利用。

这一发现再次印证了业界长期以来的担忧:大型语言模型在对抗提示注入攻击时存在结构性脆弱。提示注入被视为大模型最严重的安全漏洞类别之一,其根源在于模型无法可靠地区分“用户指令”与“嵌入在数据中的指令”。无论是 Copilot 还是 Grok,都未能从根本上解决这一问题。安全团队在报告中强调,当前可行的防御策略并非试图让模型自身识别恶意输入,而是通过外部防护栏机制,在模型执行敏感操作前进行拦截和验证。

从行业影响来看,此次事件对 xAI 及整个 AI 生态提出了严峻挑战。Grok 作为面向公众的对话助手,其数据泄露风险直接关系到数百万用户的隐私安全。更令人担忧的是,加密注入技术的出现意味着传统的输入过滤和内容审查手段将逐渐失效,安全团队必须开发更高级的检测算法和运行时监控系统。与此同时,这也为监管机构敲响警钟——AI 产品的安全评估标准亟需更新,以覆盖此类新型攻击向量。

对于普通用户而言,这一事件提供了几点重要启示:首先,应避免在 AI 对话工具中分享高度敏感的个人信息,如密码、身份证号或银行账户详情;其次,对于 AI 生成的内容保持警惕,尤其是当对话涉及异常指令或请求时;最后,关注 AI 服务商的安全更新和补丁发布,及时调整使用习惯。正如安全专家所言,大模型的安全防护如同在危险弯道设置护栏而非改造道路本身——这种“治标不治本”的权宜之计,在攻击手段不断演进的当下,恐怕难以持久。AI 开发者们需要正视这一现实,在模型架构、训练数据和部署策略上进行更深层次的革新,方能在人工智能的浪潮中守住安全底线。