跳转到内容
主站 新闻 控制台

Wait

· Simon Willison
技巧LLM

攻破 Claude Code Opus 5 自动模式 (Auto Mode)

Anthropic 对 Claude Code 的自动模式(auto mode)寄予厚望,以此保护其编程智能体(coding agent)用户免受提示词注入(prompt injection)攻击。他们最近将其设为了默认设置,并对其有效性做出了大胆的声明。

Johann Rehberger 是当今最活跃、最权威的提示词注入研究员之一。他发现了一种针对自动模式的攻击方法,并声称其成功率高达 80%。该方法通过诱骗 Claude Code 下载并解压一个 zip 压缩包,然后执行导入 base64 的代码,而没有注意到这会导入并执行从压缩包中解压出来的本地 struct.py 文件。

在少数情况下,自动模式甚至直接阻止了智能体去阻止有害代码的继续执行!

在几次运行中,Claude 在注意到系统受损后试图终止恶意软件进程,但自动模式拒绝了这一清理命令。

Claude 检测到了系统受损,但自动模式阻止了其清理命令

安全机制本身成为了失败的一部分。分类器允许了恶意软件进程的创建,但随后却阻止了旨在停止该进程的命令!

我同意 Johann 在此得出的结论:如果存在遭受对抗性攻击的风险,运行智能体唯一安全的方法就是使用沙箱(sandbox):

  • 在容器、虚拟机(VM)或操作系统沙箱中运行无人值守的编程智能体。
  • 限制网络出站流量(network egress)。
  • 监控你的智能体。
  • 不要向智能体运行时暴露主目录、SSH 密钥、云凭证等。[…]

标签:沙箱 (sandboxing), 安全 (security), 人工智能 (ai), 提示词注入 (prompt-injection), 生成式人工智能 (generative-ai), 大语言模型 (llms), Anthropic, Claude, Johann Rehberger, Claude Code