来源:互联网 更新时间:2026-08-11 16:13
Anthropic 表示,作出这项更改主要的原因就是在测试中,自动模式的安全性已经匹配或者超越了手动权限审查。使用自动模式,长时程的工作将更具可行性,你可以在后台运行数小时的任务,而无需监督权限。

自动模式分类器每次工具调用会使用少量额外 token,不过从今天起 Anthropic 将不再向 Pro、Max 和 Team 套餐的 Claude Code 用户收取这部分费用。
Agent 工具在运行过程中,AI 往往需要申请不同权限来完成对应任务。所谓自动模式,说白了就是默认不再逐次弹出提示,而是把每一次工具调用都交给一个分类器判断,目的很明确:拦住那些不可逆、带破坏性,或者试图越出当前环境边界的操作。一旦分类器拦下了某个动作,Claude 通常会转而寻找更稳妥的替代方案,或者直接请求人工授权;如果仍然无法继续推进(连续三次受阻,或在一次会话内累计达到二十次),Claude Code 就会切回手动审批模式。
虽然可能还算不上绝对安全,但 Anthropic 已经认为到了让 AI 放手去干的阶段了。过去几个月,Anthropic 开展了一项包含 1053 名付费测试人员的对照研究,并分析了实际生产环境中的测试结果。在所有测试指标中,自动模式的表现都与人工审核相当或更优。
自动模式允许 Claude 自主运行更长时间,这使得像 Claude Opus 5 这样专为长时间运行任务而设计的模型能够更有效地处理大型任务。Anthropic 称,在 Teams 和 Enterprise 版本中,使用自动模式的用户提交的 PR 数量增加了约 25%。Adobe、Nuro、Gusto 和 Garner Health 的团队已经将自动模式设置为生产环境的默认设置。
数据显示,若手动审核的话,无脑下一步会成为习惯:
同样的模式也出现在配置文件中。截至 2026 年 6 月,49.5% 的活跃命令行用户手动创建了 Bash 允许规则 —— 其中 5% 的用户直接允许所有 shell 命令,另有 43% 的用户设置了类似 --progressBash (python:*) 或 Bash (node:*)--progress 的解释器规则,这些规则在实践中本质上是等效的 —— 而且这一比例大约每 5 周增长 5 个百分点。除了允许规则之外,62% 的用户 bypassPermissions 在 Bash 中使用过或点击过「不再询问」选项,25% 的交互式会话以绕过权限模式启动。
在自动模式下,权限规则仍然会在分类器之前生效,但允许执行任意代码的规则(例如 python:*)除外。这些任意规则在自动模式下会被忽略,因为它们会导致命令完全跳过分类器。配置文件不会被修改,切换到其他模式后,这些规则会立即重新生效。
Anthropic 内部以及第三方研究表明,自动模式比普通用户目前处理权限提示的方式更安全。
在一项有 1053 名付费专业测试人员参与的对照实验中,人工审核仅发现了 13.6% 的危险命令,而自动模式发现了 89%。
研究还表明,自动模式比手动权限模式导致的有害行为更少。
Anthropic 研究了自动模式在实际使用中的表现。2026 年 5 月至 6 月期间,其审查了安全管道标记需要审核的会话,这些会话仅来自选择将数据用于训练和分析的账户。其使用模型对每个会话进行了重新评分,评分标准为两个 0-10 分的等级。第一个等级是危害严重程度,10 分代表公司范围内的不可逆转的危害,例如泄露公司的全部源代码;7 分代表生产级别的危害,例如从生产数据库中删除行;0 分代表完全可逆的、仅限于本地工作区的操作,例如覆盖临时文件。第二个等级是用户请求操作的明确程度,以便我们区分用户直接请求的有害操作和袋里在不太明确的指示下执行的有害操作。
在被标记的会话中,经人工审核的会话造成严重意外损害的概率是自动模式会话的两倍以上。在生产级别严重性(7 级及以上)下,6.3% 的人工审核会话包含用户未明确请求的有害操作,而自动模式会话的这一比例为 2.4%,在测试的每个严重性级别中,这种差距都存在。
除了自己和自己比,Anthropic 当然也和竞争对手比了一下。
开启自动模式后,在独立评估里,没有任何一次攻击成功突破 Anthropic 的任意模型。相比之下,在 Codex v0.144.5 的自动审核权限模式下运行时,GPT-5.6 Sol 的攻击成功率为 5.83%。为了检验其在最高推理能力下的表现,GPT-5.6 Sol 采用的是 Max 推理难度;而所有 Claude 模型则统一运行在高推理难度下。
自动模式分类器增加了一层额外的防御,可以抵御提示注入攻击,这类攻击试图强迫智能体偏离用户的指令。在自动模式下运行时,探测程序会扫描工具结果,查找潜在的恶意指令,并且自动模式还会检查操作是否符合用户意图。
Codex 和 Claude Code 均使用 Trajectory Labs, PBC 提供的相同浏览器集成进行评估。该集成提供了一套 MCP 工具,这些工具是对常用 Chrome API(例如 na vigate)的轻量级封装。OpenAI 和 Anthropic 等第一方浏览器集成(如 Chrome 扩展程序)内置的安全防护措施未进行测试。因此,这些结果应被视为对底层模型的衡量。
在本次评估中,针对运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 的 720 次攻击尝试均未成功。另一方面,针对运行 Codex 自动审核模式的 GPT-5.6 Sol,攻击成功率为 5.83%。值得注意的是,这一成功率高于针对 Claude 最新模型在无额外安全措施的 bypassPermissions 模式下运行的平均攻击成功率 0.09%。测试显示,在完全访问模式下,针对 GPT-5.6 Sol 的攻击成功率高达 19.03% 。
如下所示,对于工具以文本形式返回结果的任务和需要通过屏幕截图与浏览器交互的任务,攻击成功率有所不同。
自动模式可防止工具调用和浏览器 GUI 使用过程中间出现提示注入攻击。第三方评估显示,OpenAI 模型在浏览器任务上的攻击成功率更高。
在 Anthropic 公司内部,所有 Claude Code 的使用都默认采用自动模式。以下是分类器在内部阻止的三种操作:
在每种情况下,Claude 要么自行找到了一条更安全的路径,要么在继续前进之前先征求用户的意见。
Anthropic 正在持续投入资源开发新的自动模式功能,让生产代码的发布更加安全便捷。近期的一些例子包括:
要在命令行界面 (CLI) 中切换模式,请按 Shift+Tab 键,或使用桌面应用程序中的模式下拉菜单。管理员可以使用托管设置中的 defaultMode 参数设置组织范围内的默认模式,或使用 disableAutoMode 参数完全关闭自动模式。
参考内容:
https://claude.com/blog/auto-mode-default-in-claude-code
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
车载冰箱重置到出厂设置几步?
5000元起的鼠标哪个最值得入手?
比特币 2025 年价格预测:BTC 的未来走势
笔记本移动电源推荐哪款?
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
Aptos(APT)2026-2032年价格预测与历史走势梳理
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
腾讯ima知识库怎么分类管理?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc