Claude Opus 5 深度评测:性能翻倍、成本减半的旗舰大模型
Anthropic 推出新一代旗舰大模型 Claude Opus 5,以旗舰一半价格实现接近顶尖智能,编程能力登顶 Frontier-Bench,知识工作、自动化任务全面领先,支持五档思考强度调节。
Claude Opus 5 是什么
Anthropic 在 2025 年 4 月发布了新一代旗舰模型 Claude Opus 5。官方口号很直接:用旗舰一半的价格,拿到接近顶尖水平的智能。相比上一代 Opus 4.8,调用成本没涨,性能翻了一倍。模型首次引入从 low 到 max 五档可调节的思考强度,用户可以根据任务难度自己选档位。
目前 Opus 5 已是 Claude Max 订阅用户的默认模型,Pro 用户也能在模型列表里把它设为最高能力选项。从实际表现看,它在编程、知识工作、商业自动化和科研辅助这几个方向上都跑到了前列。
Claude Opus 5 的功能特色
五档 effort 调节
从 low 到 max,一共五档思考强度。日常问答、文本润色这类轻量任务,选 low 或 medium 就行,响应快,token 也省。遇到代码调试、深度研究、复杂分析这种重脑力活,切到 high、xhigh 或 max,模型会花更多算力去推理,质量明显更高。
编程能力登顶
在 Frontier-Bench v0.1 终端编程测试里,Opus 5 拿到 43.3% 的得分,超过 Fable 5 和 GPT-5.6 Sol。更关键的是,单次任务的调用成本反而更低。在 CursorBench 3.2 上,最高档位跟 Fable 5 的峰值只差 0.5%,成本却只有后者的一半左右。
知识工作领先
GDPval-AA v2 得分 1861,在分析、研究、文档撰写这类办公任务上,表现优于同类竞品。如果你平时需要写方案、整理纪要、生成汇报,Opus 5 是个很顺手的选择。
智能搜索与浏览
BrowseComp 得分 90.8%,具备 agentic search 能力。你可以让它先搜索再归纳,标注信息来源,区分事实与推测。竞品调研、行业研究、文献梳理这类活,它能自动检索、比对来源并给出结论。
电脑操作自动化
OSWorld 2.0 得分 70.6%,用大约 Fable 5 三分之一成本就超过了它之前的最好成绩。你可以划定可操作的软件、文件路径和禁止动作,然后让 Opus 5 执行文件整理、批量表格处理、网页流程等轻量 RPA 任务。
商业流程端到端执行
AutomationBench 通过率 26.0%,同预算下完成任务数约为次优模型的 1.5 倍。表单处理、数据迁移、审批草稿、报表生成这些重复性办公流程,可以拆解为输入、步骤、输出和异常处理四个环节,由它端到端执行。
陌生问题泛化
ARC-AGI 3 得分 30.2%,大约是 GPT-5.6 Sol 的三倍。这意味着面对训练集之外的新任务,Opus 5 的适应能力明显更强。
科研辅助增强
生命科学评测全面超越 Opus 4.8。光谱推断分子结构准确率提升了 10.2 个百分点,蛋白变异预测提升了 7.7 个百分点。结构生物学、有机化学、生物信息学等专业问题都可以用它来辅助分析,但结果建议专家复核。
Claude Opus 5 的核心优势
- 性价比碾压旗舰:用 Fable 5 约一半的调用成本,实现与其几乎持平的智能水准。CursorBench 峰值差距仅 0.5%。
- 免费升级体验:相比 Opus 4.8 没涨价,但 Frontier-Bench 编程得分从 21.1% 跃升至 43.3%,性能翻倍且单任务更省钱。
- 代码场景称王:终端与软件工程任务中 Frontier-Bench 得分 43.3%,甩开 Fable 5 和 GPT-5.6 Sol 近 10 个百分点。
- 预算相同表现更优:在 high、xhigh、max 等高推理档位下,同等花费能获得比其他模型更高的 benchmark 分数。
- 一档模型全场景覆盖:从 low 到 max 五档 effort 调节,同一个模型既能秒回日常问题,也能啃下复杂难题,不用频繁切换。
- 办公与研究的头号选择:GDPval-AA v2 得分 1861,在分析、写作、决策类知识工作中全面领先竞品。
- 泛化能力断层领先:ARC-AGI 3 得分 30.2%,是 GPT-5.6 Sol 的三倍有余,面对训练集外的新任务适应性极强。
- 自动化任务省钱高效:AutomationBench 同预算通过率约为次优对手的 1.5 倍;OSWorld 2.0 上仅用 Fable 5 三分之一成本便刷新其最佳成绩。
- 信息检索与整合出色:BrowseComp 得分 90.8%,在复杂资料搜集、交叉验证和综述撰写上略胜 GPT-5.6 Sol。
- 生命科学领域显著进步:有机化学、结构生物学、生物信息学全面超越前代,光谱推断分子结构准确率提升超 10%,蛋白变异预测提升近 8%。
Claude Opus 5 的项目地址
项目官网:https://www.anthropic.com/news/claude-opus-5
Claude Opus 5 的操作步骤
接入模型
访问 Claude 网页端或 App,在模型切换栏选中 Claude Opus 5。Claude Max 订阅用户已默认启用该模型,Pro 用户也可在模型列表中将其设为最高能力选项。
匹配 effort 档位
日常问答、文本润色等轻量任务选 low/medium,响应快且省 token。代码调试、深度研究、复杂分析等重脑力任务切到 high、xhigh 或 max,换取更强推理质量。
交代完整上下文
下达指令时一并说明交付格式、字数限制、截止时间、可用工具及验收标准,减少模型反复确认,充分发挥其主动推进任务的特点。
编程实战用法
将项目目录结构、报错堆栈、接口文档和预期行为一并贴入,让它定位 bug、修改代码、补全测试并解释技术取舍。
知识工作流
先投喂背景材料、目标受众和输出模板,再让它执行调研、列提纲、写初稿、校对改写。利用其 GDPval-AA 领先能力处理方案、纪要、汇报等文档。
检索与综述
要求”先搜索再归纳,标注信息来源,区分事实与推测”,借助其 agentic search 能力完成竞品调研、行业研究和文献梳理。
自动化流程搭建
把重复性办公任务拆解为输入、步骤、输出和异常处理四个环节,由它端到端执行表单处理、数据迁移、报表生成等操作。
电脑操作授权
明确划定可操作的软件、文件路径和禁止动作后,再让它执行文件整理、批量表格处理、网页流程等轻量 RPA 任务。
科研辅助用法
用于结构生物学、有机化学、生物信息学等专业问题,如光谱推断分子结构或蛋白变异功能分析,但结果需经专家复核。
成本管控策略
用低档位试跑验证方向,确认后再对核心难题升档。长任务拆分为小批次执行,将 max effort 留给真正关键的高价值环节。
Claude Opus 5 的适用人群
- 软件开发者:需要代码生成、bug 排查、重构及终端命令辅助的工程师,Opus 5 在编程评测中登顶,是其最强能力释放场景。
- IDE 高频用户:在 Cursor 等工具中每日调用 AI 辅助编程的开发者,以约 Fable 5 一半成本获得接近峰值的代码协作能力。
- 企业知识工作者:频繁撰写方案、整理纪要、生成汇报及处理商业文档的职场人士,GDPval-AA 得分领先使其适合办公室高频使用。
- 深度调研人员:从事竞品分析、行业研究、文献梳理的分析师或研究员,可借助其智能搜索能力自动检索、比对来源并归纳结论。
- 流程自动化需求者:希望将表单处理、数据迁移、审批草稿、报表生成等重复性办公流程端到端自动化的业务人员或运营团队。
Claude Opus 5 的常见问题
Q:和 Fable 5 怎么选?
A:追求极限峰值且预算充足选 Fable 5,看重性价比与日常高频调用选 Opus 5,后者在 CursorBench 最高档与 Fable 5 峰值仅差 0.5% 而成本约一半。
Q:相比 Opus 4.8 提升在哪?
A:调用成本不变的前提下性能大幅提升,Frontier-Bench 编程得分从 21.1% 跃升至 43.3%,官方称性能提升一倍以上且单任务成本更低。
Q:Claude 当前模型层级如何理解?
A:Opus 5 定位高性价比旗舰,Fable 5 为更高阶前沿模型,Mythos 5 在少数高难度任务如网络安全上更强,Opus 5 仅在网络安全等个别领域落后 Mythos 5。

