Claude Opus 5是什么
Claude Opus 5 是 Anthropic 最新发布的旗舰级模型,定位“接近 Fable 5 的前沿智能,价格约为后者一半”,相比 Opus 4.8 在成本不变的前提下大幅提升性能,已成为 Claude Max 默认模型、Claude Pro 上的最强选择。 引入可调节的 effort 思考档位,用户能在更强推理与更低延迟、更省 token 之间权衡;在 Frontier-Bench、GDPval-AA、ARC-AGI 3、AutomationBench、OSWorld 2.0 等编程、知识工作、商业自动化和电脑操作评测中多项登顶,仅网络安全等少数任务落后 Mythos 5。
阅读目录

Claude Opus 5的主要功能
-
可调 effort 思考档位:支持 low、medium、high、xhigh、max 等档位,调高获得更强推理,调低则更快、更省 token,便于按任务平衡质量、速度与成本。
-
Agentic 编程能力:面向终端与软件工程任务,在 Frontier-Bench v0.1 得分 43.3%,高于 Fable 5、Opus 4.8 与 GPT-5.6 Sol;官方称相比 Opus 4.8 性能提升一倍以上且单任务成本更低。
-
代码协作优化:在 CursorBench 3.2 最高档位下与 Fable 5 峰值仅差 0.5%,成本约一半;high、xhigh、max 档位同预算表现领先其他模型。
-
知识工作与写作:覆盖分析、研究、文档、办公类任务,GDPval-AA v2 得分 1861,领先 Fable 5、GPT-5.6 Sol 与 Opus 4.8。
-
智能搜索与浏览:具备 agentic search 能力,BrowseComp 得分 90.8%,略高于 GPT-5.6 Sol 的 90.4%,可用于复杂资料检索与综合。
-
电脑操作能力:在 OSWorld 2.0 得分 70.6%,高于 Fable 5 与 GPT-5.6 Sol,官方称可用约三分之一成本超过 Fable 5 最好成绩。
-
商业流程自动化:可端到端完成商业任务,AutomationBench 通过率 26.0%,同成本下约为次优模型 1.5 倍;最低 effort 档完成任务数也超过所有竞争者。
-
新问题求解:ARC-AGI 3 得分 30.2%,约为第二名 GPT-5.6 Sol 的三倍,强调处理训练中未见过任务的能力。
-
科学研究辅助:生命科学评测全面超过 Opus 4.8,覆盖结构生物学、有机化学、生物信息学;光谱推断分子结构提升 10.2 个百分点,蛋白序列变异功能影响预测提升 7.7 个百分点。
-
更主动也更审慎:官方定位为更 proactive、更深思熟虑的模型,能减少来回确认、自我检查并在任务中从错误恢复;同时强调安全护栏。
-
高频日常与产品集成:运行效率更高,适合日常使用;已成为 Claude Max 默认模型,也是 Claude Pro 上可用的最高能力选择,界面提供 “Opus 5 High” 等档位入口。
如何使用Claude Opus 5
-
访问平台:打开 Claude 应用或网页版,在模型选择器中切换到 Claude Opus 5。
-
按订阅层级使用:Claude Max 已把 Opus 5 作为默认模型;Claude Pro 用户可作为当前最高能力选择。
-
按任务调 effort 档位:简单问答、摘要、润色用低档位更快更省;代码调试、复杂分析、研究任务调到 high、xhigh 或 max 以获得更强推理。
-
给清晰目标和约束:说明交付物、格式、字数、截止时间、可用工具与验收标准,减少来回确认,发挥“更主动”的特点。
-
编程场景:粘贴仓库结构、报错日志、接口文档和期望行为,Opus 5 最强方向是定位问题、改代码、跑测试并解释取舍。
-
知识工作:给背景资料、目标读者和输出模板,然后进行调研、提纲、初稿、校对与改写;GDPval-AA v2 显示其知识工作领先。
-
搜索与综述:要求“先检索再归纳,标注来源,区分事实与推测”,对应其 agentic search 能力,BrowseComp 得分 90.8%。
-
自动化流程:把重复性办公流程拆成步骤、输入、输出和异常处理,让它端到端执行;AutomationBench 显示其同成本通过率约为次优 1.5 倍。
-
电脑操作类任务:明确允许操作的软件、文件范围和禁止动作,再让进行执行;OSWorld 2.0 上 Opus 5 得分 70.6%。
-
科研场景:用于结构生物学、有机化学、生物信息学等问题,例如光谱推断分子结构、蛋白变异功能影响分析;但仍需专家复核。
-
控制成本:先用低档位试跑,再对难任务升档;长任务拆小批量执行,优先把 max effort 留给关键难题,因为高档位更聪明但更耗 token。
Claude Opus 5的核心优势
-
半价逼近旗舰:智能水平接近 Fable 5,但价格约为后者一半;CursorBench 3.2 最高档位与 Fable 5 峰值仅差 0.5%,成本却约一半。
-
加量不加价:相比 Opus 4.8,在成本不变前提下大幅提升性能,官方称 Frontier-Bench 编程任务性能提升一倍以上且单任务成本更低。
-
编程能力最突出:Frontier-Bench v0.1 得分 43.3%,高于 Fable 5 的 33.7%、GPT-5.6 Sol 的 34.4% 和 Opus 4.8 的 21.1%。
-
同预算更能打:在 high、xhigh、max 档位下,同等成本得分领先其他模型;官方叙事可概括为“花一半的钱,完成接近 99% 的工作”。
-
effort 弹性稀缺:一个模型覆盖从快到省到深度推理的多档需求,低档位可高频日用,高档位攻坚难题,成本曲线更可控。
-
知识工作领先:GDPval-AA v2 得分 1861,超过 Fable 5、GPT-5.6 Sol 与 Opus 4.8,适合研究、分析、写作与办公决策。
-
新问题求解跃升:ARC-AGI 3 得分 30.2%,约为第二名 GPT-5.6 Sol 的三倍,说明面对陌生任务的泛化能力更强。
-
自动化与电脑操作性价比高:AutomationBench 同成本通过率约为次优 1.5 倍;OSWorld 2.0 用约三分之一成本即可超过 Fable 5 最好成绩。
-
搜索与综合能力靠前:BrowseComp 90.8%,略高于 GPT-5.6 Sol 的 90.4%,适合复杂检索、资料比对和综述生成。
-
科研能力增益明确:生命科学各项评测超 Opus 4.8,有机化学提升最大;光谱推断分子结构 +10.2 个百分点,蛋白变异功能影响预测 +7.7 个百分点。
Claude Opus 5的项目地址
- Claude Opus 5:https://www.anthropic.com/news/claude-opus-5
Claude Opus 5的同类竞品对比
| 对比项 | Claude Opus 5 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| 定位 | 高性价比旗舰:接近前沿智能,适合高频日常与专业工作 | 更高阶前沿模型,Opus 5 的主要“追平对象” | 外部强竞品,多项跑分进入第一梯队 |
| 价格/成本 | 约为 Fable 5 一半;相比 Opus 4.8 成本不变但性能大幅提升 | 价格约为 Opus 5 两倍 | 成本曲线整体弱于 Opus 5,多项同成本得分落后 |
| Frontier-Bench v0.1 终端编程 | 43.3%,第一 | 33.7% | 34.4% |
| CursorBench 3.2 | max 档与 Fable 5 峰值只差 0.5%,成本约一半 | 峰值最高,但成本更高 | 同预算下整体低于 Opus 5 |
| GDPval-AA v2 知识工作 | 1861,第一 | 1747 | 1736 |
| ARC-AGI-3 新问题求解 | 30.2%,约为第二名三倍 | — | 7.8% |
| BrowseComp 智能搜索 | 90.8%,微幅第一 | 87.4% | 90.4% |
| OSWorld 2.0 电脑操作 | 70.6%,第一;约三分之一成本可超 Fable 5 最好成绩 | 66.1% | 62.6% |
| AutomationBench 商业流程 | 26.0%,第一;同成本约为次优 1.5 倍 | 17.4% | 18.1% |
| DeepSWE v1.1 | 68.8% | 69.7% | 72.7%,该项第一 |
| FrontierCode v1.1 | 53.4% | 53.5%,微幅第一;也是官方加粗乌龙所在项 | 47.5% |
| HLE 多学科推理 | 无工具 56.3%,有工具 64.7% | 无工具 56.5% 微胜,有工具 63.9% | — |
| Legal / Health | Legal 11.7%;Health 59.8% | Legal 13.3% 更强;Health 表中未列 Fable,Mythos 5 为 66.0% | Legal 2.5%;Health 60.5% |
| 更适合 | 追求“接近旗舰 + 控制成本”的编程、知识工作、自动化、科研日常用户 | 预算充足、追求极限峰值能力的高难任务 | 已在 OpenAI 生态内,或看重 DeepSWE/Health 个别强项的团队 |
Claude Opus 5的应用场景
-
软件开发与重构:适合需求澄清、代码生成、bug 定位、测试补全、重构解释和终端命令辅助;Frontier-Bench 终端编程 43.3% 登顶,是其最强场景。
-
AI 编程助手日常化:在 Cursor 类工作流里做长任务拆解、跨文件修改和回归检查;CursorBench 最高档接近 Fable 5 峰值但成本约半,适合高频调用。
-
企业知识工作:写方案、做研究、整理会议纪要、生成汇报、改简历/公文/商业文档;GDPval-AA v2 1861 领先,适合办公室高频使用。
-
深度检索与综述:给课题后自动检索、比对来源、归纳结论并标注不确定性;BrowseComp 90.8%,适合竞品调研、行业研究、文献梳理。
-
商业流程自动化:把表单处理、数据搬运、审批草稿、客户跟进、报表生成等流程端到端跑起来;AutomationBench 同成本通过率约为次优 1.5 倍。
-
电脑操作与轻量 RPA:在明确权限边界内操作软件、整理文件、批量处理表格和网页流程;OSWorld 2.0 70.6%,且成本效率优于 Fable 5。
Claude Opus 5的常见问题
Q:和 Claude Fable 5 怎么选?
A:要极限峰值、预算充足选 Fable 5;要性价比和日常高频选 Opus 5。CursorBench 最高档下 Opus 5 与 Fable 5 峰值只差 0.5%,成本约一半。
A:要极限峰值、预算充足选 Fable 5;要性价比和日常高频选 Opus 5。CursorBench 最高档下 Opus 5 与 Fable 5 峰值只差 0.5%,成本约一半。
Q:它和 Opus 4.8 比提升在哪?
A:官方口径是成本不变、性能大幅提升;Frontier-Bench 编程任务中得分从 21.1% 到 43.3%,并称性能提升一倍以上、单任务成本更低。
A:官方口径是成本不变、性能大幅提升;Frontier-Bench 编程任务中得分从 21.1% 到 43.3%,并称性能提升一倍以上、单任务成本更低。
Q:Claude 现在的模型层级怎么理解?
A:可粗略理解为 Opus 5 主打高性价比旗舰,Fable 5 更高阶,Mythos 5 在少数高难项更强;Opus 5 仅网络安全等任务明确落后 Mythos 5。
A:可粗略理解为 Opus 5 主打高性价比旗舰,Fable 5 更高阶,Mythos 5 在少数高难项更强;Opus 5 仅网络安全等任务明确落后 Mythos 5。
Q:在哪里能用 Claude Opus 5?
A:Claude Max 已将其作为默认模型;Claude Pro 用户可把它作为最高能力选择。界面中可见类似 “Opus 5 High” 的档位入口。
A:Claude Max 已将其作为默认模型;Claude Pro 用户可把它作为最高能力选择。界面中可见类似 “Opus 5 High” 的档位入口。
Q:effort 档位是什么,怎么用?
A:effort 是思考强度档位,调高更聪明、调低更快更省 token。简单任务用低档,代码、研究、自动化等难任务再升到 high/xhigh/max。
A:effort 是思考强度档位,调高更聪明、调低更快更省 token。简单任务用低档,代码、研究、自动化等难任务再升到 high/xhigh/max。
Q:最擅长什么?
A:最强是软件工程与终端编程;其次是知识工作、智能搜索、商业流程自动化、电脑操作和新问题求解。对应 Frontier-Bench、GDPval-AA、BrowseComp、AutomationBench、OSWorld、ARC-AGI 3 多项领先。
A:最强是软件工程与终端编程;其次是知识工作、智能搜索、商业流程自动化、电脑操作和新问题求解。对应 Frontier-Bench、GDPval-AA、BrowseComp、AutomationBench、OSWorld、ARC-AGI 3 多项领先。
