1. Claude Opus 5 (www.anthropic.com)
发布与定位
Claude Opus 5 正式发布。该模型在接近 Claude Fable 5 前沿智能水平的同时价格仅为其一半,专为高效日常使用设计,现为 Claude Max 的默认模型和 Claude Pro 的最强模型。
性能与成本效益
相比前代 Opus 4.8,Opus 5 在同等成本下实现大幅提升。在软件工程基准 Frontier-Bench v0.1 上超越所有模型,且单次任务成本更低;在 CursorBench 3.2 上以 Fable 5 一半的成本达到其峰值性能的 0.5% 范围内。在知识工作领域,ARC-AGI 3(新颖问题解决)得分是次优模型的三倍;Zapier AutomationBench(端到端业务任务)在同等成本下通过率约为次优模型的 1.5 倍,即使最低努力设置也超越所有其他模型;OSWorld 2.0(计算机使用)在任何给定成本下均优于其他模型,以略高于 Fable 5 三分之一的成本超越其最佳成绩。科学研究方面,Opus 5 在生命科学评估(结构生物学、有机化学、生物信息学)全面优于 Opus 4.8,有机化学结构推断提升 10.2 个百分点,蛋白质功能预测提升 7.7 个百分点。视觉输出能力亦显著增强。
工作方式与自主性
Opus 5 大幅强化了工作验证与迭代能力。在无法直接查看图纸的情况下,它曾自行编写计算机视觉管道并重建 3D 机械零件;在开源包管理器漏洞修复中定位到社区补丁遗漏的根本原因;在无实时数据源时自主构建测试工具验证代码。早期用户反馈显示,该模型在调试、根因分析、长周期多步骤任务、金融与法律研究、基因组分析、前端开发等场景表现出更强的判断力、一致性、准确性和 Token 效率。
对齐与安全
自动行为审计显示,Opus 5 是 Anthropic 迄今为止最对齐的模型,对《Claude 宪法》的遵循度高于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为率最低,最不易被诱导滥用,且最避免难以逆转的鲁莽行为。在双重用途风险能力方面,Opus 5 并未推进前沿,在生物学研究和攻击性网络安全上仍落后于 Mythos 5。未针对网络任务训练,能力提升源于通用能力增长。在 OSS-Fuzz 等评估中,Opus 5 漏洞发现能力接近 Mythos 5,但在漏洞利用开发上差距显著。
防护措施
Opus 5 的网络安全分类器限制低于 Fable 5,允许源代码漏洞发现,但阻止二进制漏洞扫描、渗透测试和利用生成,预计干预频率比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,被标记请求默认回退至 Opus 4.8,API 亦可启用自动回退。参与网络验证计划(CVP)的企业和研究人员可立即使用限制更少的版本。生物学方面,Opus 5 与 Opus 4.8 防护级别相似,现为该级别中最强的科研模型;Fable 5 上被阻止的生物学请求现在将路由至 Opus 5 而非 Opus 4.8。
定价与可用性
Opus 5 已在全平台上线,定价维持前代水平:输入 $5/百万 token,输出 $25/百万 token。提供 Fast 模式,速度提升约 2.5 倍,价格为基准的两倍。同步发布两项 Beta 功能:支持对话中变更工具而不使提示缓存失效;API 安全标记请求可自动回退至其他模型。该模型对一般访问无数据保留要求。