找工位
空间入驻
小程序

Claude Opus 5.5突然发布!降价40%速度翻倍,Personal Agent时代真的来了?

2026-09-24 05:04:42

还在为AI模型贵、慢、不够聪明而纠结吗?别急!就在刚刚,Anthropic毫无预兆地扔出了一颗重磅炸弹——Claude Opus 5.5正式登场!

这可不是什么常规的半代升级,官方直接放话:多数任务性能已经追平顶级旗舰Claude Fable 5.1,但成本暴降40%,速度飙升30%以上。更让人激动的是,它已经成为所有Claude付费计划的默认模型。

半代升级,性能却直逼顶级旗舰

Anthropic把Opus 5.5定位为长时间编程Agent和知识工作的主力干将。从官方放出的成绩单来看,这次升级确实有点东西。

🚀 编程与电脑操作全面开花

在Terminal-Bench 4.0中,Opus 5.5拿下66.4%的高分,把GPT-6 Astra的57.9%和Opus 5的52.3%远远甩在身后。FrontierCode v1.1得分54.4%,也稳稳压过GPT-6 Astra的53.3%。

更夸张的是CursorBench 4.0,直接从Opus 5的46.6%跃升到57.8%!电脑操作方面,OSWorld 2.0测试从74.0%提高到81.8%,进步肉眼可见。

知识工作领域同样不遑多让。GDPval-AA v2.1中,Opus 5.5拿下1846 Elo,超过Fable 5.1的1735分。不过也有短板,AutomationBench得分为40.0%,略低于GPT-6 Astra的41.4%。Anthropic自己也坦言:当前榜单差距已经无法完整反映真实体验。

💡 真正的杀手锏:超长任务能力

什么才是这次升级的灵魂?答案是持续数小时甚至十几个小时的长任务。

有早期测试者用Opus 5.5在一天内完成了68万行代码的迁移!另一项20万行代码库审计,不到三小时就搞定了,而Opus 5需要超过20小时,token消耗还是前者的2.5倍。

最硬核的测试来了:让Opus 5.5和Fable 5.1把HAProxy从C语言重写为Rust。两者都通过了绝大多数回归测试,但Opus 5.5只用9.5小时,Fable 5.1用了12小时,而且前者成本低了51%!

知识工作方面同样惊艳。在一项季度业绩报告测试中,模型只能从难以检索的网页副本里找资料,任何虚构数字都会导致失败。Opus 5.5提交的18份报告中有16份过关,Fable 5.1和Opus 5一次都没达标。

降价之后,Opus开始成为日常主力

比榜单更让用户心动的,永远是价格和速度。

⚠️ 价格大跳水,订阅用户狂喜

Opus 5.5的API输入和输出价格分别为每百万token 4美元和20美元,比Opus 5低20%。缓存读取价格更是从0.50美元降至0.20美元,降幅高达60%!

还提供最高2.5倍速度的Fast mode,价格为每百万输入token 8美元、输出40美元。模型支持100万token上下文和12.8万token最大输出,思考模式始终开启。

更让人开心的是,Anthropic同时提高了Pro、Max和Team计划的五小时使用限额,直接增加20%!更低的模型价格还会让同一额度下的可用时长再增加约25%。订阅用户还会获得一次可自行选择时间的额度重置,有效期到10月22日。

不过要提醒一句:有开发者根据测试指出,在max档运行时,Opus 5.5的输出token消耗位居已测模型最高水平。官方说的成本降低,主要建立在默认设置和典型工作负载上。

🌟 社区实测:创意能力炸裂

社区最早一批实测集中在创意编程、3D建模和可交互模拟。

Wes Bos连续一周使用后认为,Opus 5.5已经达到Fable级别。他让模型渲染了500种常见健身器材,做出一套完整的健身房搭建器。BridgeMind更是一次提示就生成了可玩的Mario Kart游戏,场景和玩法细节明显多于Fable 5.1的版本。

最特别的案例来自Jake Eaton。他没用任何图像模型或绘图软件,而是让Opus 5.5编写约7500行Python代码,通过标准库模拟不同笔刷,逐像素绘制出多种艺术风格。

当然也有翻车时刻。Auggie用Bach Benchmark测试音乐创作能力,生成的四声部众赞歌出现了声部间距、重复音和平行八度等问题。沃顿商学院教授Ethan Mollick则认为,Opus 5.5是首个让自己感到接近Fable水平的非Fable系列模型,但文字过密问题仍未完全消失。

Personal Agent时代,从一张便宜账单开始

Opus 5.5还是Anthropic提出放慢前沿竞赛节奏后发布的第一款模型。

💡 安全措施全面升级

发布前,Frontier Design和METR等外部机构参与了评估。官方评估显示,Opus 5.5尝试突破限制边界的频率较Opus 5低约85%。由于生物与网络安全能力接近Mythos 5.1,Opus 5.5启用了与Fable 5.1相近的安全措施,大部分网络安全任务会转交给Opus 4.8。

从Opus 5到Opus 5.5,Anthropic只用了两个月左右。型号只前进了半步,但模型市场的竞争逻辑已经发生改变。

一个模型能否被反复调用、长时间运行,并以可接受的成本进入真实工作流,正在变得比单次评测高出几个百分点更加重要。旗舰能力持续降价,意味着先进智能正在从稀缺服务变成可以大规模使用的通用生产资料。

Personal Agent由此获得了全天运行的经济基础,它可以持续记住用户、理解用户,在后台处理琐事,完成过去需要人们反复发起的任务。

九月模型发布仍会制造一轮又一轮潮水,但真正改变海岸线的,从来都是持续上涨的水位。

当先进智能便宜到可以全天运行,Personal Agent也会从偶尔拍岸的浪花,变成日常生活无法忽略的潮汐。

你觉得Opus 5.5这波降价增配能让你把AI用起来吗?评论区聊聊你的看法!如果觉得有用,别忘了点赞分享给身边还在观望的朋友~