Claude Sonnet 5.5深夜空降!一半价格击败Opus,开发者实测账单暴涨

智东西
作者 | 程茜
编辑 | 心缘
智东西9月29日消息,今日凌晨,Anthropic发布Claude 5.5系列第二款模型Claude Sonnet 5.5,主打快速、高性价比。
Anthropic在博客中透露,相比Claude Sonnet 5,新模型速度提升超30%,成本降低近30%,更擅长处理日常任务,如修复错误、创建文档、制作幻灯片和电子表格等。
先来看几项关键指标,Sonnet 5.5在多项指标中可对标Opus 5.5,相比Sonnet 5有数倍提升。Anthropic称,这是首个仅通过截图就能赢得《口袋妖怪红》游戏的Sonnet模型。在Artificial Analysis上,Sonnet 5.5在AI分析指数上得分为56,仅次于Opus 5.5的58分,该榜单上,Claude系列模型包揽前三席。
价格方面,Claude Sonnet 5.5定价与上一代相同,即每百万输入token 2美元,每百万输出token 10美元,每百万token的缓存读取操作需0.20美元。不过,其博客提到,模型在实际完成任务时,单任务成本比Claude Sonnet 5要低30%。
官方放出的案例显示,Sonnet 5.5复原魔方时仅花费10秒、0.11美元就完成任务。
Artificial Analysis的榜单显示,Sonnet 5.5单任务输出token数量更多,其单任务成本为7.60美元,比Sonnet 5的单任务成本高出约50%,接近于Opus 5.5的7.63美元。
不少开发者实测发现,Sonnet 5.5的成本非常高,“建议坚持使用Opus 5.5”。
Claude Sonnet 5.5现已在全平台上线,包括AWS、谷歌云以及微软Azure。开发者可在Claude 平台通过模型标识符claude-sonnet-5-5接入使用。 如果原先在Sonnet模型上关闭思考功能,迁移至Sonnet 5.5前,需要切换至新的between_tools参数配置,该配置可保持前置思考功能处于关闭状态。
Anthropic还透露,其专为高并发和成本敏感的应用而设计的Claude Haiku 5.5,将在未来几周发布。
一、数位开发者实测对比,效果惊艳但烧不起,一款射击游戏花费上千元
不少开发者实测对比了Sonnet 5和Sonnet 5.5,两代模型之间的性能提升幅度肉眼可见。
官方案例,知名开发者@_re_pete对比了Sonnet 5和Sonnet 5.5生成落叶模拟器的效果。可以看出,Sonnet 5.5的落叶飘落效果更自然,整体画面更和谐。
在不到一分钟内,开发者@kevin_t_ngo让Sonnet 5.5通过JavaScript动画展示了恐龙的历史,其还对比了Sonnet 5和Sonnet 5.5的生成结果。Sonnet 5.5生成的动画主题形象明确,还能添加配套文字,生成带叙事感的完整插画。
另一开发者对比了Sonnet 5.5与GPT-6 Sol、GPT-6 Astra的效果,其与GPT-6 Astra的差距并不大。Sonnet 5.5、GPT-6 Astra在生成骑自行车动作时没有出现太大瑕疵。
不过效果惊艳背后,用户实测发现Sonnet 5.5的成本并不低。
BridgeMind使用Sonnet 5.5制作了一款射击游戏,它称新模型表现机器出色,生成的游戏堪称神作,但构建成本要达到177美元(约合人民币1187元),耗时49分钟完成。
在下面开发者制作的城市模拟器案例中,Sonnet 5.5的效果明显比Sonnet 5更好,Sonnet 5.5的输出token数量为38万,花费了9.23美元,Sonnet 5为12万,花费4.85美元。
另一开发者使用Sonnet 5.5制作了一个果酱西瓜浏览器动画,最终预计的API使用成本约为8.20美元,其中代码与推理2.80美元、缓存上下文数据3.6美元、缓存写入操作1.8美元、常规输入token 0.02美元,其中2/3的资源都被用于处理上下文相关任务。
二、多项测试可对标Opus 5.5,Anthropic建议开发者调节档位降成本
从Anthropic发布的基准测试来看,Sonnet 5.5在多项指标中已经超越其性能更高的Opus 5.5模型。
具体来看,该基准测试对比了Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol四大模型在智能体编程、知识工作、多学科推理、电脑操作、图表识别等方面的性能。
和上代Sonnet 5对比,Sonnet 5.5在编程、图表识别上的分数提升了数倍;和GPT-6 Sol对比,Sonnet 5.5在智能体编程、知识工作、图表识别上都更优;Sonnet 5.5在主动编程领域上的分数甚至超过Claude Opus 5.5,其他几项与之相当。
下图是各模型在不同投入等级下的得分与单任务成本的对比曲线,数据点越靠近图表左上角,代表每花费一美元所能获得的模型能力越强。
在多项基准测试中,低/中等投入档位下的Sonnet 5.5能超越Sonnet 5的最高得分,而单任务成本仅为后者的约十分之一。 Sonnet 5.5在较低投入档位运行时,单任务成本更低,与Opus 5.5形成互补;拉高投入档位后,它可以达到接近Opus的性能,同时成本处于相近水平。
编程是Sonnet 5.5性能提升的一个突出场景。在智能体编程基准FrontierCode的高投入档位下,它的得分比同档位Sonnet 5高出10分左右,单任务成本仅约后者的1/15。
CursorBench基于Cursor真实编程会话任务开展测试,在该基准上,Sonnet 5.5的最高分与Opus 5.5差距仅约2分。
很多早期测试者称,在直接对比测试中,Sonnet 5.5能够将工具调用合并在一起,从而减少操作步骤、降低成本。
Sonnet 5.5在多项知识工作任务上均取得性能提升。GDPval-AA基准覆盖44个职业、9大行业的真实业务任务,在该测试中,Sonnet 5.5得分与Opus 5.5几乎持平,相比Sonnet 5高出约400分。在电脑操作与图表识别能力上,它的表现也十分接近Opus 5.5;而在长周期知识工作场景,其性能明显优于Sonnet 5和GPT-6 Sol。
价格方面,开发者调整投入档位,可在成本、响应速度与任务整体质量之间做权衡。在Claude Code以及Anthropic官方应用中,默认投入档位为中等(Medium);开发者平台Claude Platform默认档位为高(High)。
Anthropic官方称,档位较低时,Claude响应更快、消耗Token更少,适合常规事务处理;档位调高后,Claude会进行更长时间的推理,并对输出结果做更全面的自检核验。
三、大多数对齐性指标,与Sonnet 5相当
在其自动化行为审计中,Sonnet 5.5在大多数对齐性指标上均优于或达到与Sonnet 5相同的水平。由于其网络安全能力与Opus 5相当,因此它是首个具备网络安全防护措施和回退机制的Sonnet模型。其生物学安全防护机制与Sonnet 5相同。这两种安全防护机制都针对的是少数高风险操作;常规的软件开发和大多数生命科学领域的操作并未受到影响。
Anthropic研究人员在博客中透露,Sonnet 5.5并未突破其模型能力的前沿上限,因此他们将模型的对齐评估,聚焦于一组适用于所有能力等级模型的特定风险,包括损害用户利益、误导用户,以及被用于高风险恶意场景时产生协同危害。
研究人员开展自动化行为审计,在约1850个场景下对Claude进行测试。
结果显示,在对齐性、抗滥用能力与诚实度的大部分指标上,Sonnet 5.5相比Sonnet 5均有提升或持平。 在其新推出的隔离防护评估中,Sonnet 5.5尝试突破沙箱的概率接近本次测试中表现最优的Opus 5.5;并且在所有Anthropic模型里,它去试探容器防护边界的概率最低。他们没有发现Sonnet 5.5会去执行与用户意图相冲突的目标。
网络安全方面,Sonnet 5.5的网络安全相关能力相对Sonnet 5有提升,因此研究人员为其部署了与Opus 5.5相近的安全防护机制。用户仍然可以在常规软件开发流程中,利用模型查找并修复代码漏洞;但高风险网络安全任务会自动降级回Sonnet 5处理。
Sonnet 5.5沿用与Sonnet 5相同的生物相关安全防护机制。该防护体系针对有害请求;绝大多数科研、教育以及临床工作不受影响,但部分微生物学与病毒学相关请求可能出现误拦截。
在模型蒸馏防护方面,Sonnet 5.5是首款内置安全分类器以抵御推理提取攻击的Sonnet系列模型,并扩展了保留思考链路(preserved thinking)机制:Claude的推理思考过程无法脱离生成该内容的账号单独剥离。
此外,Claude Sonnet 5.5版本也提供了不保存任何数据功能的版本。
结语:Claude中端主力模型性能暴涨,但成本是个坎
Sonnet 5.5的升级,标志着Anthropic的主力中端大模型正在快速收窄与旗舰模型之间的能力差距。这或许会改变企业落地大模型的选型思路,不必一味追求最高规格旗舰,可采用主力模型承担绝大多数常规任务、旗舰模型仅处理高难度复杂任务的分层调用架构,在能力与成本之间找到更优平衡点。
不过综合开发者的实测结果来看,Sonnet 5.5在成本端并未实现大幅缩减。一旦面对复杂Agent任务,用户往往需要拉高投入等级来换取足够性能,此时单任务开销会明显抬升。
来源:Anthropic、X
资讯由采集器定时从公开机器人 / AI 信息源自动聚合。
相关内容

除了更贵的订阅和砍半的额度,OpenAI 想做的还是「微信」
模型越来越便宜,付费给的用量却砍了半 作者|Alan 北京时间 9 月 30 日凌晨,OpenAI 开完了它口中「迄今规模最大的一届」开发者大会。官方汇总页上一共列了 25 项发布,从新模型、新 API,一路排到给企业买软件用的应用市场。 现场最安静的一刻,出现在 Sam Altman 讲到 ChatGPT Pro 会员调整的时候。台下没有一个人鼓掌。 调整本身不复杂:每月 200 美元的 Pro 200 价格不变,新订阅的用量缩水;另外新增一档 Pro 500,每月 500 美元,用量是 Plus 的 25 倍,外加一个个人套餐里只有它能用的提速档 Astra Ultrafast。 那一阵沉

刚刚,iQOO掏出年度旗舰,自研电竞芯片性能提升15%,首款电竞平板也来了
智东西 作者 | 陈骏达 编辑 | 心缘 智东西9月29日报道,刚刚,vivo旗下iQOO品牌发布了年度旗舰手机iQOO 16,这台手机搭载了第六代骁龙8超级至尊版,全球首发了由iQOO和三星显示联合研发的2K 165Hz三星珠峰屏,并基于iQOO搭建的“3+2游戏技术版图”,提升了手机在视效、操控、直播和跨端游戏等维度的体验。 同时,iQOO还发布了其首款电竞平板iQOO Pad Ultra,这款产品同样采用第六代骁龙8超级至尊版,并搭配iQOO自研电竞芯片Q4和全新一代Monster超核引擎,还通过五重风冷散热系统、新一代超感触控引擎和自研Q-flex操控技术提升游戏体验。 先来看iQOO

刚刚,DeepSeek Harness桌面端上线,梁文锋开送Token了
智东西 作者 | 江宇 编辑 | 漠影 智东西9月29日报道,今日, DeepSeek正式推出DeepSeek Harness v0.2预览版 ,并提供开箱即用的macOS和Windows 桌面端 安装包。 ▲DeepSeek Harness v0.2预览版界面 用户前往DeepSeek Harness官网下载安装后,按照引导即可直接使用,无需再自行配置开发环境。 这是DeepSeek Harness自8月13日晚推出开发者预览版v0.1并同步开源后的又一次重要更新。 此次v0.2进一步补齐了 桌面端产品体验 ,不仅 预置日常办公和开发中的常用功能 ,还新增 插件安装与管理页面、自动化任务 等

AMD 82 亿美元收购 World Labs,买的不只是世界模型
9 月 3 日,英伟达宣布以约 130 亿美元收购 Hugging Face。25 天后,AMD 宣布以约 82 亿美元收购李飞飞创办的 World Labs。 两笔交易放在一起看,更觉得有意思。CNBC 最新的报道提到,Hugging Face 在被英伟达拿下之前,AMD 和 Salesforce 都曾表达过收购兴趣。 没抢到 AI 世界里最大的模型「集散地」,AMD 转身买下了一支造模型的顶级团队。 根据 AMD 的公告,这是一笔全股票交易 ,预计在 2026 年底前完成交割,仍需通过监管审批。交割之后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。 这也是 A

让Token像土豆一样便宜,要闯哪四关?
进入2026年下半年,全球算力涨价潮持续发酵。 “让全世界更多的人,像享受土豆一样,享受Token。” 9月19日,央视《对话》走进远景乌兰察布星河基地,远景科技集团创始人张雷用这个比方,提出了一个看似简单的问题: AI怎样才能更普惠? 这句“AI土豆论”很快在算力圈引发讨论,背后是全行业共同的成本焦虑: AI算力的门槛,实在太高了。 就在节目播出三天后,小米发布MiMo-V2.6,并公开了全程直播的“炼丹”账本,把这份昂贵具象化:MiMo-V2.6的Pro与Flash两个版本,仅强化学习后训练阶段就跑了不到6天,合计烧掉了 347万美元 , 约合人民币2344万元 。 这还只是后训练环节。据
Anthropic 招股书里,最耐人寻味的 7 个细节
作者|Techno 之王 编辑|靖宇 当地时间 9 月 28 日,外媒披露了一份 Anthropic 的 IPO 招股书。 先要说清楚这份文件的性质。它并不是 Anthropic 主动公开的版本。今年 6 月,Anthropic 以公益公司身份向美国证交会秘密递交了 S-1 注册声明草案,为普通股首次公开发行做准备。按照规则,公司要在向机构投资者路演前至少 15 天公开递交修订版 S-1,完整财务数据到那时才会被外界看到。路透此次看到的是一份尚未公开的版本, Anthropic 对此拒绝置评 。 这意味着其中的数字仍可能随证交会的审阅意见调整,不少细节也只能通过路透的转述窥见一角。 但如果这份