Anthropic 发布 Claude Haiku 5.5:自称最便宜最快的小模型,运行成本比 Haiku 4.5 低 75%

ROBOT@qwh 2026-10-08 阅读:9 评论:0
2026 年 10 月 7 日,Anthropic 在官方发布页《Introducing Claude Haiku 5.5》中推出新一代小模型,模型 ID 为 claude-haiku-5-5,并称它是公司迄今最便宜、最快、能力最强的小...

Anthropic 官方发布页《Introducing Claude Haiku 5.5》

2026 年 10 月 7 日,Anthropic 在官方发布页《Introducing Claude Haiku 5.5》中推出新一代小模型,模型 ID 为 claude-haiku-5-5,并称它是公司迄今最便宜、最快、能力最强的小模型。本文依据该官方页面整理,所有性能、价格与评测数字均为厂商自述,不是独立测评。官方页面中「准确率 vs. 成本」图表只有图例与坐标轴能以文本方式采集,各数据点的具体数值未取得,本文按「素材未覆盖」如实标注。

一、定位与发布概况

Anthropic 官方称,Haiku 5.5 面向高并发、成本敏感的任务,适合摘要、压缩、数据库查询与分类这类快速重复的负载。它可以作为 Opus 5.5、Sonnet 5.5 在编码工作上的子代理,也适合实时客服、浏览器操作等对速度敏感的场景——官方称它是目前最快的模型(口径见文末脚注)。

价格上,官方称其平均运行成本比 Haiku 4.5 低约 75%。可用性方面,模型已在 Amazon Web Services、Google Cloud 与 Microsoft Azure 全平台开放,开发者可在 Claude Platform 上以 claude-haiku-5-5 调用,迁移细节见官方迁移指南。

二、Anthropic 官方公布的基准表现

官方页面给出下表,对比对象为 Haiku 4.5、GPT-6 Luna 与 Sonnet 5.5,这些数字同样出自 Anthropic 自己的评测口径:

Anthropic 官方 Haiku 5.5 基准对比表

------------
GDPval-AA v2.1(知识工作)16207351437
AA-Briefcase v1.1(知识工作)15786141336
OSWorld 2.1(离线子集,电脑操作)72.4%15.7%48.9%
Humanity's Last Exam(无工具)45.9%10.2%—
Humanity's Last Exam(带工具)57.4%18.7%—
Terminal-Bench 4.0(agentic 编码)39.2%0.0%16.4%
FrontierCode 1.1(Main)46.4%—42.4%
Chartography(无工具,视觉推理)46.4%6.4%29.1%
GDPval-AA v2.1(知识工作)16207351437
AA-Briefcase v1.1(知识工作)15786141336
OSWorld 2.1(离线子集,电脑操作)72.4%15.7%48.9%
Humanity's Last Exam(无工具)45.9%10.2%—
Humanity's Last Exam(带工具)57.4%18.7%—
Terminal-Bench 4.0(agentic 编码)39.2%0.0%16.4%
FrontierCode 1.1(Main)46.4%—42.4%
Chartography(无工具,视觉推理)46.4%6.4%29.1%

官方称 Haiku 5.5 是首个带 adjustable effort(可调投入) 设置的 Haiku 级模型,用户可在成本与智能之间取舍,并用三个基准(OSWorld、GDPval-AA、Humanity's Last Exam)展示 Low、Med、High、Xhigh、Max 各档的表现。素材未覆盖:这些图表只有图例与坐标轴被采集到(纵轴 Partial-credit score 0–90,横轴 Cost per attempt 0.05–5 美元对数刻度),各数据点的具体数值未取得,本文无法给出曲线层面的结论。官方把评测细节指向 Haiku 5.5 System Card。

三、定价与 Sonnet 5.5 缓存读取降价

官方公布每百万 token 价格,Haiku 5.5 分 prompt ≤100k 与 >100k 两档:

Anthropic 官方每百万 token 定价对比表

------------
缓存读取$0.01 / $0.05$0.10$0.10
缓存写入$0.125 / $0.625$1.25$2.50
输入$0.10 / $0.50$1.00$2.00
输出$0.50 / $2.50$5.00$10.00
缓存读取$0.01 / $0.05$0.10$0.10
缓存写入$0.125 / $0.625$1.25$2.50
输入$0.10 / $0.50$1.00$2.00
输出$0.50 / $2.50$5.00$10.00

官方称 Haiku 5.5 在 prompt 不超过 100,000 token 的任务上性价比最好,这类请求约占上一代 Haiku 模型请求量的 90%。同期,官方把 Claude Sonnet 5.5 的缓存读取价格减半:由每百万 token $0.20 降至 $0.10,并称这使 Sonnet 5.5 在大多数 agentic 任务上便宜约 20%。

四、客户反馈

官方称早期测试中客户反馈与上述性能、成本改进一致,页面列出 Asana、HubSpot、AlphaSense、Box、Rogo、Cognition 六家客户并给出署名引述(以下均为厂商页面原文摘录):

  • Asana(Staff Software Engineer Aaron Vinh):在覆盖缺陷分诊、项目搭建与作品集检索等用例的 AI Teammates 评测中,任务完成延迟比其现用模型下降超过 30%,每个 agent turn 的推理最高快 2.5 倍。
  • HubSpot(Distinguished Software Engineer Ze'ev Klapow):用模拟门户在 CRM 任务上评测新模型,Haiku 5.5 在其评测套件上拿到迄今最高分 92.8%(三次运行平均);在一项识别陈旧但模糊记录的 CRM 审计任务上,Haiku 5.5 完成最快、命中率最高、误报率最低。
  • AlphaSense(Distinguished Engineer Daniel Campos):Ask in Document 是其最大的支出来源之一,生产环境每周约 800 万次调用;用 400 条查询测试后,Haiku 5.5 相对 Haiku 4.5 是统计显著的提升(0.84 vs 0.76)。
  • Box(VP of AI Products Yashodha Bhavnani):早期测试中 Haiku 5.5 比 Haiku 4.5 高 11 分,延迟约为后者一半;计划把它用于成本报告、财务摘要、周度回顾等规模化分析工作。
  • Rogo(Applied AI Alex Wang):短时高量工作(快速查询、子代理、摘要)正适合 Haiku 5.5——大模型做演示稿时,一个 Haiku 5.5 子代理去 10-K 里提取演示稿需要的分部营收数据,准确到可以信任,又快又便宜可以大量跑。
  • Cognition(Co-Founder & CPO Walden Yan):Haiku 5.5 加入 Devin Fusion 的 sidekick 阵容,作为 sidekick 时 Fusion 拿到 66.2 的 FrontierCode 高分,同时降低了成本与延迟;可在 Devin CLI 中搭配 Opus 5.5 作 lead 试用。

五、安全防护

安全方面,官方称 Haiku 5.5 在几乎全部对齐评测上相对 Haiku 4.5 有大幅改善,错位行为更少、配合滥用的意愿更低。其网络安全防护比 Haiku 4.5 更严,但比 Anthropic 近期其他模型略松——对防御性任务的允许范围宽于 Sonnet 5.5 的防护,同时仍阻止渗透测试等更可能被攻击者使用的手法。生物学防护与 Sonnet 5、Sonnet 5.5、Opus 5 相同:允许研究性生物学问题,限制可能造成伤害的请求。从事更广泛生物与网络安全活动的组织可申请 Life Sciences Verification Program 与 Cyber Verification Program。

六、同期更新

除了 Haiku 5.5 定价,官方还宣布了三件事:

1. Sonnet 5.5 缓存读取降价。 即日起每百万 token 由 $0.20 降至 $0.10(降 50%)。官方用 Terminal-Bench 4.0 的「准确率 vs. 成本」图对比降价前后的 Sonnet 5.5,并强调:Sonnet 5.5 和 Opus 5.5 仍是复杂 agentic 编码任务(如 Terminal-Bench 4.0 所测)的更优选择;Haiku 5.5 更适合窄范围任务——压缩、摘要或子代理这类以往用旧版 Claude 会成本过高的活。

2. 月度 API credit。 本周起面向全部 Max 与 Team 订阅者推出,可在 Claude Platform 上使用:Max 5x 用户每月 $100,Max 20x 用户每月 $200,Team 订阅者最高 $500(按用户池合计)。credit 可用于任意模型,目的是让用户试用构建调用 API 的工具、应用与 Agent(帮助中心说明)。

3. SDK 更新。 Claude Python 与 TypeScript SDK 新增对 computer use 与 browser use 的 beta 支持;Haiku 5.5 因速度、能力与价格的组合特别适合这类任务(Claude Platform 文档)。

要点

  • Anthropic 官方称 Haiku 5.5(模型 ID claude-haiku-5-5)是其迄今最便宜、最快、能力最强的小模型,面向高并发成本敏感任务,并可担任 Opus 5.5 / Sonnet 5.5 的编码子代理。
  • 官方称其平均运行成本比 Haiku 4.5 低约 75%;官方公布价格为 prompt ≤100k 时输入 $0.10、输出 $0.50(每百万 token),>100k 时分别为 $0.50、$2.50。
  • 官方公布的基准在两边都有数据的项上均领先 Haiku 4.5(如 OSWorld 2.1 离线子集 72.4% 对 15.7%;FrontierCode 1.1 一行未给出 Haiku 4.5 数据),但仍低于 Sonnet 5.5;这些数字出自 Anthropic 自己的评测口径。
  • 官方称它是首个带 adjustable effort 的 Haiku 级模型;官方用「准确率 vs. 成本」图展示 OSWorld、GDPval-AA、Humanity's Last Exam 三个基准在各 effort 档的表现,图表数据点素材未覆盖。
  • 同期官方把 Sonnet 5.5 缓存读取价由 $0.20 降至 $0.10(每百万 token),称 agentic 任务约便宜 20%;Max 5x / Max 20x / Team 订阅者将分别获得每月 $100 / $200 / 最高 $500 的 API credit。
  • 官方称其对齐表现相对 Haiku 4.5 改善,网络安全防护仍阻止渗透测试;模型已在 AWS、Google Cloud、Microsoft Azure 全平台可用。

脚注

1. 「最快的模型」口径:官方称 Haiku 5.5 是各模型标准速度下最快的模型,但运行速度不及 Fast Mode 下的 Opus 系列。

2. 「平均便宜 75%」口径:官方称 Haiku 5.5 对 ≤100k token 的请求定价比 Haiku 4.5 低 90%,>100k 的请求低 50%;Haiku 4.5 有 90% 的请求属于前一类。这一计算也考虑了 tokenizer 变化——Haiku 5.5 使用更新后的 tokenizer(与 Sonnet 5.5、Opus 5.5 类似),完成同一任务使用的 token 略多。

出处

  • 主来源:Anthropic 官方发布页《Introducing Claude Haiku 5.5》,URL ,页面日期 October 7, 2026;本文整理时重新抓取该页面(2026-10-08,HTTP 200)核对内容并补齐客户引述与 Further updates 小节。
  • 页面引用但未展开阅读的文档:Haiku 5.5 System Card、Sonnet 5.5 迁移指南、Life Sciences Verification Program 与 Cyber Verification Program——本文未依据其内容作任何断言。
  • 口径与版权:页面为 Anthropic 官方营销/发布材料,性能与价格数字均为厂商自述;本文为提炼综述,客户引述为页面原文摘录,不整段复制其余内容,图表数据点缺口已标注「素材未覆盖」。
版权声明

本文仅代表作者观点,不代表本网站立场。
本文系作者授权本网站发表,未经许可,不得转载。

发表评论
热门文章
  • 康普顿未来智慧农场

    康普顿未来智慧农场
    康普顿未来农场,使用更少的水和1%的土地,即可实现与产统农业相同产量....
  • 一种自动确定计算机游戏状态中可能动作的方法

    一种自动确定计算机游戏状态中可能动作的方法
    由于手动彻底测试视频游戏软件非常困难,因此需要拥有能够自动探索不同游戏功能的人工智能代理。此类代理的关键要求是玩家动作的模型,代理可以使用该模型来确定不同游戏状态下的可能动作集,以及对代理策略选择的游戏执行选定的动作。目前使用的典型游戏引擎不提供这样的动作模型,导致现有的工作要么需要人工手动定义动作模型,要么不精确地猜测可能的动作。在我们的工作中,我们通过为游戏中存在的用户输入处理逻辑开发最先进的分析方法来演示程序分析如何有效解决该问题,该分析可以使用离散动作空间自动建模游戏...
  • 拆解 OpenAI 的新董事会

    拆解 OpenAI 的新董事会
    在人工智能和技术领域掀起波澜的惊人事件中,人工智能领域的领先实体 OpenAI 最近的领导地位发生了重大转变。以萨姆·奥尔特曼 (Sam Altman) 戏剧性地重返首席执行官职位以及随之而来的董事会改组为标志,这些变化代表了该组织的关键时刻。OpenAI 以其在人工智能研究和开发方面的开创性工作而闻名,包括广泛认可的 ChatGPT 和 DALL-E 模型,站在人工智能进步的最前沿。因此,董事会的重组不仅仅是人员的变动,还标志着人工智能领域最具影响力的组织之一的方向、优先事...
  • HierSpeech++:通过零样本语音合成新架构

    HierSpeech++:通过零样本语音合成新架构
    基于大语言模型(LLM)的语音合成已广泛应用于零样本语音合成中。然而,它们需要大规模数据,并且具有与以前的自回归语音模型相同的局限性,包括推理速度慢和缺乏鲁棒性。本文提出了 HierSpeech++,一种快速、强大的零样本语音合成器,用于文本到语音(TTS)和语音转换(VC)。我们验证了分层语音合成框架可以显着提高合成语音的鲁棒性和表现力。此外,即使在零样本语音合成场景中,我们也显着提高了合成语音的自然度和说话人相似度。对于文本到语音,我们采用文本到向量框架,该框架根据文本表...
  • 使用众包反馈来帮助训练机器人

    使用众包反馈来帮助训练机器人
    为了教人工智能代理一项新任务,比如如何打开厨房柜子,研究人员经常使用强化学习——这是一种试错过程,在该过程中,代理会因采取更接近目标的行动而获得奖励。在许多情况下,人类专家必须仔细设计奖励函数,这是一种激励机制,赋予代理人探索的动力。当智能体探索并尝试不同的动作时,人类专家必须迭代地更新奖励函数。这可能非常耗时、效率低下,并且难以扩展,尤其是当任务复杂且涉及许多步骤时。来自麻省理工学院、哈佛大学和华盛顿大学的研究人员开发了一种新的强化学习方法,该方法不依赖于专门设计的奖励函数...