Codex Reset
AI快讯
GitHub

QQ·微信群

CODEX / SIGNAL STUDIO

你的 Codex,尽在掌握。

Artificial Analysis 在其智能指数中给 Claude Haiku 5.5 评出 43 分

Artificial Analysis

Artificial Analysis 在其智能指数(Intelligence Index)中给 Claude Haiku 5.5 评出 43 分,比一年前的前代 Haiku 高出 26 分。上下文窗口为 100 万 token,高于 Claude 4.5 Haiku 的 20 万 token。该模型支持文本与图像输入,输出为文本。

在最大推理力度(maximum effort)下,该得分略高于 GLM-5.3 Flash(42 分)、Gemini 3.8 Flash(41 分)和 GPT-6 Luna(38 分),与 Kimi K3(44 分)相当,比最大推理力度下的 Claude Sonnet 5.5(56 分)低 13 分。在同一指数中,最大推理力度下每项任务使用约 162,000 个输出 token,大约是最大推理力度下 GPT-6 Luna(约 50,000 个)的三倍。从 xhigh 提升至 max 会增加 2 分,但 token 消耗约为 1.8 倍。在同为 38 分的情况下,high 推理力度每项任务使用约 55,000 个 token,而 GPT-6 Luna 在最大推理力度下约为 50,000 个。

在 Artificial Analysis 针对现实知识工作任务的私有评测 AA-Briefcase 中,该模型在最大推理力度下达到 1,578 Elo 分数,领先于 Kimi K3 和 GLM-5.3,与最大推理力度下的 Muse Spark 1.3 相当。在 Terminal-Bench 4.0 上,其得分为 33%,高于 Haiku 4.5 的 0%,与 GLM-5.3 Flash 持平,并领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。

AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%。Artificial Analysis 表示,部分差距源于该模型更愿意承认自身不知道:其幻觉率为 40%,而另外两款模型分别为 55% 和 77%。在 AutomationBench-AA 上,该模型得分为 35%,而这三款模型为 53%–60%。Artificial Analysis 表示,发布前测试中的安全拒绝问题导致了过度拒绝,Anthropic 正在修复,该机构后续将重新评测并预计分数会有所提升。

5 分钟缓存写入费用为:提示词不超过 100,000 token 时每百万 token 0.125 美元,超过后为 0.625 美元。Artificial Analysis 表示其网站尚未体现分档定价,因此 Haiku 5.5 的临时成本数据未计入超过 100,000 token 的更高费率。