觉
AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-09-22 14 浏览 公开

Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8

第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-09-22 09:49:19

原贴

查看原文
作者:X:Artificial Analysis (@ArtificialAnlys) 来源站点:x.com 原贴时间:
Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8

原文

Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。 AIHOT 分类:tip AIHOT 推荐理由:Artificial Analysis 实测 Step 5 Preview 的得分、成本与智能体短板,读者可据此对比同分段模型的表现与性价比。

中文翻译

Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。

核心信息

第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。

  • 第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。
  • 原贴提到:Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelli
  • 来源:x.com

详细解读

这是什么信号:第三方评测机构 Artificial Analysis 对阶跃星辰 Step 5 Preview 给出 Intelligence Index 44 分,落在国产旗舰模型的头部区间内——与 Kimi K3(max)同分,仅比 GLM-5.3(max)和 Qwen3.8 Max 少 1 分。更值得注意的是成本项:单任务约 0.72 美元,而同级模型约 2.00 美元,成本约为对手的 1/2.8。分数差距只有 1 分,价格差距接近 3 倍,这组数据的核心信息不是“谁更强”,而是“同分段里的单位智能成本被重新定价”。

为什么重要:在 Intelligence Index 这类综合榜单上,头部模型近半年高度聚集在 44–45 分区间,纯分数已经很难作为选型依据。真正影响采购与产品决策的,是同等分数下的每任务成本、以及榜单之外的专项能力(例如智能体长链路任务的稳定性)。当同分模型之间的成本差达到近 3 倍,模型选择就会从“效果优先”转向“效果达标前提下的成本与稳定性权衡”,这会直接改变推理预算的分配方式。

对谁有价值:一是做模型选型与成本测算的技术负责人——44 分意味着它进入了可进入短名单的分数区间,0.72 美元/任务意味着在同等预算下可承载约 2.8 倍的调用量;二是做高频调用类产品的团队,例如批量内容处理、数据清洗、Agent 工作流,这类场景对价格弹性极其敏感;三是关注国产模型竞争格局的观察者,这组数据说明头部梯队的竞争焦点正从“刷分”转向“同分降价”。

可以怎么行动:把 Step 5 Preview 与 Kimi K3(max)、GLM-5.3(max)、Qwen3.8 Max 放进同一组对比,用自己业务的真实任务集做小规模 A/B,重点记录三件事:任务完成率、单位任务实际 token 消耗、以及长链路任务中的失败与重试率。若综合质量在可接受范围内,可先在非关键路径(如内部工具、批量预处理)灰度替换,用真实账单验证成本优势是否如评测所示。

风险与限制:第一,这是 Preview 版本,能力与定价都可能随正式版变动,评测分数不构成正式版承诺;第二,Intelligence Index 是聚合指标,无法反映具体语种、领域或工具调用能力的差异,单一总分不能替代专项评测;第三,AIHOT 的推荐理由中提到该评测也涉及智能体短板,这意味着在 Agent 场景中它未必与总分表现一致,需单独验证;第四,每任务成本受输入输出长度、缓存命中率、重试次数影响,评测中的 0.72 美元不等于你实际业务的单位成本。本信号不含任何官方链接与定价条款,落地前请以官方文档为准。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 x.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8主要讲什么?

第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。

这篇文章最值得关注的要点是什么?

第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.…;原贴提到:Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelli;来源:x.com

这篇文章和哪些AI专题相关?

它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容命中「智能体」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案 下一篇 AIHOT 日报参考 2026-09-22