Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8
第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。
原贴
查看原文
原文
中文翻译
Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。
核心信息
第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。
- 第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。
- 原贴提到:Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelli
- 来源:x.com
详细解读
这是什么信号:第三方评测机构 Artificial Analysis 对阶跃星辰 Step 5 Preview 给出 Intelligence Index 44 分,落在国产旗舰模型的头部区间内——与 Kimi K3(max)同分,仅比 GLM-5.3(max)和 Qwen3.8 Max 少 1 分。更值得注意的是成本项:单任务约 0.72 美元,而同级模型约 2.00 美元,成本约为对手的 1/2.8。分数差距只有 1 分,价格差距接近 3 倍,这组数据的核心信息不是“谁更强”,而是“同分段里的单位智能成本被重新定价”。
为什么重要:在 Intelligence Index 这类综合榜单上,头部模型近半年高度聚集在 44–45 分区间,纯分数已经很难作为选型依据。真正影响采购与产品决策的,是同等分数下的每任务成本、以及榜单之外的专项能力(例如智能体长链路任务的稳定性)。当同分模型之间的成本差达到近 3 倍,模型选择就会从“效果优先”转向“效果达标前提下的成本与稳定性权衡”,这会直接改变推理预算的分配方式。
对谁有价值:一是做模型选型与成本测算的技术负责人——44 分意味着它进入了可进入短名单的分数区间,0.72 美元/任务意味着在同等预算下可承载约 2.8 倍的调用量;二是做高频调用类产品的团队,例如批量内容处理、数据清洗、Agent 工作流,这类场景对价格弹性极其敏感;三是关注国产模型竞争格局的观察者,这组数据说明头部梯队的竞争焦点正从“刷分”转向“同分降价”。
可以怎么行动:把 Step 5 Preview 与 Kimi K3(max)、GLM-5.3(max)、Qwen3.8 Max 放进同一组对比,用自己业务的真实任务集做小规模 A/B,重点记录三件事:任务完成率、单位任务实际 token 消耗、以及长链路任务中的失败与重试率。若综合质量在可接受范围内,可先在非关键路径(如内部工具、批量预处理)灰度替换,用真实账单验证成本优势是否如评测所示。
风险与限制:第一,这是 Preview 版本,能力与定价都可能随正式版变动,评测分数不构成正式版承诺;第二,Intelligence Index 是聚合指标,无法反映具体语种、领域或工具调用能力的差异,单一总分不能替代专项评测;第三,AIHOT 的推荐理由中提到该评测也涉及智能体短板,这意味着在 Agent 场景中它未必与总分表现一致,需单独验证;第四,每任务成本受输入输出长度、缓存命中率、重试次数影响,评测中的 0.72 美元不等于你实际业务的单位成本。本信号不含任何官方链接与定价条款,落地前请以官方文档为准。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 x.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8主要讲什么?
第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.8 Max 的 45 分;单任务成本约 0.72 美元,约为同级模型约 2.00 美元的 1/2.8。
这篇文章最值得关注的要点是什么?
第三方评测机构 Artificial Analysis 公布阶跃星辰 Step 5 Preview 的成绩:Intelligence Index 44 分,与 Kimi K3(max)持平,略低于 GLM-5.3(max)与 Qwen3.…;原贴提到:Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelli;来源:x.com
这篇文章和哪些AI专题相关?
它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容命中「智能体」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。