觉
AI觉醒星球
Awakening is here
Knowledge File / AI技能杠杆
2026-05-29 4 浏览 免费阅读

阶跃星辰 Step 3.7 Flash 发布,聚焦智能体效率

阶跃星辰发布开源大模型Step 3.7 Flash,198B参数MoE架构,活跃参数11B,支持256K上下文,在ClawEval和SimpleVQA评测中排名第一,工具使用τ2-bench得分超98%,兼容主流工具链并支持本地运行。

SOURCE / AI技能杠杆 MIN / 9 ACCESS / 免费阅读 POST / 2026-05-29 08:00:01

原贴

查看原文
作者:X:阶跃星辰 StepFun (@StepFun_ai) 来源站点:x.com 原贴时间:

原文

阶跃星辰(Step)发布了开源大模型 Step 3.7 Flash,主打智能体(Agent)工作流的效率。该模型在 ClawEval-1.1(67.1分)和 SimpleVQA Search(79.2分)评测中排名第一。其架构为 198B 参数的 MoE,约 11B 为活跃参数,支持 256K 上下文。模型具备多模态理解能力,能处理图像、文档并生成代码或调用工具执行任务。在工具使用方面,它致力于高可靠性,τ2-bench 得分超过 98%。Step 3.7 Flash 兼容 Claude Code、MCP 协议等工具链,并支持在 Mac Studio M4 Max 等设备上本地运行。模型权重以 Apache 2.0 许可开源。 AIHOT 分类:ai-models

中文翻译

阶跃星辰(Step)发布了开源大模型 Step 3.7 Flash,主打智能体(Agent)工作流的效率。该模型在 ClawEval-1.1(67.1分)和 SimpleVQA Search(79.2分)评测中排名第一。其架构为 198B 参数的 MoE,约 11B 为活跃参数,支持 256K 上下文。模型具备多模态理解能力,能处理图像、文档并生成代码或调用工具执行任务。在工具使用方面,它致力于高可靠性,τ2-bench 得分超过 98%。Step 3.7 Flash 兼容 Claude Code、MCP 协议等工具链,并支持在 Mac Studio M4 Max 等设备上本地运行。模型权重以 Apache 2.0 许可开源。

核心信息

阶跃星辰发布开源大模型Step 3.7 Flash,198B参数MoE架构,活跃参数11B,支持256K上下文,在ClawEval和SimpleVQA评测中排名第一,工具使用τ2-bench得分超98%,兼容主流工具链并支持本地运行。

  • 阶跃星辰发布开源MoE大模型,聚焦Agent效率。
  • 198B参数,活跃仅11B,支持256K上下文。
  • ClawEval和SimpleVQA评测第一,工具使用τ2-bench超98%。
  • 兼容Claude Code和MCP,支持本地运行。

详细解读

这是什么信号?阶跃星辰开源 Step 3.7 Flash,标志着国内大模型在智能体(Agent)工作流效率上的重要突破。该模型采用稀疏 MoE 架构,以 198B 总参数和仅 11B 活跃参数实现高效推理,256K 长上下文支持复杂任务。其在 ClawEval 和 SimpleVQA Search 评测中排名第一,工具使用方面 τ2-bench 超 98%,说明模型在指令遵循和工具调用上具备极高可靠性。

为什么重要?对于开发者而言,该模型兼容 Claude Code、MCP 协议,可直接对接现有智能体工具链,降低集成成本。支持 Mac Studio 本地运行,意味着个人开发者也能在离线环境下部署强大的 Agent 模型,无需依赖高价云端 GPU。Apache 2.0 许可进一步降低了商业使用门槛。

对谁有价值?AI 应用开发者可通过 Step 3.7 Flash 快速构建自主工作流,例如自动化代码生成、文档处理、数据抓取等。企业可将其用于智能客服或内部流程自动化,尤其是需要多模态理解(图像+文本)的场景。研究者可从开源权重中探究 MoE 的高效训练方法。

可以怎么行动?立即从 GitHub 下载模型权重,在本地 Mac Studio 上测试其工具调用能力。结合 MCP 协议开发自定义工具链,例如连接数据库或 API。对于高并发场景,可基于其低活跃参数特性做量化部署,降低延迟和成本。

风险或限制:模型虽在评测中领先,但实际业务场景可能暴露长上下文理解或多步推理的短板。本地运行受设备显存限制,Mac Studio M4 Max 最大内存约 128GB,而模型加载仍需一定资源。开源许可虽宽松,但需注意合规使用衍生模型。

信息差价值

信息差价值:多数关注点仍在通用大模型能力比拼,而 Step 3.7 Flash 的差异化在于强调智能体工作流的具体效率指标,如 τ2-bench 分数。其开源策略和 Mac 本地支持,让个人开发者能低成本体验 Agent 前沿技术,这是主流闭源模型(如 GPT-4)无法提供的。

业务启发:对于 SaaS 工具开发商,可集成 Step 3.7 Flash 作为后端推理引擎,提供“文档摘要 + 代码生成”一体化功能。对于咨询公司,可基于该模型为客户定制自动化工作流,例如自动处理发票并生成报告。

可沉淀动作:1)在 GitHub 上拉取代码并复现评测结果,记录关键性能指标。2)设计一个端到端 Agent 场景(如自动邮件回复),测试模型在真实数据下的工具调用准确率。3)撰写对比测评文章,与其他开源 Agent 模型(如 Qwen-Agent)进行横向比较,形成技术选型文档。

参考来源

AI SUMMARY

这篇文章回答了什么

阶跃星辰 Step 3.7 Flash 发布,聚焦智能体效率主要讲什么?

阶跃星辰发布开源大模型Step 3.7 Flash,198B参数MoE架构,活跃参数11B,支持256K上下文,在ClawEval和SimpleVQA评测中排名第一,工具使用τ2-bench得分超98%,兼容主流工具链并支持本地运行。

这篇文章最值得关注的要点是什么?

阶跃星辰发布开源大模型Step 3.7 Flash,198B参数MoE架构,活跃参数11B,支持256K上下文,在ClawEval和SimpleVQA评测中排名第一,工具使用τ2-bench得分超98%,兼容主流工具链并支持本地运行。;阶跃星辰发布开源MoE大模型,聚焦Agent效率。;198B参数,活跃仅11B,支持256K上下文。;ClawEval和SimpleVQA评测第一,工具使用τ2-bench超98%。

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI工具、AI超级个体专题里阅读。 关联原因:这篇内容命中「Agent、智能体、工作流」等主题信号。;这篇内容命中「工具、自动化、模型」等主题信号。;这篇内容命中「效率、技能」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 Cursor 团队发布《开发者习惯报告》 下一篇 趋势解读:Anthropic ships Claude Opus 4.8 as a "modest,聚焦 Agent 工作流自动化