觉
AI觉醒星球
Awakening is here
Knowledge File / AI技能杠杆
2026-10-03 1 浏览 免费阅读

Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%

Baseten 工程师参考 MetaInfer 论文,用 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen:单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。

SOURCE / AI技能杠杆 MIN / 9 ACCESS / 免费阅读 POST / 2026-10-03 05:09:34

原贴

查看原文
作者:Baseten 工程博客(网页) 来源站点:baseten.co 原贴时间:

原文

Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen,单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。 AIHOT 分类:tip

中文翻译

Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen,单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。

核心信息

Baseten 工程师参考 MetaInfer 论文,用 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen:单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。

  • Baseten 工程师参考 MetaInfer 论文,用 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen:单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。
  • 原贴提到:Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP
  • 来源:baseten.co

详细解读

这是什么信号

一位 Baseten 工程师参考 MetaInfer 论文的方法,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动生成了一个专用推理引擎 VibeQwen。实测结果是:单流解码比 vLLM 0.25.1 快 90%,首 token 延迟从 28ms 降到 12ms,并发 32 时吞吐高 71%。

关键不在数字本身,而在于「谁在写推理引擎」。过去这一步要靠资深 kernel 工程师手工调优数月,且只对少数大模型厂商或头部推理平台做得到;现在一个 coding agent 就能围绕「特定模型 + 特定量化格式 + 特定硬件」组合,生成一份针对性引擎。

为什么重要

推理性能的获取路径正在改变。以往团队提升延迟与吞吐,主要靠等上游框架发版、调参数、堆硬件;这条路线的边际收益越来越薄。这条信号显示的是第三条路:把推理引擎当成「可被生成的产物」,让 agent 依据论文方法为目标负载定制实现。

另一个值得注意的细节是加速集中在单流解码与首 token 延迟——这恰好是交互式场景最在意的指标,而 vLLM 的强项通常在并发吞吐。也就是说,专用引擎抢的是「体验敏感型」负载的位置,而不是全面替代。

对谁有价值

第一是推理服务与推理成本团队:如果核心模型固定在少数几个版本上,专用引擎的收益可以直接变成延迟与单位算力的产出。第二是私有化部署与垂直场景团队:模型、硬件、量化格式都相对固定,正是定制的理想土壤。第三是用 coding agent 做基础设施的工程师:这是一条可复制的「论文 → 代码 → 基准」工作流范例。第四是推理框架与平台方:它提示了上游通用框架与下游专用引擎的分工边界。

可以怎么行动

一,先盘点自己的模型—硬件—量化组合,挑出调用量大、版本稳定的那一个作为候选,而不是一上来就全面铺开。二,用 coding agent 复现 MetaInfer 一类方法,先在非核心链路上做验证,用同一张卡、同一模型、同一版本 vLLM 跑对照基准,固定测 TTFT、单流解码速度与并发吞吐三项。三,把「自研 kernel 的维护成本」也纳入评估:能自动生成不等于能自动维护。四,如果收益显著,评估哪些实现可以回流上游,减少长期分叉负担。

风险与限制

这目前是单点实测,公开信息里没有完整的复现细节与 benchmark 配置,数字不能当作普适结论。测试是单卡 B200 与 NVFP4 路径,换硬件、换量化方案是否仍有同量级收益未知。对比基准是 vLLM 的特定版本 0.25.1,而 vLLM 迭代很快,差距可能被上游追平。此外,自动生成的 kernel 在数值正确性、长上下文、批处理与多并发混合负载下的稳定性,都需要独立验证;专用引擎一旦分叉,后续模型升级、硬件换代都要重新走一遍流程。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 baseten.co 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%主要讲什么?

Baseten 工程师参考 MetaInfer 论文,用 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen:单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。

这篇文章最值得关注的要点是什么?

Baseten 工程师参考 MetaInfer 论文,用 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen:单流解码比 vLLM 0.25.1 快…;原贴提到:Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP;来源:baseten.co

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI工具、AI超级个体专题里阅读。 关联原因:这篇内容命中「Agent、工作流、Claude Code」等主题信号。;这篇内容命中「Claude」等主题信号。;这篇内容命中「技能」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 已经是本栏目第一篇
下一篇 从一个想法到一款能在 @modretro 上玩的游戏:OpenAI Devs 对话 @Casey 谈创造力的未来