AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-07-30 0 浏览 会员

Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案

Miles团队在Blackwell架构上实现了端到端MXFP8和逐token NVFP4两种低精度强化学习方案。在8x B200上对Qwen3-30B-A3B的消融实验中,低精度配置与BF16的奖励曲线高度重合,且MXFP8和NVFP4减少了推理时间。

SOURCE / AI小生意项目库 MIN / 4 ACCESS / 会员 POST / 2026-07-30 01:50:31

原贴

查看原文
作者:LMSYS:Blog(Chatbot Arena 团队) 来源站点:lmsys.org 原贴时间:

原文

Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。 AIHOT 分类:paper

中文翻译

Miles团队在Blackwell架构上实现了两种原生低精度强化学习方案:端到端MXFP8和MoE专家权重的逐token NVFP4。在8x B200上对Qwen3-30B-A3B的消融实验中,BF16与所有五种低精度配置的原始奖励曲线高度重合,且MXFP8和NVFP4减少了推理时间。

核心信息

Miles团队在Blackwell架构上实现了端到端MXFP8和逐token NVFP4两种低精度强化学习方案。在8x B200上对Qwen3-30B-A3B的消融实验中,低精度配置与BF16的奖励曲线高度重合,且MXFP8和NVFP4减少了推理时间。

  • Miles团队在Blackwell架构上实现了端到端MXFP8和逐token NVFP4两种低精度强化学习方案。在8x B200上对Qwen3-30B-A3B的消融实验中,低精度配置与BF16的奖励曲线高度重合,且MXFP8和NVFP4减少了推理时间。
  • 原贴提到:Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVF
  • 来源:lmsys.org
试看内容

成为会员查看完整内容

你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。

详细解读 信息差价值 参考来源
成为会员查看完整内容
上一篇 Google 的 Lyria 3.5 音乐模型现允许用户编辑单个音轨片段而无需从头开始 下一篇 OpenAI 为学术研究者免费提供前沿模型