新浪开源模型VibeThinker-3B旨在展示推理可良好压缩但事实知识不行
新浪发布仅30亿参数的VibeThinker-3B,在数学和编码基准上匹配参数大百倍的模型,但在事实知识任务上大幅落后。多阶段后训练是性能关键。
原贴
查看原文原文
中文翻译
微博的新VibeThinker-3B只有30亿参数,但在数学和编码基准上匹配了高达其333倍大小的顶级模型。
性能来自应用于阿里巴巴基础模型的多阶段后训练。
然而,在需要广泛事实知识的任务上,小模型远远落后。
研究人员得出结论,结构化逻辑推理依赖于少数模式且压缩良好,而广泛的世界知识仍然需要大模型。
一个只有30亿参数的中文语言模型有时在数学和编码任务上匹配大一百倍的模型。
其背后的研究人员提出了一个关于AI能力如何结构的假设。
微博母公司新浪发布了一个小语言模型,在困难数学和编码任务上与当今顶级模型竞争。
根据技术报告,VibeThinker-3B在AIME26等竞争性基准上与DeepSeek V3.2和Kimi K2.5表现相当。
这两个模型的参数多200到333倍。
新浪将该模型定位为一项实验,旨在弄清楚一个模型实际需要多少计算能力才能竞争顶级水平。
其前身VibeThinker-1.5B于2025年11月推出。
新版本更进一步,询问一个小模型是否能达到真正的顶级性能,而不仅仅是“对其大小而言表现良好”。
结果讲述了两个不同的故事。
在具有明确可验证解决方案的结构化任务上,如数学奥林匹克或编程挑战,VibeThinker-3B匹配了GLM-5或Gemini 3 Pro等模型。
在LiveCodeBench上,它击败了所有其他200亿参数以下的模型。
事实知识是另一回事。
在知识密集的GPQA-Diamond基准上,该模型远远落后于其大得多的竞争对手。
为了排除数据污染,团队让模型在训练结束后参加了2026年4月底至5月底举行的LeetCode竞赛。
VibeThinker-3B首次尝试就解决了128个问题中的123个。
这使其领先于GPT-5.2、Qwen3-Max、Kimi K2.5和Claude Opus 4.6。
它仅落后于GPT-5.3-Codex、Gemini 3.1 Pro和Gemini 3 Flash,但差距不大。
VibeThinker-3B基于阿里巴巴的Qwen2.5-Coder-3B。
新浪的贡献是后训练,即在大数据集上进行通用预训练之后的一切。
根据报告,正是这一点使3B模型接近顶级表现者。
后训练分阶段进行。
首先,模型通过监督微调学习广泛的任务,涵盖数学、编码和通用对话。
然后它针对困难的、多步骤推理问题进行定制。
随后是强化学习,依次应用于数学、编程和STEM。
然后自蒸馏将每个阶段的技能整合到单个模型中。
最后一步确保模型更好地遵循指令。
核心信息
新浪发布仅30亿参数的VibeThinker-3B,在数学和编码基准上匹配参数大百倍的模型,但在事实知识任务上大幅落后。多阶段后训练是性能关键。
- 新浪发布仅30亿参数的VibeThinker-3B,在数学和编码基准上匹配参数大百倍的模型,但在事实知识任务上大幅落后。多阶段后训练是性能关键。
- 原贴提到:Weibo's new VibeThinker-3B has just three billion parameters but matches
- 来源:the-decoder.com
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。