趋势解读:DeepSeek V4,提升开发者接入体验
DeepSeek 发布 V4 系列预览模型,参数规模和效率大幅提升,定价极具竞争力,为开发者提供更便宜的 API 选择。
原贴
查看原文原文
中文翻译
中国人工智能实验室 DeepSeek 去年 12 月发布的最后一个模型是 V3.2(和 V3.2 Speciale)。他们刚刚推出了备受期待的 V4 系列中的第一个产品,推出了两个预览型号:DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。两种模型都是 100 万代币上下文专家混合。 Pro为1.6T总参数,49B活跃。闪存总共为 284B,其中 13B 处于活动状态。他们使用标准的麻省理工学院许可证。我认为这使得 DeepSeek-V4-Pro 成为新的最大的开放权重模型。它比 Kimi K2.6 (1.1T) 和 GLM-5.1 (754B) 更大,是 DeepSeek V3.2 (685B) 大小的两倍多。 Hugging Face Pro 为 865GB,Flash 为 160GB。我希望轻度量化的 Flash 能够在我的 128GB M5 MacBook Pro 上运行。如果我可以从磁盘中传输必要的活跃专家,那么 Pro 模型可能会在其上运行。目前,我通过 OpenRouter 尝试了这些模型,使用 llm-openrouter : llm install llm-openrouter llm openrouter refresh llm -m openrouter/deepseek/deepseek-v4-pro '生成骑自行车的鹈鹕的 SVG' 这是 DeepSeek-V4-Flash 的鹈鹕: 对于 DeepSeek-V4-Pro :为了进行比较,看看我12月份从DeepSeek V3.2、8月份的V3.1和2025年3月的V3-0324得到的鹈鹕。所以鹈鹕相当不错,但真正值得注意的是成本。 DeepSeek V4 是一款非常非常便宜的型号。这是 DeepSeek 的定价页面。他们对 Flash 收取 0.14 美元/百万代币输入费用和 0.28 美元/百万代币输出费用,对 Pro 收取 1.74 美元/百万输入费用和 3.48 美元/百万输出费用。下面是 Gemini、OpenAI 和 Anthropic 前沿模型的对比表: 模型 输入 ($/M) 输出 ($/M) DeepSeek V4 Flash $0.14 $0.28 GPT-5.4 Nano $0.20 $1.25 Gemini 3.1 Flash-Lite $0.25 $1.50 Gemini 3 Flash Preview $0.50 $3 GPT-5.4 Mini $0.75 $4.50 Claude Haiku 4.5 $1 $5 DeepSeek V4 Pro $1.74 $3.48 Gemini 3.1 Pro $2 $12 GPT-5.4 $2.50 $15 Claude Sonnet 4.6 $3 $15 Claude Opus 4.7 $5 $25 GPT-5.5 $5 $30 DeepSeek-V4-Flash 是小型型号中最便宜的,甚至击败了OpenAI 的 GPT-5.4 Nano。 DeepSeek-V4-Pro 是较大前沿型号中最便宜的。 DeepSeek 论文中的这篇说明有助于解释为什么他们可以将这些模型定价如此之低 - 他们在这个版本中非常注重效率,特别是对于较长的上下文提示:在 1M 令牌上下文的场景中,即使是具有大量激活参数的 DeepSeek-V4-Pro,也仅获得单令牌 FLOP 的 27%(以等效 FP8 FLOP 测量)和 KV 缓存大小的 10%。 DeepSeek-V3.2。此外,DeepSeek-V4-Flash 由于激活参数数量较少,进一步提升了效率:在 1M-token 上下文设置下,与 DeepSeek-V3.2 相比,它仅实现了单令牌 FLOP 的 10% 和 KV 缓存大小的 7%。 DeepSeek 在论文中自我报告的基准测试表明,他们的 Pro 模型与其他前沿模型具有竞争力,尽管有这样的说明:通过推理代币的扩展,DeepSeek-V4-Pro-Max 在标准推理基准测试中表现出了相对于 GPT-5.2 和 Gemini-3.0-Pro 的卓越性能。尽管如此,其性能仍略低于 GPT-5.4 和 Gemini-3.1-Pro,这表明其发展轨迹落后于最先进的前沿模型约 3 至 6 个月。我正在密切关注 Huggingface.co/unsloth/models,因为我预计 Unsloth 团队很快就会推出一组量化版本。看看 Flash 模型在我自己的机器上运行得有多好将会非常有趣。
核心信息
DeepSeek 发布 V4 系列预览模型,参数规模和效率大幅提升,定价极具竞争力,为开发者提供更便宜的 API 选择。
- DeepSeek 发布 V4 Pro 和 Flash 两款 MoE 模型,参数规模最大。
- Flash 定价 $0.14/M token,为最便宜的轻量模型。
- 效率大幅提升:1M 上下文下 FLOPs 仅为 V3.2 的 10-27%。
- Pro 模型性能接近 GPT-5.4,但落后约 3-6 个月。
- 有望在消费级硬件上本地运行,推动边缘 AI。
详细解读
这是什么信号?
DeepSeek 发布了 V4 系列的两个预览模型,重点在于大幅提升效率并降低价格。Pro 模型拥有 1.6T 总参数(49B 激活),Flash 模型 284B 总参数(13B 激活),均采用 MoE 架构和 MIT 开源协议。定价上,Flash 仅 $0.14/M 输入、$0.28/M 输出,Pro 为 $1.74/M 输入、$3.48/M 输出,显著低于同类前沿模型。这表明 DeepSeek 正在通过架构优化(减少 FLOPs 和 KV 缓存)来降低推理成本,从而推动 AI 服务的平民化。
为什么重要?
这是中国 AI 实验室在开源模型领域的又一次重要进展。DeepSeek-V4-Pro 成为目前最大的开放权重模型,且定价策略极具攻击性,可能迫使 OpenAI、Google 等厂商跟进降价。对于开发者来说,这意味着能以更低成本获得接近前沿水平的模型能力,尤其适合长上下文、高并发场景。同时,Flash 模型的轻量化设计有望在消费级硬件(如 MacBook Pro)上本地运行,加速边缘 AI 应用。
对谁有价值?
1. AI 应用开发者:可通过 API 调用大幅降低推理成本,尤其适合需要频繁调用、对延迟不敏感的应用。2. 开源社区:模型权重开放且规模大,可用于微调、研究或部署。3. 硬件厂商:本地运行 Flash 模型的潜力可能带动新一代 AI PC 需求。4. 企业决策者:评估是否在内部工作流中替换更昂贵的模型。
可以怎么行动?
1. 立即通过 OpenRouter 或 DeepSeek 官方 API 测试 V4 模型在自身业务场景下的表现和成本。2. 关注 Unsloth 等团队的量化版本,争取在本地设备上运行 Flash 模型。3. 对于长文档处理、代码生成、内容摘要等任务,优先尝试更便宜的 V4 模型以优化预算。4. 将 DeepSeek 的定价变化纳入供应商评估体系,作为谈判或迁移的依据。
风险或限制
1. 模型性能:Pro 模型在推理基准上仍略落后于 GPT-5.4 和 Gemini-3.1-Pro,不适合对精度要求极高的任务。2. 上下文限制:虽然支持 1M token,但实际长上下文场景下的稳定性有待验证。3. 合规性:作为国内模型,在数据隐私、内容审核等方面可能受政策影响。4. 依赖第三方平台:通过 OpenRouter 等中介使用可能引入额外延迟和风险。
信息差价值
信息差价值:大多数人只关注 DeepSeek 的模型性能,却忽略了其定价策略背后的效率革命。V4 通过稀疏激活和 KV 缓存优化,在保持性能的同时将成本降到了行业谷底。这不仅是技术突破,更是商业模式的降维打击——它直接挑战了“高成本高性能”的定价逻辑。
业务启发:对于 AI 应用企业,应当立即重新评估模型供应商组合。DeepSeek V4 的性价比优势意味着你可以在不牺牲太多质量的情况下大幅降低推理支出,尤其适合 C 端产品(如客服、内容生成)或高频调用场景。同时,Flash 模型实现本地运行的可能性,为离线或隐私敏感业务提供了新路径。
可沉淀动作:整理 DeepSeek V4 与主流模型在自家典型任务上的性价比对比报告;在非关键场景中逐步切换至 V4 进行灰度测试;关注 Unsloth 量化版发布,提前准备本地部署环境;将 DeepSeek 作为备选供应商加入采购流程,以增强议价能力。