Deepseek 推出改进版 V4 Pro,开源其智能体软件,并提高 API 价格
Deepseek 发布了更新版本的 V4-Pro 模型。它在智能体基准测试中得分更高,但在整体排名中仍落后于 Claude Opus 5 等顶级模型。
原贴
查看原文原文
中文翻译
Deepseek 发布了其 V4-Pro 模型的更新版本。它在智能体基准测试中得分更高,但在整体排名中仍落后于 Claude Opus 5 等顶级模型。
该公司还发布了“Deepseek Harness”,这是一款开源软件,通过模块化插件系统将语言模型转化为自主智能体。
API 价格正在上涨,新的分时费率使得在中国工作时间之外的使用更便宜。重复数据检索变得更贵。
Deepseek 已将其旗舰产品移出测试阶段,将其专有智能体软件开源,并同时宣布提高 API 价格。deepseek-v4-pro 端点现在提供 V4-Pro-0813 构建版本。模型名称、参数数量和一百万 token 的上下文窗口保持不变,Deepseek 表示现有集成无需任何调整即可继续运行。在应用和网页上,该模型以“专家模式”提供。新增了对 OpenAI Responses API 的原生支持,并集成了 Codex。推理努力可以设置为三个级别:“低”、“高”和“最大”,Deepseek 建议日常智能体使用中间设置。根据 Deepseek 自己的对比表,Terminal Bench 2.1 得分从 72.1 跃升至 87.9,DeepSWE 得分从 12.8 升至 62.7。在几个智能体基准测试中,该模型击败了 Claude Opus 4.8。
Artificial Analysis 证实了这一改进,但也将其置于背景中。V4-Pro 在智能指数上从 45 升至 53,与 GLM-5.2 持平。这仍然落后于 Muse Spark 的 57、Qwen 3.8 Max 的 58 和 Kimi K3 的 60。Claude Opus 5 以 63 分位居榜首。Deepseek 尚未发布新构建的权重,四月份的预览版本仍在 Hugging Face 上。
此次更新也是针对较小的 V4 Flash 模型逼近旗舰产品的回应。7 月底,Deepseek 为 V4 Flash 发布了 0731 更新,该更新在 Artificial Analysis 智能指数上几乎与 Pro 预览版持平,而价格只是后者的一小部分。伴随模型更新,Deepseek Harness v0.1 以开发者预览版形式发布,采用 MIT 许可证。这款开源智能体软件被定位为 OpenAI Codex 和 Claude 的替代品。它建立在新发布的 Cordis 插件系统之上,其中所有功能都是可替换的插件,从工具、沙盒到会话和 UI。连续的会话日志跟踪每个提示、每个工具调用和每个结果。运行可以恢复、分支和重放。
极简模式将内容精简为 shell 和文件编辑器,Deepseek 使用此设置进行自己的基准测试运行。该软件通过 npx 在本地 Web 界面启动,但 Deepseek 警告存在兼容性问题。该项目由崔天翼领导,他于 2026 年 3 月从量化交易公司 Jane Street 加入 Deepseek。当团队在 8 月初发出 beta 测试者招募时,712 个项目在三天内报名。
新费率于 UTC 时间 8 月 16 日下午 4:00 生效。Deepseek 在 6 月底宣布切换到高峰和低谷定价,但当时没有公布具体数字或日期。基于时间的费率自 2025 年 2 月以来就已存在,当时该公司在夜间时段对 V3 和 R1 提供折扣。
低谷时段使用费用减半。高峰时段为 UTC 时间凌晨 1 点至 4 点和早上 6 点至 10 点,与中国工作日一致。对于欧洲用户来说,几乎整个下午都处于较低费率。
核心信息
Deepseek 发布了更新版本的 V4-Pro 模型。它在智能体基准测试中得分更高,但在整体排名中仍落后于 Claude Opus 5 等顶级模型。
- Deepseek 发布了更新版本的 V4-Pro 模型。它在智能体基准测试中得分更高,但在整体排名中仍落后于 Claude Opus 5 等顶级模型。
- 原贴提到:Deepseek has released an updated version of its V4-Pro model. It scores
- 来源:the-decoder.com
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。