
8 月 12 日晚,DeepSeek 更新官方 API 文档,旗舰模型 DeepSeek V4 Pro 0813 正式版(以下统称为 V4 Pro)悄然上线。这是继 7 月 31 日 V4 Flash 0731 转正之后,DeepSeekV4 这一代产品补上的最后一块拼图。
能力方面,V4 Pro 的 Agent 能力几乎全面提升,知名机构 SemiAnalysis 表示,DeepSeek V4 Pro 和 Flash 在 Agent 相关测试中,都甩开了参数更大的英伟达Nemotron 3 Ultra模型。
根据 DeepSeek 释放的基准测试数据,V4 Pro 在终端操作、代码工程等基准测试中"猛追" Opus 4.8、Fable 5 这种海外前沿模型,并在部分基准测试中领先。
价格上,V4 Pro 定价延续了 DeepSeek 一贯的"地板价"策略。根据官方页面提供的信息,V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出6 元,缓存命中输入低至0.025 元。以输出为例,V4 Pro 6 元的输出价格仅为Opus 5 的三十分之一、Fable5 的六十分之一。
不过需要注意,DeepSeek 也在官方页面上预告涨价,且涨幅较大。从这个角度来看,平价的 V4 Pro 可以看作是 DeepSeek 在新模型上线初期引流的一场"临时价格战"。
01
1M 上下文、双 API 兼容、全功能开放
根据 DeepSeek 官方文档,V4 Pro 正式版模型版本号为DeepSeek V4 Pro 0813,开发者可通过 deepseek V4 pro 直接调用。与 Flash 版一致,V4 Pro 提供OpenAI 格式与Anthropic 格式两套接口。
核心规格方面,V4 Pro 支持100 万 tokens 上下文窗口与最大 38.4 万 tokens 输出,可以一次性读入大型代码仓库、企业知识库或长篇文档,并支撑长时间、多步骤的 Agent 任务。
模型默认开启思考模式,同时支持切换为非思考模式,开发者可在响应速度与推理深度之间自主选择。
V4 Pro 与 Flash 版完全一致:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写(Beta)全部支持;FIM 补全(Beta)则在非思考模式下可用。这意味着DeepSeek 在接口层面已经完整对齐了当前主流的 Agent 开发工具链。

价格方面,V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出6 元,缓存命中输入低至0.025 元;Flash 版对应价格为 1 元、2 元与 0.02 元,两者价差恰好三倍,形成"高频轻量任务走 Flash、复杂推理任务走 Pro "的清晰产品分层。
另外,在并发限制方面,Pro 为 500,Flash 为 2500,进一步印证了两者的定位差异。
02
Agent 能力代际跃升
根据 DeepSeek 官方释放的信息,V4 Pro 0813 在终端操作、代码工程、工具调用、安全攻防等维度的基准测试中"猛追" Fable 5 这种海外前沿模型,并在部分基准测试中领先。

其中,考察模型在真实终端环境中执行命令、解决系统问题的能力的 Terminal Bench 2.1 中得分 87.9;面向 AI 安全攻防场景的 Cybergym 中得分 83.3;聚焦软件工程与数据科学全栈任务的 DeepSWE 与 DSBench 中分别为 62.7、71.1(DSBench-FullStack)、67.2(DSBench-Hard);在考察知识推理深度的 HLE(Humanity ’ s Last Exam)上,无工具 / 带工具成绩分别为 42.7/60.0;在衡量自动化流程的完成质量的 AutomationBench 中得分 31.8。

相比 4 月发布的 V4-Pro 预览版,正式版基准测试释放的能力数据,可以说是代际级别的提升:DeepSWE 从 12.8 跃升至 62.7,提升近 5 倍;Cybergym 从 52.7 升至 83.3;AutomationBench 从 12.8 升至 31.8;DSBench-Hard 从 31.1 翻倍至 67.2;Terminal Bench 2.1 也从 72.1 提升至 87.9。
Agent 能力的全面暴涨,是本次正式版最核心的升级信号。
与 V4-Flash-0731(平均分约 57.4)相比,V4 Pro 在全部九项基准评测中保持领先,尤其在 DeepSWE(62.7 对 54.4)、DSBench-Hard(67.2 对 59.6)等高难度任务上拉开了明显差距。
不过也要注意,在主流基准测试中,V4 Pro 并非全面碾压:在 HLE 无工具(纯知识推理)与 NL2Repo(代码库理解)两个维度上,它与 Anthropic 旗舰仍存在实打实的差距。比较有意思的是—— HLE 加入工具调用后,V4 Pro 以 60.0 对 57.9 反超 Opus 4.8,显示其工具使用能力已能弥补纯推理的短板。
03
"打爆英伟达"不靠参数
V4 Pro 正式版上线后,海外分析机构迅速给出反应。
知名半导体与 AI 分析机构 SemiAnalysis 在 X 平台发文祝贺 DeepSeek 发布 V4 Pro 0813(推文中称其为" 1.5T "模型),并直言其在 Agent 任务上"大幅击败 NVIDIA 的 Nemotron 3 Ultra "(massively beats Nemotron3 Ultra on agentic tasks)。
SemiAnalysis 同时指出,定位更低的V4-Flash 0731 同样大幅领先 Nemotron 3 Ultra——而 Flash 的激活参数比后者少 4.2 倍、总参数少近 2 倍。

其引用的 Terminal Bench 2.1 数据显示:Nemotron 3 Ultra(NVFP4)得分53.9,相比"轻量版"的 Flash,也差了 29 分,Pro 的领先幅度更达到 34 分。
除了吹捧 DeepSeek 外,SemiAnalysis 还在跟帖中附上了对 Nemotron 模式的批评—— Nemotron 联盟由多个实验室和公司组成,由 NVIDIA 与 Mistral AI 共同主导一个基础模型训练,该模型将开源,并作为后续 Nemotron 4 系列模型的基础。SemiAnalysis 认为这种联盟松散不利于和 DeepSeek 这样的实验室竞争,应该在联盟内部采用"赛马机制"引导创新。
Semianalysis 贴出来的有关 V4 Pro 和 Flash 模型在" Agent "能力上超越英伟达 Nemotron 3 Ultra 的数据,主要反映在两个方面:一个是广度,一个是能力进化幅度。
关于覆盖的广度,前面提到过。V4 Pro 的 Agent 能力并非依赖单点突破,而是横跨九个维度全面铺开:终端操作、软件工程、数据科学全栈、安全攻防等九个维度,都在追前沿模型,甚至超过,这种全链条的能力支持,恰恰是 Agent 模型的核心竞争力。
很简单,当前的 Agent 任务,都需要长时间、多步骤地调用工具、处理异常、串联任务,任何一块短板都会导致整条任务链断裂,所以对模型的要求不是某一项激进的领先,而是要在各个维度对能力均衡的拔高。
所以在提升的幅度上,与 4 月的 Preview 版相比,V4 Pro 正式版在 Agent 维度完成了近乎重做的升级:DeepSWE 提升近 5 倍、Cybergym 提升 58%、AutomationBench 提升约 1.5 倍、DSBench-Hard 翻倍等等。
股票在线官方配资另外,Flash 0731 在 Terminal Bench 2.1 上同样拿到 82.7 分,也超过英伟达的 Nemotron 3 Ultra,说明整个 V4 系列的 Agent 能力底座已经整体抬升。
结合 SemiAnalysis 提到的参数效率(激活参数少 4.2 倍),DeepSeek 实际上还证明了一件事:Agent 能力的领先,可以不再依赖参数规模的堆砌。
还有一个值得注意的信号:DeepSeek 的 Agent 团队组建。
据公开报道,该团队于今年 5 月在 DeepSeek 内部立项组建,由崔添翼(浙江大学计算机学院毕业、曾任职 Jane Street 近九年)担任负责人,首批开放研究员、研发工程师、产品经理三类岗位;崔添翼在社交平台公开表示"部门仍然非常缺人,每天都在面试",并于 8 月 2 日面向全球开发者征集 Harness 内测用户。
8 月 11 日前后," DeepSeek Harness 团队"微信公众号完成注册,认证主体为北京深度求索人工智能基础技术研究有限公司,尚未发布内容——这被外界普遍解读为Harness 产品即将发布的前兆。
04
价格战与"临时性价比"
与前沿模型基准测试对比中,可以清楚看到:对阵 Claude Opus 4.8,V4Pro 基本打平。
在双方均有数据的评测项中,V4Pro 赢下五项:Terminal Bench 2.1(87.9 对 85.0)、Cybergym(83.3 对 78.3)、DeepSWE(62.7 对 58.0)、AutomationBench(31.8 对 27.2)以及 HLE 带工具(60.0 对 57.9);Agents ’ Last Exam 双方战平(25.7 对 25.7);在 HLE 无工具(42.7 对 49.8)、NL2Repo(61.5 对 69.7)等项目中落后。
从均值的角度来看,V4 Pro 为 62.8,Opus 4.8 为 62.6 ——几乎完全持平。
对阵 Claude Fable 5,V4Pro 贴身紧逼。V4 Pro 在 Cybergym 上以 83.3 对 83.1 实现反超,AutomationBench 以 31.8 对 29.1 胜出,Terminal Bench 2.1 仅差 0.1 分(87.9 对 88.0)。平均分 62.8 对 70.5,V4Pro 达到 Anthropic 最新旗舰约九成的水平。
Terminal Bench 2.1 一项的对比尤其直观:Fable5 得分 88.0、输出价 50 美元,V4Pro 得分 87.9、输出价 0.87 美元——分数相差 0.1,价格相差 57 倍。也就是说,同样跻身第一梯队的终端 Agent 能力,两者的"入场券"成本完全不在一个量级。
如果纵向对比,V4-Pro-Preview 与正式版定价完全相同,Terminal Bench 成绩却从 72.1 跃升至 87.9,这也可以变相看成加量不加价。
Agent 能力大幅度跃升,但业界对 DeepSeek 的共识在于——价格杀伤力。

根据公开资料,Anthropic 高端旗舰 Claude Opus 5 每百万 tokens 输入 5 美元、输出 25 美元(约合人民币 36 元 /180 元,与 Opus 4.8 定价相同);最新旗舰 Fable 5 输入 10 美元、输出 50 美元(约 72 元 /360 元)。
以此计算,V4 Pro 6 元的输出价格仅为Opus5的三十分之一、Fable5 的六十分之一。
元股证券:ygzq.hk在整个前沿模型市场,DeepSeek 的价格优势仍然明显:OpenAI 旗舰 GPT-5.6 Sol 输出 30 美元(约 216 元)、均衡型的 GPT-5.6 Terra 输出 12 美元(约 86 元);定位 Coding/Agent 主力的 Claude Sonnet 5 输出 10 美元(约 72 元)。
可以说,DeepSeek 用 V4 Pro 把旗舰级 Agent 模型的价格基准线,直接拉低了一个数量级。不过,这一价格窗口可能不会持续太久。DeepSeek 已在官方页面明确标注:"计划近期整体上调 DeepSeekAPI 服务的定价,预计涨幅较大。"
所以,DeepSeek V4 Pro 正式版"三十分之一、六十分之一"价差,本质上是发布初期的窗口期定价——对于正在选型 Agent 底座的开发者而言,当前的低价既是红利,也是倒计时。
但要知道,相比海外模型,DeepSeek 即便是涨价,在能力项毕竟前沿模型的同时,依旧有非常高的价格调控空间配资使用教程,或者说性价比优势。而关于涨价,Kimi 企业业务负责人黄震昕的此前的观点值得思考。他说:"开源模型、中国大模型不该被贴上低价标签,我们做出了 SOTA 级模型 , 也能匹配合理商业定价。"
元股配资网提示:本文来自互联网,不代表本网站观点。