DeepSeek V4 Pro正式版:Agent能力补课完成,涨价预告悬而未决

一、发生了什么

8月12日深夜,DeepSeek更新官方API文档,把deepseek-v4-pro指向新版本DeepSeek-V4-Pro-0813。没有发布会,没有技术博客,最先被外界发现的是API文档里的模型版本号。该模型于4月24日以预览版上线,间隔约111天后转为正式版。它沿用同一套1.6万亿总参数MoE架构,每次推理激活约490亿参数,支持100万Token上下文和38.4万Token最大输出,默认开启思考模式。

这次更新的核心在Agent能力。官方公布的口径里,软件工程基准DeepSWE从12.8升至62.7,网络安全基准Cybergym从52.7升至83.3。终端操作基准Terminal Bench 2.1从72.1升至87.9。同一天,xAI发布Grok 4.6,两家旗舰模型在同一条赛道上碰面。

二、信息增量在哪里

信息增量不在参数规模。正式版架构与预览版完全一致,跳升全部来自后训练阶段的重做,这指向一个变化,竞争重点正从堆参数转向训练方法论。Grok 4.6走的是另一条路,在Grok 4.5基础上延长跨领域Agent强化学习,上下文50万Token。它输入每百万Token 2美元、输出6美元,Artificial Analysis智能指数61分,与GPT-5.6 Sol并列。

第二层增量在能力分布。官方对比中,V4 Pro在Cybergym以83.3分高于Fable 5的83.1分和Opus 4.8的78.3分。Terminal Bench 2.1的87.9分距Fable 5的88.0分只差0.1分。纯知识推理仍是短板,HLE无工具得分42.7分,落后Opus 4.8的49.8分和Fable 5的53.3分。第三层增量在接口,新模型同时提供OpenAI与Anthropic两套API格式,原生支持Responses API和工具调用。Codex、Claude Code这类已适配对应协议的编程工具可以直接切换。

三、对程序员和AI用户的直接意义

对程序员,影响最大的是价格与能力组合。截至8月13日官方价格页,V4 Pro每百万Token输入3元、输出6元,与预览版持平,输出价约为Fable 5的六十分之一。8月13日官方发布调价公告,采用峰谷定价,工作日9时至12时、14时至18时为高峰时段,空闲时段价格为高峰时段的一半。V4 Pro高峰输出价升至27元,较现行上涨约350%,8月17日零时生效。低价窗口有明确期限,选型时应按8月17日之后的价格重算成本。

对AI用户,需要区分跑分与真实任务。极客公园实测中,V4 Pro一次生成761行Boids模拟代码并运行通过。在寻路任务里,默认思考模式把16384个输出Token中的13394个用于思考,代码被截断,关闭思考模式后54秒输出715行完整代码。HN用户把V4 Pro和Grok 4.6放进Codex CLI做同一功能开发,V4 Pro耗时12分钟、成本0.12美元但出现Bug。Grok 4.6耗时3分18秒、成本1.41美元且没有Bug。单次实验不能代表整体水平,但思考模式对长代码任务的影响是真实存在的。

四、暂时不能推出的结论

有三条结论暂时不能推出。不能从基准分数推出全面碾压,HLE无工具、NL2Repo等纯推理维度仍落后头部模型。不能把单次实测的胜负推成行业结论,Agent任务随机性高,样本量也不足。不能把当前低价当成长期价格结构,8月17日的峰谷定价把V4 Pro高峰输出价从6元抬到27元,是现行价的4.5倍,成本敏感型系统的账要按新价格重算。

五、后续观察什么

后续观察四个点。官方是否发布技术报告或完整更新日志,公开后训练的具体做法。8月17日调价落地后的实际用量和价格结构,高峰与空闲时段的价差能否把需求引导到非高峰。8月13日晚机器之心报道DeepSeek Harness开源,模型与Agent运行框架如何组合,竞争是否从模型能力延伸到模型加框架。V4 Flash与V4 Pro的分层定价能否持续支撑不同成本敏感度的Agent系统。

参考资料

对这篇文章的意见

太空与网络 AI+航天系列