DeepSeek V4 Pro距Fable 5仅差0.1分:8月12日中美AI定价权易主
8月12日深夜到13日凌晨,全球大模型舞台罕见地连续上演三场硬仗:DeepSeek-V4-Pro-0813正式版静悄悄替换4月预览,xAI旗下SpaceXAI推出Grok 4.6,阿里千问同日开放Qwen3.8-2.4T权重。三场发布间隔不到12小时,全球顶级模型的算力榜单、跑分表和定价页被同时刷新。
DeepSeek 0.1分的贴身战
DeepSeek官网API文档里,V4 Pro从预览”转正”为DeepSeek-V4-Pro-0813,端点名维持不变,开发者原有代码无需修改即可直接调用。架构沿用1.6万亿参数MoE,每token激活490亿参数,100万token上下文窗口保持。
新版在Terminal Bench 2.1这一衡量AI智能体在终端环境完成任务的关键测试上拿下87.9分,距离Anthropic Fable 5的88.0分只剩0.1分;Cybergym反超0.2分,AutomationBench直接反超2.7分。三个智能体测试项目,V4 Pro从预览版的”跟随者”变成了”领跑者”。
更具说服力的是软件工程测试DeepSWE从12.8分跃升至62.7分,半年时间拉高近五倍,超越了同一指标下Anthropic上一代旗舰Opus 4.8的58.0分。这表明V4 Pro不再只是聊天答案生成器,开始能读懂完整代码仓库、调用多步工具、跨文件重构——这才是AI Agent能力要跨过的真实门槛。开源社区开发者Simon Willison用同一提示词在三种推理强度下测试时发现,0813版思考237秒、25步,上一版预览105秒、15步,效果却没明显更好。”想得更久不一定更好”,这比任何跑分都值得琢磨。
三家定价:把全球AI的算力税按回地板
同步推出的Grok 4.6延续xAI一贯的低价策略:每百万token输入2美元、输出6美元,与上一代Grok 4.5定价完全一致。Artificial Analysis测算,Grok 4.6完成一项综合任务平均花0.84美元,是同期Claude Opus 5 Max的约十分之一。
xAI同时亮出的一项新指标:在AA-Briefcase长任务测试中,Grok 4.6平均用53轮完成、约5亿输入token;Claude Opus 5 Max则要103轮、20亿输入token——前者消耗的token约为后者的四分之一。Cursor工程师Eric Zakariasson提前数周试用,他发现在更快响应下,开发者可以从”一次交代清楚所有需求”转为”先做一小步,再调整要求”的多轮协作模式。
DeepSeek V4 Pro则把这一数字压得更低:每百万token输入3元人民币、输出6元人民币,约0.43/0.86美元,是Grok 4.6输出价的七分之一、Fable 5输出价的六十分之一。第三家阿里千问把战场带到了开源端:Qwen3.8-2.4T首次开放Max级别权重,2.4万亿总参数、激活950亿,下载权重等同于在个人服务器上部署一家前沿模型实验室的产物。
0.1分背后:太平洋两岸的定价权易手
当DeepSeek V4 Pro与Fable 5的智能体能力差距收窄到0.1分、而输出价格维持7倍以上差时,太平洋两岸的AI定价权悄悄易手。Anthropic在5月已宣布完成650亿美元H轮融资、估值9650亿美元,年化收入5月破470亿美元,但它仍在洽谈以约60亿美元收购芯片优化公司Decart AI——目的只有一个:压低单token推理成本,应对深口袋对手的低价竞争。
Decart团队将并入Anthropic的推理与性能部门,这家由三位以色列工程师于2023年创立的初创公司今年5月刚完成3亿美元融资、估值近40亿美元,三个月内被加价近50%收走。这笔潜在交易与Anthropic设定的目标IPO窗口(最早今年9至10月)相互呼应,意味着上市前夕的一次定向补强。
摩根士丹利最近研报明确:中国大模型API均价过去一年明显上涨,美国闭源模型价格在下降,价差正在收窄;同时竞争焦点已从”价格战”转向”智力战”。8月12日这一夜的同台发布,让”价格战”和”智力战”被DeepSeek、xAI、Qwen三家同时推进到了所有战场——头部厂商间的差距不再以百分点计算,而是以”同一美元能跑通多少生产任务”来衡量。
开发者和企业的下一步棋
对企业采购而言,模型同台竞技的直接含义是:选型逻辑应该回到”每美元能跑通多少生产任务”,而不是看厂商表态。DeepSeek V4 Pro目前仍是预览/正式版间转正、价格最激进,但官方已预告”近期整体API价格预计将有较大幅度上涨”;Grok 4.6保持稳定低价,Cursor和Grok Build首周双倍用量;Qwen3.8-2.4T以权重+商业许可形式开源,能自托管的企业开始具备绕开供应商议价的能力。
8月12日这一夜之后,全球AI公司的下一个季度财报里,单token推理成本与算力摊销将成为估值之外的隐形变量。DeepSeek首轮融资510亿的估值跃升与Anthropic 100亿挪威水电这类长周期算力投资,标志着这场定价权之争将远超模型本身。