跳至正文
-
Subscribe to our newsletter & never miss our best posts. Subscribe Now!
78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
AI工具测评

DeepSeek V4-Flash正式版公测:130亿激活参数凭后训练叫板万亿Pro版

作者 admin
2026-07-31 1 分钟阅读
0

7月31日,DeepSeek正式开放V4-Flash正式版API公测。这个总参数2840亿、激活参数仅130亿的”轻量级”模型,仅靠重新后训练,就在9项Agent基准测试中多项超越3个月前发布的V4-Pro预览版——后者总参数1.6万亿,激活参数490亿,体量是它的近6倍。

Table of Contents

Toggle
  • 9项基准全面披露:Flash版Agent能力反超Pro预览版
  • 底座没换,变的是”后天教育”
  • 同日OpenAI降价80%:效率革命共振
  • Thinking Machines同日甩出Inkling-Small:以小博大成趋势
  • 后训练效率时代已经到来

9项基准全面披露:Flash版Agent能力反超Pro预览版

DeepSeek这次没有藏着掖着,直接亮出了9项基准测试的完整成绩单。最引人注目的是Terminal Bench 2.1——V4-Flash正式版拿到82.7分,而三个月前发布的V4-Pro预览版在Terminal Bench 2.0上仅得67.9分。需要说明的是,两个版本的测试集不完全相同,直接对比并不完全公平,但一个激活参数仅130亿的轻量版跑出这样的分数,已经足以说明问题。

其他核心指标同样亮眼:Cybergym网络安全对抗76.7分,DSBench-FullStack全栈开发68.7分,DSBench-Hard难题测试59.6分,NL2Repo代码仓库分析54.2分,Toolathlon verified工具调用70.3分。这些测试的名字本身就揭示了一个趋势——AI的能力评测正在从”写一段代码”进化到”完成一个工程任务”。从终端操作、代码仓库分析到网络安全对抗和全栈开发,V4-Flash展现出了”全能Agent”的潜质。

底座没换,变的是”后天教育”

整个事件中最值得关注的细节是:DeepSeek-V4-Flash-0731的模型结构、尺寸与Preview版完全一致,官方明确表示”仅重新进行了后训练”。换句话说,底座没有变,变的是”后天教育”。

这组对比数据极具冲击力:V4-Flash总参数2840亿、激活参数130亿;V4-Pro总参数1.6万亿、激活参数490亿。两者在模型规模上相差一个数量级。如果Flash能通过后训练把Agent能力拉到接近甚至超越Pro预览版的水平,意味着对于特定任务而言,模型规模并非决定性因素,训练方法和数据质量的权重正在上升。

DeepSeek还同步亮相了DeepSeek Harness极简模式——一个即将独立发布的Agent测试框架,此次随成绩一同公布。正式版同时原生支持Responses API格式,并针对性适配了Codex工作流,开发者迁移成本进一步降低。目前公测仅限API,App和网页端暂未更新,V4-Pro正式版”将尽快发布”。

同日OpenAI降价80%:效率革命共振

就在DeepSeek发布V4-Flash正式版的同一天,OpenAI宣布大幅下调两款最新模型价格。GPT-5.6 Luna降价80%,输入价格降至0.2美元/百万token,输出1.2美元/百万token;GPT-5.6 Terra降价20%,新定价为输入2美元、输出12美元/百万token。而这两款模型7月9日才公开发布,距今仅三周。

OpenAI降价的直接压力来自两方面:一是企业客户对AI账单愈发敏感,部分公司相关支出已达数十亿美元级别;二是开源权重模型快速崛起。月之暗面本月发布的开源模型Kimi K3在某些任务上已可媲美美国领先模型,促使硅谷迅速反应。Anthropic推出Claude Opus 5,性能与Fable 5相当但价格减半;谷歌也发布三款以成本优势为核心卖点的新模型,其中Gemini 3.6 Flash单次任务成本号称低于Kimi K3。

Thinking Machines同日甩出Inkling-Small:以小博大成趋势

同样在7月31日,Thinking Machines发布了第二款模型Inkling-Small——2760亿总参数、120亿激活参数的MoE架构模型,体量仅为半个月前发布的初代975B Inkling的四分之一。但就是这个”小个子”,在数学、推理、智能体编码和多模态基准上全面超越老大哥,在ARC-AGI-2上刷新开源SOTA。

剧情本身也足够戏剧化:联合创始人翁荔官宣离职仅两天,OpenAI便证实她回归带队”递归自我提升”项目。结果第三天,这家刚失去一位核心大将的公司直接把Inkling-Small的全量权重甩了出来。官方透露,关键在于预训练数据配比改进和后训练配方精炼——与DeepSeek的策略如出一辙。

后训练效率时代已经到来

7月31日的三条新闻指向同一结论:AI竞争的核心杠杆正从”堆参数”转向”练后训练”。当130亿激活参数可以叫板万亿模型,当OpenAI三周内降价80%,当四分之一体量的开源模型反超初代——后训练阶段的优化空间,可能比单纯扩大模型规模更具杠杆效应。

对开发者和企业而言,这意味着两件事:一是选模型不再只看参数量,后训练质量才是真正的分水岭;二是Token价格将持续下行,AI部署的边际成本正在快速趋近于零。DeepSeek已经在这条路上跑在了前面,V4-Pro正式版的表现无疑更值得期待。

作者

admin

关注我
其他文章
上一个

字节跳动7月30日大重组:飞书并入豆包,AI to B战略全面升维

下一个

DeepSeek V4-Flash正式版公测:130亿激活参数凭后训练叫板万亿Pro版

近期文章

  • 英伟达35亿美元入股联发科:定制AI芯片战正式打响
  • 前英伟达VP带9000万美元出逃:Veeda押注”世界模型”成具身智能新基建
  • OpenAI自研芯片Jalapeno实测跑赢英伟达:AI推理成本战正式打响
  • AI吞噬现金流:中美巨头单季烧掉1318亿,自由现金流集体转负
  • Anthropic发布MHS标准:AI智能体首次跨入物理世界操控机械臂

归档

  • 2026 年 9 月
  • 2026 年 8 月
  • 2026 年 7 月
  • 2026 年 6 月
  • 2026 年 5 月
  • 2020 年 1 月

分类

  • AI大模型
  • AI工具测评
  • AI教育
  • AI硬件/芯片
  • AI编程工具
  • AI行业动态
  • AI设计/创作
  • SEO/搜索优化
  • 科技教育
  • 科技资讯
  • 赚钱攻略
  • 软件推荐
Copyright 2026 — 78227科技派. All rights reserved. Blogsy WordPress Theme