DeepSeek V4-Flash大升级:纯后训练逆袭旗舰,编程评测逼近Opus4.8

7月31日,DeepSeek 把 V4-Flash 从「预览版」推到了正式版。改动清单很短:架构没变,参数量没变,只是「重新后训练了一次」。

改动效果?Terminal-Bench 从 61.8 跳到 82.7,DeepSWE 从 7.3 暴涨到 54.4。一个小模型,纯靠后训练,反超了自己家的大旗舰 V4-Pro——而且价格只要它的三分之一。


发生了什么:一次「只改训练不改架构」的升级

DeepSeek-V4-Flash-0731 的架构跟 4 月份预览版完全一样(HuggingFace):总量 284B MoE 架构,每 token 仅激活 13B,256 路由专家 + 1 共享专家每次选 6 个,1M token 上下文窗口。唯一变量是后训练重做了一轮。

基准测试Flash-0731预览版V4-ProGLM-5.2Opus 4.8
Terminal-Bench 2.182.761.872.181.085.0
DeepSWE54.47.312.846.258.0
Cybergym76.738.752.783.1
NL2Repo54.239.438.548.969.7
Toolathlon70.349.755.959.976.2

几个看点:DeepSWE 从 7.3 跳到 54.4 是单一后训练更新中最大的跳跃;Cybergym 翻倍至 76.7;小模型在所有 Agent 基准上全面碾压自家 V4-Pro;Terminal-Bench 距离 Opus 4.8 只差 2.3 分。

📖 关联阅读:2026年6月AI圈月报


价格:三毛钱跑 Agent

模型输入输出Terminal-Bench
DeepSeek Flash-0731$0.14$0.2882.7
GPT-5.6 Luna$0.20$1.20
Claude Sonnet 5$3$15
Claude Opus 4.8$15$7585.0

用 V4-Flash-0731 跑 Agent 循环成本约为 Opus 4.8 的 1/200。OpenAI 在 DeepSeek 发布前一天把 GPT-5.6 Luna 降价 80%(temperature2)。中美 AI 价格战从「偶尔打折」变成「常态降价」。


本地部署:MIT 开源,要够内存

权重 MIT 协议开源(MarkTechPost):4×GB300 节点跑满精度,3-bit 量化需约 110GB 内存+显存。自带 DSpark 推测解码,生成速度提升 60-85%。

📖 关联阅读:Claude Code国内使用完整指南


Agent 时代的价格战正在改写规则

Flash-0731 并发限制 2,500 请求(V4-Pro 仅 500),对 Agent 集群团队来说比基准测试更有价值。独立评测机构 Artificial Analysis 打出了 Intelligence Index 50 分,162 个模型中排第二。唯一提醒:模型比较啰嗦,实际按 token 计费(Developers Digest)。


FAQ

Q1:V4-Flash-0731 和预览版有什么不同?

答:架构相同,唯一区别是后训练重做。Terminal-Bench 从 61.8 跳到 82.7,DeepSWE 从 7.3 暴涨到 54.4。

Q2:本地能不能跑?

答:MIT 开源。3-bit 量化需约 110GB 内存+显存。本地跑不动直接用 API,$0.28/百万输出 token 极便宜。

Q3:跟 Claude Opus 4.8 比怎么样?

答:Terminal-Bench 82.7 vs 85.0,差 2.3 分但价格差 200 倍。

Q4:怎么接入?

答:API 已开放,支持 OpenAI Responses API 格式和 Codex。也可通过 橙风AI平台 统一接入。


参考信源

  1. DeepSeek. V4-Flash-0731 模型卡. 链接
  2. MarkTechPost. “DeepSeek Upgrades V4-Flash-0731.” 链接
  3. Developers Digest. “DeepSeek V4 Flash 0731.” 链接
  4. temperature2. “DeepSeek V4-Flash update.” 链接
  5. Digital Applied. “DeepSeek V4 Flash 0731.” 链接

👤 关于作者
橙风AI 技术博客作者,AI 编程工具深度用户。📧 tokencome.cn | 📖 更多 AI 教程 →

发表评论