DeepSeek 一直有个明显的短板:不会看图。做 Agent 时遇到截图、图表、图片理解的任务只能绕道。8月21日,这个短板补上了——首款多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp 上线(DeepSeek 官方)。
更狠的是定价:视觉能力逼近 Opus 4.8,价格却保持在 V4-Flash 那一档。
它是什么:给 V4-Flash 加上了「眼睛」
它不是从头训练的新模型,而是在 V4-Flash 的同一组权重上直接加了视觉理解能力(X)。关键指标:纯文本能力与 V4-Flash 持平,视觉大幅跃升,多模态 Agent 接近 Opus 4.8,1M 上下文,384K 输出,价格保持 Flash 档位(输入 $0.14/输出 $0.28)。
「文本不降级、视觉白送」是这次发布最值得注意的点。
📖 关联阅读:DeepSeek V4-Flash大升级
价格有多狠:Opus 的视觉,Flash 的价格
| 模型 | 视觉能力 | 输出$/百万token |
|---|---|---|
| Claude Opus 4.8 | 顶级 | $75 |
| GPT-5.6 Sol | 强 | $30 |
| DeepSeek Vision-Exp | 接近 Opus 4.8 | $0.28 |
视觉能力接近 Opus 4.8,价格是它的 1/268。按知乎测算,用 Opus 1/50 到 1/170 的价格提供 90-95% 的准确度(知乎)。视觉 Agent 的成本天花板被彻底击穿了。
为什么是「生产 Agent 的成本曲线」
DeepSeek 这次不抢旗舰位置,直接打生产 Agent 的成本曲线。大量 Agent 任务是「看截图→提取信息→执行」,对视觉有要求但对顶级推理要求不高。以前被迫用 Opus(因为只有它有视觉),现在 $0.28 就能干,准确度 90-95%。视觉 Agent 从奢侈品变成了日用品。
局限:实验版 + 纯视觉理解
1. 实验版(Exp)。还在验证阶段,API 行为可能调整,生产环境慎用。2. 视觉理解不是图像生成。Vision-Exp 能看懂图片(识别、提取、理解图表),但不能生成图片。
FAQ
Q1:怎么调用?
答:通过 DeepSeek API,model id 是 deepseek-v4-flash-vision-exp。
Q2:它和 V4-Flash 是同一个模型吗?
答:基本是。在 V4-Flash 权重上加视觉,文本能力持平。
Q3:视觉真接近 Opus 4.8 吗?
答:官方称多模态 Agent 接近 Opus 4.8,第三方实测视觉基准不错。但实验版建议自己测试。
Q4:国内怎么用最方便?
答:DeepSeek 官方 API 直调,或经 橙风AI平台 一站式接入按需切换。
👤 关于作者
橙风AI 技术博客作者。📧 tokencome.cn