DeepSeek补上视觉短板:首个多模态模型上线,视觉逼近Opus4.8价格仅零头

DeepSeek 一直有个明显的短板:不会看图。做 Agent 时遇到截图、图表、图片理解的任务只能绕道。8月21日,这个短板补上了——首款多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp 上线(DeepSeek 官方)。

更狠的是定价:视觉能力逼近 Opus 4.8,价格却保持在 V4-Flash 那一档。


它是什么:给 V4-Flash 加上了「眼睛」

它不是从头训练的新模型,而是在 V4-Flash 的同一组权重上直接加了视觉理解能力X)。关键指标:纯文本能力与 V4-Flash 持平,视觉大幅跃升,多模态 Agent 接近 Opus 4.8,1M 上下文,384K 输出,价格保持 Flash 档位(输入 $0.14/输出 $0.28)。

「文本不降级、视觉白送」是这次发布最值得注意的点。

📖 关联阅读:DeepSeek V4-Flash大升级


价格有多狠:Opus 的视觉,Flash 的价格

模型视觉能力输出$/百万token
Claude Opus 4.8顶级$75
GPT-5.6 Sol$30
DeepSeek Vision-Exp接近 Opus 4.8$0.28

视觉能力接近 Opus 4.8,价格是它的 1/268。按知乎测算,用 Opus 1/50 到 1/170 的价格提供 90-95% 的准确度(知乎)。视觉 Agent 的成本天花板被彻底击穿了。


为什么是「生产 Agent 的成本曲线」

DeepSeek 这次不抢旗舰位置,直接打生产 Agent 的成本曲线。大量 Agent 任务是「看截图→提取信息→执行」,对视觉有要求但对顶级推理要求不高。以前被迫用 Opus(因为只有它有视觉),现在 $0.28 就能干,准确度 90-95%。视觉 Agent 从奢侈品变成了日用品。


局限:实验版 + 纯视觉理解

1. 实验版(Exp)。还在验证阶段,API 行为可能调整,生产环境慎用。2. 视觉理解不是图像生成。Vision-Exp 能看懂图片(识别、提取、理解图表),但不能生成图片。


FAQ

Q1:怎么调用?

答:通过 DeepSeek API,model id 是 deepseek-v4-flash-vision-exp

Q2:它和 V4-Flash 是同一个模型吗?

答:基本是。在 V4-Flash 权重上加视觉,文本能力持平。

Q3:视觉真接近 Opus 4.8 吗?

答:官方称多模态 Agent 接近 Opus 4.8,第三方实测视觉基准不错。但实验版建议自己测试。

Q4:国内怎么用最方便?

答:DeepSeek 官方 API 直调,或经 橙风AI平台 一站式接入按需切换。

👤 关于作者
橙风AI 技术博客作者。📧 tokencome.cn

发表评论