DeepSeek 上线视觉模型:同价加量,但别拿它认人

8月21日,DeepSeek在API平台上线了多模态视觉理解模型deepseek-v4-flash-vision-exp,官方标注为实验版(Exp) 。这是V4系列第一个能直接输入图片的模型,纯文本能力与V4-Flash正式版基本持平,价格也一样。区别只在输入模态——多了一双眼睛。

先看数据

Vision-Exp的上下文是1M Token,最大输出384K Token,并发限制2500。支持JPEG、PNG、GIF、WebP四种图片格式,兼容Chat Completions、Messages、Responses三种API格式,支持JSON Output和Tool Calls。

图片按尺寸折算成Token计费,单张封顶384 Token。按高峰时段输入价3元/百万Token算,一张图最高成本约0.0012元——1分钱大约能看8张图。空闲时段价格减半,缓存命中的图片请求价格更低。

图片传入支持三种方式:base64内联(编码数据计入48 MiB请求体限制)、外部URL(图像文件最大32 MiB,下载需在60秒内完成)、Files API(推荐方式,尤其适合需要多次引用同一图片的Agent工作流)。

跑分:多模态Agent能力接近Opus 4.8

DeepSeek官方公布了一系列基准测试数据,称多模态Agent能力已接近Claude Opus 4.8。以下数据均为DeepSeek官方自测结果,非第三方独立榜单。

纯文本Agent任务(Vision-Exp vs V4-Flash):Terminal Bench 2.1 83.9 vs 82.7,DeepSWE 59.3 vs 54.4(提升4.9分),Toolathlon-Verified 75.9 vs 70.3(提升5.6分),DSBench-Hard 63.6 vs 59.6。

多模态Agent任务(V4-Flash因无法处理图像,此前这些任务基本无法作答):ApexBench 36.5 vs 26.2,Agents‘ Last Exam 27.3 vs 25.2,Chartography 64.3(Opus-4.8为65.0),ZeroBench 35.0(Opus-4.8为34.0),四项评测2胜2负。

看看完成了什么:

官方展示了三个场景,核心逻辑都是“看图干活一气呵成”。

生成PPT:输入“帮我做个西藏攻略的PPT,藏南+藏北,一个月自驾游,高端定制,野性、原始、探索感,不要小清新”,模型输出一套带真实摄影风格配图、包含三种定价方案的完整PPT。

网站风格重构:给一张DeepSeek Harness官网截图,要求“黑蓝深海、玻璃UI、ASCII原子像素”风格,经过多轮交互后重构出未来主义风格的开发者网站。

前端动态特效:输入“一群可爱的3D黏土小怪物加入一个跃动的复古舞池派对”,直接生成可运行的前端Mini Demo。

人脸识别翻车,问题出在架构

这是网上吐槽最多的点。同一张梁文锋的照片,不同人测出来结果不一样——有人说是王兴,有人说是王宁,有人说是张一鸣或张雪峰。还有网友把时代少年团合照发给它,它得出的结论是“这五个人长得太像、皮肤过于光滑,可能是批量生成的假图”。

这背后是架构问题。

DeepSeek走的不是原生多模态路线,而是“外挂视觉”路线——把已有的视觉编码模块接到V4-Flash前面,由文本主干完成后续推理。对于常规物体识别、OCR、图表理解这类任务,这条路够用。但人脸识别需要的是“精细视觉-语义对齐”——视觉编码器提取的特征要精确对应到具体身份,文本主干要准确调用记忆里的那个人,这套拼装架构在信息传递过程中存在损耗。

有实测显示,在处理Three.js三维场景这类复杂任务时,Vision-Exp反复自我纠错,Token消耗比Gemini 3.7 Flash高出近15倍,耗时多出3.5倍。

和Image-2不是一回事

Vision-Exp是“看图”——输入图片,输出文字、代码或Agent操作。GPT Image-2是“出图”——输入文字,输出一张新图。一个管“读懂”,一个管“创造”。

计价逻辑和价格量级完全不同:Vision-Exp看图一张约0.0012元,Image-2出图一张约0.006到0.211美元。

总结

Vision-Exp被定位为Agent的视觉入口——它的任务是“看懂截图、分析图表、理解UI布局,然后继续干活”,而不是“认人”。用超出设计范围的方式去用它,它确实会露馅。

如果你需要低成本地把看图能力接入Agent工作流——识别截图文字、分析图表、判断前端页面效果——这个模型是目前成本最低的选择之一。但如果你需要精确的人物识别或高难度视觉推理任务,它现在还不太行。

名字里的“Exp”意味着还有优化空间,生产场景建议先测试再决定是否接入。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐