国内享有盛誉的AI模型DeepSeek,向来是个有特长的「偏科生」:文本推理能力出类拔萃,一碰上图像处理就力不从心,这让小雷心里爱恨交织。
今年8月21日,DeepSeek推出了多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,同日API接口也面向公众开放,手机端识图功能随之进入体验阶段。
(图片来源:DeepSeek官方)
根据官方的阐释,DeepSeek-V4-Flash-Vision-Exp在Agent、推理、世界知识这些纯文本领域的能力与V4-Flash正式版不相上下,原有的强项得以保留。它发生显著改变的是视觉理解表现:在需要视觉处理的Agent基准测试中,新模型相比V4-Flash取得长足进步,官方强调说「多模态 Agent 能力已非常接近 Opus-4.8」。
(图片来源:DeepSeek官方)
官方展示了三个应用实例,其中最引人注目的是PPT制作:在Agent体系下生成一份商业定制的西藏自驾游方案,要求具有「野性、原始、探索感」的风格,需要呈现三种含真实的计价方案,配图强调实拍的画面质感。其他两个实例分别是网站界面重构和生成前端动态效果Demo。
(图片来源:DeepSeek官方)
关于大家关心的API调用方法,官方也给出了详解,用户只需将model参数设置为DeepSeek-V4-Flash-Vision-Exp即可。
(图片来源:DeepSeek官方)
此时图片会被转化为token进行计费,单张图片最多可容纳384个token,费率与V4-Flash保持一致。图片提交方式包含base64内联格式和外部URL链接,同时新增了Files API:图片上传一次后,后续通过file_id引用,同一图片在多个请求中无需重复上传,此服务免费。
尽管模型名称中带有「Exp」,表明这仍是实验性质版本,距离正式推出尚有时日。但对V4-Flash近期在Arena.ai前端编码榜上首次超越Opus 4.8的成就回想起来,如今视觉理解能力又有所提升,小雷认为DeepSeek今年的进展确实迅速。
(图片来源:AI生成)
可以说DeepSeek的弱点终于得到改善,接下来要观察Agent应用场景能激发多少实际需求,那才能真正检验它的实力。









网友评论