8月21日,DeepSeek首款视觉模型V4-Flash-Vision-Exp上线,一张图最高才0.001元。白天刚被"涨价11倍"刷屏,晚上它却发了个不加价的模型,还宣称多模态Agent能力接近Opus-4.8。这篇教你3步接好它的视觉API,再把官方跑分表摊开,看看媒体没说的事。
白天涨价11倍,晚上却发了个"不加价"的
先说背景。8月中旬,DeepSeek V4系列API调价,实行峰谷分时定价,最高涨幅超过11倍,不少开发者直呼"错峰调用才能省钱"。结果8月21日,DeepSeek宣布首个多模态模型V4-Flash-Vision-Exp上线——补上了视觉理解这最后一块短板,价格却直接对标V4 Flash,一分没涨。
为什么"不加价"反而是大新闻? 视觉模型要额外处理图片,算力成本普遍高于纯文本。同行发视觉模型,都是"加量也加价";DeepSeek偏偏把价格和文本版Flash拉平,一张图最高才0.001元(约1厘钱)。意图很直白:先用"视觉不加价"把开发者圈进来,把多模态Agent的生态抢到手,赚钱是后话。
这双"眼睛"能干什么
简单说,它终于能"看图"了。官方更新日志里写得很清楚,适用场景集中在四类:
- 票据、证件、合同扫描:拍张照,OCR、信息抽取一次完成
- 图表、截图理解:把报表截图丢给它,直接要结论
- 长文档里的图片:说明书、论文插图,连同正文一起喂进去
- 给Agent装上视觉:让AI"看"屏幕、操作界面,这正是多模态Agent的入口
再算笔成本账:一张图最高0.001元,1000张图才1块钱。批量跑一遍OCR,或者给自家产品加个"拍照识图"功能,成本几乎可以忽略不计。
3步接好视觉API
接口和OpenAI兼容。如果你已经在用DeepSeek的API,基本只需改一行。
第1步:拿到API Key(platform.deepseek.com,新用户有免费额度,以官网为准)。
第2步:把代码里的模型名换成deepseek-v4-flash-vision-exp。
第3步:传图。官方Vision指南给了三种发图方式,URL和base64最常用——直接贴图片链接,或者把图片编码成base64塞进消息。示意代码:
from openai import OpenAI
client = OpenAI(api_key="你的Key", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{"role": "user", "content": [
{"type": "text", "text": "这张图里有什么?帮我总结重点"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]}]
)
print(resp.choices[0].message.content)
完整参数以官方Vision指南为准,但骨架就是这三步——几分钟就能跑通。
跑分表摊开:是"接近Opus-4.8",还是2:2?
媒体标题都在喊"多模态Agent能力接近Opus-4.8",但把官方跑分表逐行看完,是另一回事:官方给出的4项视觉基准里,和Opus-4.8打成2:2平手——有赢的,也有被压的。"接近"没错,但"全面接近"是宣传话术。
再提醒一句:模型名里的Exp是Experimental(实验版)的意思,官方定位就是探路版本。想上生产环境,先小流量跑几天,重点观察你业务里的真实场景,别拿几张宣传图就拍板。
我的看法
DeepSeek这次真正放出的信号,不是"又追上谁",而是"视觉能力不再加价"。对普通开发者和想给产品加"眼睛"的人来说,这反而是最实际的一条:接口兼容、价格拉平、教程现成,门槛被压到了最低。
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。

2768

被折叠的 条评论
为什么被折叠?



