
今日,DeepSeek 为 V4-Flash 补上视觉能力,推出实验版 DeepSeek-V4-Flash-Vision-Exp 并开放调用,其多模态 Agent 能力大幅提升,Files API 也同步上线。

新推出的 DeepSeek-V4-Flash-Vision-Exp 是实验性质版本,通过 `deepseek-v4-flash-vision-exp` 这个 model id 在 DeepSeek API 平台开放调用。这一动作标志着 DeepSeek 在多模态技术上的又一探索。

在纯文本能力方面,Vision-Exp 与 V4-Flash 正式版持平,加视觉未牺牲文本推理能力。而在视觉理解的 Agent Benchmark 上大幅跃升,多模态 Agent 能力接近 Opus 4.8,图片按 token 计费,价格与 V4-Flash 一致。

DeepSeek 展示了三个多模态 Agent 长任务示例,包括做西藏自驾游 PPT、重构官网、制作前端 Mini Demo 等,体现了其在复杂多步工作流中的视觉理解能力。

Files API 开放且不收费,用户可先上传图片,通过 file_id 引用,避免重复上传。多模态 API 支持多种格式和图片传入方式,提升了使用的便利性。

DeepSeek 此次更新,为多模态大模型发展提供了新的参考,有望推动行业在视觉与文本融合技术上的进一步探索,提升多模态应用的质量和效率。
编辑观点:DeepSeek 此次升级展现了多模态技术的潜力,新功能和 API 的推出将为开发者提供更多可能,有望在相关应用领域带来新突破。

43

被折叠的 条评论
为什么被折叠?



