DeepSeek在API平台上线实验性模型DeepSeek-V4-Flash-Vision-Exp。该模型在文本输入之外支持图片,开发者可通过指定模型名称调用。
该服务支持Chat Completions、Messages和Responses三种调用格式,并支持图文混合输入。图片可通过Base64、外部URL或Files API传入。单张图片最多占用384个token,模型价格与V4-Flash一致;Files API已开放,用户可先上传图片后再按file_id引用。
多模态接口扩展智能体的输入范围
视觉能力接入既有API后,应用开发者可将截图、文档图片和图表等非文本信息纳入原有智能体流程,减少针对不同输入类型分别接入服务的工作。对模型API服务而言,图文混合请求扩展了可承载的任务类型,也增加了图片解析、文件存储、接口兼容和容量调度等环节的需求。此次价格与V4-Flash保持一致,使已使用该模型的开发者可以在原有调用框架中接入视觉输入;应用软件产品则可据此把图像与文本处理置于同一工作流,云端推理服务也将面对新增场景与基础设施负荷并存的传导。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 利好 | 视觉理解能力进入API,便于软件产品把图像和文本放入同一工作流。 |
| 互联网服务与基础设施 | 中性 | 多模态请求拓展服务需求,同时增加推理与文件处理的基础设施负荷。 |
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
