首页 / 人工智能 / AI模型与技术

DeepSeek上线视觉理解实验模型,API补齐图文输入与文件接口

DeepSeek上线V4-Flash-Vision-Exp实验模型,新增视觉理解能力并支持图文混合输入与Files API。

今日科技圈头条C编辑部已完成来源核验
查看行业与公司影响↓

DeepSeek在API平台上线实验性模型DeepSeek-V4-Flash-Vision-Exp。该模型在文本输入之外支持图片,开发者可通过指定模型名称调用。

该服务支持Chat Completions、Messages和Responses三种调用格式,并支持图文混合输入。图片可通过Base64、外部URL或Files API传入。单张图片最多占用384个token,模型价格与V4-Flash一致;Files API已开放,用户可先上传图片后再按file_id引用。

多模态接口扩展智能体的输入范围

视觉能力接入既有API后,应用开发者可将截图、文档图片和图表等非文本信息纳入原有智能体流程,减少针对不同输入类型分别接入服务的工作。对模型API服务而言,图文混合请求扩展了可承载的任务类型,也增加了图片解析、文件存储、接口兼容和容量调度等环节的需求。此次价格与V4-Flash保持一致,使已使用该模型的开发者可以在原有调用框架中接入视觉输入;应用软件产品则可据此把图像与文本处理置于同一工作流,云端推理服务也将面对新增场景与基础设施负荷并存的传导。

涉及行业行业影响分析简要理由
应用软件利好视觉理解能力进入API,便于软件产品把图像和文本放入同一工作流。
互联网服务与基础设施中性多模态请求拓展服务需求,同时增加推理与文件处理的基础设施负荷。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

专题:AI模型与技术

#DeepSeek#多模态模型#API#智能体