Liquid AI 于9月24日发布实验性 LFM2.5-VL-DSpark,作为其视觉语言模型 LFM2.5-VL-3B 的推测解码草稿模型。它不是独立替代主模型,而是先生成候选 token,再由目标模型验证,以减少生成阶段的等待。
公司披露,该草稿模型约含2.795亿参数,并支持 llama.cpp、MLX-VLM 与 SGLang。页面同时说明,推测解码不加速视觉编码和预填充;因此,实际端到端收益会受图像处理与首个 token 时间占比限制。端侧和 H100 环境中的测试结果均为厂商披露,不应视为不同业务负载下的普遍结论。
推测解码改变的是生成环节而非整条视觉链路
对开放权重多模态模型的部署者而言,这次更新提供的是一项可选的推理组合,而非模型能力本身的替换。较长回答、连续对话等以解码为主的任务,若草稿模型与目标模型配合有效,可能更容易获得吞吐改善;而图像编码、长提示词预填充或频繁短请求占主导的工作负载,收益则会被未加速环节稀释。支持多个运行时可降低部分团队试用的集成门槛,但同时也带来版本兼容、显存配置和线上回归测试工作。是否采用仍应以目标硬件、任务结构和总延迟测量为依据,而不能只比较单项测试结果。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 利好 | 开放权重视觉语言模型新增可选的推理加速组合。 |
| 系统软件 | 利好 | 多个运行时的适配扩展了推测解码的集成空间。 |
| IT咨询与其他服务 | 中性 | 企业部署需重新评估硬件、版本兼容与实际端到端延迟。 |
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
