首页 / 人工智能 / 云计算与基础设施

Netflix披露内部大模型推理服务:把 vLLM 接入既有模型平台

Netflix 技术团队披露内部大模型推理服务的架构选择:保留既有模型服务入口,并以 Triton、vLLM 和双接口承接不同推理工作负载。

今日科技圈头条C编辑部已完成多源核验
查看行业与公司影响↓

Netflix 技术团队披露了其内部大模型推理服务的设计。团队没有为大模型另建一套隔离平台,而是将模型部署和推理接入既有模型服务体系。已公开材料显示,这套体系同时服务传统机器学习模型和大模型:较小的 CPU 模型可在统一服务中运行,较大的 GPU 模型则由 Model Scoring Service 承接。

在推理引擎选择上,Netflix 介绍其早期使用过 TensorRT-LLM,随后针对嵌入生成、仅预填充、连续生成以及包含自定义约束的模型等工作负载重新评估,选择 vLLM 作为主要推理路径。NVIDIA Triton Inference Server 位于模型加载、批处理和 GPU 调度的服务层;上层控制平面负责部署、版本、健康检查、自动扩缩及分阶段发布。团队保留既有 gRPC 调用入口,同时增加兼容 OpenAI 的 HTTP 接口,供不同应用接入。

此次披露并非面向消费者的新功能发布,而是说明大模型如何进入已运行多类机器学习业务的生产系统。Netflix 还描述了模型版本兼容、约束式输出和发布策略等工程安排。为处理结构化输出需求,团队调整了接口实现,使请求中的输出格式约束能够传递到推理引擎;在 vLLM 从 V0 迁至 V1 后,团队也针对批处理中的约束式解码改写了关键路径。

从公开架构可见,Netflix 将模型推理、部署和服务治理纳入同一条生产链路。这一案例展示了大型互联网公司组织内部推理服务的方式,但未披露具体 GPU 数量、云资源采购金额或由此产生的单项财务结果。双接口设计则使既有内部服务与采用通用 HTTP 规范的新应用能够接入同一基础设施。

内部推理平台对基础设施需求的传导

大模型进入既有服务平台后,相关需求会沿着推理软件、GPU 调度、模型部署和运行维护等环节传导。Netflix 将传统模型与大模型纳入共享服务,可减少应用侧重复建设接口的需要,同时也提高了底层对模型版本管理、发布节奏和多类负载并行运行的要求。vLLM 与 Triton 在该架构中分别承担推理与服务层职责,反映出生产环境对兼容性、部署自动化和运维能力的需求。由于公司未披露采购规模,这一实践更适合作为技术采用信号,不宜据此推导相关供应商的收入金额。

涉及行业行业影响分析简要理由
互联网服务与基础设施利好内部推理平台需要持续的模型部署、服务治理和计算资源调度能力。
应用软件利好OpenAI 兼容接口降低了新应用接入既有推理服务的适配成本。
涉及的上市公司证券代码个股影响分析简要理由公允价值参考分析师平均目标价参考
NVIDIANASDAQ:NVDA中性Triton 被用于该推理服务层,但 Netflix 未披露由此新增的硬件或软件采购金额。280美元平均308.69美元

公允价值及分析师目标价为截至文章发表时的网上公开数据,数据可能随发布方更新而变化,且因不同口径可能得出不同结果,仅供参考,不等于公司客观价值。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

专题:云计算与基础设施

#大模型推理#vLLM#NVIDIA Triton#AI基础设施#Netflix