vLLM 语义路由器:LLM 推理的下一个阶段
4 分钟阅读
vLLM Semantic Router 团队

行业现状:推理并非“多多益善”
过去一年中,混合推理和自动路由日益成为大模型基础设施发展的核心——这场辩论已从单纯的规模竞赛,转向每 Token 效率、延迟控制以及针对性的计算资源使用。
以 GPT-5 为例:其显著的创新不在于参数量,而在于路由策略和基于配额的推理。
- 轻量查询 → 轻量路径:如“为什么天空是蓝的?”这类简单提示词,无需触发昂贵的推理过程。
- 复杂/高价值查询 → 推理增强模型:多步任务——如法律分析或财务规划——会被路由至启用思维链 (Chain-of-Thought) 的推理模式。
这代表了任务感知型计算分配的广义原则,即每一个推理 Token 必须贡献实质价值,而非仅仅是被消耗。
类似的思想正在其他系统中涌现
- Anthropic Claude 3.7/4:区分“快思考”与“慢思考”路径。
- Google Gemini 2.5:提供明确的“思考预算”(thinking budgets),允许企业限制推理深度。
- 阿里 Qwen3:支持在指令驱动下切换推理和非推理模式。
- DeepSeek v3.1:在双模单模型中融合了对话与推理流程。
趋势很明显:未来的推理系统将由选择性和智能化来定义,而不仅仅是模型大小。
最新研究:vLLM 语义路由 (Semantic Router)
为了响应这一转变,vLLM 语义路由为高效的 vLLM 推理引擎提供了一个开源的、意图感知的路由层。
vLLM 实现了可扩展的 LLM 服务——但缺乏围绕推理的语义决策能力。开发者面临权衡:
- 始终启用推理 → 准确性提升,但成本也随之增加。
- 禁用推理 → 成本下降,但在复杂任务上的准确性受损。
语义路由通过对查询进行语义分类并适当地分发它们,填补了这一空白,确保在需要时获得准确结果,在无需深度推理时保持高效率。

架构设计
该系统由四个支柱组成:
- 语义分类:使用 ModernBERT——目前集成在路由器中作为一个轻量级独立分类器——来确定路由路径。
- 智能路由
- 简单查询 → “快速路径”推理。
- 复杂查询 → “思维链”推理模式。
- 高性能引擎:使用 Hugging Face Candle 编写的 Rust 代码,提供高并发和零拷贝推理。
- 云原生集成:通过
ext_proc插件与 Kubernetes 和 Envoy 开箱即用。
在测试中,该设计实现了:
- 准确率提升约 10%
- 延迟降低约 50%
- Token 消耗减少约 50%
在商业和经济领域,准确率提升超过 20%。
执行挑战:预算与工具调用
两个技术限制需要解决:
- 推理预算成本
无限制的推理会增加冷启动延迟和资源占用。如果没有动态控制,简单查询可能会过度消耗 Token,而关键查询在需要时可能无法获得深度推理。TTFT(首字延迟)和 p95 延迟等 SLO 指标是必要的,并可能需要进行推理过程中的动态适配。 - 工具调用约束
添加更多工具(即“工具目录臃肿”)或冗长的工具输出会显著降低准确性。路由器必须预过滤工具并保持目录精简。
项目背景
语义路由发展于开源社区的共同贡献:
- 由 Chen Huamin 博士 (Red Hat) 于 2025 年初提出。
- 由 Xunzhuo Liu (腾讯) 进一步开发。
- 将由 Wang Chen 博士 (IBM Research) 和 Chen Huamin 博士在 KubeCon North America 2025 上展示。
我们的目标:通过以下方式为开源 LLM 提供推理加速:
- 语义感知路由
- 高效模型切换
- 企业级部署(Kubernetes 和 Envoy)
在 GitHub 上找到该项目。目前重点在于 工作组 和规划中的 v0.1 路线图。
集成与未来工作:嵌入模型与插件化
目前,ModernBERT 在路由器内部运行以进行分类,尚未由 vLLM 提供服务。然而,未来的工作旨在使分类器——以及潜在的其他嵌入模型——变得可插拔,从而允许与 vLLM 托管的模型或外部嵌入服务集成。
此功能将增强语义缓存并实现更平滑的推理定制。
路线图:v0.1 里程碑亮点
v0.1 里程碑 将扩展该项目的技术能力:
- 核心:基于 ExtProc 的模块化、跨后端语义缓存、多因素路由逻辑
- 基准测试:CLI 工具、性能测试套件、推理模式评估
- 网络:与 Envoy、GIE 和 llm-d 网关的更深层集成
- 可观测性与用户体验:管理仪表板、路由策略可视化、开发者快速入门和策略食谱
未来趋势:即时 (JIT) 推理
该领域正在从“我们能运行推理吗?”转变为“推理如何变得更智能?”
- GPT-5 使用商业价值来指导推理深度。
- vLLM 语义路由将这一能力带给了开源界。
展望未来,那些无需手动切换、能即时调整推理策略的系统,将在效率、延迟和可持续性方面领先。
一句话总结
- GPT-5:用于更智能推理的企业级路由。
- vLLM 语义路由:面向开源 LLM 的技术优先路由。
- 边缘未来:上下文感知、最小计算量且无缝协作的推理。