vLLM 语义路由器:LLM 推理的下一个阶段

4 分钟阅读
vLLM Semantic Router 团队

行业现状:推理并非“多多益善”

过去一年中,混合推理和自动路由日益成为大模型基础设施发展的核心——这场辩论已从单纯的规模竞赛,转向每 Token 效率、延迟控制以及针对性的计算资源使用。

以 GPT-5 为例:其显著的创新不在于参数量,而在于路由策略和基于配额的推理。

  • 轻量查询 → 轻量路径:如“为什么天空是蓝的?”这类简单提示词,无需触发昂贵的推理过程。
  • 复杂/高价值查询 → 推理增强模型:多步任务——如法律分析或财务规划——会被路由至启用思维链 (Chain-of-Thought) 的推理模式。

这代表了任务感知型计算分配的广义原则,即每一个推理 Token 必须贡献实质价值,而非仅仅是被消耗。

类似的思想正在其他系统中涌现

  • Anthropic Claude 3.7/4:区分“快思考”与“慢思考”路径。
  • Google Gemini 2.5:提供明确的“思考预算”(thinking budgets),允许企业限制推理深度。
  • 阿里 Qwen3:支持在指令驱动下切换推理和非推理模式。
  • DeepSeek v3.1:在双模单模型中融合了对话与推理流程。

趋势很明显:未来的推理系统将由选择性和智能化来定义,而不仅仅是模型大小。

最新研究:vLLM 语义路由 (Semantic Router)

为了响应这一转变,vLLM 语义路由为高效的 vLLM 推理引擎提供了一个开源的、意图感知的路由层。

vLLM 实现了可扩展的 LLM 服务——但缺乏围绕推理的语义决策能力。开发者面临权衡:

  • 始终启用推理 → 准确性提升,但成本也随之增加。
  • 禁用推理 → 成本下降,但在复杂任务上的准确性受损。

语义路由通过对查询进行语义分类并适当地分发它们,填补了这一空白,确保在需要时获得准确结果,在无需深度推理时保持高效率。

架构设计

该系统由四个支柱组成:

  1. 语义分类:使用 ModernBERT——目前集成在路由器中作为一个轻量级独立分类器——来确定路由路径。
  2. 智能路由
    • 简单查询 → “快速路径”推理。
    • 复杂查询 → “思维链”推理模式。
  3. 高性能引擎:使用 Hugging Face Candle 编写的 Rust 代码,提供高并发和零拷贝推理。
  4. 云原生集成:通过 ext_proc 插件与 Kubernetes 和 Envoy 开箱即用。

在测试中,该设计实现了:

  • 准确率提升约 10%
  • 延迟降低约 50%
  • Token 消耗减少约 50%

在商业和经济领域,准确率提升超过 20%。

执行挑战:预算与工具调用

两个技术限制需要解决:

  • 推理预算成本
    无限制的推理会增加冷启动延迟和资源占用。如果没有动态控制,简单查询可能会过度消耗 Token,而关键查询在需要时可能无法获得深度推理。TTFT(首字延迟)和 p95 延迟等 SLO 指标是必要的,并可能需要进行推理过程中的动态适配。
  • 工具调用约束
    添加更多工具(即“工具目录臃肿”)或冗长的工具输出会显著降低准确性。路由器必须预过滤工具并保持目录精简。

项目背景

语义路由发展于开源社区的共同贡献:

我们的目标:通过以下方式为开源 LLM 提供推理加速:

  • 语义感知路由
  • 高效模型切换
  • 企业级部署(Kubernetes 和 Envoy)

GitHub 上找到该项目。目前重点在于 工作组 和规划中的 v0.1 路线图

集成与未来工作:嵌入模型与插件化

目前,ModernBERT 在路由器内部运行以进行分类,尚未由 vLLM 提供服务。然而,未来的工作旨在使分类器——以及潜在的其他嵌入模型——变得可插拔,从而允许与 vLLM 托管的模型或外部嵌入服务集成。

此功能将增强语义缓存并实现更平滑的推理定制。

路线图:v0.1 里程碑亮点

v0.1 里程碑 将扩展该项目的技术能力:

  • 核心:基于 ExtProc 的模块化、跨后端语义缓存、多因素路由逻辑
  • 基准测试:CLI 工具、性能测试套件、推理模式评估
  • 网络:与 Envoy、GIE 和 llm-d 网关的更深层集成
  • 可观测性与用户体验:管理仪表板、路由策略可视化、开发者快速入门和策略食谱

该领域正在从“我们能运行推理吗?”转变为“推理如何变得更智能?”

  • GPT-5 使用商业价值来指导推理深度。
  • vLLM 语义路由将这一能力带给了开源界。

展望未来,那些无需手动切换、能即时调整推理策略的系统,将在效率、延迟和可持续性方面领先。

一句话总结

  • GPT-5:用于更智能推理的企业级路由。
  • vLLM 语义路由:面向开源 LLM 的技术优先路由。
  • 边缘未来:上下文感知、最小计算量且无缝协作的推理。