vLLM Semantic Router v0.1 Iris:首个重大版本

9 分钟阅读
vLLM Semantic Router 团队

vLLM Semantic Router 是面向模型混合(MoM)的系统级智能,为 LLM 系统引入了集体智慧。它位于用户和模型之间,通过捕获请求、响应和上下文中的信号,做出智能路由决策——包括模型选择、安全过滤(越狱防护、PII 脱敏)、语义缓存和幻觉检测等。更多背景信息,请参见我们此前的初步公告博客文章

我们非常激动地宣布发布 vLLM Semantic Router v0.1,代号为 Iris——这是我们的首个重大版本,标志着智能 LLM 路由领域的一个变革性里程碑。自 2025 年 9 月启动实验性版本以来,我们见证了社区的卓越成长:合并了超过 600 个 Pull Requests,处理了 300 多个 Issue,并获得了全球 50 多位杰出工程师的贡献。随着 2026 年的到来,我们很高兴能推出一个已从最初雏形演变为生产就绪级的语义路由平台。

为什么选择 Iris?

在希腊神话中,Iris (Ἶρις) 是沟通神灵与凡人的使者,她跨越彩虹桥在广袤天地间传递信息。这一象征完美契合了 vLLM Semantic Router v0.1 的使命:充当用户与多样化 AI 模型之间的桥梁,智能地在不同的 LLM 提供商和架构之间进行路由。

v0.1 Iris 有哪些新特性?

1. 架构全面升级:信号-决策插件链架构

过去:早期的 Semantic Router 依赖于单维方法——将查询分类到 14 个 MMLU 领域类别之一,并具备静态编排的越狱检测、PII 保护和语义缓存功能。

现在:我们引入了信号-决策驱动的插件链架构,这是一次对语义路由的彻底重构,能够从固定的 14 个类别扩展到无限可能的智能路由决策。

新架构从用户查询中提取六种类型的信号

  • 领域信号:基于 MMLU 训练的分类,具备 LoRA 扩展性
  • 关键字信号:基于正则表达的高效、可解释模式匹配
  • 嵌入信号:使用神经嵌入(Neural Embeddings)的可扩展语义相似度计算
  • 事实信号:用于幻觉检测的事实核查分类
  • 反馈信号:用户满意度/不满意度指标
  • 偏好信号:基于用户定义偏好的个性化设置

这些信号作为灵活决策引擎的输入,通过“与/或”逻辑及优先级选择进行整合。此前静态的特性(如越狱检测、PII 保护和语义缓存)现在均已变为可配置的插件,用户可以针对每项决策按需启用。

插件用途
semantic-cache缓存类似查询以优化成本
jailbreak检测提示词注入攻击
pii保护敏感信息
hallucination实时幻觉检测
system_prompt注入自定义指令
header_mutation修改 HTTP 头以实现元数据传播

这种模块化设计实现了无限的可扩展性——无需修改底层架构即可添加新的信号、插件和模型选择算法。更多信息请参见我们的信号-决策架构博客文章

2. 性能优化:模块化 LoRA 架构

通过与 Hugging Face Candle 团队的合作,我们彻底重构了路由器的推理内核。之前的实现需要独立加载和运行多个微调模型,计算成本随着分类任务数量的增加呈线性增长。

突破点:通过采用低秩自适应(LoRA),我们现在可以在所有分类任务间共享基础模型计算。

方法工作负载可扩展性
之前N 次完整模型前向传播O(n)
之后1 次基础模型传播 + N 个轻量级 LoRA 适配器O(1) + O(n×ε)

注:在此 ε 表示相比完整基础模型,LoRA 适配器前向传播的相对成本——通常 ε << 1,因此额外开销微乎其微。

该架构显著降低了延迟,同时支持对同一输入进行多任务分类。详细技术细节请参阅我们的模块化 LoRA 博客文章

3. 安全性增强:HaluGate 幻觉检测

除了请求时的安全性(越狱、PII)之外,v0.1 版本还引入了 HaluGate——这是一个针对 LLM 响应的三阶段幻觉检测流水线:

第一阶段:HaluGate Sentinel – 进行二分类,判断查询是否需要事实核查(创意写作和代码编写不需要事实验证)。

第二阶段:HaluGate Detector – 在 Token 级别检测响应中哪些部分不受所提供上下文的支持。

第三阶段:HaluGate Explainer – 基于 NLI 的分类,解释每个被标记片段为何出现问题(矛盾 vs 中立)。

HaluGate 与工具调用工作流无缝集成——工具结果作为验证的基准真值。检测结果通过 HTTP 头传播,使下游系统能够实施自定义策略。深入了解请参阅我们的 HaluGate 博客文章

4. 用户体验提升:一键安装

本地开发

pip install vllm-sr

使用单条 pip 命令即可在数秒内开始使用。该软件包包含了快速启动所需的所有核心依赖项。

配置:安装后,运行 vllm-sr init 以生成默认的 config.yaml。随后在 providers 部分配置您的 LLM 后端。

providers:
  models:
    - name: "openai/gpt-oss-120b"       # Local vLLM endpoint
      endpoints:
        - endpoint: "localhost:8000"
          protocol: "http"
      access_key: "your-vllm-api-key"
    - name: "openai/gpt-4"              # External provider
      endpoints:
        - endpoint: "api.openai.com"
          protocol: "https"
      access_key: "sk-xxxxxx"
  default_model: "openai/gpt-oss-120b"

详情请参阅配置文档

Kubernetes 部署

helm install semantic-router oci://ghcr.io/vllm-project/charts/semantic-router

提供生产就绪的 Helm Charts,包含合理的默认设置和广泛的自定义选项,可帮助您轻松地在 Kubernetes 中部署 vLLM Semantic Router。

仪表板:一个综合性的 Web 控制台,用于管理智能路由策略、模型配置,并提供交互式聊天广场以实时测试路由决策。您可以通过直观的浏览器界面实现可视化路由流、监控延迟分布以及微调分类阈值。

5. 生态系统集成

vLLM Semantic Router v0.1 与更广泛的 AI 基础设施生态系统无缝集成:

推理框架

  • vLLM Production Stack – vLLM 生产部署参考栈,提供 Helm charts、请求路由及 KV 缓存卸载功能。
  • NVIDIA Dynamo – 面向数据中心级分布式推理框架,支持多 GPU、多节点服务及预填充/解码分离。
  • llm-d – 原生 Kubernetes 分布式推理栈,旨在跨加速器(NVIDIA、AMD、Google TPU、Intel XPU)实现 SOTA 性能。
  • vLLM AIBrix – 用于可扩展 LLM 服务的基础设施开源组件。

API 网关

  • Envoy AI Gateway – 基于 Envoy Gateway 构建的统一生成式 AI 服务访问网关,支持多提供商。
  • Istio – 企业级开源服务网格,提供流量管理、安全性和可观测性。

6. MoM(模型混合)家族

我们很荣幸推出 MoM 家族——这是一套专为语义路由构建的、专门的专用模型套件:

模型用途
mom-domain-classifier基于 MMLU 的领域分类
mom-pii-classifierPII 检测与保护
mom-jailbreak-classifier提示词注入检测
mom-halugate-sentinel事实核查分类
mom-halugate-detectorToken 级幻觉检测
mom-halugate-explainer基于 NLI 的解释
mom-toolcall-sentinel工具选择分类
mom-toolcall-verifier工具调用验证
mom-feedback-detector用户反馈分析
mom-embedding-x语义嵌入提取

所有 MoM 模型均针对 vLLM Semantic Router 进行了专门训练和优化,确保在各种路由场景下提供一致的性能。

7. Responses API 支持

我们现在支持 OpenAI Responses API (/v1/responses),并具备内存内对话状态管理功能:

  • 有状态对话:内置状态管理,支持 previous_response_id 链式调用
  • 多轮上下文:自动在对话轮次间保留上下文
  • 路由持续性:在整个对话中维护意图分类历史

这为现代智能体框架和多轮对话应用提供了智能路由支持。

8. 工具选择功能

面向智能体工作流的智能工具管理:

  • 语义工具过滤:在发送至 LLM 前自动过滤不相关的工具
  • 上下文感知选择:考虑对话历史和任务需求
  • 减少 Token 使用:较小的工具目录意味着更快的推理和更低的成本

展望未来:v0.2 路线图

虽然 v0.1 Iris 奠定了坚实的基础,但我们已经为 v0.2 规划了重大增强:

信号-决策架构增强

  • 更多信号类型:从用户查询中提取更多有价值的信号
  • 提高准确率:提升现有信号计算的精度
  • 信号编辑器:设计一个信号组合层,用于复杂的信号提取并提高性能

模型选择算法

基于信号-决策基础,我们正在研究智能模型选择算法:

  • 基于 ML 的技术:KNN, KMeans, MLP, SVM, 矩阵分解
  • 高级方法:Elo 评分, RouterDC, AutoMix, 混合方法
  • 基于图的选择:利用模型关系图
  • 感知规模的路由:根据模型规模与任务复杂度进行优化

开箱即用插件

  • 记忆插件:持久化对话记忆管理
  • 路由器回放:调试和回放路由决策及反馈

多轮对话算法探索

  • Responses API 增强:扩展有状态对话支持,支持 Redis、Milvus 和 Memcached 等可扩展后端。
  • 上下文工程:上下文压缩与内存管理
  • 强化学习驱动的选择:基于用户偏好的 RL 模型选择

MoM 增强

  • 预训练基础模型:更长的上下文窗口以进行信号提取
  • 后训练小型语言模型 (SLM):人类偏好信号提取
  • 模型迁移:用自研替代方案替换现有模型

安全性增强

  • 工具调用越狱检测:防范恶意工具调用
  • 多轮对话保护机制:跨对话会话的安全性
  • 提高幻觉检测准确性:更高精度的幻觉检测

智能工具管理

  • 工具补全:根据意图自动补全工具定义和调用。
  • 高级工具过滤:更复杂的关联性过滤

用户体验与运维

  • 仪表板增强:改进可视化和管理能力
  • Helm Chart 改进:更多的配置选项和部署模式

评估体系

  • 正与 RouterArena 团队合作构建全面的路由器评估框架。

致谢

vLLM Semantic Router v0.1 Iris 代表了一次真正的全球合作。我们衷心感谢来自 Red Hat, IBM Research, AMD, Hugging Face 等组织的贡献。

我们很荣幸欢迎我们不断壮大的提交者社区:

Senan Zedan, samzong, Liav Weiss, Asaad Balum, Yehudit, Noa Limoy, JaredforReal, Abdallah Samara, Hen Schwartz, Srinivas A, carlory, Yossi Ovadia, Jintao Zhang, yuluo-yx, cryo-zd, OneZero-Y, aeft

还要感谢 50 多位帮助使此版本成为现实的贡献者们——谢谢你们!


开始使用

准备好尝试 vLLM Semantic Router v0.1 Iris 了吗?

pip install vllm-sr

加入社区

我们相信智能路由的未来是共同创造的。无论您是寻求将智能路由集成到 AI 基础设施中的企业、探索语义理解新前沿的研究人员,还是热衷于开源 AI 的开发者个人——我们都欢迎您的参与。

贡献方式

  • 组织:与我们合作进行集成,赞助开发或投入工程资源
  • 研究人员:合作发表论文,提出新算法,或帮助进行性能基准测试
  • 开发者:提交 PR,报告问题,改进文档,或构建社区插件
  • 社区成员:分享用例,撰写教程,翻译文档,或帮助回答问题

每一次贡献都很重要——从修复错别字到构建新特性。加入我们,共同塑造下一代语义路由基础设施。

彩虹桥现已开启。欢迎来到 Iris。 🌈