信号决策驱动架构:重塑大规模语义路由

阅读时间 14 分钟
vLLM Semantic Router 团队

早期版本的 vLLM 语义路由依赖于基于分类的路由,这是一种简单直接的方法:将用户查询分类到 14 个 MMLU 领域类别之一,然后路由到相应的模型。虽然这适用于基础场景,但我们在为企业构建生产级 AI 系统时,很快发现了它的局限性。

考虑这个现实场景:用户问:“我需要紧急帮助审查我的身份验证代码中的安全漏洞。” 基于分类的路由会将其识别为“计算机科学”查询并将其路由到通用的编码模型。但它忽略了关键的上下文:

  • 需要立即处理的紧急程度信号
  • 需要专业知识和防越狱保护的安全敏感性
  • 受益于推理能力的代码审查意图
  • 需要仔细分析的身份验证复杂性

这个单一例子揭示了根本的约束:基于分类的路由仅捕捉了用户意图的一个维度——领域,而忽略了自然语言查询中嵌入的丰富、多维的信号。

今天,我们引入了信号-决策架构——对语义路由的全面重构,它支持从 14 个固定类别扩展到无限的智能路由决策。这种新架构结合了多维信号提取、具有 AND/OR 运算符的灵活决策逻辑以及内置的插件编排,以提供生产就绪的语义智能。

问题:为什么基于分类的路由无法扩展

之前的 vLLM 语义路由架构遵循一个简单的流水线:

User Prompt → MMLU Domain Classification → Model Selection

这种方法有几个根本性的限制,使其无法扩展以满足企业需求。

单维度分析

基于分类的路由仅考虑查询的领域主题。它无法捕捉:

  • 紧急信号:“紧急”、“立即”、“关键”
  • 安全敏感性:“漏洞”、“利用”、“入侵”
  • 意图类型:代码审查、架构设计、故障排查
  • 复杂性级别:简单 FAQ 与复杂推理任务
  • 合规性要求:PII 处理、监管约束

实际影响:关于“紧急患者数据泄露”的医疗查询被路由到医疗模型,但缺乏 PII 保护和安全过滤——可能违反 HIPAA 合规性。

固定类别限制

仅限于 14 个预定义的 MMLU 类别(数学、物理、计算机科学、商业等),因此无法:

  • 为特定业务领域创建自定义类别
  • 在领域内定义细粒度的路由规则
  • 超出学术主题分类的范畴

实际影响:拥有 50 多个专业用例(法律合同、金融合规、医疗诊断、代码安全审计)的企业无法在 14 个类别中表达其路由需求。

逻辑不灵活

无法组合多个条件或实现复杂的路由策略

  • 不支持 AND/OR 逻辑:“仅在查询既紧急又与安全相关时路由到专家模型”
  • 当多个条件匹配时,没有基于优先级的选择
  • 不支持基于信号组合的条件插件应用

实际影响:无法实现分层路由策略,例如“高优先级安全问题获得推理+防越狱保护,而常规问题获得缓存响应。”

引入信号-决策架构

信号-决策架构通过将信号提取与路由决策分离,并引入具有内置插件编排功能的灵活决策引擎,从根本上重构了语义路由。

架构概览

新架构引入了三个关键创新:

  1. 多信号提取:同时捕捉用户意图的多个维度
  2. 决策引擎:使用灵活的 AND/OR 逻辑和基于优先级的选择组合信号
  3. 插件链:为缓存、安全和优化提供内置智能

完整的请求流程

核心概念

信号:多维度提示词分析

信号-决策架构不再仅依赖领域分类,而是从每个用户查询中提取三种互补的信号类型。每种信号类型利用不同的 AI/ML 技术,并在路由决策过程中发挥不同的作用。

关键词信号:可解释的模式匹配

关键词信号使用基于正则表达式的模式匹配来检测用户查询中的特定术语或短语。这种方法提供了人类可理解的路由逻辑——通过检查关键词,您可以轻松理解查询为何匹配特定规则。

技术实现:

  • 编译后的正则表达式模式以实现高效匹配
  • 支持 AND/OR 布尔运算符
  • 区分大小写和不区分大小写模式
  • 无需模型推理(零 ML 开销)

主要优势 - 可解释性:与黑盒 ML 模型不同,关键词信号提供了完全的透明度。在调试路由决策时,您可以追踪到底哪些关键词触发了哪些规则。这对合规性审计和排查生产问题至关重要。

用例:

  • 检测紧急标记:“紧急”、“立即”、“ASAP”、“关键”
  • 识别安全关键词:“漏洞”、“利用”、“入侵”、“CVE”
  • 标记合规术语:“HIPAA”、“GDPR”、“PII”、“机密”
  • 识别意图模式:“代码审查”、“架构设计”、“故障排查”

嵌入信号:可扩展的语义理解

嵌入信号使用神经嵌入模型计算用户查询与候选短语之间的语义相似度。这种方法提供了可扩展的语义匹配,能够理解超出精确关键词匹配的意图。

技术实现:

  • 候选短语的预计算嵌入(离线)
  • 使用轻量级模型进行运行时查询嵌入(例如 sentence-transformers)
  • 具有可配置阈值的余弦相似度计算
  • 多种聚合策略:最大值(任意匹配)、平均值(平均相似度)、任意(基于阈值)

主要优势 - 可扩展性:基于嵌入的匹配可以高效地扩展到数千个候选短语。添加新的路由模式不需要重新训练模型——只需添加新的候选短语并计算它们的嵌入。这实现了针对特定业务领域的快速迭代和定制。

用例:

  • 意图理解:“我需要帮助” → “技术支持请求”
  • 释义匹配:“我怎么修复这个 Bug?” ≈ “调试协助”
  • 跨语言路由:语义相似度通过多语言嵌入跨语言工作
  • 模糊匹配:处理错别字、缩写和非正式语言

领域信号:数据集驱动的分类

领域信号使用 MMLU 训练的分类模型来识别用户查询的学术或专业领域。这种方法提供了数据集驱动的领域专业知识,并支持自定义领域扩展。

技术实现:

  • 在 MMLU 数据集(14 个基础类别)上微调的分类模型
  • 通过 LoRA 适配器支持自定义领域扩展
  • 针对跨多个领域的查询的多标签分类
  • 领域预测的置信度评分

主要优势 - 通过 LoRA 进行扩展性:虽然基础模型涵盖了 14 个 MMLU 类别,但企业可以训练轻量级 LoRA 适配器来添加私有领域类别,而无需重新训练整个模型。例如:

  • 医疗保健:添加“医学成像”、“临床试验”、“药物研究”
  • 金融:添加“风险建模”、“算法交易”、“监管合规”
  • 法律:添加“合同法”、“知识产权”、“诉讼支持”

这使组织能够将领域分类扩展到其特定垂直领域,同时保持基础模型的通用知识。

用例:

  • 路由到领域特定的专家模型(数学查询 → 数学专家)
  • 应用领域适当的政策(医疗查询 → PII 保护)
  • 选择专门的知识库(法律查询 → 法律文档检索)
  • 触发领域特定的插件(代码查询 → 语法验证)

信号对比

信号类型技术可解释性可扩展性可扩展性(功能)
关键词正则匹配高(透明规则)中(手动模式)手动添加
嵌入神经嵌入低(黑盒相似度)高(数千短语)动态添加短语
领域MMLU + LoRA中(领域标签)中(14+ 类别)用于自定义领域的 LoRA 适配器

为什么需要三种信号类型?

这三种信号类型是互补的,而不是冗余的:

  • 关键词信号为已知模式提供快速、可解释的匹配
  • 嵌入信号处理语义变化并扩展到大型短语集
  • 领域信号利用学术数据集并启用领域特定专业知识

通过结合这三者,信号-决策架构同时捕捉用户意图的多个维度,实现了比任何单一信号类型更复杂的路由逻辑。

决策:灵活的路由逻辑

决策是核心路由规则,它们使用 AND/OR 逻辑组合多个信号,以确定模型选择和插件配置。

决策结构

每个决策包含:

信号组合:组合多个信号条件的 AND/OR 逻辑

  • AND:所有条件必须匹配(高精度)
  • OR:任何条件匹配(高召回率)

优先级:用于冲突解决的整数值(当多个决策匹配时)

  • 高优先级获胜
  • 实现分层路由策略

模型引用:指定使用哪个模型(以及可选的 LoRA 适配器)

  • 支持带有领域特定 LoRA 适配器的基础模型
  • 配置推理模式和努力程度

插件链:要应用的插件的有序列表

  • 用于成本优化的语义缓存
  • 用于安全的防越狱检测
  • 用于合规性的 PII 保护
  • 用于行为控制的系统提示词注入
  • 用于元数据传播的标头修改

决策评估流程

当多个决策匹配时,系统选择优先级最高的决策。如果没有决策匹配,系统将回退到默认模型。

插件:内置智能

该架构包含五个内置插件,可以针对每个决策进行配置:

插件用途关键功能
semantic-cache缓存相似查询可配置相似度阈值,成本优化
jailbreak检测提示词注入攻击基于阈值的检测,请求拦截
pii保护敏感信息编辑/哈希/掩码模式,GDPR/HIPAA 合规
system_prompt注入自定义指令替换或插入模式,角色自定义
header_mutation修改 HTTP 标头添加/更新/删除标头,元数据传播

插件按配置顺序执行,每个插件都可以修改请求、阻塞执行或为下游处理添加元数据。

插件链执行流程

从 14 个扩展到无限

信号-决策架构消除了固定类别的根本约束。它是如何扩展的:

传统方法(受限)

14 MMLU Categories → 14 Routing Rules → 14 Model Selections

约束:

  • 无法创建自定义类别
  • 无法组合多个条件
  • 无法为每个规则应用不同的政策
  • 无法超越领域分类进行扩展

信号-决策方法(无限)

3 Signal Types × N Conditions × AND/OR Logic → Unlimited Decisions

能力:

  • 创建无限自定义路由规则
  • 使用灵活逻辑组合多个信号
  • 每个决策应用独特的插件链
  • 扩展到企业级复杂性

可扩展性示例

考虑一个企业 IT 支持系统:

传统路由:仅限于 14 个基于领域的路由

  • “计算机科学” → 代码模型
  • “工程” → 工程模型
  • (12 个更多固定类别)

信号-决策路由:数百个专门路由

  • 紧急 + 安全 + 计算机科学 → 安全专家 + 推理 + 防越狱
  • 代码审查 + 高复杂性 → 架构模型 + 推理
  • FAQ + 常规 → 缓存模型 + 语义缓存
  • 医疗 + 检测到 PII → 医疗专家 + PII 保护 + 免责声明
  • 法律 + 机密 → 法律专家 + PII 哈希 + 审计标头
  • (数百个更多自定义组合)

每个决策都可以拥有独特的模型选择、推理配置和插件链——实现大规模的细粒度控制。

Kubernetes 原生设计

信号-决策架构专为云原生环境设计,具有两个自定义资源定义 (CRD):

完整示例:企业 IT 支持系统

让我们通过一个完整的示例来展示 IntelligentPool 和 IntelligentRoute 如何协同工作以构建企业 IT 支持路由系统。

IntelligentPool:定义模型池

首先,我们定义可用的模型及其 LoRA 适配器:

此池定义了:

  • 具有 4 个专业 LoRA 适配器的基础模型“qwen3”
  • 用于非专业查询的后备“qwen3”模型
  • 每个模型的推理系列配置

IntelligentRoute:定义路由逻辑

接下来,我们定义具有多信号提取的路由决策:

此配置展示了:

多信号提取:

  • 3 个关键词信号(紧急、安全、代码审查)
  • 2 个嵌入信号(技术支持、架构设计)
  • 1 个领域信号(计算机科学)

分层决策逻辑:

  • 优先级 100:紧急 + 安全 + 计算机科学 → 安全专家 + 高推理 + 防越狱 + PII 保护
  • 优先级 80:代码审查 + 计算机科学 → 代码评审员 + 中推理 + 缓存 + 自定义提示词
  • 优先级 60:架构设计 + 计算机科学 → 架构专家 + 高推理 + 缓存
  • 优先级 40:通用支持 → 基础模型 + 积极缓存

插件编排:

  • 安全关键型查询获得防越狱检测和 PII 保护
  • 代码审查获得语义缓存和自定义系统提示词
  • 架构查询获得更长的缓存 TTL(2 小时 vs 1 小时)
  • 常规查询获得积极缓存(0.90 阈值,4 小时 TTL)

后备行为:

  • 如果没有决策匹配,路由到默认模型(“general-assistant”)
  • 如果多个决策匹配,选择优先级最高的

动态配置流程

Kubernetes 原生设计实现了:

  • 零停机配置更新
  • 用于变更管理的 GitOps 工作流
  • 多集群部署策略
  • 基于命名空间的隔离和 RBAC

实际应用场景

企业 IT 支持

挑战:根据紧急程度、技术领域和安全敏感性路由支持票据。

解决方案:具有基于优先级选择的多层决策

  • 优先级 100:紧急 + 安全 + CS → 安全专家 + 推理 + 防越狱
  • 优先级 80:技术支持 + 调试 → 代码专家 + 语义缓存
  • 优先级 60:常规问题 → 常规模型 + 积极缓存

结果:适当的模型选择,通过缓存进行成本优化,对敏感问题的安全保护。

医疗保健平台

挑战:HIPAA 合规性要求 PII 保护和医疗免责声明。

解决方案:带有强制合规性插件的基于领域的路由

  • 健康领域 → 医疗专家 + PII 编辑 + 免责声明提示词 + 审计标头

结果:自动 PII 保护,一致的免责声明,合规性审计跟踪。

金融服务

挑战:具有 PII 保护、防越狱检测和成本优化的多层安全性。

解决方案:用于财务查询的全面插件链

  • 经济领域 → 金融专家 + 防越狱 + PII 哈希 + 免责声明 + 缓存 + 合规标头

结果:企业级安全、监管合规、成本效率。

教育平台

挑战:基于主题和学习意图的个性化学习体验。

解决方案:带有定制教学风格的基于意图的路由

  • 数学 + 学习意图 → 数学专家 + 推理 + 耐心导师提示词 + 缓存
  • 科学 + 教程 → 科学专家 + 引人入胜的教育者提示词

结果:个性化的教学方法,针对复杂主题的适当推理,成本优化。

代码助手

挑战:不同的复杂性级别需要不同的模型能力。

解决方案:具有推理控制的复杂性感知路由

  • 架构设计 → 推理模型 + 高努力 + 复杂性标头
  • 代码审查 → 代码专家 + 中等推理 + 缓存
  • 简单问题 → 代码专家 + 仅缓存

结果:最佳模型选择,经济高效的推理使用,简单查询的快速响应。

未来规划

信号-决策架构为跨多个维度的未来增强提供了基础:

路由核心性能优化

用于关键词匹配的基数树:用基数树数据结构替换基于正则的关键词匹配,以实现数千个关键词模式的更快匹配。这将使企业能够以一致的性能定义 10,000+ 个关键词规则。

用于嵌入搜索的 HNSW 索引:实现分层可导航小世界 (HNSW) 图,用于嵌入空间中的近似最近邻搜索。这将显着提高嵌入信号的性能,同时支持数百万个候选短语。

用于仅解码模型的并行 LoRA:在解码阶段启用多个 LoRA 适配器的并行执行,允许单个基础模型同时为多个专业领域服务。这将减少模型切换开销并提高多租户部署的吞吐量。

功能增强

可视化配置控制台:基于 Web 的 UI,用于创建和管理决策而无需 YAML 编辑,具有实时验证和测试功能。

自定义插件框架:用于开发带有社区市场的自定义插件的 SDK,使企业能够构建领域特定的智能层。

高级分析:实时监控决策性能、信号有效性和成本优化机会,并提供 ML 驱动的建议。

通过多轮对话进行模型评估:通过多轮对话评估进行智能模型选择。系统自动让多个候选模型参与并行对话,使用 LLM-as-a-Judge 评估跨维度(如连贯性、相关性、安全性和领域专业知识)的响应质量。这实现了基于实际模型性能而非静态规则的动态路由优化。

意图感知内部/外部模型选择:根据意图分析,在内部私有模型和外部 API(OpenAI、Anthropic 等)之间进行智能路由。敏感数据和专有信息自动路由到内部模型以实现隐私和合规性,而常规查询则利用外部 API 以获取更广泛的知识。成本、延迟和合规性要求根据查询特征动态平衡。

总结

信号-决策架构代表了我们对语义路由思考方式的根本转变。通过从固定分类转向基于信号的灵活决策,我们实现了:

无限可扩展性:从 14 个类别到无限的自定义路由规则

多维智能:同时捕捉关键词、嵌入和领域信号

灵活逻辑:使用 AND/OR 运算符和基于优先级的选择组合信号

内置安全:用于防越狱检测、PII 保护和合规性的集成插件

云原生设计:具有动态配置和零停机更新的 Kubernetes CRD

无论您是在构建企业 AI 网关、多租户 SaaS 平台还是特定行业的 AI 助手,信号-决策架构都能为生产部署提供所需的可扩展性、灵活性和智能。

入门指南

准备好尝试信号-决策路由了吗?

加入我们的社区,分享您的反馈并向其他正在大规模构建智能路由系统的用户学习。