AMD × vLLM 语义路由:共同构建系统智能
简介
在过去的几个月里,AMD 与 vLLM SR 团队一直在合作,旨在将 vLLM 语义路由(VSR)引入 AMD GPU——这不仅仅是一次性能优化,更是我们对人工智能系统架构认知的一次根本性变革。
AMD 一直是 vLLM 社区的长期技术合作伙伴,从加速 AMD GPU 和 ROCm™ 软件上的 vLLM 推理引擎,到如今共同构建 AI 技术栈的下一层:模型混合(MoM)系统的智能路由与治理。
随着 AI 从单一模型向多模型架构演进,挑战不再是“你的模型有多大”,而是你如何智能且安全地协同调度多个模型。VSR 旨在成为这一新时代的智能控制平面——根据语义理解做出路由决策,执行安全策略,并在系统扩展至 AGI(通用人工智能)水平时保持系统的可信度。

此次合作聚焦于三大战略支柱
- 基于信号的路由:利用关键词匹配、领域分类、语义相似度和事实核查,实现 Multi-LoRA 和多模型部署的智能请求路由。
- 跨实例智能:通过集中式响应存储和语义缓存,实现各 vLLM 实例间的状态共享与优化。
- 安全护栏与治理:从 PII(个人身份信息)检测、防越狱到幻觉检测和对齐执行,提供企业级安全性。
我们与 AMD 携手合作,不仅要让 VSR 在 AMD GPU 上高效运行,还要建立可信、可治理的 AI 基础设施新标准。
转型:从单一模型到模型混合(Mixture-of-Models)
在模型混合的世界里,企业级 AI 栈通常包括
- 路由器 SLM(小型语言模型):用于分类、路由和策略执行
- 多个 LLM 与领域专用模型(例如:代码、金融、医疗、法律)
- 工具、RAG 流水线、向量搜索与业务系统
如果没有稳健的路由层,这就成了一个晦涩且脆弱的网格。AMD × VSR 的合作旨在让路由成为一流的、GPU 加速的基础设施组件——而不是粘合在各个服务之间、即兴编写的脚本。
VSR 核心能力
1. 面向 Multi-LoRA 部署的基于信号的路由
VSR 提供了多种路由策略以适配不同的应用场景
- 关键词路由:简单的模式匹配,实现快速、确定的路由。
- 领域分类:使用训练好的分类器进行意图感知适配器选择。
- 基于嵌入的语义相似度:基于深度语义理解的细粒度路由。
- 事实核查与验证路由:将高风险查询路由至专业的验证流水线。
2. 跨实例智能
VSR 实现了各 vLLM 实例间的状态共享与优化
- 响应 API:集中式响应存储,支持有状态的多轮对话。
- 语义缓存:通过跨实例向量相似度匹配,显著减少 Token 消耗。
3. 企业级安全护栏
从单轮到多轮对话,VSR 提供
- PII 检测:防止敏感信息泄露。
- 防越狱:拦截恶意的提示词注入尝试。
- 幻觉检测:核实关键领域的响应可靠性。
- 超级对齐:确保 AI 系统在向 AGI 能力扩展的过程中,始终与人类价值观和意图保持一致。
在 AMD GPU 上运行 VSR:两条部署路径
我们的短期目标侧重于落地执行:交付能够在 AMD GPU 上高效运行的生产级 VSR 解决方案。我们正在构建两条互补的部署路径:

路径 1:基于 vLLM 的 AMD GPU 推理
在 AMD GPU 上使用 vLLM 引擎,我们运行
路由器 SLM 用于
- 任务与意图分类
- 风险评分与安全门控
- 工具与工作流选择
LLM 与专用模型用于
- 通用辅助
- 领域特定任务(金融、法律、代码、医疗)
VSR 作为决策基准层(Decision Fabric)位于上方,整合语义相似度、业务元数据、延迟限制和合规性要求,从而在模型与端点之间执行动态路由。
AMD GPU 提供了在同一集群中运行 SLM 路由 + 多个 LLM 所需的吞吐量和显存容量,能够支持高 QPS 且延迟稳定的工作负载,而不仅仅是简单的演示。
路径 2:轻量级 ONNX 路由
并非所有的路由都需要完整的推理栈。对于位于系统“前门”的超高频、延迟敏感环节,我们正在实现
- 将 SLM 路由导出至 ONNX
- 通过 ONNX Runtime 在 AMD GPU 上运行
- 将复杂的生成任务转发给 vLLM 或其他后端 LLM
这一轻量级路径专为以下场景设计
- 流量漏斗前端的分类与分流
- 大规模策略评估与离线实验
- 希望标准化 AMD GPU 同时保持模型提供商灵活性的企业
迈向语义路由的新阶段
当我们最初构建 vLLM 语义路由时,目标非常明确且实用:智能模型选择——根据任务类型、成本限制和性能要求,将请求路由至合适的模型。

vLLM 引擎提供了基础——稳定且高效地运行大型模型。vLLM 语义路由提供了调度器——将请求分配到合适的能力模型。
但随着 AI 系统迈向 AGI 水平,这一框架显得不够完整。这就像只谈论引擎效率,却不考虑刹车、交通法规或安全系统。
真正的挑战不在于让模型变得更强大,而在于当它们变得强大时如何保持控制。
从模型调度器到智能判断器
与 AMD 的合作,让我们对语义路由的演进有了不同的看法。其潜力不仅在于“路由”,更在于治理——从交通指挥员转型为 AGI 时代的智能控制平面。
这种转变改变了我们对合作的理解。我们不仅是在优化 AMD 硬件上的吞吐量和延迟。我们正在为 AI 系统构建一个宪法层——一个由责任而非仅仅功能定义的层级。
必须加固的三条控制生命线
随着我们基于 AMD 基础设施架构 VSR,我们正围绕三个关键控制点进行设计,这些点决定了 AI 系统在规模化时是否能保持可信度

1. 世界输出(动作)
强大模型最危险的能力并非推理,而是执行。每一个改变世界的动作(工具调用、数据库写入、API 调用、配置更改)在执行前都必须经过外部检查点。
通过 AMD GPU,我们可以在生产规模下在线运行这些检查点——在不成为瓶颈的情况下评估风险、执行策略并记录决策。
2. 世界输入(输入)
外部输入默认是不可信的。网页、检索结果、上传的文件和插件返回结果都可能携带提示词注入、数据投毒或提权尝试。
在 AMD 基础设施上的 VSR 提供了边界检查,在数据到达模型前进行预处理——作为第一道防线运行分类器、清理器和验证检查,而不是作为事后补救措施。
3. 长期状态(内存/状态)
最难修复的错误不是错误的回答,而是写入长期记忆、系统状态或自动化工作流中的错误回答。
我们的合作重点是将状态管理视为一流的关切点:谁可以写入、可以写入什么、如何撤销以及如何隔离污染。AMD 的 GPU 基础设施使我们能够运行持续验证和回滚机制,从而确保状态在长期内保持可信。
终极问题
当这三条生命线得到保障时,语义路由就不再仅仅是模型选择器。它成了回答一个根本问题的关键
我们如何将对齐(Alignment)从训练时的期望转变为运行时的制度?
这就是 AMD × vLLM 语义路由合作的真正意义:不仅要构建更快的路由,还要构建可信、可治理、能够安全扩展至 AGI 水平的 AI 基础设施。
长期愿景与持续工作
我们与 AMD 的合作不仅限于近期的部署,更是为了构建下一代 AI 基础设施的基础。我们正在推进几项长期计划
在 AMD GPU 上训练下一代路由模型
作为长期目标,我们计划在 AMD GPU 上探索训练一种基于仅编码器(Encoder-only)架构的下一代路由模型,针对语义路由、检索增强生成(RAG)和安全分类进行优化。
尽管近期的编码器模型(例如 ModernBERT)表现出色,但在上下文长度、多语言覆盖以及与新兴长上下文注意力技术的对齐方面仍有局限。此项工作将利用 AMD 硬件推进编码器能力,特别是针对长上下文、高吞吐量的表征学习。
最终成果将是一个开源的编码器模型,旨在与 vLLM 语义路由及现代 AI 流水线集成,在增强 AI 系统检索和路由层的同时,为社区和行业提供硬件多样化的训练与部署选择。
AMD 基础设施上的社区公开测试版
作为此次合作的一部分,vLLM 语义路由的每一个重要版本都将配备一个公开测试环境,托管在 AMD 赞助的基础设施上,并免费提供给社区使用。
这些公开测试版将允许用户
- 验证新的路由、缓存和安全功能
- 获得在 AMD GPU 上运行语义路由的实践经验
- 提供早期反馈,助力改进性能、可用性和系统设计
通过降低实验和验证门槛,该计划旨在加强 vLLM 生态系统,加速实际落地,并确保新的语义路由能力在更广泛的生产部署前得到社区反馈的打磨。
AMD GPU 驱动的 CI/CD 与端到端测试平台
从长远来看,我们旨在利用 AMD GPU 作为 VSR 这一开源项目构建、验证和发布的底层支撑,确保随着项目的成长,VSR 能在 AMD GPU 上始终保持一致的优异表现。
我们正在设计一个基于 GPU 的 CI/CD 与端到端测试平台,其中
- SLM 路由、LLM、领域模型、检索和工具均在 AMD GPU 集群上协同运行
- 多领域、多风险水平的数据集被回放作为测试流量
- 每一次 VSR 变更都会经过自动化评估流水线,包括
- 路由与策略回归测试
- 新旧策略的 A/B 对比
- 延迟、成本和可扩展性的压力测试
- 针对幻觉缓解与合规行为的专项测试套件
目标状态非常明确
每一个 VSR 版本都将附带一份可复现的、基于 GPU 运行的评估报告,而不仅仅是更新日志。
在这种模式下,AMD GPU 不仅用于提供模型服务;它们还是路由基础设施本身的验证引擎。
AMD 支持的模型混合(Mixture-of-Models)演练场
与此同时,我们正计划一个由 AMD GPU 驱动的在线模型混合(Mixture-of-Models)演练场,向社区和合作伙伴开放。
该演练场将允许用户
- 在实际工作负载下尝试不同的路由策略和模型拓扑
- 直观地观察 VSR 如何决定调用哪个模型、何时检索、以及何时应用额外的检查或回退机制
- 对比不同配置下的质量、延迟与成本权衡
对于模型厂商、工具构建者和平台提供商,这将成为一个中立的、基于 AMD GPU 的测试环境,以
- 将他们的组件集成到 MoM 栈中
- 在现实的路由和治理约束下进行基准测试
- 在一个透明、可观测的系统中展示能力
此次合作的意义
通过 AMD × vLLM 语义路由的合作,我们的目标不仅仅是“让模型在这个 GPU 上运行”。
我们的共同抱负是
- 定义一套智能、GPU 加速的路由参考架构,基于 AMD 平台,包括
- vLLM 推理路径,
- 基于 ONNX 的轻量级路由路径,
- 多模型协同与安全执行。
- 将路由视为可信的基础设施,由以下方式支撑:
- 基于 GPU 的 CI/CD 与端到端评估,
- 具备幻觉感知与风险感知的策略,
- 在线学习与自适应策略。
- 为生态系统提供一个长期的、基于 AMD GPU 的 MoM 演练场,在此,想法、模型和路由策略可以在开放的环境中被测试和演进。
简而言之,这关乎共同构建可信、可演进的多模型 AI 基础设施——以 AMD GPU 作为核心执行与验证层,以 vLLM 语义路由作为智能控制平面,使整个系统变得可理解、可治理,并为实际工作负载做好准备。
技术路线图——幻觉检测、在线学习、多模型编排——都服务于这一宏大使命。AMD 的硬件提供了执行层,VSR 提供了控制层。我们正共同构建 AI 系统,使其不仅仅依赖希望,而是通过架构保持对齐。
致谢
我们要感谢为此次合作做出贡献的许多才华横溢的人们
- AMD:Andy Luo, Haichen Zhang 以及 AMD AIG 团队。
- vLLM SR:Xunzhuo Liu, Huamin Chen, Chen Wang, Yue Zhu 以及 vLLM 语义路由开源团队。
我们非常期待在未来的日子里不断完善和扩展我们的优化方案,释放出更大的潜力!
加入我们
寻求合作!呼吁所有充满激情的社区开发者和研究人员:加入我们,在 AMD GPU 上训练下一代路由模型,共同构建可信 AI 基础设施的未来。
感兴趣?请通过以下方式联系我们
- Haichen Zhang: haichzha@amd.com
- Xunzhuo Liu: xunzhuo@vllm-semantic-router.ai
资源:
参与讨论:在 vLLM Slack 的 #semantic-router 频道分享您的用例和反馈