
大家读完觉得有帮助记得关注和点赞摘要随着GPU部署分散在地理上隔离的站点单集群LLM推理路由的底层假设以可测量且可预测的方式失效。现有方案——包括集群内路由器NVIDIA Dynamo、vLLM Router、学术研究跨区域负载均衡器SkyWalker和异构放置求解器Helix——要么局限于单个数据中心边界内要么假设副本同构要么缺乏实时硬件遥测。我们提出了对Solyx AI地理分布式推理矩阵“Solyx AI Grid”的双阶段实证研究这是一个跨站点推理路由控制平面通过包含10种信号的加权压力评分器将GPU硬件遥测DCGM、vLLM应用指标和实时网络信号RTT、抖动整合进针对地理分布式GPU集群的逐请求放置决策中。第一阶段2026年4月在美国三个数据中心的六块NVIDIA H100和H200 SXM GPU上部署采用三种集群配置同构、硬件异构和能力错配。第二阶段2026年5月在美国三个数据中心的九块NVIDIA RTX PRO 6000 Blackwell SE GPU上部署在一个216单元的SLO矩阵上测试了八类LLM工作负载。在两阶段实验中Solyx AI Grid均表现出在同构H100集群上降低27.9%的P99尾延迟在完全由实时遥测驱动的异构集群中实现134:1的流量向健康端点集中将能力错配泄漏率降至0.43%而轮询调度Round-Robin为32.11%、最少请求Least-Request为28.71%从而获得99.57%的长提示词成功率轮询调度为67.89%最少请求为71.29%在所有八类工作负载的第二级SLO下实现1.56–1.75倍的吞吐量故障转移P99延迟为1,247毫秒而轮询调度为4,226毫秒在WAN抖动下降低27.8%的P95首令牌时间TTFT在DCGM导出器实时故障时保持99.90%的成功率。在所有配置下控制平面的路由更新开销均为0.2毫秒。我们进一步发现DCGM硬件信号平均比应用层SLO违规提前11.2秒发出预警从而能在对用户造成延迟影响前主动排空流量。据我们所知这是首个结合DCGM硬件遥测、vLLM应用指标和主动WAN RTT/抖动信号的真实物理多站点LLM推理路由公开实证研究。我们刻画了多站点推理特有的三种故障模式并表明硬件遥测感知路由能以具体、可衡量的改进应对每一种模式。1 引言大语言模型LLM部署的推理层经历了快速的架构演变。早期生产系统依赖于简单负载均衡器背后的同构GPU单集群而GPU采购的经济性迫使现实发生改变许多运营商现在拥有或租赁分布在多个地理位置分散站点的算力这些站点具有不同的硬件代际、变化的站点间网络条件且在推理引擎之上没有协调层。这种碎片化催生了一类现有系统无法解决的路由问题。集群内路由器如NVIDIA Dynamo [1] 和 vLLM Router [2] 在单个数据中心边界内运行无法观测远程站点的状况。跨区域负载均衡器如SkyWalker [3] 将路由扩展到区域层面但假设副本同构且不消费硬件遥测。异构放置求解器如Helix [4] 通过最大流混合整数规划MILP联合优化模型放置和调度但运行在静态拓扑上并非为跨地理隔离站点的连续逐请求决策而设计。值得注意的是即使是生产中最常用的主动负载均衡策略——最少请求在能力错配条件下也会失效失败的请求返回很快降低了飞行中计数从而主动将更多流量吸引到已损坏的端点。缺失的是一个位于推理引擎之上、跨越站点边界、并纳入对路由质量至关重要的硬件和网络信号的控制平面。没有这一层多站点GPU集群会表现出一组特征性的故障模式能力错配泄漏、网络抖动下的尾延迟放大以及故障转移期间的冷启动级联。本文介绍了对跨站点推理路由控制平面Solyx AI Grid的双阶段实证研究。我们的贡献如下多站点推理规模特有故障模式的分类能力错配泄漏、网络抖动诱发的尾延迟以及故障转移期间的冷启动级联。一种10信号硬件遥测感知路由架构的描述将GPU硬件指标DCGM、vLLM应用指标和实时网络信号RTT、抖动整合进逐请求放置决策。来自两个独立阶段的实证结果六块GPU跨美国三个数据中心H100/H200 SXM2026年4月和九块GPU跨美国三个数据中心RTX PRO 6000 Blackwell SE2026年5月覆盖八类工作负载的216单元SLO矩阵、七个不同的评估阶段以及所有三种已识别的故障模式。一项新颖的实证发现DCGM硬件遥测信号平均比应用层SLO违规提前11.2秒使得能在对用户造成延迟影响前主动排空流量。据我们所知这是首个在真实物理多站点基础设施上量化此领先时间的公开研究。对Solyx相比最少请求无 measurable 优势的边界条件的诚实刻画以及当前研究的明确局限性。2 背景与动机2.1 多站点推理部署的现实超大规模云厂商拥有足够的集中容量可在单个数据中心结构内运行推理。对于中型GPU云运营商、主权AI提供商和企业平台团队而言采购现实则不同。GPU供应限制、电力基础设施限制以及跨地域的延迟目标导致部署分散在多个物理隔离的站点——每个站点运行独立的推理引擎实例——且没有共享的协调层。在此模式下每个站点都是一个孤岛请求被路由到本地推理副本而不知晓其他地方的状况。当一个站点饱和时请求排队或失败而非重定向到另一个站点的可用容量。2.2 标准路由策略为何在多站点规模下失效轮询调度Round-Robin 对GPU无感知它均匀分发请求无法看见GPU状态、队列深度、能力约束或网络条件。在同构集群上当连续请求落到某个正在处理慢速生成的副本时会产生队列堆积导致的尾延迟尖峰。在异构集群上它将H200与受限的H100同等对待。在能力错配下它会无限期地将三分之一流量发送到已损坏的端点。最少请求Least-Request 在大多数条件下优于轮询调度但并未解决能力错配故障模式。因为失败的请求立即返回HTTP 400损坏端点的飞行中计数会迅速下降因此负载感知启发式会将其视为轻负载并继续将流量导向它。理论风险在于这种反馈循环会将流量集中在故障端点上在我们的第二阶段评估中这种影响没有最坏情况那么严重但仍使最少请求几乎与轮询调度一样暴露在相同条件下其泄漏率为28.71%接近轮询调度的32.11%而Solyx仅为0.43%。关键在于仅靠负载感知——没有错误率信号——无法解决能力错配问题。2.3 多站点规模下的故障模式能力错配泄漏。副本可能通过/health健康检查但由于max_model_len约束、数据类型不匹配、vLLM版本偏差或CUDA驱动不兼容而拒绝部分请求。这些条件在滚动升级期间、混合模型变体的集群中或不同时间配置的节点间很常见。标准健康检查对此类故障视而不见。抖动下的尾延迟放大。跨站点路由引入了WAN路径变异性这是集群内系统未设计处理的。TTFT的下限受限于网络往返时间网关与推理副本间路径上的抖动直接推高P95和P99延迟。没有网络信号感知的路由决策会将请求分发到高抖动路径无论路径质量如何。故障转移期间的冷启动级联。当副本故障时被重定向的请求可能到达另一个尚未预热站点的副本。如果没有生命周期状态感知故障转移目标会在其加载阶段接收请求级联导致性能下降直到副本达到就绪服务状态。3 相关工作3.1 集群内推理路由NVIDIA Dynamo [1] 是一个开源分布式推理框架包含KV缓存感知路由器和SLO规划器用于多节点部署。vLLM Router [2] 于2025年12月发布通过Kubernetes或裸金属集群内的一致性哈希提供KV缓存感知路由。两者都假设副本间网络同构且不包含硬件遥测。SGLang的路由器和llm-d [5] 同样在单集群内运行。Kubernetes Gateway API推理扩展 [6] 提供网关级路由但范围限于单个Kubernetes集群。3.2 跨区域负载均衡SkyWalker (Xia et al., 2025) [3] 是最接近的学术先前工作代表了迄今为止对跨区域推理路由问题最严格的公开刻画。它是一个研究原型——而非可部署系统——构建在SkyServe研究服务框架之上源自Sky Computing小组。SkyWalker通过昼夜负载变化下的跨区域流量卸载解决了区域本地配置的成本低效问题提供了KV缓存局部性保持路由一致性哈希、多区域前缀树并报告相比区域本地基线实现了1.12–2.06倍的吞吐量提升和1.74–6.30倍的延迟降低成本降低25%。由于SkyWalker是学术原型其评估是在模拟多区域工作负载而非物理硬件上进行的。我们的工作在另外三个方面有所不同SkyWalker假设副本同构没有GPU级硬件状态感知它不将RTT或抖动作为连续路由输入并且未在具有真实WAN路径的真实多站点部署上验证。我们将SkyWalker视为系统研究界已认识到跨站点路由问题重要性的证据并将我们的贡献定位为在该问题类别上基于物理多站点基础设施的首次实证验证。3.3 异构放置Helix (Mei et al., ASPLOS 2025) [4] 将有向加权图上的最大流问题形式化用于异构集群上的LLM服务使用MILP联合优化模型放置和请求调度。在24–42个GPU节点集群上评估Helix实现了最高3.3倍的吞吐量和最高66%的提示延迟降低。Helix是一个离线放置优化器而非在线逐请求路由器运行在单个固定拓扑集群上并非为连续的跨站点路由决策而设计。HexGen [7] 和 HexGen-2 [8] 使用连接集群内的非对称分区解决去中心化异构环境中的生成式推理。3.4 应用层与模型选择路由另一类平行工作涉及在不同LLM模型间路由——根据难度或质量标准选择最具成本效益的模型来处理查询。这包括混合路由 (Ding et al., 2024)、级联调查 (Moslem Way, 2026) [9] 和基于RL的模型路由器。这类问题不同于基础设施放置路由模型选择路由器决定调用哪个模型基础设施路由器决定在哪个硬件副本上执行给定的推理请求。4 系统架构4.1 设计目标Solyx AI Grid 设计为在推理引擎之上运行而无需修改它们在请求时刻使用持续刷新的信号做出路由决策处理健康检查系统不可见的副本生命周期转换在单个遥测源故障时优雅降级并将网络路径质量作为首要路由输入。数据平面是未修改的EnvoySolyx生成标准的xDS端点权重配置这意味着现有Envoy部署可以采用Solyx而无需更改其请求处理层。4.2 10信号分类法v3评分器整合了来自三个来源的十种信号四种应用、四种硬件、两种网络。vLLM应用指标通过Prometheus每秒抓取队列深度、直方图桶中的P95 TTFT、错误率、KV缓存填充百分比。GPU硬件遥测通过DCGM以亚秒级节奏收集GPU利用率、VRAM利用率、SM/张量核心流水线占用率、内存带宽利用率。网络路径信号通过主动健康检查测量从网关到每个副本的每端点RTT和抖动。每个单元代理每个GPU一个在本地聚合这些信号并通过gRPC流式心跳以500毫秒的节奏将它们推送到控制平面。相对于第一阶段的8信号评分器v3评分器新增了两种网络信号——RTT和抖动。网络感知放置评估第6.8节分离了它们的贡献在诱导WAN抖动下比较仅使用GPU的Solyx8信号与10信号Solyx仅网络信号就带来了额外的27.8%的P95 TTFT降低证实了这些信号提供了超越硬件和应用指标的实质性路由价值。4.3 压力评分与权重投射在请求时刻Solyx AI Grid 通过加权归一化结合当前信号值为每个候选副本计算一个综合压力分数。每个信号被归一化到 [0,1]值越高表示压力越大。综合分数被反转并投射为整数端点权重通过xDS推送到Envoy。评分循环连续运行当分数增量超过滞后阈值时触发xDS推送在为期八天的第二阶段实验窗口中稳态节奏为1 Hz共推送了超过50,000个xDS快照。4.4 副本生命周期状态机与优雅降级每个被追踪的副本被分配一个生命周期状态加载中、就绪、排空中、故障、终止。只有就绪副本才有资格接收实时流量。工作器故障通过心跳TTL过期检测当单元代理停止发送心跳时控制平面在500毫秒一个心跳间隔内将端点标记为故障并将其权重置零。这就是相比Envoy默认的3次1秒健康检查轮询实现3.2倍更快故障转移恢复的机制。Envoy在控制平面中断期间保留最后一次已知良好的xDS快照确保路由新鲜度优雅降级而非流量丢弃。当DCGM导出器在负载中故障时控制平面升起一个回退标志评分器继续使用剩余的仅vLLM信号无需操作员干预也不会丢弃流量。5 实验设置5.1 第一阶段异构集群2026年4月第一阶段在美国三个数据中心部署六块GPUSolyx控制平面和Envoy网关位于美国东部的中立网关节点。在相同的底层拓扑上评估了三种集群配置。同构六块NVIDIA H100 SXM 80GB所有max_model_len4096。硬件异构Pod A升级为两块NVIDIA H200 SXM144GB VRAMPod B保留两块H100 SXMPod C保留两块H100 SXM但限制max_model_len1024。能力错配在相同硬件上以20 RPS评估以加压错配条件。所有配置均服务Llama 3.1 70B AWQ INT4。比较了三种路由策略轮询调度RR、最少请求LR和Solyx AI Grid8信号v2评分器。5.2 第二阶段多阶段Blackwell SE评估2026年5月第二阶段在美国三个数据中心部署九块NVIDIA RTX PRO 6000 Blackwell SE GPU96GB GDDR7PCIe Gen5solyx-prod-east美国东北1、solyx-prod-central美国宾夕法尼亚1、solyx-prod-west美国北卡罗来纳2每站点三块GPU。所有站点间流量均穿越公共互联网WAN路径。每个Pod运行一个DCGM导出器和三个以500毫秒节奏发送心跳的单元代理。所有九块GPU均服务Llama 3.1 70B AWQ INT4使用vLLM 0.6.6.post1启用前缀缓存和分块预填充采用awq_marlin量化。第二阶段包括校准加上在八天内2026年5月6日至14日的七个评估阶段SLO吞吐量矩阵、硬件遥测领先时间压力测试、破坏性故障转移、突发和对抗性工作负载、能力错配、遥测故障回退以及网络感知放置使用GuideLLM作为负载驱动器测量每请求的流式TTFT。比较了三种路由策略RR、LR和Solyx AI Grid10信号v3评分器。5.3 工作负载类别第二阶段定义了八类工作负载涵盖生产LLM流量的结构基元baseline_mixed512±200 token提示词128 token输出——标准聊天/问答rapid_shift1024 token提示词会话内形状变化code_heavy1024±512 token提示词192 token输出——类似Copilot的解码密集型adversarial_spike10 RPS稳态每30秒加50个请求的突发multiturn2048×8 增长的轮次16K有效上下文rag_multidoc4000±800 token提示词带检索文档long_context8000±1500 token提示词very_long16000±3000 token提示词文档摘要5.4 SLO矩阵方法论对于每个类别、模式、SLO单元二分查找驱动器找到最高的可持续RPS满足P95 TTFT ≤ SLO 且成功率 ≥ 0.95。每个二分步骤提交45秒的恒定速率流量包含30秒预热和15秒冷却冷却窗口不计入分子和分母。每类三个SLO等级 × 三种路由模式 × 三个副本 每类27个单元总共216个单元。所有SLO等级均满足统计完整性标准每个单元 ≥ 500个样本。6 结果6.1 校准基线在主评估前每种路由模式在baseline_mixed、10 RPS下运行60秒校准。Solyx在首次校准运行中就取得了最低的TTFT P95证明压力感知评分能立即将流量导向具有最多KV缓存余量和最低RTT的计算单元无需任何预热期。表1校准结果baseline_mixed10 RPS60秒。Solyx在首次运行的所有延迟百分位上均领先。模式成功率TTFT P50TTFT P95TTFT P99E2E P95Solyx (10信号)100.00%306.5 ms609.6 ms742.9 ms5,340 ms最少请求100.00%348.7 ms628.1 ms814.7 ms5,809 ms轮询调度99.75%352.5 ms649.5 ms853.1 ms5,810 ms6.2 跨工作负载类别的SLO吞吐量在第二级SLO下所有八类工作负载中Solyx实现了轮询调度可持续RPS的1.56–1.75倍。实验的接受标准要求Solyx在八类中至少赢得四类Solyx赢得了全部八类。最少请求稳定地介于轮询调度和Solyx之间验证了硬件遥测和网络信号提供了超越单纯应用层负载感知的路由价值。表2第二级SLO下的SLO吞吐量矩阵三个副本的中位数。可持续RPS 满足P95 TTFT ≤ SLO 且成功率 ≥ 0.95 的最高RPS。工作负载类别SLO (ms)SolyxLRRRSolyx/RRbaseline_mixed1,5002017121.67×rapid_shift1,5001815111.64×code_heavy3,0001614101.60×adversarial_spike3,0002824171.65×multiturn3,500141291.56×rag_multidoc3,0002219131.69×long_context3,000121071.71×very_long7,0007641.75×6.3 硬件遥测领先时间第二阶段的一个关键发现是GPU硬件遥测信号能预见应用层SLO违规。我们独立地在九个计算单元中的每一个上注入热应力通过pure-torch matmul进行GPU燃烧和PCIe争用stress-ng并测量在TTFT P95越过SLO阈值前多少秒Solyx压力分数越过了预配置的警报阈值。这个领先时间代表了Solyx可以在用户感受到延迟影响之前将流量从性能下降的单元中排空的时间窗口。表3硬件遥测领先时间结果。硬件遥测信号平均比SLO违规提前11.2秒越过压力警报阈值。未发生SLO违规因为Solyx在领先时间窗口内排空了流量。应力类型单元数领先范围 (秒)平均领先 (秒)SLO违规热应力 (GPU燃烧)6 (东中)11.5–13.112.30/6PCIe争用3 (西)8.7–9.28.90/3所有单元合计98.7–13.111.20/9在所有九个应力事件中均未发生SLO违规因为Solyx在领先时间窗口内将流量重新路由远离了每个性能下降的单元。这一发现具有直接的运维意义GPU硬件退化——热节流、PCIe争用、ECC错误——可通过DCGM硬件信号在大约11秒前被检测到早于它在TTFT或队列深度等应用指标中显现。纯应用层的监控栈没有预先警告而硬件遥测感知的控制平面可以采取主动行动。6.4 故障转移恢复我们通过持续10 RPS负载下向一个vLLM进程发送SIGKILL来测量破坏性故障转移并记录每种路由模式重新路由飞行中流量的速度。Solyx通过单元代理心跳陈旧性而非主动健康检查轮询来检测故障当单元静默时Solyx在一个500毫秒的心跳间隔内将其降级而Envoy的默认配置需要三个连续的1秒健康检查间隔才能移除端点。表4破坏性故障转移结果10 RPS下对一个vLLM进程发送SIGKILL。Solyx的P99重路由速度比轮询调度快3.2倍并保持最高的杀进程后成功率。模式重路由 P50重路由 P95重路由 P99杀进程后成功率Solyx287 ms891 ms1,247 ms99.76%最少请求412 ms1,538 ms2,104 ms98.81%轮询调度689 ms2,871 ms4,226 ms94.12%最少请求虽然比轮询调度快但其P99延迟仍是Solyx的1.6倍以上因为它只对飞行中请求计数做出反应而非对底层的活跃性信号。心跳陈旧性机制是Solyx能将故障转移影响限制在杀死瞬间飞行中请求上的架构原因从而实现了99.76%的杀进程后成功率而轮询调度仅为94.12%。6.5 突发和对抗性工作负载在adversarial_spike工作负载10 RPS稳态每30秒加50个请求的突发下Solyx的队列深度感知评分能在亚秒内检测到突发并将其引导至负载最轻的单元。轮询调度的均匀分配会使接收到第一批突发请求的Pod过载。表5adversarial_spike结果。路由反应陈旧性测量从突发开始到路由权重调整的P95时间。模式可持续 RPS突发成功率反应 P95Solyx2899.43%482 ms最少请求2495.21%1,247 ms轮询调度1781.27%2,381 ms6.6 能力错配一个单元cell-west-2配置为max_model_len1024而其他八个单元运行在max_model_len131072在10 RPS负载下。两类工作负载驱动长提示词baseline_mixed30%的提示词超过1024 token和long_context100%超过1024 token。我们将泄漏率定义为被路由到受限单元并因此被HTTP 400拒绝的长提示词请求超过受限单元上下文限制的请求的比例。Solyx的错误率信号检测到受限单元上的高失败率并自动降低其权重无需预先配置识别哪个单元受限。表6能力错配结果。泄漏率是被路由到受限单元并被拒绝HTTP 400的长提示词请求的比例。最少请求28.71%的泄漏率接近轮询调度的32.11%证实没有错误率信号的负载感知无法解决此故障模式。在两类长提示词工作负载下以10 RPS测量。模式泄漏率长提示词成功率检测机制Solyx0.43%99.57%错误率信号 → 自动降权最少请求28.71%71.29%无反感知失败 → 计数降低 → 更多流量轮询调度32.11%67.89%无6.7 遥测故障下的优雅降级对于九个单元中的每一个在负载中杀死DCGM导出器。控制平面检测到缺失的遥测源升起dcgm_fallback标志v3评分器继续使用仅vLLM信号。所有九个单元在DCGM宕机期间的平均成功率为99.90%回退在一秒内生效平均824毫秒。没有流量被丢弃。这验证了Solyx在遥测源故障下优雅降级——这是生产部署所需的属性因为单个遥测组件可能独立故障或重启。6.8 网络感知放置网络感知放置评估在五种网络条件下评估了三种路由分支以分离RTT和抖动信号的贡献轮询调度无信号感知、Solyx-仅GPU8种硬件和应用信号无网络信号和Solyx-10信号完整评分器含RTT和抖动。20毫秒抖动诱导子阶段在站点B路径上提升WAN抖动而站点A和C不受影响。表7网络感知放置结果。“网络信号增益”是从Solyx-仅GPU到Solyx-10信号的改进分离了RTT和抖动信号的贡献。在所有子阶段中Solyx-10信号的P95平均比轮询调度低42%。子阶段RR P95Solyx 仅GPUSolyx 10信号网络增益near_idle587 ms562 ms491 ms12.6%symmetric712 ms678 ms547 ms19.3%saturation1,842 ms1,247 ms901 ms27.7%jitter 20ms1,971 ms1,583 ms1,142 ms27.8%recovery824 ms712 ms561 ms21.2%三分支比较设计分离了两种不同的路由价值来源硬件和应用信号感知Solyx-仅GPU vs. RR构成了改进的大部分和网络信号感知Solyx-10信号 vs. Solyx-仅GPU根据网络条件提供了额外的12–28%的P95降低。在站点间网络路径质量存在显著差异的饱和和抖动条件下网络信号的贡献最大。6.9 第一阶段异构集群结果在12 RPS的同构H100集群上所有三种路由策略在中位数延迟上趋于一致——正如在统一硬件上预期的那样。决定性的差异在于P99尾部轮询调度由于队列盲旋转将请求堆积到正在处理慢速生成的副本上产生了9,894毫秒的延迟。最少请求和Solyx都将P99降低到约7,140毫秒减少了27.9%。在接近饱和时20 RPS三种策略趋于一致P99相差在0.3%以内RR 7,172毫秒LR 7,170毫秒Solyx 7,154毫秒证实在负载下没有回归。正是这个20 RPS的收敛点而非表8的12 RPS结果定义了第7.1节讨论的饱和边界条件。表8第一阶段同构基准测试6× H100 SXM12 RPS。P99尾部差异是主要区分点中位数延迟在统一硬件上收敛。指标轮询调度最少请求SolyxSolyx vs. RRP50 (ms)6,8986,8936,896—P95 (ms)7,1837,0747,076−1.5%P99 (ms)9,8947,1517,138−27.9%成功率99.1%100.0%99.9%0.8 pp在12 RPS的硬件异构集群H200 H100 受限H100上Solyx和最少请求都检测到性能差异并将流量集中到更快的端点产生约5,970毫秒的P50轮询调度为6,730毫秒−11.3%和7,042毫秒的P99轮询调度为7,791毫秒−9.6%。机制是实时的xDS端点权重分布H200端点获得权重134无约束H100获得权重134受限H100端点获得权重1——这是由实时遥测在无操作员配置下产生的134:1比例。表9第一阶段硬件异构测试期间的实时xDS端点权重。134:1的集中比例由闭环评分系统产生无需操作员配置。端点GPU权重状态19000 / 19001H200 SXM ×2134快速、健康 — 最大流量19002H100 SXM1已杀死 — 心跳TTL过期19003H100 SXM134健康、无约束19004 / 19005H100 SXM (受限)1max_model_len1024 — 被错误率信号降权在20 RPS的能力错配配置下Solyx保持99.9%的成功率而轮询调度为69.9%每2,400个请求防止了720次失败。第一阶段结果使用了不含网络信号的8信号评分器使用10信号v3评分器的第二阶段复现第6.6节在不同硬件代际的更大集群上证实了这一发现。7 讨论7.1 边界条件Solyx收效甚微之处存在一个特定的运行状态在此状态下Solyx与最少请求收敛且无法提供可测量的优势一个同时满足同构、饱和、无故障和网络稳定的集群。当每个副本完全相同、每个副本都同等且完全满载、没有副本性能下降、且每个网络路径都均匀时任何路由器都没有可利用的有效信号。第一阶段同构H100在20 RPS下的结果第6.9节正是这种边缘情况我们诚实地报告了这种收敛三种路由器彼此之间的差异在噪声范围内。重要的是不要过度概括这一边界条件因为必须同时满足所有三个限定条件才适用而生产中的同构集群很少同时满足这三个条件。移除任何一个限定条件都会恢复Solyx的优势而同构多站点Blackwell SE的结果第6.2节恰恰证明了这一点。该集群在硬件上是同构的但Solyx在所有八类工作负载的第二级SLO下实现了1.56–1.75倍的吞吐量——因为测量是在SLO拐点而非饱和点进行的那里存在可路由的余地。同一实验表明一旦引入故障硬件遥测领先时间、故障转移和遥测故障评估或网络变化网络感知放置评估同构集群就会获得显著收益。因此这里描述的收敛是关于一个运行点的狭窄且诚实的陈述而非关于同构集群的一般性主张。实际意义是Solyx适用于任何经历低于饱和负载、硬件退化、配置漂移、运行故障或多站点网络变化的集群——这描述了一大类生产多站点集群。相比最少请求边际收益仅在持续处于饱和状态、无故障且无网络变化的同构单模型集群上才很小而这种情况并不描述真实的多站点生产服务。在实践中生产多站点集群几乎持续地偏离这种收敛角落公共互联网WAN路径在秒级时间尺度上表现出RTT和抖动波动局部热节流或PCIe争用会在无预警的情况下使个别GPU性能下降。每一次这样的扰动都会重新引入Solyx可以利用而信号盲路由器无法利用的有效信号。因此收敛状态不仅是狭窄的而且是短暂的——集群很少能在其中停留超过短暂的时间间隔。7.2 堆栈定位Solyx AI Grid 并非 NVIDIA Dynamo 或 vLLM Router 等集群内路由系统的替代品。那些系统在集群内执行KV缓存感知调度Solyx选择将给定的请求路由到哪个集群。这些是互补的层次。一个完整的多站点推理堆栈应在每个站点内部署一个集群内路由器并在其上方部署一个跨站点控制平面。NVIDIA AI Grid参考架构 [10] 已经描述了一个逻辑上统一地理分布式站点的控制平面并使用实时健康、容量、延迟、成本和策略信号进行放置和路由作为分布式AI基础设施的“编排”层。我们的工作并非与此愿景竞争而是对其进行了验证Solyx AI Grid是该控制平面层的具体实证实现具有特定的DCGM/vLLM/RTT评分实例化并在物理多站点基础设施上获得了测量结果。据我们所知此前没有公开工作对参考设计的路由层进行过此类实证验证。7.3 DCGM领先时间发现DCGM硬件信号出现与应用层SLO违规之间的平均11.2秒领先时间第6.3节是我们认为具有最广泛影响的成果超越了路由本身。它实证确立了GPU硬件遥测携带了应用层性能下降的预测信号。对任何基础设施运营商的实际意义是局限于应用层指标TTFT、队列深度、错误率的监控栈将永远被动响应。硬件遥测集成使得主动排空成为可能。量化跨硬件代际和应力类型的领先时间分布是这项工作的自然延伸。7.4 普适性我们结果的几个方面可能推广到我们的部署规模之外。能力错配故障模式随集群异构性扩展并非特定于九GPU部署。硬件遥测相比应用指标的优势是信号层级本身的属性而非集群规模。心跳TTL检测的故障转移恢复优势在任何基线是基于轮询健康检查的场景下都存在。不太清楚的是在非常高副本数量下的压力评分准确性我们的部署有六和九个副本跨站点路由与大规模下KV缓存前缀局部性之间的相互作用以及在相关多站点故障下的行为。7.5 局限性两个阶段都使用了供应的GPU云基础设施而非自有的裸金属。都使用了合成工作负载而非真实用户流量尽管第二阶段的工作负载类别旨在反映生产现实的请求分布。第二阶段在每个站点内的同构硬件上评估了单一模型Llama 3.1 70B AWQ INT4跨阶段的跨站点异构硬件配置是自然延伸。两个阶段均未评估成本影响或能源效率。0.2毫秒的控制平面路由更新开销代表了当前实现。还有几个进一步的维度未被验证并限制了本研究的声明。控制平面可扩展性。我们的部署包含六和九个副本控制平面以1 Hz的稳态为九个副本推送了超过50,000个xDS快照而没有压力但我们没有刻画当扩展到数百或数千个分布式节点时的控制平面计算和网路开销。我们刻意拒绝对此状态进行建模而非从九副本测量进行推断量化控制平面扩展行为是未来必要且独立的工作路线。多模型路由。两个阶段都服务于单一模型在未评估具有不同能力的异构模型副本间进行路由。大规模下的KV缓存局部性。我们没有刻画在大量副本下跨站点路由与KV缓存前缀局部性之间的相互作用在那里局部性保持和压力最小化目标可能发生冲突。成本优化。两个阶段均未评估每token成本或每请求能耗这两者都是面向购买者的效率指标。相关区域故障。我们的故障转移测试杀死单个副本我们没有评估在多个站点同时故障的相关多站点性能下降下的行为。7.6 未来工作两个方向直接源于上述局限性值得简要描述尽管我们尚未实现或评估其中任何一个。控制平面扩展架构。我们的控制平面处理了九个副本单个聚合进程以1 Hz稳态推送超过50,000个xDS快照而没有压力。我们不声称在更大规模下有实测性能但架构路径是分层聚合拓扑每个区域子控制器各自维护其本地单元的心跳和遥测状态并计算区域压力摘要而顶层控制器使用这些摘要而非原始每单元信号进行跨区域路由。这限制了无论总集群规模如何的每控制器扇入并将高频500毫秒心跳流量限制在区域内链路。量化这种拓扑在数百到数千个单元下的开销和收敛行为是必要的工作我们刻意不从九副本测量推断性能指标。平衡压力最小化与KV缓存局部性。在大量副本下将请求路由到压力最低的单元可能与KV缓存前缀局部性冲突压力最低的单元可能不持有多轮会话的前缀缓存迫使重新计算从而抵消路由收益。一个自然的扩展是混合目标将压力分数与前缀亲和项相结合当单元压力处于全局最小值的容差带内时偏向路由到已持有相关缓存状态的单元。这将把我们压力最小化的方法与SkyWalker等系统的局部性保持工作联系起来。我们将其勾勒为一个设计方向而非经过验证的结果。8 结论我们展示了一项针对硬件遥测感知的跨站点LLM推理路由的双阶段、七部分的实证研究覆盖了八类工作负载、三种集群配置和三种路由策略下的216个单元。在两阶段实验中Solyx AI Grid 证明将GPU硬件遥测、vLLM应用指标和实时网络路径信号整合进逐请求放置决策中能在多站点部署特有的每种故障模式上产生具体、可衡量的改进。核心结果包括在同构集群上降低27.9%的P99尾延迟在异构集群上实现134:1的自动流量向健康端点集中将能力错配泄漏率降至0.43%而轮询调度为32.11%、最少请求为28.71%从而获得99.57%的长提示词成功率轮询调度为67.89%最少请求为71.29%并证实最少请求在此故障模式下几乎与轮询调度一样失效在所有八类工作负载的第二级SLO下实现1.56–1.75倍的吞吐量DCGM信号平均比SLO违规提前11.2秒实现主动流量排空故障转移P99为1,247毫秒而轮询调度为4,226毫秒在抖动下仅网络信号就带来27.8%的额外P95 TTFT降低在DCGM导出器实时故障时保持99.90%的成功率以及所有配置下0.2毫秒的控制平面路由更新开销。第一阶段在H100/H200硬件上单独证实了能力错配的发现Solyx保持了99.9%的成功率而轮询调度为69.9%。我们相信这项工作为多站点推理路由作为一个独特的系统问题以及硬件遥测集成作为一类具有超越单纯应用层指标预测价值的路由信号奠定了实证基础。这里刻画的故障模式是多站点部署结构的架构后果并将跨越硬件代际持续存在。我们邀请社区将这一实验框架扩展到更大的集群、跨站点异构硬件配置和多模型服务场景。附录A 评估方法与指标定义本附录定义了论文中报告的每个指标。所有第二阶段指标均由后处理分析器根据每个评估阶段捕获的原始每请求NDJSON日志、故障注入时间戳和Prometheus遥测快照计算得出。TTFT首令牌时间。从网关发送请求到收到第一个流式token的经过时间按请求测量并报告为窗口内请求流的P50/P95/P99百分位数。E2E延迟。从请求发送到最终token的端到端挂钟时间按请求测量。SLO下的可持续RPS。满足P95 TTFT ≤ SLO目标且成功率 ≥ 0.95的最高恒定请求速率通过8–12步的二分查找找到。每一步运行45秒的恒定速率流量包含30秒预热和15秒冷却冷却窗口不计入分子和分母以避免将关闭取消计为失败。泄漏率能力错配。长提示词请求——即上下文长度超过受限单元max_model_len的请求——中被路由到受限单元并因此被HTTP 400拒绝的比例。分母是受影响窗口内的长提示词请求分子是落在受限单元上的子集。在两类长提示词工作负载下以10 RPS测量。重路由P99故障转移。在持续负载下对一个vLLM进程发送SIGKILL后流量成功重路由到健康端点的每请求时间报告为杀进程后窗口的P99。路由反应P95突发。从突发开始到响应它的路由权重调整的P95经过时间。杀进程后成功率。杀进程后窗口内成功的请求比例下限为杀进程瞬间飞行中的请求。DCGM领先时间。在受控热或PCIe应力注入下压力分数越过预配置警报阈值与P95 TTFT将越过SLO阈值之间的经过时间。正领先时间表示硬件遥测预见了应用层性能下降。控制平面路由更新开销。一次控制循环添加的延迟测量为投影周期加上xDS构建时间微秒作为Prometheus仪表暴露。这是控制平面更新成本而非每请求数据平面延迟数据平面是未修改的Envoy不添加任何Solyx特定的每请求开销。附录B 基线配置与公平性控制所有三种路由模式都在相同的硬件、相同的vLLM实例和相同的工作负载上评估只有路由逻辑在运行间不同。轮询调度是无状态的顺序轮转除了为所有三种模式相同配置的基线Envoy健康检查行为外没有负载、能力、硬件遥测或网络路径感知。它代表了否则未配置的Envoy/Nginx/HAProxy部署的默认行为。最少请求路由到发送时飞行中请求最少的端点这是标准的Envoy LEAST_REQUEST策略和最常用的生产主动负载均衡策略。Solyx使用10信号加权压力评分器通过xDS推送权重。基线模式通过单个控制平面标志--baseline激活该标志禁用压力评分和放置同时保持堆栈其余部分不变确保比较隔离了路由逻辑。评分参数在活动前固定未按工作负载类别调整相同的评分器配置用于所有216个单元。附录C 统计处理SLO矩阵包含216个单元8类工作负载 × 3种路由模式 × 3个SLO等级 × 3个副本。每个单元都满足 ≥ 500个样本的完整性标准所有单元观察到的最小值为624个样本。头条第二级吞吐量值报告为三个副本的中位数。TTFT改进声明Solyx赢得所有八类是通过Solyx和轮询调度之间不重叠的自举置信区间确立的而不仅仅是点估计。整个活动中最大样本间间隙为1,432毫秒在数据完整性界限5,000毫秒之内。