路由网关
把部署好的模型发布为可调用 API:端点绑定、按 token 定价、权重优先级与 failover 策略。
本节内容
01
端点与模型绑定
一个端点聚合多个部署实例,对外暴露统一地址。
端点是调用方看到的唯一稳定地址。一个端点可以聚合同一模型的多个部署实例(跨节点、跨集群),网关按权重把请求分发到健康实例上。
灰度场景下也可以把同一端点同时绑到新旧两个模型部署上,通过权重逐步切流量,完成灰度后解绑旧实例。
02
权重与优先级
按节点性能与成本设置流量权重,让请求优先落到快节点。
每个绑定关系有一个权重值(例如 vllm-primary w:5 / vllm-standby w:3 / tgi-fallback w:2),网关按权重比例分配流量。权重高的实例优先承接请求,权重低的作为缓冲与备份。
权重是纯声明式配置,改完即刻生效,不需要重启网关或实例。
03
failover 与容灾
实例故障时的自动切换与重试语义,保证调用方无感。
实例健康检查失败或节点失联时,网关立即把该实例从分发列表摘除,流量自动落到其余健康实例上;实例恢复后自动回迁。整个过程调用方无感知。
对幂等请求,网关可在失败瞬间对下一权重实例做一次内部重试,进一步屏蔽瞬时抖动;流式请求不重放,直接按上述摘除逻辑切换。
04
端点定价
按 token 计费的定价配置,与租户预算联动。
端点上按输入 / 输出 token 分别配置单价,计费精度与调用日志逐条对应。多租户场景下,每个租户的用量独立结算,API Key 的预算上限耗尽后自动拒绝新请求。
账单明细可在控制台按租户、按端点、按时间窗导出,与自托管成本核算(电费 / 折旧)对账即可得出真实的每 token 成本。