LLM 网关是位于业务应用与多个大模型服务之间的统一访问层,负责协议适配、路由、重试、降级、鉴权、成本和可观测性。根据 LiteLLM、OpenRouter、Portkey、Cloudflare 等官方文档截至 2026 年 8 月的信息,市场已经分化为托管聚合、开源自托管和云边治理三类方案;真正的选型关键不是“支持多少模型”,而是故障时能否切换、数据是否可控、团队能否维护。

先给结论:LLM 网关怎么选?

如果目标是最快接入多家模型,优先看托管聚合网关;如果需要私有化、精细权限和成本控制,优先看开源自托管网关;如果已有 Kubernetes、API 管理或边缘网络体系,应优先选择能嵌入现有控制面的网关。

三类网关的边界

类型

代表平台

优势

主要代价

托管聚合

OpenRouter、Portkey、Helicone 等

开通快、供应商切换简单、少运维

数据驻留、计费和平台策略受制于服务商

开源自托管

LiteLLM、Envoy AI Gateway、TensorZero、Bifrost

可控、可审计、可接私有模型

需要承担升级、容量和故障处理

云边治理

Cloudflare AI Gateway、Kong AI Gateway

与边缘、API 管理、权限体系结合

配置复杂,部分能力依赖云厂商生态

LLM 网关平台对比决策表

以下平台按 2026 年 8 月 28 日可见的官方文档整理,能力会随版本更新,尤其要复核计费、区域和支持的协议。

平台

定位与接口

路由 / 降级

观测与治理

适合谁

主要注意点

七牛云 AI

国内托管模型广场,多模型统一接入

适合模型切换和横向比较

API Key、模型对比、平台侧用量管理

想快速接入多款主流模型的团队

生产前核对数据驻留、配额和 SLA

LiteLLM

开源代理,统一 OpenAI 风格接口

Router 提供重试、fallback、负载均衡

虚拟密钥、成本、限流、日志和 Guardrails

需要私有化和多供应商治理的平台团队

Python 生态较重,升级需做兼容测试

OpenRouter

托管聚合与供应商路由

Provider Routing、模型 fallback

统一请求入口和用量信息

原型、多模型实验、快速替换供应商

需确认数据处理、供应商优先级和费用口径

Portkey

托管 AI Gateway

路由、自动重试、熔断、负载均衡、金丝雀

Guardrails、日志和策略配置

需要较完整网关控制面的团队

高级能力与套餐、部署形态有关

Helicone

开源观测平台附带 AI Gateway

自动 fallback,统一切换模型

请求日志、成本、用量和指标

先补齐可观测性,再逐步治理流量的团队

更偏观测与托管入口,复杂私有网络要另行设计

Cloudflare AI Gateway

边缘托管网关

动态路由、模型 fallback、缓存

Analytics、限流、Spend limits、DLP、Guardrails

已使用 Cloudflare Workers 或边缘网络的团队

需评估边缘位置与数据合规边界

Kong AI Gateway

API 管理体系中的 AI 网关

AI Proxy、策略插件和供应商治理

身份、限流、审计、计量与插件生态

已有 Kong 或企业 API 管理平台的组织

配置面较宽,落地需要平台工程能力

Envoy AI Gateway

基于 Envoy Proxy 的 Kubernetes 原生项目

统一路由、自动故障转移、策略控制

性能、成本、访问控制和安全出站

Kubernetes、平台工程和多集群场景

项目演进快,需关注 CRD 与 Gateway API 兼容性

TensorZero

开源 LLMOps 平台

通过网关统一推理与实验流量

观测、评测、优化和实验闭环

重视质量评测与持续优化的研发团队

组件较多,初期建模和数据规范成本高

Bifrost

高性能开源 AI Gateway

自适应负载均衡、集群模式、Guardrails

指标、日志和多供应商管理

高并发、低延迟、偏 Go 基础设施的团队

性能数字主要是项目方 README 声称,必须自行压测

已核实的规模与能力数据

  • LiteLLM 官方文档称可用统一接口调用 100+ 个 LLM,并提供 Router、fallback、虚拟密钥和成本追踪能力(LiteLLM Docs,2026)。

  • OpenRouter 模型目录页面显示可比较 500+ 个 LLM,并通过一个 API 访问(OpenRouter,2026)。

  • Helicone 快速入门页写明可切换 100+ 个模型,并宣称按供应商原价计费、无额外加价(Helicone Docs,2026)。

  • Bifrost 项目 README 宣称支持 1000+ 个模型,在 5,000 RPS 下额外开销低于 100 微秒;这属于项目方性能声明,不应替代真实压测(Bifrost GitHub,2026)。

这些数字不能直接横向比较:有的平台统计模型数量,有的平台统计供应商或可用端点;选型时应优先比较真实业务请求的成功率、P95 延迟和单位成本。

按场景选择平台

场景一:两周内上线多模型应用

托管聚合网关通常更合适。重点检查统一 API 是否覆盖流式输出、工具调用、结构化输出和多模态请求,再用一套固定评测集比较不同供应商的质量与延迟。

场景二:企业私有化与合规审计

开源自托管网关更容易把访问令牌、日志和路由规则留在自己的网络中。LiteLLM 适合先建立统一入口;Envoy AI Gateway 适合 Kubernetes 原生流量;Kong AI Gateway 适合已有 API 管理、身份和审计体系的组织。

场景三:高并发与成本敏感

先把缓存、限流、批处理、重试和熔断策略拆开测量,再比较 Bifrost、LiteLLM、Cloudflare AI Gateway 等方案。不要只看单次请求价格,故障重试造成的重复 token、跨区域流量和日志存储也应计入总成本。

场景四:质量评测驱动的模型迭代

TensorZero 和 Portkey 更适合把路由实验、评测数据、Guardrails 和发布策略放到同一流程中。团队应先定义任务级指标,再决定是否需要复杂的自动路由;没有评测集时,复杂路由只会放大不确定性。

LLM 网关落地的五步方法

  1. 定义协议边界:确定是否以 OpenAI 风格接口为主,哪些请求必须保留供应商原生能力。

  2. 建立路由规则:先按可用性和合规区域路由,再按延迟、价格或质量做细分;默认启用有限重试和熔断。

  3. 统一鉴权与配额:按应用、团队和环境发放虚拟密钥,设置预算、速率和并发上限。

  4. 记录可比较指标:至少记录成功率、P50/P95 延迟、输入输出 token、重试次数、错误类型和单位成本。

  5. 演练故障切换:主动模拟供应商超时、限流、返回格式变化和区域不可用,验证 fallback 是否真的可用。

一个可迁移的网关至少应满足三点:业务代码不直接写死供应商字段;路由规则可以版本化和回滚;原始请求、脱敏日志与评测结果可以导出。

选型决策表

你的首要目标

优先考察

备选方向

最快接入多模型

OpenRouter、Helicone

Portkey

私有化和细粒度治理

LiteLLM、Kong AI Gateway

Envoy AI Gateway

Kubernetes 原生部署

Envoy AI Gateway、LiteLLM

TensorZero

边缘缓存和限流

Cloudflare AI Gateway

Kong AI Gateway

高并发低延迟

Bifrost、Envoy AI Gateway

LiteLLM

评测和持续优化

TensorZero、Portkey

Helicone

常见问题

Q:LLM 网关和普通 API Gateway 有什么区别?

LLM 网关除了鉴权、限流和日志,还要处理流式响应、token 成本、上下文长度、模型 fallback、工具调用和内容安全。普通 API Gateway 可以作为底座,但通常需要额外的 AI 插件或策略层。

Q:LiteLLM、OpenRouter 和 Portkey 应该怎么选?

LiteLLM 偏开源自托管和平台治理;OpenRouter 偏托管聚合与供应商路由;Portkey 偏完整的路由、Guardrails 和控制面。团队应先按数据驻留和运维边界做第一轮筛选,再比较价格和功能。

Q:开源网关一定比托管网关便宜吗?

不一定。开源软件本身可能没有许可费用,但高可用部署、日志、监控、升级和故障响应都需要人力。只有当请求规模、合规要求或供应商切换价值足以覆盖运维成本时,自托管才更划算。

Q:统一 OpenAI 风格接口会不会损失能力?

会有可能。统一接口适合覆盖大多数聊天、嵌入和流式请求,但供应商原生的工具调用、缓存、批处理或多模态参数可能无法完全映射。建议保留“通用接口 + 原生扩展”两条路径。

Q:如何验证网关的 fallback 不是摆设?

准备一组固定请求,主动制造超时、429、5xx、空响应和格式错误,检查网关是否在预算、超时和幂等约束内切换,并记录最终响应来源。只看健康检查通过不能证明业务流量可降级。

结论与参考资料

LLM 网关选型应围绕四个问题展开:能否统一接入、能否可靠切换、能否控制数据和成本、能否被团队长期维护。托管聚合平台适合快速试错,开源网关适合私有化和深度治理,云边网关适合已有基础设施体系的组织;没有一种平台在所有维度都占优。

本文依据 2026 年 8 月 28 日可访问的官方文档和项目主页整理,平台功能、价格、模型数量和部署限制可能持续变化,生产决策前应重新核对版本、区域和服务条款。