Google API Gateway 上线模型路由:把 LiteLLM 那层挪到托管边缘,但只认自家 Model Garden

给编码 Agent 供模型,团队要么自建 LiteLLM,要么手搓代理。Google 现在把这个活儿收编成了一...

给编码 Agent 供模型,团队要么自建 LiteLLM,要么手搓代理。Google 现在把这个活儿收编成了一个 serverless 网关 URL。

8 月 3 日的 API Gateway Release Notes(中文自媒体 8 月 4/5 日转载)上线了 model routing,状态标 preview & v1。机制很直白:客户端朝网关发 OpenAI 兼容请求(POST /chat/completions)→ 网关读 JSON body 里的 model 字段 → 匹配 OpenAPI 规范里的路由规则 → 在飞行中把请求转码成 Vertex AI 的预测 schema → 派发到 Model Garden 端点;没命中就走 defaultModel。官方自己定位:”a managed alternative to client-side proxies such as LiteLLM”。

配置是声明式的,靠两个 OpenAPI 3.x 扩展字段。文档示例里的三个目标模型是 google/gemini-3.5-flash-lite、anthropic/claude-opus-4-7、openai/gpt-oss-120b-maas——注意第三个是开放权重的 gpt-oss(MaaS 开放模型),不是 OpenAI 闭源 GPT。

这条被中文报道写成「跨供应商路由」,不准确。三家模型全部经 Vertex AI Model Garden 托管,网关不直接连 api.anthropic.com 或 api.openai.com。它也不按成本、延迟、质量做智能调度——Preview 期 “routes based exclusively on the model tag or name in the payload”,本质是按模型名静态分发 + 默认兜底。私有部署、自托管模型也不支持,单个 router 内所有模型必须共享同一主机名。

对 AI coding harness 的意义在运维形态,不在能力。过去企业给 Agent 供模型要自己扛容器、扩缩容、密钥;现在一个边缘网关 URL 顶掉这层,客户端零改动(OpenAI SDK 直连),认证、配额、用量观测集中到边缘。对「Gemini 做长上下文、Claude 做代码、gpt-oss 做低成本批处理」这类混排,配置成本明显下降。但它不是 Apigee AI Gateway 的替代——真正的跨厂商直连 + 语义缓存 + Token 预算还在 Apigee 那条更重的产品线上,这个是轻量版,且锁在 Google 自家托管模型内。

计费走 API Gateway 标准价:0–200 万次调用免费,200 万–10 亿 3.00/百万次,10 亿以上1.50/百万次,模型 token 另按 Vertex AI 计。硬限制:请求超时上限 3600 秒,支持 SSE 响应流式,不支持请求侧流式、gRPC、WebSockets、Gemini Live,不支持 VPC Service Controls。官方自陈的 Preview 缺陷:请求体缺 model 字段时网关不报错而是错误处理。无独立官方博客,只有 Release Notes 和文档,属于文档级低调发布。中文报道称「与 Gemini 企业代理平台搭配、出口先过 Agent Gateway 再交 API Gateway 调度」的串联链路,在两篇官方文档里均无对应表述,建议当推测处理。

来源: – API Gateway Release Notes(2026-08-03) https://cloud.google.com/api-gateway/docs/release-notes – 模型路由概览 https://docs.cloud.google.com/api-gateway/docs/model-routing-overview – 配置模型路由 https://docs.cloud.google.com/api-gateway/docs/model-routing-configure – 定价 https://docs.cloud.google.com/api-gateway/pricing

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1