一个Key调用500个模型是什么生意,自己搭一套要什么技术。两层都讲清楚
先解决一个命名问题。
AI中转站,学名叫AI网关(AI Gateway)。它是插在"应用"和"模型供应商"之间的一层代理服务:应用只认一个地址、一种格式、一把Key;网关在后面做翻译、选路、记账、兜底。
为什么需要这层?因为多模型时代的接入现状是碎片化的。每家厂商的API格式、SDK、鉴权方式都不同,切换模型等于改代码。多个项目共用额度,没人说得清Token花在了哪。单一供应商限流或宕机,业务直接被打断。上层应用直接持有原始Key,泄露风险高。每个团队还要自己写重试、缓存、计费逻辑——重复造轮子。
网关把这些活统一收口。对上,暴露OpenAI兼容的标准API;对下,适配各家厂商的原生格式。切换、新增模型,业务代码一行不动。这个"中间层",就是中转站的全部生意。
这个赛道全球最大的玩家。
OpenRouter成立于2023年,总部旧金山。两位创始人里,Alex Atallah是OpenSea的联合创始人兼CTO——NFT牛市里全球交易量最大的平台。另一位是Louis Vichy。
规模数字(截至2026年9月官网):聚合500+模型、接入80+供应商,月处理Token300万亿+,用户1000万+。覆盖文本、图像、视频、音频四类生成。每周Token处理量,半年前是5万亿,2026年7月到了25万亿。
收入曲线更直观:2024年10月,年化收入约1000万美元;2026年4月,超5000万;2026年7月,约1.4亿。不到两年,14倍。
商业模式很简单:充值统一计费,平台在模型价格上加收约5%~5.5%的费用。也支持自带上游Key直连(BYOK),此时只收少量通道费。
拆开看它到底提供了什么。
统一API。OpenAI兼容格式,同时支持Responses API与Anthropic Messages格式。换模型就是改一个模型名字符串。
路由与容灾。同一模型背后有多个供应商,按价格、速度、可用性自动选路;一家宕机,自动切换到下一家。服务跑在边缘节点上,压缩用户与推理之间的延迟。
计费上限。大多数模型供应商至今不提供硬性消费上限——Key一旦泄漏,账单可能一夜爆掉。OpenRouter允许给每把Key设上限,到额即停。独立开发者Simon Willison的评价流传很广,他总结过三重价值:尝试所有模型的最简单方式、计费上限、模型流行度信号。原话是:"到目前为止,这是尝试所有模型的最简单方式。"
数据策略。可配置prompt只发给信任的供应商;官方即将推出Direct API Access——请求完全不经过OpenRouter服务器,直接透传到模型商。
护栏与修复。基于OWASP规则集的提示注入防护、JSON自动修复、输入输出日志。
免费模型。带:free后缀的模型免费用,是个人开发者的尝鲜入口。
多模态。2026年8月上线视频生成API,把Seedance、Veo、万相等视频模型统一成"提交—轮询—下载"一个循环,屏蔽各家不同的任务状态与轮询逻辑。
排行榜。按Token用量统计的模型排行,是观察模型流行度的重要指标。口径提醒:OpenAI和Anthropic的大多数用户并不经过OpenRouter,榜单反映的是这个生态内的偏好。
两个月估值翻七倍,然后被质疑。
融资线:2025年6月,4000万美元种子轮与A轮,a16z和Menlo Ventures领投,投后估值约5.5亿美元。2026年5月,1.13亿美元B轮,CapitalG(Alphabet旗下)领投,英伟达NVentures跟投,投后估值13亿美元。
然后是2026年7月的大新闻:支付巨头Stripe被曝正在洽购OpenRouter,传闻估值100亿美元。从13亿到100亿,隔了两个月。此前Databricks也谈过收购。Stripe的逻辑不难理解:它2025年底已花约10亿美元收购按量计费公司Metronome,加上OpenRouter的模型路由和自己的支付老本行,AI应用从调用、计费到收款的全链条就拼齐了。(截至发文,交易仍是谈判传闻,双方均未官宣。)
争议也摆在台面上。三条:
数据隐私。prompt会被路由到各家模型商,会不会被拿去训练?官方的回应是即将上线的Direct API Access。
免费模型封号。有用户反映只用了约15英镑的Token就被永久封禁,申诉渠道只有客服机器人"Tony Bot"。
"融了不该融的钱"。B轮消息公布当天冲上Hacker News热榜第一,450分、240条评论。有评论认为靠现金流本可活得很滋润,拿了风投反而背上必须追求高估值的枷锁。联合创始人在HN评论区亲自回应:"我们不需要风投的钱也能持续增长——但什么时候你最不想融1亿美元?就是你真正需要它的那一天。"
另外,国内直接使用有三个现实障碍:网络延迟、合规适配、支付体系。国内的聚合平台(硅基流动、七牛云AI大模型广场等)走的是同一形态,模型侧换成国产阵容。
动机清楚,成本也别低估。
自建的动机通常有三个:数据只经过自己的服务器,不落第三方;去掉中间商抽成;路由、鉴权、日志可以深度定制。托管方案共同的短板,恰恰是业务请求数据要经过服务商节点——涉及用户隐私或核心机密的业务,这条路走不通。
但隐性成本经常被低估。服务器要持续维护,高并发场景需要Redis和MySQL做缓存与存储,流式SSE连接的线程占用要专门处理。上游渠道的API Key要自己收集维护,上游协议一更新就得跟进适配。告警、重试、渠道健康检测都要自己实现,线上故障需要技术人员立刻排查。对小团队,人力维护成本可能超过托管服务的开销。
一句话:有专职后端运维、数据敏感度高、并发规模大的团队适合自建;缺运维人手、以原型和中小业务为主的,托管更省。
自建的主流打法,一个Docker容器的事。
| 项目 | 语言 / 许可 | 定位与特点 | 适合谁 |
|---|---|---|---|
| One-API | Go · MIT | 国内最流行的轻量"Token中转+渠道计费"系统;Web界面管理渠道与令牌;多用户、按用户配额;对智谱、百川、Moonshot等国产模型支持好;起步SQLite,规模上MySQL+Redis | 个人与小团队自建中转站 |
| New API | Go | One-API的活跃分支;界面更现代、功能更多(Midjourney、对话调试等) | 想要更多功能的One-API用户 |
| LiteLLM | Python+Rust核心 · MIT(企业功能商业授权) | 统一调用140+供应商、1800+模型;58k+ Stars、240M+ Docker拉取;Netflix、Stripe在用;虚拟密钥、预算到额即停、限流、护栏、日志回调(Langfuse/Helicone);新模型"发布次日即支持";Rust核心宣称p99仅增0.66毫秒;Proxy模式硬依赖PostgreSQL | 平台团队、需要完整网关治理能力 |
| Bifrost | Go | 2025年新兴高性能网关(Maxim AI出品);README宣称5000 RPS下额外开销低于100微秒(项目方口径,需自行压测) | 延迟敏感、Go技术栈 |
| BricksLLM | Go | 面向"给应用发Key、控预算"的多租户Key管理场景 | 多租户Key治理 |
这些网关对上层暴露的都是OpenAI兼容接口。接入方式是把base_url指向网关、换一把虚拟Key,业务代码不动:
已有基础设施体系的团队,走另一条路。
应用层网关之外,还有一个流派:让现有基础设施"长出"AI能力。代表项目四个。
Higress:阿里开源,Envoy/Istio底座加Wasm插件扩展,和K8s体系天然亲和。Envoy AI Gateway:Kubernetes原生项目,走Gateway API标准,统一路由、自动故障转移。Kong AI Gateway:在既有API管理体系里加AI Proxy插件,复用身份、限流、审计。Cloudflare AI Gateway:边缘部署,免费额度高,带缓存、分析、Spend Limits。
共同特点:配置面较宽,落地需要平台工程能力。适合已经有Kubernetes、服务网格或API管理平台的组织——网关嵌进现有控制面,而不是再起一套新系统。
从最小可用到生产级。
最小可用:一台服务器,Docker跑一个One-API或New API,SQLite存数据。个人中转站,半小时能上线。
生产标配:网关本体(容器化部署)+ MySQL或PostgreSQL(密钥、配额、用量持久化)+ Redis(分布式限流与缓存)+ 观测层(请求日志、延迟与成功率监控,对接Langfuse或OTEL)。
LiteLLM的官方参考部署给了两套Terraform模板:AWS是ECS Fargate加Aurora加ElastiCache,GCP是Cloud Run加Cloud SQL加Memorystore。真实密钥放Secrets Manager,网关、后端、管理UI拆成三个服务。这套结构可以直接当蓝本抄。
无论选哪家,两条底线建议:真实上游Key只存在网关侧,应用一律持虚拟Key;别单一依赖某一家上游,配好降级切换预案。
对号入座。
| 场景 | 对应方案 |
|---|---|
| 个人尝鲜、模型调研 | OpenRouter(:free模型 / 小额充值) |
| 原型验证、多模型对比实验 | OpenRouter / 国内聚合平台(硅基流动、七牛云等) |
| 数据敏感、不落第三方 | 自建:One-API / New API 起手 |
| 平台团队、完整治理(预算/护栏/审计) | LiteLLM Proxy |
| 高并发、低延迟、Go技术栈 | Bifrost |
| 已有K8s或服务网格 | Envoy AI Gateway / Higress |
| 已有Cloudflare边缘体系 | Cloudflare AI Gateway |
| 可观测优先、先看清再治理 | Helicone / LiteLLM + Langfuse |
中间层正在被重新定价。Stripe愿意为路由层开出100亿美元的传闻价,英伟达花129亿美元买了Hugging Face——模型和用户之间那一段,值钱已成共识。自建的门也一直开着,一台服务器、一个容器的事。走哪条路,看你的数据在哪、账单多大、谁来运维。