7月8日,Ramp Economics Lab 公布了一组美国企业 AI 支出数据:6月,在有 AI 支出的企业中,5.8%用上了模型服务平台。1月时,这个比例还是4.5%。
在这些企业中,85.8%也在使用 OpenAI,93.2%也在使用 Anthropic。至少使用两者之一的比例达到96.4%。
模型服务平台目前更像一条新增渠道,还不是 OpenAI 和 Anthropic 的替代品。
但“客户还在”,不等于“所有调用都还在”。这正是本文想追问的问题。
这里说的“长尾调用”,不是低价值任务。它指数量大、重复度高、单次出错风险较低,没必要一直占用最强模型的任务。
先把证据边界说清。Ramp 看到的是企业向谁付钱,看不到每次请求用了哪个模型。企业同时付费,可能是在分散供应商风险,也可能是不同部门各用一套工具。它不能直接证明一次任务已经拆给多个模型。
所以,下面讨论的是一种可能路径:企业有了多个模型入口后,会不会再按任务分配调用。这是基于成本和工程条件的推论,不是 Ramp 数据已经证明的事实。
一、多供应商先出现,任务路由才有可能
用模型服务平台的企业,6月人均 AI 支出中位数是248美元。普通 AI 付费企业只有10.59美元。两者相差约23倍。
最早接入模型服务平台的,不是 AI 支出最低的企业,而是 AI 用得最深的一批企业。这说明便宜模型未必让企业少花钱,也可能让企业把 AI 用到更多地方。
刚开始试 AI,企业只关心模型能不能干活。调用量小,账单也不显眼。等 AI 真正进入日常流程,企业算账的方法就变了。
以知识库 Agent 为例,一次完整回答的背后,可能要跑查询改写、文档检索、结果排序、材料摘要、答案生成和引用核验。如果每一步都用最强模型,效果未必更好,账单却会一路往上涨。
这只是任务路由的一种典型场景,不是 Ramp 数据里的企业都在这样做。更简单的情况也很常见:内部工具用一家,对客产品用另一家;或者同时接入几家,避免被单一供应商锁住。
企业不会一上来就换模型。它们通常会先缩短上下文、使用缓存、减少重复检索、合并请求,或者用规则系统替掉部分模型步骤。
这些办法还压不住成本,企业才会考虑按任务换模型:
- 批量摘要、文档解析、查询改写、工单分类、样板代码和格式转换,交给便宜模型。
- 评审、判断和风险评估,留给强模型,必要时再加人工复核。
多供应商采用已经出现。按任务精细路由,还要看成本压力、评测能力和治理规则能不能跟上。
二、任务一拆,模型就不能写死
任务拆开后,企业得先建一个统一入口,再把不同模型和供应商接进来。
OpenRouter 更像一个托管模型市场。同一个模型可以由多家厂商提供服务。OpenRouter 会按价格、吞吐量和延迟排序,出故障时还能切换供应商或模型。
LiteLLM 更像企业自己搭的总闸门。它不负责卖模型,而是把企业已经接入的接口管起来,再做路由、负载均衡、重试和故障切换。
不管企业是为了拆任务,还是为了避免供应商锁定,都需要统一入口。过去换模型,工程师往往要改代码、调接口。现在,很多切换可以在网关里改配置。当然,效果和业务测试仍然不能省。
企业可以继续给 OpenAI 或 Anthropic 付费,却把一部分请求交给别的模型。客户还在,不代表所有调用都还在。
三、网关能接很多模型,企业却不会随便接
多模型入口解决了“怎么切”,却没有回答“能不能用”。任务一旦拆开,企业马上要判断:哪些数据能发给哪些供应商。
所以,便宜模型有机会接走长尾任务,不等于中国模型能大规模进入美国。
DeepSeek 曾在2025年1月短暂升至0.3%的企业采用率,随后很快回落到0.1%。2026年5月,Ramp 又观察到部分美国企业开始直接向 DeepSeek 付费。
但这股回暖能否持续,还不好判断。整体占比仍然太小,离大规模使用还很远。
挡在前面的不只是模型能力,还有地缘政治、数据安全、供应商审查和本地监管。
反过来也一样。美国模型想在中国面向公众提供服务,也要过内容、数据和备案这几关。
这样再看 GLM-5.2,它不能证明中国模型“攻进美国企业”。它更适合说明,低价模型为什么值得一测。
OpenRouter 页面显示,GLM-5.2 支持约100万 token 上下文,面向长程 Agent、项目级软件工程和多步骤自动化。截至7月12日,Z.ai 托管端点的挂牌价是每百万输入 token 1.40美元,输出 token 4.40美元。OpenRouter 当时显示70%折扣,折后约为0.42美元和1.32美元。第三方托管价格还会不同。
这样的上下文和折扣价,足以让它进入工程团队的测试清单。但真要上线,企业仍要审查模型来源、托管方、数据路径和供应链风险。
中美企业都可能把任务拆给多个模型,但两边接入的,多半不是同一批模型。
四、治理先划红线,价格再决定怎么分
企业挑模型,先要分清三件事:模型是谁做的,谁在托管,数据最后去了哪里。
这三件事先划出可用范围。价格只在这份清单里发挥作用。这样一来,成本和治理就不是两个并列标准,而是前后两道筛选。
便宜,只能换来测试机会。
模型如果老是出错,重试和人工复核很快就会吃掉价格优势。企业最后算的,不是一百万 token 多少钱,而是完成一件事到底要花多少钱。
价格和效果过关,还不够。
企业还要看数据去了哪里、供应商在哪里、数据会留多久,服务断了能不能顶上,内部能不能查清每一次调用。
同一个开放权重模型,既可以放在企业自己的服务器里,也可以交给第三方平台跑。模型还是那个模型,风险却不是一回事。
OpenRouter 可以把请求只发往零数据留存端点。但这条规则只约束推理端点,不管用户另外开启的插件和外部工具。它也不能代替企业对数据存放地点和内部审计的检查。
所以,多模型网关不只要省钱,还要管住哪些任务能用哪些模型,数据能发往哪里,出了故障该切到哪家。
治理决定哪些模型能进场。能力、稳定性和价格,再决定每个模型分到多少任务。
回到 Ramp 的5.8%。这个比例还很小,谈不上市场换代。
但 AI 支出强度很高的企业,已经开始同时购买模型厂商和模型服务平台。它们可能是在分散供应商风险,也可能在为任务路由铺路。Ramp 的数据还分不清两者。
如果统一网关、效果评测和治理规则补齐,选模型就可能从一次采购,变成持续调度。中美两边都可能这么做,只是各自会从本地能用的模型里挑。
最贵模型不会一夜被换掉。它最可能先丢的,是那些本来就没必要交给它的活。
主要信源
- Ramp Economics Lab(2026年7月8日):Our latest data on China vs. the American AI Labs
- Ramp Economics Lab(2026年6月3日):Top SaaS Vendors on Ramp (June 2026)
- OpenRouter:Z.ai: GLM 5.2
- OpenRouter 文档:Provider Routing
- OpenRouter 文档:Model Fallbacks
- OpenRouter 文档:Zero Data Retention
- LiteLLM 文档:Routing & Load Balancing
- LiteLLM 文档:Auto Routing
- 国家互联网信息办公室:生成式人工智能服务管理暂行办法
信息截至2026年7月12日。模型价格和企业采用率会继续变化,引用时要保留统计口径和时间。

