2026年8月,全球大模型Token平均支付价格单月暴跌29%。跌至0.97美元/百万Token,首次跌破1美元关口。三个月前,这个数字还在2美元以上。同一时间,OpenRouter平台路由Token量环比增长47%,美元支出只微增7%。用量狂飙,单价崩塌。这是海内外旗舰模型与Flash轻量模型同步降价、缓存读取定价大幅下探共同造成的行业现象,指向的是大模型API市场定价体系的整体重构。

希鸥网观察到,最先把账单摊开的不是创业公司,而是Uber。2026年4月,这家公司全年AI工具预算已经花完。CTO公开表示,每名工程师月均API调用成本高达500至2000美元。为激励员工用AI干活,Uber甚至设立了Token消耗排行榜。钱花出去了,产出却难以对齐。COO Andrew Macdonald在一档播客里承认,AI使用量和实际生产的功能之间,很难建立直接联系。

降价不全是让利,而是增长叙事撑不住的前兆。OpenAI一个月内对GPT-5.6 Luna永久降价80%,随后又把旗舰GPT-5.6 Sol输入降价20%、输出降价三分之一。DeepSeek在5月把V4 Pro价格永久下调75%,8月扛不住成本压力又调了回去。每一刀都得尊重成本曲线。价格战本质是把抢用户的获客成本,换个科目记进了API账单。

真正让厂商敢下刀的,是推理成本结构的改写。大模型推理的大头在Prefill阶段。一段10万字文档要逐句拆成Token,并行计算注意力,生成KV Cache存入显存。第二次调用同一上下文时,直接读取缓存,边际成本几乎为零。Claude Fable 5.1把缓存读取从1美元降到0.25美元每百万Token,降幅75%。这不是打折,是把补贴精准投向Agent这类反复读长上下文的场景。

需求端的耐心先耗尽了。Meta、Amazon早期都鼓励员工猛烧Token,排行榜一度是标配。当AI账单增速远超业务价值增速,这些公司转头给Claude Code、Cursor设了单月Token上限。企业的动作很诚实:一边限制预算,一边把任务迁向开源模型。顶尖模型再聪明,也架不住财务部门问一句——这次调用,到底产出了什么可衡量的东西。

希鸥网认为,这轮价格腰斩的本质,是定价权从“智能领先”滑向“性价比领先”。闭源API的赚钱逻辑建立在旗舰模型的稀缺性上。一旦开源模型能力逼近、价格只到零头,稀缺性就被稀释。高盛One-Delta部门负责人Rich Privorotsky的判断很直接:大模型已进入下半场,问题从技术是否可行,转向成本是否可承受。用量涨47%、支出只增7%,说明新场景的爆发还没跟上价格坍塌的速度。

对创业者来说,路线选择是绕不开的分水岭。AI Enabled是在现有业务上叠一个智能助手,风险低,想象空间也有限。AI Native是从零用AI重构商业逻辑,像Midjourney那样把生成能力直接做成产品。传统企业该走Enabled路线保生存,但必须在内部孵化Native项目求增长。两条路径需要的团队基因、估值逻辑和增长曲线完全不同,混着做,两边都落空。

另一件容易被低估的事,是把AI嵌进组织的决策和流程,而不是当成一个更快的Excel。未来区分企业的标准不是有没有用AI,而是AI浓度有多高。落地最大的障碍往往不是技术,是部门墙和KPI冲突。销售怕AI削提成,法务怕幻觉担风险,运营嫌改流程麻烦。这些账算不平,买再好的模型也白搭。转型得由CEO亲自推,容忍短期效率波动。

付费模式的变化同样在逼近。SaaS订阅制假设所有用户消耗相似资源,AI把这个假设打碎了。同样一个接口,有人跑一句话,有人喂十万字上下文,成本差着几个数量级。按智能付费会逐步取代按席位订阅。创业者设计商业模式时,得想清楚自己卖的是调用量、任务结果,还是最终的业务价值。单价还会继续下探,等Token真正变成水电煤,AI应用的故事才算开始。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo