希鸥网产业观察

9月22日,AI行业迎来罕见的一幕:Anthropic发布Claude Opus 5.5,约一小时后,OpenAI发布GPT-6 Sol与GPT-6 Luna,两大巨头在同一天内先后亮牌。有意思的是,这两款新模型的技术路线上,处处可见中国研究者和中国公司的影子——Opus 5.5对“上下文”动手,GPT-6 Luna对“缓存”下手,前者对应的正是前OpenAI研究者姚顺雨提出的test-time compute理念,后者的缓存与解码优化则与DeepSeek的路线如出一辙。当预训练的边际收益见顶,行业增量正涌向“第二战场”,而这一轮,学术范式和工程范式的定义权第一次握在了中国公司手里。

先看Anthropic这条线。据Artificial Analysis的智能指数统计,在max档位下,Claude Opus 5.5平均每道题要输出11.9万个token,其中8.4万个是“思考”、3.5万个才是最终答案;而OpenAI旗舰GPT-6 Astra在同一档位只用了2.7万个。Opus 5.5走的是典型的test-time路线:官方声明所有成绩默认跑在“最大力度自适应思考”(adaptive thinking at max effort)下,且从这一代起不再提供“关闭thinking模式”的选项——推理过程本身成了模型的一部分。其逻辑是:预训练能堆的数据已近极限,智能的增量只能从推理现场去找,想得越久、答得越好。

这套“把智力搬进上下文”的理念,姚顺雨早有铺垫。2023年,他提出Tree of Thoughts(思维树),让模型在推理时展开多条思路、边想边搜索最优解,同一年又提出ReAct架构,让“推理”与“行动”交替进行。2025年4月,他在博客《The Second Half》中给出核心判断:AI上半场拼训练方法与模型,下半场拼如何使用与评估模型,增量正从“训练”挪向“推理与行动”。他把“思考”称为一种“奇怪的动作”——它不改变环境,却能让模型在面对无数“空盒子”时更容易挑中那100万美元的那个。Opus 5.5,某种意义上正是这一理念的大规模工程实现。

OpenAI这条线则指向“怎么便宜地想”。GPT-6 Luna输入0.1美元/百万token、输出0.5美元/百万token,比上一代直接砍半;缓存命中时读一次缓存仅0.01美元/百万token,比标准输入便宜90%。这套动作DeepSeek早已做过:2026年8月2日,DeepSeek上线“Context Caching on Disk”(磁盘上下文缓存),将重复上下文存入磁盘阵列,命中价同样砍到一折;到V4 Flash,命中与未命中价差拉大到50倍。GPU显存昂贵、磁盘便宜且容量大,把KV cache存进硬盘,重复上下文就从最贵的部分变成了最便宜的部分。

不止缓存,还有架构。GPT-6 Luna的上下文窗口为105万token,DeepSeek V4为100万token,两边几乎对齐——但百万上下文的KV cache,按标准注意力机制多数模型根本扛不住。DeepSeek的解法是MLA(多头潜在注意力)架构,将Key和Value联合压缩进低维潜空间,缓存潜向量、用时再还原;其V2技术报告显示,MLA将KV cache砍掉93.3%,生成吞吐提升至5.76倍,V4又叠加压缩稀疏注意力,V4-Pro在百万token上下文下KV cache仅为上一代的10%。此外,OpenAI官方博客披露的推测解码——用更小的draft模型与主模型并行“猜”token、主模型批量验收,让token生成效率提升15%以上——与DeepSeek V3的MTP(多token预测)思想上殊途同归:小的先猜、大的批量验,把串行解码变成并行。

为什么是“美国巨头做产品、中国公司定范式”的分工?原文的分析提供了一个视角:过去几年,头部大厂把资源、人才、注意力全部押注在预训练主战场,依据Scaling Law堆数据、堆算力、刷榜单;但当优质数据接近耗尽、预训练边际收益递减,行业增量自然流向推理时怎么想、长上下文怎么便宜的第二战场。这里还有一个反直觉之处——主战场上的优势在第二战场反而成了累赘:手里算力最多的一方最没动力抠成本,“堆卡就能解决问题”的思路让省钱从一开始就不在他们的议题里。只有算力吃紧的一方,才会把每一分钱花在刀刃上。

DeepSeek的MLA、磁盘缓存、稀疏注意力,本质上都是“穷则思变”。当年它们只是“没钱的替代方案”,是没办法的办法;可当全行业开始拼效率、拼单位智能成本时,这些“土办法”忽然成了最硬的通货。这一轮同日发布的两款新模型,无论是对test-time compute的拥抱,还是对缓存经济学的精打细算,都可视为中国范式被硅谷主流收编的注脚——定义模型的不再是硅谷单极,国内公司把定义转化成更便宜的解决办法,巨头们则负责最后一步:做成产品,卖给全世界。

当然,“抄”只是表象,工程化落地仍有分野:Opus 5.5用超长推理换智能的路线也意味着,一旦陷入困境任务,token消耗会原地爆炸,成本随难度飙升;OpenAI的缓存命中率则高度依赖前缀设计,真实负载中的账单并不只由单价决定。但大方向已经清晰:智能的价格正沿着帕累托前沿快速下探,而下一阶段的竞争,将不再是谁堆的卡更多,而是谁更会“想”、更会“省”。天下文章一大抄,看你会抄不会抄——这一次,抄作业的方向反过来了。