8月12日深夜,SpaceXAI发布Grok 4.6,距离上一代Grok 4.5发布仅一个多月。同一天,DeepSeek、阿里千问也推出新模型,多位测评博主在社交平台写道“又是一个不眠夜”。马斯克表现得格外高调,模型上线后两小时内转发约10条推文,称Grok 4.6“客观上是第1”。

希鸥网观察到,Grok 4.6进步幅度惊人。今年5月,Grok 4.3在大模型智能指数上仅排第17位,被OpenAI、Anthropic甩开明显身位。Artificial Analysis的最新数据显示,Grok 4.6智能指数得分61,与GPT-5.6 Sol持平,仅次于Claude Opus 5的63分和Claude Fable 5的62分,并超过Kimi K3的60分。

真正让开发者兴奋的是智能体知识工作场景。在GDPval-AA v2评测中,Grok 4.6拿到1753分,高于Claude Fable 5的1741分和GPT-5.6 Sol的1728分。Grok 4.6能持续完成跨步骤任务,包括研究主题、分析信息、在大型代码库中协作、把一个想法直接变成可运行的应用。这不再是聊天助手层面的比拼,而是AI打工能力的正面交锋。

Grok 4.6的定价延续了“加量不加价”策略。每百万输入/输出token为2美元/6美元,比Claude Opus 5的5美元/25美元和GPT-5.6 Sol的5美元/30美元低60%以上。Artificial Analysis测算,Grok 4.6每任务成本0.84美元,与Kimi K3相同,但智能分数更高。在智能体场景里,一项任务持续数十分钟甚至数小时,token消耗被迅速放大,省下的每一分钱都直接影响产品毛利。

SpaceXAI的进步不能简单归功于运气。今年6月,SpaceX以600亿美元全股票交易收购Cursor,补上了编程短板。Cursor向Grok 4.5训练注入了数万亿token真实开发数据,包含开发者修改代码、调用工具、与AI智能体协同工作的完整过程。Grok 4.6还进行了更长周期的补充训练,使用经过筛选的模型生成数据、高质量工程数据以及改进的优化器和训练方案。算力、数据、后训练方法、工程优化,每一环都在起作用。

希鸥网认为,这场翻身仗最直接的受益者是目前使用Claude和GPT-5.6 API的开发者——他们多了一个能力相当但成本低60%的选择。受损的是OpenAI和Anthropic维持高价订阅、高价API的定价体系。中国大模型厂商同样承压,DeepSeek和阿里千问选择同日发新模型,本质上是在争夺同一批价格敏感型开发者。AI大模型竞争从“谁的智商高”转向“谁的性价比高”,这才是Grok 4.6真正改写行业规则的地方。

创业市场往往高估短期波折,低估长期积累的价值。回看过去半年,Grok从第17名冲到与OpenAI并列,表面上是突然爆发,但因果链条早就埋下。就像1973年第一次石油危机时油价涨了三倍,回头再看,美联储宽松信贷、过度开支、美元脱钩黄金这些多米诺骨牌是按逻辑顺序依次倒下的。创业者判断趋势时,不能被当下热度蒙蔽,要在链条启动前找到那个最底层的支点。

什么火追什么,不火的不追,这是多数人踩过的坑。达利欧回忆,1973年之后股票无人问津、大宗商品突然流行,他因为此前在这个冷门领域的经历成了抢手货,被多米尼克公司聘为大宗商品业务主管,年薪2.5万美元。Grok的翻身恰恰是因为马斯克承认了差距,在编程不火的时候深度整合了Cursor。对创业者来说,在冷门期完成积累,远比在拥挤赛道里抢位置更有复利效应。

真正的投资人要时刻准备好应对猪腩期货连续跌停的教训。达利欧当年持有猪腩期货,连续几天跌停,眼睁睁看着每天损失200点而无力抽身。Grok 4.6的性价比路线本质上就是一套风险对冲机制:既赌模型能力追平对手,又用低定价保证哪怕能力稍有差距,开发者依然愿意切换。创业者做产品时,要给用户一个“哪怕不完美也值得试试”的理由,而不是把所有赌注押在“完美超越对手”上。

本稿件整理自网络,同步发布在希鸥网创投联盟9家网站。金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:meisceo25