在深圳,一家十人规模的AI创业公司每天有数百个Agent同时运行,分头写代码、做研究。团队最初使用OpenAI的GPT系列模型,但随着任务增多,发现并发处理能力有限,开始寻找能同时运行更多任务、调用价格更低的模型。经过试用,团队最终选择DeepSeek V4.1 Flash,认为其反馈更快、费用更低,是眼下“性价比最高”的选择。
模型调用量激增带来成本压力。Google CEO Sundar Pichai曾在Google I/O大会上透露,有公司到5月全年Token预算就快用完,Google内部AI编程工具每天消耗的Token从3月的5000亿涨到5月的超过3万亿。与此同时,OpenClaw掀起的“龙虾”热潮让普通用户也开始用Agent处理日常事务,这是比编程更低门槛、更高频的需求。
在此背景下,模型厂商尤其是中国厂商接连推出Flash版本的小参数模型。7月31日,DeepSeek发布V4 Flash正式版;8月26日,阿里Qwen团队的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash同日亮相;9月,DeepSeek又推出V4.1 Flash。这些模型参数均在千亿级别(100B至500B区间),远小于当前旗舰模型万亿级别的参数。Flash命名通常代表更快、价格更低的版本,适合反复处理日常任务,复杂问题仍可交给旗舰模型。
小模型阵营仍在扩大。月之暗面和腾讯混元都在推动Flash模型版本的开发。有开发者将DeepSeek V4 Flash的评测成绩与任务成本画在一张图上,提出“斩杀线”:性能不如V4 Flash、做同样任务却更贵的模型将被淘汰。8月下旬,美国编程Agent平台Cline免费提供一款未公布身份的模型,不到一周承担了平台超过11%的推理量,随后智谱认领该模型,正是GLM-5.3-Flash。
资本市场已给中国模型公司押下高额赌注,商业化成为更现实的问题。公开数据显示,到今年8月,智谱ARR约为16亿美元,市销率高达46倍;尚未上市的DeepSeek估值达其预估年化收入的163倍,而Anthropic市销率约为20倍。中美模型竞争由此出现另一条主线:在追求AGI、争夺模型能力上限的同时,谁能用高性价比模型完成更多真实任务、服务更多用户,并打开更大市场。
扫码查看视频号
咨询
咨询