极客公园的测试工程师在Canvas画布上拖出200个三角形boid,给DeepSeek V4 Pro正式版(0813版本)下达了群体涌现模拟任务。170秒后,761行完整HTML一次通过,彩色轨迹、捕食者交互、glassmorphism控制面板全部就位。成立于2023年、由幻方量化孵化的DeepSeek,在8月6日预告“API定价将大幅上调”之后,交出的不是涨价通知,而是这枚面向代码Agent场景的正式版模型——输入每百万token仅3元,输出6元。
希鸥网观察到,这轮升级的核心是面向代码Agent场景的大规模后训练。预览版是纯文本模型,正式版首次原生支持图像推理,DeepThink引擎能在同一思考流中分析图片、解析截图、处理混合文档,对需要“看图干活”的Agent场景是从无到有的突破。价格与预览版持平,8月6日的涨价预告悬而未决,0813版本成了开发者在“最后窗口期”抢占性价比高地的抢手货。
成本结构决定了DeepSeek的定价不是成本定价,而是竞争定价。每百万token输入3元,约为Fable 5的十分之一、Kimi K3的三分之一,这条“比我强的没我便宜,比我便宜的没我强”的规律,在Agent能力从几乎不可用暴涨到能正面硬刚头部闭源模型之后,杀伤力比预览版时期放大了一个量级。涨价预告更像是一种心理锚定——先让开发者意识到当前价格不可持续,再让新版能力说话。
但翻车方式本身更值得玩味。寻路算法可视化任务中,开着thinking模式,V4 Pro用了16384个输出token,其中13394个花在内部思考上,留给实际代码的不足3000个,HTML写到一半直接截断。关掉thinking重跑,54秒输出715行完整代码,动画、迷宫生成、暗色主题一应俱全。推理token占据输出配额的80%以上,挤压实际内容空间,这是V4 Pro的真实特征,也是所有长代码生成任务的隐性陷阱。
跑分依然不是全面碾压的成绩单。HLE不使用工具时42.7分,落后Claude Opus 4.8的49.8和Fable 5的53.3;NL2Repo以61.5落后Opus 4.8的69.7。纯知识推理和最复杂的软件工程任务尚未坐上头把交椅,但Boids模拟、番茄钟产品化补全、寻路算法三个真实任务已经证明:在“一次性生成完整可运行代码”的工程场景里,V4 Pro把成本和能力的平衡点推到了新位置。
希鸥网认为,这场博弈最受伤的是腰部定价的模型厂商。DeepSeek用3元的定价锚定了“代码Agent基础能力”的市场价格带,性能接近头部、价格只有十分之一,迫使Claude Opus 4.8和Fable 5必须用更高的可靠性或更深的场景绑定证明溢价合理性。而开发者的注意力也被重新分配——当低价模型的能力足够完成大部分工程任务,高端模型的增量价值必须清晰地转化为可量化的效率提升,否则订阅流失只是时间问题。
代码Agent的接入并不顺滑,V4 Pro的thinking模式在复杂代码场景中挤占输出空间,这警示创业者:模型能力越强,人的判断越不能缺席。正如管理中的深挖程序,真正有效的方式是让开发者亲手参与Agent工作流的诊断——实测maxtokens参数、对比思考与输出的比例、记录截断发生的位置——而不是把问题交给模型自己解决。把相关人员纳入诊断流程,得出最佳答案,而不是让更多人舒服的答案。
桥水联合CEO戴维·麦考米克当年处理客户服务团队标准下滑时,直接开除了导致标准下降的人,把一位高标准的顶级投资分析师放到关键岗位,再配上有经验的管理者梳理工作流程。今天的AI工具选型同理:V4 Pro这类模型降低了生产力门槛,但也诱使团队把“模型输出”误认为“交付标准”。创业者需要做出艰难的人事抉择——谁有能力驾驭新工具扛住更高目标,谁应该从核心流程中被移开,标准不能因为工具变强而放松。
不必猜测哪里会出问题,观察历史数据就能理解并设计改进。极客公园用三个测试任务给V4 Pro立了基准线:Boids一次通过,番茄钟实现产品化补齐,寻路算法截断暴露极限。这给创业者的启示是:像设计机器一样设计Agent工作流,把thinking模式的开关、maxtokens配额、输入格式都变成系统参数,用每次任务数据反哺设计。创意和个性仍然重要,但从问题根源出发,做出艰难的工程取舍,才能让改进闭环而不是反复推倒重来。
金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo