近日,谷歌DeepMind发布了一系列新AI模型,包括Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。然而,新模型上线后迅速引发大量负面反馈。早期用户实测显示,Gemini 3.6 Flash在前端界面生成与空间推理等关键任务上表现不佳,其输出代码逻辑混乱、交互断裂,被部分开发者戏称为“史上最差”模型。这一反应在技术社区中迅速传播,引发对谷歌AI研发方向的讨论。
希鸥网观察到,此次发布的Gemini 3.6 Flash并非外界期待已久的正式版Gemini 3.5 Pro,而是被部分用户视为“阉割版”的快速迭代产品。在Vertex AI平台上线后,该模型在测试中不敌Claude Fable 5、GPT-5.6 Sol等竞品,甚至不如Meta的Muse Spark 1.1。有开发者使用2-shot测试其界面生成能力——这原本是Flash系列的强项——结果却输出组件嵌套混乱、逻辑断裂的代码,无法投入实际使用。
在空间推理方面,Gemini 3.6 Flash的表现同样令人失望。有用户录制视频逐帧测试,发现模型对基础位置关系、方向判断的准确率相比3.5 Flash出现明显退步。即便开启高性能推理模式,结果仍不理想,一位用户评价道:“木纹纹理看起来还行,但没什么特别之处;大理石近距离反射效果有bug。”在第三方综合测评平台Artificial Analysis上,该模型得分与3.5 Flash完全相同,但表现不如Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5等多款竞品。
此外,有网友发现Gemini 3.6 Flash的知识截止日期存在不实。该模型声称知识更新至2026年3月,但实际测试显示它对2025年及2026年的大部分内容一无所知,真实知识似乎停留在2025年1月。这一发现加剧了用户的不满,有开发者直言:“这是一个未完成的模型。”谷歌方面在发布公告中承认,Gemini 3.5 Pro尚未准备好,而Gemini 4已启动“目前最雄心勃勃的预训练”,但未透露具体时间表。
同时发布的Gemini 3.5 Flash-Lite主打高速推理,每秒可输出350个token,但用户反馈其快速给出的答案往往错误率高。有评论指出:“快有什么用?快速给出一个错误答案,等于用更高的效率浪费用户的时间。”而网络安全模型Gemini 3.5 Flash Cyber则聚焦特定应用场景。整体来看,此次发布被部分开发者视为谷歌在算力紧缺背景下“赶鸭子上架”的产物,甚至有用户建议DeepMind将资源转让给Moonshot等竞争对手。
希鸥网认为,谷歌此次新模型遭遇口碑滑铁卢,折射出AI企业在快速迭代与质量把控之间的深层矛盾。在竞争白热化的AI赛道,版本号升级和速度指标固然重要,但若牺牲核心效用与用户信任,反而可能削弱长期竞争力。对于创业者而言,这一事件提醒:技术创新应回归真实价值,而非陷入“版本号游戏”的短期竞赛;在资源有限时,聚焦打磨核心能力比盲目追赶进度更具战略意义。
在创业过程中,如何平衡规模扩张与能力匹配是关键课题。正如《原则》一书所揭示,企业从5人发展到60人、从60人到700人,挑战的难度并无本质变化,只是性质不同。创业者需要认清自身阶段,避免因规模扩大而忽视管理能力的同步提升。真正的成长不是盲目追赶,而是在每个阶段都能找到适配的组织能力,持续解决新问题,而非重复旧错误。
创业者还须警惕“能力预期谬论”。《创业维艰》指出,不能以企业未来规模来评判当下管理者,管理能力是渐进习得的,提前更换主管反而会造成团队动荡。在季度复盘时,应仅对照当前业务匹配度来评估人才。同时,CEO的三大核心评估维度是:是否制定正确战略、是否能带团队落地执行、是否达成匹配阶段的经营结果。单一数字无法定义CEO好坏,战略、执行力与业绩三维度需综合评判。
个人成长层面,创业者应建立清晰的“时间成本”意识。《创业90条心得》强调,时间是创业者最稀缺的资源,要主动外包低价值事务,将精力聚焦于战略决策、核心客户关系与团队建设。同时,保持输出是一种高效的自我成长方式:通过写作、分享或教学,将模糊经验转化为清晰逻辑,既能深化认知,也能构建个人品牌。每月复盘时,应做到“对事不对人”,以客观记录、温和分析和具体改进替代自我批判。
2026人工智能+实战应用及产业创新论坛将于7月31日在南京举办,欢迎全国各地人工智能创业者报名。本文内容整理自网络,将同步发布在希鸥网创投联盟网站(希鸥网、AI联播网、斯贝瑞品牌资讯、华商资讯网、金鸥财经、锐CEO网、AEXNEWS美讯社、创新日报)。欢迎媒体合作、会议咨询、纳斯达克大屏等业务对接~ 如需修改或发布文章,请加微信号:sheisceo