在2026年骁龙峰会上,高通与阶跃星辰、无量火科技、江波演示了一个端侧AI典型案例:仅用本地模型,AI读懂一封邮件、提取行程信息、同步日历、推荐航班和酒店,再草拟一封回复。这段需要理解、规划和连续执行的任务完全在端侧完成。高通公司总裁兼首席执行官安蒙在主题演讲中表示,智能体AI并不仅仅是为终端新增一个功能,它实际上创造了一种全新的终端工作流程。
如果说两年前高通主要在证明大模型能装进手机,今年它更想证明装进去的模型能够承担更完整的工作。2024年,高通自研Oryon CPU开始搭载在手机上,展示端侧大模型的可能性;2025年,第五代骁龙8至尊版引入Personal Scribe和个人知识图谱,将智能体写入产品方向;今年,第六代骁龙8至尊版与超级至尊版双旗舰均采用2nm工艺,超级至尊版设备频率拉至5GHz,CPU负责任务调度、NPU承担模型推理、低功耗感知单元处理后台信息,为不同类型的AI工作分配专属计算通道。
当AI从单次问答变成持续工作流程,缓存、内存带宽和低功耗感知变得更为重要。高通新双Micro NPU架构性能提升85%,功耗降低20%,提升了本地处理低时延、离线可用和减少数据上传的潜力,复杂任务仍可调用云端。对比2024年端侧最多部署7B模型,此次峰会上高通已与阶跃达成合作,30B的MoE模型在参考设计上完成邮件理解、行程规划和日历同步,被视为一次可感知的跨越。
更复杂的AI应用如今也可由多个模型分工完成。在AI公司Deepgram展示的AI播客应用中,NPU上的语音模型负责转写并区分发言者,GPU上的Gemma模型理解话题、生成追问建议,让异构计算变成可理解的场景。进入2026年,芯片厂商的共同趋势是能力边界与竞争边界同时扩大,对高通而言,这种扩展不只是从手机走向PC、眼镜、汽车和数据中心,还包括围绕模型适配、软件工具和跨终端协作补齐能力。
扫码查看视频号
咨询
咨询