智能体来了,高通在重新画一张算力地图

摘要

计算该发生在哪里,又由谁来决定。

过去,计算产业的价值跟着设备和芯片走。买一台手机、一台电脑,买的是里面那颗芯片能算多快。

智能体改变了这个逻辑。它会按任务调用各处的算力,简单的在本地跑,复杂的交给云端,中间还可能经过耳机、眼镜和电脑。这样一来,芯片的边界还停在 SoC 上吗?

这届骁龙峰会,我们带着这个问题和多位高通高管聊了聊,他们的回答很一致。智能体确实在更上层,但很多最基础的事还是绕不开 SoC,比如计算放在哪里跑,模型怎么分配,传感器的数据怎么合在一起,内存和上下文怎么管,哪些数据留在手机上、哪些传到云端。在他们看来,到了智能体时代,SoC 不但没有被边缘化,反而更重要了。

手机、个人 AI、AI 战略,在高通三场不同的群访上,我们其实看到正在从不同角度回答同一个问题:智能体成了计算的主角以后,算力要怎么重新分配。

梳理下来,高通给出的是一张分成三层的地图。手机 SoC 是中枢,负责调度;耳机和眼镜是触觉末梢,要能自己做判断,但更多是传递信号;云和数据中心是延伸,要装下跟着用户不断积累、不断成长的记忆和信息。

手机 SoC 从「算得快」变成「定在哪算」

第六代骁龙 8 超级至尊版的 CPU 最高主频第一次冲到 5GHz,现在的 AI 负载越来越看重吞吐,对延迟没那么敏感了,为什么还要设计如此高的主频?

高通 CPU 产品管理负责人 Manju Varma 给的理由不是性能,是编排。智能体要很快完成任务规划,还要让任务在 CPU、NPU 和 GPU 之间频繁交接,CPU 的响应速度决定了这条链路的节奏。高通反复强调的自研 CPU,也是它想要的那个调度者的核心部件。

同时,二级缓存从上一代的两组 12MB 改成了共享的 16MB,总容量变小了。高通提到这是因为 FlexCache 让不同类型的核心低时延访问同一个缓存池,在智能体任务和游戏场景上,可以给出新的设计。

内存上的改动更能说明问题。高通技术公司产品管理副总裁 Vinesh Sukumar 提到,现在的智能体越来越多用上推理模型,典型的是 MoE 这类大模型,计算过程中会产生大量中间数据。如果把它们放到系统内存里再搬回来,功耗会很高。所以这一代明显加大了 Hexagon NPU 旁边的 SRAM,让数据就地存放。GPU 也是同样的思路。Adreno Neural Fusion 算出来的结果直接放在 GPU 自己的独立高速显存里,完全不用经过 DDR。

把这些回答放在一起看,高通今年在手机上做的,是把「调度」本身做成了硬件能力。它想证明,每一段计算该交给谁,由手机里这颗 SoC 决定。

我们的理解是,这里的调度,一半是在调度算力,另一半其实是在调度数据。在手机上,搬运数据往往比计算本身更耗电。CPU 冲高主频、缓存改成共享、NPU 和 GPU 各自加大本地存储,说到底都是在减少数据来回搬动的路程。这也解释了高通为什么这么看重 HBC 这类把内存和计算贴在一起的技术。

调度也不全是技术问题。高通技术公司高级副总裁兼手机业务总经理 Chris Patrick 讲过一个很实在的原因,高通之所以同时保留 CPU、GPU、NPU 三套 AI 引擎,部分原因是背后站着三类开发者。做游戏的希望 AI 嵌在 GPU 里,一部分开发者习惯把 AI 和 CPU 绑在一起,还有人想用算力最强的 NPU。高通没法替开发者做选择,只能三条路都铺好。换句话说,SoC 能提供调度的能力,但一段计算最终落在哪个引擎上,很大程度由开发者说了算。

商业上的选择也在同一个逻辑里。有人问手机厂商利润这么薄,凭什么买更贵的 AI 芯片。Chris 没有讲这些能力值多少钱,而是讲厂商自己的标准版、Pro 和 Ultra,有的用户只要 4K 30 帧,有的用户愿意花钱上 4K 60 帧。今年骁龙 8 至尊版第一次分成两款,至尊版和超级至尊版的底子几乎一样,差别集中在 AI、影像、内存这些最贵的新能力上。高通把新的计算调度能力分成两档,下放的节奏交给厂商自己决定。

还有人问到自研芯片。小米一边做玄戒一边用骁龙,OPPO、vivo 也可能跟进,高通怎么保住位置?Chris 说客户有自研 SoC「在高通的历史上并不少见」,双方是互补关系。客户可以自己做一颗芯片,但要把 CPU、GPU、NPU 和内存之间的调度一起做好,门槛要高得多。

耳机和眼镜不能只是传声筒

到了个人 AI 群访,这张地图延伸到了人的身上。

第二代骁龙音频平台至尊版最值得说的,是环境模式下功耗降低了 40%,而不是 AI 算力翻倍。高通技术公司音频产品管理资深经理 Andrew Laister 解释,环境模式就是耳机一直「开着」,随时准备回答你的问题,这是他们现在最看重的新指标。以前算耳机功耗,看的是一次能听多久歌;现在看的是智能体能「在线」多久。

我们问高通技术公司高级副总裁兼 XR、可穿戴及个人 AI 业务总经理 Ziad Asghar,高通是在继续提升单个设备的算力,还是已经在给个人智能体铺节点?他明确选了后者,分工也讲得很具体。很复杂的问题交给云端,需要很快响应的放在手机甚至眼镜上,介于两者之间的由手机本地处理。其中有一句让我们印象最深:「终端上的 token 是免费的,云端的 token 要花钱。」

这句话值得多想一步。端侧的 token 其实并不免费,它的成本已经算进芯片和整机的价格里,用户买设备时一次付清。云端的 token 则是用一次付一次。所以这句话背后,是两种商业模式的差别:芯片公司希望价值体现在一次性卖出的硬件上,模型和云服务公司则希望用户持续为调用付费。计算留在端侧越多,对高通越有利。

那戒指这种小设备,最后会不会只是个采集数据的通信模组?Andrew 的回答很有意思。如果每个用户的每台设备都只管往上传数据,服务器会被海量通信压垮。所以终端必须有判断力,知道在什么时候、什么位置发起连接。在高通的地图里,终端要先替云端筛一遍信息,只做传声筒是不够的。

不过,它们自己并不决定去哪。Andrew 另一段话说得很清楚。用户打交道的对象是服务,由服务来决定 AI 任务放在云端、手机还是耳机上。高通把能力铺好,路线由上面的服务去选。

眼镜这一层,Ziad 讲得更细。他把智能眼镜分成了几档:只有音频的,第二代骁龙音频平台至尊版就够了;带计算机视觉摄像头、只用来给 AI 提供情境的,再往上是带显示屏的,用第一代骁龙 AR1 平台;要做沉浸式增强现实的,用第一代骁龙 AR2 平台。每一档对应不同的算力、功耗和价格。

骁龙 START 计划是这套思路的商业化版本。高通直接做好一个装进镜腿就能用的 AI 眼镜模块,配上打通眼镜、手机和云的全套软件,首批伙伴 Inspecs 旗下大约 18 个品牌可以直接接入。Ziad 说他们刚开始接触中国客户。中国本土品牌多,过去很难快速做出成熟产品,这套模块能帮他们提速。

企业场景又是另一套路线。Ziad 说,工厂或者油气现场的工人戴的眼镜,数据不应该经过员工自己的手机,而是要直接送到企业自己的服务器或私有云上。第二代骁龙音频平台至尊版的超低功耗 Wi-Fi 能直连云端,传输速率也从上一代的 MCS3 提升到了 MCS7。

这一点很说明问题。在个人场景里,决定计算去哪的主要是成本和速度;到了企业场景,隐私和合规排到了前面。展区里高通眼镜团队的一位负责人也讲过类似的考虑。他们正在研究把更多智能体能力放到眼镜本地,一是为了省下云端的成本,二是为了少往云端传数据。调度看的不只有算力,还有钱和信任。

但到了中国市场,还有个现实问题。第二代骁龙音频平台至尊版不少直连云端的能力要靠 Wi-Fi 6E,而 6GHz 频段在中国大陆并没有开放给消费电子使用。问到会不会出中国专供版,Andrew 讲了协议层面的好处,又说它也支持 2.4GHz 和 5GHz,最后补了一句:「希望它在中国也能为你们所用。」

这些贴身记录用户信息的硬件,不只替云端筛数据,也可能成为新的数据入口。群访最后,有同行问高通的芯片离真实场景的数据最近,会不会直接做数据的生意。Ziad 没有回避。他说第一视角的数据可以用来训练机器人,手部和眼部的数据可以用来做追踪,高通有条件搭这样的平台,也已经在和一些公司合作。

在展区里,那位眼镜团队的负责人讲得更接地气。他平时喜欢把手机收起来,和太太散步的时候会随口问一句阿森纳下一场什么时候踢,开车上班时让眼镜往待办清单里加一条事情。他还特意强调,平台上的模型都托管在高通自己的云上,「数据不会发给 Anthropic 或者 ChatGPT」。

一家芯片公司自己托管模型,说明这张地图已经延伸到了云上。

让这张网连到云,还要带上记忆

高通技术公司执行副总裁兼技术规划、边缘解决方案和数据中心业务总经理马德嘉(Durga Malladi)的那场群访,把地图的最后一层补齐了。

说到 CPU 为什么重要,他认为到了智能体时代,NPU 和各种加速器负责推理,编排调度仍然由 CPU 完成,这件事「从终端一直延伸到数据中心」。高通在数据中心的目标是 2027 财年营收 50 亿美元、2029 财年 150 亿美元,客户里已经有 Meta 和亚马逊 AWS。

问到存算一体,他说高通是这个趋势的开创者。HBC 的思路是把 DRAM 堆在计算裸片上,先用在数据中心,之后也会带到终端设备上。问到怎么应对英伟达的 CUDA,他讲的是高通今年 7 月收购的 Modular,其中的编程层 Mojo 会完全开源,而且能跑在任何厂商的硬件上。

问他打造一颗 AI 芯片最难的是什么,他没有挑某一项技术,而是说制程、计算和内存三件事必须同时统筹。这和手机团队的思路一致,高通不认为胜负取决于某一个单点,而是取决于把所有环节串起来的能力。

他对端侧模型的看法也值得一提。端侧已经能跑 300 亿参数的模型,但他认为不该只看参数,模型质量更重要。而且智能体本来就不会只用端侧模型,它还会在云端做部分推理,调用网页和各种工具来获取信息。换句话说,连高通自己也承认,一个智能体任务天然是端云混合的。端侧的竞争重点,正在从能跑多大的模型,转向能不能跑好合适的模型。

最能说明他思路的,是关于个人上下文的回答。他设想了一个场景。你先用骁龙手机工作一小时,再用骁龙笔记本工作两小时,两台设备各自积累了一份个人知识图谱。这两份图谱必须一致,因为它们对应的是同一个人。高通要做的,是让上下文在所有骁龙设备之间始终跟着用户。至于长期记忆,现阶段先在端侧把知识图谱做得足够高效,随着信息越积越多,再对它做压缩,以后也许有一部分会放到云端。

把三层串起来的是用户的上下文。这是马德嘉给整张地图补上的最后一根线。不过他自己也承认,要做到这一点,需要 OEM 厂商和云服务伙伴一起推进。

难点也正在这里。上下文是智能体时代最值钱的东西,手机厂商有自己的账号和系统,模型公司有自己的应用和云,谁都想把它留在自己手里。高通说的「只要是骁龙设备,上下文都跟着用户走」,前提是这些伙伴愿意把上下文交给一套跨品牌的机制。

算力、模型和调度能力,高通都准备好了。但应用愿不愿意被调用,上下文归谁,用户敢不敢把事情交出去。QwenBook 先做 PC,本身就说明手机上的信任门还没打开。在 QwenBook 上,我们看到了一部分信任设计,关键一步要在手机上确认。但我们还没看到它对「意图」的理解,它依然是我们下指令、它去执行,离理想中的个人智能体还有不小的距离。

不过,通过高通的三场群访,我们也能看到一张完整的算力地图。中枢负责调度,终端负责感知和过滤,云端负责延伸和记忆,每一层高通都准备了对应的芯片和方案。只是地图上的路要怎么走,由成本、隐私和应用之间的权限共同决定,这些都不是芯片能单独说了算的。高通画好了地图,下一步要看的是,谁来决定算力在哪里使用。

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。