智能体将定义移动计算的下一个时代,这些智能系统能够理解用户个人情境、跨应用协同运行、持续推理,并根据用户意图完成操作。

随着AI智能体化的不断深入,脱颖而出的架构不是依赖单一庞大模型处理所有任务,而是由多个专用模型组成的系统,根据任务、情境和用户需求进行智能调度。
这一转变不仅需要更快的AI推理能力,更需要面向持续运行、多模态且低时延智能打造的全新架构。在下一代旗舰移动平台中,高通技术公司为此奠定了技术基础。该平台将引入全新的高通 Hexagon NPU和两项关键特性,包括全新Element Accelerator和更大的共享内存系统。
Element Accelerator专为赋能当今的生成式AI和智能体AI的Transformer工作负载而打造。结合向量计算单元和标量计算单元,它能够加速大模型中最关键的运算,帮助智能体更快地响应、更高效地推理,并在保证移动端能效的前提下,提供更丰富的体验。
同样重要的是,Hexagon NPU大幅扩展了大容量共享内存。通过让多模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,该平台能够缓解内存瓶颈,让智能体在处理更长上下文、调用更多工具以及执行更多并发任务时,始终保持流畅响应。
Hexagon NPU的核心亮点
上述技术创新共同定义了新一代Hexagon NPU的角色:直接在终端侧运行更多智能体AI体验。Element Accelerator、向量与标量扩展单元和更大的共享内存,组成一套协同架构,助力NPU加速Transformer工作负载、处理控制逻辑复杂的智能体任务,并将更多上下文数据保留在靠近计算单元的位置。
Hexagon NPU的全新特性
对于智能体而言,性能决定了多任务处理时智能应用是否能保持响应速度、支持更长上下文理解和高效运行。Hexagon NPU面向始终运行的AI、长上下文推理、多模态模型、并发智能体以及低时延行动闭环而设计。
大容量共享内存有助于让模型状态、更多上下文信息和KV-cache数据更靠近加速器,减少访问外部内存的频次,并帮助智能体以更少的等待时间完成回答、修订、规划和执行。这意味着支持更长的上下文窗口、更快的token生成速度,以及智能体在工具和任务之间更顺畅的切换体验。
Element Accelerator进一步提升了生成式AI和智能体AI中最关键的Transformer运算性能。同时,向量计算单元助力实现高吞吐量AI数学计算,而标量计算单元则能够支持智能体对决策逻辑、路由和编排能力日益增长的需求。
更大模型,更低DDR压力
Hexagon NPU同样面向下一代模型架构而打造。
高通技术公司正与领先的内存和模型厂商合作,引入混合专家模型(Mixture-of-Experts,MoE)构建新一代终端侧AI架构。这意味着,一个300亿参数的MoE模型在保持数百亿参数可用的同时,在NPU上每次生成一个词元仅需激活约30亿个被路由选中的参数。与每次推理都需要更大部分网络参与的密集模型不同,MoE会根据输入动态选择专用专家网络,从而减少实际计算负载和内存带宽需求。结合智能的专家模块闪存到内存加载管理机制与缓存技术,这种方法能够以低功耗和低内存需求的方式实现更大模型级别的AI体验,为智能手机带来响应迅速且注重隐私保护的生成式AI。混合专家模型通过选择性激活专用专家网络,能够提升效率和质量,无需每次请求都调用整个模型。
这一方法也与更完整的精度支持策略相辅相成。对INT2、INT4、INT8、FP8和FP16的支持,使开发者能够更灵活地在性能、内存、模型质量和功耗之间取得平衡。规模更小、更高效的模型可以承担更多端侧AI任务,而更大的模型则在处理复杂任务时才被调用。
对于基于INT4的模型,该平台可实现最高50%的预填充性能提升、更快的解码吞吐速度、增强的推测解码,带来更及时、更快的每秒词元生成速度。其结果是更加即时的端侧AI体验,让智能体响应更快速、性能更强大,也更具个性化。
专为在终端侧运行智能体AI而生
凭借下一代Hexagon NPU,我们的下一代旗舰移动处理器旨在让智能体AI更加本地化、高效且响应迅速。它融合了加速、内存、精度和模型加载创新,使更多智能能力能够在靠近用户的终端运行。
Hexagon NPU是这一切的核心:一个由Element Accelerator、向量和标量计算单元、更大的共享内存以及基于闪存的模型加载机制共同构成的协同架构,专为提供下一代终端侧AI体验提供支持。
智能体AI时代已经到来。下一代骁龙旗舰移动平台专为在终端侧运行智能体AI而打造。
