快讯资讯
手机优化
系统数码
网络通信人工智能
网站游戏
测评专题

  高通披露新一代 Hexagon       苹果 iPhone Duo 折叠屏手机    

高通披露新一代 Hexagon NPU 细节:两大技术打造全

时间:2026-09-11 10:57 来源:IT之家 人气:

随着时间来到 9 月,一年一度的高通骁龙峰会也越来越近了,下一代骁龙旗舰平台也将揭开面纱。而关于全新的骁龙旗舰平台,高通不久前已经通过官方博客分别披露了全新 Oryon CPU 以及 Adreno GPU 的部分特性,还是非常有看点的。而今天,高通又发文介绍了全新 Hexagon NPU 的升级看点。下面我们具体来看一下。

在博客文章中,高通表示他们正在打造全新的 AI 基础能力,其核心是全新的 Hexagon NPU 以及两大关键创新特性。

第一大特性为全新的 Element Accelerator,专为驱动面向当今的生成式 AI 和智能体 AI 的 Transformer 工作负载而打造。

结合向量计算单元和标量计算单元,它能够加速大模型中最关键的运算,帮助智能体更快地响应、更高效地推理,并在保证移动端能效的前提下,提供更丰富的体验。

Hexagon NPU 还将大容量共享内存(Large Shared Memory)最大扩容达 50%。这能将上下文和 KV-cache 数据保留在 NPU 内部,同样可以减少访问 DDR 的次数,降低内存读取和时延,并为其他工作负载释放宝贵的内存带宽。

由此 NPU 得以专注于推理,更快、更高效地交付结果。即使端侧模型要处理更长的上下文窗口、更复杂的推理、更多的工具调用以及并发任务,智能体体验也将实现更及时的响应。

全新的 Hexagon NPU 旨在实现更快、响应更及时的 AI。针对 INT4 模型,其预填充速度提升 50%,这将提升提示词处理和上下文理解的速度,实现近乎即时的交互体验 —— 针对 INT4 模型首个词元生成时间低于 1.5 秒。

高通的 NPU 架构设计也与更完整的精度策略相辅相成。除 INT4 外,这次还支持 INT2、INT8、FP8、FP16 精度,为开发者提供更大的灵活性,以在性能、内存、模型质量和功耗之间取得平衡。

这些技术提升让全新骁龙旗舰平台的 NPU 能够支持下一代模型架构。高通表示他们正与领先的内存和模型厂商合作,引入新一代端侧架构。这一架构围绕从闪存加载的混合专家(MoE)模型构建,MoE 模型在推理和规划方面明显更为先进。

当前的 DDR 内存无法承载 300 亿参数规模的模型,因此高通与合作伙伴携手,将其从闪存中调度加载。例如,一个 300 亿参数的 MoE 模型在保持数百亿参数可用的同时,在 NPU 上每次生成一个词元仅需激活约 30 亿个被路由选中的参数。

更重要的是,考虑到现有的内存瓶颈,这一方式能够减轻内存负担。结合智能的专家模块闪存到内存加载管理机制与缓存技术(Intelligent Flash-to-Memory Expert Management),这种方法能够以低功耗和低内存需求的方式实现更大模型级别的 AI 体验。

除了 NPU,根据之前官方已经披露的消息,新一代骁龙旗舰平台的 Oryon CPU 主要有两大核心升级,一是突破性的 5GHz 主频,二是全新的缓存架构。全新 Oryon CPU 是一颗完全定制的 CPU,每一项微架构特性都由高通自主调校,每个核心还拥有自己的时钟域,可以独立进行频率扩展。这套设计思路与主频达到 5GHz 的骁龙 X2 系列一脉相承,如今在移动平台上落地。而在缓存上,全新 Oryon CPU 做了两层设计,一是缓存分层架构,每个核心均配备大容量的 L1 指令缓存,避免 CPU 周期浪费,L2 缓存集成在 CPU 内部,能以极低的时延访问更大的缓存池;二是这次的重点 Oryon FlexCache,它把 L2 缓存统一成所有核心都能直接访问的共享缓存池,并可动态调整缓存资源分配。

本文标签:

更多文章

相关文章

网站导航 | 快讯 | 资讯

  • 优化 | 系统 | 数码 | 网络通信 | 人工智能 | 网站 | 游戏

    合作伙伴:

  • 友情链接(欢迎业界知名网站交换链接)申请友情

    

    声明:本站资源皆来自网络,如有侵权问题,请联系管理员处理!

    Copyright ©2020-2028快知站 版权所有 All rights reserved.

    闽ICP备20010713号-1 闽公网安备 35020602001684号