9 月 8 日,Arm 在上海举办年度旗舰活动 Arm Everywhere China,并在会上发布了第二代移动终端计算子系统 CSS for Mobile 2。
这是一个面向智能体 AI 与 AI 原生图形的计算平台,集成了 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 以及 SI L2 系统互连,同时将系统 IP、软件和开发者工具整合为完整平台。
如果只看新计算平台的命名,CSS for Mobile 2 看起来就是一次常规的更新迭代。但听完整场发布、又在采访中和 Arm 高管们聊过技术细节后,小编对于这次的新平台又有了新的认知。CSS for Mobile 2 每一项技术细节的升级,Arm 其实都在回答一个更根本的问题:当 AI 从问答助手进化成能理解意图、规划任务、替用户干活的智能体,手机里的计算平台该长什么样。
Arm 的判断是,移动设备的性能取决于三个核心维度 —— 各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度。
CSS for Mobile 2 据此从系统层面统筹优化,并把优化延伸到物理实现阶段,让合作伙伴在 SoC 集成之前就能把功耗、性能和面积与架构设计放在一起考量。组件上保留了弹性,可整套采用,也可与自研或第三方 IP 组合。
这背后其实是 Arm CSS 一贯的思路:把底层计算技术做成集成化、经过验证、可灵活配置的计算基础。换句话说,合作伙伴不必再把大量时间和工程资源耗在底层技术的整合上,而是可以站在 CSS 之上,把资源投向真正能形成差异化的地方 —— 自己的加速器、内存架构、互连技术、系统技术和软件能力,针对自己的目标市场和工作负载打造定制化芯片。底层少走了弯路,开发进程更快、复杂性更低,差异化创新自然能更快推向市场,同时还能充分借力 Arm 生态系统的优势。
下面我们具体来看。
C2 CPU 集群:双 SME2 与编排引擎
如今,智能体不再只是执行推理,还要保持上下文、运行应用、协调不同模型与服务,并在用户授权下自主完成任务,而这一切都得装进手机的功耗和散热约束里。手机里的计算任务,从“回答一个问题”变成了“独立跑完一整套流程”。
Arm 认为,在这条流程中,CPU 被重新定义为系统的编排引擎,负责维护上下文、调度负载、协调任务。
新的 C2 CPU 集群由 Arm 迄今最强的移动 CPU C2-Ultra、面向能效的 C2-Pro 和双 SME2 引擎组成。全新 CPU 集群在面对最新 AI 模型性能最高提升 1.7 倍,单线程性能提升 15%,相同性能下功耗最多降低 38%。
进一步来看,在跑 Moonshine 和 Parakeet 语音转文本模型时,C2-Ultra 比上一代 C1-Ultra 延迟降低 40%,直接缩短智能体“开口回应”前的等待;
记忆阶段的内存检索性能提升 41%,推理阶段小语言模型生成指令的平均速度提升 25%。端到端算总账,整条工作流性能提升 24%。


闽公网安备 35020602001684号