在Arm Everywhere China 2026大会上,Arm正式发布最新的CSS for Mobile 2移动计算子系统。这一发布标志着手机计算平台从单一的模型推理向支撑完整个人AI体验转变。Arm通过增强CPU的AI计算能力以推动应用普及,并首次在Mali GPU中集成神经网络加速器以提升图形性能,同时明确将NPU层面的差异化创新交由合作伙伴主导,构建软硬件一体的生态系统。


CPU增强SME2加速端侧AI普及
个人AI任务如预订晚餐涉及语音转文字、多工具调用及复杂流程编排,对CPU的单线程性能和低延迟响应提出了更高要求。Arm C2 Ultra处理器针对此类负载优化,单线程性能与网页浏览性能均提升15%,应用启动和多线程性能分别提升12%。在C2 CPU集群中,C2 Ultra负责突发负载,C2 Pro承担持续任务,合作伙伴可根据产品定位灵活配置核心数量。


AI性能的提升主要得益于SME2技术的增强。目前几乎所有旗舰智能手机均已采用SME2技术,新一代C2 CPU集群在特定AI模型上的执行性能达到上一代的1.7倍。针对端侧AI受内存带宽限制的痛点,Arm通过低位宽矩阵计算、量化感知训练以及私有L2与大容量共享L3缓存设计,有效降低了数据搬运功耗和延迟。Arm边缘AI CPU产品管理总监Daniel Lu指出,CPU应聚焦低延迟应用及本地算力预算内的小语言模型,其等效算力约为5至6 TOPS。

GPU首次原生集成AI加速器
Mali G2-Ultra NX首次在Mali GPU中原生集成神经网络加速器,通过神经图形技术改变画面生成方式。该GPU采用神经超级采样(NSS)、神经超级采样与降噪(NSSD)及神经帧率提升(NFRU)技术,利用卷积神经网络基于真实渲染画面、运动向量和深度信息进行重建,而非凭空生成。在《光影新生》演示中,帧率与能效最高达到上一代的4倍,DRAM流量最高降低70%。


传统图形能力同步升级,Mali G2-Ultra NX引入新的执行引擎和第三代光追单元,DRAM带宽需求降低约13%。Arm强调,AI增强图形将成为行业标配,神经网络加速器与渲染单元协同工作,在复杂几何和光照场景中体现效率优势。此外,该GPU也能承担图形之外的AI计算,支持INT8等数据格式,但现阶段重点仍为图形应用。


生态策略:NPU留给伙伴,聚焦系统软件
Arm未将NPU纳入CSS for Mobile 2,而是坚持在移动设备领域将NPU技术创新交由合作伙伴主导。手机芯片厂商通常拥有自有NPU架构并围绕第一方AI功能深度优化,而第三方应用更依赖CPU和GPU相对标准化的编程环境。Arm通过提供系统优化的CPU、GPU、互联IP及软件栈CSS,缩短处理器能力与开发者应用之间的距离。


在软件生态方面,Arm开放神经图形模型,提供SDK、示例代码及游戏引擎插件,并与腾讯游戏、Unity中国等伙伴推进适配。在CPU侧,KleidiAI将针对SME2优化的计算内核接入开发工具,降低开发者使用门槛。Arm边缘AI智能终端计算副总裁James McNiven表示,软硬件一体的系统和生态是Arm在AI时代保持领导力的关键,通过统一计算体系打通图形、通用计算与神经网络计算,从而支撑个人AI的广泛落地。

