首页 / 资讯详情
CPU加速AI普及,GPU首次加AI,Arm为何把NPU留给伙伴?
摘要
个人AI的实现,到底需要一套怎样的计算底座?当手机开始理解用户意图、调用工具并连续完成任务,计算平台要支撑的已不只是一次模型推理,而是完整的个人AI体验。在今天的Arm Everywhere China 2026大会上,Arm发布了最新的CSS for Mobile 2。可以观察到,AI在全新的手机计算子系统中扮演了两个不同角色,CPU通过增强AI计算能力,帮助更多应用用上AI;Mali GPU首次原生集成神经网络加速器,用AI推动游戏性能和体验跨越式提升。Arm的CPU正在推动端侧AI进一步普及。“目前几乎所有旗舰智能手机,无论是安卓还是iOS手机,均已采用SME2技术。”Arm边缘AI智能终端计算副总裁James McNiven表示。SME2是Arm给CPU增加的一套AI矩阵运算加速能力。新一代Arm C2 Ultra带来15%的单线程性能提升,增强SME2支持的C2 CPU集群,在特定AI模型上的执行性能可达到上一代的1.7倍。全新的Arm Mali GPU让人眼前一亮。在《光影新生》演示中给出的数据显示,Mali G2-Ultra NX借助神经图形技术,相比没有AI辅助渲染的上一代Mali G1-Ultra,帧率与能效最高达到4倍。AI开始参与画面重建,让手机能够以不同于传统渲染的方式获得更高的游戏性能。CPU加速AI普及,AI加速GPU进化。但在这套面向个人AI的平台中,Arm为什么没有同时纳入自家的NPU?James McNiven解释:“在移动设备领域,Arm一贯的思路是将NPU层面的技术创新更多交由合作伙伴主导。”把NPU的差异化创新留给伙伴后,Arm将重点放在CPU、GPU以及支撑硬件能力的软件生态上。从KleidiAI到神经图形模型、SDK和游戏引擎合作,Arm正在缩短处理器能力与开发者应用之间的距离。软硬件一体的系统和生态正是Arm在AI时代能够继续成为领导者的关键。SME2成为旗舰标配,Arm CPU加速端侧AI普及个人AI带来的计算负载,比运行一次模型复杂得多。以预订结婚纪念日晚餐为例,智能体需要完成语音转文字,搜索用户喜欢的餐厅、日历和相册,再生成指令、访问网页并执行操作,如果餐厅订满,整套流程还要重新运行。CPU既要运行部分轻量级模型,也要承担工具调用和任务编排,每个环节的延迟都会影响最终体验。Arm C2 Ultra针对这类负载增强了单线程性能、执行引擎和数据访问能力。根据Arm给出的数据,其单线程性能和网页浏览性能均提升15%,应用启动和多线程性能分别提升12%。单线程性能的提升,会直接影响智能体交互、工具调用和并行任务的响应速度。在C2 CPU集群中,C2 Ultra负责需要快速响应的突发负载,C2 Pro则以更高能效承担持续任务。Arm的合作伙伴可以按照产品定位调整两类核心的数量,而不是用一种核心覆盖所有场景。对于同时包含模型推理、系统服务和前台应用的个人AI负载,这种配置空间比单独追求一个峰值数字更有实际意义。更明显的AI性能提升来自SME2。在特定AI模型中,增强SME2支持的C2 CPU集群,执行性能可以达到上一代的1.7倍。不过,端侧AI不仅受计算能力限制,也经常受制于内存带宽。以大语言模型为例,处理整段输入的预填充阶段包含大量矩阵运算,更接近计算密集型任务;逐字生成答案时,处理器需要频繁读取模型权重,又更容易受到内存带宽限制。SME2提高矩阵计算效率,低位宽与缓存设计则减少需要搬运的数据,几项改进分别对应模型运行的不同阶段。面对计算密集型负载,量化是一个解决方法,从INT8、INT4进一步走向INT