中华棋牌官方网址大全: 苹果 A20 Pro 升级暗藏玄机,32 核 NPU 才是本地 AI 关键?

很多人关注苹果 A20 Pro 时,关注点都错了。不是 2nm 制程,不是跑分成绩,也不是账面核心数增加,苹果这次真正亮出的态度,是 iPhone 即将成为真正的本地 AI 终端,指尖大模型,才是它的下一个核心使命。

过去两年,我一直在期待,手机何时能真正成为本地 AI 部署工具。iPhone 的内存早已来到 12GB,SOC 最早引入了 NPU 神经网络加速器,而且手机芯片总能最先吃到先进制程的红利。随着 2B 量级的小巧大模型性能突飞猛进,到 2026 年,手机距离本地 AI 部署的临界点已经不远。这次的 A20 Pro,让我非常兴奋,只差临门一脚。

别被 2nm 迷惑,A20 Pro 的升级全冲着大模型

CPU 依旧是六核设计,每个核心都搭载了 NA(神经网络加速器),其中两个大核性能提升 20%,被称为桌面级 Super 核。这对大模型推理至关重要,负责推理时的调度、采样和分词。

GPU 升级到 7 核,这还不是重点。重点是 GPU 内的 NA, GPU 的 NA 实现 SP8 吞吐翻倍,这是实打实的硬升级。

最硬核的升级在 NPU。从 A17 Pro 开始,苹果的 NPU 一直停留在 16 核,这次 A20 Pro 直接做成两套 16 核并行,共 32 核, 32 核 NPU 超级加倍。同时还补上了 FP8 支持,和 GPU 实现了对齐。

除此之外,内存带宽增加 50%。总线宽度从 64 比特提升到 96 比特,整体带宽达到 115GB 每秒,和小米澎湃 O3 的 LPDDR5X 基本一致。 内存带宽增加 50%,这些升级没有一个是多余的,全都是为大模型推理量身打造的。

自家 AFM 独享红利,第三方大模型也能蹭到福利

苹果自家的 Apple Foundation Models(AFM),是为 iPhone 打造的系统级 AI 插件,作为 Apple Intelligence 的主体,负责改通知、听写、Siri、屏幕分析等功能。

目前 AFM 有两个端侧版本:3B 参数的基础版,和 20B 参数的高级版(仅激活 1-4B),还有云端的 Cloud Pro 版。苹果这次的硬件升级,主要是为了让 AFM 充分发挥性能。因为 AFM 是苹果深度定制的,拥有第三方大模型没有的底层权限,而且作为后台待命的系统插件,跑在 NPU 上不会和其他 GPU 依赖功能冲突。

但苹果升级双 16 核 NPU,不只是为了 AFM。AFM 本身用不满这么强的算力,第三方大模型虽然不能吃满所有红利,但也能拿到不少好处。GPU 的 NA 实现 SP8 翻倍吞吐,能直接提升模型运行速度;NPU 支持 SP8,进一步强化算力;内存带宽提升 50%,缓解了大模型的内存瓶颈。

手机 NPU 不是万能的,GPU 才是第三方大模型主力

很多人觉得 NPU 更适合跑大模型,但其实第三方大模型优先选择 GPU+GPU 的 NA。这和不少人的认知误区有关。

NA 也就是神经网络加速器,本质是张量计算模块,只负责矩阵乘法,类似英伟达 GPU 的 Tensor Core。苹果最早给 CPU 搭配 NA,A19 Pro 首次给 GPU 加上 NA。CPU 上的 NA 主要负责小神经网络计算,比如键盘预测、音频特征提。屎系脱映俚幕 AI 服务,对大语言模型基本没用。

GPU+GPU 的 NA,类似英伟达的 CUDA 核心加 Tensor Core 组合,是目前 iPhone 支持第三方大模型的核心算力工具,绝大多数第三方大模型都会调用这个组合。这次 FP8 吞吐翻倍,直接让运行速度更快,再加上 7 核的 GPU 加持,性能提升明显。

那 NPU 到底有啥用?对苹果自家的 AFM 来说,NPU 是主力,但对第三方大模型来说,NPU 并不是优先选项。主要有两个原因:

其一,GPU 和 NPU 的算法图逻辑不同。GPU 是动态适配的,能应对大语言模型生成内容时的动态上下文变化,能提供不错的 TPS(每秒生成 token 数)。而 NPU 是静态的,需要对输入内容进行 pad 填充,比如预设图长度是 2048,输入只有 89,也会按 2048 跑。哪怕 NPU 功耗更低,TPS 表现往往不如 GPU。

其二,苹果的 Core AI 框架,现阶段只允许开发者二选一:要么面向 GPU 编译,要么面向 NPU 编译,iOS 不支持运行时切换。第三方大模型风格各异,很难完美匹配 NPU 的静态图,之前的端侧模型会同时推出 GPU 和 NPU 两个版本,NPU 版本虽然省电,但 TPS 低,影响使用体验。

不过,苹果并没有完全锁死 NPU 的第三方使用。从技术上来说,GPU 和 NPU 可以通过异构编译同时用于大模型运算:把 prefill 阶段交给 NPU,decode 阶段交给 GPU。但这需要开发者自行适配,苹果官方没有提供一键支持,属于民间技术手段。

但我认为苹果一定会开放这个口子。首先,NPU 新增 SP8 支持,不可能只为 AFM 准备,一定兼顾了第三方大模型的需求。其次,Core AI 框架允许指定 NPU 编译,相当于给第三方留了后门。最后,Core AI 的生态正在加速构建,这是苹果重点布局的业务。如果强悍的 SOC 只为跑 AFM,很多升级点都浪费了,苹果有理由开放第三方支持,体现 A 系列处理器的行业价值。

现在三四百亿参数的端侧小模型,性能已经今非昔比。A20 Pro 的出现,让手机本地 AI 的临界点终于到来。你觉得,iPhone 的本地 AI 时代,会提前到来吗?