下一代 Android 旗艦同 AI PC,CPU 都要識做 AI 矩陣運算
3C 產品

下一代 Android 旗艦同 AI PC,CPU 都要識做 AI 矩陣運算

圖片:via Android Authority — https://www.androidauthority.com/arm-sme2-amd-intel-ace-3683324/
TechLab 編輯部(譯)·

Arm SME2 同 x86 ACE 都瞄準本機 AI,NPU TOPS 唔夠睇晒

CPU 點解忽然變返重要

Android Authority 今次講一個幾值得留意嘅方向:AI 運算開始由 NPU、GPU 嘅宣傳頁,走返入 CPU 指令集。原因好現實,雲端 AI 貴、排隊、私隱又麻煩;但喺手機或者 laptop 本機跑模型,細模型嘅延遲、RAM 同資料搬位、軟件支援,往往麻煩過單睇峰值 TOPS。CPU 日日負責排程、資料處理同 app logic,如果佢識直接做 matrix multiply,成個本機 AI pipeline 可以少啲兜路。

Arm Lumex / C1 CPU 官方圖,示意手機用本機 AI 做即時翻譯同助理功能

圖片:Arm

SME2 係 Arm 嘅第一步

Arm 呢邊,關鍵字係 SME2。官方講法係,SME2 係 Armv9.3-A 入面為 AI / ML 做嘅 CPU 指令,專攻 LLM、電腦視覺呢類 matrix-heavy 工作,KleidiAI 會喺 XNNPACK、ONNX Runtime、llama.cpp、MediaPipe 等 framework 幫 app 自動食到加速。Arm C1 CPU cluster 官方數字係同條件下最高 5x AI speed-up、3x efficiency;另一頁 SME2 資料亦寫最高 6x inference。呢啲係 Arm 自家數字,唔係 TechLab 實測。

Arm C1 CPU cluster 官方圖表,列出 app performance 同 power efficiency 改善

圖片:Arm

x86 ACE 係 AMD 同 Intel 嘅共同語言

PC 呢邊,AMD 同 Intel 經 x86 Ecosystem Advisory Group 拎出 ACE(AI Compute Extensions)。whitepaper 寫到好清楚:ACE 同 AVX10 接埋,用 outer product 做 matrix acceleration;同樣兩個 512-bit input vectors,ACE INT8 可做 1024 次 multiply,AVX INT8 係 64 次。呢個係 compute density,唔可以偷換成 16x 跑分。ACE v1 亦支援 INT8、BF16、OCP FP8 / MXFP8 / MXINT8;規格頁提醒內容屬 design phase,AMD / Intel 文件未講邊代 CPU 先用到。

MediaTek Dimensity 9500 官方芯片圖,用 Arm C1 CPU 同 SME2

圖片:MediaTek

TOPS 好睇,但唔夠用

呢件事提醒返大家,近兩年 AI PC 同旗艦手機成日講 NPU TOPS,但 TOPS 高唔等於每個 AI 任務都快。實際任務冇咁整齊,摘要前後有 tokenize、資料整理、影像前處理,模型又可能有啲 operator 未有 NPU kernel。GPU 適合大吞吐量,NPU 適合長時間慳電 inference,CPU 加咗 matrix 指令之後,開發者就多一個低延遲、比較易部署、可以跟住常用 framework 走嘅選擇。對 coding assistant、相片降噪、語音轉文字、細模型客服,呢條路好實際。

現有機未必有份

不過要留意,呢類 CPU 指令要新硬件支援先用到。MediaTek Dimensity 9500 產品頁已寫明用 Armv9.3 同 SME2,CPU 組合包括 1 粒 C1-Ultra @ 4.21GHz、3 粒 C1-Premium 同 4 粒 C1-Pro;佢亦引用 MediaTek Labs 數字,話 object detection computing performance 改善 57%、跑 encoding-decoding model 時功耗低 50%。但呢啲都係官方數字,而且只代表有相關硬件同軟件路徑嘅機。手上舊 Android 手機同 Windows laptop,冇 SME2 / ACE 就唔會無端變快。

買機同公司 IT 要點睇

喺香港買下一部 Android 旗艦或者 AI PC,之後可以多問幾樣:CPU 有冇 SME2 / ACE 呢類 matrix 指令?RAM 夠唔夠畀模型長開?常用 app 係咪經 ONNX Runtime、llama.cpp、XNNPACK 呢類庫食到加速?公司 IT 如果想做本機摘要、離線文件搜尋、私隱要求高嘅 coding assistant,CPU AI 能力會影響可唔可以喺普通 notebook 跑得順。下一步要睇 Qualcomm、Samsung、AMD、Intel 點樣放入量產芯片,同 Windows / Android app 幾快真係用到。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook