代理 AI 改變行動運算架構!高通 Hexagon NPU 強化記憶體容量增 50%
隨著代理式AI 發展,行動裝置對AI 運算架構的需求也正在改變。相較於過去主要依靠單一大型模型處理任務,代理式AI 更強調根據不同任務、情境與使用者需求,調度多個專用模型,並進一步結合工具、長上下文與多模態能力完成工作。
高通指出,透過新一代頂級行動平台Qualcomm Hexagon NPU,高通帶來兩項亮點功能:全新Element Accelerator 與容量增加50% 的共享記憶體,讓經常存取的模型資料能保留在NPU 附近,使AI 代理在處理更長的上下文、更多工具與並行任務時,仍能維持快速回應。
透過NPU 記憶體子系統容量增加50%,讓更多模型狀態、啟用值與中間張量能夠保留在晶片上,減少DDR 存取次數。高通指出,這有助於降低記憶體瓶頸,帶來速度更快、回應更即時的代理式AI 體驗。
對AI 代理而言,效能決定了跨多項任務時,智慧應用是否能持續保持快速回應、情境感知與高效率。Hexagon NPU 專為持續運行的AI、長上下文推理、多模態模型、並行AI 代理與低延遲行動迴圈而設計。
高通指出,擴充的NPU 記憶體容量可讓更多模型資料、啟用值與中間張量保留在處理器本地端,減少存取外部記憶體的次數,協助AI 代理以更短的等待時間完成回答、修正、規劃與採取行動。這意味著支援更長的上下文視窗、更快的token 生成速度,以及AI 代理在不同工具與任務之間切換時更加流暢的體驗。
目前高通正與領先的記憶體與模型供應商合作,導入以混合專家模型(MoE)為核心的新一代裝置上AI 架構。一個擁有300 億參數的MoE 模型,可保有數百億個參數供使用,同時在NPU上每次生成token時,僅啟用約30億個經路由選擇的參數。
在運算精度方面,Hexagon NPU 支援INT2、INT4、INT8、FP8 與FP16,開發人員能更靈活地在效能、記憶體、模型品質與功耗之間取得平衡。規模較小、效率更高的模型可處理更多本地端任務,而當工作負載確實有需要時,則可存取更大的模型。
高通指出,Hexagon NPU 專為加速Transformer 工作負載而打造,並讓上下文資料保留在運算單元附近,但隨著任務在不同核心之間移動,AI代理也需要智慧路由、協同調度以及隨時可用的資料。CPU 則扮演互補角色,負責協調這些多步驟工作負載,並讓資料保持就緒,以供NPU 使用。AI處理也正延伸至GPU,透過專用加速功能,採用與NPU相似的運作方式。
(首圖來源:高通)