解析SoC協定堆疊與軟硬體整合 嵌入式5G串接邊緣AI運算

本文將介紹整合嵌入式5G模組的邊緣AI系統技術,它包含系統級封裝(System in Package, SiP)、FPGA/MCU(Field-Programmable Gate Array/ Microcontroller Unit)協同設計、AXI4(Advanced eXtensible Interface 4)匯流排與硬體抽象層(Hardware Abstraction Layer, HAL)應用程式介面等。

嵌入式5G模組

嵌入式5G模組是指可嵌入至終端設備(如工業電腦、IoT裝置、車載系統、AR/VR頭戴裝置等)的小型通訊模組,它具備完整的5G新無線電(New Radio,NR)通訊能力,通常包含基頻模組(內含數據機與實體層)、射頻前端(內含功率放大器、低雜訊放大器、混頻器與濾波器、無線傳輸協定處理模組(MAC/RLC/PDCP)、SIM/eSIM介面以及標準化介面(如M.2、USB、UART與PCIe)等。此類模組通常以SiP、AiP封裝,支援即插即用、低功耗、可無線(over-the-air, OTA)更新,適合嵌入式系統整合。其技術特性和優勢,如下所述:

低延遲、高頻寬:支援即時AI推論

・邊緣AI常存在於即時的智慧型感測器中:如自動駕駛、產線上的瑕疵品檢測、安全監控。

・5G提供低於毫秒(Sub-ms)的延遲與Gbps級的頻寬,讓推論結果能即時回傳至雲端或控制中心。

・適合部署在高速移動或高密度感測環境中。

圖1 整合嵌入式5G模組的邊緣AI系統架構
圖1 整合嵌入式5G模組的邊緣AI系統架構

本地推論與雲端協同:混合式AI架構

・邊緣AI可在本地執行模型推論,減少資料上傳次數。

・5G模組能讓邊緣裝置的模型與雲端的模型透過即時更新保持同步、接收指令、傳送推論結果。

・適合智慧工廠、遠端醫療、農業監控等場景。

資訊安全防護:敏感資料不離開現場

・邊緣AI可在本地處理影像、語音、個資,避免在雲端傳輸的風險。

・5G模組支援網路切片(Network Slicing)與加密通道,提升資料傳輸的安全性。

・適合金融、醫療、政府等高隱私需求的場域。

遠端管理與OTA更新:降低維護成本

・透過5G模組,系統管理者可遠端更新AI模型、修補韌體、監控各種狀態。

・不需派人到現場操作,大幅降低人力與停機成本。

・適合偏遠地區、無人看守的設備、移動載具。

擴充性與部署彈性:建構分散式AI網路

・5G的通訊覆蓋面積廣,連接的密度高,能讓邊緣AI模組可部署在以前無法觸及的地方。

表1 在圖1中的主要元件之功能
主要元件 功能
NPU 本地推論,減少資料上傳
MCU 控制邏輯、RLC/MAC協定處理
5G模組 雲端連接、遠端管理、資料傳輸
FPGA 多台相機同步、MAC排程加速
DRAM/eMMC 模型載入與儲存
表2 AXI4三種子協定(AXI4-Full、AXI4-Lite、AXI4-Stream)的特性比較
特性項目 AXI4-Full(AXI4-MM) AXI4-Lite AXI4-Stream
用途定位 高頻寬資料搬移(如DDR、 DMA) 控制暫存器存取(如MAC組態 設定) 串流資料傳輸(如影像、封包)
是否有位址通道 無(純資料流)
支援突發傳輸 是(最多256 beats) 不適用
通道數量 5(AW、W、B、AR、R) 5(AW、W、B、AR、R) 1(TVALID/TREADY及側帶訊號)
握手機制 VALID/READY VALID/READY TVALID/TREADY
支援ID/QoS 是(支援ID/QoS訊號)
資料傳輸方向 雙向(讀/寫) 雙向(讀/寫) 單向(Source→Destination)
典型應用模組 DDR、DMA、NPU、CPU MCU、MAC、PDCP控制器( 暫存器存取) ISP、MAC、PDCP、影像處理 器

・支援大規模的感測器網路、分散式推論節點。

・適合智慧城市、交通監控、能源管理等應用。

圖1是整合了嵌入式5G模組的邊緣AI系統架構圖。其主要元件的功能如表1。

AXI4匯流排

在SoC內部的匯流排設計中,進階微控制器匯流排架構(Advanced Microcontroller Bus Architecture,AMBA)的AXI4標準是目前最常用的版本。因為AXI4支援突發傳輸、VALID/READY握手機制,以及位址、資料與回應通道分離,支援主端與從端架構,便於整合CPU、DMA、MAC、NPU等模組。目前,因為電子設計自動化供應商與矽智財權廠商都有支援AXI4,所以SoC內部廣泛使用AXI4。

AXI4支援下列三種子協定:

AXI4-Full

支援需高頻寬的資料搬移(如DDR、DMA等)。因為它透過記憶體映射(Memory Mapping, MM)實現高速資料傳輸,因此也常稱為AXI4-MM。

AXI4-Lite

用於存取MAC、PDCP、DMA等模組的控制暫存器。

AXI4-Stream

沒有位址通道,專門傳輸串流資料(Streaming Data),例如視訊串流與網路封包。

表2是AXI4-Full、AXI4-Lite、AXI4-Stream三種子協定的特性比較。圖2是圖1中的SoC內部AXI4匯流排的佈線。表3是SoC內部各元件的互連方式。無線傳輸協定處理模組是5G通訊的核心之一,它構成了5G NR的第二層(Layer 2)(資料鏈結層)的資料搬運骨幹,負責將上層的IP封包轉化為可在無線介質上穩定、高效、安全傳輸的格式。圖3是在無線傳輸協定處理模組內的資料從PDCP/RLC到數據機(modem)之間的傳輸流程。其傳輸路徑是以AXI4設計的匯流排來實現的。茲概述此傳輸流程如下:

圖2 圖1所示SoC內部AXI4匯流排的互連架構
圖2 圖1所示SoC內部AXI4匯流排的互連架構
表3 在圖2中的SoC內部各元件的互連方式
層級 互連方式 說明
MCU↔Modem UART/PCIe/USB/SDIO MCU可透過相關介面與modem通訊,用於控制、資料傳輸及 連線管理
MAC↔PHY MII/RMII/RGMII/SGMII MAC與Ethernet PHY交換資料,可依系統需求支援全雙工、流 量控制等功能
MCU↔PDCP HAL API/監控/DMA MCU可管理PDCP初始化、加解密參數設定及錯誤監控
PDCP↔RLC AXI4-Sream/AXI4-Lite/FIFO PDCP與RLC交換協定資料,分別執行各自的協定處理
MCU↔RLC HAL API/中斷/狀態查詢 MCU可監控RLC狀態,並管理重傳策略與緩衝區
圖3 SoC內PDCP/RLC至數據機(modem)的資料傳輸流程
圖3 SoC內PDCP/RLC至數據機(modem)的資料傳輸流程

MCU透過AXI4-Lite寫入DMA控制器的配置暫存器

・設定來源:PDCP模組的FIFO。

・設定目的地:MAC模組的封包緩衝區(不經SRAM)。

・設定長度與觸發方式。

DMA控制器啟動AXI4-Stream傳輸

資料從PDCP模組輸出,經 AXI4-Stream傳至MAC。AXI4-Stream不使用位址通道,而是透過TVALID與TREADY訊號進行資料傳輸握手與流量控制。傳輸完成後,DMA觸發中斷(IRQ)訊號,通知MCU。

MCU

MCU查詢狀態暫存器,確認是否傳輸完成,或讀取傳輸失敗的錯誤碼。

封包資料匯聚協定(Packet Data Convergence Protocol, PDCP)模組的功能包含:加密、封包序號(Sequence Number, SN)編碼、去除重複封包(去重)、服務品質(Quality of Service,QoS)分流,這些都需要較多的資源。無線電鏈路控制(Radio Link Control,RLC)的功能包含:封包分段、重組、重傳。相較於PDCP,RLC的運算與記憶體需求通常較低,因此,在異質多核的SoC中,通常是將PDCP交由CPU或專用的硬體加速器執行,而RLC是交由低功耗的MCU執行。如圖4。

通訊協定堆疊

在5G通訊協定堆疊中,必須明確定義每層的任務、資料流、控制介面與模組分工,以便模組化設計、減少耦合(coupling),並提高可測試性、可擴充性與可維護性。這就稱作通訊協定堆疊的邊界劃分。如圖4和表4。邊界劃分的重要性在於:

圖4 在5G通訊協定堆疊中CPU和MCU的角色比較
圖4 在5G通訊協定堆疊中CPU和MCU的角色比較

・職責清晰每層只處理自己的任務,例如PDCP不處理重傳。

・除錯容易可定位是哪一層出錯,例如RLC重組失敗或MAC排程錯誤。

・硬體/韌體分工可決定哪些層可使用暫存器傳輸層(Register Transfer Level, RTL)實作,哪些可用韌體控制。

・資源優化例如DMA只負責搬移服務資料單元(Service Data Unit, SDU)到PDCP,不需管RLC的協定資料單元(Protocol Data Unit, PDU)的分段。

表4 在5G通訊協定堆疊中各協定層的功能
協定層級 功能摘要 實作方式 控制介面 資料通道 適合平台
PHY 調變/解調、FFT、MIMO、同步 RTL IP Core AXI4-Lite AXI4-Stream FPGA/SoC
MAC 排程、HARQ、邏輯信道管理 RTL/MCU韌體 AXI4-Lite AXI4-Lite/FIFO FPGA/MCU
RLC 分段/重組、ARQ重傳 MCU韌體 記憶體映射/ HAL Ring Buffer/ DMA MCU/CPU
PDCP 加密、完整性保護、重排序 CPU/硬體加速器 HAL API DMA/Memory CPU/SoC
RRC 無線資源管理、連線管理、切換 軟體協定棧 API/Socket 控制訊息 CPU/Linux
NAS 註冊、認證、連線管理 軟體協定堆疊 API/Socket 控制訊息 CPU/Linux

而減少各層之間的「耦合」的優點有:

・避免牽一髮動全身高耦合代表模組間緊密依賴,改動其中一層(如RLC的分段邏輯)可能影響PDCP、MAC、甚至MCU的行為。減少耦合可讓每層獨立演進,不需同步修改其他層。

・模組可重複使用低耦合設計讓PDCP、RLC、MAC等模組可在不同平台重複使用。例如:同一個PDCP模組,只需調整介面,就可用於LTE/5G/Wi-Fi架構。

・簡化測試與除錯若每層邊界清晰,測試可針對單層進行單元測試(unit test)。如此能更快找到錯誤,例如:RLC重組失敗,不會誤判為PDCP去重錯誤。

・支援硬體/韌體分工MCU和通訊協定層之間若耦合過高,會限制RTL/韌體的分工彈性。低耦合設計可讓PDCP使用韌體實作,RLC使用RTL實作,互不干擾

・支援異質平台整合在SoC、數據機、RF的架構中,低耦合能允許更換不同廠牌的數據機、升級PHY層而不影響MAC層、MCU可控制多種通訊協定堆疊(如LTE /NB-IoT/5G)

・降低功耗封包搬移與通訊協定堆疊的邊界劃分明確,可降低不必要的資料搬移與處理負載,進而降低系統功耗。

表5 5G封包格式的定義與功能
格式 全名 所屬層級 功能與特性
SDU 服務資料單元(Service Data Unit) 上層→下層 由上層提供給本層處理的資料單元,可為IP封包或其 他上層資料
PDU 協定資料單元(Protocol Data Unit) 各協定層 經本層協定處理後形成的資料單元,通常包含上層 SDU與本層標頭
TB 傳輸塊(Transport Block) MAC→PHY MAC提供給PHY進行傳輸的資料區塊,由PHY進行編 碼、調變與無線傳輸
SN 序號(Sequence Number) PDCP/RLC 用於識別協定資料單元及進行排序、重組等處理
SO 區段偏移(Segment Offset) RLC 表示分段資料在原始資料中的偏移位置
SI 區段指示(Segment Indicator) RLC 表示PDU所承載資料在SDU分段中的位置

減少耦合的方法需從無線傳輸協定堆疊、硬體模組、系統協調三個層面來考量,如下所述:

無線傳輸協定層:

・設計服務存取點(service access point, SAP):每層透過明確定義的SAP介面,避免跨層直接呼叫。

・資料單位標準化(如SDU、PDU與Transport Block, TB):使用標準封包格式,讓模組間只需解析封包頭(header),來決定是否要處理封包內容。各種封包格式的定義與功能,如表5。

・封包序號(SN)與區段偏移(Segment Offset, SO)資訊各自維護:每層各自管理序號與分段資訊,避免重組邏輯耦合。

・服務品質(Quality of Service,QoS)的分流識別碼(flow ID):PDCP根據QoS分流識別碼管理資料流,RLC/MAC層不需處理上層的QoS分流邏輯。

硬體模組和資料搬移:

・AXI4-Lite通道和AXI4-Stream通道分離:模組之間只透過暫存器與資料通道互動。

・資料搬移由DMA獨立控制:模組只需觸發搬移,不需知道來源與目的地。

・統一管理中斷資料:集中管理IRQ編號與優先順序,避免在RTL或韌體中寫入固定的中斷編號。

・RTL IP封裝與介面抽象化:各層協定模組封裝為IP block,僅暴露必要介面,降低模組間耦合。

圖5 嵌入式5G邊緣AI架構中的硬體抽象層
圖5 嵌入式5G邊緣AI架構中的硬體抽象層

系統協調與異質多核平台:

・CPU/MCU分工:高負載模組由大核的CPU處理,低功耗模組由小核的MCU處理,它們之間可透過信箱(mailbox)、先進先出(FIFO)佇列或多核心通訊機制(如Linux RPMsg)進行溝通。

・即時作業系統(RTOS)和Linux分層管理:RTOS在MCU內執行,控制相機感測與中斷。Linux在CPU內執行,處理5G通訊協定與AI推論。

・封包搬移流程標準化:定義封包搬移流程,例如:PDCP→RLC→DMA→MAC,每層只處理各自的邏輯。

・分層隔離的權限管理:將加密模組與Linux隔離,避免資安耦合與惡意存取。

硬體抽象層API

硬體抽象層API(如圖

5)的主要功能是讓上層軟體(如AI模型、通訊協定堆疊)能不管底層硬體的細節,操作感測器、硬體加速器、通訊模組….等。這也是減少模組耦合的關鍵之一。式子(1)是一個HAL API(hal_npu_infer)函式範例,AI模型的推論程式透過此API在NPU中運算。

圖6 從實作角度將5G通訊協定架構區分為軟體、韌體、RTL與硬體層
圖6 從實作角度將5G通訊協定架構區分為軟體、韌體、RTL與硬體層
圖7 5G NR通訊協定堆疊,可區分為控制平面與用戶平面;各協定層可依系統需求採用不同
圖7 5G NR通訊協定堆疊,可區分為控制平面與用戶平面;各協定層可依系統需求採用不同
表6 5G通訊協定堆疊各層的可能實作方式
協定層級 可能的實作方式 架構分類
PDCP Linux核心模組、RTOS任務、RTL IP 協定邏輯
RLC MCU韌體、RTL IP、裸機(bare-metal)程式 協定邏輯
MAC RTL、韌體、驅動程式 協定邏輯
PHY RTL、DSP、硬體加速器 硬體層(訊號處理)

上層的AI模型(如TensorFlow Lite)只需呼叫此API,不需知道NPU是甚麼晶片或「RTL模組」,HAL會根據底層平台,選擇最佳的操作方式或路徑(如DMA、快取清除(cache flush)、IRQ等)。因此,上層的AI模型與底層的硬體加速器(如NPU)能完全解耦(decoupling)。

軟硬體分工

圖6是以實作的角度,將5G通訊協定架構概括區分為軟、韌、硬體三大部分。其中PDCP、RLC和MAC比較特殊,如前述,它們是屬於5G NR定義的資料鏈結層協定,它們的功能在本質上是邏輯處理,而非物理層的訊號處理。在5G NR通訊協定堆疊(如圖7)中,它們被歸類為協定邏輯層,但可能有數種實作方法可以選擇,如表6。不過,它們即使是用Verilog實作的RTL,也只是協定邏輯的硬體化。

・軟體層是可由CPU/MCU執行的協定邏輯。

・韌體層負責透過HAL與驅動程式介接及控制硬體。

・RTL層是可合成的邏輯電路(Verilog /VHDL)。

・硬體層包含實體電路、元件與電路板,例如MCU、RF電路與PCB。如此劃分很重要,因為:

・模組解耦:協定邏輯可跨平台移植,例如:從MCU移植到FPGA

・可測試性:協定層可用C模擬器驗證,RTL可執行協同模擬(co-simulation)。

・可擴充性:可根據需求選擇軟體、韌體、硬體或RTL實作。

・系統整合:傳輸介面可標準化,例如:MAC和橋接器之間的介面是AXI4-Stream。