本文將介紹裝置端音訊AI的應用、限制與設計取捨。
透過環境噪音消除讓語音更清晰,從基礎知識、經典信號處理工具,一路進入深度學習時代。事實證明,噪音消除只是一場更大規模演出中的一環。耳機可透過使用者語音觸發喚醒,門鈴可偵測玻璃破碎聲,助聽器可從嘈雜環境中分離特定說話者的聲音,工廠感測器則可藉由聲音辨識軸承故障,且上述處理皆可在不連接雲端的情況下完成。本文將探討音訊AI在邊緣裝置上的應用、相關限制,以及產品開發過程中的設計取捨。
而這時間點並非偶然。邊緣人工智慧在2025年已經是一個約250至400億美元的市場,並在十年內有望突破1,000億美元。低於1瓦的硬體層級,也就是Ceva的主力領域,是其中快速成長的一部分。加速器是生成式人工智慧走向裝置端:原本存在於雲端的小型語言模型、語音代理和對話助手,正遷移到每一個人手中的裝置和耳裡的耳機上,而音訊正是這一切最自然的介面。
邊緣AI定義與範疇
邊緣已經成為一個涵蓋範圍廣大的詞彙。本文所指的並非配備強大GPU的筆記型電腦或機櫃中的伺服器;而是真正受限的那一端:僅具備數KB RAM的微控制器、音訊DSP,以及功耗僅數百毫瓦的專用神經處理單元(Neural Processing Unit, NPU)。
這本身就是一個非常廣闊的應用連續光譜(圖1):

音訊AI導入裝置端優勢
如果雲端既便宜又強大,何必費力將模型塞進指甲大小的晶片?有四個原因,而且大多數真實產品都同時在乎這四點:
延遲
喚醒詞若延遲半秒就會感覺故障,而對話式音訊有嚴格的延遲預算:ITU-T G.114將語音通訊可接受的單向延遲上限設定為約150毫秒,而裝置端音訊增強模組可分配到的時間可能僅有數十毫秒。雲端無法可靠地保證這點。
隱私
音訊是私密的,它可能承載個人的身份、情緒,甚至是健康狀況的線索。將音訊保留在裝置端,即可避免原始訊號離開裝置。對於語音生物辨識和醫療用途而言,這不是可有可無的功能,而是必要條件。
能耗與成本
將音訊全天候串流到伺服器,會消耗無線電功率並累積帳單費用。裝置端推論則能避免這兩者。
可靠性
若安全裝置在Wi-Fi斷線後便無法辨識聲音事件,就難以維持完整的安全功能。而邊緣裝置在離線時仍能繼續運作。
將這四點結合起來,就是真正推動產品的要素:更長的電池續航、更精簡的物料清單、可以印在包裝盒上的隱私承諾,以及更快的上市速度。
音訊AI在邊緣裝置上的應用持續擴展
ENC系列涵蓋了一項任務;白皮書則涵蓋了滿滿一整張表格的內容。這些應用涵蓋始終聆聽喚醒詞、噪音消除、語音辨識、說話者識別、玻璃破碎偵測、意圖判斷、離線語音,以及新興的情緒感知介面與裝置端音樂等。(圖2)。
邊緣音訊AI面臨資源限制
接下來就是有趣的地方了。一個在基準測試筆電上表現亮眼的模型,可能根本無法部署到你真正鎖定的裝置上。實際部署時,模型還會受到多項硬體限制:
記憶體與模型大小
助聽器或MCU的預算,包含模型和工作緩衝區在內,總共可能只有幾百KB。因此多數現成模型架構都難以直接部署。一個鮮明的例子:Keyword Transformer需要約540萬個參數;而BC-ResNet在語音指令資料集上達到相近的約98%準確率,卻只需約32萬個參數和約8,900萬次乘加運算(Multiply-Accumulate, MAC)。同樣的任務,但所需的模型參數量與運算量卻低了一個數量級以上。

功耗與散熱
永遠在線意味著每次推論的能耗將會乘上全部運作時間。穿戴式裝置也無法發熱。這兩者都讓人選擇夠用就好的最小模型,而非最精準的模型。
即時串流處理
邊緣音訊是串流,不是檔案。模型必須逐幀處理即時輸入資料,且無法預先取得尚未到達的音訊。然而它確實有效。具體來說:標準MLPerf Tiny關鍵字偵測模型大小約為50 KB,而INT8量化可將模型縮小約4倍(約75%),準確率損失通常低於一個百分點。說話者驗證已被量化至1 MB以下,同時在標準VoxCeleb1測試集上將等錯誤率維持在2%以下;非自迴歸的裝置端文字轉語音(如FastSpeech
2)在主觀意見分數上接近自然語音(LJSpeech上約3.8分)。在ISSCC 2024上,CEA-Leti展示了低於1微瓦的關鍵字偵測(約0.99 µW前端,在10字任務上達到91%準確率)。邊緣裝置雖小,但不弱小。
邊緣音訊AI部署設計要點
確定目標任務與裝置後,接下來需要做的是模型與硬體的選擇。真正要做的決定是什麼?簡要版的行動指南如下:


・根據預算選擇模型家族,而不是根據排行榜深度可分離卷積神經網路(Depthwise Separable Convolutional Neural Network, DS-CNN)、時間卷積網路(Temporal Convolutional ResNet, TC-ResNet)和廣播殘差網路(Broadcasted Residual Network,BC-ResNet)用一小部分準確率換取一個數量級的效率提升。應先從裝置的記憶體、功耗與運算能力等限制條件出發,再反向選擇適合的模型架構。
・針對性進行模型壓縮量化(尤其是量化感知訓練,而非僅在訓練後進行量化)、剪枝與知識蒸餾是最有影響力的工具:在每一項任務中,QAT(Quantization-Aware Training)和蒸餾都能在大幅縮小體積的同時保留品質。

・共同設計模型與硬體最好的結果來自於將它們一起最佳化:受延遲和能耗約束的神經架構搜尋、由敏感度引導的混合精度量化、編譯器中的運算子融合。硬體感知共同設計已被報導可帶來40%以上的能效提升(某些研究中超過50%),且準確率成本很小。
・評估要超越準確率這是團隊最容易忽略的一點,也是白皮書最極力主張的一點。感知語音品質評估(Perceptual Evaluation of Speech Quality, PESQ)、詞錯誤率(Word Error Rate, WER)與等錯誤率(Equal Error Rate, EER)三者分別反映語音品質、語音辨識錯誤程度與生物辨識系統的錯誤權衡,並不能直接反映模型的記憶體占用或功耗,也無法說明模型是否裝得下,或電池能撐多久。且還必須報告延遲(毫秒/幀)、每次推論能耗(µJ)、記憶體占用、即時因子,而理想情況下還需提供完整的能耗-準確率帕累托曲線。
・注意邊緣AI基準測試缺口MLPerf Tiny、SUPERB和HEAR這類倡議都是很好的起點,但大多數基準測試仍然只強調準確率,而以音訊為中心的多任務邊緣評估幾乎還不存在。在標準化之前,因此在標準化評估方法建立之前,不同邊緣模型之間的效能比較仍相當困難。(圖3)。
最後一點,目前Edge AI Foundation(前身為tinyML Foundation)旗下的音訊AI工作組,也將邊緣AI效能的標準化報告方式列為重要議題。
邊緣音訊AI隱私與可信任性

在裝置端執行是一種隱私優勢,但不是免責通行證。聲紋仍然需要保護:安全隔離區、裝置端加密與聯邦學習等技術,都可降低原始音訊與敏感特徵外洩的風險。儘管每一項都會消耗運算資源,與效率預算競爭。資料集嚴重偏向英語、華語和乾淨的錄音室音訊,因此模型對其他語言、口音和嘈雜環境的泛化能力可能較差,而壓縮可能會在無形中放大這種偏見。而隨著語音複製越來越便宜,來源追溯和浮水印也從學術界的好奇心變成了產品需求。負責任的音訊AI不是獨立的一章;它是一個與其他所有限制並行的設計約束。

音訊AI走向低功耗運算
前述的準確率、模型大小、延遲與功耗之間的取捨,也是邊緣音訊AI設計的核心課題。Ceva提供涵蓋MCU至NPU的邊緣AI IP與開發工具,例如Ceva-NeuPro-Nano、Ceva-NeuPro-M,以及搭配音訊DSP的相關方案,可分別對應低功耗TinyML、較高運算量AI,以及音訊處理等工作負載。
隨著AI運算逐漸從雲端延伸至終端裝置,音訊AI也開始在低功耗、低延遲與高隱私要求下持續演進。未來更多裝置將能在本地端完成聲音辨識、理解與回應,同時將功耗控制在微瓦等級,讓「始終聆聽」成為更多邊緣裝置的基礎能力。
參.考.資.料
[1] Edge AI market sizing: 2025 market estimates and long-range forecasts from Grand View Research, Precedence Research, and Fortune Business Insights.
[2] MCU model size & power budget: C.Banbury et al., MLPerf Tiny Benchmark(2021): the reference keyword-spotting model is a 52.5 kB DS-CNN, and target devices run at 10–250 MHz under 50 mW. arXiv:2106.07597
[3] Keyword spotting on microcontrollers/ INT8 4× compression: Y. Zhang et al., Hello Edge: Keyword Spotting on Microcontrollers (2017).arXiv:1711.07128
[4]Keyword Transformer (~5.4M parameters): A. Berg et al., Keyword Transformer: A Self-Attention Model for Keyword Spotting, Interspeech 2021.arXiv:2104.00769
[5] BC-ResNet (~321k parameters, 89.1M MACs): B. Kim et al., Broadcasted Residual Learning for Efficient Keyword Spotting, Interspeech 2021.arXiv:2106.04140. See also the survey:I. López-Espejo et al., Deep Spoken Keyword Spotting: An Overview (2021),arXiv:2111.10592.
[6] Sub-1 MB speaker verification: B. Liu et al., Extremely Low Bit Quantization for Mobile Speaker Verification Systems Under 1MB Memory, Interspeech 2023(binarized ResNet34 “b-vector”: 0.97 MB, ~27× compression, 1.72% EER on the VoxCeleb1 original test set). ISCA Archive
[7] On-device TTS quality: Y. Ren et al.,FastSpeech 2: Fast and High-Quality End-to-End Text to Speech (2021), MOS
3.83 on LJSpeech. Microsoft Research.On-device example: Apple, Advancing Speech Accessibility with Personal Voice(2023), Apple ML Research.
[8] Sub-microwatt keyword spotting: CEA-Leti at ISSCC 2024, “0.4 V 988 nW Time-Domain Audio Feature Extraction for Keyword Spotting Using Injection-Locked Oscillators” (91% on 10 words).Coverage
[9] Conversational latency budget: ITU-T Recommendation G.114, One-way transmission time (≤150 ms one-way for transparent interactivity). ITU-T G.114
[10] Hardware-aware co-design gains: H.Bouzidi et al., HADAS: Hardware-Aware Dynamic Neural Architecture Search for Edge Performance Scaling (2022),up to 57% energy-efficiency gains.arXiv:2212.03354
[11] Edge NPU efficiency: Ceva-NeuPro-M(up to 350 TOPS/W) and Ceva-NeuPro-Nano (10–200 GOPS/core).
[12] Benchmarks: SUPERB (S. Yang et al.,Interspeech 2021); HEAR (J. Turian et al., NeurIPS 2021); MLPerf Tiny (above).
[13] Edge AI Foundation (formerly the tinyML Foundation): org