
Raspberry Pi 跑本地語音助手:做到,但未到離線 Siri
XDA 呢套做法證明工具已經夾到,但延遲同維護成本都要計清楚
件事其實唔神秘,神奇喺啲膠水成熟咗
XDA 作者 Ayush Pande 喺 7 月 11 日分享咗一套 Raspberry Pi 5 語音助手玩法:Pi 5 8GB 跑 Raspberry Pi OS Lite,用 llama.cpp 跑 Qwen3.5-2B,Speaches 做 speech-to-text 同 text-to-speech,Open WebUI 做介面、咪高峰入口同自動播放。原文標題寫 Speeches,但專案官方名係 Speaches,定位好直接:做 OpenAI API-compatible 嘅本地 speech server,用 faster-whisper 轉文字,再用 Piper 或 Kokoro 講返出嚟。
值得睇嘅位係:Raspberry Pi 冇突然變成猛料 AI server,而係幾個開源工具終於夾到一齊。llama.cpp 有 OpenAI-compatible server;Speaches 亦扮到 OpenAI audio API;Open WebUI 本身支援 OpenAI-compatible 模型、STT/TTS、麥克風同自動播放。換句話講,DIY 語音助手由砌一堆 script,變成設定幾個 endpoint。呢個門檻低咗好多。

圖片:Open WebUI
效能:夠用同爽用差好遠
要先收低期望。XDA 呢套唔係即問即答:作者話 faster-distil-whisper-small.en 轉錄一段語音通常 10 至 15 秒,Qwen3.5-2B 出答案 15 至 45 秒,Kokoro-82M-v1.0-ONNX 再用約 10 秒做 TTS;簡單 prompt 大概一分鐘內有聲回覆。佢亦話 Gemma 4 E4B 喺 Pi 5 上得 2 至 3 token/s,慢到唔適合語音助手,所以先轉用 2B 級模型。
Raspberry Pi 5 官方規格寫明,佢係 2.4GHz 四核心 Arm Cortex-A76,RAM 版本去到 16GB,重負載最好配主動散熱同 5V/5A USB-C 供電。呢啲規格對 Home Assistant、NAS 小服務、輕量 LLM 都幫到手,但語音助手係三段式:STT、LLM、TTS 串住跑。任何一段慢,都會拖住成個體驗。
點解唔直接用 Siri / Gemini / Alexa?
雲端助手爽嘅地方係快、模型大、接駁生態多,問天氣、播歌、搵資料、跨 app 做嘢,普通人唔使理 server。自建 Pi 助手贏嘅地方係控制權:咪高峰收咗咩、語音有冇出屋企、日誌留幾耐、邊部機可以叫佢,全部自己定。Home Assistant 官方都講,本地 Assist pipeline 可以令語音指令留喺自家硬件。
但私隱換嚟嘅代價係維護。HTTPS、Docker network、模型下載、endpoint 路徑、瀏覽器麥克風權限,全部都會變成你自己嘅事。XDA 作者最後要開 Brave 個 allow-insecure-localhost flag 先畀 Open WebUI 用咪,呢類細節就係 DIY 同消費級助手嘅分界。前者自由,後者少煩。
最啱用喺邊度
如果你本身有 Home Assistant、NAS、舊屏幕、閒置 Pi,呢套方向幾合理。最穩陣係短命令同固定流程:開燈、查 sensor、記低一句備忘、叫 NAS 搵檔、問公司內部 FAQ、整理今日行程。呢啲場景唔追求好似 ChatGPT Voice 咁自然,重點係資料唔使上雲,同埋可以同你屋企或工作間嘅工具直接駁埋。
如果你想要流暢對話、廣東話識別穩、多人輪流講、背景聲好嘈都聽得準,Pi-only 路線暫時唔好抱太大期望。Home Assistant 文件都講,Whisper 喺 Pi 4 處理語音命令約 8 秒,Intel NUC 可以少過一秒;雖然 Pi 5 快過 Pi 4,但本地開放式語音仍然食資源。要爽,N100 mini PC 或有 GPU 嘅機會舒服好多。
有用嘅位喺邊
呢件事拆穿咗一個誤會:本地 AI 助手唔一定要一開始追大模型。家居自動化好多時只係要理解意圖、揀啱工具、回一句短答;2B 模型加清楚指令,可能實際過一個慢到等半分鐘先郁嘅 7B/8B。反而 STT 同 TTS 先係體感關鍵,因為你每次開口都要過呢兩關。
另一個位係 API 相容性。llama.cpp、Speaches 同 Open WebUI 都向 OpenAI-style endpoint 靠攏,令本地工具可以互換。今日用 Qwen 細模型,聽日可以轉 Gemma、LFM 或其他 GGUF;今日用 Kokoro,之後可以換 Piper 或外置 TTS server。呢種可換性有趣過單一品牌助手,亦啱鍾意自己掌控成套系統嘅人。
可以玩,但唔好買錯夢
所以,Raspberry Pi 本地語音助手而家已經過咗純 demo 階段,但仍然係實驗機多過日用品。你要嘅係私隱、自動化、同埋學點駁本地 AI pipeline,Pi 5 係幾好玩嘅入口;你要嘅係屋企每個人都可以即刻問、即刻答、唔使你維護,雲端 Siri/Gemini/Alexa 暫時仍然舒服。下一步值得睇嘅,係 Pi 5 16GB、N100 小主機同更細嘅 STT/TTS 模型,邊個先可以令延遲壓到真正常用。
參考來源
- XDA Developers — Llama.cpp, Speeches, and Open WebUI turned my Raspberry Pi into a voice assistant that actually works — original report
- Speaches Documentation — 核實 Speaches 官方名稱、OpenAI API 相容性、STT/TTS 引擎來源
- Speaches:Open WebUI Integration — 核實 Speaches 點樣接入 Open WebUI 嘅 Audio 設定
- llama.cpp GitHub README — 核實 llama.cpp 定位、OpenAI-compatible server 同量化支援
- Open WebUI Audio Troubleshooting Guide — 核實 Open WebUI 嘅 STT/TTS、咪高峰、自動播放同音訊設定
- Raspberry Pi 5 Product Page — 核實 Pi 5 CPU、RAM、供電同主動散熱建議
- Home Assistant:Set up a fully local voice assistant — 補充本地語音助手喺智能家居場景嘅效能同私隱取捨
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







