#LLM
18 篇文章
TechLab 所有關於「LLM」嘅文章、評測同教學,由最新排起。
3C 產品本地 LLM 唔使一款打天下:拆解 XDA 作者長留硬碟嘅 4 個選擇
XDA 作者試過逾 20 款本地 LLM,最後按工作留下四款量化模型。不過呢份清單建基於佢自己部電腦同使用習慣,當中仲有社群改版;揀之前要睇清模型來源、RAM、VRAM,同自己願意用幾多速度換私隱。
3C 產品16GB RAM 輕薄 notebook 跑本機 LLM:四個模型做到咩、卡喺邊
XDA 作者用一部 16GB RAM、AMD Radeon 整合顯示核心嘅 Lenovo notebook 跑四個量化 LLM,寫作、摘要同細型 coding 工作都做到。不過原文冇公開 token 速度同完整設定,結果更適合當入門方向,未足以當成通用 benchmark。
Tech NewsKog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲
Kog 話自家推理引擎可喺 8 張 MI300X 上跑到每秒 3,000 個輸出 token。個數字夠搶眼,不過真正值得睇嘅係佢點樣壓低單一請求延遲,同埋呢套方法搬去大型第三方模型時會遇到咩限制。
Tech NewsUnsloth Desktop 接通本機 LLM 同 Codex:慳 API 費用要先過硬件一關
Unsloth Desktop 將模型下載、推理、微調同 API endpoint 集中喺同一個介面,仲可以接駁 Codex 同 Claude Code。本機處理敏感程式碼確實吸引,亦有機會慳返部分雲端 API 費用,不過模型能力、RAM/VRAM 同推理速度,會直接決定佢有幾實用。
3C 產品本機 LLM 將 PDF 變私人溫習助手:私隱夠吸引,答案仍要逐頁核對
XDA 作者用 Ollama、Gemma 4 E4B 同 ChromaDB,將講義、PDF 同筆記變成離線問答及出題工具。資料留喺自己部機確實吸引,不過原文冇交代完整硬件規格、準確率或學習成效;RAG 亦只係減少幻覺,答案仍要睇返頁碼逐項核對。
3C 產品玩 local LLM 一定要獨立顯示卡?RTX 5070 同舊 iGPU 差距拆解
XDA 用 RTX 5070 Laptop GPU 同 Ryzen 7 5825U integrated graphics 跑同一個 Gemma 3 4B。獨顯生成快好多,不過舊 laptop 靠量化模型同共享 RAM,一樣做到摘要、改文同問答。想試本地 AI,未必一開始就要買顯示卡。
Tech NewsGoogle 自搜未必夠:In the Weights 睇 AI 記唔記得你
In the Weights 由前 OpenAI / Global Illumination 成員 Thomas Dimson 同 Joey Flynn 整,會問多個模型同一個名,再聚類出 strength score。好玩之餘,亦提醒創作者同 founder:AI 搜尋講你啲咩,未必同 Google 一樣。
3C 產品M4 Max 本地 LLM 輸出快過 GB10,但長 prompt 同軟件生態要另計
Tom’s Hardware 測試顯示,M4 Max Mac Studio 生成 token 快過 GB10 同 Strix Halo,不過遇上長 context,GB10 處理 prompt 快好多。再計 CUDA、模型格式、同時服務多人同香港售價,呢場比拼遠未到睇一個 tokens/s 數字就有答案。
3C 產品二手 Tesla V100 平價加 16GB VRAM:本機 LLM 慳錢背後六個伏位
一張平價二手 Tesla V100,配合 RTX 4080 跑出 32 tokens/s,睇落幾吸引。不過 32GB 只係兩張卡合計,重有 SXM2 轉接、散熱、driver、耗電同重啟異常要處理,價錢亦唔可以直接照搬美國市場。
3C 產品本機 LLM 真係慳錢又保密?16GB RAM 只夠入門,雲端模型仲未退場
XDA 作者將 LLM 裝落自己部 Windows PC,最後變成每日主力工具。不過佢用緊 RTX 5070 加 32GB RAM,體驗唔代表一般 notebook。本機模型勝在離線、資料唔使交去第三方同冇用量限制,但模型質素、速度同硬件成本仍然要逐樣計。
3C 產品普通電腦自己跑 LLM 值唔值?私隱同成本背後仲有幾筆數
本機 LLM 已經去到普通 16GB 電腦都玩得起,但「跑得郁」同「取代 ChatGPT」差好遠。由模型質素、RAM、速度到用電同資料安全,真正抵玩嘅情況其實幾清楚:手上已有合適硬件,又經常處理唔方便上雲端嘅文件。
Tech NewsTaboola 用 LLM 審廣告:由 demo 上線,差在模型外面嗰五層工程
Taboola 公開 LLM 廣告審查系統 Argus 嘅設計:模型只負責推理,外圍再加多階段審查、RAG、工具、模型路由同 prompt 測試。公司聲稱處理時間由 12 小時縮到幾分鐘,不過未有完整錯誤率同跨語言數據,暫時更值得睇嘅係佢點控制上線風險。
Tech NewsUbiMyTherapist 讀心率同語氣,AI 心理助理開始走向主動介入
渥太華大學 UbiMyTherapist 暫時只係研究原型,但方向好清楚:AI 心理助理開始連住 smartwatch、手機同耳機,靠心率變化、語氣同文字估情緒低谷。真正要睇嘅唔止係回應夠唔夠暖,仲有資料點收、點刪、誤判點處理,同真人治療師點接手。
3C 產品本機 LLM 唔係雲端 AI 縮水版:coding、私隱文件同舊電腦點分工
XDA 篇文講咗一批新本機 LLM,重點唔係佢哋追到 ChatGPT 幾多,而係開始用新架構慳記憶體、拉長 context、處理圖片同聲音。對一般人嚟講,重點係分清邊啲工作適合離線跑,邊啲交返畀雲端模型會實際啲。
3C 產品1.5TB 大模型用 25GB RAM 跑到,Colibrì 其實證明咗咩?
Colibrì 用 25GB RAM 跑 GLM-5.2 好吸睛,但唔等於平機打贏 AI server;值得睇嘅係 MoE 點樣將 VRAM 壓力搬去 NVMe、RAM cache 同 CPU。
3C 產品Gemma 4 12B 本機 AI:16GB laptop 跑得起,取捨要睇清
Google Gemma 4 12B 俾本機 AI 多咗一個實際選擇:文件、截圖、語音同 coding agent 都可以留喺機入面處理。不過官方同 model card 都講得好清楚,16GB 夠用要睇 GPU、量化版本同你用邊套工具。
3C 產品Android Bench 換評測方法:AI 寫 Android app 排名要重新睇
Google 更新 Android Bench,改用 Harbor framework 評測 AI model 寫 Android code,仲開放開發者提交任務。Fable 5 截至 2026 年 7 月 8 日排第一,不過今次最值得睇係方法轉咗:揀 coding agent,要用自己 app codebase 再試一次。
3C 產品Tom's Hardware 實測 AMD Ryzen AI Halo:128GB 本機 AI 盒仔,暫時未夠打 GB10
AMD Ryzen AI Halo 用 128GB unified memory、ROCm 同一套 playbooks,想做成本機 AI / coding agent 開發盒。不過 Tom's Hardware 實測指長 context 延遲同軟件細節仍落後 Nvidia GB10,買之前要分清自己要彈性定要快。