TAG
#大語言模型
4 篇文章
TechLab 所有關於「大語言模型」嘅文章、評測同教學,由最新排起。
3C 產品兩部 DGX Spark 跑 DeepSeek V4 Flash:所謂追上雲端講緊邊樣?
XDA 用兩部 NVIDIA DGX Spark 分擔 284B 參數嘅 DeepSeek V4 Flash,輸出升到每秒 36 至 41 token,寫 code 一度衝上 76。不過「追上雲端」主要係指模型毋須再壓到 2-bit,加上作者主觀使用感受,未有完整質素或雲端速度對照。
27 天前
Tech News中國開放權重模型真係領先?Qwen、DeepSeek、Kimi 靠成本同選擇搶市場
Hugging Face 數據顯示,中國模型已佔平台下載量四成以上,Qwen、DeepSeek 同 Kimi 亦快速滲入開發者工具。不過下載排行唔等於整體 AI 能力,開放權重帶嚟嘅成本、私隱同自由度,背後一樣有硬件、管理同授權代價。
1 個月前
Tech NewsKimi K3 平價追到前線,開放權重會點改寫開發者 AI workflow?
Moonshot Kimi K3 同阿里 Qwen3.8 接連挑戰 OpenAI、Anthropic,賣點係接近前線模型嘅能力、較平 API 同開放權重。不過價目只講咗半個故事:agent 用幾多 token、權重點部署、資料放邊度,同樣會影響開發者揀邊個模型。
2 個月前
Tech NewsThinking Machines 首個模型 Inkling:975B 開放權重,主攻微調同企業部署
Inkling 有 975B 總參數,支援文字、圖像同聲音,亦以 Apache 2.0 開放權重。Thinking Machines 主打嘅賣點係可調校推理量同 Tinker 微調,不過官方跑分未有第三方驗證,部署成本亦遠超一般團隊負擔。
2 個月前