TAG

#大型語言模型

7 篇文章

TechLab 所有關於「大型語言模型」嘅文章、評測同教學,由最新排起。

Claude Code 模型揀得少反而易用?Sonnet、Opus、Haiku 點分工3C 產品

Claude Code 模型揀得少反而易用?Sonnet、Opus、Haiku 點分工

AI coding 工具塞滿唔同供應商嘅模型,睇落選擇多,實際每次開工都要重新估速度、成本同能力。Claude Code 用較短嘅模型清單減少切換成本,Sonnet、Opus、Haiku 亦有清楚分工,不過呢套做法同時綁住 Anthropic 生態。

21 天前
Kimi K3 開放權重:2.8T 模型放入 coding workflow,邊個真係用得着?Tech News

Kimi K3 開放權重:2.8T 模型放入 coding workflow,邊個真係用得着?

Kimi K3 公開咗 2.8T 參數模型權重,主打 1M context 同 coding agent。不過一般開發者多數只會經 API 用,token 單價亦未必等於整項工作平;硬件、agent 效率、授權同資料安排都要逐樣計。

30 天前
Kimi K3 前端 coding 登頂:平價百萬 token 模型值唔值得開發者轉用?Tech News

Kimi K3 前端 coding 登頂:平價百萬 token 模型值唔值得開發者轉用?

Moonshot AI 推出 Kimi K3,靠前端 coding、百萬 token context 同較低 API 價錢搶眼球。獨立評測顯示佢部分能力已經貼近頂級模型,不過速度、幻覺、agent 相容性同企業資料處理仍有數要計,現階段較適合小規模試跑。

1 個月前
Kimi K3 前端生成贏 Arena,coding agent 賣點係 API 平同 100 萬 token context3C 產品

Kimi K3 前端生成贏 Arena,coding agent 賣點係 API 平同 100 萬 token context

Moonshot AI 推出 2.8T 參數 Kimi K3,喺 Frontend Code Arena 排第一,API 價亦低過 Claude Fable 5 同 GPT-5.6 Sol。不過 benchmark 未足以證明整體 coding 稱王,而完整權重、授權同香港帳戶支援仍有幾個問號。

1 個月前
一個故事 prompt 繞過 AI 防線:26 款模型單輪越獄平均成功率 71.3%Tech News

一個故事 prompt 繞過 AI 防線:26 款模型單輪越獄平均成功率 71.3%

F5 用 40 篇藏有危險步驟嘅故事,測試 26 款前沿 AI 模型,單輪越獄平均成功率達 71.3%。呢個數字唔代表所有模型平時都有同等失守機會,卻提醒公司揀模型時,能力榜同安全回應同樣要睇。

1 個月前
10 款主流 AI 遇上政治批評有兩套尺度,跨境拒答點樣形成?Tech News

10 款主流 AI 遇上政治批評有兩套尺度,跨境拒答點樣形成?

Oversight Board 測試 10 款主流模型,發現佢哋生成政治批評素材時,面對言論限制較多嘅政權,拒答率由 14% 升到 34%。研究未足以證明 AI 公司主動審查,但揭出模型可能將目標國家嘅法律同政治風險,帶到境外用戶面前。

1 個月前
Google AI 摘要連 Google 都串錯:香港用家要識嘅核對底線Tech News

Google AI 摘要連 Google 都串錯:香港用家要識嘅核對底線

Google AI Overviews 被發現連 Google 有幾多個 P 都答錯。問題唔止係串字失手,而係 LLM 以 token 處理文字,令 AI 搜尋摘要喺規格、價錢、醫療、法律同財務資料上更需要交叉核對。

3 個月前