
Taboola 用 LLM 審廣告:由 demo 上線,差在模型外面嗰五層工程
Argus 拆開審查步驟、政策、工具同測試,改模型時亦可以逐段回退
LLM demo 通常幾日就整到:掉一張廣告圖、一段文案同幾條政策入模型,再叫佢判斷批唔批。去到真實廣告平台,麻煩先正式開始。內容可以牽涉產品聲稱、名人肖像、連結目的地、投放地區同當地規則,任何一次誤判都可能放走違規廣告,或者錯殺正常客戶。Taboola 公開嘅 Argus 案例有參考價值,正正因為焦點放喺模型外面嗰套控制系統。
「Harness」講緊外圍工程,唔係指定產品
iThome 報道所講嘅 Harness 工程,按 Eagle Chen 喺分享入面嘅定義,係包住 LLM 嘅整套軟件架構,包括流程、上下文、工具、記憶同 CI/CD,唔應理解成 Harness 公司嗰套開發平台。Argus 先把人手審查拆成九個階段,由辨認廣告類型、揀適用政策、查帳戶紀錄同產品聲稱,一路去到檢查素材、landing page、下決定同交代理由。每段各自留紀錄,亦可以獨立測試及換模型,出事時容易追返係邊一步開始走樣。
呢種拆法對其他團隊都啱用。一次過叫模型讀晒資料再畀總結論,表面簡單,不過錯咗通常只剩低一句含糊解釋。分段之後,金融團隊可以把合規條款、客戶資料同高風險決定分開;媒體或電商亦可以逐步驗證標題、圖片、產品聲稱同連結。代價係請求次數、延遲同工程複雜度都會增加,所以流程唔係拆得越碎越好,要睇每一段係咪真係有獨立規則、風險或者回退價值。

圖片:Taboola
RAG 同 few-shot 負責畀足背景
Argus 會先按廣告類別、市場同政策標籤揀出相關規則,再動態組合 prompt,避免模型同時消化成套政策。另一邊就用 RAG 搵返相似嘅舊個案,再用獲批同拒批個案做 few-shot 參考。呢個設計對中英文及粵語內容尤其實際:同一句宣傳字眼,放喺唔同產品、語境或地區,風險可以差好遠;淨靠一份抽象規則,模型未必捉到團隊過往點處理灰色地帶。
不過,歷史案例唔天然等於可靠答案。如果舊標註本身前後不一,RAG 只會更穩定咁重複舊問題;政策改咗之後,過期案例亦要降權或者停用。Taboola 亦畀模型接駁自建網頁及圖片搜尋工具,用嚟核對產品認證、名人代言等聲稱。工具輸出同普通網頁一樣,有可能過期、資料唔齊,甚至互相矛盾,所以高風險結果仍然要保存證據來源,再交畀人覆核。
換模型要當成軟件更新
最值得抄功課嘅部分係 prompt evaluation。Argus 把 prompt、政策同流程納入版本控制;任何改動,連底層模型升級,都要用既定測試集檢查品質、成本同延遲,過咗 release gate 先推出。Taboola 表示,系統由 GPT-4o 轉到 Gemini 3 Flash 後,首月成本低咗 30%,但專家發現兩類 IAB 廣告出現過度拒絕,團隊於是把嗰兩段先切返舊模型,其餘流程繼續用新模型。
呢件事亦解釋咗點解模型路由有用:同一套系統冇必要每一步都綁死同一個供應商或版本。Taboola 早前公開嘅 LLM Gateway,會用統一介面、virtual model、流量分配同 failover 管理多款模型。當分類、圖片理解、事實核對各有唔同成本同準確度要求,路由可以逐項揀模型;但前提係每項都有測試數據,否則只係把一個難追嘅模型變成幾個難追嘅模型。
人工覆核仍然係安全閥
公司亦用 LLM-as-a-Judge 幫政策專家預先評估改動,減少逐項標註嘅時間。呢類做法適合初步篩選,但判分模型可能同受測模型有相近盲點,唔可以完全取代真人標註。較穩陣嘅安排係將低信心、政策衝突、新類型內容同高風險拒絕個案交畀人覆核,再將覆核結果加返落評測集。咁先可以量度 precision、recall、誤殺率、漏放率,同埋各語言表現有冇明顯落差。
Taboola 聲稱 Argus 已覆蓋全部英文廣告,把平均審查時間由 12 小時減到幾分鐘、人手工作量減少 75%,判斷一致性亦高咗 13 個百分點。Google Cloud 另一份客戶案例同樣寫到,Taboola 採用 Gemini 圖像模型後,內容審查成本低咗 75%。呢啲都係供應商同客戶自行公布嘅成果,現有資料冇交代完整測試集、基準定義、誤殺率、漏放率同跨語言成效,兩個「75%」亦未必量度緊同一件事,唔應拼埋當成獨立驗證。
真正可以帶走嘅上線清單
對準備把 LLM 放入內容審查、客服、媒體編採或金融合規嘅團隊,Argus 提供咗一張幾實用嘅清單:把決定拆成可追蹤階段;只送相關政策同例子入模型;工具結果保留來源;prompt、模型及規則全部有版本;每次改動自動跑品質、成本、延遲同分語言測試;高風險及低信心個案交人覆核;部署亦要容許逐段切換同回退。
Taboola 嘅數字仲要等更完整資料先判斷成效,不過個工程方向清楚:開發團隊要長期維護嘅,除咗模型答案,仲有政策版本、測試集、證據、人工覆核同回退路徑。缺少其中幾樣,demo 即使睇落幾醒,上線後一改 prompt 或模型,都可能靜靜地改埋成套判斷標準。
參考來源
- iThome — Harness工程實戰!Taboola如何打造LLM廣告審查系統 — original report
- AI Enterprise Summit 2026:Lessons from Argus — 會議官方議程,核對講者、分享主題、多階段流程、RAG、few-shot 同 prompt evaluation 範圍。
- Taboola Engineering:LLM-Gateway — Taboola 官方工程文章,交代 virtual model、多供應商路由、failover、成本及監察設計。
- Google Cloud:Taboola case study — Google Cloud 客戶案例,補充 Gemini 圖像模型同內容審查成本數字;屬公司案例,並非獨立評測。
- Taboola Engineering:Utilizing LLMs for Localized Recommendations — Taboola 早期 LLM 生產案例,提供測試集、precision、recall、上下文同 few-shot 做法嘅背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







