
ChatGPT、Claude、Gemini 摘 47 頁報告都有錯:長文件 AI 摘要點先可信
單次測試唔係排名,但三種錯法都值得防
XDA 作者 Anurag Singh 將同一份 47 頁 Reuters Institute 報告,分別交畀 ChatGPT、Claude 同 Gemini 摘要。作者本身睇過成份文件,所以先捉到三款工具各有甩漏。呢次測試幾貼近學生、研究人員同辦公室用戶嘅日常:份 PDF 唔算誇張長,指示亦寫得相當清楚,但一篇讀落順口、數字又多嘅摘要,照樣可以靜靜雞改咗原文意思。
指示夠清楚,三款工具仍然各自走樣
作者要求約 800 字、列出十項重點、交代方法同限制,亦要分開實際量度結果、受訪者預期同報告作者預測;每個數字仲要附頁碼,只准用上載咗嘅 PDF,文件冇答案就要明講。原報告包括 280 名、來自 51 個國家及地區嘅新聞業管理層調查,另有 Chartbeat 追蹤 2,576 個網站所得嘅流量數據。換句話講,入面同時有問卷意見、實際量度同作者判斷,分類本身已經係摘要工作嘅核心。
ChatGPT 整體最接近原文,統計同頁碼大多對得上,不過佢撈亂咗調查預期同作者預測,仲加入報告冇提過嘅來源及資料。嗰啲額外資料未必錯,但已經違反「只用附件」呢項限制。Claude 就聲稱報告所有百分比都只代表高層預期或信念,直接漏咗 Chartbeat 嘅量度數據;當中包括全球 Google Search 引流跌 33%、美國跌 38%。文中亦話 Claude 有多個數字唔準。
Gemini 嘅問題再明顯啲。佢將「67% 出版商冇因 AI 裁員」放入實際量度結果,但呢個數字來自 263 名管理層自報公司情況,唔係獨立就業統計。另一處,Gemini 見到 97% 受訪者認為後台自動化對 2026 年重要,就寫成 AI 整合已經非常普及,將「覺得重要」推成「已經採用」。佢亦冇按指示為大部分數字標頁碼,令讀者好難即場核對。

圖片:Reuters Institute
呢次測試證明到咩,證明唔到咩
呢三種錯法都值得防:加插附件以外資料、撈亂證據種類、將態度推論成實際狀況。佢哋未必係憑空作一個假數字,更多時係保留咗原文關鍵詞,再補上一段聽落合理嘅連接。呢類錯誤特別陰濕,因為句子流暢、百分比又真係喺文件出現,普通讀者未睇過原文,好容易當佢已經核實過。
不過,呢次只係一名作者、單一 PDF、每款服務一份輸出嘅個人測試。原文公開咗 prompt 同文件格式,卻冇列出實際模型版本、付費方案、測試日期,亦冇講有冇重複跑幾次。作者只話冇揀最強模型。模型更新速度快,同一服務入面揀唔同版本、推理強度,甚至重新開一個對話,都可能交出另一個結果,所以呢份測試只可以當錯誤案例,唔可以當 ChatGPT、Claude、Gemini 嘅普遍準確度排名。
叫 AI 交證據,唔好淨係交靚摘要
實際用嗰陣,可以叫工具先交一張「主張、證據種類、PDF 頁碼、原文句子」對照表,再寫摘要。證據種類至少分做量度數據、受訪者自報、受訪者預期同作者預測;搵唔到原句就標明文件冇答案。頁碼亦要小心,有啲 PDF 閱讀器顯示嘅檔案頁數會同印刷頁碼錯位,最好要求兩者一齊列出,之後撳返去睇前後文。
關鍵數字就逐個抽查:先喺 PDF 搜個數字,再睇清楚主語、樣本數、時間範圍同量度方法。尤其見到「認為重要」「預計影響」「計劃採用」呢類字眼,唔好畀 AI 縮成「已普及」或「已造成」。Google 官方話 NotebookLM 回答會以用戶揀選嘅來源為依據,亦可由引用跳返原文位置;呢種介面確實方便核對,不過 Google 同樣提醒工具會出錯,監督仍然要由人做。
研究界早已指出,模型食得落長 context,唔代表佢穩定用得到每一段資料。TACL 嘅「Lost in the Middle」研究發現,相關內容放喺長輸入中段時,模型表現往往會跌;2026 年 ACL 研究亦指,長文件摘要連自動事實一致性評分都仲未算穩。要交功課、寫報告、做研究或者向老細報數,AI 可以幫手加快閱讀,但附頁碼、原句同人手抽查先可以令錯處有機會曝光。
參考來源
- XDA Developers — I made ChatGPT, Claude, and Gemini summarize a report I'd actually read, and caught all three making things up — original report
- Journalism, media, and technology trends and predictions 2026 — 被摘要嘅原始報告,可核對問卷、Chartbeat 數據同各項百分比嘅性質。
- Does ChatGPT tell the truth? — OpenAI 官方承認模型可能交出錯誤資料或虛構引用,並建議核實重要數據同技術資料。
- Use chat in NotebookLM — Google 官方交代 NotebookLM 點樣以指定來源回答、顯示原文引用,同提醒用戶仍要覆核。
- Lost in the Middle: How Language Models Use Long Contexts — 經同行評審嘅長 context 研究,補充模型對輸入中段資料可能失準嘅背景。
- Stress Testing Factual Consistency Metrics for Long-Document Summarization — 2026 年 ACL 研究,指出長文件摘要嘅事實一致性評估仍有明顯限制。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。






