ChatGPT、Claude、Gemini 摘 220 頁 PDF,點解 Claude 反而最啱長報告
3C 產品

ChatGPT、Claude、Gemini 摘 220 頁 PDF,點解 Claude 反而最啱長報告

圖片:via XDA Developers — https://www.xda-developers.com/chatgpt-claude-and-gemini-summarize-the-same-200-page-pdf/
TechLab 編輯部(譯)·

同一份 AI 安全報告試三個模型,結果講緊摘要取捨同查證方法

一份 PDF,三種性格

XDA 作者 Yash Patel 呢次做嘅測試幾貼地:同一份《International AI Safety Report 2026》,PDF 官方檔案係 221 頁,原文當 220 頁級研究報告處理;同一個 prompt,要 ChatGPT、Gemini 同 Claude 交一份 executive briefing,唔逐章搬字,重點係 key findings、統計、風險、預測同建議。XDA 文中列出用嘅模型係 ChatGPT GPT-5.5、Gemini 3.5 Thinking 同 Claude Sonnet 5,時間點係 2026 年 7 月 10 日;樣本得一份、冇公開重跑結果,所以呢個結果要當快照睇,唔好當永遠排名。

Google 官方 Gemini 3.5 文章入面嘅產品視覺圖

圖片:Google

Claude 贏喺取捨,Gemini 贏喺密度

按 XDA 作者講法,ChatGPT 個版本最易讀,標題同段落順,啱想快手明白報告大意;問題係有啲位偏概括,少咗背景同細節。Gemini 就相反,佢交出最多內容,而且原文話速度最快,睇落最似濃縮版報告,適合搵 spec、白皮書重點、技術文件入面散落各處嘅數字。不過資料太密,讀起上嚟又變返做另一份報告。Claude 慢啲,但 XDA 覺得佢最識揀重點,深度、結構同可讀性平衡得最好。

差別唔止係模型文筆,仲關文件點樣被讀入去

呢類 200 頁以上 PDF,其實考嘅唔止模型文筆。OpenAI 自己講 ChatGPT 檔案上載可以做摘要、比較同抽取資料;至少喺企業版講解入面,文件處理會分 context stuffing 同 private search index,長文件唔一定整份塞晒入即時 context。Google Gemini 官方亦提醒,檔案太大時,模型可能 miss 咗散喺唔同位置嘅關聯同細節;升級計劃先有大啲 context。Claude 官方文件就講到 PDF 解析、視覺內容同 citations 會影響結果,API 引用 PDF 時可以交 1-indexed 頁碼範圍。換句話講,同一個 PDF,介面點讀、點檢索、點引用,都會改變摘要味道。

要摘要長報告,prompt 唔可以太客氣

如果你淨係打「summarize this PDF」,三個模型都會交到一篇似樣嘅文,但好難知邊句有根據。實用寫法係一開始就講清楚用途同對象,例如「我要 10 分鐘內向老闆講清楚呢份報告」,再限制輸出:先交 8 至 12 個主結論,每點附 PDF 頁碼、原文短句、可信度,同埋「呢點點解重要」。第二步再叫佢列出 5 個最唔肯定嘅位、5 個要人手翻查嘅數字,講明冇頁碼就唔好當事實寫。呢個做法對研究 paper、合約、課堂 notes 同 API spec 都啱用。

查 hallucination,要逼佢交證據表

最穩陣嘅流程係分兩輪。第一輪叫模型摘要,第二輪叫佢自己拆成表格:claim、PDF 頁碼、支撐短句、信心、可能錯喺邊。數字、日期、法規義務、benchmark 呢啲最易出事,要抽 5 至 10 條返 PDF viewer 對頁碼;如果頁碼對唔上,成段就降級做「待核實」。Claude 喺 XDA 呢次勝出,唔代表每份 PDF 都揀 Claude;如果你要最快掃一份長 spec,Gemini 可能有效率啲;如果你只係要會議前快手 briefing,ChatGPT 夠直接。處理正經文件時,一鍵摘要只可以當第一步;最好保留頁碼、引用同待核實位,之後先方便覆查。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook