
ChatGPT Health 聲稱推理高過醫生,benchmark 同真正診症仲差幾遠?
美國全面開放健康資料連接,獨立研究仍見急症分流失手
OpenAI 今日開始向美國所有已登入、18 歲或以上嘅 ChatGPT 用戶開放 ChatGPT Health,涵蓋網頁版同 iOS,Free、Go、Plus、Pro 都有份。用戶可以接駁電子病歷、Apple Health 同其他健康 app,主聊天亦可以喺逐次取得同意後讀取相關資料。功能本身幾實用,不過發布會最搶眼嘅係另一句:產品副總裁 Ashley Alexander 話,模型推理能力已經「高過臨床醫生水平」。同場嘅 OpenAI 健康業務主管 Karan Singhal 隨即叫大家收窄理解,只話有個別研究見到呢個方向。
「高過醫生」測緊咩
OpenAI 指向一項由哈佛、史丹福等研究人員參與、刊於《Science》嘅研究。研究用 o1-preview 處理多組診斷同醫療決策任務,當中包括波士頓醫院 76 宗真實急症病例。研究抽取病人啱啱去到急症室、第一次見醫生同入院後三個階段嘅資料,再由兩名唔知答案出自邊一方嘅醫生,評核模型同兩名主診醫生寫出嘅判斷。;初步分流階段,模型交出完全或接近正確診斷嘅比率係 67.1%,兩名醫生分別係 55.3% 同 50%。呢個結果有份量,但對照醫生只有兩位,輸入亦集中喺文字病歷。
真實診症仲包括問症、驗身、睇影像、觀察病情點變,同病人溝通後果,再為決定負責。研究作者自己都強調,結果支持模型做第二意見同臨床輔助,未足以支持踢走醫生。OpenAI 自家 HealthBench 就用醫生寫嘅評分準則,睇回答安唔安全、清唔清楚、識唔識叫人及時求醫。呢套方法實際過醫科選擇題,不過量度到嘅仍然係一段答案有幾好,未有證明病人照做之後會得到更好診症結果。

圖片:OpenAI
獨立壓力測試見到另一面
《Nature Medicine》刊出嘅獨立研究,用 60 個臨床情境、每個重複 16 次測 ChatGPT Health,總共收集 960 個回答。研究人員改動性別、種族、化驗資料、求醫障礙,亦加入家人話「冇咩嚴重」呢類干擾。結果系統低估咗 51.6% 真正急症;當家人先淡化病情,模型建議較低級別護理嘅機會高近 12 倍。四種教科書式典型急症佢全部識得叫人即時求醫,反而病情要靠時間進展先顯出危險嗰批最易失手。呢個落差正正係整齊病例 benchmark 容易遮住嘅地方。
答得順口,錯嗰陣一樣可以好危險
另一項醫生主導嘅紅隊研究,測試四款公開 chatbot 回答 222 條病人提出嘅醫療問題,共評核 888 個回答。研究用嘅 GPT-4o 有約 13.5% 回答俾醫生評為不安全,部分內容有機會造成嚴重傷害。呢個數字唔可以直接套落採用更新模型嘅 ChatGPT Health,但足以說明流暢語氣同臨床安全冇必然關係。醫療 LLM 研究亦一直見到漏資料同幻覺:模型可以寫出完整、肯定、甚至附帶解釋嘅答案,內容照樣冇根據。
健康資料唔只係一份普通附件
OpenAI 官方條款寫明,經 Health 接駁嘅病歷、Apple Health 資料、Health 對話同檔案,預設唔會用嚟訓練基礎模型或賣廣告,資料傳送同儲存時亦有加密。不過,少量獲授權員工同受信任服務供應商仍可能接觸資料,用嚟改善模型安全,除非用戶選擇退出;部分供應商亦會按 OpenAI 指示處理或儲存資料。斷開帳戶後,接駁資料可要等最多 30 日先刪除。單純刪走聊天亦唔等於刪走已接駁病歷,曾經寫入聊天或記憶嘅內容要另外處理。
香港用戶暫時用唔到核心病歷連接
今次全面推出主要面向美國,電子病歷接駁亦明確限定美國,Apple Health 同步就要用 iOS。香港用戶就算見到 Health 功能,亦唔好當本地醫療紀錄已經可以直接連接。若果自行上載化驗報告、處方或 Apple Health 資料,最好先移除冇必要嘅身份資料,睇清楚記憶、第三方 app 同資料刪除設定;消費版 Health 亦唔可以自動當成醫院簽咗醫療資料協議嘅工作環境。
ChatGPT Health 較適合整理化驗趨勢、改寫醫生說明同準備覆診問題。佢唔可以取代醫生診斷或治療;牽涉急症、藥物劑量、停藥或重大醫療決定,答案只可以用嚟整理問題。如懷疑有急症,應直接求醫或聯絡當地急症服務,唔好等 chatbot 判斷。OpenAI 下一步要做更多前瞻臨床研究,交代清楚模型會喺咩情況失手,推出後亦要持續公開安全數據。
參考來源
- The Verge — OpenAI is making big claims as it rolls out ChatGPT Health to everyone — original report
- Introducing ChatGPT Health — OpenAI 官方產品介紹,說明用途、HealthBench、資料隔離同美國限定功能。
- Health in ChatGPT — 官方支援文件,核對年齡、平台、電子病歷地區限制、刪除同第三方 app 控制。
- Health Privacy Notice — 官方健康資料條款,交代訓練用途、授權人員存取、服務供應商同資料披露安排。
- Performance of a large language model on the reasoning tasks of a physician — OpenAI 高層所指嘅哈佛及史丹福相關研究,測試 o1 系列處理診斷同醫療決策任務。
- ChatGPT Health performance in a structured test of triage recommendations — 獨立壓力測試,揭示真正急症低估、非臨床因素干擾同病情進展相關失誤。
- Large language models provide unsafe answers to patient-posed medical questions — 醫生主導紅隊研究,比較公開 chatbot 回答病人醫療問題時嘅不安全內容。
- A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation — 醫療文字摘要研究,用嚟補充 LLM 幻覺、遺漏資料同臨床安全之間嘅風險。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







