ChatGPT Health 聲稱推理高過醫生,benchmark 同真正診症仲差幾遠?
Tech News

ChatGPT Health 聲稱推理高過醫生,benchmark 同真正診症仲差幾遠?

圖片:via The Verge — https://www.theverge.com/ai-artificial-intelligence/970115/openai-chatgpt-health-launch-claims
TechLab 編輯部(譯)·

美國全面開放健康資料連接,獨立研究仍見急症分流失手

OpenAI 今日開始向美國所有已登入、18 歲或以上嘅 ChatGPT 用戶開放 ChatGPT Health,涵蓋網頁版同 iOS,Free、Go、Plus、Pro 都有份。用戶可以接駁電子病歷、Apple Health 同其他健康 app,主聊天亦可以喺逐次取得同意後讀取相關資料。功能本身幾實用,不過發布會最搶眼嘅係另一句:產品副總裁 Ashley Alexander 話,模型推理能力已經「高過臨床醫生水平」。同場嘅 OpenAI 健康業務主管 Karan Singhal 隨即叫大家收窄理解,只話有個別研究見到呢個方向。

「高過醫生」測緊咩

OpenAI 指向一項由哈佛、史丹福等研究人員參與、刊於《Science》嘅研究。研究用 o1-preview 處理多組診斷同醫療決策任務,當中包括波士頓醫院 76 宗真實急症病例。研究抽取病人啱啱去到急症室、第一次見醫生同入院後三個階段嘅資料,再由兩名唔知答案出自邊一方嘅醫生,評核模型同兩名主診醫生寫出嘅判斷。;初步分流階段,模型交出完全或接近正確診斷嘅比率係 67.1%,兩名醫生分別係 55.3% 同 50%。呢個結果有份量,但對照醫生只有兩位,輸入亦集中喺文字病歷。

真實診症仲包括問症、驗身、睇影像、觀察病情點變,同病人溝通後果,再為決定負責。研究作者自己都強調,結果支持模型做第二意見同臨床輔助,未足以支持踢走醫生。OpenAI 自家 HealthBench 就用醫生寫嘅評分準則,睇回答安唔安全、清唔清楚、識唔識叫人及時求醫。呢套方法實際過醫科選擇題,不過量度到嘅仍然係一段答案有幾好,未有證明病人照做之後會得到更好診症結果。

ChatGPT 介面側欄顯示 Health 專區,同時提供接駁病歷同查看化驗結果選項

圖片:OpenAI

獨立壓力測試見到另一面

《Nature Medicine》刊出嘅獨立研究,用 60 個臨床情境、每個重複 16 次測 ChatGPT Health,總共收集 960 個回答。研究人員改動性別、種族、化驗資料、求醫障礙,亦加入家人話「冇咩嚴重」呢類干擾。結果系統低估咗 51.6% 真正急症;當家人先淡化病情,模型建議較低級別護理嘅機會高近 12 倍。四種教科書式典型急症佢全部識得叫人即時求醫,反而病情要靠時間進展先顯出危險嗰批最易失手。呢個落差正正係整齊病例 benchmark 容易遮住嘅地方。

答得順口,錯嗰陣一樣可以好危險

另一項醫生主導嘅紅隊研究,測試四款公開 chatbot 回答 222 條病人提出嘅醫療問題,共評核 888 個回答。研究用嘅 GPT-4o 有約 13.5% 回答俾醫生評為不安全,部分內容有機會造成嚴重傷害。呢個數字唔可以直接套落採用更新模型嘅 ChatGPT Health,但足以說明流暢語氣同臨床安全冇必然關係。醫療 LLM 研究亦一直見到漏資料同幻覺:模型可以寫出完整、肯定、甚至附帶解釋嘅答案,內容照樣冇根據。

健康資料唔只係一份普通附件

OpenAI 官方條款寫明,經 Health 接駁嘅病歷、Apple Health 資料、Health 對話同檔案,預設唔會用嚟訓練基礎模型或賣廣告,資料傳送同儲存時亦有加密。不過,少量獲授權員工同受信任服務供應商仍可能接觸資料,用嚟改善模型安全,除非用戶選擇退出;部分供應商亦會按 OpenAI 指示處理或儲存資料。斷開帳戶後,接駁資料可要等最多 30 日先刪除。單純刪走聊天亦唔等於刪走已接駁病歷,曾經寫入聊天或記憶嘅內容要另外處理。

香港用戶暫時用唔到核心病歷連接

今次全面推出主要面向美國,電子病歷接駁亦明確限定美國,Apple Health 同步就要用 iOS。香港用戶就算見到 Health 功能,亦唔好當本地醫療紀錄已經可以直接連接。若果自行上載化驗報告、處方或 Apple Health 資料,最好先移除冇必要嘅身份資料,睇清楚記憶、第三方 app 同資料刪除設定;消費版 Health 亦唔可以自動當成醫院簽咗醫療資料協議嘅工作環境。

ChatGPT Health 較適合整理化驗趨勢、改寫醫生說明同準備覆診問題。佢唔可以取代醫生診斷或治療;牽涉急症、藥物劑量、停藥或重大醫療決定,答案只可以用嚟整理問題。如懷疑有急症,應直接求醫或聯絡當地急症服務,唔好等 chatbot 判斷。OpenAI 下一步要做更多前瞻臨床研究,交代清楚模型會喺咩情況失手,推出後亦要持續公開安全數據。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook