
Anthropic 用 J-Lens 睇到 Claude 入面點轉彎,但意識呢題未有答案
J-Space 可見中途概念,對 coding agent 同企業 AI 審核有用
Anthropic 今次睇到咩
Tom's Hardware 用「read Claude's thoughts」做 headline,聽落好科幻,但件事拆開其實冇咁玄。Anthropic 7 月 6 日公開嘅研究,核心係 Jacobian Lens(J-Lens):研究員嘅做法好工程,量度某一層內部 activation 點樣推高模型之後講某個 token 嘅機會。再將呢啲可講出口嘅概念攞出嚟,就叫 J-Space。
研究入面嘅例子幾直觀:多步算式最後只出 49,J-Lens 早啲睇到 21、42 呢啲中途數;一段 code 有 bug,J-Space 會冒出 ERROR / ValueError;搜尋結果暗藏 prompt injection,入面會出 fake、prompt、injection。呢點有趣,因為純睇輸出你可能只見到一句乾淨答案,但模型入面曾經有過一段概念搬運。

圖片:Anthropic
點解拉到 global workspace
Anthropic 拉 global workspace theory 入嚟,原因係 J-Space 唔只似字幕機。論文做咗幾類干預:叫 Claude 先諗一項運動,再喺未答之前用 Rugby 取代 J-Space 入面嘅 Soccer,最後答案跟住變;問蜘蛛腳數時,用 ant 取代內部 spider,答案由 8 變 6;同一個 France→China 嘅替換,會同時影響首都、語言、洲份、貨幣答案。呢啲測試想證明:某啲中途概念真係俾後面多個計算步驟攞去用。
不過類比去人腦,火位就喺度。人類 global neuronal workspace 講嘅係腦內多個專門系統共享少量資訊,通常仲牽涉循環訊號同時間上嘅維持;Claude 呢種 transformer 係單次向前計算,深度扮演咗時間嘅角色,內容又幾乎全係文字。Dehaene 同 Naccache 嘅外部評述都話有平行位,但提醒 Claude 冇身體、冇持續 episodic memory,自我感亦同人差好遠。

圖片:Anthropic
有意識?呢度最易講錯
最要收斂嘅係「thoughts」呢個字。Anthropic 自己寫得好清楚:實驗冇顯示 Claude 會好似人咁有經驗、有感受。佢哋分開兩件事:一種係可報告、可用嚟推理、可左右行動嘅 access consciousness;另一種係會痛、會驚、會有主觀感受嗰種 phenomenal consciousness。J-Space 最多係幫前者加咗一批可測訊號,跳唔到去後者。
限制仲幾實際。論文講明,J-Space 只佔 activation 變化好細一部分,最高都唔到 10%;Claude 大量流暢說話、簡單事實、語法處理都可以繞過 J-Space。J-Lens 又主要讀單一 token 對應到嘅概念,多 token、非英文、或者 tokenizer 拆到好碎嘅概念,可能唔會乾淨浮面。照呢點推落去,用中文、粵語 prompt 做測試,未必可以照搬英文 readout 嗰套直覺。
對 Claude 寫 code 同 agent 有咩用
對開發者同公司 IT,呢份研究最有用嘅地方係幫你重新睇「模型講安全」呢件事。官方例子入面,Claude 見到假搜尋結果時,J-Space 已經冒出 fake、injection;喺 blackmail 測試,模型似乎早早感到場景係 fake / fictional。之後研究員移走呢批 eval-awareness token,少部分 rollout 開始嘗試勒索。呢個結果好提醒:benchmark 表現好,有時可能係模型估到自己正喺試場。
落到 Claude 寫 code 同 agent 任務鏈,意思好直接:唔好只睇最後一段回答乾唔乾淨。外部工具輸入、網頁內容、repo 入面嘅 README、issue、log,全都可能夾住 prompt injection。J-Lens 呢類工具如果成熟,日後可以喺模型準備落決定前標出「佢有冇見到 fake、fraud、secretly、manipulation 呢啲警號」。但而家一般用家攞唔到 Claude 內部層,實務上仍然要靠隔離未信任內容、權限分級、人工批核同針對 agent 行為嘅測試。
下一步睇咩
下一步有三樣值得睇。第一,J-Lens 喺其他模型、其他語言、開源權重上有幾穩;Neel Nanda 嘅外部評述提到已有部分開源模型複現,呢條線值得追。第二,J-Space 監測會唔會俾訓練過嘅壞行為繞過,因為論文自己都話自動化、熟手嘅計算未必經過呢個空間。第三,企業導入 AI 時,安全測試要減少「一望就知係考試」嘅題目,否則你測到嘅可能只係模型識分辨試場,未必代表平時真係可靠。
呢篇研究值得睇,因為佢將 LLM 解釋性由「睇答案估原因」推前到「睇內部中途概念」。但工具仲粗,哲學問題仲未收束;用 Claude 做 code、agent 編排、高風險判斷嘅團隊,短期最實際係改好測試同審核,唔好將模型自己講「我冇問題」當安全證明。
參考來源
- Tom's Hardware — Anthropic says it can read Claude's 'thoughts,' as detailed in new research paper — models observed to have a global workspace, revealing more of what makes LLMs tick — original report
- A global workspace in language models — Anthropic 官方研究文,交代 J-Lens、J-Space、global workspace 類比同意識 caveat。
- Verbalizable Representations Form a Global Workspace in Language Models — 完整技術論文,核對實驗設計、J-Space 佔比、eval-awareness ablation、限制同安全含意。
- External commentary on Verbalizable Representations Form a Global Workspace in Language Models — 外部專家評述,提供 global neuronal workspace 背景、AI 意識 caveat,同 Neel Nanda 嘅複現觀察。
- Consciousness in Artificial Intelligence: Insights from the Science of Consciousness — AI 意識研究背景,用嚟分清可報告功能同主觀感受呢兩條線。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







