GPT-5.6 Sol/Terra/Luna 點揀:成本、cache 同安全限制
Tech News

GPT-5.6 Sol/Terra/Luna 點揀:成本、cache 同安全限制

圖片:via Engadget — https://www.engadget.com/2203102/openai-starts-previewing-gpt-56-and-its-three-variants/
TechLab 編輯部(譯)·

首輪 preview 由 API、Codex 先試,模型分工、定價同安全閘要睇清楚

三款模型,唔係同一個價錢牌

OpenAI 今次冇淨係掉一個「最強模型」出嚟,而係一次過開 GPT-5.6 Sol、Terra、Luna 三條線。官方講法好清楚:Sol 係 flagship,主打複雜推理、長時間 agent 任務、software engineering、computer use、科研同 cybersecurity;Terra 係日常高量工作,用接近 GPT-5.5 嘅能力換平一半成本;Luna 就係最快同最低成本。Sol 適合處理難題,Terra 適合長期產品 flow,Luna 就適合大量簡單任務。

模型工作點分層

GPT-5.6 個有趣位唔係「又聰明咗」咁簡單,而係 OpenAI 正式將模型命名變成產品分層。數字代表 generation,Sol、Terra、Luna 代表能力 tier,之後每條線可以自己升級。呢個安排對開發者好實際:以前你可能喺 GPT-5.5 同 mini / nano 之間硬揀,今次就似雲端 compute tier,先諗任務值唔值得用 Sol,再將一般 agent 步驟放落 Terra 或 Luna。AI coding agent 最燒錢嗰啲位,通常唔係最後答案,而係反覆讀 repo、跑工具、改 prompt、再試一次。

Token 價:Sol 冇平,Terra 同 Luna 主打成本

官方 Help Center 列明 GPT-5.6 API 價錢:Sol 係每 100 萬 input token 5 美元、output token 30 美元;Terra 係 2.5 / 15 美元;Luna 係 1 / 6 美元。對比 OpenAI 自己早前公布嘅 GPT-5.5 API 價,Sol 其實同 GPT-5.5 一樣係 5 / 30 美元,所以成本突破唔喺 flagship,而喺 Terra 同 Luna。The Verge 當時報道,Anthropic Claude Fable 5 嘅 API 價係 10 / 50 美元;按呢個價格比較,OpenAI 係用 Sol 守住高階能力,再用 Terra、Luna 壓低大量 agent workflow 嘅平均成本。

Prompt caching 會影響 agent 設計

今次另一個值得工程團隊即刻計數嘅位係 prompt caching。OpenAI 話 GPT-5.6 開始支援 explicit cache breakpoints,cache 最少保留 30 分鐘;cache write 會按未 cache input 價嘅 1.25 倍收費,cache read 繼續有 90% cached-input discount。即係話,如果你個 coding agent 每次都塞同一堆 repo 摘要、規格、工具說明、測試規則入去,固定好 prompt 開頭會好值錢;但如果成個 prompt 次次亂排、context 成日變,cache 寫入成本反而會食返唔少。GPT-5.6 唔止係模型選擇,亦係 prompt layout 同狀態管理問題。

Max reasoning 同 ultra sub-agent 係貴任務先用

OpenAI 同外媒都提到 Sol 會有 max reasoning effort,畀模型用多啲時間深諗;Axios 同 The Verge 亦提到 ultra mode 會用多個 sub-agent 分工。呢啲聽落好啱大型 refactor、security audit、跨服務 debugging,但唔應該一開就預設全部任務用。reasoning 同 sub-agent 會放大 token、latency、工具調用同監控成本,仲會令錯誤變得難追。實務上,團隊應該用 eval 決定邊類 ticket 升 Sol max,邊類留 Terra,邊類用 Luna 做初步分類或文件整理。

Cybersecurity 能力強咗,安全閘亦會阻到人

官方 system card 講得幾直:GPT-5.6 Sol 同 Terra 喺 cybersecurity 能力有明顯提升,可以搵漏洞同 exploit 片段,但喺測試入面未能對 hardened target 自主完成 end-to-end attack,所以未到 OpenAI 風險框架嘅 Critical 級。OpenAI 同時將 Sol、Terra、Luna 喺 cybersecurity 同 bio/chemical risk 都當 High capability 處理,加入 real-time checks、activation classifiers 同分層 access。對防守安全團隊嚟講,呢個可能好有用;但做合法 dual-use work,例如 vulnerability research、紅隊演練、惡意樣本分析,都有機會俾 safety check 拖慢甚至擋住。

Limited preview 係發布時最大限制

GPT-5.6 發布嗰陣唔係公開 self-service preview,亦未入 ChatGPT。OpenAI Help Center 當時寫明,preview 只限少數 trusted partners 同有 OpenAI account representative 嘅組織,API approval 唔會自動包括 Codex,Codex approval 亦唔會自動包括 API;完成 enrollment 都唔代表即刻有 access。美國政府介入亦係背景重點:白宮 6 月 2 日嘅 executive order 要建立 covered frontier model 嘅 classified benchmarking 同 voluntary framework,最多可喺公開前 30 日畀政府 access。OpenAI 當時配合,但亦明講唔想呢種 government access process 變成長期預設。

採用建議:先計 workflow,唔好淨係追 Sol

如果你而家管緊 AI coding、內部 knowledge agent 或 security automation,GPT-5.6 要睇三樣嘢:第一,任務分層夠唔夠清楚,值唔值得由 Sol 接手;第二,prompt caching 有冇設計好,否則 Terra/Luna 慳返嘅錢好快俾重複 context 食返;第三,安全閘同 access scope 會唔會影響交付。首輪 preview 發布時未有一般開放日期,官方只話未來幾星期會擴到 ChatGPT、Codex 同 API。之後最值得留意,係 broader access 開咗之後,合法開發同 security workflow 實際用落順唔順。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook