GPT‑5.6三層級明確分工與差價,利於任務依難度分流。對房仲團隊而言,從帶看話術到產出物件文案與表單處理,可按成本與品質取捨,並用快取與多代理人提升穩定度與速度。性能亮點集中在代碼代理、終端自動化,但在專業修 bug 與通用智能仍有明確對手領先。
三款定價清晰、通路已開放,導入成本可預估。Sol 對應旗艦高效能,Terra 對應日常均衡,Luna 主打成本效率;Prompt 快取與工具新能力皆在 Responses API 提供,便於把看屋流程與內勤 SOP 串成自動化。
這次三層模型與定價,對團隊選型怎麼拿捏?
三層定價差距明確,有助將任務按價值對齊模型。GPT‑5.6 一代含三款:Sol、Terra、Luna;以每百萬 tokens 計價,Sol 適合高價值決策與複雜自動化,Terra 用於日常生產,Luna 用於大量、可容錯的產出(如初稿、分類、摘要)。
- 可用範圍(Chat):Plus、Pro、Business、Enterprise 可用 Sol;Pro、Enterprise 可選 Sol Pro(努力等級)。
- ChatGPT Work 與 Codex:Free、Go 用戶用 Terra;付費可在三款間選擇並設定 effort;max 可在有權用戶中開啟。
- API:三款皆可用;Programmatic Tool Calling 與 multi‑agent 測試版在 Responses API。
| 模型 | 每百萬輸入 | 每百萬輸出 |
|---|---|---|
| Sol | $5 | $30 |
| Terra | $2.50 | $15 |
| Luna | $1 | $6 |
Programmatic Tool Calling 與 multi‑agent 會怎麼改變自動化?
內建工具呼叫減少粘合代碼,便於把表單與流程自動化。Programmatic Tool Calling 允許模型寫 JavaScript 並在隔離的 V8 執行,且無網路存取;在 Responses API 可直接調用,降低將房源資料、行程排程與外掛腳本串接的門檻。
多代理人預設並行,縮短等待並拉高成功率。ultra 以四代理人並行,將 Terminal‑Bench 2.1 從 88.8% 提升至 91.9%;在 BrowseComp 亦能達到 92.2%。API 端提供 multi‑agent 測試版,利於把複雜任務拆分為收集資訊、撰寫、校對與工具執行的並行流程。
效能領先在哪些任務?哪些仍落後競品?
代碼代理與終端操作是強項,通用智能與修 bug 尚有落差。OpenAI 指稱 Sol 在 Artificial Analysis Coding Agent Index v1.1 以 max 推理得分 80,較 Claude Fable 5 高 2.8 分,且用時與輸出 tokens 少於一半;在 Terminal‑Bench 2.1 與 DeepSWE 標出新高。
通用智能分數接近,但非全面領先。OpenAI 公布的評測表列示 Agents’ Last Exam 中,Sol 為 52.7%,Fable 5 為 40.5%;另有未標註設定的 53.6 數值說明仍由 OpenAI 提供。OSWorld 2.0 上,Sol 62.6% 並以較少輸出 tokens 超過 Claude Opus 4.8。
如下列部分評測(OpenAI 公布表):
| 評測 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|
| AA Coding Agent Index v1.1 | 80 | 77.4 | 74.6 | 76.4 | 77.2 | 72.5 | 42.7 |
| Terminal‑Bench 2.1 | 88.8% | 87.4% | 84.7% | 85.6% | 83.1% | 78.9% | 70.7% |
| DeepSWE v1.1 | 72.7% | 69.6% | 67.2% | 67% | 69.7% | 59% | 11.8% |
| SWE‑Bench Pro | 64.6% | 63.4% | 62.7% | 59.4% | 80% | 69.2% | 54.2% |
| Agents’ Last Exam | 52.7% | 50.4% | 50.3% | 46.9% | 40.5% | 45.2% | 32.1% |
修 bug 與工具運用仍被對手壓制,選型需注意。SWE‑Bench Pro 上,Sol 64.6% 落後 Claude Mythos 5 的 80.3% 與 Fable 5 的 80%;Toolathlon 中,Sol 58% 低於 Fable 5 的 61.7% 與 Opus 4.8 的 59.9%。長上下文上,Luna 在 MRCR v2 8‑needle 為 41.3%;Sol 在 512K–1M 得 73.8%,略低於 GPT‑5.5 的 74%。
快取與成本:我該如何估算與調整?
快取規則更可預期,但新增寫入成本需納入模型。GPT‑5.6 支援明確快取斷點與至少 30 分鐘快取壽命;快取寫入按未快取輸入價的 1.25 倍計費,快取讀取維持 90% 折扣。對大量重複提示(如制式合約、盤點表單)能穩定壓低成本。
離線模擬的時延與成本聲明,導入前應實測驗證。OpenAI 指出延遲與成本係離線模擬而非生產量測;另安全評測(cyber)在降低保護下測量,實際表現會不同。建議以團隊樣本工作負載先做 A/B,並視任務價值分流至 Sol/Terra/Luna,配合 ultra 與快取做精細化控成本。
資料來源:MarkTechPost — 原文連結