焦點報導 · ARTICLE

OpenAI推GPT‑5.6三層家族:Sol、Terra、Luna上線

OpenAI將GPT-5.6轉為一般供應,推出Sol/Terra/Luna三層,定價每百萬自$1/$6至$5/$30。Responses API增程式化工具呼叫;Sol多測領先,但SWE‑Bench Pro落後Claude Mythos 5約15分。

講師團隊整理 AI Academy · 編輯部
2026/07/13 發佈 55 觀看 zh-TW
OpenAI推GPT‑5.6三層家族:Sol、Terra、Luna上線 AI 生成示意圖

GPT‑5.6三層級明確分工與差價,利於任務依難度分流。對房仲團隊而言,從帶看話術到產出物件文案與表單處理,可按成本與品質取捨,並用快取與多代理人提升穩定度與速度。性能亮點集中在代碼代理、終端自動化,但在專業修 bug 與通用智能仍有明確對手領先。

三款定價清晰、通路已開放,導入成本可預估。Sol 對應旗艦高效能,Terra 對應日常均衡,Luna 主打成本效率;Prompt 快取與工具新能力皆在 Responses API 提供,便於把看屋流程與內勤 SOP 串成自動化。

這次三層模型與定價,對團隊選型怎麼拿捏?

三層定價差距明確,有助將任務按價值對齊模型。GPT‑5.6 一代含三款:Sol、Terra、Luna;以每百萬 tokens 計價,Sol 適合高價值決策與複雜自動化,Terra 用於日常生產,Luna 用於大量、可容錯的產出(如初稿、分類、摘要)。

  • 可用範圍(Chat):Plus、Pro、Business、Enterprise 可用 Sol;Pro、Enterprise 可選 Sol Pro(努力等級)。
  • ChatGPT Work 與 Codex:Free、Go 用戶用 Terra;付費可在三款間選擇並設定 effort;max 可在有權用戶中開啟。
  • API:三款皆可用;Programmatic Tool Calling 與 multi‑agent 測試版在 Responses API。
模型每百萬輸入每百萬輸出
Sol$5$30
Terra$2.50$15
Luna$1$6

Programmatic Tool Calling 與 multi‑agent 會怎麼改變自動化?

內建工具呼叫減少粘合代碼,便於把表單與流程自動化。Programmatic Tool Calling 允許模型寫 JavaScript 並在隔離的 V8 執行,且無網路存取;在 Responses API 可直接調用,降低將房源資料、行程排程與外掛腳本串接的門檻。

多代理人預設並行,縮短等待並拉高成功率。ultra 以四代理人並行,將 Terminal‑Bench 2.1 從 88.8% 提升至 91.9%;在 BrowseComp 亦能達到 92.2%。API 端提供 multi‑agent 測試版,利於把複雜任務拆分為收集資訊、撰寫、校對與工具執行的並行流程。

效能領先在哪些任務?哪些仍落後競品?

代碼代理與終端操作是強項,通用智能與修 bug 尚有落差。OpenAI 指稱 Sol 在 Artificial Analysis Coding Agent Index v1.1 以 max 推理得分 80,較 Claude Fable 5 高 2.8 分,且用時與輸出 tokens 少於一半;在 Terminal‑Bench 2.1 與 DeepSWE 標出新高。

通用智能分數接近,但非全面領先。OpenAI 公布的評測表列示 Agents’ Last Exam 中,Sol 為 52.7%,Fable 5 為 40.5%;另有未標註設定的 53.6 數值說明仍由 OpenAI 提供。OSWorld 2.0 上,Sol 62.6% 並以較少輸出 tokens 超過 Claude Opus 4.8。

如下列部分評測(OpenAI 公布表):

評測GPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
AA Coding Agent Index v1.18077.474.676.477.272.542.7
Terminal‑Bench 2.188.8%87.4%84.7%85.6%83.1%78.9%70.7%
DeepSWE v1.172.7%69.6%67.2%67%69.7%59%11.8%
SWE‑Bench Pro64.6%63.4%62.7%59.4%80%69.2%54.2%
Agents’ Last Exam52.7%50.4%50.3%46.9%40.5%45.2%32.1%

修 bug 與工具運用仍被對手壓制,選型需注意。SWE‑Bench Pro 上,Sol 64.6% 落後 Claude Mythos 5 的 80.3% 與 Fable 5 的 80%;Toolathlon 中,Sol 58% 低於 Fable 5 的 61.7% 與 Opus 4.8 的 59.9%。長上下文上,Luna 在 MRCR v2 8‑needle 為 41.3%;Sol 在 512K–1M 得 73.8%,略低於 GPT‑5.5 的 74%。

快取與成本:我該如何估算與調整?

快取規則更可預期,但新增寫入成本需納入模型。GPT‑5.6 支援明確快取斷點與至少 30 分鐘快取壽命;快取寫入按未快取輸入價的 1.25 倍計費,快取讀取維持 90% 折扣。對大量重複提示(如制式合約、盤點表單)能穩定壓低成本。

離線模擬的時延與成本聲明,導入前應實測驗證。OpenAI 指出延遲與成本係離線模擬而非生產量測;另安全評測(cyber)在降低保護下測量,實際表現會不同。建議以團隊樣本工作負載先做 A/B,並視任務價值分流至 Sol/Terra/Luna,配合 ultra 與快取做精細化控成本。


資料來源:MarkTechPost — 原文連結

原始來源: https://www.marktechpost.com/2026/07/09/openai-releases-gpt-5-6-a-three-tier-model-family-with-programmatic-tool-calling/