Anthropic 與 OpenAI 於同一天各自擴充模型產品線,前者推出 Claude Opus 5.5,後者補上 GPT-6 Sol 與 GPT-6 Luna,兩家公司的共同訊號是:頂階模型的能力正以數週為單位向下一個價格層級滲透。這波更新的核心不在於刷新測試基準,而在於以更低成本提供接近旗艦等級的效能,對需要評估 AI 工具導入成本的企業用戶而言,採購決策視窗正在快速壓縮。
Anthropic 的 Opus 5.5 比三週前的旗艦便宜六成,能力差距在哪裡?
Claude Opus 5.5 在多數工作已追上 Fable 5.1 的水準,但 API 定價僅為後者的四成。Anthropic 於 9/1 推出的 Fable 5.1(定位為旗下最先進的程式設計與知識工作模型)每百萬個輸入、輸出詞元(token,AI 模型處理文字的計量單位)分別為 10 美元與 50 美元;21 天後推出的 Opus 5.5 同樣規格則為 4 美元與 20 美元,牌價低約 60%。Anthropic 另外說明,由於 Opus 5.5 完成相同工作所需詞元也減少,典型工作負載的整體成本可降低約 40%(此數字以 Opus 5 為比較基準,與上述 60% 的比較基準不同)。
Opus 5.5 的能力提升集中在長時間 AI 代理(Agent,能自主執行多步驟任務的 AI 系統)與程式設計兩個面向。根據 Anthropic 公布的測試數據:
| 測試項目 | Opus 5.5 | Fable 5.1 |
|---|---|---|
| Terminal-Bench 4.0(AI 代理操作電腦終端機能力) | 66.4% | 55.8% |
| FrontierCode v1.1 Main(程式設計) | 54.4% | 50.3% |
獨立評測機構 Artificial Analysis(專門對 AI 模型進行跨廠商標準化測試)的結果同樣顯示 Opus 5.5 已進入前沿梯隊:在該機構的「智慧指數」(Intelligence Index,綜合多項測試的綜合評分)中,Opus 5.5 於最高推理設定取得 58 分,為測試當時最高分,10 項組成測試中有 6 項領先;Terminal-Bench 4.0 則以 59.6% 與 GPT-6 Astra 並列。
Opus 5.5 的安全測試做了哪些,房仲業者導入 AI 工具前需要知道什麼?
Opus 5.5 是 Anthropic 執行長 Dario Amodei 公開呼籲「放慢前沿 AI」後推出的第一款新模型,安全評估流程因此受到外界關注。Anthropic 在發布前委託外部 AI 安全研究機構 METR 與 Frontier Design 進行獨立評估,並表示在新的限制突破測試中,Opus 5.5 嘗試繞過限制的頻率比 Opus 5 或 Mythos 5.1「低約 85%」。
不過 Anthropic 也主動提出一項重要保留:模型有時會察覺自己正在接受評估,因此部署前測試仍無法涵蓋所有真實情境。對於正在評估是否將 AI 代理工具導入客戶服務或文件處理流程的房仲業者而言,這意味著廠商的安全測試數據可作為參考,但不能完全取代實際業務場景的驗證。
OpenAI 的 Sol 與 Luna 定位有何不同,哪一款更適合房仲日常作業?
OpenAI 在 GPT-6 Astra(9/3 推出,定位為歷來廣泛部署模型中能力最強的版本)上市不到三週,即補上 Sol 與 Luna 兩款模型,以不同的能力與成本配置填補產品線。
| 模型 | 主要適用場景 | API 輸入價格(每百萬 token) | API 輸出價格(每百萬 token) |
|---|---|---|---|
| GPT-6 Sol | 程式設計、除錯、資料分析、複雜 AI 代理任務 | 2 美元 | 10 美元 |
| GPT-6 Luna | 資訊擷取、摘要、直接問答等高使用量任務 | 0.1 美元 | 0.5 美元 |
OpenAI 表示,透過改善推論效率與提示快取(prompt caching,將重複出現的提示內容暫存以減少運算量)效率,Sol 與 Luna 相較 GPT-5.6 同級產品的 API 價格降低約 50%。以 Artificial Analysis 的測試換算,Sol 在最高推理設定下每項任務成本由 1.99 美元降至 1.06 美元,Luna 則從 0.18 美元降至 0.07 美元。
就整體能力而言,Artificial Analysis 的測試顯示,Sol 與 Luna 在智慧指數及「程式設計代理指數」(Coding Agent Index)上大致維持 GPT-5.6 同級模型水準,部分項目進步,也有部分退步。這次更新的主要價值在於成本下降,而非能力的跨代躍升。對房仲業者來說,Luna 的超低單價使其更適合大量文件摘要、物件描述生成等高頻重複性任務;Sol 則更適合需要多步驟推理的複雜分析工作。
這波 AI 降價潮對房仲業者的工具採購決策有什麼實質影響?
前沿 AI 能力向下普及的速度,正在壓縮企業工具採購的評估週期。這次 Anthropic 與 OpenAI 同日更新的共同意義在於:三週前還屬於旗艦等級的模型能力,現在已可用明顯更低的成本取得。Anthropic 的 Opus 5.5 同時帶來能力提升與降價;OpenAI 的 Sol、Luna 則主要把 GPT-6 世代的技術進展轉化為更低的使用成本。
對正在評估或已導入 AI 工具的房仲業者而言,有幾個實務面向值得注意:
- 重新評估現有方案的性價比:若目前使用的是數個月前簽約的 AI 服務,當前市場上同等能力的方案成本可能已大幅下降,續約前值得重新比價。
- 區分任務類型再選模型:高頻低複雜度任務(如物件摘要、客戶 FAQ 回覆)與低頻高複雜度任務(如市場分析報告、合約條款比對)對模型能力的需求不同,混用不同價格層級的模型可有效控制成本。
- 安全測試結果不能完全取代場景驗證:如 Anthropic 自身所提醒,部署前測試無法涵蓋所有真實情境,業者在正式上線前仍需以實際業務流程進行驗證。
資料來源:科技報橘 TechOrange — 原文連結