Claude Opus 5.5 對打 GPT-6 Sol/Luna:同日降價,兩份官方比較表都比不到當天的對手
2026 年 9 月 22 日,Anthropic 與 OpenAI 同一天降價。評測要在發布前幾週就定案,兩家不可能測到對方當天才公布的新模型——這篇整理雙方各自公布的定價與官方比較表的局限在哪裡,以及對讀者來說真正該比較的是什麼。
2026 年 9 月 22 日,星期二。Anthropic 發布 Claude Opus 5.5,OpenAI 發布 GPT-6 Sol 與 GPT-6 Luna——同一家科技媒體 TechCrunch,對這兩則發布的報導時間相隔約一個半小時(美西時間上午 9:30 與 11:00)。兩家公司在同一天,各自把價目表往下調了一截。
這不算意外——模型評測要在發布前好幾週就跑完定案,任何一家都不可能拿到對方當天才公布的新模型來測。攤開兩份發布材料各自附的比較表就能看到這一點:Anthropic 的表裡沒有 GPT-6 Sol,也沒有 GPT-6 Luna;OpenAI 的表裡沒有 Claude Opus 5.5,兩份同一天發布的官方材料,比的都是對方前一代的舊模型。這代表一件對讀者比較實際的事:光看任何一份官方比較表,都回答不了「這兩款新模型誰比較強」。
降價實際發生了什麼
Opus 5.5 的定價表寫得很直接:輸入與輸出 token 各是每百萬 4 美元與 20 美元,比 Opus 5 便宜兩成;快取讀取降到每百萬 0.20 美元,比 Opus 5 便宜六成。Anthropic 自己的說法是,在預設情境下,一般工作負載的整體成本會下降四成,輸出生成的速度也快三成以上。訂閱端另有一件事——Pro、Max、Team 與席位制企業方案的五小時用量上限被提高了,另外新增一項可以自行選擇時機使用的用量重置。這是額度變動,不是價格變動,跟 API 那端的降價是兩件不同的事,不能放在同一把尺上比較。
Anthropic 把 Opus 5.5 定位成「我們新的 Claude 5.5 家族第一款模型」,說它在多數工作上能追平上一階的 Fable 5.1,成本卻比 Opus 5 低四成。官方公告也提到一句背景:上週 Anthropic 執行長 Dario Amodei 主張,AI 的進展速度應該放慢,讓安全實踐跟得上模型能力——Opus 5.5 是那個主張提出之後的第一個發布。早期測試者提供的具體案例也寫進了公告:有工程師用它跑完一次 68 萬行程式碼的搬遷,原本要一個工程團隊花數週才能做完的工作,一天內就結束;另一項測試裡,被要求優化一個網頁應用程式每一頁的載入速度,Opus 5.5 在 40 次嘗試中成功 39 次,而 Opus 5 雖然也有改善,卻連帶改變了應用程式原本的行為。
OpenAI 這邊,GPT-6 Sol 與 Luna 定位在旗艦 GPT-6 Astra 之下,扮演性價比款的角色——Astra 是 9 月 3 日先上市的旗艦,那次沒有降價,是純粹的新模型上市。Sol 的輸入從每百萬 4 美元降到 2 美元、輸出從 20 美元降到 10 美元,精準對半;Luna 的輸入同樣對半,從 0.20 美元降到 0.10 美元,但輸出從 1.20 美元降到 0.50 美元,算下來是 58%,比官方新聞稿統稱的「降 50%」還要多。這個降幅的比較基準是 GPT-5.6 的促銷價,不是牌價。目前 Sol 與 Luna 已經開放給 ChatGPT Work 與 Codex 的 Plus、Pro、Business、Enterprise 與 Edu 用戶;Free 與 Go 方案的用戶只能在桌面版 App 裡用到 Luna,一般網頁版 Chat 暫時還用不到。
| 項目 | Claude Opus 5.5 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|---|
| 發布日 | 2026-09-22 | 2026-09-22 | 2026-09-22 |
| 輸入(每百萬 token) | $4(降 20%) | $2(降 50%) | $0.10(降 50%) |
| 輸出(每百萬 token) | $20(降 20%) | $10(降 50%) | $0.50(降 58%) |
| 快取讀取 | $0.20(降 60%) | 官方僅公布折扣 90%,未公布絕對金額 | 同左 |
| 速度/效能定位 | 典型工作負載成本降 40%、輸出速度快 30%+ | 內部事實性評測錯誤率約為前代一半 | 高 effort 下成本約為前代百分之一 |
兩家在拿誰當對照組
這張定價對照表能做出來,靠的是兩家各自公布的數字——這部分沒有懸念。真正受限的是雙方拿來「打對台」的性能比較表:受限於評測時程,各自的對照組都只能停在前一代。
Anthropic 的比較表列了五個對象:Opus 5.5、Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol——整張表沒有一格寫著 GPT-6 Sol 或 GPT-6 Luna。表裡最能說明問題的是 CursorBench 那一句:官方寫 Opus 5.5「以大約三分之一的成本贏過 GPT-5.6 Sol 11 分」,但這個「11 分」用的是預設 effort(medium)的分數;主表格裡 max effort 的差距其實是 57.8% 比 41.7%,相差 16.1 分。同一個測試、換一個 effort 等級,數字就不一樣。表格下方的方法論註記也寫明白:GPT-6 Astra 與 GPT-5.6 Sol 的分數,是採信 OpenAI 自己公布的報告,不是 Anthropic 自己重新測過。
OpenAI 這邊反過來也一樣:整張表同樣沒有一格寫著 Claude Opus 5.5。以 AutomationBench 為例,官方寫 GPT-6 Sol 以 xhigh effort 拿下 33.2% 分數、每任務成本 0.27 美元,對照組「Claude Fable 5.1 搭配 Opus 5 Fallback」拿到 31.4%、成本卻超過 Sol 的 8.9 倍——而且 fallback 本身的成本沒有算進這個數字,官方原文寫明測試裡大約四成任務觸發了這個 fallback。OpenAI 的方法論註記也寫得跟 Anthropic 一模一樣:競品分數取自公開報告,不是自己重新測過。
兩張表在做同一件事,而且做法完全對稱:各自拿自己的新模型,對照自己與對手手上都已經測過的舊模型。這是評測時程的必然結果,不是誰刻意迴避誰——但結果是,這兩份「今天發布」的材料,沒有一份能構成當日兩款新品之間真正的頭對頭測試。
安全與對齊:各自守著自己的地盤
兩家這次發布都把對齊測試放進賣點。Anthropic 寫 Opus 5.5 是「我們測過表現最好的一款」,依據是公司自己建的「自動化行為審計」——一套內部評測套件,用來檢驗模型在各種情境下的行為。官方另外提到,發布前 Opus 5.5 也經過外部機構 Frontier Design 與 METR 的評估,但那是一項獨立的、發布前才做的外部檢查,跟前面那句「自己測過表現最好」講的不是同一件事。
在另一個段落,Anthropic 給出更具體的數字:在近 2000 個情境組成的主要評測套件裡,Opus 5.5 在幾乎每一項「不對齊行為」的衡量指標上,分數都比近期任何一款 Claude 模型好,誠實度指標同樣是目前最強的一款。
OpenAI 這邊,Sol 與 Luna 沿用了 Astra 的對齊訓練方法,官方寫兩者在評測上都比各自的 GPT-5.6 版本有進步,包括在編碼工作裡誤導性宣稱的比例降低。這句話同樣只能算是官方自己公布的內部評測結果,不是第三方獨立驗證的成績。
一個月裡,兩家都在演同一齣戲
把日曆拉開一點看,這個月其實已經是第三個回合。9 月 1 日,Anthropic 在既有模型 Fable 5.1 與 Mythos 5.1 上調降快取讀取價格,降了七成五。9 月 3 日,OpenAI 推出新旗艦 GPT-6 Astra,那次沒有降價,純粹是秀肌肉。到了 9 月 22 日,兩家才真的同步把性價比款往下打——Anthropic 全面調降 Opus 5.5、OpenAI 腰斬 Sol 與 Luna。一個月之內,兩家走的是同一套劇本:先展示旗艦實力,再把入門門檻往下推。
對使用者來說,真正該比較的是什麼
如果只看新聞稿標題,這場「價格戰」聽起來像是兩家公司在打對台、比誰更便宜、比誰更快。但攤開兩份材料的實際內容,真正在動的不是某一場勝負,而是整條 AI 推理成本曲線正在往下彎——一個月裡,兩家各自先秀了一次旗艦肌肉,又各自降了一次價,每一次降價都讓同樣的智能等級變得更便宜。
至於「該用哪一家」,兩份官方比較表都回答不了,因為它們比較的對象各自停在前一代。真正能回答這個問題的,是自己手上的任務──要處理的 token 量、能不能忍受重試、快取命中率高不高。價目表會一直改,下一輪降價說不定下個月就到。真正值得記住的,是「AI 推理越來越便宜」這個方向本身,而不是任何一家在發布當天貼出來的那張比較表。