OpenAI 推出 GPT-6.1 Sol,效能接近 Astra,API 價格省超多

HongWei約 4 分鐘閱讀

站內可閱讀至 (台北時間)

OpenAI 推出 GPT-6.1 Sol,效能接近 Astra,API 價格省超多(新聞配圖)
配圖來源:蘋果仁原站文章
本站保存版本
字級

OpenAI 於 2026 年 9 月 29 日推出 GPT-6.1 Sol。根據 OpenAI 公布的測試,這款模型在程式開發、操作電腦與專業工作等項目上接近 GPT-6 Astra,標準 API 的輸入與輸出 token 單價則是 Astra 的五分之一。GPT-6.1 Sol 已開始透過 ChatGPT Work、Codex 與 API 提供使用,但目前尚未開放於一般網頁或手機 App 的 Chat 對話。

GPT-6.1 Sol 的價格與效能差在哪?

GPT-6.1 Sol 是 GPT-6 Sol 的後繼模型。它延續較低成本的定位,同時在多項測試中縮小與旗艦模型 GPT-6 Astra 的差距。對透過 API 大量處理程式、文件或多步驟任務的使用者,價格差異尤其值得留意。

標準 API 價格

GPT-6.1 Sol

GPT-6 Astra

每 100 萬輸入 token

2 美元

10 美元

每 100 萬輸出 token

10 美元

50 美元

每 100 萬快取輸入 token

0.10 美元

1 美元

表中的「五分之一」指標準 API 輸入與輸出 token 單價,不代表每項任務的總花費都固定是 Astra 的五分之一;實際費用仍取決於使用的 token 數量與處理模式。GPT-6.1 Sol 的快取輸入價格也比 GPT-6 Sol 的每 100 萬 token 0.20 美元降低一半。

程式、文件與電腦操作表現接近 Astra

在測試複雜軟體工程工作的 DeepSWE v1.1 中,OpenAI 表示 GPT-6.1 Sol 的成績與 GPT-6 Astra 相當,並以較低的推理投入與成本,超過 GPT-6 Sol 的最佳成績 6.4 個百分點。

專業工作方面,GPT-6.1 Sol 在複雜 PDF 問答測試中接近 Astra,測試內容包含表格、圖表與文件細節。針對需要連續使用多種工具的商務流程測試,它在相同推理設定下也比 GPT-6 Sol 提高 4.8 個百分點。這些結果與整理文件、執行多步驟工作流程的使用情境較為相關,但實際表現仍要視任務而定。

電腦操作測試同樣有進步。在 OSWorld 2.0 的離線測試中,GPT-6.1 Sol 以最高推理設定取得比 GPT-6 Sol 高 7 個百分點的成績,距離同設定的 Astra 差 2.1 個百分點;OpenAI 指出,該次測試的平均單項任務成本約為 Astra 的七分之一。

科學研究進步明顯,難題仍以 Astra 較強

在涵蓋資料分析、模擬與定理證明的 Terminal-Bench Science 0.1 測試中,GPT-6.1 Sol 於最高推理設定下的成績超過 GPT-6 Sol 的兩倍,平均每項任務成本為 5.47 美元,低於 Astra 的 23.80 美元。不過 Astra 在這項測試仍取得最高的 68.1% 成績。若任務特別困難,兩款模型之間仍有能力差距。

事實錯誤率降低,但不能當作一般使用的錯誤率

OpenAI 也比較了模型回答中出現事實錯誤的比例。在低推理設定下,GPT-6 Sol 有 11.4% 的回答包含至少一項事實錯誤,GPT-6.1 Sol 則降至 7.7%;在受測的不同推理設定中,GPT-6.1 Sol 與 Astra 的錯誤率差距均在 1.9 個百分點以內。

這項測試刻意選用使用者曾回報模型出錯的困難對話,因此 7.7% 不能解讀成日常使用時的整體錯誤率。需要引用數字、核對文件或處理重要決策時,生成的內容仍應查證。

安全評估與開放時間

安全方面,OpenAI 表示 GPT-6.1 Sol 在一項測試中沒有嘗試繞過自動安全審查;其他對限制條件與使用者意圖的測試,也較 GPT-6 Sol 改善。不過,單項測試沒有出現繞過行為,不等於模型沒有安全風險。OpenAI 仍將它列為具高度資安能力的模型,並採用與 Astra 相同的防護措施。

GPT-6.1 Sol 正陸續提供給符合資格的 Plus、Pro、Business、Enterprise 與 Edu 使用者,在 ChatGPT Work 和 Codex 中使用;實際能否選到模型,仍取決於方案、帳號開放進度與工作區設定。開發者則可透過 API 使用 gpt-6.1-sol。一般 Chat 對話目前尚未支援。

OpenAI 另預告將推出 GPT-6.1 Sol Ultrafast,宣稱它在 Codex 中的 token 生成速度最高可達標準速度的 8 倍;截至此次公告,尚未提供確切上線日期。現階段若想評估是否改用 Sol,較實際的做法是拿自己的程式、文件或工作流程比較輸出品質與總花費,而非只看單項測試分數。