模型与评测

GPT-6.1 Sol 详解:价格、性能、开放范围与模型对比

GPT-6.1 Sol 以 Astra 五分之一的标准 token 价格,提供接近 Astra 的编程、电脑操作与专业工作能力。本文解释这些数字真正意味着什么。

Floatboat2 分钟阅读
GPT-6.1 Sol 详解:价格、性能、开放范围与模型对比

TL;DR

  • GPT-6.1 Sol 是 GPT-6 Sol 的大幅升级:编程、电脑操作、专业文档和多步骤自动化能力接近 GPT-6 Astra,标准输入和输出价格却只有 Astra 的五分之一。
  • API 模型名为 gpt-6.1-sol。它已进入 ChatGPT Work、Codex 和 OpenAI API,但发布时还不能在普通 Chat 中使用。
  • 上下文窗口为 105 万 token,最大输出 128K,支持图片输入、函数、网页搜索、文件搜索和 Computer Use。
  • “价格只有五分之一”说的是 token 单价,不保证每项任务都便宜 80%。推理档位、重试、工具调用、缓存命中和订阅额度都会改变实际成本。
  • 失败代价高、只求最高完成率时选 Astra;复杂且需要控制成本的生产任务优先测试 6.1 Sol;窄而高频的分类、提取和路由任务更适合 Luna。

GPT-6.1 Sol 不是新版 Astra

这个名字很容易让人误会。GPT-6.1 Sol 是 GPT-6 Sol 的后继版本,不是 GPT-6 Astra 改名,也不是因安全问题暂停扩大开放的 GPT-6.1 Astra。OpenAI 给它的定位很清楚:它要成为 GPT-6 家族的主力工作模型,在多数实际任务上逼近 Astra,同时把成本压到适合反复运行的水平。

因此,GPT-6 家族现在对应的是三种不同需求:GPT-6 Astra负责最难、最不能失败的工作;GPT-6.1 Sol 负责复杂但需要算账的生产任务;GPT-6 Luna 负责窄而高频的批量任务。真正有用的问题不是“谁最聪明”,而是“这项工作需要多少能力,允许多高的失败率”。

发布时,Plus、Pro、Business、Enterprise 和 Edu 用户可以在 ChatGPT Work 与 Codex 中使用 GPT-6.1 Sol,开发者也能通过 API 调用。但普通 Chat 的模型选择器里还没有它。这解释了为什么同一个账号可能在 Codex 里看到新模型,在日常聊天界面却找不到。

规格与价格

项目GPT-6.1 Sol
API 模型名gpt-6.1-sol
上下文窗口105 万 token
最大输出128K token
知识截止时间2026 年 4 月 30 日
输入文本、图片
输出文本
推理档位low、medium、high、xhigh、max
工具函数、网页搜索、文件搜索、Computer Use
标准输入价格每百万 token 2 美元
缓存输入价格每百万 token 0.10 美元
标准输出价格每百万 token 10 美元

Astra 的标准价格是输入 10 美元、输出 50 美元,因此 6.1 Sol 确实只有其五分之一。Luna 仍便宜得多,输入和输出分别为 0.10 美元和 0.50 美元。6.1 Sol 最值得注意的是缓存输入价格:每百万 token 0.10 美元,比标准输入低 95%。如果智能体反复使用同一份规则、代码库地图、资料库或工作流说明,缓存会明显改变成本结构。

不过,token 单价只是第一行账。模型如果用了更多推理 token、重试了失败的工具调用,或在电脑操作中绕了更长的路径,总成本仍可能更高。反过来,能力更强的模型若一次完成,也可能比低价模型更省。生产环境应比较“每个验收通过的结果花多少钱”,而不是只看价目表。

能力提升体现在哪里

编程:最有可能成为新默认模型的领域

DeepSWE v1.1 测试智能体在真实代码库中完成长程软件工程任务。OpenAI 的结果显示,GPT-6.1 Sol 的成绩与 Astra 相当,并在更低推理档位和成本下超过 GPT-6 Sol 的最好成绩 6.4 个百分点。

这比代码补全分数更有意义,因为真实开发要求模型连续完成查找、修改、测试和修复。不过,评测环境不是你的仓库。迁移前仍要用自己的构建流程、代码审查标准、依赖约束和失败恢复机制进行回归测试。

专业文档与业务流程

GDP.pdf 要求模型从复杂 PDF 的表格、图表、示意图和小字说明中找出答案。OpenAI 称 6.1 Sol 的表现接近 Astra,并以不到一半的单任务成本超过带 fallback 的 Opus 5.5。AutomationBench 则覆盖销售、营销、运营、客服、财务和人力资源中的 47 种工具;6.1 Sol 在 medium 档位比 Opus 5.5 高 2.2 个百分点,比同档位 GPT-6 Sol 高 4.8 个百分点。

这类评测比普通知识问答更接近智能体的真实故障点:材料不整齐、工具要选对、步骤要排好、结果还要核验。但它们仍不能证明模型会自动适配你的 CRM、财务流程或受监管业务。

Computer Use

在 OSWorld 2.0 离线集上,GPT-6.1 Sol 的 max 档位比 GPT-6 Sol 高 7 个百分点,与 Astra 只差 2.1 个百分点;OpenAI 估算其单任务成本约为 Astra 的七分之一。电脑操作任务往往包含长轨迹、截图和反复动作,成本会迅速累积,因此这个差距可能比单次问答分数更重要。

这里必须区分 Computer Use 和云电脑。Computer Use 是模型看懂并操作软件界面的能力;云电脑是智能体运行所在的远程、持久机器。产品可以只提供其中一种,不能混为一谈。

科学任务与事实准确性

在 Terminal-Bench Science 0.1 上,GPT-6.1 Sol 的 max 档位成绩超过 GPT-6 Sol 两倍,OpenAI 测得平均每项任务成本为 5.47 美元。Astra 仍以 68.1% 领先,因此高难度科学任务依然是选择旗舰模型的明确理由。

事实准确性方面,6.1 Sol 在 low 档位把“至少包含一处事实错误”的比例从 GPT-6 Sol 的 11.4% 降到 7.7%,相对下降约 32%。但该测试专门挑选用户曾举报错误的困难对话,并不代表日常使用中的幻觉率。

Astra、6.1 Sol、Sol 和 Luna 怎么选

模型适合场景主要代价
GPT-6 Astra最困难的科学、网络安全、编程和电脑操作任务;失败成本远高于推理成本价格最高,部分能力限制更多
GPT-6.1 Sol复杂生产任务、长文档、编程智能体和反复运行的多工具流程接近前沿,但不是所有维度都等于旗舰
GPT-6 Sol已经充分验证、暂时不值得迁移的旧部署性价比已被后继版本明显压过
GPT-6 Luna分类、路由、提取等窄而高频的工作面对长程和含糊任务时可靠性较低

这与上一代的 GPT-5.6 Sol、Terra 和 Luna 不同。6.1 Sol 不是三个均匀档位中的一个,而是夹在高价旗舰与超低价批量模型之间。它自然会成为多数严肃智能体任务的首个测试对象,但不意味着可以直接替换现有模型。

发布数据没有证明什么

首先,大多数数字来自 OpenAI 的研究环境。官方明确说明,生产结果可能因系统提示、可用工具、推理档位和评测框架而不同。其次,“单任务成本”取决于 token 用量、fallback 和成功判定。最后,API 价格不能直接换算为 ChatGPT 或 Codex 的订阅额度消耗。社区早期测量可以提供线索,但还不足以下结论。

同样,没有理由假定所有已经支持 OpenAI 模型的产品都立即接入了 GPT-6.1 Sol。接入需要商业授权、工程工作和质量验证。某个产品没有正式公告,就应把支持状态写成未知。

一套可执行的迁移测试

挑选几项最能代表昂贵失败的任务:

  1. 一项需要查找、实现、测试和审查的代码库改动;
  2. 一项包含图表、脚注和冲突细节的长 PDF 任务;
  3. 一项途中会出现可恢复故障的多工具流程;
  4. 一项必须通过画面核验结果的 Computer Use 任务;
  5. 一项可以复用大段缓存前缀的重复任务。

记录验收通过率、耗时、输入输出 token、缓存命中、工具调用次数、人工修正和总成本。比较对象应是你真正使用的模型,而不只是 max 档位 Astra。最合适的推理档位,通常是能稳定通过验收的最低档。

结论

GPT-6.1 Sol 的意义不在型号又增加了一个小数点,而在于它把接近前沿的智能体能力拉到了更低的成本曲线上。它最适合的不是随手聊天,而是 Astra 能力很好却贵得难以反复运行的工作:编程智能体、专业文档分析、电脑操作和长程多工具流程。

它值得作为新的生产默认候选接受测试,但不值得盲目迁移。最终要看的仍是完成了多少合格工作、重试了多少次,以及真实 API 账单或订阅额度消耗了多少。

本文依据 OpenAI GPT-6.1 Sol 发布说明、OpenAI 模型目录与 DevDay 2026 官方复盘完成核验。

https://floatboat.ai/zh/blog/gpt-6-1-sol

常见问题

GPT-6.1 Sol 是什么?
GPT-6.1 Sol 是 OpenAI 面向编程、文档处理、电脑操作和自动化任务推出的低成本 GPT-6.1 模型。它在 API 中的模型 ID 是 gpt-6.1-sol,支持 105 万 token 上下文和最多 12.8 万 token 输出。
GPT-6.1 Sol 的 API 价格是多少?
OpenAI 的目录价是每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。实际任务成本还会受到上下文长度、输出长度、重试次数和工具调用数量影响。
普通 ChatGPT 用户可以使用 GPT-6.1 Sol 吗?
发布时,OpenAI 明确记录的是 API、Codex 和 ChatGPT Work 等工作场景,并不等于所有普通 ChatGPT 套餐的模型选择器都会出现 Sol。对外承诺前应核对当前套餐与产品文档。
GPT-6.1 Sol 和 Astra 应该怎么选?
大量、长上下文、成本敏感的 Agent 工作优先考虑 Sol;最困难的推理和质量不能妥协的任务继续交给 Astra。更实际的做法通常是用 Sol 处理常规任务,再把少数难例升级到 Astra。