TL;DR
- GPT-6.1 Sol 是 GPT-6 Sol 的大幅升级:编程、电脑操作、专业文档和多步骤自动化能力接近 GPT-6 Astra,标准输入和输出价格却只有 Astra 的五分之一。
- API 模型名为
gpt-6.1-sol。它已进入 ChatGPT Work、Codex 和 OpenAI API,但发布时还不能在普通 Chat 中使用。 - 上下文窗口为 105 万 token,最大输出 128K,支持图片输入、函数、网页搜索、文件搜索和 Computer Use。
- “价格只有五分之一”说的是 token 单价,不保证每项任务都便宜 80%。推理档位、重试、工具调用、缓存命中和订阅额度都会改变实际成本。
- 失败代价高、只求最高完成率时选 Astra;复杂且需要控制成本的生产任务优先测试 6.1 Sol;窄而高频的分类、提取和路由任务更适合 Luna。
GPT-6.1 Sol 不是新版 Astra
这个名字很容易让人误会。GPT-6.1 Sol 是 GPT-6 Sol 的后继版本,不是 GPT-6 Astra 改名,也不是因安全问题暂停扩大开放的 GPT-6.1 Astra。OpenAI 给它的定位很清楚:它要成为 GPT-6 家族的主力工作模型,在多数实际任务上逼近 Astra,同时把成本压到适合反复运行的水平。
因此,GPT-6 家族现在对应的是三种不同需求:GPT-6 Astra负责最难、最不能失败的工作;GPT-6.1 Sol 负责复杂但需要算账的生产任务;GPT-6 Luna 负责窄而高频的批量任务。真正有用的问题不是“谁最聪明”,而是“这项工作需要多少能力,允许多高的失败率”。
发布时,Plus、Pro、Business、Enterprise 和 Edu 用户可以在 ChatGPT Work 与 Codex 中使用 GPT-6.1 Sol,开发者也能通过 API 调用。但普通 Chat 的模型选择器里还没有它。这解释了为什么同一个账号可能在 Codex 里看到新模型,在日常聊天界面却找不到。
规格与价格
| 项目 | GPT-6.1 Sol |
|---|---|
| API 模型名 | gpt-6.1-sol |
| 上下文窗口 | 105 万 token |
| 最大输出 | 128K token |
| 知识截止时间 | 2026 年 4 月 30 日 |
| 输入 | 文本、图片 |
| 输出 | 文本 |
| 推理档位 | low、medium、high、xhigh、max |
| 工具 | 函数、网页搜索、文件搜索、Computer Use |
| 标准输入价格 | 每百万 token 2 美元 |
| 缓存输入价格 | 每百万 token 0.10 美元 |
| 标准输出价格 | 每百万 token 10 美元 |
Astra 的标准价格是输入 10 美元、输出 50 美元,因此 6.1 Sol 确实只有其五分之一。Luna 仍便宜得多,输入和输出分别为 0.10 美元和 0.50 美元。6.1 Sol 最值得注意的是缓存输入价格:每百万 token 0.10 美元,比标准输入低 95%。如果智能体反复使用同一份规则、代码库地图、资料库或工作流说明,缓存会明显改变成本结构。
不过,token 单价只是第一行账。模型如果用了更多推理 token、重试了失败的工具调用,或在电脑操作中绕了更长的路径,总成本仍可能更高。反过来,能力更强的模型若一次完成,也可能比低价模型更省。生产环境应比较“每个验收通过的结果花多少钱”,而不是只看价目表。
能力提升体现在哪里
编程:最有可能成为新默认模型的领域
DeepSWE v1.1 测试智能体在真实代码库中完成长程软件工程任务。OpenAI 的结果显示,GPT-6.1 Sol 的成绩与 Astra 相当,并在更低推理档位和成本下超过 GPT-6 Sol 的最好成绩 6.4 个百分点。
这比代码补全分数更有意义,因为真实开发要求模型连续完成查找、修改、测试和修复。不过,评测环境不是你的仓库。迁移前仍要用自己的构建流程、代码审查标准、依赖约束和失败恢复机制进行回归测试。
专业文档与业务流程
GDP.pdf 要求模型从复杂 PDF 的表格、图表、示意图和小字说明中找出答案。OpenAI 称 6.1 Sol 的表现接近 Astra,并以不到一半的单任务成本超过带 fallback 的 Opus 5.5。AutomationBench 则覆盖销售、营销、运营、客服、财务和人力资源中的 47 种工具;6.1 Sol 在 medium 档位比 Opus 5.5 高 2.2 个百分点,比同档位 GPT-6 Sol 高 4.8 个百分点。
这类评测比普通知识问答更接近智能体的真实故障点:材料不整齐、工具要选对、步骤要排好、结果还要核验。但它们仍不能证明模型会自动适配你的 CRM、财务流程或受监管业务。
Computer Use
在 OSWorld 2.0 离线集上,GPT-6.1 Sol 的 max 档位比 GPT-6 Sol 高 7 个百分点,与 Astra 只差 2.1 个百分点;OpenAI 估算其单任务成本约为 Astra 的七分之一。电脑操作任务往往包含长轨迹、截图和反复动作,成本会迅速累积,因此这个差距可能比单次问答分数更重要。
这里必须区分 Computer Use 和云电脑。Computer Use 是模型看懂并操作软件界面的能力;云电脑是智能体运行所在的远程、持久机器。产品可以只提供其中一种,不能混为一谈。
科学任务与事实准确性
在 Terminal-Bench Science 0.1 上,GPT-6.1 Sol 的 max 档位成绩超过 GPT-6 Sol 两倍,OpenAI 测得平均每项任务成本为 5.47 美元。Astra 仍以 68.1% 领先,因此高难度科学任务依然是选择旗舰模型的明确理由。
事实准确性方面,6.1 Sol 在 low 档位把“至少包含一处事实错误”的比例从 GPT-6 Sol 的 11.4% 降到 7.7%,相对下降约 32%。但该测试专门挑选用户曾举报错误的困难对话,并不代表日常使用中的幻觉率。
Astra、6.1 Sol、Sol 和 Luna 怎么选
| 模型 | 适合场景 | 主要代价 |
|---|---|---|
| GPT-6 Astra | 最困难的科学、网络安全、编程和电脑操作任务;失败成本远高于推理成本 | 价格最高,部分能力限制更多 |
| GPT-6.1 Sol | 复杂生产任务、长文档、编程智能体和反复运行的多工具流程 | 接近前沿,但不是所有维度都等于旗舰 |
| GPT-6 Sol | 已经充分验证、暂时不值得迁移的旧部署 | 性价比已被后继版本明显压过 |
| GPT-6 Luna | 分类、路由、提取等窄而高频的工作 | 面对长程和含糊任务时可靠性较低 |
这与上一代的 GPT-5.6 Sol、Terra 和 Luna 不同。6.1 Sol 不是三个均匀档位中的一个,而是夹在高价旗舰与超低价批量模型之间。它自然会成为多数严肃智能体任务的首个测试对象,但不意味着可以直接替换现有模型。
发布数据没有证明什么
首先,大多数数字来自 OpenAI 的研究环境。官方明确说明,生产结果可能因系统提示、可用工具、推理档位和评测框架而不同。其次,“单任务成本”取决于 token 用量、fallback 和成功判定。最后,API 价格不能直接换算为 ChatGPT 或 Codex 的订阅额度消耗。社区早期测量可以提供线索,但还不足以下结论。
同样,没有理由假定所有已经支持 OpenAI 模型的产品都立即接入了 GPT-6.1 Sol。接入需要商业授权、工程工作和质量验证。某个产品没有正式公告,就应把支持状态写成未知。
一套可执行的迁移测试
挑选几项最能代表昂贵失败的任务:
- 一项需要查找、实现、测试和审查的代码库改动;
- 一项包含图表、脚注和冲突细节的长 PDF 任务;
- 一项途中会出现可恢复故障的多工具流程;
- 一项必须通过画面核验结果的 Computer Use 任务;
- 一项可以复用大段缓存前缀的重复任务。
记录验收通过率、耗时、输入输出 token、缓存命中、工具调用次数、人工修正和总成本。比较对象应是你真正使用的模型,而不只是 max 档位 Astra。最合适的推理档位,通常是能稳定通过验收的最低档。
结论
GPT-6.1 Sol 的意义不在型号又增加了一个小数点,而在于它把接近前沿的智能体能力拉到了更低的成本曲线上。它最适合的不是随手聊天,而是 Astra 能力很好却贵得难以反复运行的工作:编程智能体、专业文档分析、电脑操作和长程多工具流程。
它值得作为新的生产默认候选接受测试,但不值得盲目迁移。最终要看的仍是完成了多少合格工作、重试了多少次,以及真实 API 账单或订阅额度消耗了多少。
本文依据 OpenAI GPT-6.1 Sol 发布说明、OpenAI 模型目录与 DevDay 2026 官方复盘完成核验。
https://floatboat.ai/zh/blog/gpt-6-1-sol
