GPT-6.1Sol
以五分之一的价格,提供接近 Astra 级别的智能
我们推出了 GPT-6.1 Sol,这是 GPT-6 Sol 的升级版。它在智能体编程、计算机使用和专业工作方面的智能水平接近 GPT-6 Astra,而输入与输出 Token 的标准价格仅为 Astra 的五分之一。缓存输入价格仅为每百万 Token 0.10 美元 — 比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50% — 让开发者能够以更低的成本,构建和运行可在不同请求间复用上下文的强大智能体。
GPT-6Astra
我们最智能的模型, 带来最佳效果。
- 输入
- US$10.00
- 输出
- US$50.00
- 缓存输入
- US$1.00
GPT-6.1Sol
接近 Astra 的智能水平,价格仅为其五分之一。
- 输入
- US$2.00
- 输出
- US$10.00
- 缓存输入
- US$0.10
GPT-6Luna
快速高效地处理 大规模日常任务。
- 输入
- US$0.10
- 输出
- US$0.50
- 缓存输入
- US$0.01
各项任务上能力更强的 Sol
GPT-6.1 Sol 为重要的日常工作带来了能力与成本之间的新平衡。与 GPT-6 Sol 相比,它在复杂专业任务中的表现显著提升,涵盖代码编写与调试、文档理解以及多步骤业务工作流的执行。在其中多项评估中,它以显著更低的成本取得了接近 GPT-6 Astra 的表现。
编程
DeepSWE v1.1 评估模型在真实代码库中完成复杂软件工程任务的能力。在这项评估中,GPT-6.1 Sol 以约五分之一的成本达到与 GPT-6 Astra 相当的水平,同时以更低的推理强度和成本,比 GPT-6 Sol 的最高得分高出 6.4 个百分点。
在 DeepSWE 1.1(在新窗口中打开) 测试中,AI 智能体需要完成原创的长程软件工程任务。
专业工作
GDP.pdf 衡量模型利用复杂 PDF 文档(包括表格、图表、示意图和小字细节)回答专业问题的准确程度。在所测试的各档推理设置下,GPT-6.1 Sol 的得分均高于带回退机制的 Opus 5.5,而单任务成本不到其一半。它还以约五分之一的单任务成本,接近 GPT-6 Astra 的业界领先性能。
在 GDP.pdf(在新窗口中打开) 测试中,模型需要根据来自金融、医疗、法律等 10 个专业领域实际工作流的复杂 PDF 文档,回答真实场景下的问题。
AutomationBench 衡量智能体能否正确完成多步骤业务工作流。在这项评估中,GPT-6.1 Sol 在中等推理强度下的得分比 Opus 5.5 高 2.2 个百分点,成本则约为其三分之一。这一得分也比相同设置下的 GPT-6 Sol 高出 4.8 个百分点。
在 AutomationBench 1.0.6(在新窗口中打开) 测试中,AI 智能体使用 47 款工具完成端到端工作流,涵盖销售、营销、运营、支持、财务和人力资源等领域。图中 Claude Fable 5.1 的成本数据低于其实际成本,因为未计入回退处理的开销,而约 40% 的任务触发了回退处理。
计算机使用
在需要与计算机应用交互的任务上,GPT-6.1 Sol 也取得了显著进步。OSWorld 2.0 的离线集评估智能体处理高难度计算机使用工作流的能力。在最高推理强度下,GPT-6.1 Sol 的得分比 GPT-6 Sol 高 7 个百分点,成本却不到其一半。在最高推理强度下,它与 Astra 的得分差距缩小至 2.1 个百分点以内,单任务成本约为其七分之一。
在 OSWorld 2.0(在新窗口中打开) 测试中,AI 智能体尝试执行涵盖日常与专业任务的长程计算机使用工作流。我们报告的是 v2026.08.08 版本离线测试集上的部分奖励分数。
科学研究
Terminal-Bench Science 0.1 评估包括数据分析、模拟和定理证明在内的科学工作流。在最高推理强度下,GPT-6.1 Sol 的得分超过 GPT-6 Sol 的两倍,单任务成本却不到其一半。在最高推理强度下,GPT-6.1 Sol 的平均单任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。它提供了强大的科研能力,同时成本比这两款模型均降低超过 75%。
GPT-6 Astra 仍以 68.1% 的得分在受测模型中排名第一,最具挑战性的科学研究任务应使用该模型。
在 Terminal-Bench Science 0.1(在新窗口中打开) 测试中,智能体使用代码和终端工具完成科学研究工作流,包括分析数据、运行模拟和拟合模型。
事实准确性
GPT-6.1 Sol 在处理高难度提示词时,事实准确性也有所提升。相比 GPT-6 Sol,它在低推理强度 (low reasoning effort) 下的提升最为明显:包含事实错误的回复比例从 11.4% 降至 7.7%,降幅约为 32%。在测试涵盖的各档推理强度下,其错误率与 GPT-6 Astra 的差距均不超过 1.9 个百分点,而每项任务的成本不到后者的五分之一。
这项评估使用去标识化的对话,衡量回答中包含至少一处事实错误的比例;用户曾在这些对话中指出早期模型的错误。这些刻意挑选的高难度提示并不代表典型使用情况。
我们使用去标识化的 ChatGPT 对话来评估事实准确性,用户曾在这些对话中指出早期模型的事实错误。这些容易引发错误的对话并不代表典型使用情况;在典型使用中,事实错误更为少见。
安全部署 GPT-6.1 Sol
在我们的对齐评估中,GPT-6.1 Sol 相较 GPT-6 Sol 有了显著提升,更接近 GPT-6 Astra 的水平。
GPT-6.1 Sol 能更坦诚地说明自身局限,也更可靠地遵循用户意图和安全约束。在具有挑战性的评估中,它在如实说明搜索工具故障、遵守明确限制,以及避免在智能体任务中产生未经授权的结果等方面,失败率均低于 GPT-6 Sol。我们未观察到它尝试绕过自动安全审查机制的行为,这与 GPT-6 Astra 和 GPT-6 Sol 的表现一致。完整详情请参阅 GPT-6.1 Sol 系统卡片附录(在新窗口中打开)。
以下评估专门测试高难度情境,并不衡量典型使用中的失误率。
定价与可用性
即日起,所有 Plus、Pro、Business、Enterprise 和 Edu 用户均可在“ChatGPT 工作”和 Codex 中使用 GPT-6.1 Sol。GPT-6.1 Sol 暂未在“聊天”中提供。开发者也可以通过 OpenAI API 访问该模型,模型标识为 gpt-6.1-sol。其 API 标准价格为:每百万输入 Token 2 美元,每百万缓存输入 Token 0.10 美元,每百万输出 Token 10 美元。未来几天,我们还将提供 GPT-6.1 Sol Ultrafast,在 Codex 中的 Token 生成速度最高可达该模型标准速度的 8 倍。

