OpenAI 最新发布的 GPT-5.6 模型系列及 ChatGPT Work 整合了多项突破性能力,旨在成为新一代 AI 生产力核心。

GPT-5.6 模型系列概览

GPT-5.6 包含三个不同定位的模型,在性能、成本和应用场景上形成梯度。

模型名称 定位与特点 编程性能 (Artificial Analysis Coding Agent Index) 价格 (每百万token) 关键优势
Sol 旗舰编程模型,性能最强 80分 (刷新SOTA) 输入 $5,输出$30 编程、长程工程任务表现卓越,成本效率远超竞品。
Terra 均衡性能模型 略高于 Claude Fable 5 输入 $2.5,输出$15 在性能与成本间取得平衡,适用于通用复杂任务。
Luna 轻量、高性价比模型 超越 Claude Opus 4.8 输入 $1,输出$6 成本极低,由 Sol 后训练生成,标志“AI训练AI”的递归自我改进成为现实 。

核心功能升级

  1. 增强推理模式:新增 maxultra 两档高能力设置。ultra 档默认启用4 个 Agent 并行工作,复杂任务可扩展至 16 个,实现更高分数与更快速度 。
  2. 补齐能力短板:提升了设计审美能力,并能自动检查渲染结果的视觉与功能问题后进行修改 。在“端到端知识工作”评测(如 BrowseComp、OSWorld 2.0)中,Sol 模型刷新了 SOTA 。
  3. 加速AI研究:在内部测试中,GPT-5.6 使研究员的日均输出 token 量达到 GPT-5.5 最高水平的两倍多,显著提升了研究效率 。

ChatGPT Work:AI 打工人神器

ChatGPT 桌面端与 Codex 应用合并,推出了全新的 ChatGPT Work

  • 核心能力:它是一个能够跨应用程序和文件自主工作的智能体(Agent),可将目标直接转化为成品,并能持续监控项目、连续工作数小时 。
  • 技术集成
    • 内置浏览器与 Computer Use:允许 ChatGPT 直接调用本地文件和应用,与操作系统深度交互 。
    • 多工具接入:支持接入多种工具,执行端到端的办公任务 。
    • 移动端操控:用户可通过手机端的 ChatGPT 应用直接操控 ChatGPT Work 。
  • 一键部署:同步推出的 Hosted Sites 功能,支持用户将生成的内容一键发布为网站 。

性能与成本对比

与主要竞品 Claude Fable 5 相比,GPT-5.6 系列在性能领先的同时,实现了显著的成本与效率优势

对比维度 GPT-5.6 (Sol) Claude Fable 5 GPT-5.6 优势
编程基准分数 80分 (SOTA) 77.2分 领先 2.8分
输出 Token 量 少于一半 基准值 节省 >50%
任务耗时 少于一半 基准值 快 >50%
任务成本 低约1/3 基准值 节省 ~33%

综上所述,GPT-5.6 通过模型分层、推理增强和成本优化,在技术性能上建立了领先优势;而 ChatGPT Work 的推出,则标志着 OpenAI 正将 AI 从对话工具升级为能够理解复杂意图、操作多平台软件、执行长链条任务的全链路智能生产力平台 。

接入up8ai.com

 


参考来源

 

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐