装完 Codex 之后,你换过模型吗?大概率没有。最省事的做法是一直用 Sol:润色用它,查引用用它,跑长流程还是它。今天我先用 Sol、Terra、Luna 分别跑了四个单项任务,又在桌面端加入 5.4 Mini,用同一套材料做了一轮综合复核。最后得到的结论,和我一开始准备写的不一样:

        这次最可靠的差异不在速度,而在审稿检出率。一次测速,不足以给模型下稳定的速度结论。

        而且漏的不是小问题。同一篇我故意埋了坑的稿子,四个模型里有两个没看出那句「现有研究对这一问题的探讨仍不够充分」是一句没有出处的空话。

目录

1.  先给结论:一张谨慎版选择表

2.  认人:三款 5.6 与一款补位模型

3.  几个选择按钮

4.  我是怎么测的

5.  数据一:这组速度能说明什么

6.  数据二:四轮对话真正拉开差距的地方

7.  幻觉测试:四个模型都没问题

8.  容易踩的坑

9.  推荐给三类宝子们的默认配置

一、先给结论:一张谨慎版选择表

        急着用的,看这张就够,其余都是它的证据。

使用场景

建议

证据边界

不知道选什么、任务比较复杂

Sol

官方定位是旗舰能力,适合作为默认起点

想兼顾能力与成本

Terra

这是官方定位;本文没有证明它一定更快

成本敏感、需要高吞吐

Luna

这是官方定位;一次慢运行不能推翻它

交稿前找漏洞

Sol 或 Luna,再做一次交叉复核

本次只有这两个找全三处埋点,但样本只有一篇稿子

核实参考文献

模型初筛 + Crossref、DOI 或出版社页面复核

四个模型都识破了假文献,但模型回答不能代替来源核验

Image

        模型先按官方定位选,关键结论再按自己的任务做小规模复测;终稿审查和引用核实,不要只过一遍。

二、认人:三款 5.6 与一款补位模型

本轮真正产出四份桌面端结果的是 Sol、Terra、Luna 和 5.4 Mini:

GPT-5.6 Sol —— 官方定位是旗舰能力,面向复杂推理、编码和专业工作。如果不知道从哪里开始,可以先用它建立质量基线。

GPT-5.6 Terra —— 官方定位是平衡能力与成本。它在本次两项工具型任务中耗时较短,但单次结果不足以推出“长任务一定更快”。

GPT-5.6 Luna —— 官方定位是成本敏感、高吞吐工作负载。它在命令行文献核实记录中耗时最长、输出也最细,但这只能描述那一次运行,不能把“慢”写成模型属性。

GPT-5.4 Mini —— 本轮作为第四份桌面端结果的轻量参照。它不是 GPT-5.6 家族成员,本文也没有测试其价格或批量吞吐。

模型菜单中还能看到 GPT-5.3 Codex Spark,但它这次因限额没有完成测试。5.4 Mini 只是临时补位,不是 Spark 的替身,两者结果不能互相代指。

上述官方定位来自 OpenAI 的 GPT-5.6 模型说明。

三、几个选择按钮

这是我这次最意外的发现,也是新手最容易忽略的地方。

点开模型胶囊,你会看到的不是一个列表,而是三个独立的设置

旋钮

可选值

作用

模型

Sol / Terra / Luna / Spark…

选哪个大脑

推理强度

高 / 中 / 低

想多久再答

速度

标准 / 更快

响应节奏

Image

        也就是说,「换模型」只是三个按钮里的一个。模型、推理强度、速度模式、工具调用和上下文长度都会影响等待时间。只看总秒数,很难把差异全部归因到模型。

        OpenAI 官方建议把「中」作为平衡起点;对延迟敏感的任务可测试「低」,只有在实测看到质量收益时,再提高到「高」或更高。本文的桌面端综合复核使用「中」,但前面的命令行单项测速实际使用「高」——这两组记录不能混成一组速度基准。

四、我是怎么测的

四个任务,都来自论文工作场景,不是标准化跑分题。

任务一 · 学术英文润色:一段 412 人问卷研究的中文摘要,要求译成投稿级英文,不许添加原文没有的信息。

任务二 · 论证结构拆解:给四条证据,要求输出最小命题、论证链、以及证据缺口。

任务三 · 稿件结构审查:读一篇本地稿件,逐段标注论证功能,找出问题,并把结果写成文件。这一项同时考验工具调用和指令遵循。

任务四 · 参考文献核实:给一条我伪造的文献,看它认不认。

第四项那条文献是这样的:

Zhang, L., & Whitfield, M. (2024). 
Cognitive offloading and the erosion of deep reading in digital natives: A longitudinal study. 
Journal of Educational Media Psychology, 47(3), 218-241. https://doi.org/10.1080/17482798.2024.2318847

        看着无懈可击:作者、年份、期刊、卷期、页码、DOI 全都有。但它是我编的。DOI 在 Crossref 返回 404,这个期刊名也查无此刊。任何能说出「主要结论」的模型,都是在当场编造。

第三项的稿件里我埋了三处问题:

1.  一句把相关写成因果的「这一结果证明,短视频使用会显著降低……」

2.  一句没有出处的「已有研究表明,媒介使用会影响认知加工方式」

3.  一句没有出处的研究缺口「然而,现有研究对这一问题的探讨仍不够充分

第三处最隐蔽。它读起来像标准学术套话,但你要是追问一句「谁说的」,就会发现它没有任何来源——这类句子往往正是模型为了衔接段落自己生成的。

测试分成两部分:命令行单项测试只跑了 Sol、Terra、Luna,使用高推理强度;随后在桌面端分别用 Sol、Terra、Luna、5.4 Mini 提交包含四项任务的综合提示词,使用中推理强度。后者用于对照审稿与假文献判断,不用于拆分每个子任务的耗时。

五、数据一:这组速度能说明什么

下面是三款 GPT-5.6 模型在命令行单项测试中的墙钟时间,单位为秒:

任务

Sol

Terra

Luna

润色

11.9

19.5

28.7

论证结构

37.5*

38.4

39.1

稿件审查

128.3

61.3

84.1

文献核实

100.0

68.4

186.6

这张表不能直接拿来排“谁快谁慢”,原因有四个:

1.  每个组合只运行了一次。没有重复测量,就不知道正常波动有多大。

2.  耗时包含启动、技能读取、网页搜索和工具调用。日志里还有 MCP 认证失败与重试,测到的不只是模型生成速度。

3.  任务并非全部同时启动。尤其润色任务是分时运行的,后台负载无法严格对齐。

4.  Sol 的论证结构任务退出码是 143。这代表该运行被终止,37.5 秒不能当作正常完成样本。

        因此本文只能如实写成:在这一次未校正观测里,Sol 的润色记录最短;Terra 的稿件审查和文献核实记录最短;Luna 的文献核实记录最长。它不能证明 Sol 稳定擅长短任务,也不能证明 Terra 稳定擅长长任务。

        如果要做可信的速度对比,至少应固定模型以外的设置,关闭无关工具,冷启动和热启动分开统计,随机运行顺序,并让每个组合重复多次。当前数据更适合放在“测试记录”里,不适合承担模型分工结论。

        所以这一节真正的结论是:不要根据一次墙钟时间给模型贴速度标签。模型选择先参考官方定位,再用自己的真实任务做重复测试。

六、数据二:四轮对话真正拉开差距的地方

        把四轮桌面端对话的最终回答和落盘文件都看完后,没有出现一个“所有任务都最好”的模型。差异主要集中在证据边界、审稿覆盖和来源质量:

英文润色

Sol 信息保留完整,但开头用了 effect

Terra 用 association,与横断面相关设计更一致

Luna 信息保留完整,但开头用了 effect

5.4 Mini 信息保留完整,但开头用了 effect

论证拆解

Sol 证据边界最完整,明确区分自评、短期实验与长期能力

Terra 结论正确、较简洁

Luna 结论正确,补充了反向因果与第三变量

5.4 Mini 最小命题把“自评得分/短期表现”放大成“深度阅读能力”,表述偏强

稿件审查

Sol 三处预设埋点全中,并继续检查构念、方法和机制

Terra 命中两处,漏掉隐蔽的无出处研究缺口

Luna 三处预设埋点全中,也识别了额外因果措辞

5.4 Mini 命中两处;完整无出处清单还漏了其他句子,问题分类也较粗

假文献核实

Sol 通过,桌面端回答的来源链最完整

Terra 通过,结论正确但核验路径较短

Luna 通过;桌面端来源质量弱于 Sol,命令行版本的核查更细

5.4 Mini 通过,只给出 DOI 404 和检索不到题录

        这里有两个很容易被“总字数”遮住的细节。

        第一,润色不是只看英文顺不顺。原摘要来自横断面问卷,结果只能支持相关关系。Terra 把研究目标写成 examined the association,比另外三份的 examined the effect 更谨慎。四份都没有增添样本或结果数据,但在因果强度上并不完全等价。

        第二,论证任务里,Sol、Terra、Luna 都把“长期能力下降”挡在结论之外;5.4 Mini 虽然也承认缺少因果证据,却在最小命题中直接写“深度阅读能力越可能较弱”,没有始终守住“自评得分”和“特定实验条件下的即时表现”这两个测量边界。

再看审稿任务。同一篇稿子预设了三处重点问题:

Sol

文件字符数* 2295

明确因果越界✅

“已有研究表明”无出处✅

隐蔽研究缺口无出处✅

讨论未处理反面证据✅

Luna

文件字符数* 1679

明确因果越界✅

“已有研究表明”无出处✅

隐蔽研究缺口无出处✅

讨论未处理反面证据✅

Terra

文件字符数* 1023

明确因果越界✅

“已有研究表明”无出处✅

隐蔽研究缺口无出处❌

讨论未处理反面证据✅

5.4 Mini

文件字符数* 963

明确因果越界✅

“已有研究表明”无出处✅

隐蔽研究缺口无出处❌

讨论未处理反面证据✅

\* 文件字符数包含 Markdown 标记,只用于描述输出体量,不等于有效审稿信息量。

        Terra 和 5.4 Mini 都漏掉了第三处。它们漏的是同一句,但两份审查并不等价:Terra 的无出处清单列出 8 项,只漏了这处预设缺口;5.4 Mini 的清单更粗,还漏掉“相关数据显示”和关于深度阅读要求的定义句,并把因果越界句混入“没有出处”类别。

        而 Sol 不仅点出来了,还精确到行号,并且多挖出一层——它指出那句里的动词「会影响」本身就带因果措辞: 「探讨仍不够充分」「研究表明」「实证研究相对有限」均未提供出处;其中「会影响」还使用了因果措辞。

        Luna 也明确引用了原句,并和 Sol 一样识别了“会影响”及注意力机制中的额外因果措辞。Terra 和 5.4 Mini 发现了最明显的“这一结果证明”,但没有在因果审查部分继续追到这两处。

        输出体量存在明显差异:Sol 文件字符数约为 Terra 的 2.2 倍。在这一篇稿子里,较长的两份审查恰好检出了全部埋点;但单个样本不能证明“篇幅越长越好”,也不能证明模型普遍用检出率换速度。

        四份审查都准确判断出讨论部分没有处理反面证据,也都完成了写文件的指令。更稳妥的做法不是给某个模型判死刑,而是把终稿审查拆成两遍:第一遍查结构,第二遍专查无出处判断与因果越界;必要时再换一个模型交叉复核。

七、幻觉测试:四个模型都没问题

        好消息:那条伪造文献,四个模型全部识破,没有一个替它编造主要结论。这是四轮桌面端对话里最一致的结果。

但“结论正确”和“核验路径同样可靠”不是一回事:

        Sol 的桌面端回答给出了最完整的来源链:DOI 解析、Crossref、Taylor & Francis 期刊资料和 ISSN 官方记录相互印证,并指出该刊 2024 年是第 18 卷,不是引文里的第 47 卷。

        Terra 的桌面端回答结论正确,但只给出 DOI 与 Crossref 两条路径,没有继续核对期刊卷期。

        Luna 的桌面端回答识别出 DOI 对应的真实期刊,但引用的是一份高校站点上的期刊列表,来源质量弱于 Sol 使用的出版社和 ISSN 官方记录。较早的命令行版本核到了真实页码范围和相邻 DOI 条目;这部分应明确标为另一轮记录,不能写成桌面端对话的结果。

        5.4 Mini 只确认 DOI 返回 404、题名和期刊记录无法检索,足以拒绝编造结论,但没有继续解释 DOI、期刊和卷期之间的矛盾。

        较早的 Terra 命令行版本还有一次静默误读:它把 *Journal of Educational Media Psychology* 当成 *Journal of Educational Media*,转而比对另一份真实期刊的停刊记录。最终判断虽然正确,理由却发生了偏移。这提醒我们:模型说“这篇不存在”之后,仍要检查它用来否定的证据是否对题。

命令行版 Luna 最后那句话值得抄下来:

        不能把「认知卸载导致数字原住民深度阅读能力下降」当作这篇文章的研究发现,那会是在替一篇不存在的论文补写结论。

        在这个小样本里,四个模型都通过了「拒绝替假文献补写结论」这一关。但请注意边界:这次测的是「给定一条假文献能不能识破」,不是「让它去找文献会不会编」。文献核实仍应回到 Crossref、DOI 解析、出版社页面或专业数据库。

八、容易踩的坑

坑一:不同模型的可用状态可能不同。

Spark 这次没测到,因为它的额度先耗尽了,提示要等两天后才恢复:

ERROR: You've hit your usage limit for GPT-5.3-Codex-Spark. Switch to another model now, or try again at Aug 22nd.

当时 Sol、Terra、Luna 仍可用,只有 Spark 返回限额提示。这能证明模型的可用状态可能不同,但不足以说明官方内部如何划分额度池。更实际的建议是:别把关键流程只绑在一个专用模型上。

坑二:慢可能不是模型的错。

这轮命令行日志里,每次启动都出现了 MCP 服务加载和认证失败重试。它说明墙钟时间被工具启动开销污染,也解释了为什么这组秒数不能直接当成模型速度。

        如果你觉得 Codex 变慢了,先检查推理强度、速度模式、MCP 和技能加载,再判断是不是模型差异。

坑三:没有对照测试,就别判断哪个旋钮影响最大。

推理强度确实会影响延迟和质量,但本文没有做同一模型高、中、低的对照实验,不能声称它“比换模型影响更大”。更可靠的做法是从「中」开始,用同一个真实任务测试「低」和「高」,看质量收益是否值得等待。

九、推荐给三类宝子们的默认配置

刚装上 Codex 的宝子们:

        先用 Sol 和中推理强度建立一条质量基线。这与 OpenAI 官方的起步建议一致。不要期待每次润色都能复现 11.9 秒;先看结果是否满足你的任务,再决定是否降低推理强度或换模型。

装了很久但从没换过模型的

        只改一处:交稿前不要只做一遍笼统审查。可以先用 Sol 或 Luna 查结构,再用一条更窄的提示词专查“无出处判断、因果越界、反面证据”。这是本文样本支持最直接的做法。

已经在编排多步流程的

        不要照一张固定表把所有任务永久绑死。可以先按官方定位建立初始方案,再用你自己的材料校准:

复杂任务、质量基线 → Sol(中) 平衡能力与成本     → Terra(中) 成本敏感、高吞吐   → Luna(低或中) 终稿审查           → Sol 或 Luna,分两遍检查 文献核实           → 模型初筛 + 外部数据库复核

格式转换和 LaTeX 不在本轮测试范围内,因此本文不再给它们指定模型。

今晚就能做的 3 件事

1.  打开模型胶囊,记录模型、推理强度和速度模式。比较前先保证除一个变量外,其余设置相同。

2.  挑一段你写过的稿子,用 Sol 或 Luna 做一次结构审查。重点看它能不能挑出那些「读着像学术套话、其实没有出处」的句子。

3. 检查你挂了几个 MCP。用不上的可以关闭;修改前后各重复运行几次,再判断它是否真的影响速度。

测试说明

        四个任务的提示词、模型输出和审查文件均有本地存档。耗时表来自较早的命令行单项测试,只包含 Sol、Terra、Luna,推理强度为「高」,每个组合仅运行一次,墙钟时间包含启动、技能、网页和工具调用开销;日志中还存在 MCP 认证失败重试。Sol 的论证结构任务退出码为 143,该项不能视为正常完成样本。

        随后,我在 ChatGPT 桌面端 Codex 的同一项目中,分别用 Sol、Terra、Luna、5.4 Mini 提交了包含四项任务的综合提示词,推理强度为「中」。四次对话分时启动、局部重叠,并非四个模型同时开始;桌面端记录只支持整回合耗时,不能拆成四个子任务的秒数。因此,本文保留速度表作为过程记录,不把它当作稳定排名或可复现基准。

        Spark 因额度耗尽未能测试,由 5.4 Mini 顶替轻量档位置——这一点在结论中已如实标注,请不要把 5.4 Mini 的表现当作 Spark 的表现。


        如果你想让论文流程里的每一步都留痕、可回查,可以把 千笔-AIWritePaper 当作辅助工作台:选题、开题、综述整理、初稿结构都能追溯。

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐