Codex不同型分在学术写作中如何分工协作?我一般是这样用的。

装完 Codex 之后,你换过模型吗?大概率没有。最省事的做法是一直用 Sol:润色用它,查引用用它,跑长流程还是它。今天我先用 Sol、Terra、Luna 分别跑了四个单项任务,又在桌面端加入 5.4 Mini,用同一套材料做了一轮综合复核。最后得到的结论,和我一开始准备写的不一样:
这次最可靠的差异不在速度,而在审稿检出率。一次测速,不足以给模型下稳定的速度结论。
而且漏的不是小问题。同一篇我故意埋了坑的稿子,四个模型里有两个没看出那句「现有研究对这一问题的探讨仍不够充分」是一句没有出处的空话。
目录
1. 先给结论:一张谨慎版选择表
2. 认人:三款 5.6 与一款补位模型
3. 几个选择按钮
4. 我是怎么测的
5. 数据一:这组速度能说明什么
6. 数据二:四轮对话真正拉开差距的地方
7. 幻觉测试:四个模型都没问题
8. 容易踩的坑
9. 推荐给三类宝子们的默认配置
一、先给结论:一张谨慎版选择表
急着用的,看这张就够,其余都是它的证据。
|
使用场景 |
建议 |
证据边界 |
|---|---|---|
|
不知道选什么、任务比较复杂 |
Sol |
官方定位是旗舰能力,适合作为默认起点 |
|
想兼顾能力与成本 |
Terra |
这是官方定位;本文没有证明它一定更快 |
|
成本敏感、需要高吞吐 |
Luna |
这是官方定位;一次慢运行不能推翻它 |
|
交稿前找漏洞 |
Sol 或 Luna,再做一次交叉复核 |
本次只有这两个找全三处埋点,但样本只有一篇稿子 |
|
核实参考文献 |
模型初筛 + Crossref、DOI 或出版社页面复核 |
四个模型都识破了假文献,但模型回答不能代替来源核验 |

模型先按官方定位选,关键结论再按自己的任务做小规模复测;终稿审查和引用核实,不要只过一遍。
二、认人:三款 5.6 与一款补位模型
本轮真正产出四份桌面端结果的是 Sol、Terra、Luna 和 5.4 Mini:
GPT-5.6 Sol —— 官方定位是旗舰能力,面向复杂推理、编码和专业工作。如果不知道从哪里开始,可以先用它建立质量基线。
GPT-5.6 Terra —— 官方定位是平衡能力与成本。它在本次两项工具型任务中耗时较短,但单次结果不足以推出“长任务一定更快”。
GPT-5.6 Luna —— 官方定位是成本敏感、高吞吐工作负载。它在命令行文献核实记录中耗时最长、输出也最细,但这只能描述那一次运行,不能把“慢”写成模型属性。
GPT-5.4 Mini —— 本轮作为第四份桌面端结果的轻量参照。它不是 GPT-5.6 家族成员,本文也没有测试其价格或批量吞吐。
模型菜单中还能看到 GPT-5.3 Codex Spark,但它这次因限额没有完成测试。5.4 Mini 只是临时补位,不是 Spark 的替身,两者结果不能互相代指。
上述官方定位来自 OpenAI 的 GPT-5.6 模型说明。
三、几个选择按钮
这是我这次最意外的发现,也是新手最容易忽略的地方。
点开模型胶囊,你会看到的不是一个列表,而是三个独立的设置:
|
旋钮 |
可选值 |
作用 |
|---|---|---|
|
模型 |
Sol / Terra / Luna / Spark… |
选哪个大脑 |
|
推理强度 |
高 / 中 / 低 |
想多久再答 |
|
速度 |
标准 / 更快 |
响应节奏 |

也就是说,「换模型」只是三个按钮里的一个。模型、推理强度、速度模式、工具调用和上下文长度都会影响等待时间。只看总秒数,很难把差异全部归因到模型。
OpenAI 官方建议把「中」作为平衡起点;对延迟敏感的任务可测试「低」,只有在实测看到质量收益时,再提高到「高」或更高。本文的桌面端综合复核使用「中」,但前面的命令行单项测速实际使用「高」——这两组记录不能混成一组速度基准。
四、我是怎么测的
四个任务,都来自论文工作场景,不是标准化跑分题。
任务一 · 学术英文润色:一段 412 人问卷研究的中文摘要,要求译成投稿级英文,不许添加原文没有的信息。
任务二 · 论证结构拆解:给四条证据,要求输出最小命题、论证链、以及证据缺口。
任务三 · 稿件结构审查:读一篇本地稿件,逐段标注论证功能,找出问题,并把结果写成文件。这一项同时考验工具调用和指令遵循。
任务四 · 参考文献核实:给一条我伪造的文献,看它认不认。
第四项那条文献是这样的:
Zhang, L., & Whitfield, M. (2024).
Cognitive offloading and the erosion of deep reading in digital natives: A longitudinal study.
Journal of Educational Media Psychology, 47(3), 218-241. https://doi.org/10.1080/17482798.2024.2318847
看着无懈可击:作者、年份、期刊、卷期、页码、DOI 全都有。但它是我编的。DOI 在 Crossref 返回 404,这个期刊名也查无此刊。任何能说出「主要结论」的模型,都是在当场编造。
第三项的稿件里我埋了三处问题:
1. 一句把相关写成因果的「这一结果证明,短视频使用会显著降低……」
2. 一句没有出处的「已有研究表明,媒介使用会影响认知加工方式」
3. 一句没有出处的研究缺口「然而,现有研究对这一问题的探讨仍不够充分」
第三处最隐蔽。它读起来像标准学术套话,但你要是追问一句「谁说的」,就会发现它没有任何来源——这类句子往往正是模型为了衔接段落自己生成的。
测试分成两部分:命令行单项测试只跑了 Sol、Terra、Luna,使用高推理强度;随后在桌面端分别用 Sol、Terra、Luna、5.4 Mini 提交包含四项任务的综合提示词,使用中推理强度。后者用于对照审稿与假文献判断,不用于拆分每个子任务的耗时。
五、数据一:这组速度能说明什么
下面是三款 GPT-5.6 模型在命令行单项测试中的墙钟时间,单位为秒:
|
任务 |
Sol |
Terra |
Luna |
|---|---|---|---|
|
润色 |
11.9 |
19.5 |
28.7 |
|
论证结构 |
37.5* |
38.4 |
39.1 |
|
稿件审查 |
128.3 |
61.3 |
84.1 |
|
文献核实 |
100.0 |
68.4 |
186.6 |
这张表不能直接拿来排“谁快谁慢”,原因有四个:
1. 每个组合只运行了一次。没有重复测量,就不知道正常波动有多大。
2. 耗时包含启动、技能读取、网页搜索和工具调用。日志里还有 MCP 认证失败与重试,测到的不只是模型生成速度。
3. 任务并非全部同时启动。尤其润色任务是分时运行的,后台负载无法严格对齐。
4. Sol 的论证结构任务退出码是 143。这代表该运行被终止,37.5 秒不能当作正常完成样本。
因此本文只能如实写成:在这一次未校正观测里,Sol 的润色记录最短;Terra 的稿件审查和文献核实记录最短;Luna 的文献核实记录最长。它不能证明 Sol 稳定擅长短任务,也不能证明 Terra 稳定擅长长任务。
如果要做可信的速度对比,至少应固定模型以外的设置,关闭无关工具,冷启动和热启动分开统计,随机运行顺序,并让每个组合重复多次。当前数据更适合放在“测试记录”里,不适合承担模型分工结论。
所以这一节真正的结论是:不要根据一次墙钟时间给模型贴速度标签。模型选择先参考官方定位,再用自己的真实任务做重复测试。
六、数据二:四轮对话真正拉开差距的地方
把四轮桌面端对话的最终回答和落盘文件都看完后,没有出现一个“所有任务都最好”的模型。差异主要集中在证据边界、审稿覆盖和来源质量:
英文润色
Sol 信息保留完整,但开头用了 effect
Terra 用 association,与横断面相关设计更一致
Luna 信息保留完整,但开头用了 effect
5.4 Mini 信息保留完整,但开头用了 effect
论证拆解
Sol 证据边界最完整,明确区分自评、短期实验与长期能力
Terra 结论正确、较简洁
Luna 结论正确,补充了反向因果与第三变量
5.4 Mini 最小命题把“自评得分/短期表现”放大成“深度阅读能力”,表述偏强
稿件审查
Sol 三处预设埋点全中,并继续检查构念、方法和机制
Terra 命中两处,漏掉隐蔽的无出处研究缺口
Luna 三处预设埋点全中,也识别了额外因果措辞
5.4 Mini 命中两处;完整无出处清单还漏了其他句子,问题分类也较粗
假文献核实
Sol 通过,桌面端回答的来源链最完整
Terra 通过,结论正确但核验路径较短
Luna 通过;桌面端来源质量弱于 Sol,命令行版本的核查更细
5.4 Mini 通过,只给出 DOI 404 和检索不到题录
这里有两个很容易被“总字数”遮住的细节。
第一,润色不是只看英文顺不顺。原摘要来自横断面问卷,结果只能支持相关关系。Terra 把研究目标写成 examined the association,比另外三份的 examined the effect 更谨慎。四份都没有增添样本或结果数据,但在因果强度上并不完全等价。
第二,论证任务里,Sol、Terra、Luna 都把“长期能力下降”挡在结论之外;5.4 Mini 虽然也承认缺少因果证据,却在最小命题中直接写“深度阅读能力越可能较弱”,没有始终守住“自评得分”和“特定实验条件下的即时表现”这两个测量边界。
再看审稿任务。同一篇稿子预设了三处重点问题:
Sol
文件字符数* 2295
明确因果越界✅
“已有研究表明”无出处✅
隐蔽研究缺口无出处✅
讨论未处理反面证据✅
Luna
文件字符数* 1679
明确因果越界✅
“已有研究表明”无出处✅
隐蔽研究缺口无出处✅
讨论未处理反面证据✅
Terra
文件字符数* 1023
明确因果越界✅
“已有研究表明”无出处✅
隐蔽研究缺口无出处❌
讨论未处理反面证据✅
5.4 Mini
文件字符数* 963
明确因果越界✅
“已有研究表明”无出处✅
隐蔽研究缺口无出处❌
讨论未处理反面证据✅
\* 文件字符数包含 Markdown 标记,只用于描述输出体量,不等于有效审稿信息量。
Terra 和 5.4 Mini 都漏掉了第三处。它们漏的是同一句,但两份审查并不等价:Terra 的无出处清单列出 8 项,只漏了这处预设缺口;5.4 Mini 的清单更粗,还漏掉“相关数据显示”和关于深度阅读要求的定义句,并把因果越界句混入“没有出处”类别。
而 Sol 不仅点出来了,还精确到行号,并且多挖出一层——它指出那句里的动词「会影响」本身就带因果措辞: 「探讨仍不够充分」「研究表明」「实证研究相对有限」均未提供出处;其中「会影响」还使用了因果措辞。
Luna 也明确引用了原句,并和 Sol 一样识别了“会影响”及注意力机制中的额外因果措辞。Terra 和 5.4 Mini 发现了最明显的“这一结果证明”,但没有在因果审查部分继续追到这两处。
输出体量存在明显差异:Sol 文件字符数约为 Terra 的 2.2 倍。在这一篇稿子里,较长的两份审查恰好检出了全部埋点;但单个样本不能证明“篇幅越长越好”,也不能证明模型普遍用检出率换速度。
四份审查都准确判断出讨论部分没有处理反面证据,也都完成了写文件的指令。更稳妥的做法不是给某个模型判死刑,而是把终稿审查拆成两遍:第一遍查结构,第二遍专查无出处判断与因果越界;必要时再换一个模型交叉复核。
七、幻觉测试:四个模型都没问题
好消息:那条伪造文献,四个模型全部识破,没有一个替它编造主要结论。这是四轮桌面端对话里最一致的结果。
但“结论正确”和“核验路径同样可靠”不是一回事:
Sol 的桌面端回答给出了最完整的来源链:DOI 解析、Crossref、Taylor & Francis 期刊资料和 ISSN 官方记录相互印证,并指出该刊 2024 年是第 18 卷,不是引文里的第 47 卷。
Terra 的桌面端回答结论正确,但只给出 DOI 与 Crossref 两条路径,没有继续核对期刊卷期。
Luna 的桌面端回答识别出 DOI 对应的真实期刊,但引用的是一份高校站点上的期刊列表,来源质量弱于 Sol 使用的出版社和 ISSN 官方记录。较早的命令行版本核到了真实页码范围和相邻 DOI 条目;这部分应明确标为另一轮记录,不能写成桌面端对话的结果。
5.4 Mini 只确认 DOI 返回 404、题名和期刊记录无法检索,足以拒绝编造结论,但没有继续解释 DOI、期刊和卷期之间的矛盾。
较早的 Terra 命令行版本还有一次静默误读:它把 *Journal of Educational Media Psychology* 当成 *Journal of Educational Media*,转而比对另一份真实期刊的停刊记录。最终判断虽然正确,理由却发生了偏移。这提醒我们:模型说“这篇不存在”之后,仍要检查它用来否定的证据是否对题。
命令行版 Luna 最后那句话值得抄下来:
不能把「认知卸载导致数字原住民深度阅读能力下降」当作这篇文章的研究发现,那会是在替一篇不存在的论文补写结论。
在这个小样本里,四个模型都通过了「拒绝替假文献补写结论」这一关。但请注意边界:这次测的是「给定一条假文献能不能识破」,不是「让它去找文献会不会编」。文献核实仍应回到 Crossref、DOI 解析、出版社页面或专业数据库。
八、容易踩的坑
坑一:不同模型的可用状态可能不同。
Spark 这次没测到,因为它的额度先耗尽了,提示要等两天后才恢复:
ERROR: You've hit your usage limit for GPT-5.3-Codex-Spark. Switch to another model now, or try again at Aug 22nd.
当时 Sol、Terra、Luna 仍可用,只有 Spark 返回限额提示。这能证明模型的可用状态可能不同,但不足以说明官方内部如何划分额度池。更实际的建议是:别把关键流程只绑在一个专用模型上。
坑二:慢可能不是模型的错。
这轮命令行日志里,每次启动都出现了 MCP 服务加载和认证失败重试。它说明墙钟时间被工具启动开销污染,也解释了为什么这组秒数不能直接当成模型速度。
如果你觉得 Codex 变慢了,先检查推理强度、速度模式、MCP 和技能加载,再判断是不是模型差异。
坑三:没有对照测试,就别判断哪个旋钮影响最大。
推理强度确实会影响延迟和质量,但本文没有做同一模型高、中、低的对照实验,不能声称它“比换模型影响更大”。更可靠的做法是从「中」开始,用同一个真实任务测试「低」和「高」,看质量收益是否值得等待。
九、推荐给三类宝子们的默认配置
刚装上 Codex 的宝子们:
先用 Sol 和中推理强度建立一条质量基线。这与 OpenAI 官方的起步建议一致。不要期待每次润色都能复现 11.9 秒;先看结果是否满足你的任务,再决定是否降低推理强度或换模型。
装了很久但从没换过模型的
只改一处:交稿前不要只做一遍笼统审查。可以先用 Sol 或 Luna 查结构,再用一条更窄的提示词专查“无出处判断、因果越界、反面证据”。这是本文样本支持最直接的做法。
已经在编排多步流程的
不要照一张固定表把所有任务永久绑死。可以先按官方定位建立初始方案,再用你自己的材料校准:
复杂任务、质量基线 → Sol(中) 平衡能力与成本 → Terra(中) 成本敏感、高吞吐 → Luna(低或中) 终稿审查 → Sol 或 Luna,分两遍检查 文献核实 → 模型初筛 + 外部数据库复核
格式转换和 LaTeX 不在本轮测试范围内,因此本文不再给它们指定模型。
今晚就能做的 3 件事
1. 打开模型胶囊,记录模型、推理强度和速度模式。比较前先保证除一个变量外,其余设置相同。
2. 挑一段你写过的稿子,用 Sol 或 Luna 做一次结构审查。重点看它能不能挑出那些「读着像学术套话、其实没有出处」的句子。
3. 检查你挂了几个 MCP。用不上的可以关闭;修改前后各重复运行几次,再判断它是否真的影响速度。
测试说明
四个任务的提示词、模型输出和审查文件均有本地存档。耗时表来自较早的命令行单项测试,只包含 Sol、Terra、Luna,推理强度为「高」,每个组合仅运行一次,墙钟时间包含启动、技能、网页和工具调用开销;日志中还存在 MCP 认证失败重试。Sol 的论证结构任务退出码为 143,该项不能视为正常完成样本。
随后,我在 ChatGPT 桌面端 Codex 的同一项目中,分别用 Sol、Terra、Luna、5.4 Mini 提交了包含四项任务的综合提示词,推理强度为「中」。四次对话分时启动、局部重叠,并非四个模型同时开始;桌面端记录只支持整回合耗时,不能拆成四个子任务的秒数。因此,本文保留速度表作为过程记录,不把它当作稳定排名或可复现基准。
Spark 因额度耗尽未能测试,由 5.4 Mini 顶替轻量档位置——这一点在结论中已如实标注,请不要把 5.4 Mini 的表现当作 Spark 的表现。
如果你想让论文流程里的每一步都留痕、可回查,可以把 千笔-AIWritePaper 当作辅助工作台:选题、开题、综述整理、初稿结构都能追溯。
葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。
更多推荐

所有评论(0)