我的 Codex 论文流程:15个skills、7个阶段、4个注意事项、1条红线

先说我踩过的三个坑,你大概率也遇到过。
第一个,让模型直接帮我找文献。它给了一份格式漂亮的清单,题名、作者、年份、DOI 一应俱全。我拿去核,一半打不开,另一半打开了但内容跟它写的支撑关系对不上。
第二个,题目还很虚就开始写。生成速度很快,读起来也顺,但每一段都在绕。真正的问题是那个研究问题根本没收住,后面写多少字都是空转。
第三个,图省事让模型直接出了一张示意图。看着很专业,放大一看坐标轴上的数字是糊的,图例里的单词拼错了,而且没有任何一份数据文件能对应上它。
这三件事有个共同点:输出看起来越完整,越难发现它是空的。
所以我后来把整个流程改了。不再追求「一句话生成一篇」,而是把论文拆成七个阶段,每个阶段有明确的产出物和检查动作。模型只在它可靠的环节干活,其余环节它连碰都不碰。这篇把这套流程完整写出来,包括我实际用的提示词和自检表。
流程总览
先给一张全景,后面逐段展开。
00 装配
我让 Codex 做的事 定一条主线 Skill
产出物 可用的技能目录
过关标准不会多套流程打架
01 文献
我让 Codex 做的事 只出检索策略
产出物 检索式 + Zotero 库
过关标准每条文献可点开
02 idea
我让 Codex 做的事 苏格拉底式追问
产出物 一句话最小命题
过关标准说得清 gap 属于哪类
03 架构
我让 Codex 做的事 章节契约
产出物 三级大纲 + 证据映射
过关标准每个论点有证据编号
04 写作
我让 Codex 做的事 按学科分流起草
产出物 分章草稿
过关标准无证据处标着缺口
05 图表
我让 Codex 做的事 写出图代码
产出物 数据 + 脚本 + 图
过关标准换台机器能跑出同一张
06 组会
我让 Codex 做的事 重排叙事
产出物 汇报页
过关标准听众三分钟能抓住主张
07 雷达
我让 Codex 做的事 每日筛新论文
产出物 日报 / 周报
过关标准重要的进了 Zotero
七个阶段里,第 01 段是地基。文献这层一旦掺假,后面写得再顺都是危房。
00|先把 Skill 装对,别装满
我现在长期留在系统里的是五个综合学术 Skill,分工不同:
|
仓库 |
我用它做什么 |
|---|---|
K-Dense-AI/scientific-agent-skills |
自然科学向,尤其生物医学、化学,自带科学数据库 |
Yuan1z0825/nature-skills |
覆盖面最全,从找观点一路到科研绘图 |
Imbad0202/academic-research-skills-codex |
我的主线,打磨 idea 和论文架构 |
leo-lilinxiao/codex-autoresearch |
计算机 / AI 方向,反复跑实验 |
zLanqing/codex-claude-academic-skills |
写中文稿时更顺手 |
抄仓库名时留意两处:第三个是大写字母 I 开头的 Imbad0202,不是小写 l;第四个是 leo-lilinxiao,中间只有一个 i。这两个我都抄错过,全是 404。
比装什么更重要的是别全装。这五个的能力有重叠,同时挂着,模型会同时听五套流程,你自己也说不清该从哪一步进。我的搭法是:
一条主线管全程,一两把小刀管专项,其余先不装。
主线我留给 academic-research-skills-codex。它只有一个入口,内部再路由到不同 workflow,不容易几个 Skill 同时被叫起来打架。
01|文献:策略、搜索、归档,三段分开
这是整套流程里我改动最大、收益也最大的一段。
先说结论:我不再让 Codex 去搜文献、点下载。
那种做法通常是让模型操控浏览器,一篇一篇点下载按钮。效率极低是其次,真正的问题是检索环节最容易出幻觉——你拿到的是一份看起来齐整、经不起核对的清单。
我把这段拆成三步,每步交给不同的东西。
### Step 1 · 策略归 Codex
模型在这里只做一件事:把研究问题翻译成检索逻辑。关键词怎么组、同义词和缩写要不要展开、时间窗口划到哪、哪些期刊必须覆盖、哪些主题要排除。
它产出的是检索式,不是结果。
我要检索的主题是:【主题】我的研究问题是:【XXX研究问题】 目标学科和常用期刊:【期刊名称】
请帮我设计检索策略,输出:
1. 核心概念拆解,每个概念给 3 到 5 个同义表达和常见缩写
2. 三组检索式,分别偏召回、偏精确、偏交叉领域
3. 时间窗口和文献类型的建议范围,并说明理由
4. 需要主动排除的主题,避免检索被邻近领域淹没 只输出检索策略,不要列举具体文献,不要生成任何 DOI。
最后那句必须写。不写,它十有八九会顺手「举几个例子」,而那些例子往往就是幻觉的入口。
### Step 2 · 搜索归专用站
真检索我交给学术搜索产品,分三类用:
|
工具 |
我在什么时候用 |
|---|---|
| Undermind |
主力。做深度检索,直接返回可点开的论文链接 |
| Elicit / Consensus |
要结构化摘要、想快速看领域内共识与分歧 |
| Connected Papers / ResearchRabbit / Litmaps |
已有一篇种子论文,想顺引文网络往外扩 |
我的常规动作是把已经写好的一段研究背景直接丢给 Undermind,让它检索同主题文献。它会先反问一句「你最想让这次检索优先服务于什么」,把范围再收一道,然后出一份带原始链接的调研报告。
这一步最大的价值是:每条文献都能当场点开。不需要事后逐条验真伪,因为它本来就是从真实索引里捞出来的。
拿到报告后我通常不急着关掉,就在旁边继续追问:这批文献里哪几篇是同一条脉络、我还缺哪一块材料、有没有和我结论冲突的工作。这类整理型问题它答得不错。但论文正文我不在这里写——这类工具的写作能力一般,成稿还是回 Codex。
### Step 3 · 归档归 Zotero
选出来的文献统一进 Zotero,网页、PDF、DOI、题录一起存。我固定分三栏:
· core papers——直接支撑我论点的,通常不超过 20 篇
· related work——需要在综述里交代、但不构成直接支撑的
· reading queue——还没读、但看起来相关的
分栏的意义在写作阶段才显现:写引言时我只允许自己引 core 里的东西,related 只能用来铺背景。这条自律省掉了大量后期返工。
存完之后,通过插件把 Zotero 连回 Codex,让它读整个库,出综述骨架、证据矩阵和投稿方向建议。到这一步模型才第一次接触文献,而它接触到的每一条都已经是我亲手确认过的。
整条链路是这样的:
Codex 出检索式 → 专用站找真论文 → Zotero 沉淀分栏 → 回流 Codex 做分析
模型全程没有决定过「文献从哪来」。

文献工作台
02|idea:被追问到说得清为止
文献铺好之后,我不直接写。先过一轮追问。做法是让主线 Skill 进入苏格拉底模式,我给方向,它连续反问。我要求它一次只问两三个问题,答完再往下推。
真正有杀伤力的是这四类问题:
最小命题: 你最想让审稿人相信的那一句话是什么?必须能用一句话说完,说不完就是还没想清楚。
操作性定义: 你反复用的这个核心概念,在你的论文里具体指什么?怎么测?
gap 归类:你说的空白,是工具缺口(还没人做出这个东西)、证据缺口(做过但没验证过)、还是理解缺口(有结果但解释不清)?三者对应的论文写法完全不同。
边界条件:如果换个场景、去掉某个前提,你的结论还成立吗?
我一般要来回七八轮才停。中途会被问得很难受,但被问住的地方,正好就是审稿人后面要问的地方。
请用苏格拉底式追问帮我收敛研究问题,全程不要写大纲或正文。
我的方向:【方向】
我目前的想法:【想法】
我已有的材料:【填入资料,例如数据、访谈、原型、前期实验】
规则: 一次只问 2 到 3 个问题,等我回答后再继续。
围绕四点推进:最小命题、核心概念的操作性定义、 gap 属于工具 / 证据 / 理解中的哪一类、边界条件。 我回答含糊时请直接指出含糊在哪,不要替我补完。 追问结束后,输出 3 个可检验的候选研究问题, 每个标注:可研究对象、可能方法、需要材料、最大风险。
红线:这一步绝对不让它写大纲。 只要它开始列章节,追问就停了,题目也就没收住。
03|架构:给每个论点配证据编号
idea 定下来,接着搭结构。这一步我要的不是章节标题列表,而是一份章节契约:每章回答什么问题、需要什么证据、和前后章怎么承接、哪里材料还不够。
关键是让它把证据编号标在论点后面。Zotero 里的 core papers 我提前编好号,写大纲时直接引用编号。没有编号可标的地方,一律写「证据缺口」,不许用「已有研究表明」这类模糊说法糊过去。
基于以下研究问题和文献编号清单,输出三级大纲。
研究问题:【研究问题】
可用文献:【文献1题名/文献2题名 …】
要求: 每个主要论点后标注支撑它的文献编号。 没有文献支撑的论点,标注为「证据缺口」并说明需要什么材料。 每章开头写明本章要回答的问题,结尾写明它交给下一章什么。 只输出大纲和证据映射,不要写正文段落。
大纲拿到手,我会先数一遍「证据缺口」有几处。缺口太多说明文献还没做够,得退回第 01 段补,而不是硬往下写。
04|写作:按学科分流,别用一套模板
这一步最容易出问题的地方,不是文笔,是证据标准用错了。
自然科学、计算机、人文社科对「什么算证据充分」的要求差得很远。一套模板打天下的结果,是让理论建构被写成实验报告,或者让消融实验被一笔带过。
我按学科分三条线:
1.自然科学 / 医学 / 材料
重点在数据、实验链路、结果表述的规范。走 scientific-agent-skills 和 nature-skills。
2.计算机 / AI / 机器学习
重点在 baseline 选择、实验设计、评估指标,还要处理 LaTeX 和引用格式。走 wanshuiyin/Auto-claude-code-research-in-sleep(ARIS)、Orchestra-Research/AI-Research-SKILLs、leo-lilinxiao/codex-autoresearch。
3.人文社科 / 交叉学科
重点在理论框架、论证逻辑、文献综述的组织,以及中文表达。走 Imbad0202/academic-research-skills-codex 和 fakerqwq/social-science-paper-writing-skill。
不管走哪条线,我下指令时都会加同一段约束:
写作约束: 只能使用大纲中标注了编号的证据,不得引入清单外的文献或数据。 摘要级证据不得扩写成全文结论。 相关关系不得写成因果结论。 没有真实数据的章节保持空白,不要用占位数字。
草稿出来后,我固定搜三个词:「证明」「显著提升」「所有」。这三个词出现的地方,回去逐句核对证据编号。十次里有七八次,问题就藏在这里。
05|图表:真数据、代码出图,没有例外
这里是我整套流程唯一一条不打折的红线:直接用图像模型生成整张图,绝不能进论文。
原因不是效果不好,是它从根上不成立。图像模型是把提示词映射到潜空间再解码成一整张位图,它不「知道」数字是多少——文字会漂移,坐标轴数值不可编辑,图例里的术语可能拼错。更要命的是没有任何数据能追溯到这张图,这是科研诚信问题,不是美观问题。
我的做法是让 Codex 写出图代码,产出三件套:
1. 数据文件——原始或清洗后的数据,单独存
2. 绘图脚本——Python 或 R,随机种子固定,依赖版本写清楚
3. 图片——脚本跑出来的结果
判断标准只有一条:换一台机器,重跑脚本,能不能得到同一张图。图像模型我不是完全不用,但只用在两个地方:想构图布局、画纯示意性的框架图草稿。而且草稿最终一定要用矢量工具重画一遍。

代码出图 vs 生成图对比
06|组会页:叙事要重排,不是把论文贴上去
论文是给读者看的,汇报是给听众听的。这两件事的信息组织方式完全不同,直接把章节复制进模板,讲出来一定拖沓。
我现在不套幻灯片模板,而是用前端向的 Skill 把内容做成网页展示:
|
仓库 |
作用 |
|---|---|
obra/superpowers |
表现力强的页面和动画 |
nextlevelbuilder/ui-ux-pro-max-skill |
产品级 UI/UX 思路,控制信息密度 |
vercel-labs/agent-skills |
网页设计规范与 React / Next.js 实践 |
anthropics/skills
的 frontend-design |
强化组件结构和页面层级 |
pbakaus/impeccable |
对齐、间距、收尾打磨 |
zarazhangrui/frontend-slides |
把前端代码转成演示页和讲稿 |
重排叙事我按三条来:开头三十秒讲清楚要解决什么问题,中间只留一张最关键的图,结论放前面、方法放后面。论文里的铺垫顺序在这里要倒过来。
这段有工程门槛,本地起服务不熟的话可以先跳过,用 nature-skills 里的 nature-paper2ppt 直接出 PPTX 顶着,等流程其他部分跑顺了再回来。
07|我的机器人:让新论文自己找上门
最后一段是长期跟踪。我在 Codex 里挂了定时任务,每天固定时间跑一次文献筛选,监控源是 Crossref、OpenAlex、arXiv。用到的两个 Skill 是 xuezheng627/daily-literature-digest-skill 和 xuezheng627/research-radar-paper-vault。
配置四步:
1. 在对话里设定主题、关键词、关注的作者和期刊
2. 在 Dashboard 里确认监控源和推送格式
3. 在任务里调筛选条件,太宽就收紧关键词
4. 收日报或周报,一般每天三到五篇
推送出来的东西不全都要。我的处理规则是:扫一眼标题和一句话摘要,觉得重要的手动进 Zotero 的 reading queue,其余直接放过。
这一步省的不是时间,是意志力。跟进文献从一件需要每天记得做的事,变成了默认发生的事。方向偏了就在对话里改一句,第二天换题,不用手动重跑检索。

定时任务 / 每日雷达推送
四道门禁自检表
七个阶段听起来多,但真正决定成败的只有四道闸。每次交稿前我都过一遍:
| 门禁 |
检查什么 |
没过的表现 |
|---|---|---|
| 文献真实性 |
检索有没有离开模型 |
引用一核就没,DOI 对不上 |
| idea 强度 |
有没有被追问到说得清 |
一句话讲不清最小命题,gap 归不了类 |
| 图的可复现 |
是不是真数据 + 代码出图 |
图里文字不可编辑,找不到对应数据文件 |
| 文献入口 |
新论文有没有固定通道 |
全靠临时想起来搜一次 |
常见翻车场景
|
问题 |
真实原因 |
怎么救 |
|---|---|---|
|
引用核不上 |
让模型直接检索了 |
退回 01,检索全部重做 |
|
写得顺但绕 |
题目没收住就开写 |
退回 02,重新追问 |
|
审稿说论证跳跃 |
大纲没标证据编号 |
退回 03,补证据映射 |
|
相关被写成因果 |
写作时没加约束 |
搜「证明 / 显著提升 / 所有」逐句改 |
|
图被要求提供原始数据 |
图不是代码出的 |
重跑脚本,没脚本就重做 |
|
文献总是落后 |
没有固定入口 |
配 07 的定时任务 |
第一周怎么落地
别一次全上,我的建议顺序是:
第一天只做 00 和 01。装一条主线 Skill,把 Undermind 和 Zotero 打通,用一个正在做的真实题目跑一遍检索,把 core papers 那一栏填到 10 篇左右。
第二天到第三天做 02 和 03。就这个题目做完整的苏格拉底追问,一直问到能一句话说清最小命题,再出带证据编号的三级大纲。
第四天到第五天做 04,只写一章。不要整篇上,先验证证据约束是不是真的守得住。
第六天做 05,把这一章里的图用代码重出一遍。
第七天配 07 的雷达,让它从此每天自己跑。
06 那段可以放到第二周,它对成稿质量没有影响,只影响汇报效果。
最后
这套流程解决的不是「写得更快」,是过程可控。
模型在语言组织上确实强,但它不知道哪篇文献真的存在,不知道你的数据长什么样,也不知道审稿人会从哪里下刀。这三件事必须由人来兜。整套流程的设计目标只有一个:让每一步都留下可以回查的痕迹,出问题时能精确定位到哪一段,而不是把整篇推倒重来。
底线始终不变:AI 最多是辅助,文献自己得读,论文还是人写,创新是人的责任。
如果你不想从零折腾 Skill 配置和本地环境,也可以用 AIWritePaper 先跑通一版留痕的基础稿,从选题、文献到成稿每一步都可复核,再接回 Codex 做审稿和打磨。平台生成的内容仍然要由作者本人核对引用、数据和论证,也不能替代伦理审批与导师审核。
文中提到的仓库
· K-Dense-AI/scientific-agent-skills
· Yuan1z0825/nature-skills
· Imbad0202/academic-research-skills-codex
· leo-lilinxiao/codex-autoresearch
· zLanqing/codex-claude-academic-skills
· wanshuiyin/Auto-claude-code-research-in-sleep
· Orchestra-Research/AI-Research-SKILLs
· fakerqwq/social-science-paper-writing-skill
· xuezheng627/daily-literature-digest-skill
· xuezheng627/research-radar-paper-vault
· zarazhangrui/frontend-slides
· pbakaus/impeccable
· nextlevelbuilder/ui-ux-pro-max-skill
· vercel-labs/agent-skills
· anthropics/skills
葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。
更多推荐



所有评论(0)