最近这几个月我越来越少关注哪一个模型最强,反而一直在优化自己的模型组合。一个任务交给谁,能在可接受的时间里做完,质量够不够,额度烧得值不值。

        模型更新太快,只用一家很容易碰到两个问题。强模型的额度总在最需要它的时候告急,便宜模型看着能干,遇到复杂任务又会多返工几轮。我的办法很朴素,让每个模型做它最划算的那一段,把需要判断力的工作留给上限最高的模型。

        这篇就把我目前的组合摊开讲。里面的套餐价格和额度,有些来自我的老套餐或账户定向活动不一定完全能参考,但肯定有替代产品,最后会给宝子们一个最划算的组合。准备订阅前还是要看自己账户最后的结算页。

一、核心思路

Benchmark 只负责告诉我它有没有资格上场

        我会看 Benchmark,但不会照着总榜订阅。总体SOTA真的适合所有人吗?一个模型的综合分数很高,只能说明它大概率没有明显短板。工作里的任务往往很偏。有人主要写前端,有人每天查论文,也有人要处理本机一堆文件。某个模型只在一个方向做到 SOTA,已经足够说明它在这个方向值得使用的。

Image

        比如前端生成强的gemini,意味着它更可能一次把布局和交互做顺。检索与工具调用强的grok和gemini,意味着它更适合去找X动态、论文线索和当天信息。长文分数高,也不代表它可以直接写论文,至少说明它有机会在长材料里维持结构,不会读到后半段就忘掉前面的限制。其实写出好的内容有时候是经过优化的agentic流程配合一个旧的不那么聪明的模型,依然可以生成高质量的学术内容。

        Benchmark在我这里是一张入场券。模型拿到入场券以后,还要跑我自己的真实题目。公开测试集给的是统一考场,我每天面对的却是自己的文件、提示词、软件环境和验收标准。两者其实不能一概而论,其实每个宝子也一样,肯定都有最适合自己的组合。

我一直盯着三件事

第一件是速度

        一个模型再聪明,每次都要等十几分钟,我也不会把日常小活交给它。查资料、整理表格、改一段前端和批量清洗内容,反馈速度会直接改变工作节奏。快模型允许我多试两次,很多任务的最终质量反而更稳。

第二件是智价比

        我说的智价比,不只是 API 里每百万 Token 多少钱。订阅额度、刷新周期、并发数量、工具是否好用,都要算进去。一个模型单次效果只有强模型的八成,价格只有十分之一,速度还快,它就很适合采集、初筛和批量任务。

第三件是能力上限

        复杂代码、本地文件操作、长文论证和最终审查,往往需要一个上限足够高的模型收口。便宜模型可以把路铺好,最后那一下仍要交给能发现漏洞、敢推翻初稿的模型。我的订阅组合就是围着这三件事搭起来的。

二、我的模型组成

主力位置留给 GPT-5.6

        我平时顺口会说 ChatGPT 5.6,准确一点,它是我在 Codex 里主要使用的 GPT-5.6 模型组。我的账户是 200 美元档的 20x 权益。升级到 5.6 以后,额度已经不像过去那么宽松,偶尔也会一天消耗10+亿token,分配任务反而更重要了。。

Image

        我其实并不是token燃烧大户,做大工程的开发者可能一天就要消耗数十亿token。

Image

        我用得最多的是 Sol 和 Luna,推理强度通常放在中档。OpenAI 的官方模型指南也把 medium 当作平衡起点。max 会让模型多做探索与核验,困难任务确实可能更稳,代价是等待时间和 Token 消耗都明显增加。日常工作一上来就拉满,体验通常很差。

        Sol 是我的干活主力。论文结构审查、复杂开发、跨文件修改,以及需要操控本机文件的任务我会优先给它。sol比较吃token,慢的时候也真慢,但遇到有难度的活,返工次数通常比先用弱模型硬磨更少。

        Luna 接简单开发和批量工作。单文件脚本、轻量页面、格式整理、初步分类,这些任务没有必要占 Sol 的额度。官方对 Luna 的定位也是高吞吐、成本敏感的工作。它的价值很直接,快,便宜,够用。

        生图我也更愿意把最终一版交给GPT-Image-2。目前这就是当前的先进图像生成模型。按我自己的使用体验,它在文字准确度、改图服从度和成品稳定性上更省心。别家的模型可以先出创意,最后要放进文章封面或产品页面,我还是更常回到这一套。

MiniMax 老套餐负责跑量

        我手里还有 98 元档的 MiniMax 老套餐,其实前期由于能力使用的并不多,因为智谱取消周限,我留了这个订阅,结果后来新订阅的用户也加上周限了。这个套餐现在已经属于保留档,公开销售的现行方案和限制都不一样。老用户如果还留着,可以继续评估自己的用量,别把我的额度情况当成新用户都能买到的标准权益。

Image

        我每月大致会烧到 70 亿 Token,主要供几个 OpenClaw 任务采集学术和 AI 方向的数据。我的账户目前没有看到周限,主要受五小时窗口约束,一个窗口经常能跑掉 70% 到 80% 的额度。

Image

        这类任务追求的是吞吐和持续运行。采回来的内容还要经过后续去重、核验和强模型复查,MiniMax 在这里不需要承担最后判断。只要它能稳定地把大量材料搬回来,这 98 元就花得很值。

SuperGrok Heavy 接住搜索和简单任务

        我抢到的是年付 990 美元的 SuperGrok Heavy,还附带 Cursor Ultra。

Image

        这里先提醒一句,990 美元和我见过的 99 美元活动入口都不是常规公开价格,能不能拿到完全看账户、地区和活动页面。

Image

        Grok 最好用的地方是搜索。它找 X 上的讨论、当天信息和论文线索很快,搜索结果与回答接得也比较自然。纯推理任务里,它并不总能赢过顶级国模,但我也没打算让它包办所有难题。它现在是我的简单任务主力,把 GPT 的额度省下来给 Sol。

        Cursor Ultra 当前公开价是每月 200 美元,官方文档写明包含 400 美元的第三方模型用量。对我来说,这部分额度像一个应急仓。Claude 账号和额度总有不稳定的时候,Ultra 里的额度不算夸张,关键时刻足够拿来解题。

        SuperGrok 和 Cursor 还给了我两边都能用的 Grok 资源。具体额度池会随套餐调整,我只把它当作自己的账户体验,不把它写成人人都有的固定权益。

        Grok Bot 值得单独提一下。官方已经把它开放给 SuperGrok Heavy 和 Cursor Ultra 用户,可以在桌面和 iPhone 上把任务交给一个持续工作的 Bot。它的操作很简,手机端尤其顺手。很多时候我只想丢一句要求,让它自己跑完再回来找我,这种体验比在一堆设置里来回切模式舒服得多。

Image

Gemini 3.7 Flash 负责速度、前端和图像生态

        Gemini 3.7 Flash 是最近这套组合里让我最愿意反复调用的快模型。Google 在 8 月 13 日正式发布了它,定位就是编码与 Agent 工作的高效主力。官方给出的 WebDev Arena 分数也比 3.6 Flash 更高,前端生成仍然是它很突出的方向。比较奇葩的是复活的antigravity现在有两个客户端。。

Image

        一个是antigravity做的类似codex这类agent工具。

Image

        另一个就是antigravity IDE保留了曾经的原汁原味。。真实怀念过年前后一个pro号拉好家庭组配合反代爽蹬6个号的claude4.5的时期。。

Image

        我这里看到过两种 Google AI Pro 活动。老订阅用户重新订阅,前三个月每月 4.99 美元;新用户还有首月 1.99 美元的入口。宝子们可以看看自己的是哪种优惠,国内的visa、master信用卡都能直接订。不过需要注意一下谷歌账号的地区,如果是中国需要改成支持Gemini的地区,不然会验证成功antigravity卡登录界面的情况。改地区有相关攻略,小编今天又一个号改地区1小时左右就改好了。这些都是账户定向优惠,不同地区和时间看到的页面可能不一样。Google One 当前公开常规价依然更高,最后以付款页为准。Gemini的cli已经不更新了,应该是更名为antigravity cli,风格类似,只是把图标换了一下。

Image

        只用 Flash 的话,额度对我已经很充足。它比 Grok 还快,前端能力也更顺手。Google 生态里还有 Nano Banana 可以生图,写页面、补素材、快速做一版视觉草图都很方便,生图能力仅次于gpt-image-2(最近听说微软出了一款生图模型,占据了谷歌第二的位置,我没用过不做评价,去年nano banana2刚出现的到现在依旧能打)。

        有人拿它开玩笑,叫它国产大豆包。我能理解这种吐槽,Flash 的回答有时确实偏快、偏直,碰到复杂判断也需要复核。可它现在的速度和活动价摆在这里,订阅价值依然很高。

WorkBuddy 里的 Hy3 适合免费对照

        WorkBuddy最近腾讯推的非常凶。而WorkBuddy 里这款模型的准确名字是 Hy3。腾讯官方写明,Hy3 在 WorkBuddy 的免费体验期到 2026 年 8 月 31 日。免费不是长期承诺,过期后的规则还要看新公告。

Image

        我的感受很直接。能力比前面几款弱一点,速度不错,也能正常跑工具。遇到不着急的任务,我偶尔让它做一版,再拿结果和其他模型对照。现在还免费,就更适合拿来做这种测试。

Kimi 放在退役观察位

        Kimi 的订阅我已经取消了,只是当期权益还没到期。登月计划的额度用完以后,我暂时不准备续费。

Image

        Kimi 现在的产品功能很多,官方套餐也已经改成共享额度池和多档订阅。对我的组合来说,它的位置比较尴尬。强国模的价格普遍不低,Agent 跑起来以后消耗也快,速度又没有明显优势,DeepSeek涨价以后也感觉也高攀不起了。

Image

        手里已经有 MiniMax、Grok 和 Gemini,再给 Kimi 留一份长期订阅,价值不够清楚。

Image

        我会继续看 ox-alpha,目前opencode免费。社区现在确实在猜它来自 GLM 系列,也有人直接叫它 GLM-5.5。公开迹象只能说明它和 GLM 家族可能有关,Z.ai、OpenRouter 和模型提供方都没有确认身份。现阶段把它写成 GLM-5.5 还太早,等官方揭晓更稳妥。

三、这套模型各自能干到哪里

        下面这张表是我的当前使用体验,不是官方排名。等级只表示它在我的工作流里处于什么位置,套餐和模型更新以后还会变。

模型

体验评分

适用与边界

GPT-5.6 Sol

能力上限:很高

速度:中等偏慢

智价比:中等

适用(最适合我的任务):复杂开发、本地文件、论文审查、最终收口

边界(我不会交给它的事):大批量机械整理

GPT-5.6 Luna

能力上限:中高

速度:很快

智价比:很高

适用(最适合我的任务):简单开发、批处理、格式转换、初筛

边界(我不会交给它的事):单独承担高风险结论

MiniMax 老套餐

能力上限:中等

速度:

智价比:很高

适用(最适合我的任务):OpenClaw 数据采集、长时间跑量

边界(我不会交给它的事):直接决定文献真假与论文结论

SuperGrok Heavy

能力上限:中高

速度:

智价比:

适用(最适合我的任务):X 搜索、新闻与论文线索、简单任务、手机端 Bot

边界(我不会交给它的事):没有外部证据时做最终事实裁决

Gemini 3.7 Flash

能力上限:中高

速度:很快

智价比:很高

适用(最适合我的任务):前端、快速编码、图像生态、日常问答

边界(我不会交给它的事):一次完成高难度长链推理

WorkBuddy Hy3

能力上限:中等

速度:

智价比:免费期很高

适用(最适合我的任务):对照测试、普通办公、轻量工具任务

边界(我不会交给它的事):复杂任务的唯一执行者

Kimi

能力上限:中高

速度:中等

智价比:目前对我偏低

适用(最适合我的任务):剩余额度内的补充与对照

边界(我不会交给它的事):再增加一份长期重复订阅

        看完这张表,会发现我的组合里没有一个模型负责所有事情。Sol 守上限,Luna 和 Gemini 保速度,MiniMax 负责吞吐,Grok 接搜索与简单任务。Hy3 和 Kimi 留作对照和补位。

四、同题竞跑,再让强模型收口

        我很喜欢让所有模型跑同一个任务。我先固定题目和材料,输出要求也完全一样,随后分别交给 Sol、Grok、Gemini、MiniMax 和 Hy3。这样测出来的差异才有意义。给每个模型不同提示词,再比较谁写得好,最后比到的往往是提示词,不是模型。

        拿学术写作举例。我会先固定研究问题、可用文献和禁止编造的边界。各模型都要交一份大纲、一张证据表,再写同一小节。它们引用了什么,遗漏了什么,哪一段推理跳得太快,都能直接摆在一起看。

        接下来把几份结果交给能力更强的模型,让它做审查。审查时不能只问哪份最好。我会要求它逐条核对事实、找出各自独有的信息、标记互相冲突的判断,还要说明每个结论来自哪份材料。

        强模型也会偏爱自己的文风,它的裁决不能直接当答案。最后还要回到原始来源。论文要查题名、作者、期刊和 DOI,代码要真实运行,数据要看原表。多模型能增加候选答案,也能互相暴露漏洞,可靠性最终来自可回查的证据。

        这套方法还有一个好处。你很快就会知道哪个模型适合自己的任务。公开榜单上的两分差距,可能在你的场景里毫无感觉;一次真实竞跑里少改三轮,才能省下实打实的时间。

五、不想维护模型矩阵,可以先把论文流程跑顺

        上面这套组合适合爱折腾的人。订阅要管,额度要算,提示词要维护,模型更新以后还得重新测试。很多人只想尽快把论文写顺,并不愿意先做半个月的模型管理员。

        千笔-AIWritePaper 作为目前国内AI学术写作天花板,更适合解决这个起步成本。它把选题、文献整理、结构规划和正文生成放在一条连续流程里。用户先跑出一版可检查的基础稿,再把关键章节交给强模型复核,整个过程会比在五六个对话框之间手动搬材料省事很多。

        我更推荐把它当作论文工作台。先让平台完成重复劳动,作者把时间放在研究问题、证据质量和最终表达上。平台生成的引用、数据与论证仍要逐项核对,导师审核和学术责任也不会因为用了工具就转移。

        如果你刚开始接触 AI 学术写作,不知道该买哪几个套餐,可以先用千笔-AIWritePaper跑一次完整流程。等你碰到速度、检索或复杂审查上的瓶颈,再决定要不要补 Grok、Gemini 或 GPT。这样花出去的每一份订阅费,至少对应一个已经出现的需求。

        我现在的组合也不会一直不变。模型更新以后,谁能在我的真实任务里更快、更稳、更省,我就把任务交给谁。名字和榜单都只是参考,能把工作做完,才是我愿意长期续费的理由。

        但目前最值得订阅性价比最高的一定是ChatGPT-Pro-20x和99美元的SuperGrok Heavy!

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐