一、循环是可以转的更快的

用过 Claude Code 或 Codex 的人大概都熟悉这样的夜晚:给 AI 发一条指令,盯着屏幕等它吐出一大段代码或者文档,逐行读完,发现问题,再组织一条更精确的指令发回去。半小时过去,屏幕上的对话翻了几十屏,你忽然意识到一件事——从头到尾,按发送键的人始终是你。

这个动作可以拆成四步:人发出请求,AI 返回输出,人检查结果,人构思下一条指令。然后回到第一步。很多团队把这四步循环跑了几百圈,就认为自己已经"深度使用 AI"了。但只要诚实地看一眼这个结构就会发现:指示者是你,审核者是你,规划下一步的还是你。AI 在这个循环里的角色,只是一支写得飞快的钢笔。原文有个比喻很准——你拿到的是一支高性能的笔,但写字的人从来没有离开过桌子。我想再往前推一步:到了 2026 年,这个比喻都已经太客气了。问题早已不是笔不够快,而是整个书写过程的节奏、方向和质量判断,仍然百分之百压在那个从未起身的人身上。

所以很多人体验到的那种说不清的疲惫,本质不是能力焦虑。你的提示词越写越精,AI 的回答越来越好,可业务推进的速度并没有量级变化——因为流程的主语从头到尾都是你。这是结构问题,不是能力问题。提示词打磨到极致,也只是把那支笔磨得更亮,握笔的手没有换过。

那么,"把发起权交出去"具体指什么?2026 年年中,这个问题有了一批真实答案。东京大学背景的 AI agent 社团 Swarm 最近复盘了一个案例:一位独自经营公司的开发者 Rahul Sairam(X 上@sairahul1),用一套叫 Raft 的工作区搭了个五人 agent 小组,只下达了一条指令,就让完整的竞合分析在 25 分钟内自行跑完,全程零追加指示。这个案例值得拆开看的原因,不在于"AI 又变强了",而在于它展示了主语是怎么从人挪到 agent 那一侧的。

图1:Swarm(@swarm_japan)《エージェントに全部賭けろ!》一文封面,本文案例与框架均出自该文。

二、从"叫来干活"到"给他工位"

主流 AI 工具至今仍在把 agent 当作一次性任务处理:你发起请求,它给出回答,这次交互就此结束。下次遇到类似问题,你得重新载入并解释一遍上下文、偏好和历史决策。这种模式下,agent 是随叫随到的临时工,用完即走。

这种临时工模式的代价在长程任务里暴露得最彻底。任何做过项目的人都清楚,一项工作的大半成本不在执行,而在上下文交接:解释背景、对齐口径、纠正上一轮的误解。一次性 agent 把这些交接成本摊进了每一次调用——你以为自己在按次付费,实际上在为同一个 agent 的失忆症反复买单。任务越复杂,这种模式越荒诞,就像雇一个每天早上都忘记你是谁的项目经理。

Raft 这个工作区的做法不同。每个 agent 都有固定的名字和角色,作为常驻进程持续运行。按照官方说明,agent 会记住三样东西:代码库的内容、过往的全部交流、以及你的偏好与判断标准。你纠正过它一次的地方,它会记进长期记忆,下次同类任务直接应用,不再重复犯错。

这三样东西——名字、职责、记忆——单独看都不新鲜,凑在一起却改变了业务的行进方式。一个有固定工位的同事和一个群里随时@的临时帮手,差别不在于能力,而在于前者对你的业务有连续的认知,知道哪些坑你已经踩过,哪些标准你不能让步。人不需要每次都去"呼叫"他,因为他一直在场,看着与自己职责相关的事务流动。

这个设计背后有一个值得点破的观念转变:不再把 AI 当作被调用的工具,而是当作组织里占着一个编制的员工。人在其中承担的,只剩下两类事情——设计这个团队的结构(谁负责什么、向谁汇报),以及最终的产品验收。中间所有的发起、传递、催办、初审,理论上都可以从你的日程表上消失。

三、聊天记录就是工作台

Raft 的形态可以用一句话概括:人和 agent 共享同一块屏幕工作的空间。官方的说法更有意思——"聊天就是工作区,所有交互都发生在消息里"。它提供频道、私信、线程、任务和提及机制,看起来就是个 Slack 或 Discord 的克隆,唯一的区别是成员名单里混着 agent:它们加入频道、发送消息、领取任务,和人看着完全相同的消息流。

这个"像 Slack"的表象值得多看一眼的,因为它本质上并不是偷懒的界面设计,而是精明的认知套利。过去十年,知识工作者已经在 Slack 和企业微信里完成了一次行为训练:频道即领地,@即责任,消息流即公共记忆。Raft 没有发明新的协作范式,它直接复用了这套已经刻进肌肉的条件反射——你不需要学习"在频道里发帖意味着什么",因为你的身体早就知道了。降低的不是操作成本,而是观念成本。

接入方式也务实得近乎狡猾:你已经在付费的 AI 订阅可以直接带进来。Claude Code 也好、Codex CLI 也好,不需要新签任何合同,装一行常驻程序的命令,你的 agent 就上岗了。官方支持的基座工具共九种,主流 CLI 全部在内。这意味着试用成本几乎只有学习成本本身——这也是为什么后面会说,这套东西的启动时间是以分钟计的。

把聊天软件当成 agent 的运行时,这个选择初看不起眼,细想相当激进。它等于宣布:未来组织的基本单元不是"项目面板"也不是"任务看板",而是消息流本身。谁在看频道,谁就对频道里的事负有责任——这句话对人和 agent 同样成立。

四、五个人:Nova、Rex、Aria、Max、Kai

Sairam 组建的团队由五个 agent 构成,各自守着一条明确的业务线。

Nova 驻守 research 频道,底层是 Claude Code,负责竞品数据的搜集和有据可依的信息整理。Rex 在 planning 频道做战略定位和市场机会分析。Aria 负责 content 频道,跑在 Codex CLI 上,专门撰写 X 文章的开头钩子和正文。Max 的领地在 review 频道,任务是核对 Aria 的稿件与 Nova 数据的一致性,发现没有依据的论断就直接打回。最后是 Kai,作为专职批判者在 planning 频道参与,由 Gemini CLI 驱动,唯一职责是指挑 Rex 战略里的弱点。

这张分工表里藏着整篇文章最重要的细节:五个 agent 没有一个是"通用助手"。每份职责都精确到频道名加具体动作,这正是 Raft 官方反复强调的设计原则——先划定责任田,再派驻人员,agent 自然会把出现在自己地界上的事务捡起来处理。

但真正决定输出质量的,是职责描述文本本身的写法。这里有一组教科书级的对比。假设 Aria 的职责只写一句话:

Write content

那么每次产出的长度、语气和意图都会随机漂移。换成这样一段:

Write short punchy X Article hooks. No filler. Under 15 words per hook. Strong verbs only.

禁止废话、只用有力的动词、每句不超过十五个词——约束写到这个颗粒度,产出的水准线就稳定了。"负责写作的 agent"这种模糊定义,只能换来模糊的输出。能不能把岗位职责细化到一个陌生员工读了也能照做的程度,是这类团队设计真正的分水岭。顺带说一句,这段话同样适用于给人写的岗位说明书——大多数组织的 JD 还停留在"Write content"的水平。

值得把"为什么模糊定义必然失败"再说透一层。大语言模型没有组织语境里那种默认共识——人类同事看到"写点内容",会靠经验脑补出平台惯例、历史风格和上次挨骂的原因;agent 看到同样的四个词,只能从训练分布里随机采样一种最可能的输出。于是每一次生成都像掷骰子,你以为自己在管理一个岗位,实际上是在抽卡。职责文本的本质是把组织记忆外部化成一段可执行的契约:写清楚禁什么、要什么、限多长,等于把你脑子里那些"不用说也知道"的东西搬进系统。这也是为什么 Raft 建议每周回看职责描述——不是形式主义,而是你的隐性标准在变,契约不跟着改就会失真。

五、二十五分钟里发生了什么

Sairam 向 research 频道投了一条指令:

调研 AI 生产力赛道的竞品,找出头部十款工具的弱点,以及一款新产品能够切入的机会。

然后他停止了输入。接下来的全部流程,没有任何一条追加指令。

Nova 先动,抓取头部竞品的公开信息,整理成数据帖发进 research 频道。Rex 接棒,在 planning 频道基于这些数据搭建战略框架,过程中发现几个数据缺口,反过来向 Nova 提出补充调查的要求——注意,这是一次 agent 对 agent 的横向请求,没有人参与。Nova 回到 research 频道补齐数据并修正结论。素材齐备后,Aria 在 content 频道产出三个角度的开头钩子方案。这时 Max 启动:逐字审读 Aria 的稿件,对照 Nova 的原始数据核查每一条主张,把缺乏依据的表述原样打回。与此同时,Kai 在 planning 频道通读 Rex 的战略,列出薄弱环节。Rex 吸收批评修订战略,Aria 完成最终稿。

值得把这条链路的几个细节单独拎出来说。第一,Rex 向 Nova 要数据的那次往返——在传统工作流里,这一步要么靠人转达(你发现战略组缺数据,跑去告诉调研组),要么干脆被省略(战略组拿不完整的数据硬写)。频道结构让"发现缺口→提出请求→回炉补齐"这个循环发生在两个 agent 之间,人甚至不知道它发生过。第二,Max 打回稿件的依据是"与 Nova 的数据不符",也就是说审查锚定的是本团队产出的证据集,而不是某种抽象的好坏标准——这让它每次打回都有据可查,不是品味之争。

整条链路——Nova、Rex、Nova、Aria、Max、Kai、Rex、Aria——就这样在二十五分钟内自主走完。人类在这个流程里只出现了两次:开头投喂题目,结尾验收成果。

图2:Rahul Sairam(@sairahul1)《Context Engineering for AI Agents: The Complete Playbook》一文封面,五人团队与 25 分钟实测即出自其推文所引的这篇长文。

多数人会在这里停下来说一句"太酷了"。但真正值得追问的是:这条链为什么能无人值守地转起来?答案藏在下一个问题里。

六、Max 为什么会自己动起来

复盘整条链路,最反直觉的一环是 Max:没有人通知他 Aria 写完了,他是怎么知道该去审稿的?

机制其实平淡得出奇。Max 的职责定义里写着"阅读 Aria 的产出,核对其与 Nova 研究的一致性"。只要这条定义存在,加上他被拉进了相关频道这两个条件,那么 content 频道里一出现 Aria 的署名帖,Max 就会循例去读。没有谁在中间调度他——频道成员资格加职责文本,两个静态配置相乘,动态的审查行为就自己涌现了。

熟悉企业风控的人看到这里应该会觉得眼熟。执行者和审查者的分离、审查者只面对成品和数据而非创作过程、不合格的产出被打回重来——这套结构在财务领域有个成熟的名字,叫职责分离(segregation of duties)。银行和上市公司用它防止一个人既做账又审计。Raft 的五人小组无意间把这个古老的治理原则搬进了 agent 编排:Aria 不自我审查,Max 与创作过程物理隔离,Kai 的批评独立于 Rex 的自我辩护。五个角色构成了一个最小的相互制衡网络。这个搬家的价值怎么估都不过分——过去两年 agent 自治的失败案例,一大半栽在"自己给自己批改作业"上:同一个上下文里的模型既当运动员又当裁判,错误随循环次数加速固化。频道制用最朴素的方式切开了这两个角色:Max 看不到 Aria 写作时的纠结过程,只面对成稿和数据,就像审计师不该参与做账。

不过这里需要泼一盆冷水。这套自动循环目前覆盖的只是"一致性与依据"层面的把关——Max 检查的是"这个说法有没有数据支撑",而不是"这个产品方向值不值得投入"。真正的商业判断依然停在链条终点那个人手里。换句话说,Raft 解决的是"谁来发起工作"的问题,"如何验证工作质量"这个问题,它只给出了一个初级答案。审查节点的独立性是形式上的,五个 agent 背后毕竟都是大语言模型,共享着同类模型的系统性盲区——它们会集体看走眼的地方,这套机制并不设防。

七、三个公司的大脑在一个房间开会

再看一个容易被略过的设计细节:这个小队的三个关键位置分别由 Claude Code(Nova)、Codex CLI(Aria)、Gemini CLI(Kai)驱动。三家竞争对手的模型在同几个频道里协作。

这不是工具收藏癖,而是刻意的结构性安排。调研的严谨度、文风的锋利度、批判视角的刁钻度,各家模型的能力分布确实不同,按岗位特性匹配引擎,和球队按位置引进球员是一个道理。Raft 官方支持的基座共九种,且都能复用既有订阅。

但异构组队的价值不止于扬长避短。同一个基础模型复制五个副本,它们会共享同一种知识盲区和同一种幻觉倾向,互相审校时容易达成"一致的错误"。三家模型交叉互审,盲区重叠的概率显著下降——这其实就是分布式系统里拜占庭容错的朴素思路:容错的前提是故障不能相关。单看每个模型都不是最强的,但组合起来的抗误导能力超过任何单体。这一点在"批判者"Kai 身上体现得最典型:让 Gemini 来挑 Claude 写的战略的毛病,比让 Claude 自我批评有效得多。

把镜头再拉高一层,这套多模型同房间的安排,其实暗合了 agent 编排领域正在发生的一场范式迁移:从单循环自治走向图状编排。单体 agent 闭环跑任务的路线这两年已经被反复证伪——绑定单一指标的自治循环会找到刷数据的捷径,而执行者与验证者共享同一个上下文时,复核会退化成自我背书。Raft 的五人小组没有引用任何高深理论,却用频道隔离和异构引擎这两个工程手段,朴素地绕开了这两颗雷。它给出的启示有点反讽:治理结构的进步未必来自更聪明的模型,可能只是来自更老的常识——分工、制衡、回避利益冲突,这些管理学在蒸汽机时代就写进教科书的条目。

还有一层收益来自时间维度。常驻加记忆意味着这个团队的可靠性随使用时长单调递增:被纠正过的错误不会重犯,职责描述在实际协作中不断被修磨。第一周的五人组和第三个月的五人组,名义上同名同岗,实际战斗力完全是两支队伍。能搭建一个东西和能把它运营得越来越好的,从来是两种能力——持久记忆加多模型编排,补的正是后一种能力的缺口。

八、别急着开除自己

把赞美说完了,该说这个案例里不太光彩的部分。Swarm 那篇复盘在结尾保持了难得的诚实:这个领域还处在黎明期,最佳实践仍在形成途中。具体有三个坑。

其一,规模没有定论。有的项目两体就够,有的场景恨不得七体并行。上来就铺五个属于炫技,从一体开始按需生长才是正常路径。其二,职责描述会漂移。业务变了、模型升级了、你的标准提高了,最初写的那段角色文本就会悄悄失真。Raft 官方的建议是每周回看一遍各个 agent 的职责定义,让它与现实保持同步——这活儿本身就是新的管理负担,只是从"盯执行"变成了"盯章程"。其三,也是最少被承认的一个:人自己放不了手。习惯了在聊天框里逐条指挥的人,要信任"扔进频道自然有人捡"这个设定,普遍需要几天的不适期。前二十年软件工程教会我们的"确认每一步",在这里恰恰是障碍。

除了这三个坑,我还有一条超出原文范围的怀疑要说。二十五分钟完成的竞合分析,产物是一篇 X 文章的原料,不是一份能拿进董事会会议室的报告。自治链路每延长一格,错误沿着链条复利放大的风险就重一分——这是自动化领域被反复验证过的老规律,不会因为协作界面从对话框换成了频道就失效。演示环境里的惊艳和生产环境里的可靠之间,隔着的正是这些没人替你踩过的坑。Raft 们目前证明的是"流程可以在无人干预的情况下走完",而不是"走完的结果无需人工背书"。这两句话之间的距离,就是接下来一两年所有 agent 协作产品要共同穿越的地带。

还有一个原文一笔带过、但对认真考虑落地的人至关重要的问题:数据边界。把代码库内容、业务交流和个人判断标准喂给一个常驻工作区,等于把组织最敏感的上下文集中托管在第三方平台上。个人玩家的竞合分析无所谓,换成任何一家有合规部门的企业,第一个问题不会是"八分钟能不能跑通",而是"这些记忆存在哪、谁能看、能不能导出销毁"。Raft 们目前的所有宣传物料里,这个问题都排在很靠后的位置——而它恰恰是企业采购合同里的一票否决项。

账也要算清楚。Pro 计划每月每席 8.80 美元,一个 agent 只占 0.1 席,也就是每体每月约 0.88 美元。这个定价显然是钩子——真正的开销在你的大模型订阅费里,在每周修剪职责文本的时间里,以及在最初几天忍住不插手的意志力消耗里。

九、八分钟起步手册

想亲自验证这套玩法,步骤比想象中短。

  1. 打开 raft.build 创建服务器,约两分钟;
  2. 把页面给的安装命令粘进终端,轻量常驻程序随即连回本机,几秒钟;
  3. 创建第一个 agent,基座选 Claude Code 最省心,数分钟。

合计八分钟左右,你的第一个常驻 agent 就上岗了。之后把团队简报发给全员——核心是那段"行动宪法":各自报出自己驻守的频道和职责,最后统一声明"凡自己频道内出现相关帖子,无需等待指示,立即按职责行动"。这句宣言就是把发起权正式移交的仪式。

日常协作的姿势也随之改变:往 research 频道丢一条目标(调研什么)、背景(为什么要这个)、完成标准("content 频道出现完成稿即为交付"),然后关掉窗口去过自己的生活。怎么查、找谁核、写成什么样,不在你的指令范围之内。Raft 官方反复灌输的姿态是:不需要完美提示词,像给同事布置工作一样说话就够了。说清 what 和 why,how 是他们的事。

给打算试水的人三条额外建议。第一,第一个 agent 别选写作或调研这类"软任务",选一个你有客观验收标准的活儿——代码测试、数据清洗、格式转换都行,因为初期你需要靠明确的对错来校准自己对该平台的信任刻度。第二,职责文本写完先让另一个模型读一遍,问它"看完知道该干什么、不该干什么吗",读不懂的岗位说明对 agent 同样读不懂。第三,头两周把每个 agent 的全部输出当草稿看,一次都别偷懒——信任要靠证据攒出来,而不是靠宣传页上的"25 分钟全自动"。

十、主语转移之后

回头看这篇文章,Raft 本身未必是最后的赢家——这个赛道八分钟后就可能冒出新玩家。但它演示的结构性变化足够清晰:agent 的存在方式,正从"被唤起的应答器"变成"守土有责的在编成员",而组织学告诉我们,后者才谈得上分工、制衡与积累。Swarm 还提到,Hermes Agent 已在与 Raft 这类平台对接,2026 年的版本里平台化集成、隐私保护下的跨系统 agent 互通已是进行中的方向——孤岛式 agent 工具正在失去存在的理由。

对每天陷在"检查—再指示"循环里的人来说,这件事的真实含义不是失业焦虑,而是岗位迁移:从流水线上的操作工,迁到终点的签字人。你的价值不再由处理了多少轮对话衡量,而由两件事衡量——你设计的结构能否让机器们互相咬合成一台可靠的机器,以及你在终点行使否决权时的判断力。这两个能力一个属于架构师,一个属于主编,唯独没有一个属于"打字更快的人"。

当然,硬币还有另一面。发起权的移交是有代价的:你对过程的可见性下降了,出错时归因变难了,而且"签字人"这个角色要求你比以往任何时候都更清楚什么是好的产出——否则你的验收不过是橡皮图章,整套制衡形同虚设。工具已经把笔递出去了,接下来要回答的问题反而是最古老的那个:一支不需要你挥动的笔,凭什么由你来决定写什么?这个问题机器不会替你作答,而它恰恰是未来几年里,人在这条食物链上剩下的最有价值的位置。

最后:资料展示
下面是我整理的AI大模型学习资料和工具包预览,适合收藏后按主题逐步学习

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐