从"Skill 是不是提示词"聊到"大模型是不是 Agent 的大脑",再到五大主流 Agent 工具的记忆体系横向对比——这是一篇关于 Agent 记忆架构 的深度思考总结。

引言

最近和一个资深 Java 开发者朋友深入聊了 AI Agent 的底层原理,从几个看似基础的问题出发,越挖越深:

  • Skill 最终是不是就是一段提示词?
  • 大模型是 Agent 的大脑吗?
  • 为什么说记忆是决定 Agent 强弱的最关键要素?
  • 主流 Agent 工具(OpenClaw / Claude Code / Codex / WorkBuddy / DeepSeek Harness)的记忆设计有什么区别?

这篇文章把这次对话的思考完整沉淀下来,希望能帮到正在研究 Agent 架构的同学。
也可以看看这篇文章《大脑 —— AI 引擎的工程化


一、Skill 的本质:提示词?不止

从模型视角看:是的。
Skill 被激活时,它的 SKILL.md 内容(指令、步骤、示例)会作为文本注入到模型上下文里,模型"看到"的就是一段提示词。最终进入模型输入的都是 token,本质都是提示词。

从系统视角看:不止提示词。 Skill 其实是三层结构:

层级 内容 本质
指令层 SKILL.md 正文(怎么想、怎么做) 提示词
工具层 脚本、API 调用 真实代码执行
触发层 匹配机制(何时激活) 调度逻辑

结论:Skill = 提示词(教模型怎么做)+ 工具(真正去执行)+ 触发逻辑(什么时候生效)。
提示词解决"怎么做",工具解决"做不了的事"。如果只有提示词,模型只能"说"不能"做";加上工具,才能闭环。


二、大模型不是 Agent 的大脑

一个关键认知:大模型是无状态的(stateless)。每次调用就是一次独立的前向传播,第二次对话和第一次没有任何"记忆"区别——它连自己上一句说过什么都不知道。

所以"模型本身是大脑"这个说法并不准确。更准确的拆解:

部件 类比 作用
模型权重 先天智力/推理能力 会思考、会推理,但失忆
上下文窗口 工作记忆 这次对话能"看见"的东西
上下文管理系统(历史维护、记忆文件、检索) 长期记忆 + 记忆调度 让 Agent 记得、有身份、有连续性

核心洞察:大模型是"思考的器官",上下文管理系统是"记忆的器官",合起来才是大脑。
Agent 的"我"不在模型里,而在模型外的上下文里。

活生生的例子:同一个模型,配合不同的上下文系统(SOUL.md、MEMORY.md、AGENTS.md 等文件),可以是"小只"也可以是"另一个助手"。模型提供能力,上下文提供身份。

一句话升级:

模型提供能力,上下文提供身份。Agent 的"大脑" = 推理能力 + 记忆系统 + 调度循环,缺一不可。


三、记忆:Agent 强弱的分水岭

推理、记忆、调度循环三者中,记忆是最难的,也是 Agent 强弱最关键的要素。为什么难?因为记忆不是"存下来"这一个动作,而是一条完整链路:

1. 写入难(记什么)
上下文有限,什么值得记、什么该丢?记多了是噪音,记少了是失忆。这需要判断力,而判断力本身要消耗推理。

2. 检索难(想起来)
记了不等于能用。几十万字的历史,怎么在需要的那一刻把最相关的捞出来?检索错了,记忆反而有害——想起一件错误的事比想不起来更糟。

3. 遗忘/压缩难(装不下)
上下文窗口是物理瓶颈。要像人脑睡眠一样做"记忆整理":把一天的琐事提炼成一句结论,把过时的信息淘汰掉。压缩必然有损,有损就可能失真。

4. 冲突处理难(记忆会变)
旧记忆和新事实矛盾时信哪个?用户搬家了、换工作了,记忆系统要能识别并更新,而不是永远停留在第一次见面。

为什么记忆是分水岭:

  • 推理是军备竞赛——大家都在用最强的模型,差异被抹平,花钱就能买到
  • 调度/工具是工程问题——会写代码就能做
  • 记忆是唯一"越用越值钱"的部分——它决定 Agent 是否懂你、是否有连续性、能否从经验中变强

模型能力决定 Agent 的下限,记忆系统决定 Agent 的上限。


四、记忆会无限膨胀:四层防线

记忆系统最核心的矛盾:无限增长 = 记忆系统必死。所以答案不是"装更多",而是"主动管理"。

以 OpenClaw 的真实数据为例(我的实测):

  • 长期记忆 MEMORY.md:15 行
  • 每日笔记 memory/ 目录:68K,9 个文件

68K 的原始日记只蒸馏出 15 行精华——说明机制在工作。具体靠四层防线:

防线 1:入口过滤(蒸馏)
日记 ≠ 长期记忆。每日笔记是 raw 记录,进长期记忆前要过"这件事值得记一年吗?"的筛选。大部分日记永远留在日记里。这是第一道也是最狠的压缩。

防线 2:定期淘汰(遗忘)
定期整理时主动移除过时信息。遗忘和记住同样重要——记了一堆过期信息,比不记更糟。

防线 3:按需检索(不靠全量加载)
长期记忆膨胀到几万行也没关系——因为不需要每次全读。用语义索引(memory_search)按需捞相关片段,存储和读取解耦,容量压力就小了。

防线 4:拆分/归档(终极手段)
按主题拆文件,长期记忆只留索引;更老的内容归档。类似图书馆——常读的书放前台,旧书进书库,书库满了就封存。

对应人脑:工作记忆(上下文)→ 情景记忆(日记)→ 语义记忆(长期记忆)→ 遗忘(淘汰归档)

记忆系统的智慧不在于"存得住",而在于"舍得忘"。存是本能,忘是设计。


五、主流 Agent 记忆设计横向对比

5.1 OpenClaw —— 分层 + 语义检索 + 主动维护

  • 载体:多文件分层(MEMORY.md 长期 / 每日笔记 / SOUL.md 身份 / USER.md 用户画像)
  • 写入:系统维护 + 用户可编辑,定期主动做"记忆整理"
  • 检索:语义搜索,按需捞,不全量读
  • 范围:通用助理,跨任务跨项目,还包含"人格记忆"
  • 特点:最接近"人脑三层记忆"模型,成本是维护机制复杂

5.2 Claude Code —— 单文件 + 模型自主写入

  • 载体:CLAUDE.md(项目级 + 用户级),会话内是完整 transcript 直接进上下文
  • 写入:模型自己判断"这个值得记",主动写进 CLAUDE.md(auto-memory)
  • 检索:启动时全量加载 + 按需引用文件,没有语义搜索
  • 特点:面向编程,记忆 = 项目约定 + 用户偏好;很少主动整理淘汰,靠 /compact 压缩会话

5.3 Codex(OpenAI)—— 标准制定者

  • 载体:AGENTS.md(OpenAI 定义的规范,被全行业采纳)+ 本地记忆库(codex m,按主题分文件)
  • 写入:模型自动维护,有专门的 memory 命令体系
  • 特点:赢在"定义了标准格式",让记忆文件可以在不同工具间迁移

5.4 WorkBuddy(腾讯)—— 任务中心制

  • 载体:任务级对话历史 + 产物文件 + 工作目录
  • 特点:记忆锁在单个任务里(对话 + 产物 + @引用上下文),任务结束记忆基本归档,下一个任务不会自动记得你——跨任务长期记忆目前是短板

5.5 DeepSeek Harness(dsh)—— 一切皆插件

  • 载体:Event-sourced 会话日志(append-only SessionEvent,模型历史从日志派生)
  • 特点:没有特权核心,连 agent 循环、模型适配器都是插件;有官方 compaction 记忆压缩机制

对比总表:

工具 谁写记忆 怎么捞 谁整理 记忆范围
OpenClaw 系统+用户 语义检索 主动定期 用户级(全局)
Claude Code 模型自主 全量加载 基本不整理 项目级
Codex 模型自主 全量+命令检索 自动追加 项目级+用户级
WorkBuddy 任务自动记录 任务列表+@引用 无跨任务整理 任务级
DeepSeek Harness 事件日志派生 日志回放 compaction 内建 会话级(可扩展)

六、记忆作用域:工具定位的本质

记忆作用域(memory scope)才是底层分类标准:

作用域 代表 身份边界
会话级 所有工具 这一次对话
项目级 Claude Code / Codex AGENTS.md 这个工程的专家
用户级(全局) OpenClaw / codex m 你的助理
组织级 未来趋势 团队共享记忆

Claude Code 全量加载其实是优点,不是妥协。 项目级记忆通常就几百行,全量加载成本极低,换来的是确定性——不会像检索那样漏掉关键约定,也不会 A 项目的东西串到 B 项目。"换工程从头开始"是特性不是缺陷:上下文干净,不串味。

OpenClaw 全局记忆的代价是检索精度。 记得多就要捞得准,捞错一条记忆比没有记忆更糟。全局记忆系统拼的是"该想起的时候想得起,不该想起的时候不打扰"。


七、组合拳:OpenClaw 当大脑,Claude Code 当手

对"开发 + 业务"双身份的人来说,正确姿势不是二选一,而是组合:

OpenClaw 当大脑(全局记忆 + 调度),Claude Code / Codex 当手(项目执行)

技术上完全可行——OpenClaw 的 exec 可以直接调用 Claude Code / codex 的 CLI。写个 skill,遇到代码任务就调 claude -p "..."codex exec 去项目里干活,干完结果回到 OpenClaw 的全局记忆里沉淀:

  • ✅ 业务上下文(OpenClaw 记得你是谁、项目背景、历史决策)
  • ✅ 工程执行(Claude Code 在项目里精确操作)
  • ✅ 换项目不串味(每个工程还是干净的 CLAUDE.md)

八、DeepSeek Harness 深度评估(2026.8 最新)

DeepSeek Harness(dsh)是 DeepSeek AI 于 2026 年 8 月 13 日开源 的智能体运行时框架(MIT 协议,Node.js),核心口号 “Everything is a Plugin”(一切皆插件),由 Cordis 驱动(Koishi 同门框架,其设计论文为《A Programming Paradigm for Spatiotemporal Composability》)。

它真正厉害的三点:

1. 没有特权核心
OpenClaw 的 agent 循环、记忆注入、渠道路由是框架内置的,只能在外围扩展。dsh 连模型适配器、工具注册表、会话日志、agent 循环本身都是插件——任何一个都能从配置里整体换掉。这种可定制深度是同类框架里最激进的。

2. Event-sourced 记忆
Session 是 append-only 的事件日志(turn/start、tool/call、assistant/chunk……),模型看到的历史从日志派生,不单独存储。"模型可见即已记录"是运行时强制的不变式。好处:一切可回放、可 fork、可审计、崩溃可恢复。且有官方 compaction seam(记忆压缩事件),记忆管理是内建一等公民。

3. Seam 机制
文件系统、沙箱、子进程、终端、子代理全是可替换的 seam。把 fs provider 指向远程沙箱,Bash/PTY/LSP 全部跟着迁移,零分支代码。

但要加一个时间维度:

维度 OpenClaw dsh
架构上限 高(外围扩展) 更高(无特权核心)
当前成熟度 生产可用 开发者预览,明确警告 breaking changes
渠道接入 开箱即用(飞书/Discord/WhatsApp) 只有 Web UI + headless,渠道要自己写
长期记忆 现成(分层 + 语义检索) 会话级记忆极强,跨会话长期记忆靠插件实现
生态 成熟 刚起步

结论:OpenClaw 是现在就能打的战斗机,dsh 是设计图纸更先进的原型机。
上限高 ≠ 现在强。dsh 的上限要等插件生态长出来才兑现。但 DeepSeek 自己下场做运行时,这个信号本身就说明 Agent 基建的战争已经打响了。


九、总结

  1. Skill = 提示词 + 工具 + 触发逻辑,模型最终消费的都是文本,但 Skill 的价值在于让文本能调用真实工具
  2. 大模型是"思考的器官",上下文管理系统是"记忆的器官",合起来才是 Agent 的大脑
  3. 记忆是最难的:写入、检索、遗忘、冲突处理,每一环都是挑战
  4. 记忆系统靠"舍得忘"生存:蒸馏、淘汰、按需检索、归档,四层防线缺一不可
  5. 记忆作用域决定工具定位:项目级(Claude Code)适合开发,用户级(OpenClaw)适合业务
  6. 对开发+业务双身份的人:OpenClaw 当大脑 + Claude Code 当手,组合拳最优
  7. DeepSeek Harness 是架构理念最激进的后来者,值得持续关注

对程序员来说,Agent 的上限 = 框架的开放性 × 记忆的连续性。


参考资料

  • DeepSeek Harness(GitHub):https://github.com/deepseek-ai/deepseek-harness
  • Cordis 框架:https://github.com/cordiverse/cordis
  • Cordis 设计论文《A Programming Paradigm for Spatiotemporal Composability》:https://github.com/cordiverse/paper
  • Tencent WorkBuddy 官方文档:https://www.workbuddy.ai/docs/zh/workbuddy/Overview
  • OpenClaw:https://github.com/openclaw/openclaw

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐