Agent 到底有没有“大脑“?深度拆解五大 AI Agent 的记忆体系设计
Agent 到底有没有"大脑"?深度拆解五大 AI Agent 的记忆体系设计
从"Skill 是不是提示词"聊到"大模型是不是 Agent 的大脑",再到五大主流 Agent 工具的记忆体系横向对比——这是一篇关于 Agent 记忆架构 的深度思考总结。
引言
最近和一个资深 Java 开发者朋友深入聊了 AI Agent 的底层原理,从几个看似基础的问题出发,越挖越深:
- Skill 最终是不是就是一段提示词?
- 大模型是 Agent 的大脑吗?
- 为什么说记忆是决定 Agent 强弱的最关键要素?
- 主流 Agent 工具(OpenClaw / Claude Code / Codex / WorkBuddy / DeepSeek Harness)的记忆设计有什么区别?
这篇文章把这次对话的思考完整沉淀下来,希望能帮到正在研究 Agent 架构的同学。
也可以看看这篇文章《大脑 —— AI 引擎的工程化》
一、Skill 的本质:提示词?不止
从模型视角看:是的。
Skill 被激活时,它的 SKILL.md 内容(指令、步骤、示例)会作为文本注入到模型上下文里,模型"看到"的就是一段提示词。最终进入模型输入的都是 token,本质都是提示词。
从系统视角看:不止提示词。 Skill 其实是三层结构:
| 层级 | 内容 | 本质 |
|---|---|---|
| 指令层 | SKILL.md 正文(怎么想、怎么做) | 提示词 |
| 工具层 | 脚本、API 调用 | 真实代码执行 |
| 触发层 | 匹配机制(何时激活) | 调度逻辑 |
结论:Skill = 提示词(教模型怎么做)+ 工具(真正去执行)+ 触发逻辑(什么时候生效)。
提示词解决"怎么做",工具解决"做不了的事"。如果只有提示词,模型只能"说"不能"做";加上工具,才能闭环。
二、大模型不是 Agent 的大脑
一个关键认知:大模型是无状态的(stateless)。每次调用就是一次独立的前向传播,第二次对话和第一次没有任何"记忆"区别——它连自己上一句说过什么都不知道。
所以"模型本身是大脑"这个说法并不准确。更准确的拆解:
| 部件 | 类比 | 作用 |
|---|---|---|
| 模型权重 | 先天智力/推理能力 | 会思考、会推理,但失忆 |
| 上下文窗口 | 工作记忆 | 这次对话能"看见"的东西 |
| 上下文管理系统(历史维护、记忆文件、检索) | 长期记忆 + 记忆调度 | 让 Agent 记得、有身份、有连续性 |
核心洞察:大模型是"思考的器官",上下文管理系统是"记忆的器官",合起来才是大脑。
Agent 的"我"不在模型里,而在模型外的上下文里。
活生生的例子:同一个模型,配合不同的上下文系统(SOUL.md、MEMORY.md、AGENTS.md 等文件),可以是"小只"也可以是"另一个助手"。模型提供能力,上下文提供身份。
一句话升级:
模型提供能力,上下文提供身份。Agent 的"大脑" = 推理能力 + 记忆系统 + 调度循环,缺一不可。
三、记忆:Agent 强弱的分水岭
推理、记忆、调度循环三者中,记忆是最难的,也是 Agent 强弱最关键的要素。为什么难?因为记忆不是"存下来"这一个动作,而是一条完整链路:
1. 写入难(记什么)
上下文有限,什么值得记、什么该丢?记多了是噪音,记少了是失忆。这需要判断力,而判断力本身要消耗推理。
2. 检索难(想起来)
记了不等于能用。几十万字的历史,怎么在需要的那一刻把最相关的捞出来?检索错了,记忆反而有害——想起一件错误的事比想不起来更糟。
3. 遗忘/压缩难(装不下)
上下文窗口是物理瓶颈。要像人脑睡眠一样做"记忆整理":把一天的琐事提炼成一句结论,把过时的信息淘汰掉。压缩必然有损,有损就可能失真。
4. 冲突处理难(记忆会变)
旧记忆和新事实矛盾时信哪个?用户搬家了、换工作了,记忆系统要能识别并更新,而不是永远停留在第一次见面。
为什么记忆是分水岭:
- 推理是军备竞赛——大家都在用最强的模型,差异被抹平,花钱就能买到
- 调度/工具是工程问题——会写代码就能做
- 记忆是唯一"越用越值钱"的部分——它决定 Agent 是否懂你、是否有连续性、能否从经验中变强
模型能力决定 Agent 的下限,记忆系统决定 Agent 的上限。
四、记忆会无限膨胀:四层防线
记忆系统最核心的矛盾:无限增长 = 记忆系统必死。所以答案不是"装更多",而是"主动管理"。
以 OpenClaw 的真实数据为例(我的实测):
- 长期记忆 MEMORY.md:15 行
- 每日笔记 memory/ 目录:68K,9 个文件
68K 的原始日记只蒸馏出 15 行精华——说明机制在工作。具体靠四层防线:
防线 1:入口过滤(蒸馏)
日记 ≠ 长期记忆。每日笔记是 raw 记录,进长期记忆前要过"这件事值得记一年吗?"的筛选。大部分日记永远留在日记里。这是第一道也是最狠的压缩。
防线 2:定期淘汰(遗忘)
定期整理时主动移除过时信息。遗忘和记住同样重要——记了一堆过期信息,比不记更糟。
防线 3:按需检索(不靠全量加载)
长期记忆膨胀到几万行也没关系——因为不需要每次全读。用语义索引(memory_search)按需捞相关片段,存储和读取解耦,容量压力就小了。
防线 4:拆分/归档(终极手段)
按主题拆文件,长期记忆只留索引;更老的内容归档。类似图书馆——常读的书放前台,旧书进书库,书库满了就封存。
对应人脑:工作记忆(上下文)→ 情景记忆(日记)→ 语义记忆(长期记忆)→ 遗忘(淘汰归档)
记忆系统的智慧不在于"存得住",而在于"舍得忘"。存是本能,忘是设计。
五、主流 Agent 记忆设计横向对比
5.1 OpenClaw —— 分层 + 语义检索 + 主动维护
- 载体:多文件分层(MEMORY.md 长期 / 每日笔记 / SOUL.md 身份 / USER.md 用户画像)
- 写入:系统维护 + 用户可编辑,定期主动做"记忆整理"
- 检索:语义搜索,按需捞,不全量读
- 范围:通用助理,跨任务跨项目,还包含"人格记忆"
- 特点:最接近"人脑三层记忆"模型,成本是维护机制复杂
5.2 Claude Code —— 单文件 + 模型自主写入
- 载体:CLAUDE.md(项目级 + 用户级),会话内是完整 transcript 直接进上下文
- 写入:模型自己判断"这个值得记",主动写进 CLAUDE.md(auto-memory)
- 检索:启动时全量加载 + 按需引用文件,没有语义搜索
- 特点:面向编程,记忆 = 项目约定 + 用户偏好;很少主动整理淘汰,靠 /compact 压缩会话
5.3 Codex(OpenAI)—— 标准制定者
- 载体:AGENTS.md(OpenAI 定义的规范,被全行业采纳)+ 本地记忆库(
codex m,按主题分文件) - 写入:模型自动维护,有专门的 memory 命令体系
- 特点:赢在"定义了标准格式",让记忆文件可以在不同工具间迁移
5.4 WorkBuddy(腾讯)—— 任务中心制
- 载体:任务级对话历史 + 产物文件 + 工作目录
- 特点:记忆锁在单个任务里(对话 + 产物 + @引用上下文),任务结束记忆基本归档,下一个任务不会自动记得你——跨任务长期记忆目前是短板
5.5 DeepSeek Harness(dsh)—— 一切皆插件
- 载体:Event-sourced 会话日志(append-only SessionEvent,模型历史从日志派生)
- 特点:没有特权核心,连 agent 循环、模型适配器都是插件;有官方 compaction 记忆压缩机制
对比总表:
| 工具 | 谁写记忆 | 怎么捞 | 谁整理 | 记忆范围 |
|---|---|---|---|---|
| OpenClaw | 系统+用户 | 语义检索 | 主动定期 | 用户级(全局) |
| Claude Code | 模型自主 | 全量加载 | 基本不整理 | 项目级 |
| Codex | 模型自主 | 全量+命令检索 | 自动追加 | 项目级+用户级 |
| WorkBuddy | 任务自动记录 | 任务列表+@引用 | 无跨任务整理 | 任务级 |
| DeepSeek Harness | 事件日志派生 | 日志回放 | compaction 内建 | 会话级(可扩展) |
六、记忆作用域:工具定位的本质
记忆作用域(memory scope)才是底层分类标准:
| 作用域 | 代表 | 身份边界 |
|---|---|---|
| 会话级 | 所有工具 | 这一次对话 |
| 项目级 | Claude Code / Codex AGENTS.md | 这个工程的专家 |
| 用户级(全局) | OpenClaw / codex m | 你的助理 |
| 组织级 | 未来趋势 | 团队共享记忆 |
Claude Code 全量加载其实是优点,不是妥协。 项目级记忆通常就几百行,全量加载成本极低,换来的是确定性——不会像检索那样漏掉关键约定,也不会 A 项目的东西串到 B 项目。"换工程从头开始"是特性不是缺陷:上下文干净,不串味。
OpenClaw 全局记忆的代价是检索精度。 记得多就要捞得准,捞错一条记忆比没有记忆更糟。全局记忆系统拼的是"该想起的时候想得起,不该想起的时候不打扰"。
七、组合拳:OpenClaw 当大脑,Claude Code 当手
对"开发 + 业务"双身份的人来说,正确姿势不是二选一,而是组合:
OpenClaw 当大脑(全局记忆 + 调度),Claude Code / Codex 当手(项目执行)
技术上完全可行——OpenClaw 的 exec 可以直接调用 Claude Code / codex 的 CLI。写个 skill,遇到代码任务就调 claude -p "..." 或 codex exec 去项目里干活,干完结果回到 OpenClaw 的全局记忆里沉淀:
- ✅ 业务上下文(OpenClaw 记得你是谁、项目背景、历史决策)
- ✅ 工程执行(Claude Code 在项目里精确操作)
- ✅ 换项目不串味(每个工程还是干净的 CLAUDE.md)
八、DeepSeek Harness 深度评估(2026.8 最新)
DeepSeek Harness(dsh)是 DeepSeek AI 于 2026 年 8 月 13 日开源 的智能体运行时框架(MIT 协议,Node.js),核心口号 “Everything is a Plugin”(一切皆插件),由 Cordis 驱动(Koishi 同门框架,其设计论文为《A Programming Paradigm for Spatiotemporal Composability》)。
它真正厉害的三点:
1. 没有特权核心
OpenClaw 的 agent 循环、记忆注入、渠道路由是框架内置的,只能在外围扩展。dsh 连模型适配器、工具注册表、会话日志、agent 循环本身都是插件——任何一个都能从配置里整体换掉。这种可定制深度是同类框架里最激进的。
2. Event-sourced 记忆
Session 是 append-only 的事件日志(turn/start、tool/call、assistant/chunk……),模型看到的历史从日志派生,不单独存储。"模型可见即已记录"是运行时强制的不变式。好处:一切可回放、可 fork、可审计、崩溃可恢复。且有官方 compaction seam(记忆压缩事件),记忆管理是内建一等公民。
3. Seam 机制
文件系统、沙箱、子进程、终端、子代理全是可替换的 seam。把 fs provider 指向远程沙箱,Bash/PTY/LSP 全部跟着迁移,零分支代码。
但要加一个时间维度:
| 维度 | OpenClaw | dsh |
|---|---|---|
| 架构上限 | 高(外围扩展) | 更高(无特权核心) |
| 当前成熟度 | 生产可用 | 开发者预览,明确警告 breaking changes |
| 渠道接入 | 开箱即用(飞书/Discord/WhatsApp) | 只有 Web UI + headless,渠道要自己写 |
| 长期记忆 | 现成(分层 + 语义检索) | 会话级记忆极强,跨会话长期记忆靠插件实现 |
| 生态 | 成熟 | 刚起步 |
结论:OpenClaw 是现在就能打的战斗机,dsh 是设计图纸更先进的原型机。
上限高 ≠ 现在强。dsh 的上限要等插件生态长出来才兑现。但 DeepSeek 自己下场做运行时,这个信号本身就说明 Agent 基建的战争已经打响了。
九、总结
- Skill = 提示词 + 工具 + 触发逻辑,模型最终消费的都是文本,但 Skill 的价值在于让文本能调用真实工具
- 大模型是"思考的器官",上下文管理系统是"记忆的器官",合起来才是 Agent 的大脑
- 记忆是最难的:写入、检索、遗忘、冲突处理,每一环都是挑战
- 记忆系统靠"舍得忘"生存:蒸馏、淘汰、按需检索、归档,四层防线缺一不可
- 记忆作用域决定工具定位:项目级(Claude Code)适合开发,用户级(OpenClaw)适合业务
- 对开发+业务双身份的人:OpenClaw 当大脑 + Claude Code 当手,组合拳最优
- DeepSeek Harness 是架构理念最激进的后来者,值得持续关注
对程序员来说,Agent 的上限 = 框架的开放性 × 记忆的连续性。
参考资料
- DeepSeek Harness(GitHub):https://github.com/deepseek-ai/deepseek-harness
- Cordis 框架:https://github.com/cordiverse/cordis
- Cordis 设计论文《A Programming Paradigm for Spatiotemporal Composability》:https://github.com/cordiverse/paper
- Tencent WorkBuddy 官方文档:https://www.workbuddy.ai/docs/zh/workbuddy/Overview
- OpenClaw:https://github.com/openclaw/openclaw
葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。
更多推荐

所有评论(0)