我是 Codex 爱好者,但是最近我把 100 刀的 Pro 降回 Plus 了
核心原因:最近刷榜的 GLM5.2、Kimi K3、Qwen-3.8-Max 好像都挺能打。所以我又把 Hermes 捞回来了(它的客户端我蛮喜欢的)
但是 Codex 的记忆系统与 Hermes 设计哲学差异巨大:Codex 认为记忆是机器生成的副产品(人别碰),Hermes 认为记忆是agent 的主动资产(只有两个极小容量的文件,MEMORY.md(agent 笔记)上限2,200 字符;USER.md(用户画像)上限1,375 字符),我还是习惯有强大的记忆系统,最好可以 AI 自进化,给 Hermes 加个强大的外挂
我找到了一个开源的记忆托管平台 MemOS,可以让 AI 应用及 Agent 获得长期记忆

MemOS 官方把自己定位成”记忆操作系统”,它提供了一个记忆面板挺直观的。看了官方文档,也安装试了一下,完美解决我的问题,也推荐给大家,本文后面我再详细介绍完整安装过程

现在的 Agent 很强,但你和它一起工作的时间,并没有真正沉淀下来
今天告诉它项目放在哪里、资料应该怎么整理、哪些来源可以使用、最后保存成什么格式。换一个新会话,它可能又要重新熟悉一遍。
上次踩过的坑、被纠正过的错误、已经验证有效的工作方法,也未必能迁移到下一次任务
各家 Agent 都有自己的记忆管理手段,但是对记忆的理解、设计、风格完全不一样:
产品 | Memory 更接近什么 | 主要载体 | 谁负责写入 | 如何使用 |
|---|---|---|---|---|
Claude Code | 项目经验和工作规则 | Markdown 文件 | 用户 + Claude | 会话开始时加载 |
OpenAI ChatGPT | 用户画像和跨聊天个性化 | 平台内部记忆状态 | 用户 + ChatGPT 后台系统 | 动态合成相关上下文 |
OpenClaw | 可审计的 Agent 知识库 | MEMORY.md、每日笔记、索引 | Agent + 用户 + dreaming | 启动注入 + 按需检索 |
Hermes Agent | 有容量限制的 Agent 自主管理记忆 | MEMORY.md、USER.md+ 外部 Provider | Agent 自己 | 启动快照 + 每轮预取 |
这也是为什么最近 AI Memory 管理赛道越来越热闹,每家都说自己领先,但你信哪个?
市面上很多评测,问题是各家跑分的评测条件完全不一样,不同的 prompt、不同的 judge 模型、不同的数据集版本,甚至连”得分”的定义都不统一,就像大模型刚出来那会儿各种榜单乱飞一样
MemOS 最近开源了 OmniMemEval 评测框架,把 14 款主流 Memory 产品拉到同一条流水线上跑,统一 benchmark、统一模型配置、统一 prompt、统一 judge——而且 MemOS 自己的成绩确实打得很漂亮
OmniMemEval 做的事情很简单:让所有人穿同样的鞋、跑同样的赛道、用同一个裁判计时
先看 User Memory 赛道,也就是面向个人用户的长期记忆能力,这对应的是 MemOS 云服务产品
OmniMemEval 把 14 款商业化 Memory 产品拉到一起,在五大评测集上统一跑分:

据官方最新数据,MemOS 云服务最新版本已进一步提升到 LoCoMo 92.34、LongMemEval 93.40,达到行业 SOTA 水平
真正有意思的是 Context Tokens——这代表每次回答时注入给模型的上下文 token 数:

MemOS 不是靠”塞更多上下文”来提高分数的,它的记忆检索效率明显更高——用更少的 token 达到更好的效果——这在生产环境下意味着:更低的调用成本、更快的响应速度、更少的模型幻觉风险
这说明 MemOS 在记忆抽取、检索路由和上下文组织上做了比较深的优化,不是简单粗暴地把所有相关记忆全塞进去
再看 Agent Memory 赛道——这是我更关心的方向——当 AI Agent 需要执行真实任务(写代码、搜索信息、做数学推理)时,长期记忆到底能帮多少忙?
这部分对应的产品是 MemOS Local Plugin 2.0,安装在 OpenClaw 或 Hermes 上,让 Agent 具备本地长期记忆能力
评测使用了 AgentBench 的五大任务域:
任务 | 能力维度 |
|---|---|
BrowseComp-Plus | 信息检索 |
OmniMath | 数学推理 |
SWE-Bench | 软件工程 |
LiveCodeBench | 代码实现 |
GDPVal | 知识工作 |
OpenClaw 评测结果:

MemOS 在五项中拿下四项第一(BrowseComp-Plus、OmniMath、SWE-Bench、GDPVal),平均任务完成率从 36.63% 提升到 50.87%——这不是微调 prompt 能带来的提升,是记忆系统带来的结构性能力增强
Hermes 评测结果同样亮眼:
方法 | OmniMath | SWE-Bench |
|---|---|---|
Baseline | 62.00 | 37.18 |
Mem0 | 64.33 | 34.62 |
Hindsight | 64.00 | 28.20 |
| MemOS | 72.67 | 52.56 |
Hermes 上的 SWE-Bench 从 37.18% 飙到 52.56%,提升幅度超过 15 个百分点——这意味着 Agent 修 bug 的能力因为有了长期记忆而显著变强了
MemOS 有几个形态,我用的是本地插件

安装过程:
curl -fsSL https://raw. githubusercontent. com/MemTensor/MemOS/main/apps/memos-local-plugin/install.sh | bash
一键脚本会自动检测已安装的 OpenClaw 和 Hermes,部署插件到对应的 ~/.hermes/plugins/目录,生成config.yaml并启动 Viewer

Viewer 面板:
安装完成后,Hermes 的 Viewer 默认运行在 http://127.0.0.1:18800,可以查看所有记忆层级

然后在配置中,可以导入 Hermes 原生记忆

然后就可以在工作区查看了

我强烈建议开启【记忆自进化】功能,它可以在基础摘要记忆之外,自动沉淀任务、经验、环境认知和技能

这个功能需要配置大模型能力,我配置的是 Qwen3.8-max-preview

MemOS 还有团队共享记忆功能,不过我还没有尝试

MemOS 让我比较有感的地方,除了把分散的记忆集中到一个面板里,它还会让记忆继续往上生长:一次次任务形成记录,反复验证的做法沉淀为经验,对项目和环境的理解逐渐形成认知,成熟后甚至可以结晶成技能
我把 Codex 很多任务都放到 Hermes 执行了,比如我最近正在测试 GLM5.2、Kimi K3、Qwen-3.8-Max 这三个模型各方面能力,慢慢滴记忆面板中有了很多关于我项目开发和内容创作方面的很多经验了

还有 Hermes 对工作环境的感知

还有自动沉淀的技能,有些我自己都没想到可以做成 Skills

我现在还没有把 MemOS 的所有功能都用透,但至少就目前的体验来说,它已经很好地解决了我的实际问题,也是我用过比较完整、比较有成长感的一套 Agent 记忆方案。
如果你也是 OpenClaw、Hermes 的重度用户,我还是挺建议亲自装起来体验几天,很多价值,不是安装完成、问几个问题就能立刻看到的。等你真正带着它做过一些项目,让任务、经验和技能一点点沉淀下来,才会逐渐感受到它确实开始越来越懂你了
本文由作者【Ai学习的老章】,微信公众号:【Ai学习的老章】,原创/授权 发布于平台,未经许可,禁止转载。
更新时间:2026-07-25
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号