来源:互联网 更新时间:2026-07-27 14:21
说起用 OpenClaw 打造私人知识库这事儿,挺有意思。很多人都在讨论“让 AI 成为私人助手”,但真正落地的时候,才发现没那么简单。
这篇文章会聊三个核心问题:为什么靠聊天记录远远不够?怎么从零开始构建一个 10 万字的个人知识库?以及,这个东西在实际场景中到底能干什么。
先扔几个核心判断:单纯靠聊天记录沉淀出来的“记忆”,精度非常有限。AI 主动记住的内容,经常是它以为重要但你其实不 care 的东西。想要真正懂你,还得自己出手。

最近 OpenClaw 的热度很高,大家嘴里常挂着一句话:“它是我的私人助手。”甚至有人整了个开源项目,把前同事的聊天记录导进去,生成对应的 Skill。
但这里有个关键问题:聊天记录和文档能还原的信息精度,着实有限。对于真正意义上的私人助理,需要很多独有的信息——而这恰恰是 AI 靠“猜”搞不定的。
从 2025 年开始,我就在持续构建个人信息知识库,到现在已经攒了超过 10 万字,还在不断迭代。不管是预测未来,还是复盘过去,这东西的帮助都非常大。这篇文章,就把过程中的实践和一些经验分享出来。

起初,Gemini、Claude 和 GPT 都陆续上线了长期记忆功能。当时不少自媒体在“闭眼吹”,说 AI 会用得越久越聪明。但实际体验下来,AI 沉淀记忆的方式存在几个致命的盲区:
这些关键信息,AI 根本没法通过聊天自己“悟”出来。少了这些,它给出的建议自然隔靴搔痒,更别说做出准确的预测。
更重要的一点是:没有形成闭环。比如说,AI 给你出了一份材料,列了 10 个要点,你最后只采纳了 2 个。你不会特意回去告诉 AI 你选择了啥,那 AI 记住的内容就很可能是乱猜的结果——严重不完整,甚至可能是错的。
这就导致了一个尴尬的局面:所谓的长期记忆帮助不大,甚至会过度拟合某些信息。比如你是程序员,它就老拿写代码来举例,反而偏离了你的真实需求。

既然 AI 自己搞不定,那就自己动手。最开始,简单粗暴——用 Markdown 格式写到同一个文件里,不同内容用不同标题分开。当然,姓名、学校这类关键信息做了脱敏处理。
当时长文档检索主流还是 RAG 方式。长文本会被拆成很多小块,很容易在提取时遗漏。比如,“我的大学阶段”写了十几个段落,你问一句“大学有什么经历”,它可能只匹配到第一个段落。
所以构造数据时,每一段都得重复说明这是“我的大学阶段”,面向检索去写。同时也要面向实际使用场景来构建数据。比如你可能问某段时间获过什么奖、做了什么事,那证书或主要事件上就都得加上时间。

选一个长知识库检索做得好的平台(比如 Gemini),就可以开始各种提问了。

有了这些个人信息,能干的事就多了:

为了让信息更通用,能在 OpenClaw、Cursor 以及任何支持 Skill 的工具中方便调用,决定把它改造成 Skill。

有了之前的个人资料,让 AI 根据目录结构拆分成多个独立的 Markdown 文件。单个文件如果太长(比如超过 500 行),就拆成文件夹,里面再分多个子文件。制作 Skill 时,在 SKILLS.md 文件里构建对应的目录,这能让 AI 实现更好的渐进式加载。

为了让单个文件检索更高效,在较长的文件顶部加上目录,方便 AI 快速定位和查找。

以前的信息大多需要手动添加到不同文档,效率实在不高。后来开始用一些工具辅助录入:闪电说、智谱 AI 语音输入法,最近改用了 Typeless,配合麦克风,录入效率提升不少。

随着越来越多的人开始使用 OpenClaw 和 AI 对话,OpenClaw 本身会生成每日记忆归档,并会不定时整理成长记忆。但问题是,每日对话的内容中,很多只是临时性的,并不适合回流到永久记忆中。而且,AI 自己觉得该回流的,往往也不是我们真正想要的。

所以,在 OpenClaw 里启动定时任务,每天整理前一天的内容,筛选出适合回流到 Skill 的部分。让 AI 先出个计划,确认后再回流进去。

有了 OpenClaw 之后,反而不太愿意主动打开个人信息 Skill 来手动修改了——太麻烦。于是搞了一个回流的 Skill:当提到要回流个人信息时,它会自动识别目录,给出计划。确认后再回流进去。

辛辛苦苦整理的记忆如果丢失,那损失可就大了。好在这些内容本质上都是 Skill,可以这样操作:
这样一来,就算被 AI 改坏了,恢复特定版本也是小菜一碟。换个电脑恢复关键 Skill 也非常方便。

还有一点值得注意:如果你看过 AI 相关的论文,会知道 AI 有迎合用户判断的倾向。在你的私人助手里,它很容易对你形成误导,让你做出误判。所以,在用 OpenClaw 时,我会修改它的 SOUL.md 文件,调整性格特点。目的是让它不总是迎合,而是能有相对独立的思考。同时,很多 AI 回答还带有明显的“AI 味”——大量破折号、机械的句式。调整它的表达,让它更像真人。在回答个人信息相关问题时,必须要求它根据 Skill 提取相关信息后再回答。

坦率说,现在整体还是用隐私换效率,你得有“就算全部泄露也无所谓”的心态。不过,也没必要把所有隐私都暴露出去:创建私有仓库,对姓名、学校等关键信息做脱敏,特别隐私的数据就别写进去了。另外,可以根据不同场景,把常用场景独立成单独的 Skill。比如写材料缺乏逻辑,就专门建一个“材料审核”的 Skill,只做逻辑性检查,没必要让 AI 了解私有信息。尽量用正规厂商,避免不知名的中转站。未来本地模型能力足够可用后,隐私数据可以优先用本地模型处理,或者先本地脱敏再发给大模型。
这个问题很关键。你需要什么样的数据,取决于你用它来做什么事。换句话说,做那件事所需的信息是否完整、准确,这比数据有多少更重要。数据永远没有“全”的时候,能做的只有:把可能用到的关键数据提前准备好,在使用过程中不断补充、优化和调整。
一个有趣的检验方法:让它判断你是十六型人格中的哪一种。如果 AI 的判断结果和你真正做题得出的答案一致,说明刻画得非常准确;如果有较大出入,说明数据可能不完整或有偏差。
缺点的价值其实比优点更大。我们用 AI,就是希望它能帮我们规避缺点,并针对这些缺点做增强。只有让 AI 了解真实的你,它才能给出有实质帮助的建议。有了这些缺点,甚至可以和 AI 一起探讨,针对性地打造对应的 Skills,让它更好地帮你完成任务。
每天工作和生活都录音,必要性不大。不仅要考虑硬件条件(工作场景是否适合录音、设备电量能不能撑住),更关键的是:数据多不代表质量高。每天产生的大量信息其实都是重复性的、低密度的,价值有限。当然,如果是参加重要的 AI 大会,录音确实有意义。但真正有用的数据,还是靠自己的观察和积累沉淀下来更实在。

可以预见,未来知识的沉淀会走向自动化,能突破 AI 眼镜这种便携设备在电池等方面的限制。不管是个人记忆还是知识库,一定会走向多模态——不仅能沉淀文本,还能感知语气变化,看懂人的表情。随着模型能力不断增强,AI 一定会走向个性化,满足每个人的独特需求。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
免费网络收音机软件有哪些?高评分收音机APP推荐
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
电视剧《罗曼诺夫后裔》剧情介绍
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
夸克浏览器AI画质增强功能在旧款手机上无法开启怎么办?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc