来源:互联网 更新时间:2026-07-27 13:43
跳出技术视角,先明知识库本质:解析LLM Wiki与OKF在知识系统中的关键作用,重新定义知识转化的三层逻辑。
最近我一直在想一个问题:
做知识库时,我们很容易从技术开始讨论:文件怎么切分、Embedding 选什么、向量数据库用哪一个、召回率怎么样。
但再往前一步,会发现这个问题其实问早了。
如果我们还没有说清楚知识库到底要解决什么,就会把“上传了一批文件,并且可以向大模型提问”当成知识库建设已经完成。
更倾向于这样理解:
在这套系统里:
这三者不是互相替代的产品,而是在解决三个不同层次的问题。
一个 PDF、一份产品手册、一段会议录音,本身首先是资料。
当我们从资料中识别出产品名称、价格、生效时间和适用对象,它们变成了信息。只有当这些信息被放回具体业务语境,能够回答问题、支持判断,并且知道来源和适用边界时,才开始成为可使用的知识。
举一个简单的例子:
我们熟悉的 DIKW 模型,常用“数据—信息—知识—智慧”描述这种变化。
Russell Ackoff 在《From Data to Wisdom》中区分了数据、信息、知识、理解与智慧。Jennifer Rowley 后来梳理了不同文献中的 DIKW 表达,也指出各层之间如何转换并没有完全一致的定义。
所以不会把 DIKW 当成一条自动流水线。
定义是:
这里的关键词不是“存储”,而是“转化”和“持续维护”。
一条真正能够长期使用的知识,通常需要回答这些问题:
知识库因此保存的不只是内容,还包括内容之间的关系,以及使用这些内容的条件。
为了避免被具体工具带着走,把知识库的目标收敛成六个问题。
资料散落在网盘、聊天记录、邮件、Wiki、工单和人的脑子里。知识库首先要降低寻找答案的成本。
找到原文件不等于得到答案。系统需要把长文档、表格和记录,整理成围绕对象、问题与场景组织的知识。
答案需要能够回到原始来源。没有证据、没有负责人、没有确认状态的内容,只能算线索,不能直接当成结论。
价格、产品能力、制度和流程都会变化。知识库要知道什么已经失效,什么正在等待重新确认。
官网、合同、销售材料和员工笔记可能给出不同说法。系统不能静默选择一个看起来最像答案的文本,而应暴露冲突并进入确认流程。
一条已经确认的知识,不应该每次都从几十页资料里重新推导。它应该能够被搜索、问答、写作、客服或 Agent 反复调用。
这六点也给了我们一个判断标准:
RAG 是 Retrieval-Augmented Generation,即检索增强生成。
2020 年的原始论文将模型自身的参数化记忆与外部的非参数化记忆结合起来:系统先检索相关材料,再让生成模型基于这些材料作答。
这条路径很重要。它让大模型不必只依赖训练时记住的内容,也非常适合“从一批资料中找到相关内容并回答问题”。
传统的原始文档 RAG 通常是这样工作的:
但这套流程本身并不自动保证:
因此,更准确的说法不是“RAG 不是知识库”,而是:
2026 年,Andrej Karpathy 发布了一份名为 LLM Wiki 的 idea file,把它描述为一种“使用 LLM 构建个人知识库的模式”。它不是一个具体产品,也不是一套强制标准。
它对常规 RAG 的核心质疑是:如果每次提问都从原始资料重新检索和拼接,复杂的综合工作也会被一遍遍重做,知识本身并没有持续积累。
LLM Wiki 提出的做法,是在原始资料和查询之间增加一个持续维护的 Wiki 层:
这相当于把知识库从“查询时临时拼答案”,推进到“摄取时持续编译知识”。
不过,LLM Wiki 并没有宣布检索无用。Karpathy 在同一份说明中提到,小规模可以使用 index.md,规模扩大后仍可以增加全文、混合或向量搜索。
也就是说,RAG 不一定只能检索原始文档碎片,它也可以检索已经整理、关联和维护过的知识页面。
LLM Wiki 提供了一种模式,但不同团队做出来的 Wiki 仍可能拥有不同目录、字段和约定,很难在工具之间交换。
Google Cloud 在 2026 年 6 月发布了 Open Knowledge Format(OKF)v0.1 草案,把 LLM Wiki 模式进一步形式化为开放格式。
Google 对问题的判断很直接:
OKF 的最小形态并不复杂:
index.md 支持逐层发现内容;log.md 记录变化。它的价值不在于提供一个新的知识库界面,而在于让同一批知识可以被人阅读、被 Agent 解析、进入版本控制,也能从一个工具迁移到另一个工具。
但 OKF v0.1 是刻意保持最小化的交换规范。规范只强制每个概念拥有 type 字段,也明确不规定存储、服务和查询设施。
这意味着它解决了“知识怎么表示和交换”,但不会自动解决负责人、权限、确认状态、有效期和冲突审批。这些仍需要产品在 OKF 之上定义自己的治理字段与流程。
把 RAG、LLM Wiki 和 OKF 放回同一张图,更倾向于把知识库拆成五层:
| 层次 | 主要任务 | 典型能力 |
|---|---|---|
| 原始资料层 | 保存事实来源 | 文件、网页、数据库、录音、记录 |
| 知识编译层 | 从资料中形成可复用知识 | 抽取、归一、合并、关联、冲突发现、摘要更新 |
| 表示与交换层 | 让知识可读、可解析、可迁移 | Markdown、元数据、链接、OKF 或领域 Schema |
| 治理层 | 决定知识能否被相信和使用 | 来源、负责人、状态、版本、有效期、权限、审核 |
| 检索与应用层 | 在具体任务中使用知识 | 搜索、RAG、问答、写作、Agent 工具 |
在这张结构里:
所以“我们用了 RAG”“我们使用 Markdown”“我们兼容 OKF”,都不能单独证明已经建成了知识库。
讨论具体工具之前,可以先检查:
如果这些问题都没有回答,只是“文件上传成功、向量索引完成”,知识库仍然停留在资料接入阶段。
最后也要承认边界:知识库不能替一个组织决定它自己都没有决定的问题。
如果企业没有统一价格、没有明确政策边界、没有负责人愿意确认,系统最多只能把缺口与冲突暴露出来,不能凭空制造一个正确答案。
所以目前的结论不是“RAG 已经过时”,也不是“LLM Wiki 会取代 RAG”。
当这些层次被分开,我们才有可能讨论一个知识库产品到底缺了什么,而不是继续把“上传文件后可以问答”当成知识库的全部。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
免费网络收音机软件有哪些?高评分收音机APP推荐
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
电视剧《罗曼诺夫后裔》剧情介绍
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
夸克浏览器AI画质增强功能在旧款手机上无法开启怎么办?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc