热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >不要将你的 RAG 知识库限制在文本上

不要将你的 RAG 知识库限制在文本上

来源:互联网 更新时间:2026-08-27 14:19

构建知识库的时候,有个老问题一直很头疼:几乎所有内容都得先转成纯文本。尤其是碰到幻灯片、PDF或者各种图片素材,光靠文字提取,能做的事情非常有限。 那么,怎么才能把非纯文本的数据也充分利用起来,不让它们白白浪费? 得益于近两年AI的快速迭代,这件事变得比以往任何时候都简单,成本也更低了。用上具备视觉能力的大语言模型(LLMs),就能批量转录成百上千张图片——不只是把字抠出来,还能理解内容之间的关系。如果有些场景需要,这些模型甚至可以直接描述图片中的视觉对象,比传统的OCR方案丰富得多,也详细得多。 整个流程可以拆成三个步骤: 1. **收集数据**:整理好你打算处理的图片,确保它们结构清晰,单张图像里的信息不要太密集。 2. **上传数据**:设置一个 AWS S3 存储桶,把图片托管上去,确保云端AI模型能正常访问。 3. **转录数据**:配置 OpenAI API(或者其它LLM API),让它来执行实际的图片转录工作。 这三个组件搭好之后,接下来的重点就是怎么把整个过程跑成**自动化**——让几百张图片的转录工作,在几分钟内搞定。

收集数据

第一步很直观:把要用的图片都收拢到一起。 图片来源可以是照片、幻灯片截图、PDF页面,都行。但有一个原则需要留意——尽量不要塞太多信息到一张图片里。无论来源是什么,过于密集的信息布局都会给LLM造成负担,也更容易出现遗漏或理解错误。 虽然自动化脚本主要是处理常见的图片格式,比如 .png、.jpg 和 .jpeg,但稍加调整,也能兼容其它文件类型。

上传数据

因为要用 GPT-4o 这种云端大模型来做转录(换成其它模型也可以),所以得先把所有图片上传到一个服务器上。 最省力的办法之一就是用 AWS S3 存储桶——相比 Imgur 这类平台,它几乎没有存储上限。 其实选择哪个服务商并不关键,核心就一条:图片链接必须是可公开访问的。否则,云端的LLM根本拿不到文件。

如何创建一个 Amazon S3 存储桶

**步骤 1:登录 AWS 管理控制台** 1. 打开 AWS 管理控制台。 2. 输入你的 AWS 凭证登录。 3. 在搜索框输入“S3”,从服务列表里选中 **S3**。 **步骤 2:创建一个新存储桶** 1. 点击 **创建存储桶** 按钮。 1. 输入一个唯一的 **存储桶名称**——这个名称必须在全球范围内唯一,同时符合 AWS 命名规范。 2. 取消勾选“**阻止所有公共访问**”复选框。 1. 点击页面底部的 **创建存储桶**。 **步骤 4:配置存储桶允许公共访问** 1. 进入新存储桶的 **权限** 标签。 2. 点击 **存储桶策略**,粘贴下面的 JSON 配置,用于允许公开读取: ``` { "Version": "2012-10-17", "Statement": [ { "Sid": "PublicReadGetObject", "Effect": "Allow", "Principal": "*", "Action": "s3:GetObject", "Resource": "arn:aws:s3:::{enter_bucket_name}/*" } ] } ``` 重要:记得把 `{enter_bucket_name}` 替换成你自己的存储桶名字。 存储桶设置好之后,它在后续的转录流程中会扮演关键角色——等所有环节串起来的时候,就清楚了。

转录数据

这里以 OpenAI 的 GPT-4o 作为示例。 前提是完成下面几个小步骤:

步骤 1:创建 OpenAI 账户

1. 打开 OpenAI 的 API 密钥页面。 2. 点击 **注册** 创建新账户。已有账户则直接登录。

第2步:获取API访问权限并获取API密钥

1. 按照说明申请API访问权限,可能需要填写一些账单信息。 2. 账户设置通过后,回到API密钥页面。 3. 点击 **创建API密钥** 生成一个新的密钥,妥善保存,后面会用到。 有了API密钥,后面就可以用它来批量处理图片了。 注意:如果刚注册完账户,可能暂时无法使用 GPT-4o 这类模型。可以选 GPT-4o Mini,或者通过 Azure 的接口来调用 OpenAI 的模型。

自动化过程

前面那些配置完成后,就进入了最有趣的部分——省下几百个小时的重复劳动,同时让知识库的内容丰富度提升一个量级。 在处理脚本的过程中,优化了好几个版本才达到稳定,现在可以直接拿来用,省掉大量试错时间。 整套脚本、提示模板和示例 `.env` 文件都在 GitHub 仓库里公开,完全免费: ``` https://github.com/MarcosSan4/ImageKB/tree/main ```

设置你的环境

运行脚本前,把两件事做好: 1. 在 `.env` 文件中设置好 **环境变量**(GitHub仓库里有示例文件参考)。 2. 安装 **依赖包**(列在 `requirements.txt` 中)。

图像转录 — 核心功能

脚本的主干逻辑围绕三个环节展开: 1. **上传图像到 S3**:脚本会遍历指定 `folder_path` 下的所有文件夹,把每张图片上传到 AWS S3,并确保设置为公开可访问。 2. **用 GPT-4o 转录图像**:图片上传完成后,脚本会把图片的公开 URL 连同预设的提示一起发送给 GPT-4o 模型,让它返回详细的转录内容。 3. **存储转录结果**:每次返回的转录内容会被追加到对应图片所在文件夹的 `transcriptions.txt` 文件中。不同子文件夹的转录结果会各自保存,并用分隔符隔开,方便后续查看。

杂项功能

除了核心的图像处理流程,脚本还附带了一些实用功能,让整体方案更完整: 1. **总结与向量化**:转录内容收集完成后,脚本可以对其做总结,提炼出核心概念,并生成新的向量,确保知识覆盖最大化。这些向量在接入知识库时是基础环节。 2. **文件夹递归处理**:脚本会自动处理指定目录下的所有子文件夹,每张图片都不会落下,适合管理大型数据集。 3. **更新转录文件名**:通过更新文件名来记录每个转录文件包含的向量数量,方便追踪进度。 4. **合并转录文件**:可以把一个文件夹内的所有转录合并成一个文件,也可以选择把所有子文件夹的转录合并到根目录下的单一文件。 5. **向量数量统计**:统计每个主文件夹中生成的向量数,快速掌握数据量级,同时验证完整性。 6. **上传向量到Qdrant**:最后,脚本可以把所有向量写入 Qdrant 向量数据库。当然,改几行代码就能切换到其它数据库服务。

最后的想法

在“知识就是力量”的时代,别让数据被困在纯文本的框框里。借助AI的能力,把图片无缝转录并整合到知识库中,把几小时的手工劳作用自动化流程来替代。 不管手头是几十张图片,还是成百上千张,这套方法都能显著提升数据的价值和可用性。 回顾一下,关键步骤并不复杂: 1. **收集数据**:整理好图片。 2. **上传数据**:放到云存储里。 3. **转录数据**:交给AI生成详细描述。 4. **组织与向量化**:确保知识库全面、高效、可用。 那么… 开工吧!
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc