来源:互联网 更新时间:2026-07-27 14:16
企业中 80% 的数据都藏在 Excel 表格里。但做过 RAG 的朋友都知道,让大模型真正“读懂”这些表格,远比处理 PDF 或 Word 文档要棘手。今天,就基于 LlamaIndex 0.14.19 的源码,把 Excel 索引建立的三种方案拆开揉碎了讲清楚。

企业 80% 的数据藏在 Excel 里。如何让大模型真正"读懂"这些表格数据?本文基于 LlamaIndex 0.14.19 源码,拆解 Excel 索引建立的完整机制。
做 RAG 的时候,PDF、Word 这些文档本质上是一段段连续的文字,切分起来相对自然。但 Excel 完全不同——它是结构化的二维表格。如果只是简单地把所有单元格的值拼成一段文字,AI 就会丢失“哪个值属于哪一列”这个关键信息。
LlamaIndex 的解法非常巧妙:把列名(也就是表头)和每个单元格的值绑定在一起,让每一行数据都自带语义上下文。这样一来,AI 就能准确理解“张三是工程师”而不是把“张三”和“设计师”搞混。
这是 LlamaIndex 内置的默认处理方式。当你用 SimpleDirectoryReader 加载一个目录时,框架会自动识别 .xls 或 .xlsx 文件,并调用 PandasExcelReader 来处理。
它的工作原理可以一句话概括:Excel → pandas 读取 → 每行转成“列名: 值”的文本 → 封装成 Document。
举个例子,有一张这样的表:
| 姓名 | 职位 | 部门 |
|---|---|---|
| 张三 | 工程师 | 技术部 |
| 李四 | 设计师 | 设计部 |
经过处理后,会变成这样的文本:
姓名: 张三, 职位: 工程师, 部门: 技术部
姓名: 李四, 职位: 设计师, 部门: 设计部
每一行数据都带上了列名,语义清晰。最简用法也极其简单:
from llama_index.core import SimpleDirectoryReader, VectorStoreIndex
# 把 Excel 文件放到 data 目录下,一行代码搞定
documents = SimpleDirectoryReader("./data").load_data()
index = VectorStoreIndex.from_documents(documents)
# 开始提问
query_engine = index.as_query_engine()
response = query_engine.query("技术部有哪些人?")
如果表格很大或者需要更精细的控制,可以通过参数调整:
from llama_index.readers.file import PandasExcelReader
reader = PandasExcelReader(
concat_rows=False, # 每行生成一个独立 Document(适合大表格)
sheet_name=0, # 只读第一个 Sheet(默认读所有 Sheet)
pandas_config={ # 传给 pandas 的参数
"usecols": "A:D", # 只读 A~D 列
"nrows": 1000, # 只读前 1000 行
}
)
documents = SimpleDirectoryReader(
"./data",
file_extractor={".xlsx": reader, ".xls": reader}
).load_data()
关于 concat_rows 的选择,经验是:表格小于 100 行,用 True 保持完整上下文;超过 1000 行,用 False 让每行独立成 Document,检索更精准;如果每行语义独立,比如 FAQ 列表,用 False;如果行间关联紧密,比如财务报表,用 True。
默认方案把所有列都塞进正文。但很多时候,你可能只想检索部分列的内容,其他列作为辅助信息或过滤条件。StructuredDataReader 就是为了这个场景设计的——你可以指定哪些列进正文、哪些列进 metadata。
假设有一张销售数据表:
| 订单号 | 客户名称 | 产品 | 金额 | 日期 |
|---|---|---|---|---|
| ORD001 | 王五 | 笔记本电脑 | 8999 | 2024-01-15 |
如果把所有列都放进正文做向量检索,“订单号”和“日期”这类字段会引入噪音。更好的做法是:正文只用“客户名称”和“产品”用于向量匹配,而“订单号”“金额”“日期”作为 metadata,可以用过滤器做精确筛选。
用法示例:
from llama_index.readers.structured_data import StructuredDataReader
from llama_index.core import SimpleDirectoryReader
reader = StructuredDataReader(
col_index=["客户名称", "产品"], # 这些列的内容进入正文
col_metadata=["订单号", "金额", "日期"] # 这些列作为 metadata
)
documents = SimpleDirectoryReader(
"./data",
file_extractor={".xlsx": reader}
).load_data()
生成的 Document 中,text 字段是“王五, 笔记本电脑”,metadata 字段包含订单号、金额和日期。向量检索只匹配客户和产品,而日期、金额等字段可以通过 metadata filter 做精确过滤,大大提升检索效率。
安装时别忘了:
pip install llama-index-readers-structured-data
如果文件格式多样,不只有 Excel,还有 PDF、Word、PPT 混在一起,可以考虑 UnstructuredReader。它基于 Unstructured.io 库,支持数十种文件格式。
from llama_index.readers.file import UnstructuredReader
reader = UnstructuredReader()
documents = reader.load_data(file=Path("data.xlsx"))
不过,它需要额外安装 unstructured 库,体积较大。对于纯 Excel 场景,前两种方案更轻量高效。
读完 Excel 只是第一步。从文件到可查询的索引,完整链路如下:
? Excel 文件
↓ Reader 读取
? Document (text + metadata)
↓ NodeParser 分块
? TextNode[]
↓ Embedding 模型向量化
? 向量
↓ 写入 VectorStore
?️ 索引建立完成 → 可查询
| 场景 | 推荐方案 |
|---|---|
| 快速验证、表格不大 | PandasExcelReader(默认) |
| 需要精确控制哪些列参与检索 | StructuredDataReader |
| 多种文件混合处理 | UnstructuredReader |
| 超大表格(10万行+) | 建议预处理后再导入 |
有几个容易忽略的细节需要特别留意:
PandasExcelReader 底层依赖 openpyxl,没装会直接报错:
pip install openpyxl
所有行合并成一个 Document,文本可能达到几十万字符,后续分块和向量化都会出问题。大表格请设 concat_rows=False。
Excel 中的合并单元格,pandas 只会在左上角单元格保留值,其余位置读出来是空值。LlamaIndex 会把空值替换为空字符串,但语义上可能不完整。建议在导入前先取消合并单元格。
默认会读取所有 Sheet。如果你的 Excel 里有很多辅助性的 Sheet(比如“说明”“模板”),建议指定 sheet_name 参数,只读取目标 Sheet,避免噪音。
Excel 在企业中无处不在,让 AI 能高效检索表格数据,是 RAG 落地中绕不过的关键一步。LlamaIndex 的设计思路很清晰:把结构化数据转换为带语义上下文的自然语言文本,然后复用整个 RAG 管线。三种方案覆盖了从“开箱即用”到“精细控制”的不同需求。
建议从默认的 PandasExcelReader 开始尝试,如果发现检索效果不理想、噪音太多,再切换到 StructuredDataReader 做精细化控制。
本文分析基于 LlamaIndex v0.14.19 源码。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
免费网络收音机软件有哪些?高评分收音机APP推荐
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
电视剧《罗曼诺夫后裔》剧情介绍
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
夸克浏览器AI画质增强功能在旧款手机上无法开启怎么办?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc