来源:互联网 更新时间:2026-08-26 14:26
企业想用好LLM,高质量数据是绕不开的前提。相比传统机器学习模型,LLM对数据的需求量更大、要求也更高,尤其是那些占企业数据总量80%的非结构化数据。问题在于,传统的ETL工具压根不擅长处理这类数据——文本、PDF、幻灯片、邮件、聊天记录……于是,数据科学家们不得不把大量时间耗在数据准备环节,不仅拖慢了LLM部署的节奏,也让人力投入的ROI变得很难看。
Unstructured.io的CEO Brian Raymond敏锐地捕捉到了这个痛点,一心一意帮企业解决非结构化数据的处理难题。简单来说,Unstructured做的事情就是在数据摄入(data ingestion)环节,把非结构化数据提取出来,分割成更小的逻辑单元,同时生成元素级的元数据,最后将处理好的数据以JSON格式返回给用户。
另一个不可忽视的优势在于,团队深刻理解大企业和政府机构的真实需求——CEO的政府背景带来了充足的资源支持。Unstructured.io已经拿下了不少大客户订单,并且跟美国空军、太空部队等政府部门建立了合作。
当然,非结构化数据处理这个赛道还处在起步阶段,Unstructured.io要面对云厂商、上下游公司以及其他初创公司的竞争。往后看,Multi-step agents和多模态技术的应用可能会打开新的机会窗口。我们在硅谷了解到,未来几个月模型推理能力会进一步提升,multi-step agent可能逐步落地,我们也期待非结构化数据领域能解锁更多的商业价值。
01 Unstructured.io 的市场机会
02 什么是 Unstructured.io
03 市场竞争
04 结论与猜想
企业正在大规模采用LLM。麦肯锡的调研显示,2023年是AI在企业端渗透率增长最快的一年——从55%飙升到72%,整整提高了17个百分点。如果把范围缩小到生成式AI,增速更惊人:一年内从33%涨到65%,翻了一番。摩根士丹利2024年第二季度的CIO调查也预测,2025年企业级GenAI的采用率还会继续攀升。
Source: The state of AI in early 2024: GenAI adoption spikes and starts to generate value, May 30, 2024 | Survey, McKinsey & Company
把LLM用好的前提,是为它喂高质量的数据。企业的数据分为结构化数据和非结构化数据——后者占了80%。但在LLM出现之前,企业ETL主要处理的是结构化数据。原因很简单:传统ETL工具没法从非结构化数据中提取足够特征,而且传统机器学习模型受智能水平限制,对数据精确度的要求比LLM更高,所以非结构化数据一直没被好好利用起来。
LLM与传统机器学习模型相比,有两点本质区别:
•
使用 Unstructured 对大模型进行 finetune
•
所以LLM(尤其是RAG)的广泛应用,大大增加了企业数据处理的工作量。Unstructured.io的调研显示,数据科学家要把超过3/4的工作时间花在数据准备上,人力成本极高。说白了,就算LLM对精确度要求降低了,想把RAG做好也绝非易事——“the devil is in the details.” Unstructured.io的优势就在于,通过大量细致的工程化工作,把这些细节处理得妥妥当当。
What is RAG
RAG的工作流大致是:数据提取及处理(data ingestion and preprocessing)→ 索引创建(index creation)→ 检索(retrieval)→ 回答生成(answer generation)。
在data ingestion环节,需要把数据提取出来,分割成更小的逻辑单元(称为“元素”),生成元素级元数据,再转化成JSON等结构化格式。这一步做得够不够精细,直接影响后续数据清理、分块、生成块摘要以及embedding的效果。这是难点,也是Unstructured的看家本领。传统清理数据的方式,得写大量正则表达式、自定义Python脚本去识别页眉页脚、重复模板等不需要的内容,而Unstructured能做到每个文档元素都有明确的分类标签或元数据标记——数据科学家可以直接利用这些元数据快速锁定需要的内容。
Unstructured Chunking 方式和传统 Character Splitting 的不同
Unstructured.io是前美国中央情报局分析师Brian Raymond于2022年7月创立的。创立之前,Brian和创始团队都在NLP领域的公司工作,他们发现了一个共同的困境:客户因为无法处理非结构化格式的数据,始终没法好好应用AI模型。
于是,Unstructured.io成立后首先发布了开源的非结构化数据提取工具,把企业的非结构化数据从“牢笼”里解放出来。同时,Raymond的政府背景相当深厚——Unstructured.io得到了美国空军、美国特种作战司令部的支持,靠与大企业和美国政府合作来打磨商业化版本的产品。
前面已经提到过,
企业里非结构化数据处理以PDF为主,是因为大多数数据最终都会被转化成PDF格式存储——文章、纪要、财务报表等等。而从PDF中提取数据一直是数据科学家很头疼的事:表格被锁住、格式混乱、内容无法访问……问题层出不穷。
不过,为了获取更大的市场,Unstructured.io也搭建了端到端的企业级平台,支持整个工作流。
Unstructured.io从开源起步,产品形态不断丰富。目前的产品包括SaaS、Serverless和Marketplace API,以及企业级平台,满足了不同客户的需求。
• 数据提取器:从各种格式文档中提取内容,如PDF、Word等。
• 文档分割器:把文档内容细化为更小的逻辑单元,便于进一步分析。
• 数据转换器:将提取和分割后的数据转换成标准化格式(以JSON为主),供下游应用和模型使用。
开源Python库适合产品原型开发,目前只做基础维护工作,
• SaaS API(今年1月推出):由Unstructured托管,用户只需调用API,无需管理底层基础设施。目前已有超过1000个付费用户,
它适合拥有
• 支持从10个数据源提取文档内容(如Azure Blob Storage、S3、Google Drive等)。
• 标准化输出传送到10个目标数据源(如Pinecone、Wea viate、S3、Postgres等)。
• 通过workflow连接源和目标,支持运行和调度工作流。
• 监控工作流状态。
Unstructured的产品还处于早期,未来有大量功能值得开发。产品规划已经涵盖了很多方向:集成更多源和目标连接器、增加音频和图像处理、支持用户自定义embedding模型、集成Azure AI Document Intelligence和AWS Textract、增加数据存储和向量同步能力,推出新一代表格和表单提取模型等等。
根据产品分析和客户访谈,Unstructured.io最突出的优势有以下几点:
企业反馈Unstructured大大提升了非结构化数据的处理效率。处理多个不同类型文件时,
这背后是
分类细致的最大好处是方便做下一步的cleaning,可以采用混合搜索和基于metadata过滤的方式实现更精确的内容控制(比如只处理正文,图像和文本分开处理),还可以按语义分块。
Unstructured.io的开源代码库包含25多个源连接器和10个目标连接器,尽量覆盖用户的所有使用场景。比如与LangChain、LlamaIndex等集成,进一步方便了GenAI应用的开发。Unstructured还把这些打包进了商业版企业平台——一个无代码界面的仪表板,可以直接创建和管理RAG工作流。
尽管有开源版本,Unstructured.io在付费客户获取上做得相当不错。2024年3月完成B轮融资时,1月份推出的商业版SaaS API就已经有超过1000个付费客户,其中包含不少大型企业和政府订单。
商业版本准确性更强、覆盖文件类型更多,也提供企业级部署支持,Unstructured从开源到商业化的路径相对顺畅,预计未来收入会持续提升。
不过客户普遍认为Unstructured面临来自大型云厂商、上下游公司以及其他创业公司的潜在竞争。
Unstructured.io的创始人兼CEO Brian Raymond早期是政客出身——曾在美国中央情报局(CIA)担任情报官员,后来在白宫负责伊拉克和ISIS的外交政策。在ISIS于伊拉克和叙利亚迅速崛起期间,他与奥巴马总统和拜登副总统紧密合作。
之后,他加入初创公司Primary AI,为公共部门和国家安全领域提供NLP解决方案。Brian深入研究如何基于Transformer构建知识图谱和企业工作流,并意识到数据预处理在AI/ML项目中、尤其是在处理复杂的政府内部文件时极其重要。这促使他创立了Unstructured.io,专门为企业和政府简化数据准备过程。
Unstructured.io的团队由来自开源社区、大型企业和美国国防情报机构的技术专家组成。推出商业化产品后,Brian组建了销售团队。目前,团队在技术、市场和客户服务领域实力强劲,有能力承接大型企业和政府机构的需求。
Unstructured.io累计获得6500万美元投资,投资方包括AI生态上层公司LangChain和Databricks——可以看出它在Gen-AI生态系统中的重要性已经得到认可。
非结构化数据的提取是数据处理工作流中的一个环节,如果市场机会足够大,工作流里的玩家都有动力也有机会延伸进来。根据客户访谈分析,Unstructured.io主要面临来自大型云厂商、上下游公司及其他初创公司的潜在竞争。
客户访谈显示,Amazon、Azure等云厂商也在尝试开发非结构化数据处理工具,但由于这个领域技术较新,大厂动作慢,至今还没拿出能匹敌Unstructured的产品。
云厂商的优势很明显:
客户访谈提到,许多向量数据库公司也在开发自己的非结构化数据处理API,比如Milvus、Chroma、Pinecone。如果向量数据库发布类似产品,用户就能在同一平台内完成从数据预处理到存储、检索的全流程。不过这些公司尚未完全发布产品,具体能力还有待观察。
这些初创公司专注在不同领域,如LlamaIndex、Hammerspace提供相对综合性的数据处理工具,Clarifai专注图像和视频处理。
其中LlamaIndex的非结构化数据提取工具LlamaParse与Unstructured.io直接竞争。LlamaIndex的端到端开源生态对Unstructured.io构成一定挑战。我们在Unstructured.io的Slack中观察到,很多用户有集成LlamaIndex的需求,而LlamaParse在准确性上也达到了类似Unstructured.io的水平。这也进一步佐证:非结构化数据ingestion可能并不具备明显的技术壁垒,更多是工程优化问题。
两家公司未来可能会获取不同的客户群——
非结构化数据处理未来有很多潜在变化可能,我们会持续关注:
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
5000元起的鼠标哪个最值得入手?
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
WorkBuddy积分怎么获得?
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc