来源:互联网 更新时间:2026-08-12 17:11
周末一大早,数据圈又炸了:OpenAI收购了实时数据分析公司Rockset。虽然具体的收购金额没公布,但这家成立8年的公司可不是等闲之辈——完成了6轮融资,在2023年的B+轮融资中,估值已经落在了1到5亿美元的区间。OpenAI的COO对Rockset能把客户数据转化为“可执行的智能”(actionable intelligence)的能力赞赏有加,并明确表示要把Rockset整合进OpenAI的产品线。而Rockset这边,也官宣了逐步关闭自有云服务的计划。消息一出,北美那些跟Rockset抢饭碗的竞品们,几乎是条件反射般地开始了瓜分用户的行动。

时间拨回2016年,Rockset呱呱坠地,当时的产品定位非常明确:要做实时云原生分析数据库(Real-time cloud-native analytic database)。它的创始团队来头不小:联合创始人兼CEO Venkat Venkataramani,曾领导Facebook的数据库基础设施团队;另一位联合创始人兼CTO Dhruba Borthakur,曾是Facebook Hadoop分布式文件系统(HDFS)项目的技术负责人,也是RocksDB的创始工程师。下面这张图,左边是我珍藏的2020年Rockset白皮书的定位,右边是他们网站现在的竞品分析列表。


老实说,Rockset在分析数据库里绝对是个异数。它几乎是唯一一个把行存当作主存储的分析数据库:底层用RocksDB-Cloud做存储,天然实现了存算分离,然后靠着Converged Index来提升分析性能。但问题在于,行存加上索引这种模式,写放大效应非常严重,一旦数据量上去,分析性能就很难看了。所以,它真正的战场更像是一个HTAP场景——从上游实时同步TP和NoSQL的数据,然后在内部进行实时分析。
Rockset支持一系列内置的Connector来实现外部数据的实时同步,主要包括 MongoDB、Kafka、S3、DynamoDB、Kinesis、GCS等。可以看到,除了所有实时数仓都会支持的消息队列和对象存储,Rockset还特意照顾了MongoDB和DynamoDB这两个数据源。同时,它还提供了一套近似MongoDB的JSON操作接口,走的是REST API风格。后来,Rockset也补充了从TP数据库同步数据的能力,但这需要依赖一个中间的Kinesis——用户得先用AWS DMS把MySQL的binlog同步到Kinesis,然后Rockset才能消费。这个路径还是有点绕,跟后来Redshift推出的Zero ETL一比,劣势就非常明显了。
因为是闭源产品,关于Converged Index的公开资料并不多,但从官方博客中,我们还是能拼凑出它的核心公式:

八年下来,Rockset的客户名单里其实没出现过什么有名头的大企业,倒是积累了一批数据量中等规模的中小公司。卡在中等规模陷阱里的Rockset,特色并不突出:前面有Snowflake、Databricks这样的巨头,已经把实时能力(Dynamic table、Delta live table)做得非常完善了;后面有DuckDB这样极致小巧的嵌入式分析引擎虎视眈眈;而在实时分析这个赛道里,ClickHouse、Druid、Pinot、StarRocks这些已经在各大厂站稳脚跟的开源产品更是一个比一个强。Rockset的日子,着实不好过。
到了2023年,随着LLM的到来,AI 2.0的元年正式开启。向量数据库突然作为“大模型的记忆体”火了起来,RAG应用在2024年也开始真正落地。Rockset自然也没有闲着,顺势在自己的产品里新增了一个向量索引(vector index),其核心特色如下:


看到这里,你可能会说:这也没什么嘛,现在很多向量库不都有这些功能吗?为什么OpenAI偏偏选了Rockset?关于这个问题,确实没有任何信源,只能做个推测:可能价格合适,加上人比较靠谱。毕竟Rockset的人都是专业的数据库老手,在AP市场打拼了这么多年,也需要找到一条出路。跟那些去年才创业做向量数据库的初创公司相比,他们对向量数据库的未来可能抱有更美好的幻想。事实上,给数据库加上向量功能,门槛并没有想象中那么高——向量本质上就是一个float数组,把几个典型的相似度算法实现出来,再把Faiss、USearch等向量索引库封装进来做一些优化,最基础的向量能力就有了。从Elasticsearch、Redis、PostgreSQL,到Snowflake、Databricks,都在走这条路。当然,新一代的向量数据库在GPU加速、multi-vector、更多索引算法支持方面,还是有不少差异化的。但长期来看,这些差异化是否足以让客户独立维护一套专用的向量数据库,还是存疑的——毕竟,要把传统数据库里的Geo function、文档全文倒排索引都实现好,也需要时间。Rockset就是个例子,它甚至都不处理那么大规模的数据。而就目前看到的,大部分真实的向量用户,数据规模还是在百万到千万的量级。他们可能有一定的高并发、实时和低延迟要求,用来服务线上业务,这个区间刚好也是Rockset的舒适区。
公开信息显示,Rockset只有100人左右(下图是LinkedIn上有记录的71个人的职责分布),确实船小好调头。整个产品定位配合之前的Converged Index,转型看起来顺理成章。

基于网络上的信息以及跟朋友们的讨论,这里给出三个猜测方向。
“OpenAI is also rumored to be working on a search engine, so the acquisition of a company that enables real-time data retrieval could point to ChatGPT becoming a formidable competitor to Google Search”
消息出来后,很快就有爆料说,OpenAI考虑做AI搜索引擎来跟Google竞争,而收购Rockset正是为了增强这个方向的可行性。传统搜索还是以关键字为核心,向量搜索则能帮助召回更多语义相似的结果,而LLM的总结能力可以大大提升答案的可解释性,问答式的交互方式也有可能碘伏传统搜索的入口地位。不过,说实话这个说法并不太看好。原因有三:一是AI搜索引擎赛道已经过于拥挤,Perplexity这样的头部玩家已经吸走了不少资源和流量;二是传统搜索引擎真的难以在短期内被碘伏,一个很重要的原因是AI搜索的成本仍然居高不下;三是用户的搜索习惯,依然是关键字驱动的,而非问答式。
OpenAI COO, Brad Lightcap, explains how Rockset will fit in at OpenAI: “Rockset’s infrastructure empowers companies to transform their data into actionable intelligence. We’re excited to bring these benefits to our customers by integrating Rockset’s foundation into OpenAI products.”
这段话摘自Rockset发布收购消息的博客。目前OpenAI的ARR是34亿美元,根据估计,付费用户有390万。按照20美元/月的Plus会员计算,大概有7到9亿美元的营收来自个人订阅,其余收入主要来自企业版或开发者API调用。也就是说,当前OpenAI的核心营收还是来自B端或者个人开发者。用过OpenAI SDK的朋友都知道,Assistants API是中间的一个重要功能,本质上就是RAG的高层封装。不过大家普遍觉得,它相比向量数据库还是少了一些灵活性,而且价格略贵。基于Rockset来构建一个更灵活、更便宜的Assistants API,不失为一种可能性。Hybrid search的理念,也能很好地适配企业级混合文本搜索和语义搜索的灵活需求。ChatGPT Enterprise当前除了隐私保护之外,并没有太多独有特性,都能卖这么多钱——如果补上完整的Hybrid search能力,对增强企业版客户转化应该会有帮助。

今年2月,ChatGPT给Plus会员客户发布了一个Memory功能,你可以在个人设置里打开它(Settings > Personalization > Memory)。打开以后,ChatGPT跟你的对话会考虑你之前的聊天记录,并搜索相关信息后再给出答复。这个Memory功能,大概率是跟向量搜索相关的。更早的时候,Sam Altman也给媒体表达过,想把ChatGPT做成一个超级个人助理的野心。这一切都离不开给每个用户创建一个小型知识库。从向量数据库的角度看,这其实就是典型的“标量过滤 + 语义搜索”场景:在一张很大的用户聊天记录表中,先按用户ID做过滤,再进行相似搜索,最后把结果一起作为上下文喂给大模型。

更关键的是,这个Memory功能可以提供给GPTs使用。也就是说,GPTs里的机器人可以记住你跟你之间的聊天记录了——这样一来,像Character AI这样的应用,就更容易在GPTs上实现了。
无论OpenAI收购Rockset的最终目的是什么,有一个明确且已经被验证的事实是:OpenAI已经招聘了大量来自互联网大厂的Data Infra人员。虽然LLM重构了AI生态,让整个体系脱离了之前的ML和Data Infra模式,但AI终究离不开Data。新时代的AI+Data Infra,仍在探索之中。Let's seek.
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
5000元起的鼠标哪个最值得入手?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
管线机怎么接云米净水器
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
笔记本移动电源推荐哪款?
腾讯ima知识库怎么分类管理?
海尔消毒柜自动消毒如何中止
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc