2026 年 8 月,Databricks 宣布完成 50 亿美元战略融资,估值达到 1900 亿美元。
这个数字已经足够惊人,但比估值更值得关注的是它的增长速度:Databricks 的年化收入运行率已经超过 70 亿美元,同比增长超过 80%,并保持正向调整后自由现金流。
如果只看表面,Databricks 很容易被理解成又一家受益于 AI 热潮的超级独角兽。
但它真正有意思的地方,是过去十多年里一直在沿着同一条主线扩张:
从大数据计算,走向数据平台,再走向企业 AI 基础设施。
它今天想做的,已经不只是“帮企业分析数据”,而是成为未来 AI Agent 运行所依赖的数据底座。
一、Databricks 从哪里来?
Databricks 出生于 UC Berkeley 的 AMPLab 实验室。
它最早的核心技术,就是后来大名鼎鼎的 Apache Spark。
在 Hadoop 时代,大数据处理高度依赖 MapReduce,很多计算任务需要频繁读写磁盘,效率并不高。
Spark 的突破在于:
通过内存计算,大幅提升大规模数据处理效率。
2013 年,包括 Ali Ghodsi、Matei Zaharia、Reynold Xin、Ion Stoica 等 Spark 核心成员创立了 Databricks。
这也奠定了公司长期以来的产品哲学:
先通过开源项目建立技术影响力,再围绕企业级需求构建商业平台。
Spark 只是第一步。
二、真正改变命运的是 Lakehouse
Spark 很成功,但它本身是开源的。
Databricks 必须回答一个问题:
如果 Spark 免费,客户为什么要付钱给 Databricks?
答案最终变成了 Lakehouse。
过去企业的数据架构通常分成两类:
一类是 Data Warehouse,性能好、治理成熟,但昂贵,而且不适合承载大量非结构化数据。
另一类是 Data Lake,成本低、扩展性强,但数据质量、事务能力和治理能力较弱。
Databricks 提出的 Lakehouse,核心思路非常简单:
把 Data Lake 的低成本和开放性,与 Data Warehouse 的可靠性和性能结合起来。
这成为它后续十年最重要的战略基础。
三、技术底座到底是什么?
理解 Databricks,可以把它拆成几个关键技术层。
1. Delta Lake:让数据湖拥有数据库能力
普通数据湖的问题是,数据虽然便宜地存下来了,但缺乏事务、版本控制和一致性。
Delta Lake 在 Parquet 文件之上增加事务日志,从而提供 ACID 事务、版本回滚、数据一致性等能力。
它解决的是一个根本问题:
企业能不能直接在廉价对象存储上,构建可靠的数据平台?
Databricks 的答案是:可以。
2. Photon:补齐高性能 SQL
仅靠 Spark,很难长期正面对抗 Snowflake、BigQuery 这样的数据仓库。
于是 Databricks 自研了 Photon。
Photon 是一个高性能向量化查询引擎,主要用于加速 SQL 和分析任务。
它代表了 Databricks 商业模式的重要转变:
底层数据格式可以开放,但高性能计算引擎可以形成专有壁垒。
3. Unity Catalog:把数据治理变成核心能力
AI 时代,一个越来越重要的问题是:
谁能访问什么数据?
哪个模型用了哪些数据?
AI Agent 有没有权限读取客户信息?
这正是 Unity Catalog 的价值。
它统一管理数据、模型、权限、审计和数据血缘。
过去,治理主要服务于人。
未来,治理很可能主要服务于 AI Agent。
因为一个员工一天可能访问几十次数据,而一个 Agent 一天可能发起数万次调用。
这让“权限与治理”从 IT 管理问题,逐渐变成 AI 基础设施问题。
四、从 Data 公司变成 Data + AI 公司
生成式 AI 爆发之后,Databricks 很快意识到:
企业真正稀缺的,不是基础模型,而是自己的私有数据。
GPT、Claude、Gemini、Llama 都可以更换。
但客户记录、交易数据、产品知识、供应链信息、内部文档,这些无法轻易复制。
Databricks 恰好已经站在这些数据之上。
因此 2023 年,它以约 13 亿美元收购 MosaicML,正式向大模型训练和生成式 AI 基础设施扩张。
战略逻辑也非常清楚:
过去管理的是:
Data → Analytics
现在希望覆盖:
Data → Model → Inference → Agent
五、为什么又买了 Neon?
Databricks 过去最强的是分析型数据系统。
它很擅长回答:
去年哪些客户买了什么?
但 AI Agent 真正进入业务系统之后,需要做的可能是:
帮这个客户创建订单。
前者是分析,后者是交易。
于是 2025 年,Databricks 收购了 serverless PostgreSQL 公司 Neon,并推出 Lakebase。
这一步很关键。
因为 Databricks 开始从“分析过去”进入“直接参与业务运行”。
也就是说,它不仅想服务 BI 和数据科学家,还希望未来 AI Agent 的实时数据库也运行在自己的平台上。
六、现在的 Databricks,本质上是什么?
如果把今天的 Databricks 简化成一张图,大致可以理解为:
底层存储
S3 / Azure Data Lake / Google Cloud Storage
↓
开放数据格式
Delta Lake / Iceberg / Parquet
↓
计算引擎
Spark / Photon / Serverless
↓
数据工程
ETL / Streaming / Lakeflow
↓
数据治理
Unity Catalog
↓
分析与 BI
Databricks SQL / Genie
↓
AI 与模型
MLflow / Mosaic AI / Model Serving
↓
AI Agent 与业务系统
Agent Bricks / Lakebase / AI Gateway
所以,Databricks 早已不是一家“大数据公司”。
它真正想成为的是:
企业数据和 AI 的统一运行平台。
七、为什么资本愿意给 1900 亿美元估值?
核心原因有三个。
第一,Databricks 掌握的是企业最难迁移的数据资产
模型可以换,GPU 可以换,云也可能换。
但企业多年积累的数据、权限关系、数据血缘和业务语义,迁移成本极高。
谁掌握这一层,谁就拥有很强的客户黏性。
第二,它正在同时吃多个市场
过去 Databricks 主要竞争 Data Warehouse。
现在它已经进入:
- 数据工程
- 数据仓库
- 数据治理
- 机器学习
- 生成式 AI
- PostgreSQL
- AI Agent
它的 TAM 也因此不断扩大。
第三,AI Agent 可能带来全新的基础设施需求
传统软件的链路是:
Human → Application → Database
未来可能变成:
Human → Agent → Tools → Database
而一个员工未来可能同时拥有多个 Agent。
一旦 Agent 数量快速增长,数据访问、模型调用、数据库事务、权限管理都会同步增长。
Databricks 正在赌这个趋势。
八、它和 Snowflake 的竞争也变了
过去 Databricks 和 Snowflake 被认为是一对直接竞争对手。
Snowflake 从 Data Warehouse 向 AI 扩张。
Databricks 从 Data Lake 和 Spark 向 Data Warehouse、AI 扩张。
双方最后都走向同一个方向:
统一企业的数据和 AI 工作负载。
但 Databricks 更强调开放生态。
它的核心逻辑是:
数据保持开放,计算、治理和 AI 平台商业化。
这对担心 vendor lock-in 的大型企业尤其有吸引力。
九、最大的机会:成为 Agent 时代的数据操作系统
Databricks 下一阶段真正的故事,可能已经不是 Lakehouse。
而是:
AI Agent Infrastructure。
未来一家大型企业内部,可能同时运行成千上万个 Agent。
这些 Agent 都需要:
- 数据
- 上下文
- 记忆
- 模型
- 权限
- 治理
- 数据库
而 Databricks 正在试图把这些能力全部放到一个平台中。
Lakebase 负责实时数据库。
Genie 负责理解企业数据和业务语义。
Unity Catalog 负责权限与治理。
Mosaic AI 负责模型。
AI Gateway 负责模型调用和管理。
如果这套逻辑成立,Databricks 的角色将从“数据分析平台”升级为:
AI Agent 的企业级运行底座。
十、当然,风险也不小
1900 亿美元估值,也意味着市场对 Databricks 的预期非常高。
它至少面临三个风险。
第一,是 AWS、Microsoft、Google 这样的云巨头。
它们同时拥有云、存储、数据库、模型和 GPU,天然具备整合优势。
第二,是 Snowflake。
双方的产品边界越来越重叠,竞争已经从数据仓库延伸到 AI。
第三,是 AI 平台最终会不会被模型厂商直接吃掉。
如果未来 OpenAI、Anthropic 或云厂商把 Agent、数据库、模型治理全部集成起来,Databricks 的部分价值可能被压缩。
反过来,如果企业坚持多云、多模型和开放数据架构,Databricks 的中立平台定位反而会更加重要。
结语:Databricks 真正的护城河,是数据重力
回头看 Databricks 的发展路径,会发现它每一步都围绕数据不断扩张。
Spark 解决计算。
Delta Lake 解决可靠存储。
Lakehouse 解决数据湖与数据仓库割裂。
Photon 解决性能。
Unity Catalog 解决治理。
Mosaic AI 解决模型。
Lakebase 解决实时交易。
Agent Bricks 和 AI Gateway 则开始解决 AI Agent 的生产环境问题。
所有这些能力,最终都围绕同一个核心:
Data Gravity,数据重力。
数据在哪里,计算会靠近哪里。
计算在哪里,AI 也会靠近哪里。
所以,1900 亿美元估值背后,资本真正押注的可能并不是一家更强的数据仓库公司。
而是:
Databricks 能否成为 AI 时代企业数据、模型和 Agent 的统一操作系统。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...