Databricks:从 Spark 到 AI Agent,1900 亿美元估值背后的故事

商业3周前发布 小智
265 0

2026 年 8 月,Databricks 宣布完成 50 亿美元战略融资,估值达到 1900 亿美元

这个数字已经足够惊人,但比估值更值得关注的是它的增长速度:Databricks 的年化收入运行率已经超过 70 亿美元,同比增长超过 80%,并保持正向调整后自由现金流。

如果只看表面,Databricks 很容易被理解成又一家受益于 AI 热潮的超级独角兽。

但它真正有意思的地方,是过去十多年里一直在沿着同一条主线扩张:

从大数据计算,走向数据平台,再走向企业 AI 基础设施

它今天想做的,已经不只是“帮企业分析数据”,而是成为未来 AI Agent 运行所依赖的数据底座。


一、Databricks 从哪里来?

Databricks 出生于 UC Berkeley 的 AMPLab 实验室。

它最早的核心技术,就是后来大名鼎鼎的 Apache Spark

在 Hadoop 时代,大数据处理高度依赖 MapReduce,很多计算任务需要频繁读写磁盘,效率并不高。

Spark 的突破在于:

通过内存计算,大幅提升大规模数据处理效率。

2013 年,包括 Ali Ghodsi、Matei Zaharia、Reynold Xin、Ion Stoica 等 Spark 核心成员创立了 Databricks。

这也奠定了公司长期以来的产品哲学:

先通过开源项目建立技术影响力,再围绕企业级需求构建商业平台。

Spark 只是第一步。


二、真正改变命运的是 Lakehouse

Spark 很成功,但它本身是开源的。

Databricks 必须回答一个问题:

如果 Spark 免费,客户为什么要付钱给 Databricks?

答案最终变成了 Lakehouse。

过去企业的数据架构通常分成两类:

一类是 Data Warehouse,性能好、治理成熟,但昂贵,而且不适合承载大量非结构化数据。

另一类是 Data Lake,成本低、扩展性强,但数据质量、事务能力和治理能力较弱。

Databricks 提出的 Lakehouse,核心思路非常简单:

把 Data Lake 的低成本和开放性,与 Data Warehouse 的可靠性和性能结合起来。

这成为它后续十年最重要的战略基础。


三、技术底座到底是什么?

理解 Databricks,可以把它拆成几个关键技术层。

1. Delta Lake:让数据湖拥有数据库能力

普通数据湖的问题是,数据虽然便宜地存下来了,但缺乏事务、版本控制和一致性。

Delta Lake 在 Parquet 文件之上增加事务日志,从而提供 ACID 事务、版本回滚、数据一致性等能力。

它解决的是一个根本问题:

企业能不能直接在廉价对象存储上,构建可靠的数据平台?

Databricks 的答案是:可以。


2. Photon:补齐高性能 SQL

仅靠 Spark,很难长期正面对抗 Snowflake、BigQuery 这样的数据仓库。

于是 Databricks 自研了 Photon。

Photon 是一个高性能向量化查询引擎,主要用于加速 SQL 和分析任务。

它代表了 Databricks 商业模式的重要转变:

底层数据格式可以开放,但高性能计算引擎可以形成专有壁垒。


3. Unity Catalog:把数据治理变成核心能力

AI 时代,一个越来越重要的问题是:

谁能访问什么数据?

哪个模型用了哪些数据?

AI Agent 有没有权限读取客户信息?

这正是 Unity Catalog 的价值。

它统一管理数据、模型、权限、审计和数据血缘。

过去,治理主要服务于人。

未来,治理很可能主要服务于 AI Agent。

因为一个员工一天可能访问几十次数据,而一个 Agent 一天可能发起数万次调用。

这让“权限与治理”从 IT 管理问题,逐渐变成 AI 基础设施问题。


四、从 Data 公司变成 Data + AI 公司

生成式 AI 爆发之后,Databricks 很快意识到:

企业真正稀缺的,不是基础模型,而是自己的私有数据。

GPT、Claude、Gemini、Llama 都可以更换。

但客户记录、交易数据、产品知识、供应链信息、内部文档,这些无法轻易复制。

Databricks 恰好已经站在这些数据之上。

因此 2023 年,它以约 13 亿美元收购 MosaicML,正式向大模型训练和生成式 AI 基础设施扩张。

战略逻辑也非常清楚:

过去管理的是:

Data → Analytics

现在希望覆盖:

Data → Model → Inference → Agent


五、为什么又买了 Neon?

Databricks 过去最强的是分析型数据系统。

它很擅长回答:

去年哪些客户买了什么?

但 AI Agent 真正进入业务系统之后,需要做的可能是:

帮这个客户创建订单。

前者是分析,后者是交易。

于是 2025 年,Databricks 收购了 serverless PostgreSQL 公司 Neon,并推出 Lakebase

这一步很关键。

因为 Databricks 开始从“分析过去”进入“直接参与业务运行”。

也就是说,它不仅想服务 BI 和数据科学家,还希望未来 AI Agent 的实时数据库也运行在自己的平台上。


六、现在的 Databricks,本质上是什么?

如果把今天的 Databricks 简化成一张图,大致可以理解为:

底层存储
S3 / Azure Data Lake / Google Cloud Storage

开放数据格式
Delta Lake / Iceberg / Parquet

计算引擎
Spark / Photon / Serverless

数据工程
ETL / Streaming / Lakeflow

数据治理
Unity Catalog

分析与 BI
Databricks SQL / Genie

AI 与模型
MLflow / Mosaic AI / Model Serving

AI Agent 与业务系统
Agent Bricks / Lakebase / AI Gateway

所以,Databricks 早已不是一家“大数据公司”。

它真正想成为的是:

企业数据和 AI 的统一运行平台。


七、为什么资本愿意给 1900 亿美元估值?

核心原因有三个。

第一,Databricks 掌握的是企业最难迁移的数据资产

模型可以换,GPU 可以换,云也可能换。

但企业多年积累的数据、权限关系、数据血缘和业务语义,迁移成本极高。

谁掌握这一层,谁就拥有很强的客户黏性。

第二,它正在同时吃多个市场

过去 Databricks 主要竞争 Data Warehouse。

现在它已经进入:

  • 数据工程
  • 数据仓库
  • 数据治理
  • 机器学习
  • 生成式 AI
  • PostgreSQL
  • AI Agent

它的 TAM 也因此不断扩大。

第三,AI Agent 可能带来全新的基础设施需求

传统软件的链路是:

Human → Application → Database

未来可能变成:

Human → Agent → Tools → Database

而一个员工未来可能同时拥有多个 Agent。

一旦 Agent 数量快速增长,数据访问、模型调用、数据库事务、权限管理都会同步增长。

Databricks 正在赌这个趋势。


八、它和 Snowflake 的竞争也变了

过去 Databricks 和 Snowflake 被认为是一对直接竞争对手。

Snowflake 从 Data Warehouse 向 AI 扩张。

Databricks 从 Data Lake 和 Spark 向 Data Warehouse、AI 扩张。

双方最后都走向同一个方向:

统一企业的数据和 AI 工作负载。

但 Databricks 更强调开放生态。

它的核心逻辑是:

数据保持开放,计算、治理和 AI 平台商业化。

这对担心 vendor lock-in 的大型企业尤其有吸引力。


九、最大的机会:成为 Agent 时代的数据操作系统

Databricks 下一阶段真正的故事,可能已经不是 Lakehouse。

而是:

AI Agent Infrastructure。

未来一家大型企业内部,可能同时运行成千上万个 Agent。

这些 Agent 都需要:

  • 数据
  • 上下文
  • 记忆
  • 模型
  • 权限
  • 治理
  • 数据库

而 Databricks 正在试图把这些能力全部放到一个平台中。

Lakebase 负责实时数据库。

Genie 负责理解企业数据和业务语义。

Unity Catalog 负责权限与治理。

Mosaic AI 负责模型。

AI Gateway 负责模型调用和管理。

如果这套逻辑成立,Databricks 的角色将从“数据分析平台”升级为:

AI Agent 的企业级运行底座。


十、当然,风险也不小

1900 亿美元估值,也意味着市场对 Databricks 的预期非常高。

它至少面临三个风险。

第一,是 AWS、Microsoft、Google 这样的云巨头。

它们同时拥有云、存储、数据库、模型和 GPU,天然具备整合优势。

第二,是 Snowflake。

双方的产品边界越来越重叠,竞争已经从数据仓库延伸到 AI。

第三,是 AI 平台最终会不会被模型厂商直接吃掉。

如果未来 OpenAI、Anthropic 或云厂商把 Agent、数据库、模型治理全部集成起来,Databricks 的部分价值可能被压缩。

反过来,如果企业坚持多云、多模型和开放数据架构,Databricks 的中立平台定位反而会更加重要。


结语:Databricks 真正的护城河,是数据重力

回头看 Databricks 的发展路径,会发现它每一步都围绕数据不断扩张。

Spark 解决计算。

Delta Lake 解决可靠存储。

Lakehouse 解决数据湖与数据仓库割裂。

Photon 解决性能。

Unity Catalog 解决治理。

Mosaic AI 解决模型。

Lakebase 解决实时交易。

Agent Bricks 和 AI Gateway 则开始解决 AI Agent 的生产环境问题。

所有这些能力,最终都围绕同一个核心:

Data Gravity,数据重力。

数据在哪里,计算会靠近哪里。

计算在哪里,AI 也会靠近哪里。

所以,1900 亿美元估值背后,资本真正押注的可能并不是一家更强的数据仓库公司。

而是:

Databricks 能否成为 AI 时代企业数据、模型和 Agent 的统一操作系统。

© 版权声明

相关文章

暂无评论

none
暂无评论...