Table of contents
Open Table of contents
- 1. 先建立整体认知:企业大数据平台到底在解决什么
- 2. 企业级大数据平台总体分层
- 3. 第一层:业务系统与 OLTP
- 4. OLAP:为什么需要分析平台
- 5. MPP:它和 OLAP 不是同一个维度
- 6. 数据集成层:ETL、ELT、CDC
- 7. Kafka / 消息队列在架构中的位置
- 8. 数据湖:现代大数据平台的重要底座
- 9. 对象存储为什么成为现代数据湖底座
- 10. Hadoop 到底是什么
- 11. 实时流计算:Flink 的位置
- 12. 数据仓库是什么
- 13. 数据湖和数据仓库不是二选一
- 14. NoSQL 是什么
- 15. 图数据库为什么会独立出现
- 16. “全域全结构生命周期存储”怎么理解
- 17. 数据治理为什么必须独立存在
- 18. 开发管理是什么
- 19. 数据中台到底是什么
- 20. 数据服务:数据中台真正输出价值的地方
- 21. 研究沙箱为什么金融机构常见
- 22. 最上层:大数据应用
- 23. 将已知架构模块放回总体架构
- 24. 华为云 / HCS / FusionInsight 常见能力映射
- 25. 三组最容易混淆的概念
- 26. 证券交易所场景的一条完整数据链路
- 27. 建议后续学习顺序
- 28. 最终理解目标
- 29. 一句话总结
1. 先建立整体认知:企业大数据平台到底在解决什么
理解企业级大数据平台,最重要的不是先背产品名,而是先把“产品名、开源组件名、技术架构名、业务能力名”分开。
很多架构交流之所以容易混乱,就是把 Kafka、Flink、Hadoop、数据湖、MPP、数据中台、数据服务放在同一个层次讨论。
可以先建立一个最核心的认知:
企业大数据平台本质上是在解决:数据从哪里来 → 怎么进来 → 存在哪里 → 怎么计算加工 → 怎么治理 → 怎么形成统一资产 → 怎么对外提供数据 → 最终支撑什么业务。
2. 企业级大数据平台总体分层
┌───────────────────────────────────────────────────────────────┐
│ ⑧ 大数据应用 / AI应用 │
│ 风控 │ 反欺诈 │ 营销 │ 监管报送 │ 经营分析 │ 投研 │ 智能运营 │
├───────────────────────────────────────────────────────────────┤
│ ⑦ 数据服务 │
│ 数据集市 │ 指标 │ 标签 │ 图谱 │ 数据API │ 自助分析 │ 研究沙箱 │
├───────────────────────────────────────────────────────────────┤
│ ⑥ 数据资产层 │
│ 主题域 │ 数据模型 │ 指标体系 │ 标签体系 │ 数据目录 │ 知识图谱 │
├───────────────────────────────────────────────────────────────┤
│ ⑤ 计算 / 数仓 / 湖仓 / 专用数据引擎 │
│ Spark │ Flink │ SQL/MPP │ ClickHouse │ HBase │ Graph │ AI │
├───────────────────────────────────────────────────────────────┤
│ ④ 统一数据存储 │
│ 数据湖 │ 对象存储 │ HDFS │ 数仓存储 │ NoSQL │ 热温冷归档 │
├───────────────────────────────────────────────────────────────┤
│ ③ 数据集成 / 数据接入 │
│ ETL/ELT │ CDC │ Kafka │ 批量采集 │ 实时采集 │ 文件/日志采集 │
├───────────────────────────────────────────────────────────────┤
│ ② 数据源 │
│ OLTP │ 核心交易 │ Oracle/MySQL │ MQ │ 文件 │ 日志 │ IoT │ 外部数据 │
└───────────────────────────────────────────────────────────────┘
↑ 横向能力 ↑
┌───────────────────────────────────────────────────────────────┐
│ 数据治理 │ 数据安全 │ 元数据 │ 血缘 │ 质量 │ 标准 │ 权限 │ 审计 │
│ 开发管理 │ 调度 │ 任务编排 │ DevOps │ 运维 │ 资源管理 │ 多租户 │
└───────────────────────────────────────────────────────────────┘
这张图可以作为以后看任何金融、证券、银行、运营商等企业级大数据平台的“坐标系”。
3. 第一层:业务系统与 OLTP
大数据平台最下面通常不是“大数据”,而是企业原有的生产业务系统。
例如证券交易所常见数据源包括:
交易系统
行情系统
会员系统
清算系统
结算系统
监管系统
财务系统
CRM
日志系统
外部市场数据
这些系统中,大量核心数据库属于:
OLTP:Online Transaction Processing,联机事务处理。
典型特征:
| 维度 | OLTP |
|---|---|
| 目标 | 处理业务交易 |
| 数据 | 当前状态、业务明细 |
| 操作 | INSERT / UPDATE / DELETE / SELECT |
| 查询 | 短事务、点查、简单查询 |
| 并发 | 很高 |
| 一致性 | 很重要 |
| 典型数据库 | Oracle、MySQL、PostgreSQL、GaussDB |
示例:
UPDATE account
SET balance = balance - 10000
WHERE account_id = 123;
这是典型 OLTP 操作。
核心理解
OLTP 负责“把业务跑起来”,大数据平台负责“把数据用起来”。
典型关系:
生产系统
↓
数据复制 / CDC / Kafka / ETL
↓
大数据平台
4. OLAP:为什么需要分析平台
和 OLTP 对应的是:
OLAP:Online Analytical Processing,联机分析处理。
例如:
SELECT
customer_type,
region,
SUM(transaction_amount),
COUNT(*)
FROM transaction
WHERE trade_date BETWEEN ...
GROUP BY customer_type, region;
如果扫描过去 5 年、数百亿甚至数千亿笔交易记录,就不适合直接在核心生产数据库上执行。
因此形成:
OLTP
│
│ 数据同步
▼
┌────────────────────┐
│ 大数据/分析平台 │
│ OLAP │
└────────────────────┘
可以简化记忆:
OLTP 解决业务事务,OLAP 解决分析决策。
5. MPP:它和 OLAP 不是同一个维度
MPP = Massively Parallel Processing,大规模并行处理。
它描述的是一种并行计算架构,而不是一种业务负载。
例如:
SQL
│
Query Coordinator
│
┌──────────┼──────────┐
▼ ▼ ▼
Node1 Node2 Node3
30TB 35TB 35TB
│ │ │
└──────────┼──────────┘
▼
Result
因此:
OLAP = 工作负载类型
MPP = 实现 OLAP 的一种技术架构
例如:
OLAP
├─ MPP 数仓
│ └─ GaussDB(DWS)
├─ ClickHouse
├─ Spark SQL
└─ Presto / Trino / HetuEngine
6. 数据集成层:ETL、ELT、CDC
企业数据不会自动进入大数据平台,所以必须存在数据集成层。
数据集成
│
┌──────────┼───────────┐
▼ ▼ ▼
数据库 文件 MQ
│ │ │
▼ ▼ ▼
CDC ETL Kafka
│ │ │
└──────────┼───────────┘
▼
数据湖
6.1 ETL
ETL = Extract → Transform → Load
即:
提取
↓
转换
↓
装载
例如:
Oracle
↓
抽取交易记录
↓
日期格式统一
身份证脱敏
字段映射
异常数据清洗
↓
数据仓库
6.2 ELT
现代数据湖、湖仓越来越多采用:
Extract
↓
Load
↓
Transform
也就是先把原始数据存入数据湖,再使用 Spark、Flink、SQL 等进行加工。
原因在于:
原始数据未来可能还有新的使用方式,因此先完整保留,再按需加工。
6.3 CDC
CDC = Change Data Capture,变更数据捕获。
如果生产数据库发生:
10:01 INSERT A
10:02 UPDATE B
10:03 DELETE C
CDC 可以通过数据库日志捕获这些变化:
Oracle / MySQL
│
│ redo / binlog
▼
CDC
│
▼
Kafka
│
▼
Flink / 数据湖 / 数据仓库
金融行业大量实时数据链路都会使用 CDC。
7. Kafka / 消息队列在架构中的位置
Kafka 不是数据库,也不是数据湖。
它属于:
分布式事件流 / 消息系统。
在企业大数据平台中,Kafka 常承担实时数据总线。
交易系统
行情系统
风控系统
日志系统
│
▼
Kafka
│
┌──┼────────────┐
▼ ▼ ▼
Flink 数据湖 实时OLAP
│
▼
实时风控
Kafka 的核心价值是解耦:
生产者 → Kafka → 多个消费者
例如一笔交易写入 Topic:
Kafka Topic: trade
│
├→ 风控
├→ 行情分析
├→ 数据湖
├→ 监管系统
└→ 实时指标
8. 数据湖:现代大数据平台的重要底座
传统架构通常是:
业务数据库
↓
ETL
↓
数据仓库
但企业中大量数据并不适合直接进入传统关系型数据仓库,例如:
JSON
日志
图片
视频
PDF
CSV
文本
语音
IoT
行情原始文件
因此产生了:
Data Lake,数据湖。
核心思想:
尽量保存企业所有类型的原始数据。
覆盖:
结构化数据
半结构化数据
非结构化数据
现代数据湖越来越多采用:
对象存储 / HDFS
│
┌─────┼─────┐
▼ ▼ ▼
Spark Flink SQL引擎
9. 对象存储为什么成为现代数据湖底座
过去 Hadoop 数据湖典型使用:
HDFS
云时代越来越多使用:
Object Storage
典型产品:
AWS → S3
华为云 → OBS
对象存储不是传统文件系统,而是:
Bucket
├─ object1
├─ object2
└─ object3
通过 API / HTTP 访问。
现代架构因此逐步形成:
OBS
统一数据存储
│
┌────────────┼──────────────┐
▼ ▼ ▼
Spark Flink DWS
▼ ▼ ▼
批处理 实时处理 OLAP
这就是:
存算分离。
10. Hadoop 到底是什么
一个常见误区:
Hadoop = 大数据平台。
不准确。
Hadoop 最初是一套分布式大数据基础框架。
经典核心:
Hadoop
├─ HDFS
│ 分布式存储
├─ YARN
│ 资源调度
└─ MapReduce
分布式计算
后来逐渐形成 Hadoop 生态:
Hadoop Ecosystem
│
├─ HDFS
├─ YARN
├─ Hive
├─ HBase
├─ Spark
├─ Flink
├─ Kafka
├─ ZooKeeper
├─ Ranger
└─ ...
可以粗略理解:
MRS 是企业级、云化、产品化的大数据/Hadoop 生态平台。
一个 MRS 集群可能包含:
HDFS
Hive
Spark
Flink
Kafka
HBase
ClickHouse
HetuEngine
Ranger
FusionInsight Manager 则承担集群统一监控、配置、权限、资源与运维管理。
11. 实时流计算:Flink 的位置
传统大数据常采用:
昨天的数据
↓
夜间跑 ETL
↓
第二天出报表
这是典型:
Batch Processing,批处理。
但是金融行业很多业务不能等待,例如:
异常交易
反洗钱
反欺诈
市场监控
实时行情
实时风险
因此需要:
交易产生
↓
Kafka
↓
Flink
↓
实时规则 / 实时模型
↓
毫秒~秒级结果
可以简化记忆:
Spark → 更偏大规模批计算
Flink → 更偏实时流计算
Kafka → 实时数据通道
现代平台越来越强调:
流批一体。
12. 数据仓库是什么
数据湖强调:
什么数据都能放。
数据仓库强调:
数据经过严格建模、组织和治理以后,用于分析。
例如金融数据仓库常按主题域建设:
客户主题
账户主题
交易主题
产品主题
机构主题
风险主题
常见数仓分层:
Raw Data
│
ODS
│
DWD
│
DWS
│
ADS
| 层次 | 含义 |
|---|---|
| ODS | Operational Data Store,贴源/原始层 |
| DWD | Data Warehouse Detail,明细层 |
| DWS | Data Warehouse Summary,汇总层 |
| ADS | Application Data Service,应用层 |
注意:DWS 有两种不同含义
数仓建模语境:
DWS = Data Warehouse Summary
华为云产品语境:
GaussDB(DWS) = Data Warehouse Service
二者不是一回事。
13. 数据湖和数据仓库不是二选一
| 对比维度 | 数据湖 | 数据仓库 |
|---|---|---|
| 数据类型 | 结构化、半结构化、非结构化 | 主要结构化 |
| Schema | 灵活 | 严格 |
| 原始数据 | 强 | 弱 |
| 成本 | 较低 | 相对较高 |
| SQL分析 | 可以 | 很强 |
| BI报表 | 可以 | 很强 |
| 数据治理 | 需额外增强 | 天然较强 |
因此现代架构逐渐发展为:
Lakehouse,湖仓一体
核心理念:
湖的灵活性 + 仓的事务、治理、建模、分析能力。
现代湖仓常用开放表格式:
Iceberg
Hudi
Paimon
这些技术为对象存储上的数据增加:
Schema
ACID
版本
增量读取
Time Travel
14. NoSQL 是什么
NoSQL 不是某一种数据库,而是一大类非传统关系型数据库。
| 类型 | 典型技术 |
|---|---|
| Key-Value | Redis |
| Document | MongoDB |
| Wide Column | HBase / Cassandra |
| Graph | Neo4j / GES |
| Time Series | InfluxDB |
例如:
客户画像
客户ID → 数百/数千个标签
或者:
数百亿条事件记录
可能更适合 HBase 等 NoSQL,而不是传统 MySQL。
MRS 中的 HBase 就属于典型的分布式 NoSQL。
15. 图数据库为什么会独立出现
关系数据库适合:
客户表
交易表
账户表
但当问题变成:
A 和 B 有什么关系?
或:
100 万个账户之间是否存在异常资金网络?
图模型更适合:
客户A
/ \
手机号 银行卡
| |
客户B ----账户C
\ /
公司D
图数据库中通常:
Node = 人 / 账户 / 公司 / 设备
Edge = 交易 / 持股 / 控制 / 联系人
金融常见应用:
反洗钱
反欺诈
关联交易
客户关系
企业关系
实控人分析
知识图谱
因此:
图数据库是针对关系网络分析的专用数据引擎。
它不是数据湖或数仓的替代品。
16. “全域全结构生命周期存储”怎么理解
这通常不是一种具体数据库,而是企业数据存储体系的总体目标。
16.1 全域
覆盖:
业务域
管理域
外部数据
互联网数据
IoT 数据
16.2 全结构
覆盖:
结构化
半结构化
非结构化
16.3 全生命周期
覆盖:
产生
↓
在线
↓
热数据
↓
温数据
↓
冷数据
↓
归档
↓
销毁
因此企业级存储通常会组合多种技术:
企业数据
│
┌───────────────┼─────────────────┐
▼ ▼ ▼
对象存储 HDFS DWS
原始/冷数据 大数据 分析
│
├───────────── HBase
│ 在线大数据
│
├───────────── Graph
│ 关系数据
│
└───────────── Archive
长期归档
17. 数据治理为什么必须独立存在
如果只有:
Kafka + Spark + Flink + HDFS
严格来说只能算:
大数据技术平台。
还不能算成熟的企业数据平台。
因为真正的企业问题往往是:
这个字段是什么意思?
谁产生的?
谁负责?
是不是敏感数据?
质量怎么样?
经过哪些加工?
哪些报表用了它?
为什么两个部门的“客户数”不同?
因此必须建设:
数据标准
元数据
数据目录
数据血缘
数据质量
数据安全
权限
指标
模型
资产
例如一个“交易金额”字段,治理平台需要能够描述:
名称:交易金额
标准编码:TRADE_AMT
类型:DECIMAL(20,2)
业务定义:……
来源:核心交易系统
负责人:交易业务部
安全等级:L3
血缘:
交易系统
→ ODS
→ DWD
→ DWS
→ 风险指标
这时候数据才真正成为:
数据资产。
在华为云体系中,这类能力通常与 DataArts Studio / FusionInsight 数据治理能力对应。
18. 开发管理是什么
开发管理不要和数据治理混淆。
它主要解决:
数据工程师怎么开发、编排、发布和运行数据任务。
典型能力:
SQL 开发
Spark 开发
Flink 开发
Shell
ETL 任务
工作流
依赖关系
定时调度
补数据
版本管理
发布
运行监控
失败重跑
例如:
任务A
│
▼
任务B ─────┐
│ │
▼ ▼
任务C 任务D
\ /
▼ ▼
任务E
又例如金融机构夜间批处理:
01:00 拉取交易数据
01:20 清洗
02:00 客户汇总
03:00 风险指标
05:00 生成监管报表
19. 数据中台到底是什么
数据中台不是:
- 一个数据库
- 一个单独软件
- 一个 Hadoop 集群
- 一个单独的数据仓库
更准确的理解是:
数据中台是一套企业级、可复用的数据能力体系。
可以用“采、建、管、用”理解:
数据中台
│
┌──────────┬───────┼───────┬───────────┐
▼ ▼ ▼ ▼
采 建 管 用
│ │ │ │
数据集成 数据模型 标准 数据API
CDC 指标 质量 数据集市
Kafka 标签 血缘 标签服务
ETL 图谱 安全 自助分析
目录 研究沙箱
最终目的不是:
建一个更大的数据库。
而是:
把企业数据变成可复用的数据资产与数据能力。
20. 数据服务:数据中台真正输出价值的地方
如果没有数据服务:
数据平台
│
└→ 用户直接查数据库
最终容易出现:
每个系统自己写 SQL
每个部门自己算指标
每个项目自己复制数据
正确方式是把数据资产服务化:
数据资产
│
┌───────────┼───────────┐
▼ ▼ ▼
数据API 指标 标签
│ │ │
APP/系统 BI 营销
│
├──────── 数据集市
│
├──────── 自助分析
│
└──────── 研究沙箱
因此广义数据服务通常包括:
数据集市
指标服务
标签服务
图谱服务
数据 API
自助分析
研究沙箱
华为 DataArts 的“数据服务”产品能力更偏向:
把数据表/数据资产快速发布为 API,并统一管理 API 生命周期。
但企业架构里的“数据服务层”范围通常更广。
21. 研究沙箱为什么金融机构常见
例如证券研究员希望分析:
过去10年全部A股行情
+
上市公司财务
+
新闻
+
研报
显然不能让研究员直接访问核心生产数据库。
因此会建设:
Research Sandbox,研究沙箱。
企业数据平台
│
经过授权的数据
│
▼
Sandbox
│
┌────┼─────┐
▼ ▼ ▼
SQL Python Jupyter
│
▼
量化研究 / 建模
典型特点:
计算环境隔离
数据权限受控
资源配额
可审计
结果导出受控
这在银行、证券、交易所等机构非常常见。
22. 最上层:大数据应用
整个大数据平台最终是为业务服务。
大数据平台
│
┌────────────────┼──────────────────┐
▼ ▼ ▼
风险 经营 营销
│ │ │
反欺诈 BI 客群
AML KPI 标签
实时风控 报表 推荐
│
▼
监管
│
监管报送
市场监察
异常交易
证券交易所典型场景:
实时行情分析
市场异常交易监控
会员画像
上市公司分析
监管报送
风险监控
知识图谱
量化研究
历史行情分析
23. 将已知架构模块放回总体架构
| 模块 | 在整体架构中的角色 | 典型技术 |
|---|---|---|
| 开发管理 | 数据研发与任务编排平台 | SQL、Spark、Flink、调度 |
| 实时流计算 | 实时计算 | Kafka + Flink |
| 数据湖 | 全量原始数据底座 | OBS / HDFS |
| 数据仓库 | 高质量结构化分析 | MPP / DWS |
| 图数据库 | 关系网络分析 | Graph / GES |
| 数据治理 | 企业数据管理 | 元数据、质量、血缘、标准 |
| 全域全结构生命周期存储 | 统一存储体系 | OBS、HDFS、DWS、HBase、归档 |
这些模块之间:
不是竞争关系,而是组合关系。
24. 华为云 / HCS / FusionInsight 常见能力映射
注意:不同 HCS / FusionInsight 版本的具体产品组合、组件名和交付形态可能不同,以下更适合作为架构映射,而不是固定 BOM。
| 企业能力 | 通用技术 | 华为体系常见对应 |
|---|---|---|
| OLTP 数据库 | MySQL / PostgreSQL / Oracle | GaussDB / RDS 等 |
| 数据集成 | ETL / CDC | DataArts / CDM 等 |
| 消息 / 实时总线 | Kafka | MRS Kafka |
| 实时计算 | Flink | MRS Flink |
| 批处理 | Spark | MRS Spark |
| Hadoop 存储 | HDFS | MRS HDFS |
| SQL on Hadoop | Hive | MRS Hive |
| NoSQL | HBase | MRS HBase |
| 实时 OLAP | ClickHouse | MRS ClickHouse |
| 联邦查询 | Trino / Presto 类 | HetuEngine |
| 数据湖 | Object Storage / HDFS | OBS + MRS |
| 湖元数据 | Hive Metastore 类 | LakeFormation |
| 企业数仓 | MPP Database | GaussDB(DWS) |
| 数据治理 | Catalog / Quality / Lineage | DataArts Studio / FusionInsight 相关治理能力 |
| 图计算 | Graph DB | GES / 图计算相关能力 |
| 集群运维 | Cluster Manager | FusionInsight Manager |
25. 三组最容易混淆的概念
25.1 数据湖、数据仓库、数据中台
数据湖
↓
解决“数据怎么统一存”
数据仓库
↓
解决“数据怎么高质量分析”
数据中台
↓
解决“数据怎么形成企业可复用能力”
因此:
湖、仓更多属于技术/数据架构,中台更多属于企业数据能力架构。
25.2 Kafka、Flink、Spark、DWS
这几个产品/技术不是同一类东西:
Kafka
数据流通
Flink
实时计算
Spark
批计算 / 通用计算
DWS
MPP 分析数据库
典型完整链路:
OLTP
│
CDC
│
▼
Kafka
│
▼
Flink
/ \
▼ ▼
HBase 数据湖
│
Spark
│
▼
DWS
│
▼
BI
25.3 技术平台、治理平台、数据服务
技术平台
MRS / DWS / OBS
│
▼
负责“算和存”
治理平台
DataArts 等
│
▼
负责“把数据管好”
数据服务
API / 指标 / 标签 / 集市
│
▼
负责“把数据提供出去”
26. 证券交易所场景的一条完整数据链路
【交易系统】
│
OLTP
│
CDC / 实时采集
│
▼
Kafka
│
┌──────────┴──────────┐
▼ ▼
Flink Data Lake
实时规则计算 OBS/HDFS
│ │
▼ ▼
异常交易告警 Spark
│
▼
ODS → DWD → DWS
│
┌──────────┼──────────┐
▼ ▼ ▼
DWS HBase Graph
│ │ │
▼ ▼ ▼
BI 客户画像 关系网络
│
└─────┬────┘
▼
数据资产
│
┌────────────────┼───────────────┐
▼ ▼ ▼
指标 标签 图谱
│ │ │
└────────────────┼───────────────┘
▼
数据服务
│
┌────────────────┼───────────────┐
▼ ▼ ▼
数据API 自助分析 研究沙箱
│
▼
风控 / 监管 / 投研 / BI / AI
横向贯穿整个体系的能力:
数据治理
数据安全
元数据
数据血缘
数据质量
数据标准
开发管理
任务调度
平台运维
资源管理
多租户
27. 建议后续学习顺序
建议不要再随机补术语,而是按以下顺序系统学习:
-
企业大数据平台总体架构与数据流
- 建立“数据源 → 接入 → 存储 → 计算 → 治理 → 服务 → 应用”的整体框架。
-
Hadoop / MRS 内部架构
- HDFS
- YARN
- Hive
- Spark
- HBase
- ZooKeeper
- Ranger
- HetuEngine
-
实时数据平台
- Kafka
- Topic
- Partition
- Consumer Group
- Flink
- Checkpoint
- Exactly Once
- CDC
-
数据湖与湖仓
- OBS / HDFS
- 存算分离
- LakeFormation
- Hive Metastore
- Parquet / ORC
- Iceberg / Hudi / Paimon
-
企业数据仓库
- OLAP
- MPP
- Shared-Nothing
- 事实表 / 维表
- 星型模型 / 雪花模型
- ODS / DWD / DWS / ADS
- GaussDB(DWS)
-
数据治理与数据中台
- 元数据
- 血缘
- 标准
- 质量
- 指标
- 标签
- 资产目录
- DataArts / FusionInsight 治理能力
-
数据服务体系
- 数据集市
- 数据 API
- 指标服务
- 标签服务
- 图谱服务
- 自助分析
- 研究沙箱
-
金融级非功能架构
- 两地三中心
- 同城双活
- 容灾
- RPO / RTO
- 多租户
- 数据权限
- 脱敏
- 审计
- 监管合规
-
金融典型业务架构
- 实时风控
- 反洗钱
- 市场监察
- 监管报送
- 客户 360
- 投研
- AI
28. 最终理解目标
当看到一张企业大数据平台总体架构图时,应能够沿着下面这条主线逐层解释:
数据源
↓
数据接入
↓
消息 / CDC
↓
统一存储
↓
批处理 / 流处理
↓
数据湖 / 数据仓库 / 湖仓
↓
数据治理
↓
数据资产
↓
数据服务
↓
大数据应用 / AI 应用
并能够判断每个模块到底属于:
存储
计算
数据集成
数据治理
数据开发
数据资产
数据服务
业务应用
而不是只停留在识别产品 Logo 的层面。
29. 一句话总结
企业级大数据平台不是某一个产品,而是一套围绕“数据全生命周期”构建的企业数据基础设施:底层负责采集、存储和计算,中间负责治理和资产化,上层通过数据服务向业务、分析、监管和 AI 输出可复用的数据能力。