Skip to content
Figo Blogs
Go back

企业级大数据平台架构科普(华为云 HCS / FusionInsight / MRS 视角)

Contents

Table of contents

Open Table of contents

1. 先建立整体认知:企业大数据平台到底在解决什么

理解企业级大数据平台,最重要的不是先背产品名,而是先把“产品名、开源组件名、技术架构名、业务能力名”分开。

很多架构交流之所以容易混乱,就是把 Kafka、Flink、Hadoop、数据湖、MPP、数据中台、数据服务放在同一个层次讨论。

可以先建立一个最核心的认知:

企业大数据平台本质上是在解决:数据从哪里来 → 怎么进来 → 存在哪里 → 怎么计算加工 → 怎么治理 → 怎么形成统一资产 → 怎么对外提供数据 → 最终支撑什么业务。


2. 企业级大数据平台总体分层

┌───────────────────────────────────────────────────────────────┐
│                      ⑧ 大数据应用 / AI应用                     │
│ 风控 │ 反欺诈 │ 营销 │ 监管报送 │ 经营分析 │ 投研 │ 智能运营    │
├───────────────────────────────────────────────────────────────┤
│                           ⑦ 数据服务                            │
│ 数据集市 │ 指标 │ 标签 │ 图谱 │ 数据API │ 自助分析 │ 研究沙箱   │
├───────────────────────────────────────────────────────────────┤
│                         ⑥ 数据资产层                            │
│ 主题域 │ 数据模型 │ 指标体系 │ 标签体系 │ 数据目录 │ 知识图谱   │
├───────────────────────────────────────────────────────────────┤
│              ⑤ 计算 / 数仓 / 湖仓 / 专用数据引擎               │
│ Spark │ Flink │ SQL/MPP │ ClickHouse │ HBase │ Graph │ AI     │
├───────────────────────────────────────────────────────────────┤
│                     ④ 统一数据存储                              │
│ 数据湖 │ 对象存储 │ HDFS │ 数仓存储 │ NoSQL │ 热温冷归档       │
├───────────────────────────────────────────────────────────────┤
│                     ③ 数据集成 / 数据接入                       │
│ ETL/ELT │ CDC │ Kafka │ 批量采集 │ 实时采集 │ 文件/日志采集     │
├───────────────────────────────────────────────────────────────┤
│                         ② 数据源                                │
│ OLTP │ 核心交易 │ Oracle/MySQL │ MQ │ 文件 │ 日志 │ IoT │ 外部数据 │
└───────────────────────────────────────────────────────────────┘

        ↑                    横向能力                     ↑
┌───────────────────────────────────────────────────────────────┐
│ 数据治理 │ 数据安全 │ 元数据 │ 血缘 │ 质量 │ 标准 │ 权限 │ 审计 │
│ 开发管理 │ 调度 │ 任务编排 │ DevOps │ 运维 │ 资源管理 │ 多租户     │
└───────────────────────────────────────────────────────────────┘

这张图可以作为以后看任何金融、证券、银行、运营商等企业级大数据平台的“坐标系”。


3. 第一层:业务系统与 OLTP

大数据平台最下面通常不是“大数据”,而是企业原有的生产业务系统。

例如证券交易所常见数据源包括:

交易系统
行情系统
会员系统
清算系统
结算系统
监管系统
财务系统
CRM
日志系统
外部市场数据

这些系统中,大量核心数据库属于:

OLTP:Online Transaction Processing,联机事务处理。

典型特征:

维度OLTP
目标处理业务交易
数据当前状态、业务明细
操作INSERT / UPDATE / DELETE / SELECT
查询短事务、点查、简单查询
并发很高
一致性很重要
典型数据库Oracle、MySQL、PostgreSQL、GaussDB

示例:

UPDATE account
SET balance = balance - 10000
WHERE account_id = 123;

这是典型 OLTP 操作。

核心理解

OLTP 负责“把业务跑起来”,大数据平台负责“把数据用起来”。

典型关系:

生产系统
   ↓
数据复制 / CDC / Kafka / ETL
   ↓
大数据平台

4. OLAP:为什么需要分析平台

和 OLTP 对应的是:

OLAP:Online Analytical Processing,联机分析处理。

例如:

SELECT
    customer_type,
    region,
    SUM(transaction_amount),
    COUNT(*)
FROM transaction
WHERE trade_date BETWEEN ...
GROUP BY customer_type, region;

如果扫描过去 5 年、数百亿甚至数千亿笔交易记录,就不适合直接在核心生产数据库上执行。

因此形成:

                 OLTP
                  │
                  │ 数据同步
                  ▼
        ┌────────────────────┐
        │   大数据/分析平台   │
        │       OLAP         │
        └────────────────────┘

可以简化记忆:

OLTP 解决业务事务,OLAP 解决分析决策。


5. MPP:它和 OLAP 不是同一个维度

MPP = Massively Parallel Processing,大规模并行处理。

它描述的是一种并行计算架构,而不是一种业务负载。

例如:

                 SQL
                  │
           Query Coordinator
                  │
       ┌──────────┼──────────┐
       ▼          ▼          ▼
     Node1      Node2      Node3
      30TB       35TB       35TB
       │          │          │
       └──────────┼──────────┘
                  ▼
               Result

因此:

OLAP = 工作负载类型
MPP  = 实现 OLAP 的一种技术架构

例如:

OLAP
 ├─ MPP 数仓
 │   └─ GaussDB(DWS)
 ├─ ClickHouse
 ├─ Spark SQL
 └─ Presto / Trino / HetuEngine

6. 数据集成层:ETL、ELT、CDC

企业数据不会自动进入大数据平台,所以必须存在数据集成层。

              数据集成
                 │
      ┌──────────┼───────────┐
      ▼          ▼           ▼
    数据库       文件         MQ
      │          │           │
      ▼          ▼           ▼
     CDC        ETL       Kafka
      │          │           │
      └──────────┼───────────┘
                 ▼
               数据湖

6.1 ETL

ETL = Extract → Transform → Load

即:

提取
 ↓
转换
 ↓
装载

例如:

Oracle
 ↓
抽取交易记录
 ↓
日期格式统一
身份证脱敏
字段映射
异常数据清洗
 ↓
数据仓库

6.2 ELT

现代数据湖、湖仓越来越多采用:

Extract
   ↓
Load
   ↓
Transform

也就是先把原始数据存入数据湖,再使用 Spark、Flink、SQL 等进行加工。

原因在于:

原始数据未来可能还有新的使用方式,因此先完整保留,再按需加工。

6.3 CDC

CDC = Change Data Capture,变更数据捕获。

如果生产数据库发生:

10:01 INSERT A
10:02 UPDATE B
10:03 DELETE C

CDC 可以通过数据库日志捕获这些变化:

Oracle / MySQL
      │
      │ redo / binlog
      ▼
     CDC
      │
      ▼
    Kafka
      │
      ▼
Flink / 数据湖 / 数据仓库

金融行业大量实时数据链路都会使用 CDC。


7. Kafka / 消息队列在架构中的位置

Kafka 不是数据库,也不是数据湖。

它属于:

分布式事件流 / 消息系统。

在企业大数据平台中,Kafka 常承担实时数据总线。

交易系统
行情系统
风控系统
日志系统
    │
    ▼
  Kafka
    │
 ┌──┼────────────┐
 ▼  ▼            ▼
Flink 数据湖      实时OLAP
 │
 ▼
实时风控

Kafka 的核心价值是解耦:

生产者 → Kafka → 多个消费者

例如一笔交易写入 Topic:

Kafka Topic: trade
        │
        ├→ 风控
        ├→ 行情分析
        ├→ 数据湖
        ├→ 监管系统
        └→ 实时指标

8. 数据湖:现代大数据平台的重要底座

传统架构通常是:

业务数据库
     ↓
    ETL
     ↓
 数据仓库

但企业中大量数据并不适合直接进入传统关系型数据仓库,例如:

JSON
日志
图片
视频
PDF
CSV
文本
语音
IoT
行情原始文件

因此产生了:

Data Lake,数据湖。

核心思想:

尽量保存企业所有类型的原始数据。

覆盖:

结构化数据
半结构化数据
非结构化数据

现代数据湖越来越多采用:

对象存储 / HDFS
        │
  ┌─────┼─────┐
  ▼     ▼     ▼
Spark Flink   SQL引擎

9. 对象存储为什么成为现代数据湖底座

过去 Hadoop 数据湖典型使用:

HDFS

云时代越来越多使用:

Object Storage

典型产品:

AWS → S3
华为云 → OBS

对象存储不是传统文件系统,而是:

Bucket
  ├─ object1
  ├─ object2
  └─ object3

通过 API / HTTP 访问。

现代架构因此逐步形成:

              OBS
        统一数据存储
              │
 ┌────────────┼──────────────┐
 ▼            ▼              ▼
Spark        Flink           DWS
 ▼            ▼              ▼
批处理       实时处理         OLAP

这就是:

存算分离。


10. Hadoop 到底是什么

一个常见误区:

Hadoop = 大数据平台。

不准确。

Hadoop 最初是一套分布式大数据基础框架。

经典核心:

Hadoop
 ├─ HDFS
 │    分布式存储
 ├─ YARN
 │    资源调度
 └─ MapReduce
      分布式计算

后来逐渐形成 Hadoop 生态:

Hadoop Ecosystem
│
├─ HDFS
├─ YARN
├─ Hive
├─ HBase
├─ Spark
├─ Flink
├─ Kafka
├─ ZooKeeper
├─ Ranger
└─ ...

可以粗略理解:

MRS 是企业级、云化、产品化的大数据/Hadoop 生态平台。

一个 MRS 集群可能包含:

HDFS
Hive
Spark
Flink
Kafka
HBase
ClickHouse
HetuEngine
Ranger

FusionInsight Manager 则承担集群统一监控、配置、权限、资源与运维管理。


传统大数据常采用:

昨天的数据
   ↓
夜间跑 ETL
   ↓
第二天出报表

这是典型:

Batch Processing,批处理。

但是金融行业很多业务不能等待,例如:

异常交易
反洗钱
反欺诈
市场监控
实时行情
实时风险

因此需要:

交易产生
   ↓
Kafka
   ↓
Flink
   ↓
实时规则 / 实时模型
   ↓
毫秒~秒级结果

可以简化记忆:

Spark → 更偏大规模批计算
Flink → 更偏实时流计算
Kafka → 实时数据通道

现代平台越来越强调:

流批一体。


12. 数据仓库是什么

数据湖强调:

什么数据都能放。

数据仓库强调:

数据经过严格建模、组织和治理以后,用于分析。

例如金融数据仓库常按主题域建设:

客户主题
账户主题
交易主题
产品主题
机构主题
风险主题

常见数仓分层:

             Raw Data
                 │
                ODS
                 │
                DWD
                 │
                DWS
                 │
                ADS
层次含义
ODSOperational Data Store,贴源/原始层
DWDData Warehouse Detail,明细层
DWSData Warehouse Summary,汇总层
ADSApplication Data Service,应用层

注意:DWS 有两种不同含义

数仓建模语境:

DWS = Data Warehouse Summary

华为云产品语境:

GaussDB(DWS) = Data Warehouse Service

二者不是一回事。


13. 数据湖和数据仓库不是二选一

对比维度数据湖数据仓库
数据类型结构化、半结构化、非结构化主要结构化
Schema灵活严格
原始数据强弱
成本较低相对较高
SQL分析可以很强
BI报表可以很强
数据治理需额外增强天然较强

因此现代架构逐渐发展为:

Lakehouse,湖仓一体

核心理念:

湖的灵活性 + 仓的事务、治理、建模、分析能力。

现代湖仓常用开放表格式:

Iceberg
Hudi
Paimon

这些技术为对象存储上的数据增加:

Schema
ACID
版本
增量读取
Time Travel

14. NoSQL 是什么

NoSQL 不是某一种数据库,而是一大类非传统关系型数据库。

类型典型技术
Key-ValueRedis
DocumentMongoDB
Wide ColumnHBase / Cassandra
GraphNeo4j / GES
Time SeriesInfluxDB

例如:

客户画像
客户ID → 数百/数千个标签

或者:

数百亿条事件记录

可能更适合 HBase 等 NoSQL,而不是传统 MySQL。

MRS 中的 HBase 就属于典型的分布式 NoSQL。


15. 图数据库为什么会独立出现

关系数据库适合:

客户表
交易表
账户表

但当问题变成:

A 和 B 有什么关系?

或:

100 万个账户之间是否存在异常资金网络?

图模型更适合:

       客户A
      /     \
   手机号    银行卡
     |        |
   客户B ----账户C
      \       /
        公司D

图数据库中通常:

Node = 人 / 账户 / 公司 / 设备
Edge = 交易 / 持股 / 控制 / 联系人

金融常见应用:

反洗钱
反欺诈
关联交易
客户关系
企业关系
实控人分析
知识图谱

因此:

图数据库是针对关系网络分析的专用数据引擎。

它不是数据湖或数仓的替代品。


16. “全域全结构生命周期存储”怎么理解

这通常不是一种具体数据库,而是企业数据存储体系的总体目标。

16.1 全域

覆盖:

业务域
管理域
外部数据
互联网数据
IoT 数据

16.2 全结构

覆盖:

结构化
半结构化
非结构化

16.3 全生命周期

覆盖:

产生
 ↓
在线
 ↓
热数据
 ↓
温数据
 ↓
冷数据
 ↓
归档
 ↓
销毁

因此企业级存储通常会组合多种技术:

              企业数据
                 │
 ┌───────────────┼─────────────────┐
 ▼               ▼                 ▼
对象存储         HDFS              DWS
原始/冷数据      大数据             分析
 │
 ├───────────── HBase
 │               在线大数据
 │
 ├───────────── Graph
 │               关系数据
 │
 └───────────── Archive
                 长期归档

17. 数据治理为什么必须独立存在

如果只有:

Kafka + Spark + Flink + HDFS

严格来说只能算:

大数据技术平台。

还不能算成熟的企业数据平台。

因为真正的企业问题往往是:

这个字段是什么意思?
谁产生的?
谁负责?
是不是敏感数据?
质量怎么样?
经过哪些加工?
哪些报表用了它?
为什么两个部门的“客户数”不同?

因此必须建设:

数据标准
元数据
数据目录
数据血缘
数据质量
数据安全
权限
指标
模型
资产

例如一个“交易金额”字段,治理平台需要能够描述:

名称:交易金额
标准编码:TRADE_AMT
类型:DECIMAL(20,2)
业务定义:……
来源:核心交易系统
负责人:交易业务部
安全等级:L3
血缘:
交易系统
 → ODS
 → DWD
 → DWS
 → 风险指标

这时候数据才真正成为:

数据资产。

在华为云体系中,这类能力通常与 DataArts Studio / FusionInsight 数据治理能力对应。


18. 开发管理是什么

开发管理不要和数据治理混淆。

它主要解决:

数据工程师怎么开发、编排、发布和运行数据任务。

典型能力:

SQL 开发
Spark 开发
Flink 开发
Shell
ETL 任务
工作流
依赖关系
定时调度
补数据
版本管理
发布
运行监控
失败重跑

例如:

任务A
 │
 ▼
任务B ─────┐
 │         │
 ▼         ▼
任务C     任务D
   \       /
    ▼     ▼
     任务E

又例如金融机构夜间批处理:

01:00 拉取交易数据
01:20 清洗
02:00 客户汇总
03:00 风险指标
05:00 生成监管报表

19. 数据中台到底是什么

数据中台不是:

  • 一个数据库
  • 一个单独软件
  • 一个 Hadoop 集群
  • 一个单独的数据仓库

更准确的理解是:

数据中台是一套企业级、可复用的数据能力体系。

可以用“采、建、管、用”理解:

                      数据中台
                         │
      ┌──────────┬───────┼───────┬───────────┐
      ▼          ▼       ▼       ▼
      采          建       管       用
      │          │       │       │
数据集成      数据模型   标准    数据API
CDC           指标       质量    数据集市
Kafka         标签       血缘    标签服务
ETL           图谱       安全    自助分析
                         目录    研究沙箱

最终目的不是:

建一个更大的数据库。

而是:

把企业数据变成可复用的数据资产与数据能力。


20. 数据服务:数据中台真正输出价值的地方

如果没有数据服务:

数据平台
   │
   └→ 用户直接查数据库

最终容易出现:

每个系统自己写 SQL
每个部门自己算指标
每个项目自己复制数据

正确方式是把数据资产服务化:

                     数据资产
                        │
            ┌───────────┼───────────┐
            ▼           ▼           ▼
          数据API       指标         标签
            │           │           │
         APP/系统       BI          营销
            │
            ├──────── 数据集市
            │
            ├──────── 自助分析
            │
            └──────── 研究沙箱

因此广义数据服务通常包括:

数据集市
指标服务
标签服务
图谱服务
数据 API
自助分析
研究沙箱

华为 DataArts 的“数据服务”产品能力更偏向:

把数据表/数据资产快速发布为 API,并统一管理 API 生命周期。

但企业架构里的“数据服务层”范围通常更广。


21. 研究沙箱为什么金融机构常见

例如证券研究员希望分析:

过去10年全部A股行情
+
上市公司财务
+
新闻
+
研报

显然不能让研究员直接访问核心生产数据库。

因此会建设:

Research Sandbox,研究沙箱。

企业数据平台
      │
经过授权的数据
      │
      ▼
   Sandbox
      │
 ┌────┼─────┐
 ▼    ▼     ▼
SQL Python Jupyter
 │
 ▼
量化研究 / 建模

典型特点:

计算环境隔离
数据权限受控
资源配额
可审计
结果导出受控

这在银行、证券、交易所等机构非常常见。


22. 最上层:大数据应用

整个大数据平台最终是为业务服务。

              大数据平台
                  │
 ┌────────────────┼──────────────────┐
 ▼                ▼                  ▼
风险             经营                营销
 │                │                  │
反欺诈           BI                 客群
AML              KPI                标签
实时风控         报表                推荐
 │
 ▼
监管
 │
监管报送
市场监察
异常交易

证券交易所典型场景:

实时行情分析
市场异常交易监控
会员画像
上市公司分析
监管报送
风险监控
知识图谱
量化研究
历史行情分析

23. 将已知架构模块放回总体架构

模块在整体架构中的角色典型技术
开发管理数据研发与任务编排平台SQL、Spark、Flink、调度
实时流计算实时计算Kafka + Flink
数据湖全量原始数据底座OBS / HDFS
数据仓库高质量结构化分析MPP / DWS
图数据库关系网络分析Graph / GES
数据治理企业数据管理元数据、质量、血缘、标准
全域全结构生命周期存储统一存储体系OBS、HDFS、DWS、HBase、归档

这些模块之间:

不是竞争关系,而是组合关系。


24. 华为云 / HCS / FusionInsight 常见能力映射

注意:不同 HCS / FusionInsight 版本的具体产品组合、组件名和交付形态可能不同,以下更适合作为架构映射,而不是固定 BOM。

企业能力通用技术华为体系常见对应
OLTP 数据库MySQL / PostgreSQL / OracleGaussDB / RDS 等
数据集成ETL / CDCDataArts / CDM 等
消息 / 实时总线KafkaMRS Kafka
实时计算FlinkMRS Flink
批处理SparkMRS Spark
Hadoop 存储HDFSMRS HDFS
SQL on HadoopHiveMRS Hive
NoSQLHBaseMRS HBase
实时 OLAPClickHouseMRS ClickHouse
联邦查询Trino / Presto 类HetuEngine
数据湖Object Storage / HDFSOBS + MRS
湖元数据Hive Metastore 类LakeFormation
企业数仓MPP DatabaseGaussDB(DWS)
数据治理Catalog / Quality / LineageDataArts Studio / FusionInsight 相关治理能力
图计算Graph DBGES / 图计算相关能力
集群运维Cluster ManagerFusionInsight Manager

25. 三组最容易混淆的概念

25.1 数据湖、数据仓库、数据中台

数据湖
    ↓
解决“数据怎么统一存”

数据仓库
    ↓
解决“数据怎么高质量分析”

数据中台
    ↓
解决“数据怎么形成企业可复用能力”

因此:

湖、仓更多属于技术/数据架构,中台更多属于企业数据能力架构。


25.2 Kafka、Flink、Spark、DWS

这几个产品/技术不是同一类东西:

Kafka
数据流通

Flink
实时计算

Spark
批计算 / 通用计算

DWS
MPP 分析数据库

典型完整链路:

       OLTP
        │
       CDC
        │
        ▼
      Kafka
        │
        ▼
      Flink
      /   \
     ▼     ▼
   HBase   数据湖
             │
            Spark
             │
             ▼
            DWS
             │
             ▼
             BI

25.3 技术平台、治理平台、数据服务

技术平台
MRS / DWS / OBS
     │
     ▼
负责“算和存”

治理平台
DataArts 等
     │
     ▼
负责“把数据管好”

数据服务
API / 指标 / 标签 / 集市
     │
     ▼
负责“把数据提供出去”

26. 证券交易所场景的一条完整数据链路

                       【交易系统】
                           │
                        OLTP
                           │
                   CDC / 实时采集
                           │
                           ▼
                        Kafka
                           │
                ┌──────────┴──────────┐
                ▼                     ▼
              Flink                 Data Lake
           实时规则计算             OBS/HDFS
                │                     │
                ▼                     ▼
           异常交易告警             Spark
                                      │
                                      ▼
                              ODS → DWD → DWS
                                      │
                           ┌──────────┼──────────┐
                           ▼          ▼          ▼
                         DWS       HBase       Graph
                           │          │          │
                           ▼          ▼          ▼
                         BI       客户画像     关系网络
                           │
                           └─────┬────┘
                                 ▼
                              数据资产
                                 │
                ┌────────────────┼───────────────┐
                ▼                ▼               ▼
              指标             标签             图谱
                │                │               │
                └────────────────┼───────────────┘
                                 ▼
                              数据服务
                                 │
                ┌────────────────┼───────────────┐
                ▼                ▼               ▼
             数据API          自助分析        研究沙箱
                │
                ▼
        风控 / 监管 / 投研 / BI / AI

横向贯穿整个体系的能力:

数据治理
数据安全
元数据
数据血缘
数据质量
数据标准
开发管理
任务调度
平台运维
资源管理
多租户

27. 建议后续学习顺序

建议不要再随机补术语,而是按以下顺序系统学习:

  1. 企业大数据平台总体架构与数据流

    • 建立“数据源 → 接入 → 存储 → 计算 → 治理 → 服务 → 应用”的整体框架。
  2. Hadoop / MRS 内部架构

    • HDFS
    • YARN
    • Hive
    • Spark
    • HBase
    • ZooKeeper
    • Ranger
    • HetuEngine
  3. 实时数据平台

    • Kafka
    • Topic
    • Partition
    • Consumer Group
    • Flink
    • Checkpoint
    • Exactly Once
    • CDC
  4. 数据湖与湖仓

    • OBS / HDFS
    • 存算分离
    • LakeFormation
    • Hive Metastore
    • Parquet / ORC
    • Iceberg / Hudi / Paimon
  5. 企业数据仓库

    • OLAP
    • MPP
    • Shared-Nothing
    • 事实表 / 维表
    • 星型模型 / 雪花模型
    • ODS / DWD / DWS / ADS
    • GaussDB(DWS)
  6. 数据治理与数据中台

    • 元数据
    • 血缘
    • 标准
    • 质量
    • 指标
    • 标签
    • 资产目录
    • DataArts / FusionInsight 治理能力
  7. 数据服务体系

    • 数据集市
    • 数据 API
    • 指标服务
    • 标签服务
    • 图谱服务
    • 自助分析
    • 研究沙箱
  8. 金融级非功能架构

    • 两地三中心
    • 同城双活
    • 容灾
    • RPO / RTO
    • 多租户
    • 数据权限
    • 脱敏
    • 审计
    • 监管合规
  9. 金融典型业务架构

    • 实时风控
    • 反洗钱
    • 市场监察
    • 监管报送
    • 客户 360
    • 投研
    • AI

28. 最终理解目标

当看到一张企业大数据平台总体架构图时,应能够沿着下面这条主线逐层解释:

数据源
  ↓
数据接入
  ↓
消息 / CDC
  ↓
统一存储
  ↓
批处理 / 流处理
  ↓
数据湖 / 数据仓库 / 湖仓
  ↓
数据治理
  ↓
数据资产
  ↓
数据服务
  ↓
大数据应用 / AI 应用

并能够判断每个模块到底属于:

存储
计算
数据集成
数据治理
数据开发
数据资产
数据服务
业务应用

而不是只停留在识别产品 Logo 的层面。


29. 一句话总结

企业级大数据平台不是某一个产品,而是一套围绕“数据全生命周期”构建的企业数据基础设施:底层负责采集、存储和计算,中间负责治理和资产化,上层通过数据服务向业务、分析、监管和 AI 输出可复用的数据能力。


Share this post:

Previous Post
工业级 Agent Session:Event Log、State Reducer、Resume 与 Replay