SKILL.md
只读
名称
data-analytics
描述
使用 PlantUML 语法配合数据库与数据分析 Stencil 图标,快速绘制数据管道与分析架构图。非常适合 ETL 管道、数据湖、实时流处理、数据仓库以及 BI 仪表盘设计等场景。
数据分析架构图生成器
快速上手: 定义数据源 → 声明数据接入/ETL 图标 → 连接至存储/数据仓库 → 添加 BI/可视化展示 → 包裹在 ```plantuml 代码块中。
⚠️ 重要提示: 请务必使用
```plantuml或```puml代码块围栏。绝对不要使用```text—— 否则将无法正常渲染为图表。
核心规则
- 每个图表均需以
@startuml开头,并以@enduml结尾 - 数据管道建议使用
left to right direction(从左到右方向:数据源 → 接入 → 转换 → 存储 → 可视化) - 数据分析、数据库及存储图标统一使用
mxgraph.aws4.*Stencil 语法 - 默认颜色会自动应用 —— 无需显式指定
fillColor或strokeColor - 使用
rectangle "Zone" { ... }或package "Layer" { ... }来对管道的不同阶段/层级进行分组 - 有向数据流使用
-->,异步/流式数据流使用..>(虚线)
完整 Stencil 参考手册: 参见 stencils/README.md 查看 9500+ 个可用图标。
Mxgraph Stencil 语法
mxgraph.aws4.<icon> "Label" as <alias>
数据分析与 ETL Stencil 图标
| 类别 | Stencil 图标 | 用途 |
|---|---|---|
| Query Engine | athena, athena_data_source_connectors |
无服务器化 S3 数据 SQL 查询 |
| ETL | glue, glue_crawlers, glue_data_catalog, aws_glue_data_quality, aws_glue_for_ray |
数据集成与数据目录管理 |
| Streaming | kinesis, kinesis_data_streams, kinesis_data_firehose, kinesis_data_analytics, kinesis_video_streams |
实时数据流处理 |
| MapReduce | emr, emr_engine, emr_engine_mapr_m3, emr_engine_mapr_m5 |
大数据计算处理(Spark、Hive 等) |
| Data Warehouse | redshift, redshift_ra3, redshift_streaming_ingestion, redshift_ml |
列式数据分析仓库 |
| Search | opensearch_service_data_node, opensearch_ingestion, cloudsearch |
全文检索与日志分析 |
| BI | quicksight |
仪表盘与数据可视化 |
| Data Lake | lake_formation, s3, glacier, glacier_deep_archive |
受控数据湖存储 |
| Catalog | datazone_custom_asset_type, data_exchange |
数据治理与共享 |
| Streaming Kafka | msk, msk_connect |
托管 Kafka 数据流 |
数据库 Stencil 图标
| 类别 | Stencil 图标 | 用途 |
|---|---|---|
| Relational | aurora, aurora_instance, rds, rds_instance, rds_mysql_instance, rds_postgresql_instance |
关系型事务数据库 |
| NoSQL | dynamodb, dynamodb_table, dynamodb_global_secondary_index, dynamodb_stream |
键值与文档数据库 |
| Graph | neptune |
图数据库 |
| In-Memory | elasticache, elasticache_for_redis, elasticache_for_memcached |
缓存与 Session 存储 |
| Document | documentdb, documentdb_with_mongodb_compatibility |
文档型数据库 |
| Ledger | quantum_ledger_database |
不可篡改的交易日志数据库 |
| Wide-Column | keyspaces |
兼容 Cassandra 的宽列数据库 |
连接类型
| 语法 | 含义 | 适用场景 |
|---|---|---|
A --> B |
实线箭头 | 批处理数据流 / API 调用 |
A ..> B |
虚线箭头 | 流式传输 / 异步 / CDC(变更数据捕获) |
A -- B |
实线 | 双向同步 |
A --> B : "label" |
带标签连接 | 描述数据格式或数据量 |
快速示例
@startuml
left to right direction
mxgraph.aws4.s3 "Data Lake\n(S3)" as s3
mxgraph.aws4.glue "Glue\nETL" as glue
mxgraph.aws4.redshift "Redshift" as rs
mxgraph.aws4.quicksight "QuickSight" as qs
s3 --> glue
glue --> rs
rs --> qs
@enduml
数据分析架构类型
| 类型 | 用途 | 核心 Stencil 图标 | 示例 |
|---|---|---|---|
| Data Lake | 集中式原始数据存储 | s3, lake_formation, glue, athena |
data-lake.md |
| Real-time Streaming | 事件流处理 | kinesis, msk, lambda_function, opensearch_service |
real-time-streaming.md |
| Data Warehouse | 星型模型数据分析 | redshift, glue, quicksight |
data-warehouse.md |
| ETL Pipeline | 提取-转换-加载 | glue, glue_crawlers, glue_data_catalog, s3 |
etl-pipeline.md |
| Log Analytics | 集中式日志分析 | kinesis_data_firehose, opensearch_service, lambda_function |
log-analytics.md |
| ML Feature Store | 特征工程流水线 | glue, s3, athena, emr |
ml-feature-pipeline.md |
| CDC Pipeline | 数据库变更数据捕获 | dynamodb_streams, kinesis, lambda_function, redshift |
cdc-pipeline.md |
| Multi-source BI | 跨数据库报表展示 | aurora, dynamodb, redshift, quicksight |
multi-source-bi.md |






