Cloud Dataproc
1. 核心定位
Section titled “1. 核心定位”Google Cloud Dataproc 是一项全面托管且高度可扩缩的服务,用于在云端运行 Apache Spark、Apache Flink、Presto 以及超过 30 种开源 Hadoop 生态组件。其核心价值在于降低集群部署与调优门槛,并实现与云端存储(GCS)的无缝集成。
2. 核心组件支持
Section titled “2. 核心组件支持”Dataproc 默认内置了数据科学计算的常用环境:
- 核心计算引擎:Apache Spark, Hadoop MapReduce.
- 环境隔离与包管理:Anaconda (支持灵活挂载 Python 数据科学依赖包).
3. 自动化运维实战:通过 CLI 动态拉起集群
Section titled “3. 自动化运维实战:通过 CLI 动态拉起集群”在现代数据工程中,Dataproc 常配合 Airflow 等调度器实现“即用即拉起,算完即销毁”的极致弹性。
3.1. 初始化集群并挂载 Python 依赖包
Section titled “3.1. 初始化集群并挂载 Python 依赖包”通过 gcloud 命令行在指定 Region 启动集群,并利用 properties 参数要求底层 Anaconda 环境在启动前预装所需的 ML 库(如 PyTorch、HuggingFace Tokenizers):
gcloud dataproc clusters create my-ml-cluster \ --image-version=2.0 \ --region=${REGION} \ --properties="^#^dataproc: conda.packages ='pytorch ==1.7.1, coverage== 5.5'#dataproc: pip.packages ='tokenizers ==0.10.1, datasets== 1.5.0'"