跳转到内容

Cloud Dataproc

Google Cloud Dataproc 是一项全面托管且高度可扩缩的服务,用于在云端运行 Apache Spark、Apache Flink、Presto 以及超过 30 种开源 Hadoop 生态组件。其核心价值在于降低集群部署与调优门槛,并实现与云端存储(GCS)的无缝集成。


Dataproc 默认内置了数据科学计算的常用环境:

  • 核心计算引擎:Apache Spark, Hadoop MapReduce.
  • 环境隔离与包管理:Anaconda (支持灵活挂载 Python 数据科学依赖包).

3. 自动化运维实战:通过 CLI 动态拉起集群

Section titled “3. 自动化运维实战:通过 CLI 动态拉起集群”

在现代数据工程中,Dataproc 常配合 Airflow 等调度器实现“即用即拉起,算完即销毁”的极致弹性。

3.1. 初始化集群并挂载 Python 依赖包

Section titled “3.1. 初始化集群并挂载 Python 依赖包”

通过 gcloud 命令行在指定 Region 启动集群,并利用 properties 参数要求底层 Anaconda 环境在启动前预装所需的 ML 库(如 PyTorch、HuggingFace Tokenizers):

Terminal window
gcloud dataproc clusters create my-ml-cluster \
--image-version=2.0 \
--region=${REGION} \
--properties="^#^dataproc: conda.packages ='pytorch ==1.7.1, coverage== 5.5'#dataproc: pip.packages ='tokenizers ==0.10.1, datasets== 1.5.0'"