GCP Professional Machine Learning Engineer 课程

系统化的 GCP Professional Machine Learning Engineer 课程,覆盖 ML 架构、数据管道、Vertex AI 建模、扩展、安全与 MLOps,并配有练习题。

等级: Google Cloud Professional Machine Learning Engineer Certification 难度: advanced 5 节课 60 分钟
原创练习内容:本页题目为本站独立编写的练习题,不是官方真题,与任何考试机构均无关联、未获其背书。
课程进度 0 / 5
返回课程

你将学到

  • 描述 Vertex AI 架构。
  • 构建高性能数据管道。
  • 使用 Vertex AI 训练和服务模型。
  • 解释扩展、安全与合规。
  • 描述 MLOps、监控与治理。

开始前准备

  • 建议具备构建机器学习模型的实践经验。
  • 熟悉 Google Cloud 数据与 ML 服务会有帮助。
  • 了解 Python 和容器化工作负载会更好。

课程 1 使用 Vertex AI 架构机器学习解决方案

Google Cloud Professional Machine Learning Engineer 考试验证基于 Google Cloud 设计、构建和运维生产级机器学习系统的能力。Vertex AI 是核心平台:提供训练任务、AutoML、模型注册表、端点、Pipeline、实验、特征商店和向量检索。架构师要选择合适的托管服务组合,用 Pipeline 实现可复现流程,并分离实验追踪、模型版本管理和预测服务等职责。Feature Store 提供在线和离线特征服务,Model Garden 提供精选模型,TensorBoard 帮助比较训练运行。

示例

示例:团队使用 Vertex AI Pipelines、Experiments、Feature Store 和端点,将推荐模型从实验阶段可复现地推进到生产环境。

课程 2 构建高性能数据管道

高性能机器学习依赖可靠且可扩展的数据管道。BigQuery 提供 SQL 分析和 BigQuery ML,Dataflow 统一流批处理,Pub/Sub 接收实时事件,Cloud Storage 保存训练产物。Dataproc 运行 Spark 特征工程,Cloud Composer 编排定时工作流。BigQuery reservation 和 slot 自动扩缩控制查询容量与成本。Vertex AI Datasets 管理带标签训练数据的版本,Dataflow 模板让管道可重复。

示例

示例:流式风控特征管道从 Pub/Sub 读取事件,用 Dataflow 转换,将特征存入 Feature Store 并服务于在线端点。

课程 3 在 Vertex AI 上训练和服务模型

Vertex AI 同时支持自定义训练和自动化训练。自定义训练任务运行你自己的容器,AutoML 以少量代码训练模型,超参数调优自动搜索最佳设置。Vizier 提供黑盒优化,Explainable AI 生成特征归因,Forecast 等服务处理时序问题。自定义预测容器可完全控制部署环境。模型存入 Model Registry 并部署到端点,用流量拆分实现分批上线。

示例

示例:团队用超参数调优训练自定义容器,注册最佳版本,并用 10% 流量拆分分批上线。

课程 4 扩展、安全与合规

生产级机器学习既要可预测地扩展,也要保护数据。Vertex AI 端点通过最小/最大副本数和自动扩缩吸收流量,批量预测处理大规模离线任务。GPU 和 TPU 配额控制加速器可用性,BigQuery slot 自动扩缩调整分析容量。安全上组合 VPC Service Controls 边界、Cloud KMS 客户管理密钥、私有端点和最小权限服务账号。Cloud DLP 在训练前脱敏敏感数据,Confidential VM 保护使用中的数据。

示例

示例:端点设置最小副本 2、最大副本 10,同时用 VPC Service Controls 和私有端点将预测流量限制在组织内部。

课程 5 MLOps、监控与治理

MLOps 让模型上线后仍然可靠、可治理。Vertex AI Model Monitoring 检测训练-服务偏差和数据漂移,Model Registry 用版本和别名管理分批上线。Pipeline 缓存跳过未变化的步骤,Experiments 与 Metadata 记录产物和血缘。Cloud Logging 收集审计与运维日志,持续训练在数据更新时自动重训。

示例

示例:监控对预测漂移告警,Pipeline 自动重训模型,Registry 用渐进流量拆分提升新版本。