AWS Machine Learning Specialty 课程

系统化的 AWS Machine Learning Specialty 课程,覆盖数据工程、模型训练、安全、部署、监控、MLOps 和优化,并配有练习题。

等级: AWS Machine Learning Specialty 难度: advanced 5 节课 60 分钟
课程进度 0 / 5
返回课程

你将学到

  • 描述数据工程与准备。
  • 解释模型训练与算法。
  • 描述安全与合规。
  • 解释部署与推理。
  • 描述监控、MLOps 与优化。

开始前准备

  • 具备基础 AWS 知识会有帮助。
  • 建议了解一些 Python 或机器学习基础。
  • 无需之前的 AWS 认证。

课程 1 数据工程与准备

AWS Machine Learning Specialty 考试验证在 AWS 上设计、构建和运营机器学习解决方案的能力。数据工程是第一步:S3 存储原始数据集,Athena 直接查询 S3 中的数据,AWS Glue 准备和编目数据。特征存储集中管理可复用特征,Data Wrangler 提供可视化准备。团队把数据分为训练集、验证集和测试集,归一化数值特征,处理类别变量,并避免数据泄漏。高质量的数据准备直接影响模型准确性和可靠性。 复习时把 S3、Glue、算法、安全和部署工具做成卡片,每天快速回忆,再完成几道同类题巩固。错题要写出正确推理,并把最弱主题放在每周练习的最前面。

示例

示例:团队把原始交易存储在 S3,使用 Glue 清洗数据,为可复用特征创建特征存储,并把最终数据集分为训练集、验证集和测试集。

课程 2 模型训练与算法

模型训练使用 SageMaker 内置算法和自定义容器。Linear Learner 支持回归,XGBoost 处理表格分类和回归,K-Means 聚类,PCA 降维。超参数在训练前设置,epoch 是数据遍历次数,损失函数衡量误差。过拟合发生在模型记住训练数据时。提前停止、验证集、迁移学习和混淆矩阵有助于构建可靠模型。 复习时把 S3、Glue、算法、安全和部署工具做成卡片,每天快速回忆,再完成几道同类题巩固。错题要写出正确推理,并把最弱主题放在每周练习的最前面。

示例

示例:回归团队使用 Linear Learner,监控验证损失,应用提前停止,并在分类试点中用混淆矩阵评估最终模型。

课程 3 安全与合规

安全与合规保护数据和模型。IAM 控制用户和角色,KMS 管理加密密钥,VPC 提供网络隔离,VPC 端点提供私有访问。TLS 保护传输中的数据,CloudTrail 审计 API 调用,最小权限只授予所需权限。笔记本实例使用 IAM 角色,私有端点把推理保持在 VPC 内。静态和传输中的数据加密是机器学习工作负载的核心要求。 复习时把 S3、Glue、算法、安全和部署工具做成卡片,每天快速回忆,再完成几道同类题巩固。错题要写出正确推理,并把最弱主题放在每周练习的最前面。

示例

示例:医疗机器学习工作负载使用 KMS 加密,在 VPC 内运行,使用私有端点,并只允许所需的最小 IAM 权限。

课程 4 部署与推理

部署与推理把模型投入生产。实时端点提供实时预测,批量转换处理大数据集,推理管道串联预处理和预测。端点配置定义模型、实例和容量;自动扩展调整容量;生产变体路由流量进行 A/B 测试。Serverless 和批量选项可以降低成本并匹配工作负载模式。 复习时把 S3、Glue、算法、安全和部署工具做成卡片,每天快速回忆,再完成几道同类题巩固。错题要写出正确推理,并把最弱主题放在每周练习的最前面。

示例

示例:零售商使用实时端点提供产品推荐,使用批量转换进行夜间评分,并使用自动扩展处理流量高峰。

课程 5 监控、MLOps 与优化

监控与 MLOps 让模型保持可靠。CloudWatch 监控端点指标和告警;Model Monitor 检测数据漂移;Experiments 跟踪运行;Pipelines 自动化工作流;血缘记录工件关系;Clarify 检测偏差。优化使用 Spot 训练、分布式训练、Autopilot、自动调参、合适的实例、模型压缩和成本审查。团队在出现漂移时重新训练,并使用 MLOps 让更新可重复。 复习时把 S3、Glue、算法、安全和部署工具做成卡片,每天快速回忆,再完成几道同类题巩固。错题要写出正确推理,并把最弱主题放在每周练习的最前面。

示例

示例:团队使用 CloudWatch 告警、Model Monitor 漂移检测和 SageMaker Pipelines,当漂移超过阈值时使用最近数据重新训练。