数据科学面试课程

面向数据科学面试的结构化课程,涵盖统计、概率、Python、pandas、SQL、机器学习、产品指标与 A/B 测试,并配有练习题。

等级: Data Science Interview 难度: intermediate 5 节课 60 分钟
课程进度 0 / 5
返回课程

你将学到

  • 理解数据科学面试形式。
  • 解释统计、概率和假设检验。
  • 编写 pandas 操作和 SQL 查询。
  • 解释机器学习概念和指标。
  • 设计实验并解读产品指标。

开始前准备

  • 具备基础 Python 和 SQL 知识会有帮助。
  • 建议熟悉统计学基础。
  • 练习 pandas 和本地数据库会有帮助。

课程 1 了解数据科学面试

数据科学面试考察统计、编程、SQL、机器学习和业务判断的综合能力。面试官会要求解释概念、编写代码、解读指标并解决开放式案例。建议先学习统计与概率,再学习 Python 和 pandas、SQL、机器学习,最后学习产品指标与 A/B 测试。你需要能解释 p 值和置信区间,编写 pandas 操作,连接 SQL 表,解释精确率和召回率,并设计简单实验。面试官看重清晰的推理、正确的术语和实际的取舍。本课程把主题分成五节,并配有 60 道原创练习题供面试前复习。

示例

示例:被问到不平衡分类模型时,解释精确率和召回率。

课程 2 统计与概率

统计题考察你对不确定性和数据总结的理解。p 值是当原假设为真时,观察到至少与样本一样极端的数据的概率,而不是假设为真的概率。置信区间以所选置信水平给出可能包含参数的区间。标准差衡量均值周围的离散程度,中位数比均值更抗离群值。相关性衡量线性关系的强度和方向,但不证明因果关系。常见检验包括双样本 t 检验、卡方检验和 ANOVA。泊松分布建模固定区间内的事件数,贝叶斯定理用证据更新概率。面试官希望看到清晰定义和例子,而不是背诵公式。

示例

示例:95% 置信区间 [10, 20] 表示该区间很可能包含真实均值。

课程 3 Python、pandas 与 SQL

数据科学面试常包含 pandas 和 SQL 的现场编码。pandas 中,read_csv 加载数据,head 显示前几行,describe 给出摘要统计,dropna 删除缺失值,fillna 填充缺失值。groupby 分组聚合,merge 像 SQL 一样连接 DataFrame,value_counts 统计唯一值,apply 对元素运行函数。NumPy 提供数组,Matplotlib 创建图表。SQL 中,WHERE 过滤行,GROUP BY 分组,HAVING 过滤组,ORDER BY 排序,LIMIT 限制行数。INNER JOIN 保留匹配,LEFT JOIN 保留左表全部行,DISTINCT 去重。聚合函数包括 COUNT、AVG、SUM、MIN、MAX。要多练习这些操作,因为面试官常要求最简单正确的答案。

示例

示例:df.groupby("city")["sales"].mean() 返回每个城市的平均销售额。

课程 4 机器学习概念

机器学习问题聚焦监督与无监督学习、模型评估和常见算法。监督学习使用有标签数据做分类或回归,聚类是无监督。逻辑回归常用于二分类,线性回归预测连续值,K-means 寻找聚类。过拟合是模型学习了噪声,限制树深度、剪枝和正则化有帮助。交叉验证通过多次划分评估模型。精确率是真阳性除以预测阳性,召回率是真阳性除以实际阳性,F1 平衡两者。对于不平衡数据,准确率可能有误导性,因此常优先使用 F1、精确率和召回率。面试官希望你把算法与业务问题联系起来,并清晰解释取舍。

示例

示例:当一个类别明显更少时,使用 F1 而不是准确率。

课程 5 案例、指标与策略

产品案例题要求你定义问题、选择指标、设计实验并说明如何处理结果。指标是可衡量的值,例如转化率、留存率、流失率或每用户收入。转化率是转化除以访客,留存率是回访用户占比,流失率是停止使用的用户。同期群分析随时间跟踪群体。A/B 测试随机分配用户到对照组和实验组,以衡量改动效果。原假设假设无效果,低 p 值表明结果不太可能由偶然造成。面试官希望看到结构化思考:明确目标、定义人群、选择主要指标和护栏指标、估算样本量并决定下一步。要练习解释指标为何变化以及接下来会调查什么。

示例

示例:对结账改动,以转化率为主要指标,以错误率为护栏指标。