Curso de Entrevista de Ciencia de Datos

Un curso estructurado de entrevista de ciencia de datos que cubre estadística, Python, SQL, machine learning, métricas y pruebas A/B con preguntas enlazadas.

Nivel: Data Science Interview Dificultad: intermediate 5 lecciones 60 min
Progreso del curso 0 / 5
Volver a los cursos

Qué aprenderás

  • Comprender el formato de entrevista.
  • Explicar estadística, probabilidad y pruebas.
  • Escribir pandas y SQL.
  • Explicar machine learning y métricas.
  • Diseñar experimentos e interpretar métricas.

Antes de empezar

  • Conocer Python y SQL ayuda.
  • Se recomienda estadística básica.
  • Practicar con pandas y una base local ayuda.

Lección 1 Comprender la Entrevista de Ciencia de Datos

Las entrevistas de ciencia de datos combinan estadística, programación, SQL, machine learning y criterio de negocio. Debes explicar conceptos, escribir código, interpretar métricas y resolver casos. Empieza por estadística, luego Python y pandas, SQL, machine learning y finalmente métricas y pruebas A/B. Define p-values e intervalos, escribe pandas, une tablas, explica precisión y recall y diseña experimentos. Este curso organiza los temas en cinco lecciones con 60 preguntas originales.

Ejemplo

Ejemplo: explica precisión y recall en un modelo de clasificación desbalanceado.

Lección 2 Estadística y Probabilidad

Las preguntas de estadística evalúan incertidumbre y resúmenes. Un p-value es la probabilidad de observar datos extremos bajo la hipótesis nula. Los intervalos de confianza dan un rango probable. La desviación estándar mide dispersión y la mediana es robusta. La correlación no prueba causalidad. Pruebas comunes: t de dos muestras, chi-cuadrado y ANOVA. Poisson modela conteos y Bayes actualiza probabilidades. Explica con definiciones y ejemplos.

Ejemplo

Ejemplo: un intervalo de confianza del 95% de [10, 20] probablemente contiene la media real.

Lección 3 Python, pandas y SQL

Las entrevistas incluyen código con pandas y SQL. En pandas: read_csv, head, describe, dropna, fillna, groupby, merge, value_counts y apply. NumPy da arrays y Matplotlib grafica. En SQL: WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, joins y agregados. Practica escribir estas operaciones con fluidez.

Ejemplo

Ejemplo: df.groupby("city")["sales"].mean() devuelve las ventas medias por ciudad.

Lección 4 Conceptos de Machine Learning

Las preguntas cubren aprendizaje supervisado y no supervisado, evaluación y algoritmos. La regresión logística clasifica, la lineal predice valores y K-means agrupa. El sobreajuste se reduce con profundidad, poda y regularización. La validación cruzada evalúa en varias particiones. Precisión, recall y F1 importan en datos desbalanceados. Explica algoritmos y tradeoffs con claridad.

Ejemplo

Ejemplo: usa F1 en lugar de accuracy cuando una clase es mucho más rara.

Lección 5 Casos, Métricas y Estrategia

Los casos piden definir el problema, elegir métricas, diseñar un experimento y decidir acciones. La tasa de conversión, retención y churn son métricas clave. El análisis de cohortes sigue grupos. A/B testing compara control y tratamiento. La hipótesis nula asume sin efecto y un p-value bajo sugiere evidencia. Piensa en estructura: objetivo, población, métricas, tamaño de muestra y decisiones.

Ejemplo

Ejemplo: para un cambio de checkout, mide la tasa de conversión y usa la tasa de error como guardrail.