Kursus Temu Duga Sains Data

Kursus temu duga sains data berstruktur merangkumi statistik, Python, SQL, pembelajaran mesin, metrik produk dan ujian A/B dengan soalan latihan.

Tahap: Data Science Interview Kesukaran: intermediate 5 pelajaran 60 min
Kemajuan kursus 0 / 5
Kembali ke kursus

Apa yang akan anda pelajari

  • Memahami format temu duga.
  • Menjelaskan statistik, kebarangkalian dan ujian.
  • Menulis pandas dan SQL.
  • Menjelaskan pembelajaran mesin dan metrik.
  • Mereka eksperimen dan mentafsir metrik.

Sebelum bermula

  • Pengetahuan Python dan SQL membantu.
  • Disyorkan memahami asas statistik.
  • Latihan pandas dan pangkalan data tempatan membantu.

Pelajaran 1 Memahami Temu Duga Sains Data

Temu duga sains data menggabungkan statistik, pengaturcaraan, SQL, pembelajaran mesin dan pertimbangan perniagaan. Calon perlu menerangkan konsep, menulis kod, mentafsir metrik dan menyelesaikan kes. Mulakan dengan statistik, kemudian Python dan pandas, SQL, pembelajaran mesin, akhirnya metrik produk dan ujian A/B. Terangkan p-value dan selang keyakinan, tulis operasi pandas, gabungkan jadual SQL, terangkan precision dan recall, reka eksperimen. Kursus ini menyusun topik dalam lima pelajaran dengan 60 soalan asli.

Contoh

Contoh: terangkan precision dan recall apabila ditanya model klasifikasi tak seimbang.

Pelajaran 2 Statistik dan Kebarangkalian

Soalan statistik menguji pemahaman ketidakpastian dan ringkasan data. P-value ialah kebarangkalian data ekstrem di bawah hipotesis nol. Selang keyakinan memberi julat parameter. Sisihan piawai mengukur sebaran dan median lebih mantap. Korelasi tidak membuktikan sebab. Ujian biasa: t-test dua sampel, chi-square, ANOVA. Poisson memodelkan kiraan dan Bayes mengemas kini kebarangkalian. Terangkan dengan definisi dan contoh.

Contoh

Contoh: selang keyakinan 95% [10, 20] bermaksud selang itu mungkin mengandungi min sebenar.

Pelajaran 3 Python, pandas dan SQL

Temu duga sering merangkumi kod pandas dan SQL. Dalam pandas: read_csv, head, describe, dropna, fillna, groupby, merge, value_counts, apply. NumPy memberi tatasusunan dan Matplotlib mencipta plot. Dalam SQL: WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, join, agregasi. Latih menulis operasi ini dengan lancar.

Contoh

Contoh: df.groupby("city")["sales"].mean() mengembalikan purata jualan setiap bandar.

Pelajaran 4 Konsep Pembelajaran Mesin

Soalan pembelajaran mesin merangkumi supervised vs unsupervised, penilaian dan algoritma. Logistic regression untuk klasifikasi, linear regression untuk ramalan, K-means untuk kluster. Overfitting dikurangkan dengan kedalaman, pruning, regularisasi. Cross-validation menilai model. Precision, recall, F1 penting untuk data tak seimbang. Terangkan algoritma dan tradeoff dengan jelas.

Contoh

Contoh: gunakan F1 daripada accuracy apabila satu kelas jauh lebih jarang.

Pelajaran 5 Kes, Metrik dan Strategi

Kes produk meminta mentakrifkan masalah, memilih metrik, merancang eksperimen dan membuat keputusan. Conversion rate, retention, churn ialah metrik utama. Analisis kohort menjejak kumpulan. Ujian A/B membandingkan kawalan dan rawatan. Hipotesis nol menganggap tiada kesan dan p-value rendah menunjukkan bukti. Fikir berstruktur: matlamat, populasi, metrik, saiz sampel, keputusan.

Contoh

Contoh: untuk perubahan checkout, ukur conversion rate sebagai metrik utama dan error rate sebagai pelindung.