Pertemuan 4: Exploratory Data Analysis (EDA)

Tujuan Pembelajaran

Setelah mengikuti pertemuan ini, mahasiswa diharapkan mampu menerapkan konsep dan keterampilan berikut secara mandiri.

  • Memahami tujuan dan ruang lingkup Exploratory Data Analysis.
  • Membaca informasi struktur dan tipe data dengan info().
  • Menginterpretasi ringkasan statistik dan korelasi.
  • Menarik kesimpulan awal sebelum membangun model.

Exploratory Data Analysis atau EDA adalah proses menyelidiki data sebelum modeling: menemukan pola, mengidentifikasi anomali, menguji asumsi, dan merangkum karakteristik utama. EDA menjawab pertanyaan tentang data dulu, baru pertanyaan tentang modelMengaitkan EDA dengan pertanyaan bisnis: data apa yang paling berpengaruh, apakah ada pola musiman, adakah anomali yang mencurigakan. Jawabannya ditemukan lewat eksplorasi, bukan lewat model.

Mengenal Struktur Data

Langkah pertama adalah mengenali bentuk data: jumlah baris dan kolom, tipe setiap kolom, serta keberadaan nilai kosong. Fungsi df.shape, df.info(), dan df.head() memberikan gambaran awal yang cepat.Menjelaskan bahwa EDA bukan sekadar menjalankan fungsi, tetapi aktivitas bertanya kepada data. Setiap angka yang muncul harus ditafsirkan: mengapa kolom ini banyak kosong, mengapa ada nilai ekstrem, dan apa maknanya bagi masalah yang sedang dipecahkan.

import pandas as pd
df = pd.read_csv("data.csv")
print(df.head())
print(df.info())
print(df.shape)

Ringkasan Statistik

df.describe() menghasilkan statistik dasar kolom numerik: jumlah data valid, rata-rata, standar deviasi, kuartil, minimum, dan maksimum. Rentang antara minimum dan maksimum menunjukkan sebaran, sementara perbedaan rata-rata dan median bisa mengisyaratkan adanya pencilan atau data miring.

print(df.describe())
print("Rata-rata Nilai:", df["Nilai"].mean())
print("Nilai tertinggi:", df["Nilai"].max())
print("Nilai terendah:", df["Nilai"].min())

Analisis Korelasi

Korelasi mengukur kekuatan dan arah hubungan linier dua variabel, dengan rentang -1 hingga 1. Nilai mendekati 1 berarti hubungan positif kuat, mendekati -1 berarti negatif kuat, dan mendekati 0 berarti tidak ada hubungan linier yang bermakna.

print(df.corr())
print(df["JamBelajar"].corr(df["Nilai"]))

Matriks korelasi membantu memilih fitur: fitur yang berkorelasi tinggi terhadap target berpotensi menjadi prediktor kuat, sementara dua fitur yang saling berkorelasi tinggi dapat dipertimbangkan agar tidak dipakai bersamaan.

Langkah Praktik

Gunakan dataset nilai siswa yang sama dengan pertemuan sebelumnya agar analisisnya berkesinambungan. Fokuslah menafsirkan setiap angka yang muncul.

  • Muat dataset nilai siswa berisi JamBelajar, Nilai, dan Kehadiran.
  • Gunakan info() dan shape untuk memastikan struktur dan tipe data benar.
  • Gunakan describe() untuk melihat persebaran tiap kolom numerik.
  • Hitung korelasi JamBelajar terhadap Nilai dan tafsirkan.
  • Rangkum temuan dalam beberapa kalimat sebagai hipotesis awal model.

Catat tiga temuan penting dari EDA Anda dalam kalimat singkat; temuan ini nantinya menjadi dasar pemilihan fitur untuk model.

Latihan

Jawab setiap latihan dengan alasan, bukan sekadar hasil akhir, agar pemahaman konsep EDA lebih mendalam.

  • Jelaskan mengapa EDA dilakukan sebelum melatih model.
  • Apa arti korelasi 0.85 dan korelasi -0.3 pada sepasang variabel?
  • Sebutkan satu fitur kandidat prediktor terbaik pada data nilai siswa beserta alasannya.
No Comment! Be the first one.

Tinggalkan Balasan

Alamat email Anda tidak akan dipublikasikan. Ruas yang wajib ditandai *