Pertemuan 6: Supervised & Unsupervised Learning

Tujuan Pembelajaran

Setelah mengikuti pertemuan ini, mahasiswa diharapkan mampu menerapkan konsep dan keterampilan berikut secara mandiri.

  • Membedakan supervised dan unsupervised learning.
  • Memahami masalah regresi untuk target numerik kontinu.
  • Memahami masalah klasifikasi untuk target kategori.
  • Menerapkan K-Means untuk pengelompokan data.

Supervised learning melatih model menggunakan data berlabel, yaitu setiap baris memiliki jawaban benar yang disebut target. Dari pola fitur ke target, model belajar memetakan input baru ke output. Dua tugas utamanya adalah regresi untuk nilai kontinu dan klasifikasi untuk kategori.

# Regresi: prediksi harga rumah
# target berupa angka, misal harga dalam juta
# Klasifikasi: deteksi spam
# target berupa label, misal "spam" atau "bukan"
print("Dua arah supervised learning")

Pada regresi, target bisa berupa harga, suhu, atau penjualan. Pada klasifikasi, target berupa kategori seperti jenis bunga atau status penyakit. Keduanya akan diimplementasikan menggunakan Scikit-learn pada pertemuan mendatang.Menjelaskan peta keputusan memilih jenis learning: jika ada label jawaban gunakan supervised, jika ingin menemukan kelompok tersembunyi gunakan unsupervised.

Unsupervised Learning dan K-Means

Unsupervised learning bekerja tanpa label dan bertujuan menemukan struktur tersembunyi dalam data. Teknik utamanya disebut clustering, dan algoritma paling populer adalah K-Means. K-Means membagi data menjadi K kelompok berdasarkan kedekatan ke titik pusat yang terus diperbarui secara iteratif.Menekankan bahwa regresi dan klasifikasi adalah dua arah supervised yang paling umum, sedangkan clustering adalah andalan unsupervised. Pemahaman ini menentukan model mana yang dipakai pada pertemuan-pertemuan berikutnya.

from sklearn.cluster import KMeans
import numpy as np

X = np.array([[1, 1], [1.5, 2], [3, 3],
              [8, 8], [8.5, 9], [9, 8]])

model = KMeans(n_clusters=2, random_state=42, n_init=10)
model.fit(X)
print("Label tiap titik:", model.labels_)
print("Pusat cluster:", model.cluster_centers_)

Parameter n_clusters menentukan jumlah kelompok, dan n_init menjalankan algoritma beberapa kali berdasar inisialisasi berbeda agar hasil lebih stabil. Memilih jumlah kelompok yang pas bisa dibantu dengan metode elbow berdasarkan nilai inertia.

Regresi Linear sebagai Awal

Implementasi lengkap regresi linear disajikan pada pertemuan berikutnya. Pada prinsipnya, model mencari garis terbaik y sama dengan a kali x ditambah b yang meminimalkan jarak total titik terhadap garis. Nilai a disebut slope dan b disebut intercept.

Langkah Praktik

Mulailah dari dataset kecil untuk memahami cara kerja K-Means secara visual sebelum mencobanya pada data yang lebih besar.

  • Buat dataset dua fitur sederhana dan jalankan K-Means dengan 2 cluster.
  • Cetak label dan pusat cluster, lalu tafsirkan makna kedua kelompok.
  • Ubah n_clusters dari 2 menjadi 3 dan bandingkan hasilnya.
  • Scatter-plot hasil cluster dengan warna berbeda per label.
  • Diskusikan contoh penerapan: klasterisasi pelanggan atau dokumen.

Setiap kali mengubah jumlah cluster, amati perubahan label dan pusat cluster untuk memahami bagaimana algoritma membagi data.

Latihan

Latihan menguji pemahaman konsep serta kemampuan memilih learning yang tepat untuk sebuah masalah. Tuliskan argumen dengan jelas.

  • Beri satu contoh masalah klasifikasi dan satu contoh regresi dunia nyata.
  • Jelaskan perbedaan utama supervised dan unsupervised learning.
  • Jalankan K-Means pada data satu dimensi lalu tafsirkan kelompoknya.
No Comment! Be the first one.

Tinggalkan Balasan

Alamat email Anda tidak akan dipublikasikan. Ruas yang wajib ditandai *