Hasil Pre-Processing

🧩 Alur Preprocessing (Sesuai Implementasi)

Dataset batch "Data Mentah MBG" dipilih. Berikut hasil setiap tahapan preprocessing per baris data.

Teks Asli→ Cleaning→ Case Folding→ Normalisasi (kamus)→ Tokenisasi→ Stopword Removal→ TF-IDF→ Random Forest / KNN
Preprocessing diimplementasikan native di PHP (tanpa dependency eksternal):
β€’ Cleaning β€” hapus URL, mention, hashtag, angka, tanda baca, dan karakter non-ASCII/emoji.
β€’ Case Folding β€” ubah seluruh teks menjadi huruf kecil.
‒ Normalisasi — kamus kata tidak baku/singkatan (gk→tidak, yg→yang, dst.) dari tabel kamus_normalisasi.
β€’ Stopword Removal β€” daftar stopword Bahasa Indonesia (StopwordList.php).
β€’ TF-IDF β†’ Random Forest / KNN β€” ekstraksi fitur lalu klasifikasi (menu Training Model).
Selanjutnya, data yang belum berlabel bisa diberi label otomatis di menu Pelabelan Data.

26 dari 26 baris berhasil diproses β€” siap download.

Teks Asli Case Folding Cleaning Normalisasi Tokenisasi Stopword Hasil Akhir Label