Hasil Pre-Processing
π§© Alur Preprocessing (Sesuai Implementasi)
Dataset batch "Data Mentah MBG" dipilih. Berikut hasil setiap tahapan preprocessing per baris data.
Teks Asliβ
Cleaningβ
Case Foldingβ
Normalisasi (kamus)β
Tokenisasiβ
Stopword Removalβ
TF-IDFβ
Random Forest / KNN
Preprocessing diimplementasikan native di PHP (tanpa dependency eksternal):
β’ Cleaning β hapus URL, mention, hashtag, angka, tanda baca, dan karakter non-ASCII/emoji.
β’ Case Folding β ubah seluruh teks menjadi huruf kecil.
β’ Normalisasi β kamus kata tidak baku/singkatan (gkβtidak, ygβyang, dst.) dari tabel
β’ Stopword Removal β daftar stopword Bahasa Indonesia (
β’ TF-IDF β Random Forest / KNN β ekstraksi fitur lalu klasifikasi (menu Training Model).
Selanjutnya, data yang belum berlabel bisa diberi label otomatis di menu Pelabelan Data.
β’ Cleaning β hapus URL, mention, hashtag, angka, tanda baca, dan karakter non-ASCII/emoji.
β’ Case Folding β ubah seluruh teks menjadi huruf kecil.
β’ Normalisasi β kamus kata tidak baku/singkatan (gkβtidak, ygβyang, dst.) dari tabel
kamus_normalisasi.β’ Stopword Removal β daftar stopword Bahasa Indonesia (
StopwordList.php).β’ TF-IDF β Random Forest / KNN β ekstraksi fitur lalu klasifikasi (menu Training Model).
Selanjutnya, data yang belum berlabel bisa diberi label otomatis di menu Pelabelan Data.
26 dari 26 baris berhasil diproses β siap download.
| Teks Asli | Case Folding | Cleaning | Normalisasi | Tokenisasi | Stopword | Hasil Akhir | Label |
|---|
βΉ Sebelumnya Hal. 12 / 3