Training Model
Training hanya memakai baris yang sudah dipreprocessing dan sudah berlabel.
Jika sebuah batch belum muncul di sini atau jumlah "siap dilatih"-nya masih kurang, jalankan
Preprocessing lalu Pelabelan Data terlebih dahulu.
Pembagian data latih/uji sekarang otomatis stratified (proporsi tiap kelas sentimen dijaga sama di data latih & data uji), dan tersedia opsi SMOTE untuk menyeimbangkan kelas minoritas pada data latih sebelum training.
Pembagian data latih/uji sekarang otomatis stratified (proporsi tiap kelas sentimen dijaga sama di data latih & data uji), dan tersedia opsi SMOTE untuk menyeimbangkan kelas minoritas pada data latih sebelum training.
Catatan (berdasarkan riwayat training Anda sendiri): ternyata yang paling
menentukan akurasi bukan
Jadi menaikkan
โ ๏ธ Soal memori: kalau
max_depth, melainkan opsi "cari split pakai
seluruh data latih" di bawah. Riwayat training menunjukkan pola yang jelas:
max_depth=100, minLeaf=5, tanpa full-split โ akurasi 59.95%max_depth=200, minLeaf=1, tanpa full-split โ akurasi hanya 54.48%โ56.62% (lebih rendah walau depth-nya lebih tinggi!)max_depth=200, minLeaf=1, dengan full-split โ akurasi melompat ke 70.62%โ71.14%
Jadi menaikkan
max_depth saja (default 50) tidak banyak membantu selama
pencarian split masih dibatasi subsampling. Untuk hasil terbaik, aktifkan
"cari split pakai seluruh data latih" dan set max_depth ke
sekitar 100-200 โ persis kombinasi yang menghasilkan akurasi >70% di riwayat training Anda.
Konsekuensinya: training jadi jauh lebih lambat (percobaan dengan 100 tree butuh
±29 menit / 1756 detik, dibanding ±90 detik tanpa full-split), jadi mulai dulu
dari n_trees kecil (10-30) untuk uji cepat sebelum menaikkan ke 100.
โ ๏ธ Soal memori: kalau
max_depth dinaikkan tinggi
(150-200 ke atas) SEKALIGUS min_samples_leaf dibiarkan 1, pohon bisa
terus membelah sampai leaf isinya 1 baris data โ jumlah node per tree jadi sangat
besar (dikali n_trees), dan bisa memicu "Allowed memory size
exhausted". Kalau mau depth besar, naikkan juga min_samples_leaf
ke 5-10: selain jauh lebih hemat memori, ini regularisasi yang mencegah leaf
menghafal baris tunggal/noise (overfitting).
๐ฒ Training Random Forest
๐ Training K-Nearest Neighbor
Riwayat Training
| Waktu | Batch | Algoritma | Data Train/Test | Akurasi | Precision | Recall | F1-Score | Waktu Latih | Pengaturan |
|---|---|---|---|---|---|---|---|---|---|
| 15/08/2026 21:39 | Data Mentah MBG | ๐ KNN | 7968 / 1171 | 56.79% | 66.55% | 56.79% | 58.46% | 84.85s | Stratified, SMOTE: โ , fitur: 3000 , K: 15 , metrik: cosine |
| 15/08/2026 21:34 | Data Mentah MBG | ๐ฒ Random Forest | 7968 / 1171 | 71.14% | 72% | 71.14% | 71.49% | 1755.97s | Stratified, SMOTE: โ , fitur: 3000 , depth: 200 , minLeaf: 1 , full-split |
| 15/08/2026 21:02 | Data Mentah MBG | ๐ฒ Random Forest | 7968 / 1171 | 70.62% | 72.21% | 70.62% | 71.14% | 68.15s | Stratified, SMOTE: โ , fitur: 3000 , depth: 200 , minLeaf: 1 , full-split |
| 15/08/2026 20:55 | Data Mentah MBG | ๐ฒ Random Forest | 7968 / 1171 | 56.62% | 71.59% | 56.62% | 57.7% | 608.43s | Stratified, SMOTE: โ , fitur: 3000 , depth: 200 , minLeaf: 1 |
| 15/08/2026 20:42 | Data Mentah MBG | ๐ฒ Random Forest | 7968 / 1171 | 54.48% | 71.17% | 54.48% | 55.77% | 76.61s | Stratified, SMOTE: โ , fitur: 3000 , depth: 200 , minLeaf: 1 |
| 15/08/2026 20:20 | Data Mentah MBG | ๐ KNN | 7968 / 1171 | 55.59% | 64.16% | 55.59% | 57.36% | 53.93s | Stratified, SMOTE: โ , fitur: 3000 , K: 7 , metrik: cosine |
| 15/08/2026 20:17 | Data Mentah MBG | ๐ฒ Random Forest | 7968 / 1171 | 59.95% | 72.94% | 59.95% | 61.46% | 89.16s | Stratified, SMOTE: โ , fitur: 3000 , depth: 100 , minLeaf: 5 |