Klasifikasi Biner untuk Prediksi Keselamatan Penumpang Titanic: Perbandingan Algoritma Logistic Regression, Decision Tree, dan Random Forest

Dian Ayu Kusrini, Ay Kumalaka, Nur Adila

Sari


Klasifikasi biner merupakan salah satu teknik supervised machine learning yang banyak digunakan untuk memprediksi keluaran ke dalam dua kelas berdasarkan pola pada data. Dataset Titanic menjadi salah satu dataset yang paling sering digunakan sebagai media pembelajaran dan evaluasi algoritma klasifikasi karena memuat informasi demografis dan sosial ekonomi penumpang yang berkaitan dengan status keselamatan. Penelitian ini bertujuan untuk membandingkan kinerja tiga algoritma klasifikasi, yaitu Logistic Regression, Decision Tree, dan Random Forest, dalam memprediksi keselamatan penumpang Titanic serta menganalisis kemungkinan terjadinya data leakage yang dapat memengaruhi hasil evaluasi model. Dataset yang digunakan terdiri atas 418 data penumpang dengan 12 atribut, meliputi kelas penumpang, usia, jenis kelamin, tarif, jumlah anggota keluarga, dan pelabuhan keberangkatan. Tahap praproses data meliputi penanganan nilai hilang, penghapusan atribut yang tidak relevan, pengkodean data kategorikal, serta pembagian data latih dan data uji menggunakan metode stratified sampling dengan rasio 80:20. Standardisasi data diterapkan khusus pada model Logistic Regression, sedangkan Decision Tree dan Random Forest dilatih menggunakan data tanpa standardisasi. Kinerja model dievaluasi menggunakan metrik akurasi, presisi, recall, F1-score, confusion matrix, analisis korelasi, serta feature importance pada Random Forest. Hasil penelitian menunjukkan bahwa ketiga algoritma menghasilkan nilai akurasi, presisi, recall, dan F1-score sebesar 1,00 pada data uji. Namun, analisis lebih lanjut menunjukkan bahwa hasil tersebut disebabkan oleh data leakage, di mana atribut Sex memiliki nilai feature importance sebesar 0,83 dan berkorelasi sempurna dengan label Survived. Temuan ini mengindikasikan bahwa dataset yang digunakan kemungkinan merupakan dataset turunan yang label targetnya dibentuk berdasarkan aturan sederhana berbasis jenis kelamin, sehingga akurasi sempurna tidak mencerminkan kemampuan model yang sesungguhnya. Oleh karena itu, penelitian ini menegaskan pentingnya validasi kualitas data, pemeriksaan hubungan antara fitur dan target, serta deteksi data leakage sebelum menarik kesimpulan mengenai performa algoritma machine learning.

Kata kunci— Klasifikasi Biner, Titanic, Logistic Regression, Random Forest, Data Leakage, Machine Learning.


Teks Lengkap:

PDF

Referensi


Penulis Jutif, "Preventing Data Leakage in Classification via Integrated Machine Learning Pipeline: Studi Kasus Dataset Titanic," J. Inform. dan Tek. Inf. (JUTIF), vol. 7, no. 1, pp. 391–410, Feb. 2026.

Perbandingan Metode Regresi Logistik dan Random Forest untuk Klasifikasi Data Imbalanced (Studi Kasus: Klasifikasi Rumah Tangga Miskin di Kabupaten Karangasem, Bali Tahun 2017), ResearchGate, 2019.

Perbandingan Kinerja Algoritma Decision Tree dan Random Forest untuk Klasifikasi Nutrisi pada Makanan Cepat Saji, ResearchGate, 2025.

"Random Forest vs Decision Tree," School of Information Systems, Universitas Bina Nusantara, 2024. [Online]. Tersedia: https://sis.binus.ac.id/2024/04/02/random-forest-vs-decision-tree/

Perbandingan Algoritma Logistic Regression dan Random Forest, JUARA (Jurnal Aplikasi dan Riset Informatika), vol. 2, no. 1, Agu. 2023.

Analisis Perbandingan Decision Tree dan Random Forest pada Klasifikasi Teks Data Kesehatan, Bina Insani ICT Journal, 2023.

T. Z. Jasman et al., "Perbandingan Logistic Regression, Random Forest, dan XGBoost dalam Prediksi Penyakit Gagal Jantung," CSRID Journal, pp. 275–284, 2024.

J. Brownlee, "Data Leakage in Machine Learning," Machine Learning Mastery, 2020. [Online]. Tersedia: https://machinelearningmastery.com/data-leakage-machine-learning/

Riansyahputra et al., "Membangun Model Prediksi yang Robust: Penanganan Feature Leakage dalam Analisis Dampak Media Sosial terhadap Prestasi," EJECTS Journal of Computer Technology and Information Systems, 2026.

L. Breiman, "Random Forests," Machine Learning, vol. 45, no. 1, pp. 5–32, 2001.

F. Pedregosa et al., "Scikit-learn: Machine Learning in Python," Journal of Machine Learning Research, vol. 12, pp. 2825–2830, 2011.

Kaggle, "Titanic - Machine Learning from Disaster: Data," Kaggle Competition Page. [Online]. Tersedia: https://www.kaggle.com/c/titanic/data

B. W. Nugroho dan Supriyanto, "Analisis Prediktif Berbasis Metaheuristik untuk Keselamatan Penumpang dalam Insiden Maritim: Studi Kasus Titanic," E-Link Jurnal Teknik Elektro dan Informatika, 2025.

A. Ambarwari, Q. J. Adrian, dan Y. Herdiyeni, "Analisis Pengaruh Data Scaling terhadap Performa Algoritme Machine Learning untuk Identifikasi Tanaman," Jurnal RESTI (Rekayasa Sistem dan Teknologi Informasi), vol. 4, no. 1, pp. 117–122, 2020.

D. M. W. Powers, "Evaluation: From Precision, Recall and F-Measure to ROC, Informedness, Markedness and Correlation," Journal of Machine Learning Technologies, vol. 2, no. 1, pp. 37–63, 2011.


Refbacks

  • Saat ini tidak ada refbacks.



EJECTS: Jurnal Computer, Technology, and Informations System

Gedung Fakultas Ilmu Komputer, Universitas Darwan Ali, JL. Batu Berlian, No. 10, Sampit, Kabupaten Kotawaringin Timur, Provinsi Kalimantan Tengah, 74322

Creative Commons Licence
This work is licensed under a Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.

View My Stats