Analysis of the Impact of Data Scaling Techniques on Classification Algorithms: KNN, SVM, and Logistic Regression Using Synthetic Data

Authors

  • Aghasi Yanda Wafa Azizah Universitas Negeri Surabaya
  • Muhammad Radifan Asyauri Universitas Negeri Surabaya
  • Yuliani Puji Astuti Universitas Negeri Surabaya

Abstract

Data preprocessing plays a crucial role in determining the performance of machine
learning classification algorithms, particularly in handling feature scale variations
(Ahsan et al., 2021; Pinheiro et al., 2025). . This study analyzes the impact of data
scaling techniques on the performance of classification algorithms, namely KNearest
Neighbors (KNN), Support Vector Machine (SVM), and Logistic Regression,
using a controlled synthetic dataset. All experiments were implemented using
Python in a Google Colaboratory environment to ensure reproducibility and ease of
implementation. Three data scaling scenarios were evaluated: No Scaling, Min-Max
Scaling, and Standard Scaling. Model performance was assessed using multiple
evaluation metrics, including Accuracy, Precision, Recall, F1-Score, and Execution
Time. The experimental results indicate that data scaling has a significant influence
on the performance of distance- and margin-based classification algorithms
(Amorim, Cavalcanti and Cruz, 2022). In particular, SVM combined with Standard
Scaling achieved the best overall performance, yielding an accuracy of 0.940 and an
F1-score of 0.933. KNN also demonstrated sensitivity to feature scaling, although its
performance remained competitive in the absence of scaling due to the controlled
characteristics of the synthetic dataset. In contrast, Logistic Regression exhibited
relatively stable performance across all scaling techniques, indicating lower
sensitivity to feature scale variations. These findings emphasize the importance of
selecting appropriate data scaling techniques according to the characteristics of the
classification algorithm (Sujon et al., 2024).. This study provides empirical insights
that can serve as practical guidelines for preprocessing strategies in machine
learning classification tasks.
Keywords: Data Scaling, Classification Algorithms, KNN, SVM, Logistic Regression,
Synthetic Data
Abstrak
Pra-pemrosesan data memainkan peran penting dalam menentukan kinerja
algoritma klasifikasi pembelajaran mesin, terutama dalam menangani variasi skala
fitur (Ahsan et al., 2021; Pinheiro et al., 2025). Penelitian ini menganalisis dampak
teknik penskalaan data terhadap kinerja algoritma klasifikasi, yaitu K-Nearest
Neighbors (KNN), Support Vector Machine (SVM), dan Regresi Logistik, dengan
menggunakan kumpulan data sintetis yang terkontrol. Semua eksperimen
diimplementasikan menggunakan Python dalam lingkungan Google Colaboratory
untuk memastikan reproduktibilitas dan kemudahan implementasi. Tiga skenario
penskalaan data dievaluasi: Tanpa Penskalaan, Penskalaan Min-Max, dan

Penskalaan Standar. Kinerja model dinilai menggunakan beberapa metrik evaluasi,
termasuk Akurasi, Presisi, Recall, F1-Score, dan Waktu Eksekusi. Hasil
eksperimen menunjukkan bahwa penskalaan data memiliki pengaruh signifikan
terhadap kinerja algoritma klasifikasi berbasis jarak dan margin (Amorim,
Cavalcanti and Cruz, 2022). Secara khusus, SVM yang dikombinasikan dengan
Penskalaan Standar mencapai kinerja keseluruhan terbaik, dengan akurasi
sebesar 0,940 dan F1-score sebesar 0,933. KNN juga menunjukkan sensitivitas
terhadap penskalaan fitur, meskipun kinerjanya tetap kompetitif tanpa penskalaan
berkat karakteristik terkontrol dari dataset sintetis. Sebaliknya, Regresi Logistik
menunjukkan kinerja yang relatif stabil di seluruh teknik penskalaan, yang
mengindikasikan sensitivitas yang lebih rendah terhadap variasi skala fitur.
Temuan ini menekankan pentingnya memilih teknik penskalaan data yang sesuai
dengan karakteristik algoritma klasifikasi (Sujon et al., 2024). Studi ini
memberikan wawasan empiris yang dapat berfungsi sebagai pedoman praktis
untuk strategi prapemrosesan dalam tugas klasifikasi pembelajaran mesin.
Kata kunci: Penskalaan Data, Algoritma Klasifikasi, KNN, SVM, Regresi Logistik,
Data Sintetis

Downloads

Published

2026-06-26