Classification du Trafic Internet grâce aux Méthodes d’Apprentissage Automatique
Abstract:
L’étude de ce travail consiste à exploter des algorithmes d’apprentissage automatique interprétables tels que : l’arbre de décision, la forêt aléatoire et XGBoost pour proposer des modèles performants destinés à la classification du trafic selon le service qui le génère. L’ensemble de données utilisé pour la mise en place des modèles contient 377 526 trafics. Chaque trafic est décrit par 248 caractéristiques qui représentent principalement des informations telles que les numéros de ports, des statistiques sur les paquets échangés, etc. Un autre ensemble de données constitué de 19 626 trafics est utilisé pour évaluer les modèles. L’étude consiste à construire des modèles puis à analyser l’importance des caractéristiques ayant servi à la construction afin de supprimer les caractéristiques superflues sur plusieurs itérations pour une amélioration des performances. À l’issue de l’étude, on constate que l’arbre de décision est le plus efficace pour détecter les trafics de type attaque. La forêt aléatoire quant à elle donne de très bons résultats avec le moins de caractéristiques. Enfin XGBoost arrive à s’adapter aux déficits de données et donne de très bons résultats malgré les données manquantes. Un des meilleurs modèles construit à partir de 12 caractéristiques, a permis d’atteindre une exactitude globale de 98,40 % sur l’ensemble des données destiné à l’évaluation. Également, ce travail a permis de dégager un ensemble de 14 caractéristiques importantes dans la classification du trafic internet qui se sont démarquées tout au long de l’étude. Parmi ces 14 caractéristiques, deux d’entre elles se sont revélées incontournables. Il s’agit du numéro de …
URPHORAN développe et promeut la recherche scientifique à travers des projets innovants, la formation des jeunes chercheurs et la valorisation des résultats.
Nous contacter