Antecedentes: El rápido crecimiento del tráfico de red cifrado ha aumentado la necesidad de una clasificación del tráfico de red (NTC) eficaz e imparcial. Las técnicas tradicionales se enfrentan a dificultades con los datos cifrados, la disponibilidad limitada de características y el elevado volumen de tráfico, lo que reduce su fiabilidad en situaciones reales.
Métodos Proponemos una novedosa metodología de preprocesamiento que analiza el tráfico de red sin procesar y lo convierte a un formato textual (nt2txt), lo que permite aplicar técnicas de procesamiento del lenguaje natural (NLP) y de aprendizaje profundo. Este enfoque elimina el sesgo de los metadatos de los protocolos, estructura los datos en semiflujos de tamaño fijo y utiliza una división rigurosa de los datos para evitar la superposición de flujos entre el entrenamiento y la evaluación. A continuación, se entrena un modelo basado en LSTM para clasificar el tráfico utilizando únicamente datos de carga útil.
Resultados Este trabajo proporciona un marco escalable e independiente del protocolo para la clasificación del tráfico cifrado, lo que demuestra la eficacia de las técnicas de PLN a la hora de mejorar el rendimiento del modelo y reducir el sesgo del conjunto de datos. Nuestra metodología alcanzó una precisión del 88,87 ± 0,04 % en un conjunto de datos externo ciego, superando a modelos similares basados en LSTM y en la combinación de CNN y LSTM. Métricas como el kappa de Cohen y el coeficiente de correlación de Matthew confirman además la robustez y la generalizabilidad de nuestro enfoque.
Palabras clave: Inteligencia artificial, Ciberseguridad, Clasificación del tráfico, PLN
Background The rapid growth of encrypted network traffic has increased the need for efective and unbiased Network Traffic Classification (NTC). Traditional techniques struggle with encrypted data, limited feature availability, and high traffic volume, reducing their reliability in real-world scenarios.
Methods We propose a novel pre-processing methodology that analyzes raw network traffic into a textual format (nt2txt), enabling the application of Natural Language Processing (NLP) and Deep Learning techniques. This approach eliminates bias from protocol metadata, structures the data into fixed-size semi-flows, and uses rigorous data-splitting to prevent flow overlap between training and testing. An LSTM-based model is then trained to classify traffic using only payload data.
Results This work provides a scalable, protocol-agnostic framework for encrypted traffic classification, demonstrating the effectiveness of NLP techniques in improving model performance and reducing dataset bias. Our methodology achieved 88,87 ± 0,04% accuracy on a blind external dataset, outperforming similar LSTM and hybrid CNN-LSTM models. Metrics such as Cohen’s Kappa and Matthew’s Correlation Coeficient further confirm the robustness and generalizability of our approach.
Keywords Artificial intelligence, Cybersecurity, Traffic classiffcation, PLN
Publicado por nuestro investigador, José Manuel Sánchez Velázquez, antiguos compañeros del CEIEC como Alberto Nogales y Andrew Coney y junto a nuestro querido Álvaro García Tejedor, cuyo compromiso, rigor y dedicación representan fielmente los valores que definen nuestro trabajo investigador.


