Le traitement du langage naturel (Natural Language Processing ou NLP) est une branche de l'intelligence artificielle (IA) qui apprend aux ordinateurs à comprendre le langage humain aussi bien sous forme orale qu'écrite. Le traitement du langage naturel combine la linguistique informatique avec le Machine Learning et le Deep Learning pour traiter des données vocales et textuelles, qui peuvent également être utilisées avec d'autres types de données dans le but de développer des systèmes techniques intelligents.
Le Traitement du langage naturel est une branche de l’Intelligence artificielle qui permet aux ordinateurs de comprendre le langage humain, à l’oral comme à l’écrit, en combinant la linguistique computationnelle avec le Machine Learning et le Deep Learning.
Le Traitement du langage naturel transforme des données linguistiques non structurées en un format structuré grâce à des techniques de préparation des données telles que la tokenisation, le stemming et la lemmatisation. Il utilise ensuite des modèles d’IA pour interpréter les données textuelles et vocales, identifier des relations et générer de nouvelles données linguistiques.
La compréhension du langage naturel (NLU) s’appuie sur l’analyse syntaxique et sémantique pour extraire le sens des phrases dans des tâches telles que la classification de documents et l’analyse des sentiments. La génération du langage naturel (NLG), quant à elle, regroupe les méthodes permettant aux ordinateurs de produire du texte à partir de données d’entrée.
Les applications courantes du Traitement du langage naturel incluent la reconnaissance vocale, la reconnaissance du locuteur, la reconnaissance d’entités nommées, l’analyse des sentiments, la classification de documents, le résumé automatique de texte et la traduction automatique dans des secteurs tels que la finance, l’industrie manufacturière et les technologies de l’information.
Les techniques de prétraitement les plus courantes incluent la tokenisation (découpage du texte en phrases ou en mots), le stemming (réduction des mots à leur racine), la lemmatisation (analyse du vocabulaire pour supprimer les affixes), Word2vec (création de représentations numériques des mots) et la modélisation par n-grammes.
NLP models range from classical machine learning algorithms like logistic regression and decision trees to deep learning architectures including CNNs, RNNs, autoencoders, and transformer models like BERT and ChatGPT that form the basis of large language models.
Les modèles de Traitement du langage naturel vont des algorithmes classiques de Machine Learning, comme la régression logistique et les arbres de décision, aux architectures de Deep Learning comprenant les réseaux de neurones convolutifs (CNN), les réseaux de neurones récurrents (RNN), les autoencodeurs et les modèles de type transformer tels que BERT et ChatGPT, qui constituent la base des grands modèles de langage.
MATLAB permet de mettre en œuvre des pipelines complets de Traitement du langage naturel grâce à Text Analytics Toolbox pour les données textuelles et Audio Toolbox pour les données vocales. Il fournit des outils de prétraitement, d’extraction de caractéristiques, d’entraînement de modèles de Machine Learning et de Deep Learning, ainsi qu’un accès à des modèles préentraînés tels que BERT et VGGish.