Natural Language Processing (natürliche Sprachverarbeitung) ist ein Teilbereich der künstlichen Intelligenz (KI), der Computer darauf trainiert, menschliche Sprache in mündlicher und schriftlicher Form zu verstehen. Die natürliche Sprachverarbeitung kombiniert Computerlinguistik mit Machine Learning und Deep Learning zur Verarbeitung von Sprach- und Textdaten, die auch mit anderen Datentypen zur Entwicklung intelligenter technischer Systeme verwendet werden können.
Verarbeitung natürlicher Sprache ist ein Teilgebiet der Künstlichen Intelligenz, das Computern beibringt, menschliche Sprache in gesprochener und geschriebener Form zu verstehen, indem computerlinguistische Methoden mit Machine Learning und Deep Learning kombiniert werden.
Verarbeitung natürlicher Sprache wandelt unstrukturierte Sprachdaten in ein strukturiertes Format um, indem Datenvorbereitungstechniken wie Tokenisierung, Stemming und Lemmatisierung angewendet werden, und verwendet anschließend Modelle der Künstlichen Intelligenz, um Sprach- und Textdaten zu interpretieren, Zusammenhänge zu entdecken und neue Sprachdaten zu erzeugen.
Natural Language Understanding (NLU) verwendet syntaktische und semantische Analysen, um aus Sätzen Informationen zu extrahieren — für Aufgaben wie Dokumentenklassifizierung und Sentimentanalyse — während Natural Language Generation (NLG) die Methoden umfasst, mit denen Computer aus gegebenen Daten Textantworten erzeugen.
Zu den häufigen Anwendungen der Verarbeitung natürlicher Sprache gehören Spracherkennung, Sprechererkennung, Named-Entity Recognition, Sentimentanalyse, Dokumentenklassifizierung, Textzusammenfassung und maschinelle Übersetzung in Branchen wie Finanzen, Fertigung und Informationstechnologie.
Zu den gängigen Vorverarbeitungstechniken gehören Tokenisierung (Aufteilen von Text in Sätze oder Wörter), Stemming (Reduzierung von Wörtern auf ihre Stammformen), Lemmatisierung (Verwendung lexikalischer Analyse zur Entfernung von Affixen), Word2vec (Erzeugung numerischer Wortvektoren) und n-Gramm-Modellierung.
Modelle für die Verarbeitung natürlicher Sprache reichen von klassischen Machine-Learning-Algorithmen wie logistischer Regression und Entscheidungsbäumen bis hin zu Deep-Learning-Architekturen, einschließlich CNNs (Convolutional Neural Networks), Rekurrente Neuronale Netze (RNN), Autoencoder und Transformer-Modellen wie BERT und ChatGPT, die die Grundlage großer Sprachmodelle bilden.
MATLAB ermöglicht komplette NLP‑Pipelines mit Text Analytics Toolbox für Textdaten und Audio Toolbox für Sprachdaten; es stellt Tools für Vorverarbeitung, Merkmalsextraktion, Modelltraining mit Machine Learning oder Deep Learning sowie Zugriff auf vortrainierte Modelle wie BERT und VGGish bereit.
Transfer Learning ermöglicht die Nutzung vortrainierter großer Sprachmodelle und deren Anpassung an spezifische NLP‑Probleme, z. B. das Feinabstimmen (Fine‑Tuning) eines BERT‑Modells für eine bestimmte Sprache oder Klassifizierungsaufgabe.