Skip to main content
Le traitement automatique du langage naturel (NLP) est un sous-domaine de l’intelligence artificielle et de la linguistique informatique qui porte sur l’analyse et la synthèse informatiques des langues naturelles. L’une de ses applications pratiques consiste à extraire des données pertinentes à partir d’un texte. La manière dont un document est traité dépend de sa structure. Il en existe trois types : Pour plus d’informations, voir Types of documents processed using ABBYY FlexiCapture. Utilisez le NLP pour traiter les documents non structurés. Par exemple, le NLP peut extraire d’un contrat des numéros de référence, les noms des parties, des dates importantes (dates de signature, de prise d’effet, de durée et de résiliation), le prix du contrat, les frais et les conditions de paiement. Pour extraire des données à partir de tableaux ou de documents structurés et semi-structurés, utilisez d’autres méthodes, telles que FlexiLayouts.

Comment le NLP extrait les informations

Les produits ABBYY utilisent des modèles NLP pour extraire des informations à partir de texte non structuré. Un modèle NLP définit les entités à extraire. Lorsque vous entraînez un modèle NLP sur des exemples de documents, il détermine le domaine métier et l’algorithme d’extraction afin d’extraire les informations plus efficacement. L’effort nécessaire à la création d’un modèle NLP dépend de la diversité de vos documents, du contexte disponible, ainsi que de la complexité et du volume des informations à extraire. L’extraction de données à partir de texte non structuré nécessite une puissance de calcul importante, et l’analyse de textes plus longs prend davantage de temps. Toutefois, les informations dont vous avez besoin se trouvent souvent sur une page ou dans un paragraphe précis. L’identification de ces parties utiles s’appelle la segmentation et demande beaucoup moins de temps et de ressources que l’extraction d’entités. Vous pouvez donc segmenter un document avant d’en extraire des informations. Pour plus d’informations, consultez Créer un modèle de segmentation.

Traiter des documents non structurés avec le NLP

  1. Installez le module NLP.
  2. Créez une Document Definition.
  3. Créez et entraînez un modèle NLP, ou chargez un modèle NLP existant dans votre Document Definition.