Skip to main content
Les scripts d’extraction peuvent améliorer les résultats lorsqu’ils sont utilisés avec un modèle NLP. Utilisez-les dans les cas suivants :
  • Vous devez extraire des entités à partir d’un tableau.
  • Vous ne disposez pas de suffisamment de documents d’exemple pour entraîner votre modèle NLP.
  • La qualité de l’extraction n’est pas satisfaisante pour certains champs.
Les scripts d’extraction vous permettent de :
  • Identifier des segments de texte correspondant à une expression régulière, à des mots ou expressions issus d’un dictionnaire utilisateur (sous n’importe quelle forme fléchie) ou à un objet NER intégré.
  • Exécuter des requêtes sur le texte et sur les segments de texte, dans lesquels les mots de recherche peuvent apparaître sous n’importe quelle forme fléchie.
  • Enregistrer les segments de texte identifiés dans les champs du document.
  • Extraire des adresses et leurs composants à partir de documents.

Objets NER intégrés

Composants d’adresse : NerZipCode (code postal), NerCountry (pays), NerState (État), NerCity (ville) et NerStreet (rue).

Créer un script d’extraction

1

Ouvrir les propriétés de la section

Ouvrez Document Definition Editor, cliquez avec le bouton droit sur une section du document, cliquez sur Properties, puis sur l’onglet NLP.
2

Créer le script

Sous Extraction Scripts, cliquez sur Create.
3

Charger un dictionnaire ou modifier le script

Dans la boîte de dialogue Extraction Script, cliquez sur Load pour charger un dictionnaire utilisateur ou sur Edit pour ouvrir l’éditeur de scripts. Les dictionnaires utilisateur doivent être encodés en UTF-8 avec BOM ou en ANSI.

Extraire les composants d’une adresse à partir d’un document

1

Définir la zone de l’adresse

Spécifiez la partie du document qui contient l’adresse. Limitez la zone de recherche à l’aide d’un champ FlexiLayout et utilisez cette zone comme source du script d’extraction. Pour plus d’informations, consultez Contraintes de recherche.
2

Appliquer le script d’extraction

Appliquez le script approprié. Vous pouvez rechercher des composants d’adresse dans l’ensemble du champ ou dans une partie d’un champ.
Une adresse contient au plus une occurrence de chaque composant (code postal, pays, État, ville et rue), mais un script peut en renvoyer plusieurs. Plus la zone de recherche est définie précisément, moins il y a d’occurrences renvoyées. Lorsque vous utilisez la méthode ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) ou ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) pour analyser une adresse, chaque mot des composants détectés reçoit les attributs suivants lors de l’indexation, que vous pouvez ensuite utiliser dans des requêtes XML :
  1. Le nom de la collection, au format [resultCollectionNamePrefix]_[NerTypeOfComponent].
  2. Le préfixe resultCollectionNamePrefix.
  3. Le type de l’objet NER.
Pour obtenir un exemple de requête XML d’extraction d’adresse, consultez Langage de requête.
Actuellement, vous pouvez extraire des composants uniquement à partir d’adresses allemandes et américaines.