- Vous devez extraire des entités à partir d’un tableau.
- Vous ne disposez pas de suffisamment de documents d’exemple pour entraîner votre modèle NLP.
- La qualité de l’extraction n’est pas satisfaisante pour certains champs.
- Identifier des segments de texte correspondant à une expression régulière, à des mots ou expressions issus d’un dictionnaire utilisateur (sous n’importe quelle forme fléchie) ou à un objet NER intégré.
- Exécuter des requêtes sur le texte et sur les segments de texte, dans lesquels les mots de recherche peuvent apparaître sous n’importe quelle forme fléchie.
- Enregistrer les segments de texte identifiés dans les champs du document.
- Extraire des adresses et leurs composants à partir de documents.
Objets NER intégrés
Composants d’adresse :
NerZipCode (code postal), NerCountry (pays), NerState (État), NerCity (ville) et NerStreet (rue).
Créer un script d’extraction
1
Ouvrir les propriétés de la section
Ouvrez Document Definition Editor, cliquez avec le bouton droit sur une section du document, cliquez sur Properties, puis sur l’onglet NLP.
2
Créer le script
Sous Extraction Scripts, cliquez sur Create.
3
Charger un dictionnaire ou modifier le script
Dans la boîte de dialogue Extraction Script, cliquez sur Load pour charger un dictionnaire utilisateur ou sur Edit pour ouvrir l’éditeur de scripts. Les dictionnaires utilisateur doivent être encodés en UTF-8 avec BOM ou en ANSI.
Extraire les composants d’une adresse à partir d’un document
1
Définir la zone de l’adresse
Spécifiez la partie du document qui contient l’adresse. Limitez la zone de recherche à l’aide d’un champ FlexiLayout et utilisez cette zone comme source du script d’extraction. Pour plus d’informations, consultez Contraintes de recherche.
2
Appliquer le script d’extraction
Appliquez le script approprié. Vous pouvez rechercher des composants d’adresse dans l’ensemble du champ ou dans une partie d’un champ.
ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) ou ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) pour analyser une adresse, chaque mot des composants détectés reçoit les attributs suivants lors de l’indexation, que vous pouvez ensuite utiliser dans des requêtes XML :
- Le nom de la collection, au format
[resultCollectionNamePrefix]_[NerTypeOfComponent]. - Le préfixe
resultCollectionNamePrefix. - Le type de l’objet NER.
Actuellement, vous pouvez extraire des composants uniquement à partir d’adresses allemandes et américaines.
