Skip to main content

Création de champs de document

Pour chaque entité que vous souhaitez extraire, créez un champ correspondant dans le Document Definition.
1

Ajouter un champ

Dans le Document Definition Editor, cliquez avec le bouton droit sur le nom de la section de document et sélectionnez Create Field.
2

Créer un champ Text

Créez un champ Text.
3

Activer une région

Dans l’onglet General, sélectionnez Can have region.
4

Nommer le champ

Dans le champ Name, indiquez un nom (par exemple, PreambleSegment). Les noms de champ ne doivent pas contenir d’espaces, ni de caractères non anglais, ni commencer par un chiffre.
Capture d’écran de l’onglet General de la boîte de dialogue Properties du champ dans le ABBYY FlexiCapture Document Definition Editor, avec le champ nommé PreambleSegment et les options Can have region et Text segment sélectionnées.
Répétez ces étapes pour chaque entité. Si vous utilisez la segmentation, créez un champ Text distinct pour chaque segment : créez un champ non répétable dans un groupe répétitif, sélectionnez Text segment dans les propriétés du champ et sélectionnez Allow multiple regions si un segment peut commencer et se terminer sur des pages différentes.

Créer un modèle de segmentation

La segmentation améliore la précision et la rapidité de l’extraction d’entités et est facultative. Elle nécessite un modèle NLP dédié, et vous ne pouvez avoir qu’un seul modèle de segmentation par section de document.
1

Ouvrir les propriétés de la section

Dans le Document Definition Editor, cliquez avec le bouton droit sur le nom de la section de document et sélectionnez Properties. Dans l’onglet NLP, cliquez sur Create.
2

Nommer le modèle et définir son type

Dans le champ Name, saisissez un nom (par exemple, SegmentationModel). Définissez Model type sur Segmentation, puis sélectionnez la langue requise dans Language.
Capture d’écran de la boîte de dialogue New NLP Model dans l’onglet NLP des Properties de la section de document dans ABBYY FlexiCapture, avec le modèle nommé SegmentationModel, Source défini sur Section, Model type défini sur Segmentation et Language défini sur English.
3

Choisir les champs de segment

Cliquez sur Suivant, indiquez les champs dans lesquels les segments seront extraits, puis cliquez sur OK.
Après avoir créé un modèle de segmentation, entraînez-le sur des exemples de documents.

Créer un modèle d’extraction d’entités

Pour extraire des entités, vous devez disposer d’un modèle NLP d’extraction d’entités entraîné à partir de documents annotés manuellement.
1

Ouvrir les propriétés de la section

Dans Document Definition Editor, ouvrez les propriétés de la section du document, cliquez sur l’onglet NLP, puis sur Create.
2

Nommer le modèle et définir son type

Saisissez un Name (par exemple, EntitiesExtraction). Comme source de données, sélectionnez une section (si vous n’utilisez pas la segmentation) ou un segment (si vous l’utilisez). Définissez Model type sur Extraction, puis sélectionnez la Language requise.
3

Choisir les champs de résultat

Cliquez sur Suivant et sélectionnez les champs de résultat à extraire de la section ou du segment sélectionné.
Répétez ces étapes pour chaque segment ou section de document dont les entités doivent être extraites. Enregistrez ensuite votre Document Definition (Document Definition → Save), fermez-le (Document Definition → Close) et publiez-le (Document Definition → Publish). Après avoir créé un modèle d’extraction d’entités, entraînez-le à l’aide d’exemples de documents.
L’option Allow training permet d’entraîner un modèle NLP pendant le traitement des documents : le modèle est entraîné lorsque vous effectuez l’entraînement à l’extraction des champs à l’aide d’un lot d’entraînement à l’extraction des champs. Pour désactiver l’entraînement ou supprimer ses résultats, cliquez avec le bouton droit sur le lot d’entraînement et sélectionnez Disabled ou Delete dans le menu contextuel.