- テーブルからエンティティを抽出する必要がある。
- NLP モデルを学習させるためのサンプルドキュメントが十分にない。
- 一部の field の抽出品質に満足していない。
- 正規表現、ユーザー辞書内の単語やフレーズ (任意の活用形) 、または組み込みの NER オブジェクトに一致するテキストスパンを特定する。
- 検索語が任意の活用形で出現しうるテキストやテキストスパンに対してクエリを実行する。
- 特定したテキストスパンをドキュメントの field に保存する。
- ドキュメントから住所とその構成要素を抽出する。
組み込み NER オブジェクト
住所の構成要素:
NerZipCode (郵便番号) 、NerCountry (国) 、NerState (州) 、NerCity (市) 、NerStreet (住所) 。
抽出スクリプトを作成する
1
セクションのプロパティを開く
Document Definition エディターを開き、ドキュメント セクションを右クリックして Properties をクリックし、NLP タブを開きます。
2
スクリプトを作成する
Extraction Scripts で Create をクリックします。
3
辞書をロードするか、スクリプトを編集する
Extraction Script ダイアログで、ユーザー辞書をロードするには Load を、スクリプト エディターを開くには Edit をクリックします。ユーザー辞書は、BOM 付きの UTF-8 または ANSI でエンコードする必要があります。
ドキュメントから住所の構成要素を抽出する
1
住所の領域を指定する
住所が含まれるドキュメントの領域を指定します。FlexiLayout field を使用して検索領域を限定し、その領域を抽出スクリプトのソースとして使用します。詳細については、検索制約を参照してください。
ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) または ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) メソッドを使用して住所を解析すると、インデックス作成時に、検出された構成要素内の各単語に次の属性が付与されます。これらの属性は XML クエリで使用できます。
[resultCollectionNamePrefix]_[NerTypeOfComponent]形式のコレクション名。resultCollectionNamePrefixプレフィックス。- NER オブジェクトの型。
現在、構成要素を抽出できるのはドイツおよび米国の住所のみです。
