| 用語 | 定義 |
|---|---|
| ドキュメント | 1 つ以上のページ画像と、そこから抽出されたデータの集合。 |
| Document Definition | 特定の文書タイプを識別し、処理する方法を定義します。これには、ドキュメント構造 (ページをドキュメントにまとめる際に使用する、許可されたページ順序) 、ドキュメント セクション、field データが満たす必要のあるルール、データ フォーム上の field とそのキャプションの位置、エクスポート設定、処理設定が含まれます。 |
| 文書タイプ | 共通の特性を持ち、ビジネスプロセス内で同様に処理されるドキュメント。例として、請求書、契約書、パスポートがあります。 |
| エンティティ | NLP で抽出する情報を含む field または field グループ。例として、人、企業、場所、金額、日付があります。 |
| Field | データ抽出の対象となるドキュメント要素。field には、単純なものと複雑なものがあります。複雑な field の例として、各セルが個別の子 field となるテーブルフィールドがあります。 |
| NER (固有表現認識) | 非構造化テキスト内の固有表現を検出して分類する情報抽出タスク。 |
| NLP (自然言語処理) | コンピューターによる自然言語の解析と合成を研究する、人工知能および計算言語学の下位分野。情報抽出、機械翻訳、チャットボット、ドキュメント分類、感情分析などに利用されます。 |
| NLP モデル | テキストから抽出するエンティティとセグメント、およびその抽出方法を決定する仕組み。対象分野と抽出アルゴリズムはトレーニング時に選択されます。 |
| セグメント | 抽出対象のデータを含む、1 つ以上の段落からなるテキスト フラグメント。セグメントは、たとえば契約解除の条件など、抽出対象の field にすることもできます。 |
| セグメンテーション | セグメントを特定するプロセス。情報抽出に先行し、エンティティの検索対象を特定のフラグメントに絞り込むことで、大規模なドキュメントの処理に役立ちます。 |
Using NLP to process unstructured documents
用語集
ABBYY FlexiCapture で使用される NLP 用語集。エンティティ、field、NER、NLP モデル、セグメント、セグメンテーション、Document Definition を定義します。
