Skip to main content
検証オペレーターは、NLPモデルを再学習することでデータ抽出を改善できます。FlexiCaptureがfieldを検出できなかったり、あるfieldを別のfieldと取り違えたりした場合、オペレーターは正しいfieldを指定してモデルを再学習します。FlexiCaptureはその後、再学習済みモデルを使用して、より高精度に抽出します。
追加学習は、Document DefinitionsにロードされたNLPモデルでは使用できません。

検証中に学習を開始する

次の2つの方法のいずれかで学習を開始します。
  • 検証ステージの後に学習ステージを追加します。学習は、学習用バッチに対して指定された条件が満たされたときに開始されます。詳細については、Workflow setupを参照してください。
  • 文書を手動で学習ステージに送信します。作業バッチ内の文書を右クリックし、Trainを選択します。

学習の仕組み

  • 学習を開始すると、FlexiCapture は汎用の学習用バッチ (まだ存在しない場合) を作成し、候補に関係なく Document Definition 内のすべてのドキュメントをそのバッチにコピーします。
  • 各ドキュメントには、学習用 または テスト用 のステータスが割り当てられます。
  • 学習用 としてマークされたドキュメントは、新しい NLP モデルの構築に使用されます。
  • 新しいモデルは、テスト用 としてマークされたドキュメントを使用してテストされます。
  • 新しいモデルの性能が既存のモデル以上であれば、既存のモデルに置き換わります。そうでない場合は却下されます。
一部のドキュメントで field は同じでも配置が大きく異なる場合は、認識精度を向上させるため、候補ごとに別々の学習用バッチを作成してください。

特定のベンダーまたは候補用の学習用バッチを作成する

1

プロジェクトを開く

Project Setup Station で、NLP モデルを使用するプロジェクトを開きます。詳細については、NLP モデルの作成を参照してください。
2

Field Extraction Training Batches を開く

Fields Training → Open Field Extraction Training Batches を選択するか、Ctrl+Alt+B を押すか、ショートカットメニューから Field Extraction Training Batches を選択します。
3

バッチを作成する

File → New Batch を選択します (または Ctrl+N を押します) 。Document Definition と候補を選択し、その後ショートカットメニューから NLP Batch を選択します。
4

Documentを追加して学習する

Documentを追加して認識し、セクションの順序を編集した後、ショートカットメニューの TrainCtrl+F7、またはツールバーの Train Batch ボタンを使用して学習を開始します。
学習済み NLP モデルの品質は、学習 Documentの数とマークアップの品質に左右されます。
  • 学習 Documentでは、Document Definition で定義されているすべての field をマークアップします。
  • 各学習用バッチには、100 ~ 500 件のDocumentを含めます。この範囲であれば、学習を遅らせることなく、FlexiCapture が最適なパラメーターを選択できます。
オペレーターのフィードバックを学習に使用する場合、新しいDocumentは学習用バッチと候補バッチの両方に追加されます。
  • 専用の学習用バッチを持つ候補では、そのバッチ用に作成されたモデルが使用されます。
  • その他すべての候補では、汎用の学習用バッチ用に作成されたモデルが使用されます。
学習用バッチにすでに含まれているDocumentと同一のDocumentが同じソースから追加された場合、新しいDocumentが古いDocumentに置き換わり、この操作はバックグラウンドタスクログに記録されます。FlexiCapture は、Documentの登録パラメーターを使用して、そのDocumentがコピーかどうかを判定します。

学習用バッチの設定

バッチを作成したら、Show NLP Batch Settings を選択して、以下のオプションを設定します。

学習統計のエクスポート

学習の完了後、NLP モデルに関する以下の統計をエクスポートできます。
  • 学習用バッチの設定。
  • 新旧の NLP モデルに関する情報。
  • 学習時間。
  • 使用した NLP コンポーネントのバージョン。
  • ドキュメントおよび field の学習統計。
  • エクスポートしたデータの鮮度。isActual Parameter が false の場合、学習後にバッチが変更されています (ドキュメントの追加または削除、マークアップ の変更など) 。最新の統計を取得するには、再度学習を実行してください。
ログをエクスポートするには、バッチを右クリックし、ショートカットメニュー で field 抽出統計をエクスポート をクリックして、CSV ファイルの保存先を指定します。