Introducing ABBYY FlexiLayout Studio
非構造化文書からのデータキャプチャ
FlexiLayoutを使用して非構造化文書からデータキャプチャします。これは、固定のDocument Definitionでは対応できない可変fieldsの位置を特定するための形式化記述です。
文書には、手書きまたは機械で記入されるfieldsが含まれます。文書は1ページ以上で構成される場合があります。文書は、固定文書と半構造化文書に分けられます。
固定文書では、同一のfieldsがバッチ内のすべての文書でまったく同じ位置にあります。固定文書は、データfieldから情報を読み取り、それをデータベース、文書管理システム、またはアーカイブ用アプリケーションにエクスポートする文書処理アプリケーションで処理できます。
固定文書からデータを抽出するには、fieldの位置と、そこに含まれる可能性のある情報の型を記述したDocument Definitionを使用します。同じDocument Definitionを使用して、所定のバッチ内のすべての文書からデータを抽出します。これにより、文書処理アプリケーションは、文書上の特定のデータをどこで探すべきか、またデータが正しく抽出されたことをどのように確認するかを把握できます.
半構造化文書では、同じデータfieldでも、文書によって位置が異なります。さらに、バッチ内のすべての文書にすべてのfieldsが含まれているとは限りません (たとえば、署名fieldがある文書もあれば、ない文書もあります) 。各種の支払文書は、半構造化文書の代表的な例です。
書簡、登録フォーム、法的文書も、半構造化文書の代表的な例です。同じ種類の文書であれば構造は似ていますが、それでもfieldには違いが生じることがあります。たとえば、書簡にはページ上部に差出人の氏名と住所が記載され、法的文書には当事者名、その詳細、発効日が記載されます。
半構造化文書ではfieldの正確な位置を事前に把握できないため、Document Definition を使用してそのような文書からデータを抽出することはできません。つまり、従来のデータ抽出システムでは、そのような文書からデータを抽出できません。
ABBYY FlexiLayout Studioを使用すると、非構造化文書を形式的に記述し、検索アルゴリズムをプログラムに与えることで、データfieldsを見つけてそれらのfieldsから情報を抽出できるようになります。形式的な記述は、非構造化文書上のfields相互の関係と、fields内のデータの性質に基づいています。作成した記述は文書画像でテストでき、情報を確実に抽出できることを確認できます。
ABBYY FlexiLayout Studioで作成された形式化記述は、FlexiLayoutsと呼ばれます。FlexiLayoutを使用して非構造化文書からデータ取得を開始するには、それをABBYY FlexiCaptureのようなデータキャプチャアプリケーションにエクスポートする必要があります。ABBYY FlexiCaptureテクノロジーは幅広いデータキャプチャ機能を備えており、実質的にあらゆる種類の文書を処理できます。
