メインコンテンツへスキップ
ABBYY FlexiCapture は、さまざまな種類の文書からデータを単一のフローで抽出できるソフトウェアソリューションです。 1 つのフローでさまざまな文書を処理できます。また、構造化セクションと半構造化セクションの両方を含む文書など、種類の異なる文書を混在させて処理するようプログラムを設定することもできます。文書の種類がシステム構成に影響するのは、Document DefinitionsDocument Definitions の作成方法に限られます。処理する文書の種類によって、Operator の作業内容が変わることはありません。 ABBYY FlexiCapture は、以下の文書を自動入力できるよう設定できます。これらは 1 つのフロー内で処理することも可能です。
構造化フォームとは、マーク付きの情報 field 一式を含み、その書式、数、レイアウトが文書ごとに変わらない文書です。このような文書は fixed forms と呼ばれます。たとえば、ほとんどのアンケートや申請書は fixed forms です。通常、こうしたフォームは空白フォームとして配布され、手書きで記入されます。文書フロー内で fixed form を識別し、そこからデータを抽出するには、抽出対象のデータを含む field の位置をプログラムに示す 1 つの固定 layout を作成する必要があります。自動入力の要件を満たすように作成された fixed forms は、最も効率よく処理できます。このようなフォームは machine-readable forms と呼ばれます。こうしたフォームの要件や作成方法の詳細については、Creating a machine-readable forms セクションを参照してください。このプログラムには、machine-readable forms を設計するための便利なツールである ABBYY FormDesigner (ABBYY FlexiCapture に付属) が含まれています。ABBYY FormDesigner を使用したフォーム設計については、User Guide およびヘルプトピックを参照してください。Document Definition を作成する基本的な手順は、構造化文書を例に説明されています。
fax で受信した fixed forms は歪んでいる場合があります。サイズや field の相対位置が変化していることがあるため、このようなフォームを処理する際は、認識精度を高めるために FlexiLayout を使用することをお勧めします。
これらは、情報 field 一式を含む文書で、文書ごとにデザイン、数、レイアウトが大きく異なる場合があります。こうした文書は flexible と呼ばれます。たとえば、請求書は半構造化文書です。異なる会社から送られてくるため、アイテム数も書式も異なることが多いからです。すべての請求書には請求書番号と支払うべき請求額がありますが、それらの位置は文書ごとに異なります。flexible forms を識別してそこからデータを抽出するために、ABBYY FlexiCapture では flexible layout (FlexiLayout) を使用します。flexible layout は、ABBYY FlexiLayout Studio と呼ばれる専用の module を使って作成します。この module の詳細は、User Guide およびヘルプトピックで確認できます。半構造化文書の処理は、layout の作成とロードの段階を除けば、fixed forms の処理とほとんど同じです。詳細については、Creating a Document Definition for semi-structured document processing を参照してください。
ABBYY FlexiCapture は、契約書、手紙、注文書、図表など、自由形式で情報が記載された非構造化文書の処理にも使用できます。プログラムは、非構造化文書を fixed forms または flexible forms の別紙として自動的に識別できるほか、flexible layout を使用して識別し、PDF searchable filesPDF searchable files または画像ファイルとしてエクスポートすることもできます。非構造化文書から index field を抽出する方法としては、flexible layout を使用した自動抽出と手動入力の両方に対応しています。NLP を使用して非構造化文書を処理することもできます。この技術では、NLP Model を使ってテキストから情報を抽出します。非構造化文書の処理の典型的な scenario としては、紙の archive を電子化する必要があり、さらに属性ベースの高速検索を実現するために 2 つまたは 3 つの index field を抽出する必要がある場合が挙げられます。詳細については、Creating Document Definitions for unstructured and semi-structured documents を参照してください。