これは、筆跡の法医学的比較のためのソフトウェアシステムです。バッファロー大学の文書分析および認識のための卓越センターであるCEDARで開発されました。 [1] [2] [3] CEDAR-FOXには、質問を受けた文書検査官と対話して、スキャンされた文書から関心領域の抽出、テキストの行と単語の決定、テキスト要素の認識などの処理手順を実行する機能があります。最終目標は、2つの筆跡サンプルを比較して、検察側と弁護側の仮説の下での対数尤度比を決定することです。署名サンプルの比較にも使用できます。米国特許[4]で保護されているこのソフトウェアは、 Cedartech, Inc.からライセンスを取得できます。
詳細
筆者検証は、2 つの手書きサンプルが同じ筆者によって書かれたかどうかを判断するタスクです。これは、疑問文書検査で使用されます。一連のメトリックを使用することで、CedarFox は、2 つの文書が同じ個人によって書かれたか、異なる個人によって書かれたかの信頼性の尺度を関連付けることができます。CedarFox では、比較を取得するために、文書全体または文書の特定の領域を選択できます。比較は、マクロ機能 (傾斜、接続性などの全体的な特性を測定)、ミクロ機能 (個々の文字の形状に基づく)、およびスタイル機能 (文字ペアの形状、バイグラムなど) に基づいています。筆者検証には、(i) 疑問文書を単一の既知の文書と比較する (この比較の基礎は、個人が持つ可能性のある変化の量に基づく統計です)、および (ii) 疑問文書を「複数の既知の」文書と比較する、という 2 つの異なるモードがあります。ここでは、システムは既知の文書から筆者の習慣について学習します。このモードを使用するには、少なくとも 4 つの既知の文書が必要です。ユーザーを識別するタスクは、2 つの部分に分かれています。
文書処理と特徴抽出
CEDAR-FOX は、ドキュメントを比較できるようにするために、ドキュメントに対してさまざまな操作を実行します。これには、しきい値設定、行削除、行分割、単語分割、トランスクリプト マッピングが含まれます。
画像処理
- しきい値処理は、グレースケール画像をバイナリに変換して、前景ピクセルを背景ピクセルから分離します。使用されるしきい値処理方法は、Otsu しきい値処理、適応しきい値処理、およびテクスチャしきい値処理です。
- 文書が罫線紙を使用して書かれている場合、ユーザーは下線削除操作を実行できます。この操作にはハフ変換が適用され、ユーザーは適切なしきい値を選択できます。高いしきい値を選択すると、文字のストロークの一部が削除されるため、ユーザーはしきい値の適切な値を見つける必要があります。
- 行分割は、文書内の各行を分離し、二変量ガウス密度の概念を使用します。単語分割も同様に動作し、文書内の各単語を分離します。

単語の分割。 - トランスクリプト マッチングは、手書き画像のトランスクリプトを含むテキスト ファイルをソフトウェアに提供するグラウンド トゥルース マッチングです。これは、異なる被験者に同じ内容を手書きしてもらい、それを未知の文書と照合する場合に役立ちます。トランスクリプトと手書き画像の間で最適な単語レベルのアラインメントを見つけます。文字画像が抽出され、文書間の類似性を比較するために使用できます。
システムユーティリティ
CedarFox には、ドキュメントを直接スキャンするだけでなく、結果をスプレッドシートに直接入力したり、中間結果を印刷したりするためのユーザー インターフェイスがあります。ドキュメントのメタデータを保存するためのデータベース アクセスも利用できます。
ドキュメントの比較
CEDAR-FOXでは、文書比較のための多くのオプションが利用可能です。使用される4つの主要な検証モデルは次のとおりです。
- 識別要素を特定する。
- 特徴はマクロ (グローバル) とマイクロ (ローカル) の特徴に分かれています。マクロ特徴はドキュメント全体に対して計算されますが、マイクロ特徴は選択された文字/バイグラム/単語に対して計算されます。マクロ特徴は、グレースケール ベース、輪郭ベース、傾斜ベース、ストローク幅、傾斜、高さ、単語間隔です。これらの特徴は比較に使用されます。
- 類似度測定を使用して特徴から距離空間にマッピングします。
- ドキュメントの比較は、特徴空間から距離空間にマップされます。マクロ特徴は実数値であるため、距離空間へのマッピングは 2 つの特徴間の絶対差になります。バイナリ値特徴の類似性は、ハミング距離、ユークリッド距離などを使用して計算できます。相関類似度測定が最適な測定として推奨されます。
- PDF を使用した距離空間分布のパラメトリック モデリング。
- 距離空間の分布は、ガウス分布またはガンマ分布として表される確率密度関数を使用してモデル化されます。ドキュメントの性質はミクロの特徴に影響しますが、マクロの特徴には影響しません。尤度比 (LR) が計算され、続いて対数尤度比 (LLR) が計算されます。
- 9 ポイントの証拠の強さを計算します。
- LLR は、9 段階の定性スケールにマッピングされます。このスケールは、LLR 値に関連付けられている証拠の強さに対応します。これは、ASTM テクノロジの 9 段階スケールに従います。[1- 同じと識別、2- 可能性が高い、3- おそらく実行、4- 兆候は実行、5- 結論なし、6- 兆候は実行なし、7- おそらく実行なし、8- 可能性が高いが実行なし、9- 排除として識別]。
検索中
CedarFox には、手書き文書内のキーワードを検索するための複数のモードがあります。ワード スポッティングでは、ユーザーはクエリとして単語画像を選択できます。この画像を使用して、指定した文書内で類似の単語画像を検索できます。別の種類の検索では、ユーザーが単語を入力でき、この単語がクエリに一致する可能性に基づいて文書内のすべての単語をランク付けします。
手書き認識
CedarFox には自動文字認識機能があります。また、事前に指定された辞書による単語認識も組み込まれています。書き手の検証/識別の目的で最高の文字認識精度が必要な場合は、ユーザーが手動で文字 ID を入力することもできます。

読みやすさと可読性の分析
単語ギャップの比較と Palmer メトリックとの比較がサポートされています。
参考文献
- ^ SN Srihari、C. Huang、H. Srinivasan、「双子の筆跡の識別可能性について」、Journal of Forensic Sciences、Wayback Machineに 2010-11-23 アーカイブ、2008 年 3 月、第 53 巻 (2)、pp. 430-446
- ^ Srihari, SN, SH. Cha, H. Arora and S. Lee、「手書きの個性」、Journal of Forensic Sciences 、 Wayback Machineに 2010-11-23 アーカイブ、2002、47(4): 856-872
- ^ SN Srihari、H. Srinivasan、K. Desai、「CEDAR-FOX を使用した質問文書の検査」、法医学文書検査ジャーナル、18、2007 年、pp. 1-20
- ^ SN Srihari 他、「手書きまたは生体認証サンプルを分析および/または比較する方法および装置」、米国特許番号 7,580,551、2009 年 8 月 29 日。
外部リンク
- シーダーテック
- シダー
- シーダーフォックスQDワークショップ
- Justnet: 司法技術情報センター: 文書審査ツール[永久リンク切れ ]
