ドキュメントのモザイク化は、ドキュメントの複数の重なり合ったスナップショット画像をつなぎ合わせて、1 つの大きな高解像度の合成画像を作成するプロセスです。ドキュメントは、固定された机上のカメラの下に手動でスライドされ、ドキュメントのすべての部分がカメラの視野内にスナップショットされるまで続きます。ドキュメントがカメラの下にスライドされると、ドキュメントのすべての動きがビジョン システムによって大まかに追跡されます。ドキュメントは定期的にスナップショットされ、連続するスナップショットが約 50% 重なり合うようになります。次に、システムは重なり合ったペアを見つけて、すべてのペアが 1 つのドキュメントとしてつなぎ合わされるまで繰り返しつなぎ合わせます。[1]
ドキュメントのモザイク化は、主に 4 つのプロセスに分けられます。
- トラッキング
- 特徴検出
- 通信を確立する
- 画像のモザイク化。
追跡(単純な相関プロセス)
このプロセスでは、カメラの下に滑り込ませた文書の動きがシステムによって大まかに追跡されます。追跡は、単純相関プロセスと呼ばれるプロセスによって実行されます。スナップショットの最初のフレームでは、相関テンプレートとして画像の中心から小さなパッチが抽出されます。相関プロセスは、次のフレームのパッチ領域の 4 倍のサイズで実行されます。紙の動きは、相関関数のピークで示されます。相関関数のピークは、紙の動きを示します。このフレームからテンプレートが再サンプリングされ、テンプレートが文書の端に到達するまで追跡が続行されます。テンプレートが文書の端に到達した後、別のスナップショットが撮影され、文書全体が撮影されるまで追跡プロセスが繰り返し実行されます。スナップショットは、後のプロセスで重なり合った画像をペアリングしやすくするために、順序付きリストに保存されます。
効率的なマッチングのための特徴検出
特徴検出とは、ある画像を別の画像と合わせる変換を見つけるプロセスです。特徴検出には主に2つのアプローチがあります。[2] [3]
- 特徴ベースのアプローチ : 動きパラメータは点の対応から推定されます。このアプローチは、安定して検出可能な特徴が豊富にある場合に適しています。
- 特徴のないアプローチ : 2 つの画像間の動きが小さい場合、動きパラメータはオプティカルフローを使用して推定されます。一方、2 つの画像間の動きが大きい場合、動きパラメータは一般化相互相関を使用して推定されます。ただし、このアプローチでは計算コストの高いリソースが必要になります。
各画像は、画像全体にわたって整理された特徴セットと一致するように、列、行、単語の階層に分割されます。傾斜角度の推定や、列、行、単語の検出は、特徴検出操作の例です。
スキュー角度の推定
まず、テキストの行が画像のラスターラインとなす角度(傾斜角)を推定します。これは±20°の範囲にあると想定されます。画像内の小さなテキストパッチがランダムに選択され、ラスターラインに沿って合計されたパッチのピクセル強度の分散が最大になるまで±20°の範囲で回転されます。[4]
検出された傾斜角度が正確であることを保証するために、ドキュメント モザイク システムは、多数の画像パッチで計算を実行し、各パッチのピクセル強度の分散によって重み付けされた個々の角度の平均を見つけることによって最終的な推定値を導き出します。
列、行、単語の検索
この操作では、歪みを補正した文書は直感的に列、行、単語の階層に分割されます。歪みを補正した文書の照明やページの色に対する感度は、歪みを補正した画像にソーベル演算子を適用し、出力をしきい値処理してバイナリ勾配の歪みを補正した画像を取得することで除去できます。[5]
操作は、大まかに列分割、行分割、単語分割の 3 つのステップに分けられます。
- ピクセルを垂直方向に合計することで、バイナリグラデーションの歪み補正された画像から列を簡単にセグメント化できます。
- 各行のベースラインは、列のセグメンテーション プロセスと同じ方法で水平方向にセグメント化されます。
- 最後に、分割された各行に垂直プロセスを適用して、個々の単語を分割します。
これらのセグメンテーションは、ドキュメント モザイクが、重なり合う画像ペア内の単語の右下隅を一致させることによって作成されるため重要です。さらに、セグメンテーション操作により、行と列の階層のコンテキストで画像のリストを確実に整理できます。
セグメンテーション操作には、2値勾配、歪み補正画像における相当な量の合計処理が含まれ、これは部分和行列[6]を構築することによって行われ、その要素は次のように与えられる。
部分和行列は、バイナリ勾配、歪み補正画像を通じて1回のパスで計算されます。[6]
通信を確立する
2 つの画像は、次の構造のリンク リストの階層に編成されます。
- image=列のリスト
- 行=単語のリスト
- 列=行のリスト
- 単語=長さ(ピクセル単位)
構造の下部には、2 つの画像間の対応を確立するための各単語の長さが記録されており、一致する長さの単語のグループについて対応する構造のみを検索するように削減されます。
シードマッチの検索
シード マッチの検索は、image1 の各行を image2 の各行と比較することによって行われます。次に、2 つの行を各単語ごとに比較します。2 つの単語 (image1 から 1 つ、image2 から 1 つ) の長さ (ピクセル単位) とそのすぐ隣の単語が、定義済みの許容しきい値 (たとえば 5 ピクセル) 内で互いに一致する場合、それらは一致するとみなされます。2 つの行の間に 3 つ以上の単語が一致する場合、各イメージの行は一致するとみなされます。シード マッチの検索操作は、連続する行の一致が 2 組見つかった時点で終了します。
マッチリストの構築
シード マッチの検索操作が完了したら、次のプロセスは、2 つの画像の対応点を生成するためのマッチ リストを作成することです。このプロセスは、シード行から離れた行の一致するペアを検索することによって実行されます。
画像のモザイク

2つの画像の対応点のリストが与えられたら、次に画像の重なり合う部分の変換を見つけます。ピンホールカメラモデルを想定すると、画像1のピクセル(u,v)と画像2のピクセル(u0,v0)間の変換は平面対平面の射影性によって示されます。[7]
射影性のパラメータは4組のマッチングポイントから求められます。RANSAC回帰[8]技術を使用して、外れ値の一致を除外し、残りの良好な一致から射影性を推定します。
投影率は、重なり合う部分の角の相関を使用して微調整され、サブピクセル精度の 4 つの対応関係が得られます。次に、式 1 を使用して、image1 を image2 の座標系に変換します。このプロセスの典型的な結果を図 5 に示します。
多くの画像が対応
最後に、すべての画像を「アンカー」画像の座標系にマッピングすることで、ページ全体の構成が構築されます。アンカー画像は通常、ページの中心に最も近いものです。アンカー フレームへの変換は、前に見つかったペアワイズ変換を連結することによって計算されます。生のドキュメント モザイクを図 6 に示します。
ただし、重なり合う連続しない画像の問題が発生する可能性があります。この問題は、階層サブモザイクを実行することで解決できます。図 7 に示すように、image1 と image2 が登録され、image3 と image4 も登録されて、2 つのサブモザイクが作成されます。これらの 2 つのサブモザイクは、後で別のモザイク処理でつなぎ合わされます。
適用分野
ドキュメントモザイク技術は、次のようなさまざまな分野に適用できます。
- 文書画像のテキスト分割[5]
- 文書認識[4]
- デジタルデスク上の紙とのやりとり[9]
- 仮想環境用ビデオモザイク[10]
- 画像登録技術[3]
関連研究論文
- Huang, TS; Netravali, AN (1994). 「特徴の対応からの動きと構造: レビュー」. Proceedings of the IEEE . 82 (2): 252–268. doi :10.1109/5.265351.
- DG Lowe. [1] 知覚組織と視覚認識。Kluwer Academic Publishers、ボストン、1985年。
- Irani, M.; Peleg, S. (1991). 「画像登録による解像度の向上」. CVGIP: グラフィカルモデルと画像処理. 53 (3): 231–239. doi :10.1016/1049-9652(91)90045-L. S2CID 4834546.
- Shivakumara, P.; Kumar, G. Hemantha; Guru, DS; Nagabhushan, P. (2006). 「スライディング ウィンドウ ベースのドキュメント画像モザイク化アプローチ」。Image and Vision Computing . 24 (1): 94–100. doi :10.1016/j.imavis.2005.09.015.
- [2] カメラベースの文書画像モザイク化。(nd). Image (ロチェスター、NY)、1。
- クマール、GH;シバクマラ、P.達人、DS;ナガブシャン (2004)。 「ドキュメント画像のモザイク化: 新しいアプローチ」(PDF)。文章。29 (3): 329–341。CiteSeerX 10.1.1.107.4304。土井:10.1007/bf02703782。S2CID 62593940。
- Sato, T., Ikeda, S., Kanbara, M., Iketani, A., Nakajima, N., Yokoya, N., & Yamada, K. (nd). カメラの動きを推定する文書と写真の高解像度ビデオモザイク。Mosaic A Journal for the Interdisciplinary Study of Literature。
参考文献
- ^ abcd Zappalá, Anthony; Gee, Andrew; Taylor, Michael (1999). 「ドキュメントモザイク」. Image and Vision Computing . 17 (8): 589–595. doi :10.1016/S0262-8856(98)00178-4.
- ^ Mann, S.; Picard, RW (1995). 「射影群のビデオ軌道: 画像モザイクの新しい視点」.技術レポート (知覚コンピューティングセクション)、MIT メディアラボ(338). CiteSeerX 10.1.1.56.6000 .
- ^ ab Brown, LG (1992). 「画像登録技術の調査」ACM Computing Surveys . 24 (4): 325–376. CiteSeerX 10.1.1.35.2732 . doi :10.1145/146370.146374. S2CID 14576088.
- ^ ab Bloomberg, Dan S.; Kopec, Gary E.; Dasari, Lakshmi (1995). 「文書画像のゆがみと向きの測定」(PDF)。 Vincent, Luc M; Baird, Henry S (編)。Document Recognition II。 Proceedings of the SPIE。 Vol. 2422。 pp. 302–315。Bibcode :1995SPIE.2422..302B。doi :10.1117/12.205832。S2CID 5106427。
- ^ ab Taylor, MJ; Zappala, A.; Newman, WM; Dance, CR (1999). 「カメラを通したドキュメント」. Image and Vision Computing . 17 (11): 831–844. doi :10.1016/S0262-8856(98)00155-3.
- ^ ab Preparata, FP; Shamos, MI (1985).計算幾何学: 入門. コンピュータサイエンスのモノグラフ. Springer–Verlag. ISBN 9780387961316。
- ^ Mundy, JL; Zisserman, A. (1992). 「付録 - マシンビジョンのための射影幾何学」 .コンピュータビジョンにおける幾何学的不変性. ケンブリッジ MA: MIT プレス. CiteSeerX 10.1.1.17.1329 . ISBN 9780262132855。
- ^ Martin A. Fischler、Robert C. Bolles (1981)。「ランダムサンプルコンセンサス:画像分析と自動地図作成への応用によるモデルフィッティングのパラダイム」(PDF)。Communications of the ACM。24(6):381–395。doi :10.1145 /358669.358692。S2CID 972888。
- ^ Wellner, P. (1993). 「デジタルデスク上の紙とのやり取り」Communications of the ACM . 36 (7): 87–97. CiteSeerX 10.1.1.53.7526 . doi :10.1145/159544.159630. S2CID 207174911.
- ^ Szeliski, R. (1996). 「仮想環境のためのビデオモザイク」. IEEE コンピュータグラフィックスとアプリケーション. 16 (2): 22–306. doi :10.1109/38.486677.
文献
- Anthony , Zappalá、Andrew Gee、Michael Taylor (1999)。「ドキュメントのモザイク化」。Image and Vision Computing。17 (8): 589–595。doi :10.1016/S0262-8856(98)00178-4。
外部リンク
- アドバンストビジョンホームページ
