
コンピュータビジョンにおいて、スティクセル(「スティック」と「ピクセル」の合成語)は、シーンの特定の垂直スライス内の最も近い障害物を近似する垂直スティックの形で、画像内の深度情報をスーパーピクセルで表現したものです。2009 年に導入された[ 1 ]スティクセルは、ロボットナビゲーションや先進運転支援システムに応用されており、ロボット環境や交通シーンを中程度の抽象度で表現するために使用できます。[ 2 ] [ 3 ]
コンピュータビジョンにおけるシーン理解の問題の一つは、エージェントが移動できるカメラ周辺の水平方向の自由空間と、それを区切る垂直方向の障害物を特定することです。画像に深度情報(例えば、ステレオ視差、ライダー、または単眼深度推定から生成される)を組み合わせることで、観測されたシーンの密な三次元再構成が可能になります。密な再構成の欠点の一つは、画像内の各ピクセルが点群の要素にマッピングされるため、データ量が膨大になることです。交通シーンやロボットナビゲーションなど、主に垂直方向の障害物によって区切られた平面自由空間を特徴とするビジョン問題は、メモリと処理時間を節約できる圧縮表現の恩恵を受けることができます。
スティクセルは、観測シーンで最も近い障害物に属する垂直面のスライスを表す細い垂直長方形です。これにより、このような問題でシーンを表現するために必要な情報量を劇的に削減できます。スティクセルは、底面の垂直座標、スティックの高さ、奥行きの 3 つのパラメータによって特徴付けられます。スティクセルは固定幅で、各スティクセルは一定数の画像列にまたがり、水平方向の画像解像度をダウンサンプリングできます。元の定式化では、画像の各列には最大で 1 つのスティクセルが含まれますが、後に拡張が行われ、各列に複数のスティクセルを許容することで、異なる距離にある複数のオブジェクトを表現できるようになりました。[ 4 ]
スティクセル推定への入力は、ステレオ視差やその他の手段から計算できる高密度深度マップです。元のアプローチでは、自由空間を推定するためにセグメント化できる占有グリッドを計算し、動的計画法によって最適なセグメント化を見つける効率的な方法を提供します。[ 5 ]占有グリッドマッピングの代わりに、多様体ベースの方法などの代替アプローチを使用できます。[ 6 ]
自由空間境界は、最も近い縦方向距離にある障害物の基点を提供しますが、画像の各列には、異なる距離にある複数の物体が現れる場合があります。障害物を完全に定義するには、その高さを推定する必要があります。これは、物体の奥行きを背景の奥行きから分離することによって実現されます。奥行き値に基づいてピクセルに対するメンバシップ関数を定義できます。このメンバシップは、ピクセルが最も近い垂直方向の障害物または背景に属する信頼度を表します。障害物と背景を分離するカットは、動的計画法を用いて効率的に計算できます。
自由空間と障害物の高さの両方がわかれば、各スティクセルが占める列の情報を融合することでスティクセルを推定でき、最終的に、スティクセルがカバーするピクセルの深さに対するモデルフィッティングによって、スティクセルのより精緻な深さを推定できます。場合によっては、信頼度情報(例えば、セミグローバルマッチングなどの手法によって生成された視差信頼度)と組み合わせることもできます。[ 7 ]