自動種識別は、デジタル技術と人工知能を介して、分類学者の専門知識を生態学者、準分類学者などに提供する方法です。今日、ほとんどの自動識別システムは、識別のために種を描写した画像に依存しています。[ 1 ]正確に識別された種の画像に基づいて、分類器が訓練されます。十分な量の訓練データに触れると、この分類器は、以前に見たことのない画像で訓練された種を識別できるようになります。
昆虫(個体)やグループ(種、ギルド、特徴など)といった生物学的対象を自動的に識別することは、何世紀にもわたって分類学者の夢でした。初期の多変量バイオメトリクス手法の目標は、グループ識別とグループ間特性という長年の問題に取り組むことでした。1950年代と60年代には多くの予備的な研究が行われましたが、対象物の生物学的識別を完全に自動化する実用的なシステムの設計と実装の進歩は、もどかしいほど遅いことが判明しました。2004年、ダン・ヤンゼン[ 2 ]は 、新たな読者に向けてこの夢を更新しました。
宇宙船が着陸する。彼は降り立ち、周囲を指差す。すると「友好的―非友好的―食用―有毒―安全―危険―生物―無生物」と表示される。次のスキャンでは「Quercus oleoides―Homo sapiens―Spondias mombin―Solanum nigrum―Crotalus durissus―Morpho peleides―蛇紋岩」と表示される。これは半世紀前、中学3年生の時にSF小説を読んで以来、ずっと私の頭の中に残っている。

ヤンゼンがこの古典的な問題に対して好んで用いた解決策は、DNAから種を識別する機械を構築することであった。しかし、近年のコンピュータアーキテクチャの発展とソフトウェア設計の革新により、ヤンゼンの構想を実現するために必要なツールが、数年後ではなく、今まさに系統分類学とコンピュータ科学のコミュニティの手に渡っている。しかも、DNAバーコードの作成だけでなく、デジタル画像に基づく識別にも利用できるのだ。
2004 年に発表された調査[ 3 ]では、自動種識別が当時広く採用されていなかった理由と、将来的に現実的な選択肢となるかどうかについて調査しています。著者らは、「形態的特徴に基づいて自動種識別システムを開発しようとする研究は少数ながら増加傾向にある」ことを発見しました。細胞、花粉、翅、生殖器などの種の構造を分析した 20 の研究の概要では、1 ~ 72 種のトレーニング セットで識別成功率が 40% ~ 100% であることが示されています。しかし、これらのシステムには 4 つの根本的な問題があることも明らかになりました。(1) トレーニング セットが小さすぎる (1 種あたり 5 ~ 10 標本) ため、特に希少種の場合、拡張が難しい可能性がある、(2) 識別エラーが十分に研究されていないため、それらを処理して分類体系を見つけることができない、(3) スケーリングが研究対象とする種数が少ない (200 種未満)、(4) 新種がトレーニングされた種に限定されているため、新種の観察結果は既知の種のいずれかに分類される、というものです。
2017年に発表された調査[ 4 ]では、過去10年間(2005~2015年)の自動植物種識別に向けた進歩と発見を体系的に比較・議論しています。この期間中に、主にコンピュータサイエンスのバックグラウンドを持つ著者によって、質の高い媒体で120件の一次研究が発表されました。これらの研究では、特徴情報を保持しながらピクセルベースの画像データの高次元性を削減する特徴や分類方法など、豊富なコンピュータビジョンアプローチが提案されています。これらの研究の大部分は識別のために葉を分析していますが、花ベースの識別方法を提案している研究はわずか13件です。その理由は、葉は収集や撮影が容易で、年間を通して入手可能だからです。提案された特徴は、形状、質感、色などの一般的なオブジェクト特性と、葉脈や縁などの葉固有の特性を捉えています。ほとんどの研究では、評価に250種以下のデータセットが使用されています。しかし、この点に関して進歩が見られ、ある研究では2k種以上[ 5 ]のデータセットを、別の研究では20k種以上[ 6 ]のデータセットを使用している。
2022年に開発されたシステム[ 7 ]は、電子トラップを使用した自動昆虫監視システムで使用するのに十分な精度を自動識別で達成できることを示しました。数百枚の画像で分類器をトレーニングすることで、ショウジョウバエを正しく識別し、種の侵入や害虫の発生を検出することを目的とした継続的な監視に使用できます。このシステムの成功にはいくつかの側面が貢献しています。まず、電子トラップを使用することで標準化された設定が提供され、異なる国や地域に展開されていても、サイズ、視野角、照明などの視覚的な変動が制御されます。これは、自動害虫識別のための自由視野システムよりもトラップベースのシステムの開発が容易であることを示唆しています。
保全が世界的な懸念事項となっている生物多様性そのものを特定できる専門家が不足している。 1993年に古生物学におけるこの問題について論じたロジャー・ケスラー[ 8 ]は、次のように指摘している。
「…主要な生物群について概観的な知識を持つ体系的な古生物学者が不足しつつある…次世紀の古生物学者は、分類学的問題にじっくり取り組む余裕はないだろう…古生物学は、その成功に大きく貢献してきた体系学者の助けなしに、その興奮を維持していかなければならないだろう。」
この専門知識の不足は、正確な同定に依存する商業産業(農業、生物層序学など)だけでなく、幅広い純粋研究および応用研究プログラム(保全、生物海洋学、気候学、生態学など)にも深刻な影響を与えています。また、あらゆる生物群の技術的、分類学的文献には、矛盾した誤った同定例が散見されることも、非公式ながら広く認識されています。これは、分類学者が同定を行うための訓練やスキルが不十分であること(例えば、類似したグループ間の境界を認識する際に異なる経験則を使用している)、元のグループの説明や図が十分に詳細ではないこと、最新のモノグラフや適切にキュレーションされたコレクションへのアクセスが不十分であること、そしてもちろん、分類学者がグループの概念に関して異なる意見を持っていることなど、さまざまな要因によるものです。査読は、この分野における最も明白な誤り(作為または作為の誤り)を排除するものであり、しかも著者が問題となっている標本の適切な表現(例えば、図、録音、遺伝子配列など)を提供した場合に限られる。
分類学もまた、自動識別システムのさらなる開発と利用から大きな恩恵を受ける。人材と資源の両方を引き付けるためには、分類学は「大規模で協調的な国際科学事業」へと変貌を遂げなければならない。[ 9 ]多くの人が、インターネット、特にワールドワイドウェブを介し た利用が、この変貌を実現するための媒体であると指摘している。形態学的データ、音声クリップ、ビデオファイルなどにアクセスするための仮想的なGenBankのようなシステムを確立することは正しい方向への大きな一歩となるが、観察情報やテキストベースの記述へのアクセスを改善するだけでは、分類上の障害や識別再現性の低さの問題をうまく解決することはできない。むしろ、定性的な基準に基づいて重要な決定を下す際に必然的に伴う主観性を減らすか、少なくともより形式的な分析的文脈に組み込む必要がある。

適切に設計され、柔軟かつ堅牢な自動識別システムは、分散コンピューティングアーキテクチャを中心に構築され、権威あるトレーニングセットデータ(画像や遺伝子配列など)のコレクションを参照することで、原則として、すべての分類学者に電子データアーカイブへのアクセスと、一般的な分類群の日常的な識別を処理するために必要な分析ツールを提供できます。適切に設計されたシステムは、アルゴリズムが信頼できる識別を行えない場合を認識し、その画像を専門家(別のデータベースからアクセスできる)に照会することもできます。このようなシステムには人工知能の要素も組み込むことができ、使用頻度が高くなるほど性能が向上します。種の形態学的(または分子)モデルが開発され、正確であることが実証されると、これらのモデルにクエリを実行して、観察された変異パターンと変異限界のどの側面が識別に使用されているかを判断し、新しい(そして潜在的に)より信頼性の高い分類学的特徴の発見への道が開かれます。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)以下に、種識別システムのホームページへのリンクをいくつか示します。SPIDAとDAISYシステムは基本的に汎用性が高く、提示されたあらゆる画像データを分類できます。ABISとDrawWingシステムは、翅脈に基づく特定の特徴を照合することで識別を行うため、膜状の翅を持つ昆虫に限定されます。