ケモメトリクスとは、データ駆動型の手法を用いて化学システムから情報を抽出する科学である。ケモメトリクスは本質的に学際的な分野であり、化学、生化学、医学、生物学、化学工学における問題に取り組むために、多変量統計学、応用数学、コンピュータサイエンスといった主要なデータ分析分野で頻繁に用いられる手法を活用する。この点において、心理測定学や計量経済学といった他の学際的分野と共通する特徴を持つ。
ケモメトリクスは、実験的な自然科学、特に化学における記述的問題と予測的問題の両方の解決に応用されます。記述的応用では、化学システムの特性をモデル化し、システムの根底にある関係性や構造を学習すること(すなわち、モデルの理解と識別)を目的としています。予測的応用では、化学システムの特性をモデル化し、関心のある新しい特性や挙動を予測することを目的としています。どちらの場合も、データセットは小規模な場合もありますが、多くの場合、数百から数千の変数、数百から数千の事例または観測値を含む大規模で複雑なものとなります。
ケモメトリクス技術は、分析化学やメタボロミクスにおいて特に広く用いられており、改良されたケモメトリクス分析法の開発は、分析機器および分析手法の最先端技術の発展にも貢献し続けている。ケモメトリクスは応用主導型の学問分野であり、標準的なケモメトリクス手法は産業界で広く利用されている一方で、学術研究グループはケモメトリクス理論、手法、および応用開発の継続的な発展に尽力している。
化学における最も初期の分析実験でさえ、ある種のケモメトリクスを含んでいたと主張することもできるが、この分野は一般的に、コンピュータが科学調査にますます活用されるようになった1970年代に出現したと認識されている。「ケモメトリクス」という用語は、1971年の助成金申請書の中でスヴァンテ・ウォルドによって造語され[ 1 ] 、その後まもなく、この分野の2人の先駆者であるスヴァンテ・ウォルドとブルース・コワルスキーによって国際ケモメトリクス協会が設立された。ウォルドはスウェーデンのウメオ大学の有機化学教授であり、コワルスキーはシアトルのワシントン大学の分析化学教授であった[ 2 ] 。
初期の応用例の多くは多変量分類に関するものであり、その後、数多くの定量的予測応用が続き、1970年代後半から1980年代初頭にかけて、データとコンピュータを駆使した多種多様な化学分析が行われるようになった。
多変量解析は、ケモメトリクスの初期の応用においても重要な側面でした。赤外分光法や紫外可視分光法からのデータは、サンプルごとに数千回の測定が行われることがよくあります。質量分析法、核磁気共鳴法、原子発光/吸収法、クロマトグラフィー実験も、本質的に多変量です。これらのデータの構造は、主成分分析(PCA)、部分最小二乗法(PLS)、直交部分最小二乗法 (OPLS)、および二方向直交部分最小二乗法 (O2PLS) などの手法の使用に適していることがわかりました。[ 3 ]これは主に、データセットが多変量である一方で、強力で多くの場合線形な低ランク構造が存在するためです。PCA と PLS は、より化学的に興味深い低ランク構造を経験的にモデル化し、データ内の相互関係または「潜在変数」を活用し、回帰、クラスタリング、パターン認識などのさらなる数値分析のための代替コンパクト座標系を提供する上で、長年にわたって非常に効果的であることが示されています。特に部分最小二乗法は、他の分野で一般的に使用されるようになるずっと以前から、長年にわたり化学計量学の分野で広く用いられてきた。
1980年代には、この分野で3つの専門誌が登場しました。Journal of Chemometrics、Chemometrics and Intelligent Laboratory Systems、Journal of Chemical Information and Modelingです。これらの雑誌は、ケモメトリクスの基礎研究と方法論研究の両方を引き続き扱っています。現在、既存のケモメトリクス手法の日常的な応用のほとんどは、応用指向の雑誌(例:Applied Spectroscopy、Analytical Chemistry、Analytica Chimica Acta、Talanta )に掲載されています。ケモメトリクスに関する重要な書籍やモノグラフも1980年代に初めて出版されました。これには、 MalinowskiのFactor Analysis in Chemistryの初版[ 4 ]、Sharaf、Illman、KowalskiのChemometrics [ 5 ]、MassartらのChemometrics: a textbook [ 6 ]、MartensとNaesのMultivariate Calibration [ 7 ]などが含まれます。
化学計量学の応用分野の中には、分子モデリングやQSAR、ケモインフォマティクス、ゲノミクス、プロテオミクス、メタボノミクス、メタボロミクスといった「オミクス」分野、プロセスモデリング、プロセス分析技術など、新たな領域へと発展したものもあります。
化学計量学の初期の歴史に関する記述は、ゲラディとエスベンセンによる一連のインタビューとして発表された。[ 8 ] [ 9 ]
多くの化学的問題やケモメトリクスの応用にはキャリブレーションが関係します。目的は、圧力、流量、温度、赤外線、ラマン、 [ 10 ] NMRスペクトル、質量スペクトルなどの化学システムの測定された特性に基づいて、関心のある特性を予測するために使用できるモデルを開発することです。例としては、1) 多波長スペクトル応答と分析対象物濃度、2) 分子記述子と生物学的活性、3) 多変量プロセス条件/状態と最終製品属性を関連付ける多変量モデルの開発が挙げられます。このプロセスには、予測対象の特性の参照値と、これらの特性に対応すると考えられる測定属性を含むキャリブレーションまたはトレーニングデータセットが必要です。たとえば、ケース1)の場合、各サンプルの関心のある分析対象物の濃度(参照)と、そのサンプルの対応する赤外線スペクトルを含む、多数のサンプルからのデータを収集できます。次に、部分最小二乗回帰や主成分回帰(その他無数の方法)などの多変量較正技術を用いて、多変量応答(スペクトル)と対象となる分析物の濃度を関連付ける数学モデルを構築し、このようなモデルを用いて新しいサンプルの濃度を効率的に予測することができる。
多変量キャリブレーションの手法は、古典的手法または逆手法に大別されることが多い。[ 7 ] [ 11 ] これらのアプローチの主な違いは、古典的キャリブレーションでは、測定された分析応答(スペクトルなど)を最適に記述するようにモデルが解かれ、したがって最適な記述子とみなせるのに対し、逆手法では、関心のある特性(濃度、最適な予測子など)を最適に予測するようにモデルが解かれることである。[ 12 ] 逆手法は通常、化学システムの物理的知識をあまり必要とせず、少なくとも理論的には平均二乗誤差の意味で優れた予測を提供するので、[ 13 ] [ 14 ] [ 15 ]逆手法は現代の多変量キャリブレーションでより頻繁に適用される傾向がある。
多変量キャリブレーション技術を使用する主な利点は、光分光法などの迅速、安価、または非破壊的な分析測定を用いて、従来は時間のかかる高価な、あるいは破壊的な試験(LC-MSなど)が必要だった試料特性を推定できることです。同様に重要なのは、多変量キャリブレーションによって、他の分析対象物による強い干渉がある場合でも、正確な定量分析が可能になることです。分析方法の選択性は、分析測定方法だけでなく、数学的なキャリブレーションによっても左右されます。例えば、近赤外スペクトルは、他の分析手法(赤外スペクトルやラマンスペクトルなど)に比べて非常に広帯域で非選択的ですが、綿密に開発された多変量キャリブレーション法と組み合わせることで、非常に複雑なマトリックス中の分析対象物の濃度を予測するのにしばしば有効です。
教師あり多変量分類手法は、将来のサンプルを分類できる数学モデルを開発するためにキャリブレーションセットまたはトレーニングセットを使用するという点で、多変量キャリブレーション手法と密接に関連しています。ケモメトリクスで用いられる手法は、多変量判別分析、ロジスティック回帰、ニューラルネットワーク、回帰/分類木など、他の分野で用いられる手法と類似しています。これらの従来の分類手法と併せてランク削減手法を用いることは、ケモメトリクスでは一般的であり、例えば主成分分析や部分最小二乗スコアなどが挙げられます。
クラスモデリングまたはワンクラス分類器と呼ばれる一連の手法は、関心のある個々のクラスのモデルを構築することができます。[ 16 ]このような方法は、製品の品質管理や真正性の検証の場合に特に役立ちます。
教師なし分類(クラスター分析とも呼ばれる)は、複雑なデータセット内のパターンを発見するためによく用いられ、化学計量学で使用される多くのコア技術は、機械学習や統計的学習などの他の分野にも共通している。
化学計量学の用語では、多変量曲線分解は、参照情報やシステム知識が限られているか、あるいはまったくないデータセットを分解しようとするものです。これらの技術に関する初期の研究のいくつかは、1970 年代初頭に Lawton と Sylvestre によって行われました。[ 17 ] [ 18 ] これらのアプローチは、自己モデリング混合分析、ブラインドソース/信号分離、スペクトル分離とも呼ばれます。たとえば、複数の蛍光色素を含む一連のサンプルからの蛍光スペクトルで構成されるデータセットから、多変量曲線分解法を使用して、各サンプルにおける個々の蛍光色素の蛍光スペクトルとそれらの相対濃度を抽出できます。これは、実質的に全体の蛍光スペクトルを個々の成分からの寄与に分離するものです。回転の曖昧さ(測定データを等価に表現できる解が多数存在する)のため、この問題は通常、不確定であるため、非負性、単峰性、個々の構成要素間の既知の相互関係(運動学的制約や質量バランス制約など)といった追加の制約を適用することが一般的である。[ 19 ] [ 20 ]
実験計画は化学計量学における研究の中核分野であり、化学応用における実験計画に特化したモノグラフもいくつか出版されている。 [ 21 ] [ 22 ] 実験計画の健全な原則は化学計量学コミュニティ内で広く採用されているが、多くの複雑な実験は純粋に観察に基づくものであり、サンプルの特性や相互関係、およびサンプルの特性をほとんど制御できない。
信号処理は、ほぼすべてのケモメトリクスアプリケーションにおいて重要な要素であり、特に較正や分類の前にデータを調整するための信号前処理の使用が挙げられます。ケモメトリクスで一般的に用いられる技術は、関連分野で用いられる技術と密接に関連していることが多いです。 [ 23 ]信号前処理は、最終的なデータ処理の結果の解釈方法に影響を与える可能性があります。 [ 24 ]
性能特性評価と評価指標 物理科学のほとんどの分野と同様に、ケモメトリクスは定量的指向であるため、性能特性評価、モデル選択、検証と妥当性確認、および評価指標にかなりの重点が置かれています。定量的モデルのパフォーマンスは通常、関心のある属性を予測する際の二乗平均平方根誤差によって指定され、分類器のパフォーマンスは真陽性率/偽陽性率のペア(または完全な ROC 曲線)として指定されます。Olivieri らによる最近のレポートでは、選択性、感度、SNR、予測区間推定の多変量定義を含む、多変量キャリブレーションにおける評価指標と不確実性推定の包括的な概要が提供されています。[ 25 ]ケモメトリクス モデルの選択には通常、リサンプリング(ブートストラップ、順列、交差検証を含む) などのツールの使用が含まれます。
多変量統計的プロセス制御(MSPC)、モデリング、最適化は、歴史的に化学計量学の発展の大部分を占めています。[ 26 ] [ 27 ] [ 28 ] 分光法は、30~40 年にわたり製造プロセスのオンライン監視に成功裏に使用されており、このプロセスデータは化学計量モデリングに非常に適しています。特に MSPC に関しては、バッチプロセスと連続プロセスの多方向モデリングが産業界でますます一般的になり、化学計量学と化学工学の研究の活発な分野であり続けています。当初はプロセス分析化学と呼ばれていたもの[ 29 ]、または新しい用語であるプロセス分析技術は、化学計量法と MSPC に大きく依存し続けています。
多次元法は、ケモメトリクスの応用において広く用いられています。[ 30 ] [ 31 ] これらは、より広く用いられている方法の高次の拡張です。例えば、データの表(行列、または2次配列)の分析はいくつかの分野で日常的に行われていますが、多次元法は3次、4次、またはそれ以上の次数を含むデータセットに適用されます。この種のデータは化学では非常に一般的で、例えば、液体クロマトグラフィー/質量分析(LC-MS)システムは、分析された各サンプルについて、大きなデータ行列(溶出時間とm/z)を生成します。したがって、複数のサンプルにわたるデータはデータキューブを構成します。バッチプロセスモデリングでは、時間とプロセス変数とバッチ番号を持つデータセットが関係します。このような問題に適用される多次元数学的手法には、PARAFAC、三線形分解、多次元PLSおよびPCAなどがあります。
過去 10 年間、分析化学のために開発された多変量統計手法が食品科学技術で広く利用されるようになりました。ケモメトリクスは、多様なサンプルタイプ、サンプル数、および応答を含む大規模で複雑なデータセットを扱う場合に特に価値があります。これらの手法は、高付加価値食品の地理的起源、農業システム、および混入物の検出を支援します。[ 32 ]
総じて、ケモメトリクスは、食品科学における複雑で多因子的な課題に包括的なアプローチで取り組むための不可欠なツールです。食品品質の監視、原材料の評価、およびプロセスの最適化を担当する政府機関や業界は、特に高次元データを扱う場合、ケモメトリクスを取り入れるべきです。ユーザーが最適なツールを選択できるよう、この記事では、実用的な応用例を概説し、一般的に使用されているケモメトリクス手法の利点と限界を評価します。[ 32 ]