化学データベースとは、化学情報を保存するために特別に設計されたデータベースのことです。この情報には、化学構造や結晶構造、スペクトル、反応や合成、熱物性データなどが含まれます。
生物活性データベースは、文献、特許、スクリーニングプログラムにおける生物学的アッセイから得られた生物活性結果と、構造やその他の化学情報を関連付けるものである。
化学構造は従来、原子間の化学結合を示す線を用いて紙に描かれてきました(2D構造式)。これらは化学者にとって理想的な視覚的表現ですが、計算用途、特に検索や保存には適していません。小さな分子(創薬用途ではリガンドとも呼ばれる)は通常、原子とその結合のリストを用いて表現されます。しかし、タンパク質などの大きな分子は、アミノ酸の構成要素の配列を用いてよりコンパクトに表現されます。放射性同位体も表現されますが、これは一部の用途にとって重要な属性です。構造に関する大規模な化学データベースは、テラバイトの物理メモリを消費して、数百万の分子に関する情報の保存と検索を処理することが期待されています。[ 6 ] [ 7 ]
化学文献データベースは、構造やその他の化学情報を、学術論文や特許などの関連文献と関連付けます。この種のデータベースには、STN、SciFinder、Reaxysなどがあります。また、化学的特性評価に特化した多くのデータベースには、文献へのリンクも含まれています。
結晶構造データベースは、 X線結晶構造データを保存する。代表的な例としては、タンパク質データバンク(PDB)やケンブリッジ構造データベース(CSDB)などが挙げられる。
NMRスペクトルデータベースは、化学構造とNMRデータを関連付けるものです。これらのデータベースには、 FTIRや質量分析などの他の特性データも含まれていることがよくあります。
ほとんどの化学データベースは安定分子に関する情報を格納していますが、反応データベースには中間体や一時的に生成される不安定分子も格納されています。反応データベースには、生成物、反応物、および反応機構に関する情報が含まれています。
化学反応データなどを一覧表示する代表的な例としては、BeilsteinデータベースやReaxysなどが挙げられる。
熱物性データとは、
デジタルデータベースで化学構造を表現する主な手法は2つあります。
これらの手法は、立体化学的な差異や電荷、さらには有機金属化合物に見られるような特殊な結合様式を表現できるように改良されてきた。コンピュータによる表現の主な利点は、記憶容量の増加と、高速かつ柔軟な検索が可能であることである。

化学者は、構造の一部、IUPAC名の一部、および特性の制約に基づいてデータベースを検索できます。化学データベースは、ユーザーが指定した原子と結合のパターンに一致する化学物質を取得する方法である部分構造検索をサポートしている点で、他の汎用データベースとは異なります。この種の検索は、部分グラフ同型性(単相とも呼ばれる) を探すことによって実現され、グラフ理論の広く研究されている応用です。[ 8 ] [ 9 ] [ 10 ]
クエリ構造には、「単結合/芳香族」や「任意の」などの結合パターンを含めることができ、柔軟性を提供します。同様に、実際の化合物では特定の原子となる頂点を、クエリでは原子リストに置き換えることができます。二重結合のシス-トランス異性体については、E型、Z型、またはその両方を取得する選択肢を提供することで対応しています。 [ 8 ] [ 11 ]
分子の 3D 構造を一致させること、または空間制約を指定することによる検索は、創薬設計において特に有用なもう 1 つの機能です。この種の検索は計算コストが非常に高くなる可能性があります。多くの近似法が提案されており、たとえば BCUTS [ 12 ] [ 13 ] [ 14 ]特殊関数表現、慣性モーメント、レイ トレーシングヒストグラム、最大距離ヒストグラム、形状多重極などがあります。[ 15 ] [ 16 ] [ 17 ] [ 18 ] [ 19 ]
PubChem [ 11 ] [ 20 ]やChemSpider [ 21 ]などの大規模データベースには、検索用のグラフィカルインターフェースがあります。Chemical Abstracts Service は化学文献を検索するためのツールを提供しており、Elsevierが提供するReaxys は、 Beilstein データベースに元々含まれていたものを含め、化学物質と反応情報の両方を網羅しています。[ 22 ] PATENTSCOPE は部分構造から化学特許にアクセスできるようにしており[ 23 ]、個々の化学物質を説明する Wikipedia の記事も同様に検索できます。[ 24 ]
合成中間体やハイスループットスクリーニング用の化学物質の供給業者は、通常、検索インターフェースを提供しています。現在、一般の人々が自由に検索できる最大のデータベースはZINC データベースで、370 億を超える市販の分子が含まれているとされています。[ 25 ] [ 26 ]
分子の構造以外のすべての特性は、物理化学的属性または薬理学的属性(記述子とも呼ばれる)に分類できます。さらに、分子には、多かれ少なかれ曖昧な名前や同義語を提供する、さまざまな人工的で多かれ少なかれ標準化された命名システムがあります。
分子量、部分電荷、溶解度などの物理化学的記述子は、分子構造に基づいて直接計算できる場合が多いのに対し、薬理学的記述子は、多変量統計や実験結果(スクリーニング、バイオアッセイなど)を用いて間接的にしか導出できません。これらの記述子は、計算負荷を軽減するために、分子の表現とともに保存されることが多く、実際によく保存されています。
分子類似性には単一の定義はありませんが、その概念は用途に応じて定義することができ、記述子空間における距離尺度の逆数として説明されることがよくあります。たとえば、2つの分子の分子量の差が他の分子と比較した場合よりも小さい場合、2つの分子はより類似していると見なされることがあります。さまざまな他の尺度を組み合わせて、多変量距離尺度を作成することができます。距離尺度は、三角不等式が成り立つかどうかに応じて、ユークリッド尺度と非ユークリッド尺度に分類されることがよくあります。最大共通部分グラフ(MCS)に基づく部分構造検索[ 27 ](類似性または距離尺度)も非常に一般的です。MCSは、共通の部分グラフ(部分構造)を共有する分子にヒットすることで、医薬品のような化合物をスクリーニングするためにも使用されます。[ 28 ]
データベース内の化学物質は、類似性に基づいて「類似」分子のグループにクラスタリングされることがあります。階層的クラスタリングと非階層的クラスタリングの両方のアプローチは、複数の属性を持つ化学物質に適用できます。これらの属性または分子特性は、経験的に決定することも、計算によって導出された記述子にすることもできます。最も一般的なクラスタリングアプローチの 1 つは、Jarvis-Patrick アルゴリズムです。[ 29 ]
薬理学的な化学物質リポジトリでは、類似性は通常、化合物の生物学的効果(ADME /毒性)の観点から定義され、これはQSAR法を用いて類似した物理化学的記述子の組み合わせから半自動的に推測することができる。
化学化合物の固有記録を管理するためのデータベースシステムは、登録システムと呼ばれます。これらは、化学索引、特許システム、産業データベースなどによく利用されます。
登録システムは通常、データベースに登録されている化学物質の一意性を、一意な表現を用いることで保証します。文字列化された表記の生成に優先順位ルールを適用することで、 「正規SMILES 」のような一意の「正規」文字列表現を得ることができます。CASシステムなどの一部の登録システムは、同じ目的を達成するために、一意のハッシュコードを生成するアルゴリズムを使用しています。
登録システムと単純な化学データベースの重要な違いは、既知、未知、部分的に既知のものを正確に表現できるかどうかです。例えば、化学データベースでは立体化学が未指定の分子を保存できますが、化学登録システムでは、登録者が立体配置が未知、特定の(既知の)混合物、またはラセミ体であるかを指定する必要があります。化学登録システムでは、これらはそれぞれ異なるレコードとして扱われます。
登録システムは、化学物質中のハロゲンイオンの違いといった些細な違いを考慮しないように、分子を前処理する。
一例として、ケミカルアブストラクトサービス(CAS)の登録システムが挙げられます。CAS登録番号も参照してください。
計算結果は、通常、データのグラフィカル表示によって化学者にとって分かりやすい形で示されます。また、化学構造エディタを使用することで、データ入力も簡素化されます。これらのエディタは、グラフィカルデータを内部的に計算結果に変換します。
さまざまな表現形式を相互変換するためのアルゴリズムも多数存在します。変換用のオープンソースユーティリティとしては、OpenBabelがあります。これらの検索および変換アルゴリズムは、データベースシステム自体に実装されている場合もあれば、現在の傾向として、標準的なリレーショナルデータベースシステムに適合する外部コンポーネントとして実装されている場合もあります。Oracle およびPostgreSQLベースのシステムはどちらも、ユーザー定義データ型を可能にするカートリッジ技術を使用しています。これにより、ユーザーは化学検索条件を含むSQLクエリを作成できます (たとえば、SMILESCOL 列の SMILES 文字列として表現された構造にフェニル環を持つレコードを検索するクエリは、
SELECT * FROM CHEMTABLE WHERE SMILESCOL.CONTAINS ( ' c1ccccc1 ' )IUPAC名を構造表現に変換するアルゴリズム、およびその逆のアルゴリズムは、テキストから構造情報を抽出するためにも使用されます。しかし、IUPACには複数の方言が存在するため、困難が生じています。現在、統一されたIUPAC標準を確立するための取り組みが進められています( InChIを参照)。
47. https://www.elsevier.com/en-in/products/reaxys