
部分構造検索( SSS ) は、ユーザーが指定した原子と結合のパターンに一致する化学物質のみをデータベースから取得する方法です。これはグラフ理論、具体的には水素欠乏分子グラフをクエリとする部分グラフマッチングの応用です。この方法の数学的基礎は 1870 年代に築かれ、化学構造の描画は原子を頂点、結合を辺とするグラフと同等であると示唆されました。現在、SSS はケモインフォマティクスの標準的な部分であり、医薬品化学者による新薬発見で広く使用されています。
SSS を提供する商用システムは多数あり、通常はグラフィカル ユーザー インターフェイスと化学描画ソフトウェアを備えています。PubChemやChemSpiderなどの公開されている大規模なデータベースは、この方法で検索できます。また、個々の化学物質を説明するWikipediaの記事も同様に検索できます。
定義
部分構造検索は、ユーザーが指定した原子と結合のパターンを含む化学物質をデータベースから取得するために使用されます。これは、特殊なクエリ言語を使用して実装され、実際のアプリケーションでは、データベースに保存されている追加データに対して論理演算子を使用して検索をさらに制限できます。つまり、「 1 g を超えるサンプルが利用可能なすべてのカルボン酸を返します」。 [1] [2]「部分構造」の 1 つの定義は、2008 年に提供されました。「2 つの化学構造 A と B があり、構造 A が構造 B に完全に含まれている場合、A は B の部分構造であり、B は A の上部構造です。」[3]
分子グラフ:異なる種類の原子を表す異なるラベル(色)の頂点と、異なる種類の結合に関連する異なるラベル(色)の辺を持つグラフ(彩度グラフ)。位相的電子分布理論では、与えられた核構成における結合経路の完全なネットワーク。[4]
この定義では、「構造」という言葉は「化合物」と同義ではありません。もし同義なら、エタノールの構造、CH 3 CH 2 OHはプロパノールの構造、CH 3 CH 2 CH 2 OHにはならないでしょう。なぜなら、エタノールの末端CH 3は、OH基から2原子離れたプロパノール鎖に完全には含まれていないからです。その代わりに、クエリ構造は、形式的には、水素が枯渇した分子グラフです。したがって、検索は、3つの原子と、C–C–Oとして結合した2つの単結合を含む物質を検索します。プロパノールは「ヒット」であり、ジエチルエーテルもC–C–O–C–Cです。ユーザーがヒットをアルコールに限定したい場合は、クエリ構造を「明示的な水素」で描画する必要があります。そうしないと、C–C–O–Hとエーテルは一致しなくなります。[1]数学的には、部分構造を見つけることはグラフ理論、具体的には部分グラフマッチングの応用です。[5]
例
化学者が化学構造を描くときに使用する標準的な慣例[6]は、部分構造検索を実装する際に考慮する必要があります。歴史的に、互変異性体[7]と立体化学[8]の表現は困難を伴ってきました。これはヒスチジンを使用して説明できます。[9]
上の行は、(S)-ヒスチジン(このアミノ酸の天然異性体)、そのエナンチオマーである(R)-ヒスチジン、および慣例的に等量のR体とS体のラセミ混合物を示す図の標準的な2次元化学図を示しています。 [10]下の行は、イミダゾール環を別の互変異性体で描いた同じ3つの化合物を示しています。ヒスチジンについては、 15 N NMR分光法によって、サンプルでは1-H互変異性体が3-H体よりも好ましいことが実験的に判明しています。 [11]データベースに保存するための表現の選択は、部分構造の検索に影響を与える可能性があります。6つの図はすべて、赤で示されているように、プロパノール部分構造C–C–C–Oにヒットします。ただし、1-Hイミダゾール-4-メチルの青い部分構造にヒットするのは、明らかに上の行のみで、これは他の3つの化合物には完全には含まれていないためです。実際、各垂直ペアは同じ化学物質です。一般に、互変異性体は別々のサンプルとして分離することはできません。[7]現代のデータベースでは、物質は単一の標準形式で保持され、一意性がチェックされます。InChIKeyはこれを行う1つの方法を提供します。[9] (S)-ヒスチジンの標準キーはHNDVDQJCIGZPNO-YFKPBYRVSA-N、[12] (R)-ヒスチジンのキーはHNDVDQJCIGZPNO-RXMQYKEDSA-N [13]、(RS)-ヒスチジンのキーはHNDVDQJCIGZPNO-UHFFFAOYSA-Nです。[14]最初の14文字のブロックは、分子グラフをエンコードするため、これらすべての物質で同一です。[9]
クエリインターフェースと検索アルゴリズム
ほとんどの部分構造検索システムは、化学構造描画コンポーネントを備えたグラフィカル ユーザー インターフェイスをユーザーに提供します。クエリ構造には、柔軟性を提供するために、「単結合/芳香族」や「任意」などの結合パターンを含めることができます。同様に、実際の化合物では特定の原子となる頂点は、クエリ内の原子リストに置き換えられる場合があります。二重結合のシス-トランス異性は、 E フォームのみ、Z フォームのみ、または両方を取得するオプションを提供することで対応しています。 [1] [15]
検索アルゴリズムは計算量が多く、多くの場合O ( n 3 ) または O ( n 4 ) の時間計算量 ( nは関係する原子の数) ですが、問題はNP 完全であることが知られています。[16]高速化は、最初のステップとしてフラグメント スクリーニングを使用することで実現されます。この事前計算では通常、分子フラグメントの有無を表すビット文字列が作成されます。クエリに存在するフラグメントを持たないターゲット化合物はヒットせず、除外されます。[17] [18]クエリの原子とターゲット分子との結合のマッピングを求める原子ごとの検索は、通常、Ullman アルゴリズムのバリエーションを使用して行われます。[5] [19]
実装
2024年現在、部分構造検索はウェブ経由でアクセスできる化学データベース[アップデート]の標準機能となっている。国立生物工学情報センターが管理するPubChem [20] [15]や王立化学協会が管理するChemSpider [21]などの大規模データベースには、検索用のグラフィカルインターフェースがある。アメリカ化学会の一部門であるChemical Abstracts Serviceは化学文献を検索するためのツールを提供しており、エルゼビアが提供するReaxysは、もともとBeilsteinデータベースに保管されていたものも含め、化学物質と反応情報の両方をカバーしている。[22]世界知的所有権機関が管理するPATENTSCOPEは、化学特許を部分構造でアクセスできるようにしており[23]、個々の化学物質を説明するWikipediaの記事も同様に検索できる。[24]
合成中間体やハイスループットスクリーニング用の化学物質の供給業者は、検索インターフェースを日常的に提供しています。現在、一般の人が自由に検索できる最大のデータベースはZINCデータベースで、370億を超える市販分子が含まれていると言われています。[25] [26]
歴史
.png/500px-Historic_Benzene_Formulae_Kekulé_(original).png)
ケクレが導入したタイプの図を使用して描かれた化学構造が、現在グラフ理論と呼ばれているものに関連するという考えは、1878年に数学者JJシルベスターによって示唆されました。彼はネットワークの意味で「グラフ」という言葉を初めて使用しました。[27] [28] アーサー・ケイリーは、1874年にすでに、原子が頂点にあり、結合が辺に対応する分子グラフへの初期のアプローチで、化学異性体を列挙する方法を検討していました。[29] [30]
構造式:分子内の原子がどのように結合し、空間的に配置されているかについての情報を与える式。[31]
20世紀には、化学者は、特に潜在的な医薬品や農薬として合成され、テストされるようになった個々の有機化合物の構造式を示す標準的な方法を開発しました。 [32] [6] 1950年代までに、製造されテストされる化合物の数が増えるにつれて、化学データベースを作成する最初の試みが行われ、ケモインフォマティクスというサブ分野が確立されました。[33] 2012年に述べたように、「分子内の部分構造の検索は、ケモインフォマティクスの最も基本的なタスクに属し、今日ではほぼすべてのケモインフォマティクスソフトウェアの一部です」。[34]

部分構造検索の使用法が最初に提案されたのは 1957 年で、特許審査官の作業負荷を軽減するためでした。審査官は、発明が新規であるかどうかを判断するために公開された文献を検索する必要があり、化学特許の場合、これは多くの場合、マルクーシュ構造の一般的なクレーム内で既知の例を見つけることを意味します。[35] [33]これが実現する前に、いくつかの開発が必要でした。重要なことは、既存の文献を検索可能にし、化学構造クエリを入力して一致する結果を返す方法を考案する必要があったことです。これらの要件は、フリードリヒ・コンラート・バイルシュタインがHandbuch der organischen Chemie (有機化学ハンドブック)を発表した 1881 年にはすでに部分的に満たされていました。このハンドブックでは、既知の化学物質が非常に体系的に注意深く分類され、特定の複素環を含むすべての例が一緒に配置されるようにしました。[36] [37]
1907年、アメリカ化学会は化学抄録サービス(CAS)を設立した。この週刊購読サービスには、何千もの学術雑誌の記事の要約や世界中の特許の請求をまとめた印刷物が含まれていた。これには化学物質索引があり、原則として化学名または化学式で検索することができた。[38]しかし、CASの記録が完全に機械可読形式に変換され、インターネットがデータベースをエンドユーザーに接続できるようになって初めて、包括的な検索が可能になった。CASは1980年代からさまざまな専門検索サービスを提供していたが、2008年になってようやく「SciFinder」システムがウェブ経由で利用可能になった。[39]
1960年代までに、新しい化学物質を合成し試験する企業は、社内データベースの作成において大きな進歩を遂げました。インペリアル・ケミカル・インダストリーズは、ウィスウェッサー線表記法を使用して、テキスト文字列としてエンコードされた化学構造を保存しました。関連するCROSSBOWソフトウェアは、キーベースの検索を使用した部分構造検索と、それに続くよりプロセッサ集約的な原子ごとの検索を可能にしました。[40] [41]研究化学者は、既存の在庫について企業のコレクションを検索するだけでなく、低分子中間体のベンダーが提供するサードパーティのデータベースも検索したいと認識されていました。後者のアプリケーションは、製薬業界に関心を持つ6つの企業とその商業サプライヤーのコラボレーションとして発展しました。[42] [9]
1980年代までに、市販のサブ構造検索システムでは他のライン表記法が使用されるようになりました。SMILESエンコーディングとそのSMARTSクエリ言語[43]やSYBYLライン表記[9] [44]などがその例です。[45]当時利用可能な化学情報システムの包括的な調査が1985年にNASAのために作成されました。[46]
化学検索と、これまで以上に大規模な化合物のスクリーニングによって生成される生物学的データを組み合わせる必要性から、MACCSなどのシステムが実装されました。[46] : 73–77 [47] MDL Information Systemsのこの商用システムは、立体化学のみが異なる化学物質のグループ内での保存と検索用に特別に設計されたアルゴリズムを使用していました。 [48] 1980年代半ばまでに利用可能だった多くのシステムをレビューしたところ、「社内で開発されたシステムのほとんどは、化学構造データベースを管理するための市販の標準化されたソフトウェアに置き換えられました」と指摘されています。[49] MDL Molfileは現在、接続テーブルの形式で単一分子データを保存するためのオープンファイル形式です。[50] [9]
2000年代までに、パーソナルコンピュータは十分に高性能になり、Microsoft Excelなどのオフィスソフトウェア内で化学物質を保存および検索することが可能になりました。[51]
その後の開発では、非常に大規模なデータベースを効率的に検索できる新しい技術の使用や、化学物質を一意に定義するための一種の線表記法である標準化された国際化学識別子の使用が重要になりました。 [9] [25] [52] [53]
参照
参考文献
- ^ abc Currano, Judith N. (2014). 「第5章 構造と部分構造による検索」.化学者のための化学情報. pp. 109–145. doi :10.1039/9781782620655-00109. ISBN 978-1-84973-551-3。
- ^ Agrafiotis, Dimitris K.; Lobanov, Victor S.; Shemanarev, Maxim; et al. (2011). 「大規模化学ライブラリの効率的なサブ構造検索: ABCD 化学カートリッジ」. Journal of Chemical Information and Modeling . 51 (12): 3113–3130. doi :10.1021/ci200413e. PMID 22035187.
- ^ Cao, Yiqun; Jiang, Tao; Girke, Thomas (2008). 「薬物類似化合物の検索と予測のための最大共通サブ構造ベースのアルゴリズム」.バイオインフォマティクス. 24 (13): i366–i374. doi :10.1093/bioinformatics/btn186. PMC 2718661. PMID 18586736 .
- ^ 「分子グラフ」。ゴールドブック。IUPAC。2014年。doi:10.1351/goldbook.MT07069 。 2024年7月28日閲覧。
- ^ ab Ullmann, JR (1976). 「サブグラフ同型性のためのアルゴリズム」Journal of the ACM . 23 : 31–42. doi : 10.1145/321921.321925 .
- ^ ab McMurry, John (2023). 「1.12 化学構造の描画」. 有機化学: 第10版. OpenStax, ライス大学. pp. 25–27. ISBN 9781711471853。
- ^ ab Katritzky, Alan R.; Hall, C. Dennis; El-Gendy, Bahaa El-Dien M.; Draghici, Bogdan (2010). 「薬物発見における互変異性」。Journal of Computer-Aided Molecular Design . 24 (6–7): 475–484. Bibcode :2010JCAMD..24..475K. doi :10.1007/s10822-010-9359-z. PMID 20490619.
- ^ スミス、サイラス W. (2009)。「キラル毒性学:同じこと…ただ違うだけ」毒性科学。110 (1 ) : 4–30。doi : 10.1093/toxsci/ kfp097。PMID 19414517 。
- ^ abcdefg Warr, Wendy A. (2011). 「化学構造の表現」WIREs 計算分子科学1 ( 4): 557–579. doi :10.1002/wcms.36.
- ^ 「検索用語: ヒスチジン」. chemspider.com . 2024年8月1日閲覧。
- ^ Roberts, John D. (2000). ABCs of FT-NMR . サウサリート、カリフォルニア: University Science Books. pp. 258–9. ISBN 978-1-891389-18-4。
- ^ 「L-ヒスチジン」。chemspider.com。詳細はこちら。2024年8月1日閲覧。
- ^ 「D-ヒスチジン」chemspider.com . 詳細はこちら. 2024年8月1日閲覧。
- ^ 「DL-ヒスチジン」。chemspider.com。詳細はこちら。2024年8月1日閲覧。
- ^ ab 「PubChem構造検索」。pubchem.ncbi.nlm.nih.gov 。 2024年8月1日閲覧。
- ^ Wegener, Ingo (2005). 複雑性理論: 効率的なアルゴリズムの限界を探る. Springer. p. 81. ISBN 9783540210450。
- ^ Bond, V. Lynn; Bowman, Carlos M.; Davison, Linda C.; et al. (1979). 「化学情報のオンライン保存と検索。II. 部分構造と生物活性の検索」。化学情報とコンピュータサイエンスのジャーナル。19 (4): 231–234。doi :10.1021/ci60020a012。PMID 551973 。
- ^ Cummings, Maxwell D.; Maxwell, Alan C.; DesJarlais, Renee L. (2007). 「自動ドッキングのための小分子データベースの処理」.医薬化学. 3 (1): 107–113. doi :10.2174/157340607779317481. PMID 17266630.
- ^ Rahman, SA; Bashton, M.; Holliday, GL; Schrader, R.; Thornton, JM (2000). 「小分子サブグラフ検出器 (SMSD) ツールキット」. Journal of Cheminformatics . 1 (1): 12. doi : 10.1186 /1758-2946-1-12 . PMC 2820491. PMID 20298518.
- ^ Kim, Sunghwan (2021). 「PubChemにおける化学情報の探索」Current Protocols . 1 (8): e217. doi :10.1002/cpz1.217. PMC 8363119 . PMID 34370395.
- ^ Williams, Antony J. (2010). 「ChemSpider: インターネット上に分散された構造ベースのリソースの統合」。オンラインリソース、ソーシャル ネットワーキング、デジタル ライブラリによる学習の強化。ACS シンポジウム シリーズ。第 1060 巻。pp. 23–39。doi :10.1021/bk- 2010-1060.ch002。ISBN 978-0-8412-2600-5。
- ^ Jarabak, Charlotte; Mutton, Troy; Ridley, Damon D. (2020). 「主要なウェブベースの化学情報およびデータ検索ツールの物質レコードのプロパティ情報:コンテンツの理解、検索の機会、および教育への応用」。化学教育ジャーナル。97 ( 5 ) : 1345–1359。Bibcode :2020JChEd..97.1345J。doi :10.1021/acs.jchemed.9b00966。
- ^ 「PATENTSCOPE でサブ構造検索が利用可能に」www.wipo.int . 2019-02-11 . 2024-08-04閲覧。
- ^ Ertl, Peter; Patiny, Luc; Sander, Thomas; et al. (2015). 「Wikipedia Chemical Structure Explorer: Wikipedia からの分子の部分構造と類似性の検索」. Journal of Cheminformatics . 7:10 . doi : 10.1186/s13321-015-0061-y . PMC 4374119. PMID 25815062 .
- ^ ab Tingle, Benjamin I.; Tang, Khanh G.; Castanon, Mar; Gutierrez, John J.; Khurelbaatar, Munkhzul; Dandarchuluun, Chinzorig; Moroz, Yurii S.; Irwin, John J. (2023). 「ZINC-22─リガンド発見のための実体化合物の無料数十億スケールデータベース」。Journal of Chemical Information and Modeling . 63 (4): 1166–1176. doi : 10.1021/acs.jcim.2c01253 . PMC 9976280 . PMID 36790087.
- ^ Warr, Wendy A.; Nicklaus, Marc C.; Nicolaou, Christos A.; Rarey, Matthias (2022). 「創薬のための超大規模化合物コレクションの探索」。Journal of Chemical Information and Modeling . 62 (9): 2021–2034. doi :10.1021/acs.jcim.2c00224. PMID 35421301.
- ^ Sylvester, JJ (1878). 「化学と代数」. Nature . 17 (432): 284. Bibcode :1878Natur..17..284S. doi : 10.1038/017284a0 .
すべての不変量と共変量は、ケクレ図またはケミコグラフと正確に同一の
グラフ
で表現できるようになります。
- ^ Gross, Jonathan L.; Yellen, Jay (2004). グラフ理論ハンドブック. CRC Press . p. 35. ISBN 978-1-58488-090-5. 2024年7月28日閲覧。
- ^ Cayley (1874). 「LVII.異性体の数学的理論について」。ロンドン、エディンバラ、ダブリン哲学雑誌および科学ジャーナル。47 (314): 444–447。doi :10.1080/14786447408641058。
- ^ ビッグス、ノーマン、キース・ロイド、E.、ウィルソン、ロビン・J. (1986)。グラフ理論、1736-1936 。クラレンドン・プレス。pp. 39、63–64。ISBN 0198539169。
- ^ 「構造式」。ゴールドブック。IUPAC。2014年。doi:10.1351/goldbook.S06061 。 2024年7月28日閲覧。
- ^ Goodwin, WM (2008). 「有機化学における構造式と説明」.化学の基礎. 10 (2): 117–127. doi :10.1007/s10698-007-9033-2.
- ^ ab Willett, Peter (2008). 「化学ドキュメンテーションからケモインフォマティクスへ: 化学情報科学の50年」. Journal of Information Science . 34 (4): 477–499. doi :10.1177/0165551507084631.
- ^ Ehrlich, Hans-Christian; Rarey, Matthias (2012). 「分子グラフにおけるサブ構造検索の体系的ベンチマーク - Ullmann から VF2 まで」Journal of Cheminformatics . 4 (1): 13. doi : 10.1186/1758-2946-4-13 . PMC 3586954. PMID 22849361 .
- ^ Ray, Louis C.; Kirsch, Russell A. (1957). 「デジタルコンピュータによる化学記録の検索」. Science . 126 (3278): 814–819. Bibcode :1957Sci...126..814R. doi :10.1126/science.126.3278.814. PMID 17776535.
- ^ リヒター、フリードリヒ (1938)。 「バイルシュタインの作り方」。化学教育ジャーナル。15 (7): 310。書誌コード:1938JChEd..15..310R。土井:10.1021/ed015p310。
- ^ White, Michael J. (2014). 「第3章 化学特許」.化学者のための化学情報. pp. 53–90. doi :10.1039/9781782620655-00053. ISBN 978-1-84973-551-3。
- ^ 「CAS Printed Products」. CAS. 2008年5月12日時点のオリジナルよりアーカイブ。2024年7月29日閲覧。
- ^ 「新しいSciFinderがWeb経由で利用可能に」CAS。2008年5月13日時点のオリジナルよりアーカイブ。2024年7月29日閲覧。
- ^ Eakin, Diane R.; Hyde, Ernest; Palmer, Graham (1974). 「化学構造情報を用いたコンピュータの利用: ICI CROSSBOW システム」. Pesticide Science . 5 (3): 319–326. doi :10.1002/ps.2780050316.
- ^ Warr, Wendy A. (1982). 「Wiswesser 線式表記法の多様な用途と将来展望」. Journal of Chemical Information and Computer Sciences . 22 (2): 98–101. doi :10.1021/ci00034a007.
- ^ Walker, S. Barrie (1983). 「CAOCI の開発と ICI 植物保護部門での使用」.化学情報およびコンピュータサイエンスジャーナル. 23 : 3–5. doi :10.1021/ci00037a001.
- ^ Weininger, David (1988). 「SMILES、化学言語および情報システム。1. 方法論とエンコード規則の紹介」。Journal of Chemical Information and Computer Sciences。28 : 31–36。doi : 10.1021/ci00057a005。
- ^ Homer, R. Webster; Swanson, Jon; Jilek, Robert J.; et al. (2008). 「SYBYL ライン表記法 (SLN): 化学構造、クエリ、反応、仮想ライブラリを表す単一の表記法」。Journal of Chemical Information and Modeling . 48 (12): 2294–2307. doi :10.1021/ci7004687. PMID 18998666.
- ^ Wiswesser, William J. (1985). 「化学表記法の歴史的発展」. Journal of Chemical Information and Computer Sciences . 25 (3): 258–263. doi :10.1021/ci00047a023.
- ^ ab Shaik, Aneesa Bashir (1985-12-05). 「化学情報システムの調査」(PDF) . ntrs.nasa.gov . pp. 1–160.
- ^ Adamson, George W.; Bird, John M.; Palmer, Graham; Warr, Wendy A. (1985). 「ICI 内での MACCS の使用」. Journal of Chemical Information and Computer Sciences . 25 (2): 90–92. doi :10.1021/ci00046a007.
- ^ Wipke, W. Todd; Dyott, Thomas M. (1974). 「立体化学的にユニークな命名アルゴリズム」. Journal of the American Chemical Society . 96 (15): 4834–4842. doi :10.1021/ja00822a021.
- ^ Hagadone, Tom R. (1988). 「社内化学構造データベースの管理における現在のアプローチと新しい方向性」.化学構造. pp. 23–41. doi :10.1007/978-3-642-73975-0_3. ISBN 978-3-642-73977-4。
- ^ 「CT ファイル形式」(PDF)。Biovia。2020 年 8 月。2021年 2 月 19 日時点のオリジナルよりアーカイブ(PDF) 。2024 年 8 月 1 日に取得。
- ^ Lawson, Kevin R.; Lawson, Jonty (2012). 「LICSS - Microsoft Excel の化学スプレッドシート」. Journal of Cheminformatics . 4 (1): 3. doi : 10.1186 /1758-2946-4-3 . PMC 3310842. PMID 22301088.
- ^ ジャドソン、フィリップ (2019)。「第 7 章 構造、部分構造、および上部構造の検索」。化学における知識ベースのエキスパート システム。理論および計算化学シリーズ。英国王立化学協会。pp. 84–107。doi :10.1039 / 9781788016186-00084。ISBN 978-1-78801-471-7。
- ^ Rarey, Matthias; Nicklaus, Marc C.; Warr, Wendy (2022). 「反応情報科学と化学空間に関する特集号」. Journal of Chemical Information and Modeling . 62 (9): 2009–2010. doi : 10.1021/acs.jcim.2c00390 . PMID 35527682.
外部リンク
- Wikipedia 化学構造エクスプローラーは、Wikipedia の化学記事を部分構造で検索します。
- PubChemを検索
- ChemSpiderを検索
- 500億以上の分子のデータベースZINC-22を検索
