

テキストネイリング(TN)は、非構造化文書から構造化情報を半自動的に抽出する情報抽出方法です。この方法により、人間は大量の文書から小さなテキストの塊を対話的に確認し、潜在的に有益な表現を識別できます。識別された表現は、テキスト(正規表現など)や高度な自然言語処理(NLP)技術に依存する計算方法を強化するために使用できます。TNは、1)人間と物語テキストの対話により、非常に普及している非否定表現を識別すること、および2)すべての表現と注釈を非否定のアルファベットのみの表現に変換して、均質な表現を作成することという2つの概念を組み合わせています。[1] [2]
従来の機械学習によるテキスト分類のアプローチでは、人間の専門家がフレーズやメモ全体にラベルを付ける必要があり、その後、教師あり学習アルゴリズムが関連性を一般化して新しいデータに適用しようとします。対照的に、否定されていない個別の表現を使用すると、一般化を達成するための追加の計算方法が不要になります。[3] [4] [5]
歴史
TNはマサチューセッツ総合病院で開発され、喫煙状況の抽出、冠動脈疾患の家族歴、睡眠障害患者の特定、[6]非アルコール性脂肪性肝疾患患者のフレーミングハムリスクスコアの精度の向上、2型糖尿病の非順守の分類など、複数のシナリオでテストされました。電子健康記録のテキスト文書からの情報抽出に関する包括的なレビューが利用可能です。[7] [8]
テキストベースの分類器の精度を高めるために非否定表現を使用することの重要性は、2018年10月にCommunications of the ACMに掲載された論文で強調されました。[9]
ソースコード
「釘付け表現」を使用して物語メモから喫煙状況を抽出するサンプルコードはGitHubで入手できます。[10]
進歩的なサイバーヒューマンインテリジェンスとしてのTN
2018年7月、バージニア工科大学とイリノイ大学アーバナ・シャンペーン校の研究者らは、TNを進歩的サイバーヒューマンインテリジェンス(PCHI)の例として言及した。[11]
医療における機械学習に対する批判
チェンとアッシュは2017年に「機械学習は過大な期待のピークにあるが、その技術の能力と限界をより深く理解することで、その後の「幻滅の谷」への崩壊を和らげることができる」と書いている。[12]
Communications of the ACMに掲載された「ブルートフォースを超えて」という書簡では、ブルートフォースアプローチはテキストに適用した場合、従来の機械学習アルゴリズムよりも優れたパフォーマンスを発揮する可能性があることが強調されています。書簡では、「...機械学習アルゴリズムをテキストに適用する場合、あらゆる言語には無限の数の表現が含まれるという仮定に依存します。対照的に、さまざまな病状において、臨床医は患者の状態を説明するために同じ表現を使用する傾向があることがわかりました。」と述べています。[13]
2018年6月に発表された、医学におけるデータに基づく研究結果の採用が遅れていることに関する見解の中で、Text Nailingの共同作成者であるUri Kartounは次のように述べています。「...Text Nailingは、テキストを簡素化するために単純なトリックに頼っており、人間による注釈に大きく依存していると主張する医療情報学ジャーナルの査読者から懐疑的な意見を引き起こしました。TNは一見すると単なる光のトリックのように見えるかもしれませんが、実際にはかなり洗練された方法であり、最終的にはより冒険的な査読者や編集者の注目を集め、最終的に出版に受け入れられました。」[14]
批判
ヒューマン インザループ プロセスは、ドメイン エキスパートを使用して機能を生成する方法です。ドメイン エキスパートを使用して機能を作成することは、目新しい概念ではありません。ただし、ドメイン エキスパートが機能を作成するのに役立つ特定のインターフェイスと方法は、おそらく目新しいものです。
この場合、専門家が作成する特徴は正規表現と同等です。アルファベット以外の文字を削除して「smokesppd」に一致させることは、正規表現 /smokes[^a-zA-Z]*ppd/ と同等です。正規表現をテキスト分類の特徴として使用することは目新しいことではありません。
これらの特徴が与えられると、分類器は著者によって手動で設定されたしきい値となり、一連のドキュメントのパフォーマンスによって決定されます。これは分類器ですが、分類器のパラメータ (この場合はしきい値) が手動で設定されるだけです。同じ特徴とドキュメントが与えられると、ほぼすべての機械学習アルゴリズムが同じしきい値、または (おそらく) より良いしきい値を見つけることができるはずです。
著者らは、サポート ベクター マシン(SVM) と数百のドキュメントを使用するとパフォーマンスが劣ると指摘していますが、SVM がどの機能またはドキュメントでトレーニング/テストされたかは明記していません。公平な比較を行うには、手動しきい値分類器で使用されるものと同じ機能とドキュメント セットを使用します。
参考文献
- ^ Kartoun, Uri (2017). 「テキストネイリング」.インタラクション. 24 (6): 44–9. doi :10.1145/3139488. S2CID 29010232.
- ^バルボサ、シモーネ、 コックトン、ギルバート(2017)。「デザイン思慮深さでアジェンダバイアスを回避する」。インタラクション。24(6):5。doi : 10.1145 / 3151556。S2CID 657561。
- ^ Beam, Andrew L; Kartoun, Uri; Pai, Jennifer K; Chatterjee, Arnaub K; Fitzgerald, Timothy P; Shaw, Stanley Y; Kohane, Isaac S (2017). 「睡眠薬の処方と臨床意思決定に影響を与える医師と患者のダイナミクスの予測モデル化」。Scientific Reports . 7 : 42282. Bibcode :2017NatSR...742282B. doi :10.1038/srep42282. PMC 5299453 . PMID 28181568.
- ^ Simon, Tracey G; Kartoun, Uri; Zheng, Hui; Chan, Andrew T; Chung, Raymond T; Shaw, Stanley; Corey, Kathleen E (2017). 「末期肝疾患Naスコアモデルは非アルコール性脂肪性肝疾患患者における主要な心血管イベントの発生を予測する」Hepatology Communications . 1 (5): 429–438. doi :10.1002/hep4.1051. PMC 5659323 . PMID 29085919.
- ^ Corey, Kathleen E; Kartoun, Uri; Zheng, Hui; Chung, Raymond T; Shaw, Stanley Y (2016). 「電子カルテデータベースを使用した非アルコール性脂肪肝疾患の非伝統的な心血管リスク因子の特定」。アメリカ消化器病学会誌。111 (5): 671–6. doi :10.1038/ajg.2016.44. PMC 4864030 . PMID 26925881.
- ^ Kartoun, Uri; et al. (2018). 「医師が診断した不眠症患者を識別するアルゴリズムの開発」。Scientific Reports . 8 (1): 7862. Bibcode :2018NatSR...8.7862K. doi :10.1038/s41598-018-25312-z. PMC 5959894 . PMID 29777125.
- ^ Meystre, S. M; Savova, G. K; Kipper-Schuler, K. C; Hurdle, J. F (2008). 「電子健康記録のテキスト文書からの情報抽出: 最近の研究のレビュー」。Yearbook of Medical Informatics : 128–44. PMID 18660887。
- ^ Wang, Yanshan; Wang, Liwei; Rastegar-Mojarad, Majid; Moon, Sungrim; Shen, Feichen; Afzal, Naveed; Liu, Sijia; Zeng, Yuqun; Mehrabi, Saeed; Sohn, Sunghwan; Liu, Hongfang (2018). 「臨床情報抽出アプリケーション: 文献レビュー」. Journal of Biomedical Informatics . 77 : 34–49. doi :10.1016/j.jbi.2017.11.011. PMC 5771858. PMID 29162496 .
- ^ CACMスタッフ(2018 年)。「より正確なテキスト分析で患者の転帰を改善」Communications of the ACM。61(10):6–7。doi :10.1145/3273019。S2CID 52901757 。
- ^ 「GitHub - kartoun/text-nailing」。GitHub。2018年1月7日。
- ^ Rikakis, Thanassis; Kelliher, Aisling; Huang, Jia-Bin; Sundaram, Hari (2018). 「社会貢献のための進歩的なサイバーヒューマンインテリジェンス」. Interactions . 25 (4): 52–56. doi :10.1145/3231559. S2CID 49563432.
- ^ Chen , Jonathan H; Asch, Steven M (2017). 「医療における機械学習と予測 — 過大な 期待のピークを超えて」。New England Journal of Medicine。376 ( 26 ): 2507–9。doi : 10.1056 /NEJMp1702071。PMC 5953825。PMID 28657867。
- ^ CACMスタッフ (2017). 「ブルートフォースを超えて」Communications of the ACM . 60 (10): 8–9. doi :10.1145/3135241.
- ^ Kartoun, Uri (2018). 「医療におけるデータ駆動型研究結果の導入加速に向けて」.医学、医療、哲学. 22 (1): 153–157. doi :10.1007/s11019-018-9845-y. PMID 29882052. S2CID 46973857.
