文書分類 、あるいは文書カテゴリ分けは、 図書館学 、情報科学 、コンピュータ科学 における課題です。その課題は、文書 を1つまたは複数のクラス またはカテゴリ に割り当てることです。これは「手動」(あるいは「知的」)で行うことも、アルゴリズムを用い て行うこともできます。文書の知的分類は主に図書館学の領域であり、一方、文書のアルゴリズム分類は主に情報科学とコンピュータ科学の領域です。しかし、これらの課題は重複しているため、文書分類に関する学際的な研究が行われています。
分類対象となる文書は、テキスト、画像、音楽など多岐にわたります。文書の種類ごとに、それぞれ特有の分類上の課題があります。特に指定がない限り、テキスト分類 が前提となります。
文書は、主題 に基づいて分類することも、その他の属性(文書の種類、作成者、印刷年など)に基づいて分類することもできます。この記事では、主題分類のみを取り上げます。文書の主題分類には、内容に基づくアプローチと要求に基づくアプローチという、主に2つの考え方があります。
「コンテンツベース」分類と「リクエストベース」分類内容に基づく分類 とは、文書内の特定の主題に与えられた重みによって、文書が割り当てられるクラスが決定される分類のことです。たとえば、図書館の分類では、書籍の内容の少なくとも20%は、その書籍が割り当てられるクラスに関するものであるべき、というルールが一般的です。[ 1 ] 自動分類では、特定の単語が文書内に出現する回数が基準となる場合があります。
リクエスト指向分類 (またはインデックス作成)とは、ユーザーからの想定されるリクエストが文書の分類方法に影響を与える分類方法です。分類器は、「このエンティティはどの記述子で見つけるべきか?」と自問し、「考えられるすべてのクエリを考えて、目の前のエンティティがどのクエリに関連しているかを決定する」必要があります(Soergel、1985、p. 230 [ 2 ] )。
リクエスト指向型分類とは、特定の読者層やユーザーグループを対象とした分類のことです。例えば、フェミニズム研究のための図書館やデータベースは、歴史図書館とは異なる方法で文書を分類・索引付けする場合があります。しかし、リクエスト指向型分類は、ポリシーに基づく分類 と理解する方が適切でしょう。つまり、分類は特定の理念に基づいて行われ、分類を行う図書館やデータベースの目的を反映しているということです。このように、必ずしもユーザー調査に基づく分類や索引付けとは言えません。リクエスト指向型分類がユーザーベースのアプローチとみなされるのは、利用状況やユーザーに関する実証データが適用される場合に限られます。
分類とインデックス作成の比較 文書をクラスに割り当てること(「分類」)と文書に主題を割り当てること(「 主題索引 」)を区別することがありますが、フレデリック・ウィルフリッド・ランカスター が主張するように、この区別は有益ではありません。「これらの用語上の区別は全く意味がなく、混乱を招くだけです」と彼は書いています(Lancaster、2003、p. 21 [ 3 ] )。この区別が純粋に表面的なものであるという見解は、分類システムがシソーラス に変換でき、またその逆も可能であるという事実によっても裏付けられています(Aitchison、1986 [ 4 ] 2004 [ 5 ] Broughton、2008 [ 6 ] Riesthuis & Bliedung、1991 [ 7 ] 参照)。したがって、索引内の文書に主題語を割り当てることは、その文書をその主題語で索引付けされた文書のクラスに割り当てることと同等です(Xとして索引付けまたは分類されたすべての文書は、同じ文書クラスに属します)。
自動文書分類(ADC)自動文書分類タスクは、3 つの種類に分類できます。教師あり文書分類 では、何らかの外部メカニズム (人間のフィードバックなど) が文書の正しい分類に関する情報を提供します。教師なし文書分類 (文書クラスタリング とも呼ばれます) では、分類は外部情報に全く依存せずに行う必要があります。半教師あり文書分類 [ 8 ] では、文書の一部が外部メカニズムによってラベル付けされます。さまざまなライセンスモデルで利用可能なソフトウェア製品がいくつかあります。[ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ]
アプリケーション 分類技術は、
スパムフィルタリングとは、 電子メールのスパム メッセージを正規の電子メールから識別しようとするプロセスです。メールルーティングとは 、一般的なアドレスに送信されたメールを、トピックに応じて特定のアドレスまたはメールボックスに送信することです[ 15 ]。 言語識別 、テキストの言語を自動的に判別するジャンル分類、テキストのジャンルを自動的に判定する[ 16 ] 読みやすさ評価とは 、テキストの読みやすさの度合いを自動的に判定し、異なる年齢層や読者タイプに適した教材を見つけるため、あるいはより大規模なテキスト簡略化 システムの一部として利用されるものです。感情分析とは 、あるトピックに関して話し手や書き手の態度、あるいは文書全体の文脈的な極性を判断することである。公衆衛生監視におけるソーシャルメディアを用いた健康関連分類[ 17 ] 記事のトリアージ、手動による文献キュレーションに関連する記事の選択、たとえば生物学で手動キュレーションされた注釈データベースを生成する最初のステップとして行われているように[ 18 ]
参考文献 ↑ 米国議会図書館(2008年)。件名標目マニュアル。ワシントンD.C.:米国議会図書館、政策・基準部。(シートH 180:「資料全体の20%以上を占めるトピックにのみ件名標目を割り当てること。」) ↑ Soergel, Dagobert (1985).情報の整理:データベースと検索システムの原理。フロリダ州オーランド:Academic Press。 ↑ ランカスター、FW(2003)。索引作成と抄録作成の理論と実践。図書館協会、ロンドン。 ↑ Aitchison, J. (1986). 「シソーラスのソースとしての分類:シソーラス用語と構造のソースとしてのHE Blissの書誌分類」 Journal of Documentation、第42巻、第3号、160-181ページ。 ↑ Aitchison, J. (2004). 「BC2からのシソーラス:Bliss Musicスケジュールから派生した実験的シソーラスで明らかになった問題点と可能性」Bliss Classification Bulletin、第46巻、20-26ページ。 ↑ Broughton, V. (2008). "ファセット分類をファセット用語の基礎とする: Bliss Bibliographic Classification (第 2 版) における分類構造のシソーラス形式への変換。]" Axiomathes、第 18 巻、第 2 号、pp. 193-210。 ↑ Riesthuis, GJA、および Bliedung, St. (1991)。「UDC のシソーラス化」。知識組織化とヒューマンインターフェースのためのツール、第 2 巻、pp. 109-117。Index Verlag、フランクフルト。 ↑ Rossi, RG、Lopes, A. d. A.、および Rezende, SO (2016)。テキストのトランスダクティブ分類を改善するための二部グラフ異種ネットワークにおける最適化とラベル伝播。Information Processing & Management、52(2):217–257。 ↑ 「対話型自動文書分類プロトタイプ」(PDF) 。2017年11月15日にオリジナル(PDF)からアーカイブ 。2017年11月14日 に取得。 ↑ インタラクティブ自動文書分類プロトタイプ(2015年4月24日、 Wayback Machineに アーカイブ済み) ↑ 文書分類 - Artsyl [ リンク削除済み] ↑ ABBYY FineReader Engine 11 for Windows ↑ 分類器 - アンチドット ↑ 「困難なプロジェクトのための3つ の 文書分類方法」 。www.bisok.com 。 2021年8月4日 取得 。 ↑ ステファン・ブーゼマン、スヴェン・シュマイヤー、ローマン・G・アレンス (2000)。コールセンターでのメッセージの分類。 Sergei Nirenburg、Douglas Appelt、Fabio Ciravegna、Robert Dale 編、Proc.第6回応用自然言語処理研究会(ANLP'00)、158 ~ 165 ページ、ACL。 ↑ Santini, Marina; Rosso, Mark (2008), Testing a Genre-Enabled Application: A Preliminary Assessment (PDF) , BCS IRSG Symposium: Future Directions in Information Access, London, UK, pp. 54– 63, 2019-11-15 に オリジナル (PDF)からアーカイブ済み、 2011-10-21 に取得 {{citation}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)↑ Dai, X.; Bikdash, M.; Meyer, B. (2017). ソーシャルメディアから公衆衛生監視へ: Twitter分類のための単語埋め込みに基づくクラスタリング手法 . SoutheastCon 2017. Charlotte, NC. pp. 1– 7. doi : 10.1109/SECON.2017.7925400 . ↑ Krallinger, M; Leitner, F; Rodriguez-Penagos, C; Valencia, A (2008). "Bio Creative II のタンパク質間相互作用アノテーション抽出タスクの概要 " . Genome Biology . 9 (Suppl 2): S4. doi : 10.1186/gb-2008-9-s2-s4 . PMC 2559988 . PMID 18834495 .
さらに読む Fabrizio Sebastiani.自動テキスト分類における機械学習. ACM Computing Surveys, 34(1):1–47, 2002. Stefan Büttcher、Charles LA Clarke、Gordon V. Cormack。『情報検索:検索エンジンの実装と評価』 MIT Press、2010年。Wayback Machine に2020年10月5日に アーカイブ済み。
外部リンク 文書分類入門 自動テキスト分類に関する参考文献( 2019年9月26日にWayback Machine に アーカイブ済み) クエリ分類に関する参考文献( 2019年10月2日にWayback Machine に アーカイブ済み) テキスト分類分析ページ テキスト分類の学習 - 『Pythonによる自然言語処理』第6章(オンラインで入手可能) TechTC - テクニオン大学テキスト分類データセットリポジトリ( 2020年2月14日にWayback Machine に アーカイブ済み) デビッド・D・ルイスのデータセット BioCreative III ACT(記事分類タスク)データセット