動機 カレン・スパーク・ジョーンズ (1972)は、逆文書頻度(idf)と呼ばれる用語特異性の統計的解釈を考案し、それが用語重み付けの基礎となった。[ 3 ]
ある用語の特異性は、その用語が出現する文書数の逆関数として定量化できる。
例えば、シェイクスピアの37作品に登場するいくつかの単語のdf(文書頻度)とidfは、次のように表されるかもしれません。
「ロミオ 」「ファルスタッフ 」「サラダ」といった単語は、ごく少数の劇にしか登場しません。そのため、これらの単語を見れば、どの劇かおおよそ見当がつくでしょう。一方、「良い」「甘い」といった単語はどの劇にも登場するため、どの劇かを判断する上で全く役に立ちません。
意味 tf-idfは、単語頻度 と逆文書頻度 という2つの統計量の積です。これらの統計量の正確な値を決定する方法はいくつかあります。 文書やウェブページ内におけるキーワードやフレーズの重要性を定義することを目的とした数式。
用語頻度 用語頻度tf( t , d ) は、文書d内の用語 t の相対頻度です。
t f ( t 、 d ) = f t 、 d ∑ t ′ ∈ d f t ′ 、 d {\displaystyle \mathrm {tf} (t,d)={\frac {f_{t,d}}{\sum _{t'\in d}{f_{t',d}}}}} 、ここで、f t , d は文書内の用語の生の出現回数 、つまり文書d内で用語 t が出現する回数です。分母は、文書d 内の用語の総数(同じ用語の出現をそれぞれ個別にカウントしたもの)であることに注意してください。用語頻度を定義する方法は他にもいくつかあります。[ 4 ] : 128
生のカウント自体: tf( t , d ) = f t , d ブール型の 「頻度」:tf( t , d ) = tが d に含まれる場合は1 、それ以外の場合は 0。対数スケールされた 周波数: tf( t , d ) = log (1 + f t , d ) ; [ 5 ] 長い文書への偏りを防ぐため、頻度を拡張する。例えば、文書内で最も頻繁に出現する用語の生の頻度で、生の頻度を割る。 t f ( t 、 d ) = 0.5 + 0.5 ⋅ f t 、 d 最大 { f t ′ 、 d : t ′ ∈ d } {\displaystyle \mathrm {tf} (t,d)=0.5+0.5\cdot {\frac {f_{t,d}}{\max\{f_{t',d}:t'\in d\}}}
単語頻度-逆文書頻度tf-idfは次のように計算されます。
t f 私 d f ( t 、 d 、 D ) = t f ( t 、 d ) ⋅ 私 d f ( t 、 D ) {\displaystyle \mathrm {tfidf} (t,d,D)=\mathrm {tf} (t,d)\cdot \mathrm {idf} (t,D)} tf-idf の重みが高いのは、(特定の文書における)単語の出現頻度 が高く、かつ文書コレクション全体におけるその単語の出現頻度が低い場合です。そのため、重みは一般的な単語を除外する傾向があります。idf の対数関数内の比率は常に 1 以上であるため、idf(および tf-idf)の値は 0 以上になります。単語がより多くの文書に出現するにつれて、対数内の比率は 1 に近づき、idf と tf-idf は 0 に近づきます。
単語頻度と逆文書頻度はどちらも情報理論 の観点から定式化できます。これは、それらの積が文書の共同情報内容の観点から意味を持つ理由を理解するのに役立ちます。分布に関する特徴的な仮定p ( d 、 t ) {\displaystyle p(d,t)} それは次のとおりです。
p ( d | t ) = 1 | { d ∈ D : t ∈ d } | {\displaystyle p(d|t)={\frac {1}{|\{d\in D:t\in d\}|}}} 相澤によれば、この仮定とその意味合いは「tf-idfが採用するヒューリスティックを表している」[ 8 ]。
コーパス内の「ランダムに選択された」文書の条件付きエントロピー D {\displaystyle D} 特定の用語が含まれているという事実を条件とするt {\displaystyle t} (そして、すべての文書が選択される確率が等しいと仮定すると)次のようになります。
H ( D | T = t ) = − ∑ d p d | t ログ p d | t = − ログ 1 | { d ∈ D : t ∈ d } | = ログ | { d ∈ D : t ∈ d } | | D | + ログ | D | = − 私 d f ( t ) + ログ | D | {\displaystyle H({\cal {D}}|{\cal {T}}=t)=-\sum _{d}p_{d|t}\log p_{d|t}=-\log {\frac {1}{|\{d\in D:t\in d\}|}}=\log {\frac {|\{d\in D:t\in d\}|}{|D|}}+\log |D|=-\mathrm {idf} (t)+\log |D|} 表記法に関して言えば、D {\displaystyle {\cal {D}}} そしてT {\displaystyle {\cal {T}}} はそれぞれ文書または用語の抽出に対応する「確率変数」です。相互情報量は 次のように表すことができます。
M ( T ; D ) = H ( D ) − H ( D | T ) = ∑ t p t ⋅ ( H ( D ) − H ( D | W = t ) ) = ∑ t p t ⋅ 私 d f ( t ) {\displaystyle M({\cal {T}};{\cal {D}})=H({\cal {D}})-H({\cal {D}}|{\cal {T}})=\sum _{t}p_{t}\cdot (H({\cal {D}})-H({\cal {D}}|W=t))=\sum _{t}p_{t}\cdot \mathrm {idf} (t)} 最後のステップは拡張することですp t {\displaystyle p_{t}} 文書の(ランダムな)選択に関して、ある用語を抽出する無条件確率は次のようになる。
M ( T ; D ) = ∑ t 、 d p t | d ⋅ p d ⋅ 私 d f ( t ) = ∑ t 、 d t f ( t 、 d ) ⋅ 1 | D | ⋅ 私 d f ( t ) = 1 | D | ∑ t 、 d t f ( t 、 d ) ⋅ 私 d f ( t ) 。 {\displaystyle M({\cal {T}};{\cal {D}})=\sum _{t,d}p_{t|d}\cdot p_{d}\cdot \mathrm {idf} (t)=\sum _{t,d}\mathrm {tf} (t,d)\cdot {\frac {1}{|D|}}\cdot \mathrm {idf} (t)={\frac {1}{|D|}}\sum _{t,d}\mathrm {tf} (t,d)\cdot \mathrm {idf} (t).} この式は、考えられるすべての用語と文書の Tf-idf を合計すると、それらの結合分布のすべての特性を考慮した文書と用語間の相互情報量が回復されることを示しています。[ 8 ] したがって、各 Tf-idf は、用語 x 文書のペアに付随する「情報ビット」を運びます。
tf-idfの例2つの文書のみからなるコーパスの単語出現頻度表があると仮定します。
「これはサンプルAです。」 「これもまた一つの例だ、また一つの例だ、例だ。」
「this」という語句に対するtf-idfの計算は、以下のように行われます。
生の頻度形式では、tf は各文書における「this」の出現頻度を表します。各文書には「this」という単語が一度ずつ出現しますが、文書 2 の方が単語数が多いため、相対頻度は小さくなります。
t f ( 」 t h 私 s 」 、 d 1 ) = 1 5 = 0.2 {\displaystyle \mathrm {tf} ({\mathsf {''this''}},d_{1})={\frac {1}{5}}=0.2} t f ( 」 t h 私 s 」 、 d 2 ) = 1 7 ≈ 0.14 {\displaystyle \mathrm {tf} ({\mathsf {''this''}},d_{2})={\frac {1}{7}}\approx 0.14} IDFはコーパスごとに一定であり、 「this」という単語を含む文書の割合を表します 。この場合、2つの文書からなるコーパスがあり、その両方に「this」という単語が含まれています。
私 d f ( 」 t h 私 s 」 、 D ) = ログ ( 2 2 ) = 0 {\displaystyle \mathrm {idf} ({\mathsf {''this''}},D)=\log \left({\frac {2}{2}}\right)=0} つまり、「this」という単語のtf-idfはゼロであり、これはこの単語がすべての文書に現れることから、あまり情報量が多くないことを示唆している。
t f 私 d f ( 」 t h 私 s 」 、 d 1 、 D ) = 0.2 × 0 = 0 {\displaystyle \mathrm {tfidf} ({\mathsf {''this''}},d_{1},D)=0.2\times 0=0} t f 私 d f ( 」 t h 私 s 」 、 d 2 、 D ) = 0.14 × 0 = 0 {\displaystyle \mathrm {tfidf} ({\mathsf {''this''}},d_{2},D)=0.14\times 0=0} 「例」という単語はより興味深い。それは3回登場するが、2番目の文書にしか登場しない。
t f ( 」 e x 1 m p l e 」 、 d 1 ) = 0 5 = 0 {\displaystyle \mathrm {tf} ({\mathsf {''example''}},d_{1})={\frac {0}{5}}=0} t f ( 」 e x 1 m p l e 」 、 d 2 ) = 3 7 ≈ 0.429 {\displaystyle \mathrm {tf} ({\mathsf {''example''}},d_{2})={\frac {3}{7}}\approx 0.429} 私 d f ( 」 e x 1 m p l e 」 、 D ) = ログ ( 2 1 ) = 0.301 {\displaystyle \mathrm {idf} ({\mathsf {''example''}},D)=\log \left({\frac {2}{1}}\right)=0.301} ついに、
t f 私 d f ( 」 e x 1 m p l e 」 、 d 1 、 D ) = t f ( 」 e x 1 m p l e 」 、 d 1 ) × 私 d f ( 」 e x 1 m p l e 」 、 D ) = 0 × 0.301 = 0 {\displaystyle \mathrm {tfidf} ({\mathsf {''example''}},d_{1},D)=\mathrm {tf} ({\mathsf {''example''}},d_{1})\times \mathrm {idf} ({\mathsf {''example''}},D)=0\times 0.301=0} t f 私 d f ( 」 e x 1 m p l e 」 、 d 2 、 D ) = t f ( 」 e x 1 m p l e 」 、 d 2 ) × 私 d f ( 」 e x 1 m p l e 」 、 D ) = 0.429 × 0.301 ≈ 0.129 {\displaystyle \mathrm {tfidf} ({\mathsf {''example''}},d_{2},D)=\mathrm {tf} ({\mathsf {''example''}},d_{2})\times \mathrm {idf} ({\mathsf {''example''}},D)=0.429\times 0.301\approx 0.129} (底が10の対数 を使用)。
用語を超えて tf-idf の背後にある考え方は、用語以外のエンティティにも適用されます。1998 年に、idf の概念が引用に適用されました。[ 11 ] 著者らは、「非常にまれな引用が 2 つの文書で共有されている場合、多数の文書による引用よりも高い重み付けをすべきである」と主張しました。さらに、tf-idf は、ビデオ内のオブジェクト マッチングを行う目的で「ビジュアル ワード」[ 12 ] や文全体にも適用されました。[ 13 ] しかし、tf-idf の概念は、単純な tf スキーム (idf なし) よりもすべての場合に効果的であることが証明されたわけではありません。tf-idf を引用に適用した場合、研究者らは、idf コンポーネントのない単純な引用数重みよりも改善が見られないことを発見しました。[ 14 ]
デリバティブ tf-idf から派生した用語重み付けスキームがいくつかあります。その 1 つは TF-PDF (用語頻度 * 比例文書頻度) です。[ 15 ] TF-PDF は、メディアで出現するトピックを特定する文脈で 2001 年に導入されました。PDF コンポーネントは、用語が異なるドメインでどのくらいの頻度で出現するかの差を測定します。もう 1 つの派生は TF-IDuF です。TF-IDuF では、[ 16 ] idf は検索または推奨される文書コーパスに基づいて計算されません。代わりに、idf はユーザーの個人文書コレクションに基づいて計算されます。著者らは、TF-IDuF は tf-idf と同等に効果的であるだけでなく、たとえばユーザーモデリングシステムがグローバル文書コーパスにアクセスできない状況でも適用できると報告しています。DELTA TF-IDF [ 17 ] 派生は、肯定的および否定的感情などの 2 つの特定のクラス間での用語の重要度の差を使用します。例えば、肯定的なレビューでは「素晴らしい」という単語に高いスコアを、否定的なレビューでは同じ単語に低いスコアを割り当てることができます。これにより、文書の感情を強く示す単語を特定しやすくなり、テキスト分類タスクの精度向上につながる可能性があります。
参考文献 ↑ Rajaraman, A.; Ullman, JD (2011). "データマイニング" (PDF) .大規模データセットのマイニング . pp. 1–17 . doi : 10.1017/CBO9781139058452.002 . ISBN 978-1-139-05845-2 。 ↑ Breitinger, Corinna; Gipp, Bela; Langer, Stefan (2015-07-26). "研究論文推薦システム:文献調査" . International Journal on Digital Libraries . 17 (4): 305– 338. doi : 10.1007/s00799-015-0156-0 . ISSN 1432-5012 . S2CID 207035184 . ↑ Spärck Jones, K. (1972). "用語特異性の統計的解釈とその検索への応用". Journal of Documentation . 28 (1): 11– 21. CiteSeerX 10.1.1.115.8343 . doi : 10.1108/eb026526 . S2CID 2996187 . ↑ Manning, CD; Raghavan, P.; Schutze, H. (2008). "スコアリング、用語重み付け、およびベクトル空間モデル" (PDF) . 情報検索入門 . p. 100. doi : 10.1017/CBO9780511809071.007 . ISBN 978-0-511-80907-1 。↑ 「TFIDF統計 | SAX-VSM」 。 1 2 3 Robertson, S. (2004). "逆文書頻度の理解:IDFの理論的議論について". Journal of Documentation . 60 (5): 503– 520. doi : 10.1108/00220410410560582 . ↑ 情報検索入門の 「 実践における確率推定」 も参照してください。 1 2 相沢明子 (2003). 「tf-idf 尺度の情報理論的視点」. 情報処理と管理 . 39 (1): 45– 65. doi : 10.1016/S0306-4573(02)00021-3 . S2CID 45793141 . ↑ Sheridan, Paul; Ahmed, Zeyad; Farooque, Aitazaz A. (2026). "TF–IDF 用語重み付けスキームのフィッシャーの正確検定による正当化" . The American Statistician . 80 (1): 146– 156. arXiv : 2507.15742 . doi : 10.1080/00031305.2025.2539241 . 1 2 Ahmed, Zeyad; Sheridan, Paul; McIsaac, Michael; Farooque, Aitazaz A. (2026). "Common TF–IDF variants arise as key components in the test statistic of a penalized likelihood-ratio test for word burstiness" . Discover Computing . 29 (1): 274. arXiv : 2604.00672 . doi : 10.1007/s10791-026-10090-4 . ↑ Bollacker, Kurt D.; Lawrence, Steve; Giles, C. Lee (1998-01-01). "CiteSeer". Proceedings of the second international conference on Autonomous agents - AGENTS '98 . pp. 116–123 . doi : 10.1145/280765.280786 . ISBN 978-0-89791-983-8 . S2CID 3526393 . ↑ Sivic, Josef; Zisserman, Andrew (2003-01-01). "Video Google: A text retrieval approach to object matching in videos". Proceedings Ninth IEEE International Conference on Computer Vision . ICCV '03. pp. 1470–. doi : 10.1109/ICCV.2003.1238663 . ISBN 978-0-7695-1950-0 . S2CID 14457153 . ↑ 関洋平. 「新聞記事からのtf/idfと位置重み付けによる文抽出」 (PDF) . 国立情報学研究所. ↑ Beel, Joeran; Breitinger, Corinna (2017). 「CC-IDF引用重み付けスキームの評価 – 参考文献に「逆文書頻度」(IDF)をどれだけ効果的に適用できるか?」 (PDF) . 第12回IConference議事録 . 2020年9月22日に オリジナル (PDF) からアーカイブ済み. 2017年1月29日 取得 . ↑ Khoo Khyou Bun; Bun, Khoo Khyou; Ishizuka, M. (2001). "Emerging Topic Tracking System". Proceedings Third International Workshop on Advanced Issues of E-Commerce and Web-Based Information Systems. WECWIS 2001. pp. 2–11 . CiteSeerX 10.1.1.16.7986 . doi : 10.1109/wecwis.2001.933900 . ISBN 978-0-7695-1224-2 . S2CID 1049263 . ↑ Langer, Stefan; Gipp, Bela (2017). "TF-IDuF: ユーザーの個人文書コレクションに基づくユーザーモデリングのための新しい用語重み付けスキーム" (PDF) . IConference . ↑ Martineau, Justin; Finin, Tim (2009). "Delta TFIDF: 感情分析のための改良された特徴空間" . Proceedings of the Third International AAAI Conference on Web and Social Media . ICWSM. San Jose, CA: AAAI. doi : 10.1609/icwsm.v3i1.13979 . Salton, G ; McGill, MJ (1986).現代情報検索入門 . McGraw-Hill . ISBN 978-0-07-054484-0 。Salton, G. ; Fox, EA; Wu, H. (1983). "拡張ブール情報検索". Communications of the ACM . 26 (11): 1022– 1036. doi : 10.1145/182.358466 . hdl : 1813/6351 . S2CID 207180535 . Salton, G. ; Buckley, C. (1988). "自動テキスト検索における用語重み付けアプローチ" (PDF) . Information Processing & Management . 24 (5): 513– 523. doi : 10.1016/0306-4573(88)90021-0 . hdl : 1813/6721 . S2CID 7725217 . Wu, HC; Luk, RWP; Wong, KF; Kwok, KL (2008). "TF-IDF用語の重みを関連性決定として解釈する". ACM Transactions on Information Systems . 26 (3): 1. doi : 10.1145/1361684.1361686 . hdl : 10397/10130 . S2CID 18303048 .
外部リンクとおすすめの読み物 Gensimは 、ベクトル空間モデリングのためのPythonライブラリであり、tf-idf重み付け機能も備えています。検索エンジンの構造( 2009年3月10日にWayback Machine に アーカイブ済み) Lucene で使用されるtf-idfおよび関連する定義scikit-learn のTfidfTransformerText to Matrix Generator (TMG) は、テキストマイニング (TM) におけるさまざまなタスク、具体的には i) インデックス作成、 ii) 検索、 iii)次元削減 、 iv) クラスタリング、 v) 分類 に使用できる MATLAB ツールボックスです。インデックス作成ステップでは、tf-idf を含むローカルおよびグローバルな重み付け方法を適用できます。 用語頻度の説明用語頻度の説明