統計的にありそうもないフレーズ(SIP )は、ある文書(または文書のコレクション)の中で、より大きなコーパスよりも頻繁に出現するフレーズまたは単語セットです。[1] [2] [3] Amazon.comは、特定の書籍または章のキーワードを決定する際にこの概念を使用しています。書籍または章のキーワードはそのセクション内で不釣り合いに出現する可能性が高いためです。[4] [5] Christian Rudderも、オンラインデートプロフィールとTwitterの投稿のデータを使用してこの概念を使用し、著書「Dataclysm」で特定の人種または性別に最も特徴的なフレーズを決定しました。[6] 2つまたは3つの単語(形容詞、形容詞、名詞または副詞、副詞、動詞)の言語密度を持つSIPは、著者の態度、前提または結論を読者に伝えたり、重要なアイデアを表現したりします。
SIP のもう 1 つの用途は、盗作の検出ツールとしての使用です。(ほぼ) ユニークな単語の組み合わせをオンラインで検索すると、公開されたテキストにその単語が出現した場合、検索によってその場所が特定されます。この方法では、公開され、オンラインでデジタル化されたテキストのみをチェックします。
たとえば、学生の提出物に「庭園スタイル、デザインの不規則性を称賛する」というフレーズが含まれていた場合、Google.com を使用して検索すると、イギリスの政治家でエッセイストのウィリアム・テンプル卿に関するオリジナルの Wikipedia 記事が表示されます。
例
コンピュータに関する文書では、最も一般的な単語は「the」である可能性が高いですが、「the」は英語で最も一般的に使用される単語であるため、どの文書でも「the」が非常に頻繁に使用される可能性があります。ただし、「explicit Boolean algorithm」などのフレーズは、英語での平均頻度よりもはるかに高い頻度で文書に出現する可能性があります。したがって、このフレーズはどの文書にも出現する可能性は低いですが、特定の文書では出現しています。「Explicit Boolean algorithm」は統計的に起こりにくいフレーズです。
ダーウィンの『種の起源』の統計的にありそうもないフレーズとしては、温帯産、属の派生、過渡的段階、未知の祖先、化石層、家畜種、改変された子孫、疑わしい形態、近縁形態、有益な変異、非常に遠い、過渡的段階、非常に異なる種、雑種の子孫などが挙げられます。[7]
参照
- コロケーション– 偶然に予想されるよりも頻繁に共起する単語の列
- Googlewhack – Google によってインデックスされた、単一のウェブページ上で出現する 2 つの単語
- tf-idf – 情報検索やテキストマイニングで使用される統計
- 複雑に特定された情報- 「インテリジェントデザイン」理論を主張するために使われる概念
参考文献
- ^ 「SIPping Wikipedia」(PDF) . Courses.cms.caltech.edu . 2017年1月1日閲覧。
- ^ Jonathan Bailey (2012 年 7 月 3 日)。「統計的にあり得ないフレーズはどのくらい長くすべきか?」今日の剽窃。
- ^ Errami, Mounir; Sun, Zhaohui; George, Angela C.; Long, Tara C.; Skinner, Michael A.; Wren, Jonathan D.; Garner, Harold R. (2010 年 6 月 1 日). 「統計的にありそうにないフレーズを使用して重複コンテンツを特定する」. Bioinformatics . 26 (11): 1453–1457. doi :10.1093/bioinformatics/btq146. PMC 2872002. PMID 20472545 – bioinformatics.oxfordjournals.org 経由.
- ^ 「統計的にあり得ないフレーズとは何か?」Amazon.com 。 2007年12月18日閲覧。
- ^ Weeks, Linton (2005年8月30日). 「Amazonの重要統計が書籍の売れ行きを明らかに」ワシントンポスト. 2015年9月8日閲覧。
- ^ ラダー、クリスチャン(2014)。データクライズム:誰も見ていないと思うときの私たちは誰なのか。ニューヨーク:クラウンパブリッシャー。ISBN 978-0-385-34737-2。
- ^ 社会学的にあり得ないフレーズ Crooked Timber 2005年4月
