
著者プロファイリングとは、与えられた一連のテキストを分析し、文体や内容に基づく特徴に基づいて著者のさまざまな特性を明らかにしたり、著者を特定したりする試みである。分析される特性には、一般的に年齢や性別が含まれるが、最近の研究では、性格特性や職業などの他の特性も検討されている。[ 1 ]
著者プロファイリングは、自動著者識別(AAI)の3つの主要分野の1つであり、他の2つは著者帰属と著者識別です。AAIのプロセスは19世紀末に登場しました。アメリカの独学の物理学者で気象学者のトーマス・コーウィン・メンデンホールは、フランシス・ベーコン、ウィリアム・シェイクスピア、クリストファー・マーロウの作品にこのプロセスを初めて適用しました。メンデンホールは、これら3人の歴史的人物から、単語の長さを調べることによって、彼らの量的文体上の違いを明らかにしようとしました。[ 2 ]
21世紀に入ってから多くの進歩が見られたとはいえ、著者のプロファイリングという課題は、その難しさゆえに依然として未解決の問題である。
テキストの分析を通じて、さまざまな著者プロファイリング技術を適用して著者に関する情報を予測することができます。たとえば、機能語や品詞分析を参照して、著者の性別やテキストの真偽を判断することができます。[ 3 ]
著者プロファイリングのプロセスは通常、以下の手順で行われます。[ 4 ]
著者プロファイリングのための機械学習アルゴリズムは、時間の経過とともにますます複雑化している。著者プロファイリングで使用されるアルゴリズムには、以下のようなものがある。
過去には、著者プロファイリングは書籍や新聞記事などの物理的な文書に限定されていました。著者プロファイリングでは、語彙的特徴や構文的特徴など、著者に帰属するテキスト属性のさまざまな組み合わせが特定され、分析されました。 [ 4 ]著者プロファイリングの先駆的な研究は、ソーシャルメディアやインターネット上の著者プロファイリングへの移行までは、主に単一のジャンルに焦点を当てていました。[ 9 ]コンテンツワードやPOSタグなどの属性は、物理的な文書上の著者プロファイル予測には効果的ですが、デジタルテキスト上の著者プロファイル予測におけるその有効性は主観的であり、分析対象のオンラインコンテンツの種類に依存します。[ 4 ]
技術の進歩に伴い、インターネット上での著者プロファイリングはますます一般的になっています。ソーシャルメディアの投稿、ブログ記事、電子メールなどのデジタルテキストが現在使用されています。[ 4 ]デジタルテキストの分析がマーケティングやビジネスなどの分野にもたらす利点により、研究努力が活発化しています。[ 8 ]デジタルテキストの著者プロファイリングにより、性格[ 8 ] 、収入、職業[ 10 ]など、より幅広い著者特性の予測も可能になりました。
デジタルテキストの著者プロファイリングに最も効果的な属性は、文体と内容の特徴の組み合わせです。[ 4 ]デジタルテキストの著者プロファイリングは、ジャンル横断的な著者プロファイリングに焦点を当てており、1つのジャンルをトレーニングデータに、別のジャンルをテストデータに使用しますが、良好な結果を得るには、両者が比較的類似している必要があります。[ 9 ]
オンラインテキストに対して著者プロファイリング手法を実行する際には、いくつかの問題点がある[ 4 ] 。これらの問題点には以下が含まれる。
20世紀から21世紀にかけてのインターネットの普及は、ソーシャルメディアプラットフォーム、電子メール、ブログなど、ウェブからデータを収集できるようになったことから、著者プロファイリング研究の増加を促しました。著者プロファイリングのタスクでは、ウェブユーザーの年齢、性別、出身地、国籍、心理特性を特定するために、ウェブコンテンツが分析されてきました。得られた情報は、マーケティングやフォレンジックなど、さまざまな用途に活用されています。
人々の日常生活におけるソーシャルメディアの統合が進むにつれ、ソーシャルメディアは著者のプロファイリングのためのテキストデータの豊富な情報源となっています。これは主に、ユーザーが自己表現、交流、個人的なビジネスなどさまざまな目的でコンテンツを頻繁にアップロードおよび共有しているためです。ソーシャルボットもソーシャルメディアプラットフォーム、特にTwitterでよく見られる機能であり、著者のプロファイリングのために分析できるコンテンツを生成します。[ 11 ]異なるプラットフォームには同様のデータが含まれていますが、特定のプラットフォームの形式と構造に応じて異なる機能が含まれている場合もあります。
ソーシャルメディアを著者プロファイリングのデータソースとして使用することには、取得されたデータが常に信頼できる、または正確であるとは限らないため、依然として限界があります。ユーザーは、自分自身について虚偽の情報を提供したり、情報を隠したりすることがあります。[ 12 ]その結果、著者プロファイリングのアルゴリズムのトレーニングは、精度が低いデータによって妨げられる可能性があります。もう 1 つの限界は、ソーシャルメディアのテキストの不規則性です。不規則性の特徴には、スペルミスなどの通常の言語基準からの逸脱、文字を数字に置き換えるなどの非標準化された音訳、略語、ユーザーが作成したフレーズの略語などがあり、著者プロファイリングに課題をもたらす可能性があります。[ 13 ]研究者は、著者プロファイリングのアルゴリズムのトレーニングにおいて、これらの限界を克服する方法を採用しています。[ 13 ]
Facebook は、ソーシャル ネットワーキング サービスとして著者のプロファイリング研究に役立ちます。これは、ソーシャル ネットワークがサイト内でソーシャル アクションのために構築、拡張、使用される方法によるものです。[ 14 ]このようなプロセスでは、ユーザーは著者のプロファイリング研究に使用できる個人的なコンテンツを共有します。テキスト データは、Facebook から、ユーザーの「ステータス アップデート」などの個人的な投稿から著者のプロファイリング用に取得されます。[ 15 ]これらは、著者のプロファイリング用に選択された言語のコーパスを作成するために取得され、コンテンツ ワードのバイリンガルまたはマルチリンガル データベースを作成します。[ 15 ] [ 16 ]その後、著者のプロファイリングに使用できます。
Facebook の文脈では、著者のプロファイリングは主に英語のテキストデータを使用しますが、ローマ ウルドゥー語、アラビア語、ブラジル ポルトガル語、スペイン語などの英語以外の言語も使用します。[ 16 ] [ 11 ] Facebook の著者のプロファイリング研究は主に性別と年齢層の識別を目的としていますが、宗教性、ユーザーの IT バックグラウンド、さらには基本的な感情 (ポール エクマンの定義による)などを予測するための属性を導き出す試みも行われています。[ 15 ] [ 17 ]
Sina Weiboは、アジア言語のテキストを含む数少ないアジアのソーシャルメディアプラットフォームの1つで、著者のプロファイリングのために分析されています。Weiboコンテンツにおける著者のプロファイリングの主な焦点となるコンテンツには、古典中国語の文字、ハッシュタグ、絵文字、顔文字、均一な句読点、ラテン語のシーケンス(テキストの多言語性のため)、さらには詩の形式が含まれます。特に人気のある中国語の表現、品詞タグ、単語の種類も著者のプロファイリングのために追跡されています。[ 18 ]
Weibo コンテンツの著者プロファイリングには、主に中国語と西洋言語の言語的な違いにより、他のソーシャルメディア プラットフォームで使用されるアルゴリズムとは異なるアルゴリズムが必要です。たとえば、中国語の感情は、括弧内にジェスチャーや表情を表す漢字で表されます。たとえば、[哈哈]「笑い」、[泪]「涙」、[偷笑]「くすくす笑い」、[爱你]「愛」、[心]「心」などです。[ 18 ]これは、西洋言語で絵文字に句読点記号を使用することや、Facebook、Instagramなどの他のプラットフォームで Unicode 絵文字を一般的に使用することとは異なります。さらに、西洋の絵文字は約 161 種類ですが、Weibo などのウェブ コンテンツで中国本土で定期的に使用される絵文字は約 2900 種類あります。[ 19 ]これらの違いに対処するため、著者プロファイリングアルゴリズムは中国語の絵文字や言語的特徴に基づいて訓練されています。たとえば、著者プロファイリングアルゴリズムは、英語の言語的特徴(大文字など)を検出するアルゴリズムの代わりに、中国語の形式や感情を表す文体表現を検出するように設計されています。[ 19 ]
他のより人気のあるグローバルなプラットフォームと比較すると、Weibo のテキストは著者のプロファイリングのタスクにはあまり使用されていません。これはおそらく、Weibo が中国本土の中国人人口に集中しており、その使用が主に中国国民に限定されているためです。このプラットフォームで行われた研究では、ボットや機械学習アルゴリズムを使用して著者の年齢と性別を特定しています。データは、分析に協力する参加者の Weibo マイクロブログ投稿から取得され、ユーザーの概念ベースのプロファイルを一定の精度で構築するアルゴリズムのトレーニングに使用されます。[ 18 ]
チャットログは、テキストによる議論を多く含んでいるため、著者のプロファイリングのために研究されてきました。その分析は、社会動向や法医学などの応用研究に貢献しています。チャットログからの著者プロファイリングのデータソースには、 Yahoo!、AIM(ソフトウェア)、WhatsAppなどのプラットフォームがあります。[ 20 ]単一のチャットルームまたは独立したユーザーによって議論されたチャットトピックをリストアップする概念ベースのプロファイルを作成するために、計算システムが考案されています。 [ 21 ]
著者プロファイリングは、ブログ執筆者の年齢、性別、地理的位置などの特性を、さまざまな執筆スタイルに基づいて特定するために使用できます。[ 22 ]これは、匿名ブログの場合に特に役立ちます。コンテンツワードの選択、スタイルベースの特徴、トピックベースの特徴が分析され、著者の特徴が明らかになります。[ 23 ]
一般的に、ブログでよく見られる特徴としては、文章あたりの動詞の分布率が高いことや、代名詞の使用頻度が比較的高いことが挙げられる。動詞、代名詞、その他の品詞の頻度は、著者の文章における感情、性別、年齢をプロファイリングおよび分類するために使用される。[ 24 ]過去に物理的な文書に使用されていたサポートベクターマシンなどの分類モデルを使用した著者プロファイリングもブログでテストされている。しかし、そのパフォーマンスの低さから、ブログには不向きであることが証明されている。[ 22 ]
ブログの著者プロファイリングに効果的な機械学習アルゴリズム[ 22 ]には、以下のものが含まれます。
メールは、一般的なメールプラットフォームのさまざまなセクションに豊富なテキストデータが含まれているため、著者プロファイリングの一貫した焦点となっています。これらのセクションには、送信済み、受信トレイ、スパム、ゴミ箱、アーカイブされたフォルダが含まれます。[ 25 ]メールの著者プロファイリングに対する多言語アプローチには、データソースとして英語、スペイン語、アラビア語のメールなどが含まれています。[ 25 ] [ 12 ]著者プロファイリングを通じて、年齢、性別、地理的出身地、教育レベル、国籍、さらにはビッグファイブ性格特性の神経症傾向、協調性、誠実性、外向性、内向性などの性格の心理測定特性など、メールユーザーの詳細を特定できます。
メールの著者プロファイリングでは、重要なテキストデータのためにコンテンツが処理され、メタデータやその他のハイパーテキストマークアップ言語(HTML)の冗長性などの重要でない機能は除外されます。メールのコンテンツを含む多目的インターネットメール拡張機能(MIME)の重要な部分も分析に含まれます。取得されたデータは、著者テキスト、署名テキスト、広告、引用テキスト、返信行など、コンテンツのさまざまなセクションに解析されることがよくあります。[ 25 ]著者プロファイリングタスクにおけるメールのテキストコンテンツのさらなる分析には、処理される声のトーン、感情、意味、およびその他の言語的特徴の抽出が含まれます。
著者プロファイリングは、テキストの著者の特定の特性を特定する必要があるさまざまな分野で応用されており、法医学やマーケティングなどの分野で重要性が高まっています。[ 26 ]用途に応じて、著者プロファイリングのタスクは、特定する特性、調査対象の著者の数、分析に使用できるテキストの数の点で変化する可能性があります。
その応用範囲は従来、文学作品などの書かれたテキストに限られていたが、コンピュータとインターネットの発展に伴い、オンラインテキストにも拡大した。
法言語学の分野では、著者プロファイリングは、匿名、偽名、または偽造されたテキストの著者の特徴を、著者の言語使用に基づいて特定するために使用されます。法言語学者は、言語分析を通じて、容疑者の動機やイデオロギー、および容疑者の民族性や職業などの他のクラス特性を特定しようとします。これは必ずしも決定的な著者の特定につながるわけではありませんが、このような情報は法執行機関が容疑者の数を絞り込むのに役立ちます。[ 27 ]
ほとんどの場合、法言語学の文脈における著者プロファイリングは、比較対象となるテキストがまったくないか、ごくわずかしかなく、著者を特定できる外部証拠もない単一のテキストの問題を伴います。[ 28 ]法言語学者が分析するテキストの例としては、恐喝の手紙、自白、遺言、自殺予告の手紙、盗作された文章などがあります。[ 29 ]これは、インターネット上で行われるサイバー犯罪の増加に伴い、中年男性と未成年少女の間の性的に露骨なオンラインチャットログなどのオンラインテキストにも広がっています。[ 28 ] [ 30 ]
著者のプロファイリングの使用の最も初期の、そして最もよく知られた例の1つは、1979年に悪名高い誘拐事件に関連した身代金要求の手紙の調査を依頼されたロジャー・シューイによるものです。シューイは誘拐犯の個人語の分析に基づいて、スペルミスと方言から誘拐犯の身元に関する重要な要素、つまり誘拐犯は教養があり、オハイオ州アクロン出身であることを特定することができました。[ 31 ]これは最終的に容疑者の逮捕と自白に成功しました。
しかし、著者のプロファイリング手法は、法言語学者が重要な社会言語学的指標を主観的に特定することに依存しているため、客観性に欠けるという批判がある。文学評論家のドナルド・ウェイン・フォスターが採用したようなこれらの手法は、推測的で完全に個人の主観的経験に基づいているため、経験的に検証することはできないと言われている。[ 32 ]
ソーシャルボットの識別には著者プロファイリングが採用されており、最も一般的なのはTwitterボットです。ソーシャルボットは、商業的、政治的、イデオロギー的な影響力から脅威とみなされており、2016年の米国大統領選挙では、政治的な議論を二極化させ、誤情報や未検証の情報を拡散しました。マーケティングの文脈では、ソーシャルボットは肯定的なレビューを投稿することで製品の人気を人為的に高め、不利なレビューで競合製品の評判を損なうことができます。[ 33 ]したがって、著者プロファイリングの観点からのボット検出は、非常に重要なタスクです。[ 33 ] [ 34 ]
ボットは人間のアカウントのように見えるように作られており、ユーザー名、プロフィール写真、投稿時間などのプロフィール情報によって大部分が識別できます。[ 34 ]しかし、テキストデータのみ(メタデータなし)からボットを識別するタスクははるかに難しく、著者プロファイリング技術が必要です。[ 34 ]これは通常、意味的および構文的特徴に基づく分類タスクを伴います。[ 35 ] [ 36 ]
ボットと性別のプロファイリングのタスクは、デジタルテキストフォレンジックとスタイルメトリクスの一連の科学イベントと共有タスクを主催するPANが2019年に主催した4つの共有タスクの1つでした。[ 33 ]参加チームは大きな成功を収め、英語とスペイン語のツイートのボット検出でそれぞれ95.95%と93.33%という最高の結果を達成しました。[ 35 ]
著者プロファイリングは、ブログ、オンライン製品レビュー、ソーシャルメディアコンテンツの分析に基づいて、自社製品を好む人や好まない人の人口統計を特定できるため、マーケティングの観点からも有用です。 [ 26 ]これは、ほとんどの人が製品レビューを匿名で投稿するため重要です。著者プロファイリングの手法は、ビジネスの専門家がターゲットグループの人口統計に基づいてより情報に基づいた戦略的意思決定を行うのに役立ちます。[ 37 ]さらに、企業は、現在の顧客の人口統計とプロファイルに一致する消費者グループにマーケティングキャンペーンをターゲットにすることができます。[ 38 ]

著者プロファイリングの手法は、伝統的なメディアや文学を研究する際に、様々な著者の文体や執筆内容を特定するために用いられます。文学における著者プロファイリングは、共著の書誌記録に基づいて、著者の社会的ネットワークや文学的影響力を推測するためにも行われます。匿名作品や偽作の場合、この手法を用いて著者を特定したり、同一人物によって書かれた作品を特定したりすることもあります。
文学や伝統的なメディアに関する著者プロファイリング研究の例としては、以下のような研究が挙げられます。[ 39 ] [ 40 ]
著者プロファイリングのもう1つの応用例は、標準属性に基づいて図書館リソースをカタログ化するための戦略を考案することです。[ 42 ]このアプローチでは、著者プロファイリング技術によって、著者の書誌レコードに基づいて図書館リソースが自動的に分類される図書館カタログ化の効率が向上する可能性があります。これは、図書館カタログ化の大部分がまだ手作業で行われていた21世紀初頭には重要な問題でした。
図書館の目録作成に著者プロファイリングを用いる際、研究者はサポートベクターマシンアルゴリズム(SVM)などの機械学習を図書館の自動処理に利用してきました。著者プロファイリングにSVMを用いることで、既存のデータベース内の著者の書誌レコードを識別、追跡、更新し、著者の書誌レコードに示されている文学的内容や専門分野に基づいて著者を特定することができます。この場合、著者プロファイリングは、出版されたメディアの物理的なコピーから得られる著者の社会的構造を利用して図書館のリソースを目録化します。[ 42 ]
著者プロファイリングは、大衆文化で取り上げられてきました。2017年のディスカバリーチャンネルのミニシリーズ「マンハント:ユナボマー」は、ユナボマーをめぐるFBIの捜査をフィクション化したものです。この番組では、犯罪プロファイラーが、ユナボマーが発表したマニフェストや手紙に見られる独特の言い回しを分析し、ユナボマーのアイデンティティを決定づける特徴を特定します。この番組は、1996年に実際のユナボマー犯人を逮捕する上で著者プロファイリングが極めて重要であったことから、犯罪捜査における著者プロファイリングの重要性を強調しました。[ 43 ]