
Google Flu Trends ( GFT ) は、Googleが運営するウェブ サービスでした。29か国以上でインフルエンザの活動状況を推定していました。Google検索クエリを集約することで、インフルエンザの活動状況について正確な予測を試みました。このプロジェクトは、インフルエンザの流行を予測するために、2008 年に Google.org によって初めて開始されました。[ 1 ]
Google Flu Trendsは2015年8月9日に最新の推定値の公開を停止しました。過去の推定値は引き続きダウンロード可能で、最新のデータは明示された研究目的のために提供されています。[ 2 ]
Google Flu Trendsの狙いは、数百万人のユーザーのオンライン上の健康追跡行動をモニタリングすることで、収集された膨大な数のGoogle検索クエリを分析し、ある集団におけるインフルエンザ様疾患の発生状況を明らかにすることでした。Google Flu Trendsは、これらの結果を該当地域の過去のインフルエンザ活動の基準値と比較し、活動レベルを「最小限」「低」「中程度」「高」「激しい」のいずれかで報告します。これらの推定値は、国レベルおよび地域レベルの保健機関が収集した従来の監視データと概ね一致しています。
Roni Zeiger はGoogle Flu Trends の開発に協力しました。[ 3 ]
Google Flu Trendsは、インフルエンザの流行傾向に関する情報を収集するために、以下の方法を使用していると説明されています。[ 4 ] [ 5 ]
まず、2003年から2008年にかけて米国で毎週入力された約5000万件の一般的な検索クエリについて、時系列データを算出します。各クエリの時系列データは州ごとに個別に算出され、各クエリ数をその州の全クエリ数で割ることによって正規化され、分数に変換されます。各検索に関連付けられたIPアドレスを特定することで、そのクエリが入力された州を特定できます。
インフルエンザ様疾患(ILI)による医師の診察の対数オッズと、ILI関連の検索クエリの対数オッズを計算するために、線形モデルが使用されます。
PはILI医師受診率、Qは前のステップで計算されたILI関連の問い合わせ割合です。β0は切片、β1は係数、εは誤差項です。[ 6 ]
5,000万件のクエリそれぞれについて、Qとしてテストを行い、単一のクエリから計算された結果が、米国疾病予防管理センター(CDC)から入手した実際の過去のインフルエンザ様疾患(ILI)データと一致するかどうかを確認します。このプロセスにより、線形モデルを使用した場合にCDCのILIデータを最も正確に予測できる上位クエリのリストが作成されます。次に、上位45件のクエリが選択されます。これは、これらのクエリをまとめて集計すると、過去のデータに最も正確に適合するためです。上位45件のILI関連クエリの合計を使用して、線形モデルを2003年から2007年までの週ごとのILIデータに適合させ、係数を取得します。最後に、訓練済みのモデルを使用して、米国全土のインフルエンザの流行を予測します。
このアルゴリズムはその後、正確性に関する懸念を受けてGoogleによって改訂され、その結果を再現しようとする試みから、アルゴリズム開発者が「特定された実際の検索語を隠す必要性を暗黙のうちに感じていた」ことが示唆されている。[ 7 ]
Google Flu Trends は、検索を実行した個人を特定することなく、何百万もの匿名の検索クエリを集計するだけでプライバシー侵害を回避しようとしています。[ 1 ] [ 8 ]検索ログにはユーザーの IP アドレスが含まれており、検索クエリが最初に送信された地域を追跡するために使用できます。Google はコンピューター上でプログラムを実行してデータにアクセスして計算するため、プロセスに人間は関与していません。Google はまた、検索ログの IP アドレスを 9 か月後に匿名化するポリシーを実施しました。[ 9 ]
しかし、Google Flu Trendsは一部のプライバシー団体からプライバシーに関する懸念を引き起こしている。電子プライバシー情報センターと患者プライバシー権は、2008年に当時のGoogleのCEOであったエリック・シュミットに書簡を送った。 [ 10 ]彼らは、ユーザー生成データの使用が公衆衛生の取り組みを大きく支援できることを認めつつも、「Googleの反対にもかかわらず、裁判所の命令や大統領の権限によって、ユーザー固有の調査が強制される可能性がある」という懸念を表明した。
GFTの当初の動機は、病気の活動を早期に特定し、迅速に対応することで、季節性インフルエンザやパンデミックインフルエンザの影響を軽減できると考えられたことでした。ある報告によると、Google Flu Trendsは、CDC(疾病管理予防センター)が報告する最大10日前に、インフルエンザの地域的な流行を予測することができました。[ 11 ]
2009年のインフルエンザパンデミックでは、Google Flu Trendsが米国におけるインフルエンザに関する情報を追跡しました。[ 12 ] 2010年2月、CDCは米国中部大西洋岸地域でインフルエンザの症例が急増していることを確認しました。しかし、インフルエンザの症状に関する検索クエリのGoogleデータは、CDCの報告書が発表される2週間前に同じ急増を示していました。
「警告が早ければ早いほど、予防と制御の対策を早く講じることができ、インフルエンザの症例を防ぐことができる」と、 CDCのインフルエンザ部門の監視責任者であるリン・フィネリ博士は述べた。「毎年、国民の5~20%がインフルエンザに感染し、平均して約3万6000人が死亡している。」[ 11 ]
Google Flu Trendsは、トレンドを特定し予測を計算するために使用できる集合知の一例です。検索エンジンによって蓄積されたデータは、検索クエリが人々のフィルターされていない欲求とニーズを表しているため、非常に洞察に富んでいます。「これは、Googleのユーザーによって意図せず作成されたデータを使用して、そうでなければ見えない世界のパターンを見るための非常に賢い方法のように思えます」と、MITスローン経営大学院の教授であるトーマス・W・マローンは述べています。「集合知で可能なことのほんの表面をなぞっているだけだと思います。」[ 11 ]
Googleの最初の論文では、Google Flu Trendsの予測はCDCのデータと比較して97%正確であると述べていました。[ 4 ]しかし、その後の報告では、Google Flu Trendsの予測は特に2つの注目度の高いケースで非常に不正確であったと主張されています。Google Flu Trendsは2009年の春のパンデミックを予測できず[ 13 ]、2011年から2013年の期間では一貫して相対的なインフルエンザ発生率を過大評価し[ 7 ] 、 2012年のインフルエンザシーズンのある期間における医師の診察回数をCDCが記録した数の2倍と予測しました。[ 7 ] [ 14 ] International Journal of Forecastingに掲載された2022年の研究(解説付き)[ 15 ]では、Google Flu Trendsは、予測されたインフルエンザ発生率が最近観測されたインフルエンザ発生率と等しくなる、いわゆる「ナイーブ」予測の一例である最近性ヒューリスティックに劣っていることがわかりました。 2007年3月18日から2015年8月9日までの全週(Google Flu Trendsの予測が利用可能な期間)において、Google Flu Trendsの平均絶対誤差は0.38、最近性ヒューリスティックの平均絶対誤差は0.20でした(いずれもパーセントポイント)。単一の予測変数(直近に観測されたインフルエンザ発生率)を用いた線形回帰の平均絶対誤差も0.20であり、ランダム予測のベンチマークは1.80でした。
問題の原因の一つは、インフルエンザ関連のGoogle検索を行う人々がインフルエンザの診断方法についてほとんど知らない可能性があることです。インフルエンザやインフルエンザの症状に関する検索は、インフルエンザに似ているが実際にはインフルエンザではない病気の症状を調べている可能性があります。[ 16 ] さらに、「発熱」や「咳」など、Googleが追跡しているとされる検索語の分析や、時間の経過に伴う検索アルゴリズムの変更の影響により、Googleの予測の意味について懸念が生じています。[ 7 ] 2013年秋、Googleは、ニュースでインフルエンザが大きく取り上げられたことによる検索数の増加を補償しようと試み始めました。これは、以前は結果を歪めていたことが判明しました。[ 17 ] しかし、ある分析では、「GFTとCDCの遅延データを組み合わせ、GFTを動的に再調整することで、GFTまたはCDC単独のパフォーマンスを大幅に改善できる」と結論付けています。[ 7 ]後期の研究では、Google検索データを使用することで推定値を改善できることが実証されており、CDCデータのみを使用したモデルで見られる誤差を最大52.7パーセント削減できる。[ 18 ]
研究者らは、元のGFTモデルを再評価することで、このモデルがさまざまな健康状態に関するクエリを集約していることを発見しました。これは、ILI率の過大予測につながる可能性があります。同じ研究で、ILIモデリングのためのより高度な線形および非線形のより優れたアプローチが提案されています。[ 19 ]
しかし、追跡調査により、インフルエンザ様疾患の発生率と元のGFTモデルの出力の両方でトレーニングされたランダムフォレスト回帰モデルを使用することで、GFTの精度を大幅に向上させることができました。[ 20 ]
オスナブリュック大学認知科学研究所によるインフルエンザ予測プロジェクト[ 21 ]のような類似プロジェクトは、 TwitterなどのソーシャルメディアデータとCDCデータ、および病気の空間的および時間的拡散を推測する構造モデル[ 22 ]を組み合わせることで、基本的なアイデアを発展させています。