スポーツ賭博で使用される方法
統計的サッカー予測は、スポーツ賭博で使用される方法で、統計ツールを使用してサッカーの 試合の結果を予測します。統計的試合予測の目標は、サッカーの試合の結果のオッズを設定するために統計的試合予測を使用するブックメーカーの予測を上回ることです[要出典] [疑わしい-議論]。
最も広く使用されている統計的予測手法はランキングです。サッカーランキングシステムは、過去の試合結果に基づいて各チームにランクを割り当て、最も強いチームに最高ランクが割り当てられます。対戦相手のランクを比較することで、試合の結果を予測できます。サッカーランキングシステムはいくつかありますが、よく知られているものとしては、FIFAワールドランキングやワールドフットボールイロレーティングがあります。
ランキングシステムに基づいたサッカーの試合予測には、主に 3 つの欠点があります。
- チームに割り当てられたランクは、攻撃力と防御力の強さを区別しません。
- 順位はサッカーチームのスキルの変化を考慮しない累積平均です。
- ランキングシステムの主な目的は、サッカーの試合の結果を予測することではなく、チームを平均的な強さに応じて分類することです。
サッカーの予測に対する別のアプローチは、評価システムとして知られています。ランキングはチームの順位のみを参照しますが、評価システムでは各チームに連続的にスケールされた強さの指標を割り当てます。さらに、評価はチームだけでなく、攻撃力や守備力、ホームフィールドアドバンテージ、さらには各チームプレーヤーのスキルに割り当てることもできます(Stern [1]による)。
歴史
サッカーの予測のための統計モデルに関する出版物は 90 年代から登場し始めましたが、最初のモデルはそれよりずっと以前に Moroney [2]によって提案されました。Moroney は 1956 年にサッカーの試合結果に関する最初の統計分析を発表しました。彼の分析によると、ポアソン分布と負の二項分布の両方がサッカーの試合結果に適切に適合しました。サッカーの試合中の選手間のボールパスの系列は、1968 年に Reep と Benjamin [3]によって負の二項分布を使用してうまく分析されました。彼らは 1971 年にこの方法を改良し、1974 年に Hill [4]はサッカーの試合結果はある程度予測可能であり、単なる偶然の問題ではないことを示しました。
異なるスキルを持つチーム間のサッカーの試合結果を予測する最初のモデルは、1982年にマイケル・マーハー[5]によって提案されました。彼のモデルによると、試合中に相手が獲得するゴールはポアソン分布から抽出されます。モデルパラメータは、ホームフィールドアドバンテージ要因によって調整された攻撃スキルと防御スキルの差によって定義されます。ホームフィールドアドバンテージ要因をモデル化する方法は、1992年にカーネヤとキャロン[6]による記事でまとめられました。チーム強さの時間依存性は、1999年にクノール=ヘルド[7]によって分析されました。彼は再帰ベイズ推定を使用してサッカーチームを評価しました。この方法は、一般的な平均統計に基づくサッカー予測と比較して、より現実的でした。
すべての予測方法は、トーナメントの種類、時間依存性、回帰アルゴリズムによって分類できます。サッカーの予測方法は、ラウンドロビントーナメントとノックアウトトーナメントによって異なります。ノックアウトトーナメントの方法は、Diego Kuonenの記事にまとめられています。[8]
以下の表は、ラウンドロビントーナメントに関連する方式をまとめたものです。
時間に依存しない最小二乗評価
この方法は、トーナメントの各チームに連続的にスケールされた評価値を割り当て、最強のチームが最高の評価を得ることを目的としています。この方法は、ライバル チームに割り当てられる評価が各試合の結果に比例するという仮定に基づいています。
チーム A、B、C、D がトーナメントで対戦しており、試合結果が次のとおりであるとします。
チーム A、B、C、D のそれぞれの評価 、 、 は不明ですが、試合# 1 の結果はチーム A と B のランクの差に比例すると仮定できます。 このように、 は スコア差に対応し、 はノイズ観測値です。トーナメントのすべての試合について、同じ仮定を行うことができます。








選択行列Xを導入することで、上記の式を簡潔な形で書き直すことができます。

選択マトリックスのエントリは 1、0、-1 のいずれかで、1 はホーム チーム、-1 はアウェイ チームに対応します。
![{\displaystyle {\begin{matrix}\mathbf {y} =\left[{\begin{matrix}2\\1\\-3\\2\\2\\end{matrix}}\right],&\mathbf {X} =\left[{\begin{matrix}1&-1&0&0\\0&0&1&-1\\0&-1&0&1\\1&0&0&-1\\0&1&-1&0\\\end{matrix}}\right],&\mathbf {r} =\left[{\begin{matrix}r_{A}\\r_{B}\\r_{C}\\r_{D}\\\end{matrix}}\right],&\mathbf {e} =\left[{\begin{matrix}\varepsilon _{1}\\\varepsilon _{2}\\\varepsilon _{3}\\\varepsilon _{4}\\\varepsilon _{5}\\\end{matrix}}\right]\\\end{matrix}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/2fec02d293d82d3a69ef23ff598bca5a2bd0c01d)
行列がフルランクの場合、システムの代数解は最小二乗法で見つけることができます。


そうでない場合は、ムーア・ペンローズ擬似逆行列を使用して次の式を得ることができます。

最終的な評価パラメータは、この場合、最も強いチームの評価が最も高くなります。標準的なランキング システムと比較したこの評価方法の利点は、数字が継続的にスケーリングされ、チームの強さの正確な違いが定義されることです。
![{\displaystyle \mathbf {r} =[1.625,\ 0.75,\ -0.875,\ -1.5]^{T}.}](https://wikimedia.org/api/rest_v1/media/math/render/svg/dcd66cd44613102374b86046049853cc6794e765)
時間に依存しないポアソン回帰
このモデル(Maher [5])によれば、チームiがチームjと対戦する試合で得点されたゴールがとである
場合、次のようになります。


および は、平均値がおよび である独立したランダム変数です。したがって、ホームチームが x ゴールを決め、アウェイチームが y ゴールを決める結合確率は、2 つの独立した確率の積になります。




一方、 Kuonen [8]とLee [9]によると、およびの一般化対数線形モデルは次のように定義されます。および、ここで、はそれぞれ攻撃力と守備力、ホームフィールドアドバンテージを指します。およびは、シーズン中にホームチームとアウェイチームが獲得したゴールの平均を表す補正係数です。







C がシーズンに参加するチーム数、N がこれまで行われた試合数を表すと仮定すると、チームの強さは、およびに関して負の対数尤度関数を最小化することで推定できます。



と が既知であると仮定すると、負の対数尤度を最小化するチームの攻撃力と守備力、およびホームグラウンドの優位性は、期待値最大化によって推定できます。





このモデルの改良は、マーク・ディクソン(統計学者)とスチュアート・コールズによって提案されました。[10]彼らは、独立したポアソンモデルが成り立たない、0-0、1-0、0-1、1-1の低スコアの相関係数を発明しました。ディミトリス・カーリスとイオアニス・ンツォウフラス[11]は、時間に依存しないスケラム分布モデルを構築しました。スコアの分布に適合するポアソンモデルとは異なり、スケラムモデルはホームとアウェイのスコアの差に適合します。
時間依存マルコフ連鎖モンテカルロ
一方、統計モデルでは、パラメータを正確に推定するために多数の観測値が必要です。また、シーズン中に十分な観測値が得られない場合(通常はそうなります)、平均統計値を使用するのが合理的です。一方、チームのスキルはシーズン中に変化し、モデルパラメータが時間に依存することはよく知られています。マーク・ディクソン(統計学者)とコールズ[10]は、最新の試合結果に大きな重みを割り当てることでこのトレードオフを解決しようとしました。ルーとサルベセン[12]は、マルコフ連鎖モデルを使用して新しい時間依存の評価方法を導入しました。
彼らは、上記の一般化線形モデルをおよびについて修正することを提案しました。



はチーム i と j の強さの差に対応します。このパラメータは、対戦チームの強さを過小評価することによって引き起こされる心理的影響を表します。


モデルによれば、チーム A の攻撃力は、時間 に対する標準的なブラウン運動方程式で記述できます。




ここで、およびはそれぞれ記憶喪失率と以前の攻撃の分散を指します。


このモデルは次の仮定に基づいています:

トーナメントで 3 つのチーム A、B、C が対戦し、試合が次の順序で行われると仮定します: : AB; : AC; : BC、結合確率密度は次のように表すことができます:




この場合、パラメータの解析的推定は困難であるため、モデルのパラメータを推定するために
モンテカルロ法が適用されます。
他のスポーツでの使用
サッカーに使用されるモデルは、ゴール(ポイント)の数え方が同じ他のスポーツ、つまりアイスホッケー、水球、フィールドホッケー、フロアボールなどに使用できます。Marek、Ťoupal、Šedivá(2014)[13]は、Maher(1982)、 [5] DixonとColes(1997)、[10]などのサッカーにモデルを使用した研究を基にしています。彼らはアイスホッケー用に4つのモデルを導入しました。
- 二重ポアソン分布モデル(Maher(1982) [5]と同じ)、
- ランダム変数間の負の相関を許容する二変量ポアソン分布の一般化を使用する二変量ポアソン分布モデル(この分布はFamoye(2010)[14]で導入されました)。
- 以前の2つのモデル(DixonとColes(1997)[10]に触発されたもの)の対角膨張バージョンでは、0:0、1:1、2:2、3:3、4:4、および5:5の同点の確率が追加のパラメータを使用してモデル化されます。
4 つのモデルすべてにおいて、推定の過程で古い情報 (結果) は無視されます。モデルは、1999/2000 シーズンから 2011/2012 シーズンまでのチェコ共和国の最高レベルのアイス ホッケー リーグであるCzech Extraligaで実証されています。結果は、ブックメーカーに対する架空の賭けに効果的に使用されています。
参考文献
- ^ Stern Hal. (1995)大学フットボールのナンバー 1 は誰か?...そしてどうやって決めるのか? Chance、夏、7-14。
- ^ Moroney MJ (1956) Facts from figures . 第3版、ペンギン社、ロンドン。
- ^ Reep C. Benjamin B. (1968) 「サッカーにおけるスキルとチャンス」 Journal of the Royal Statistical Society、シリーズA、131、581-585。
- ^ Hill ID (1974)、「アソシエーションフットボールと統計的推論」応用統計学、23、203-208。
- ^ abcd Maher MJ (1982)、「アソシエーションフットボールスコアのモデリング」Statistica Neerlandica、36、109-118
- ^ Caurneya KSとCarron AV(1992)スポーツ競技におけるホームアドバンテージ:文献レビュー。スポーツと運動生理学ジャーナル、14、13-27。
- ^ Knorr-Held, Leonhard (1997)スポーツチームのダイナミック評価(1999 年改訂)。Collaborative Research Center 386、ディスカッションペーパー 98
- ^ ab Diego Kuonen (1996)ノックアウトサッカートーナメントの統計モデル
- ^ Lee AJ (1997)プレミアリーグのスコアのモデリング: マンチェスターユナイテッドは本当に最強か? Chance、10、15-19
- ^ abcd Mark J. Dixon と Coles SG (1997) 「サッカーのスコアとサッカー賭博市場の非効率性のモデル化」、応用統計学、第 46 巻、第 2 号、265-280
- ^ ディミトリス・カーリスとイオアニス・ンツォウフラス (2007)サッカーの結果のベイジアンモデリング:ゴール差に対するスケラム分布の使用
- ^ Rue H. および Salvesen Ø. (1999)リーグにおけるサッカー試合の予測と回顧的分析。技術レポート。ノルウェー科学技術大学、トロンハイム。
- ^ マレク、パトリス;シェディバ、ブランカ。ウパル、トマーシュ (2014)。 「アイスホッケーの試合結果のモデリングと予測」。スポーツにおける定量分析のジャーナル。10 (3): 357–365。土井:10.1515/jqas-2013-0129。ISSN 1559-0410。S2CID 199575279 – Research Gate 経由。
- ^ Famoye, F (2010). 「新しい二変量一般化ポアソン分布」. Statistica Neerlandica . 64 : 112–124 . doi :10.1111/j.1467-9574.2009.00446.x. S2CID 120921695.