人工知能において、大規模マルチタスク言語理解の測定( MMLU ) は、大規模言語モデルの機能を評価するベンチマークです。
ベンチマーク
数学、哲学、法律、医学など57の学術分野にわたる約16,000の多肢選択式問題で構成されています。これは、大規模言語モデルの機能を比較するための最も一般的に使用されるベンチマークの1つであり、2024年7月時点で1億回以上ダウンロードされています。[1] [2]
MMLUは、ダン・ヘンドリックスと研究者チームによって2020年にリリースされ[3] 、新しい言語モデルが人間よりも優れた精度を達成していた一般言語理解評価(GLUE)などの当時の既存のベンチマークよりも難しいように設計されていました。 MMLUのリリース時点では、ほとんどの既存の言語モデルはランダムチャンスのレベル(25%)程度のパフォーマンスを発揮し、最高のパフォーマンスを発揮したGPT-3モデルは43.9%の精度を達成しました。[3] MMLUの開発者は、人間のドメイン専門家は約89.8%の精度を達成すると推定しています。[3] 2024年の時点で、o1、Gemini、Claude 3などの最も強力な言語モデルのいくつかは、約90%のスコアを達成すると報告されています。[4] [5]
ランダムに抽出された3,000の質問に対する専門家のレビューでは、9%以上の質問が間違っている(質問が明確に定義されていないか、与えられた回答が間違っている)ことが判明しており、これは90%が基本的に達成可能な最高スコアであることを示唆しています。[6]
例
以下の例はそれぞれ「抽象代数」と「国際法」の課題から抜粋したものです。[3]正解は太字で示されています。
フィールド 内にあるすべてのものを検索します。
(A) 0 (B) 1 (C) 2 (D) 3
国際人権規約における拷問の定義に対する留保は、現代の実践において受け入れられるでしょうか?
(A) 留保国の法律が異なる定義を採用している場合、
これは受け入れられる留保である (B) これは、自由権規約の趣旨と目的に反するため、
受け入れられない留保である (C) これは、自由権規約における拷問の定義が国際慣習法と一致しているため、受け入れられない留保である
(D) これは、一般国際法の下では、国家が条約に留保を付す権利を有するため、受け入れられる留保である
リーダーボード
参考文献
- ^ ケビン・ルース(2024年4月15日)。「AIには測定の問題がある」ニューヨーク・タイムズ。
- ^ 「MMLUデータセット」。HuggingFace。2024年7月24日。
- ^ abcd Hendrycks, Dan; Burns, Collin; Kossen, Andy; Steinhardt, Jacob; Mishkin, Pavel; Gimpel, Kevin; Zhu, Mark (2020). 「大規模なマルチタスク言語理解の測定」。arXiv : 2009.03300 [ cs.CY]。
- ^ ab OpenAI o1 システムカード。OpenAI。p. 33。2024年9月13日閲覧。
- ^ 「MMLU でのマルチタスク言語理解 | リーダーボード」。Papers with Code。2024年 10 月 10 日閲覧。
- ^ Gema, Aryo Pradipta; Leang, Joshua Ong Jun; Hong, Giwon; Devoto, Alessio; Mancino, Alberto Carlo Maria; Saxena, Rohit; He, Xuanli; Zhao, Yu; Du, Xiaotang (2024-06-07). 「MMLUはもう終わりか?」arXiv : 2406.04127 [cs.CL].
