大規模マルチタスク言語理解の測定(MMLU)は、大規模言語モデルの能力を評価するための一般的なベンチマークです。これは、MMLU-Pro [ 1 ]、MMMLU [ 2 ]、MMLU-Redux [ 3 ]など、他のいくつかのバージョンや派生版に影響を与えました。
MMLUは15,908の多肢選択式問題で構成されており、そのうち1,540問はモデルの最適な設定(温度、バッチサイズ、学習率)を選択および評価するために使用されます。問題は、非常に複雑なSTEM分野や国際法から栄養学や宗教まで、57の分野に及びます。これは、大規模言語モデルの能力を比較するための最も一般的に使用されるベンチマークの1つであり、 2024年7月時点で1億回以上ダウンロードされています。 [ 4 ] [ 5 ]
このベンチマークは、ダン・ヘンドリックスと研究者チームによって 2020年9月7日に公開されました。これは、モデルが簡単なテストで人間を上回るようになったため、当時存在していた一般言語理解評価(GLUE)などのベンチマークよりも難易度が高くなるように意図的に作られました。MMLUが公開されたとき、既存の言語モデルのほとんどはランダムな偶然(25%)に近いスコアでした。最も性能が高かったモデルであるGPT-3 175Bは、43.9%の精度を達成しました。MMLUの作成者は、人間のドメインエキスパートが約89.8%の精度を達成すると推定しました。[ 4 ] 2024年半ばまでに、 Claude 3.5 Sonnet、GPT-4o、Llama 3.1 405Bなどの強力な言語モデルの大部分は、一貫して88%を達成しました。[ 6 ] [ 7 ] [ 8 ] 2025年現在、MMLUはより難しい代替手段を優先して部分的に段階的に廃止されています。
2024年6月5日、専門家らはベンチマークの5,700問の手動分析の詳細を記した論文を発表し、このベンチマークに非常に多くの正解エラーが含まれていることを明らかにした。例えば、「ウイルス学」サブセットの質問の57%は、正解が複数ある(4%)、質問が不明瞭(14%)、または完全に間違った回答(33%)などのエラーが含まれているとマークされた。全体として、MMLUの質問の6.5%にエラーが含まれていると推定され、達成可能な最大スコアが100%を大幅に下回っていることを示唆している。[ 9 ]データ汚染もこのベンチマークの妥当性に対する重大な脅威となった。企業は質問と回答をモデルのトレーニングデータに簡単に含めることができ、事実上、ベンチマークを無効にしてしまう可能性がある。[ 10 ]
以下の例は、それぞれ「抽象代数学」、「国際法」、「専門医療」の課題から引用したものです。[ 4 ]正解は太字で示されています。
質問1:
すべて検索でそのためはフィールドです。
(A) 0 │ (B) 1 │ (C) 2 │ (D) 3
質問2:
市民的及び政治的権利に関する国際規約(ICCPR)における拷問の定義に留保を設けることは、現代の実践において容認されるだろうか?
(A)留保国の国内法が異なる定義を採用している場合、これは許容される留保である。(B)これは国際人権規約の目的と趣旨に反するため、許容されない留保である。(C)これは国際人権規約における拷問の定義が慣習国際法と一致しているため、許容されない留保である。(D)これは一般国際法の下で国家は条約に留保を付す権利を有するため、許容される留保である。
質問3:
33歳の男性が甲状腺癌のため根治的甲状腺切除術を受けた。手術中、中等度の出血のため、頸部左側の複数の血管を結紮する必要が生じた。術後、血清検査ではカルシウム濃度7.5 mg/dL、アルブミン濃度4 g/dL、副甲状腺ホルモン濃度200 pg/mLが認められた。この患者の所見は、以下のどの血管の損傷によって引き起こされたか?