モデル評価および脅威研究( METR ) (ミーター) は、カリフォルニア州バークレーに拠点を置く非営利の研究機関です。[ 1 ]一部の研究者が社会に壊滅的なリスクをもたらす可能性があると主張する、長期的なエージェントタスクを実行する最先端のAIモデルの能力を評価しています。[ 2 ] [ 3 ] METR は、主要な AI 企業と協力して、展開前のモデル評価を実施し、OpenAIのo3、o4-mini、GPT-4o、GPT-4.5、およびAnthropicのClaudeモデルを含むシステム カードに貢献してきました。[ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ]
METR のCEO兼創設者は、 OpenAIの元アライメント研究者で、2022 年に退職してPaul ChristianoのAlignment Research Centerの評価部門である ARC Evals を設立した Beth Barnes です。2023 年 12 月に ARC Evals は独立した501(c)(3)非営利団体として分離され、METR と改名されました。[ 8 ] [ 9 ] [ 10 ]
METRの研究の大部分は、AIシステムがAIシステム自体の研究開発を行う能力を評価することに焦点を当てており、その中にはAIが「研究工学の課題を解決し、AIの研究開発を加速できるかどうか」をテストするために設計されたベンチマークであるRE-Benchも含まれる。[ 11 ] [ 12 ]

2025年3月、METRは、最先端のAIモデルが完了できるソフトウェアエンジニアリングタスクの長さが、2019年から2024年の間に約7ヶ月で倍増したことを指摘する論文を発表した。[ 14 ]
2026年1月、METRは時間軸推定モデルの新しいバージョン(Time Horizon 1.1)をリリースした。更新されたモデルによると、AI機能の進歩率は2023年以降増加しており、2023年以降の倍増時間は130.8日(4.3ヶ月)と推定されている。したがって、進歩は20%速くなっていると推定される。[ 15 ]
METRは、分析対象のAIモデルに対して「タスク完了時間範囲」を公開しています。これは、「AIエージェントが一定の信頼性レベルで成功すると予測されるタスク期間(人間の専門家による完了時間で測定)」を測定するものです。[ 16 ]この指標は2つのバリアントで報告されています。50%時間範囲は、AIモデルが50%の確率で成功すると推定されるタスク期間を示し、80%時間範囲は、AIモデルが80%の確率で成功すると推定されるタスク期間を示します。[ 16 ] METRは、基盤となるモデルの2つのバージョン、Time Horizon 1.0とTime Horizon 1.1を公開しており、後者は2026年1月に導入されました。[ 16 ]
2026年5月9日現在 最もパフォーマンスの高いモデルはClaude Mythosで、50% の時間範囲は少なくとも 16 時間、80% の時間範囲は 3 時間 6 分である可能性が高い。[ 16 ] METR は「現在のタスク スイートでは 16 時間を超える測定値は信頼できない」と指摘している。次の表は、各モデルのリリース日順に時間範囲の推定値を示している。[ 16 ] [ 17 ]