AIモデルの性能を横断的に比較するベンチマークサイトを運営するArtificial Analysisは、看板指標である「Artificial Analysis Intelligence Index」を最新版のv4.2に改訂したと公式ブログで発表した。ITmedia AI+などの報道によると、より複雑で実務に近いタスクの評価を増やすとともに、外部に一切公開していない「非公開(held-out)」の評価データセットの比率を拡大したことが今回の改訂の柱だという。
具体的には、指数全体に占める非公開データの比重をv4.1の20%からv4.2では40%へと倍増させた。非公開データには、Artificial Analysis自身が開発した知識労働評価「AA-Briefcase」や「AA-Omniscience」、物理学分野の難問「CritPt」の解答セットなどが含まれる。あわせて、知識労働タスクを測る「AA-Briefcase」と、Surge AIが開発したPDF読解力評価「GDP.pdf」の2種類を新規に追加した。
今回の改訂の背景には、9月上旬に公開されたOpenAIの新モデル「GPT-6 Astra」のスコアリングを巡って外部から懐疑的な見方が示されたことがあるとされる。非公開データの比率を高めることで、モデル開発企業が特定のベンチマークの傾向を学習して見かけ上のスコアを引き上げる「ゲーミング」を防ぐ狙いだ。Artificial Analysisは、次期版となる「v5」ではさらに非公開データの比率を高める方針も明らかにしている。
同ランキングでは、Anthropicの「Claude Fable 5.1」が首位を維持し、OpenAIの「GPT-6 Astra」が前世代の「GPT-5.6 Sol」からスコアを4ポイント伸ばして僅差の2位につけているという。第三者機関による継続的な指標見直しは、各社が公表する自社ベンチマークだけでは見えにくいモデル性能の実態を把握するうえで、引き続き重要な役割を果たしそうだ。
出典: ITmedia AI+



