Y Combinator出身のスタートアップSpecific Labsが、コーディングエージェント向けの新しいベンチマーク「Real-SWE」の結果を公開しました。公開済みの問題セットを使う従来の評価と異なり、実在の企業からライセンスを受けた非公開の本番コードベースをタスクに使うことで、モデルが事前に問題を学習してしまう「ベンチマーク汚染」を避ける狙いがあるといいます。評価はタスクごとに8回試行した際の解決率(pass@1)の平均で、対象タスクは平均11ファイルの編集を伴う規模とされています。
結果は、AnthropicのFable 5.1をClaude Code経由で動かした場合が解決率38.8%で最高となり、OpenAIのGPT-6 Astraが33.8%、GoogleのGemini 3.8 FlashをGemini CLI経由で動かした場合が31.2%で続きました。
一方でコスト面では傾向が異なります。Specific Labsの試算では、Fable 5.1は1回の実行あたり6.96ドルかかり、解決1件あたりでは約17.94ドルに達するのに対し、Gemini 3.8 Flashは1回あたり2.50ドルと安く、解決1件あたりでは約8.01ドルにとどまるとされ、精度とコストのトレードオフが浮き彫りになりました。
なお、コスト試算の具体的な算出方法についてSpecific Labsは詳細を明らかにしておらず、あくまで一民間スタートアップによる独自ベンチマークである点には留意が必要です。



