AIニュース

DeepSeek、初のマルチモーダルモデル「V4-Flash-Vision-Exp」を公開 一部指標でAnthropic Opus 4.8に匹敵

公開日: ・出典: DeepSeek API Docs

中国のAI企業DeepSeekは8月21日、テキスト専用の主力モデル「DeepSeek-V4-Flash」をベースに画像理解機能を追加した実験的モデル「DeepSeek-V4-Flash-Vision-Exp」をAPI上で公開した。テキストに関するエージェント能力・推論・知識面ではV4-Flashと同水準の性能を維持しつつ、画像やスクリーンショットを読み取って行動できるマルチモーダル対応が新たに加わっている。

DeepSeekが公表した自社ベンチマークによれば、マルチモーダルエージェント関連の指標において、本モデルはAnthropicの「Claude Opus 4.8」に匹敵する結果を示した。具体的には、エージェント能力を測る「Agents' Last Exam」でOpus 4.8の25.7に対し27.3、画像読解を測る「ZeroBench」(Pass@5)でも34.0に対し35.0を記録し、いずれもOpus 4.8をわずかに上回ったという。

価格体系はV4-Flashと同一に据え置かれており、画像1,000枚あたりの処理コストは1.15元(約0.17ドル)程度と、GPTやClaude系モデルと比べても低コストに抑えられている点をDeepSeekは強調している。

上場(IPO)準備が報じられるDeepSeekにとって、実験モデルとはいえフロンティア級のマルチモーダル性能を低価格で示したことは、価格競争が続くAI業界における存在感の維持につながる動きといえる。

出典: DeepSeek API Docs

Xでシェア