コンピュータビジョン研究者のFei-Fei Li氏が創業したWorld Labsは9月1日、「空間知能(spatial intelligence)」の実現を掲げる新モデル「Atlas」を早期アクセス版として発表した。同社はAtlasを「オムニ(omni)モデル」と位置づけ、単一の基盤モデルで画像・動画・3D空間の生成を横断的に扱える点を特徴としている。
Atlasは1〜6枚の参照画像と、あらかじめ指定したカメラ経路を入力すると、最大1分・1440p解像度の動画を、任意の角度から見渡せる3D空間として生成できる。同社はAtlasを、テキストプロンプト頼みではなくカメラの幾何情報をモデルへのネイティブな入力として直接扱う「マルチモーダルな自己回帰型拡散トランスフォーマー」だと説明しており、スクラッチから学習した点を強調している。
World Labsはこれまで、Nvidia・AMD・Autodeskなどから合計12億ドルの資金を調達してきた。今回のAtlasは限定パートナー向けの早期アクセスとしての公開で、料金体系や一般提供時期、APIの詳細などは現時点で公表されていない。
出典: World Labs公式ブログ



