米Palo Alto拠点のスタートアップAbliteration.aiが、オープンウェイトで公開されているAIモデルから安全上の「拒否」機構だけを取り除いた改変版をホスティングし、ブラウザやAPI経由で有償提供する事業を展開していることを、TechCrunchが9月3日付で報じた。同社は昨年創業したばかりで、ベンチャーキャピタルからの資金調達はまだ行っていないものの、複数の大手クラウド事業者と契約を結んでおり、顧客からの収益のみで運営できているという。共同創業者を名乗る「Devon」氏(現在も別の企業に在籍しているため本名は非公表)が取材に応じた。
同社が扱うモデルには、中国Z.aiが公開したばかりの「GLM-5.3」も含まれる。「orthogonalization」と呼ばれる手法を用いて、モデル内部でユーザーの指示を拒否する働きをしている部分だけを特定・除去し、それ以外の推論力やコーディング力、エージェントとしての性能はそのまま維持しているとされる。同社は、他のモデルが拒否するような「攻撃的サイバー、レッドチーム演習、エージェントのテスト業務」を行いたい利用者に向けたサービスだと説明している。
TechCrunchは実際に無料アカウントを作成し、改変版GLM-5.3に対してChromeに保存されたパスワードを窃取するPythonプログラムの作成や、危険な人体病原体を自宅で培養する詳細な手順を尋ねたところ、いずれも拒否されることなく回答が返ってきたと報告している。AI安全研究者からは、こうしたガードレール除去モデルは「モデルをサイコパスに変えるようなものだ」との批判が上がっており、実害につながりかねないとの懸念が示されている。
出典: TechCrunch



