中国AlibabaのQwenチームは2026年8月26日、次世代モデル「Qwen4」で採用予定のアーキテクチャを先行して取り入れたオープンウェイトモデル「Qwen3.8-Flash-Next」を公式ブログで発表し、モデルの重みをHugging Face等で公開しました。同モデルはMixture-of-Experts(MoE)構成のマルチモーダルモデルで、ディスク上の総パラメータは1800億(うち中心となるメインモデルが1250億、加えて新規採用の「Nグラム埋め込み層」に510億、複数トークン同時予測モジュールに40億)ですが、推論時に実際に活性化するのは60億パラメータのみとされています。ネイティブのコンテキスト長は26万2144トークンで、最大100万トークンまで拡張可能です。
Qwenチームによれば、Gated DeltaNetとQwen独自のスパースアテンションを組み合わせた新機構や、新設計の「Nグラム埋め込み層」(頻出する単語のまとまりを辞書のように保持し、GPUではなく通常のシステムメモリに置くことでコストを抑える仕組み)、最適化アルゴリズム「Muon」の採用などが今回の性能改善の柱だとしています。コーディング関連のベンチマークではSWE-bench Proで62.5、SWE-bench Multilingualで81.0を記録したとしており、エージェント関連タスクやマルチモーダル理解のベンチマークでも高いスコアを公表しています。
特筆すべきは、前モデル「Qwen3.7-Plus」(総パラメータ397億、活性化パラメータ170億)と比較して、学習コストが約9分の1に抑えられた一方、コーディングやオフィス業務関連タスクを中心に前モデルを上回る性能を達成したとQwenチームが公表している点です。API利用料金も入出力トークンともに前モデル比でおよそ12分の1に引き下げられ、入力100万トークンあたり1元(約0.15ドル)、出力100万トークンあたり3元という設定です。オープンウェイトの大規模モデルにおいて、性能と低コストを両立させる開発競争が中国勢を中心に一段と激しくなっていることを示す事例といえます。



