通常はサーバーが必要になる1250億パラメータ級のAIモデルが、自宅のゲーミングPCで動き始めた。
無料で公開されているオープンソースのStrataが、Qwen3.8-Flash-Nextを手元のPCで実行する手順をまとめ、12GBから24GBのNVIDIA製グラフィックボードと64GBのメモリで動作する構成を示した。
StrataのGitHubリポジトリは2026年9月24日に公開され、10月1日時点で3700を超えるスターを集めている。
WindowsとLinuxに対応し、ワンクリックに近い導入手順と毎秒60から95トークンの応答速度が注目を集めている。
ゲーミングPCで巨大モデルが動く理由
Strataが実行するモデルは、24576人の小さな専門家が集まった組織のような構造を持つ。
1つの単語を書く際に働くのは10人の専門家だけで、残りは待機する。
グラフィックボードは毎回使う処理と頻繁に呼ばれる数千人の専門家を担当する。
メモリは全員の専門家を保持し、プロセッサーが足りない分を同時に処理する。
ソリッドステートドライブには29GBの対応表が置かれ、1語あたり数行だけ読み出す。
小さな支援モデルが次の数語を予測し、大きなモデルがまとめて検査する手順で、同じ品質のまま1.6倍から1.8倍速く応答する。
長い文章は最大8192トークンずつ読み込むため、資料やコードの取り込みは毎秒1000トークンを超える。
会話の最初だけ読み込みに時間がかかり、2回目以降は差分だけ読むため待ち時間が短くなる。
Qwen3.8-Flash-Nextは何が新しいのか
Qwen3.8-Flash-NextはAlibabaのQwenチームが2026年8月26日に公開したオープンモデルだ。
次世代のQwen4系列を見据えた実験的な設計で、1250億の本体に510億のNグラム埋め込みを加えている。
1トークンあたりに働くのは60億だけで、512人の割り当て専門家のうち10人と共有専門家が応答する。
48層のうち36層はGated DeltaNet、12層はQwen Sparse Attentionで構成される。
標準で262144トークンの文脈に対応し、YaRNによる拡張で最大100万トークンまで扱える。
画像と動画の理解、道具の呼び出し、思考の強さ調整に対応するマルチモーダルな構成だ。
公開された評価ではSWE-bench Proで62.5、Toolathlon Verifiedで73.5、LiveCodeBench v6で91.9を示した。
Qwen3.8-27BやDeepSeek-V4-Flash、Claude Opus 4.6を上回る項目があり、Qwenチームは学習期間がQwen3.8-27Bの9分の1であると説明している。