広告

生成AI活用プロダクト

ゲーミングPCで1250億モデルが動く StrataとQwen3.8-Flash-Nextの組み合わせが話題

デイリートピックス編集部公開: 2026/10/01約4分で読めます3 views
広告

通常はサーバーが必要になる1250億パラメータ級のAIモデルが、自宅のゲーミングPCで動き始めた。

無料で公開されているオープンソースのStrataが、Qwen3.8-Flash-Nextを手元のPCで実行する手順をまとめ、12GBから24GBのNVIDIA製グラフィックボードと64GBのメモリで動作する構成を示した。

StrataのGitHubリポジトリは2026年9月24日に公開され、10月1日時点で3700を超えるスターを集めている。

WindowsとLinuxに対応し、ワンクリックに近い導入手順と毎秒60から95トークンの応答速度が注目を集めている。

ゲーミングPCで巨大モデルが動く理由

Strataが実行するモデルは、24576人の小さな専門家が集まった組織のような構造を持つ。

1つの単語を書く際に働くのは10人の専門家だけで、残りは待機する。

グラフィックボードは毎回使う処理と頻繁に呼ばれる数千人の専門家を担当する。

メモリは全員の専門家を保持し、プロセッサーが足りない分を同時に処理する。

ソリッドステートドライブには29GBの対応表が置かれ、1語あたり数行だけ読み出す。

小さな支援モデルが次の数語を予測し、大きなモデルがまとめて検査する手順で、同じ品質のまま1.6倍から1.8倍速く応答する。

長い文章は最大8192トークンずつ読み込むため、資料やコードの取り込みは毎秒1000トークンを超える。

会話の最初だけ読み込みに時間がかかり、2回目以降は差分だけ読むため待ち時間が短くなる。

Qwen3.8-Flash-Nextは何が新しいのか

Qwen3.8-Flash-NextはAlibabaのQwenチームが2026年8月26日に公開したオープンモデルだ。

次世代のQwen4系列を見据えた実験的な設計で、1250億の本体に510億のNグラム埋め込みを加えている。

1トークンあたりに働くのは60億だけで、512人の割り当て専門家のうち10人と共有専門家が応答する。

48層のうち36層はGated DeltaNet、12層はQwen Sparse Attentionで構成される。

標準で262144トークンの文脈に対応し、YaRNによる拡張で最大100万トークンまで扱える。

画像と動画の理解、道具の呼び出し、思考の強さ調整に対応するマルチモーダルな構成だ。

公開された評価ではSWE-bench Proで62.5、Toolathlon Verifiedで73.5、LiveCodeBench v6で91.9を示した。

Qwen3.8-27BやDeepSeek-V4-Flash、Claude Opus 4.6を上回る項目があり、Qwenチームは学習期間がQwen3.8-27Bの9分の1であると説明している。

導入手順と日常の使い方

広告

Windowsではリポジトリを入手してSTART-HERE.batをダブルクリックする。

Linuxではsetup.shを実行し、モデルや文脈量、画像対応を選ぶと約70GBのファイルを取得する。

初回起動時は35GBから55GBをメモリに読み込むため、1分から3分ほどPCの反応が鈍くなる。

READMEは待つよう呼びかけ、次回以降は入手済みのファイルを使うため起動が速くなると説明している。

起動後はブラウザでhttp://127.0.0.1:8080が開き、対話や稼働監視、設定の画面が表示される。

端末ではchat.pyで対話し、思考の深さはoffやlow、medium、highから選ぶ。

外部の応用製品からはOpenAI互換のhttp://127.0.0.1:8080/v1で接続し、Anthropic形式はhttp://127.0.0.1:8080/v1/messagesで接続する。

画像は画面のPictureやchat.pyの/imageで渡し、応用製品では添付で送る。

DockerではNVIDIA Container Toolkitと580以降のドライバーが必要で、strata-dataの領域にモデルファイルを保持する。

2枚や3枚の構成では起動時に選択肢が表示され、AMD製グラフィックボードのHIPはLinuxで実験的に対応する。

速度と選び方 まず試すならどれか

RTX 5070の12GB版とRyzen 5 7600、64GBメモリでの実測が公開されている。

短い対話ではQ2_0が毎秒93トークン、IQ2_XSが毎秒79トークン、IQ3_XXSが毎秒62トークン、IQ3_Sが毎秒53トークンだ。

12万8000トークンの文脈でもQ2_0は毎秒74トークンを保ち、IQ3_Sは毎秒46トークンを保つ。

入力の読み取りは毎秒1620から2170トークンで、3万2000トークンの入力は約15秒で読み終える。

容量の目安はQ2_0が37.6GB、IQ2_XSが39.2GB、IQ3_XXSが47.0GB、IQ3_Sが54.8GBだ。

64GB搭載機では全種類が入り、48GB搭載機ではQ2_0とIQ2_XSが入る。

迷った場合はIQ2_XSが推奨され、主にコードを書く場合や32GBから48GBの機体ではCoder版が案内されている。

Coder版はコードに必要な専門家を残して半分を削り、Shard 1は29.6GBで262K文脈に対応する。

Swift 1.5は思考を短くして応答を早める調整版で、同じ大きさの原本と同程度の容量で使える。

SETUP.batの再実行で後から追加でき、用途や搭載量に合わせて切り替える運用が想定されている。

出典・参考リンク

広告

あわせて読みたい