米疾病対策センター(CDC)が公表した2025–26年シーズンの評価で、Googleの「Google_SAI-FluEns」が、米国の**週次インフルエンザ入院数の確率予測**を提出した適格モデル39件のうち最上位になった。予測するのは地域ごとの入院数とその不確実性であり、患者個人が感染・発症するかを予測するものではない。
39モデルの採点でRelative WISが0.56
CDCは34チームから提出された53モデルのうち、採用基準を満たす39モデルを最終分析に使った。「39」は全投稿数ではない。各モデルは当週から3週先までの入院数を予測した。予測の提出先には全米、50州、ワシントンD.C.、プエルトリコが含まれたが、最終順位の採点対象は50州とワシントンD.C.だった。CDCは規模の異なる全米値と、データ入手に制約のあるプエルトリコを採点から外し、提出率75%未満のモデルも除外した。
Google_SAI-FluEnsの主指標「Relative WIS」は0.56で、39モデル中最も低かった。Relative WISは、予測区間の幅と実際の入院数からのずれを評価するWISを、基準モデルと比べた値だ。**低いほど良い**。
基準となるRelative WIS 1は、前週の入院数を中央値として引き継ぎ、不確実性も付けるモデルの水準を表す。0.56は、この評価条件でGoogleの予測がその基準モデルより良いスコアだったことを示す。
同モデルは予測対象の98%を提出した。実際の入院数が予測した50%区間に入った割合は51.2%、95%区間に入った割合は93.72%だった。
このcoverageは、対象地域・期間・予測先をまとめて集計した値で、個別の予測が当たる確率ではない。CDCの「FluSight ensemble」はRelative WISが0.62で7位だった。
AIが候補コードを探索し、研究者が課題と戦略を設計
Google Researchは、予測モデルの開発に「ERA(Empirical Research Assistance)」を使った。
ERAは研究者が指定した課題や過去の監視データ、評価方法を基に、LLM誘導の探索で候補コードを生成する。候補を実行して採点し、その結果でコードを改良する。
人間の研究者も既存研究を踏まえて予測課題や候補戦略、評価方法を設計し、モデルの選定に関わった。Google_SAI-FluEnsは複数の候補を組み合わせた提出モデルで、AIだけが研究から運用まで完結させた例ではない。
急な増減には予測区間にも限界
CDCは、自らのFluSight ensembleについて、2025年12月末の入院数の増加と2026年1月中旬の減少を50%・95%予測区間で捉えられなかったと報告した。急な変化を含む週には、集約モデルの予測区間にも限界がある。ただし、これはCDCのensembleに関する分析で、Google_SAI-FluEnsが同じ期間にどれだけ外したかを示す数字ではない。
今回の首位は、CDCが定めた地域、期間、提出基準、採点方法の下での**2025–26年シーズンの入院予測評価**の結果だ。Googleの前向き評価論文には途中段階の43適格モデルを使った別の分析もあるが、今回の最終順位の母数や0.56というスコアには用いていない。
