NVIDIAは2026年9月18日、日本国内の企業向けに大規模言語モデル(LLM)開発基盤「Nemotron 3 Ultra」の提供を開始した。同モデルは80億パラメータ規模ながら、従来の同等サイズモデルを大きく上回る推論性能を発揮し、日本語を含む多言語対応を強化している。企業が自社データでファインチューニングし、独自の生成AIアプリケーションを短期間で構築できる点が特徴だ。
国産データでの学習に対応、日本語性能を大幅向上
Nemotron 3 Ultraは、NVIDIAが独自に収集・整備した高品質な多言語データセットで事前学習されたモデルだ。日本語については、ウェブコーパスに加え、技術文書・法令・ニュース記事・書籍など多様なジャンルの日本語データを重点的に学習させた。NVIDIAの発表によると、日本語ベンチマーク「JGLUE」および「JP-LLMベンチマーク」において、同規模のオープンモデルと比較して平均15〜20%の性能向上を確認しているという。
同社のエンタープライズAI担当バイスプレジデントは「日本企業が抱える『ベースモデルの日本語能力不足』という課題に対し、最初から日本語を強化したモデルを提供することで、ファインチューニングの工数とコストを大幅に削減できる」と説明する。実際に早期アクセスプログラムに参加した大手製造業では、独自技術文書への適応にかかるデータ準備期間が従来の3分の1程度に短縮されたと報告されている。
NeMoフレームワークと連携、オンプレミス・クラウド両対応
提供形態は、NVIDIAの「NeMo」フレームワーク上で動作するコンテナイメージとして配布される。NeMoは、データ前処理・事前学習・ファインチューニング・評価・展開までを一貫して支援するツールキットだ。企業は自社のGPUクラスタや、主要クラウドプロバイダ(AWS、Azure、Google Cloud、Oracle Cloud)のNVIDIA GPUインスタンス上で、同一のワークフローを実行できる。
特に注目されるのは、NVIDIAが同時に発表した「Nemotron 3 Ultra NIM(NVIDIA Inference Microservice)」だ。最適化された推論エンジン「TensorRT-LLM」を内包し、H100 GPU 1枚あたり毎秒2,000トークン以上の推論スループットを実現するとされている。これにより、リアルタイム応答が求められるチャットボットやコード生成支援、社内ナレッジ検索などのユースケースで、レイテンシを抑えた本番運用が可能になるとみられる。
国内パートナー経由での導入支援体制も整備
NVIDIAは、日本国内の主要SIerおよびAIベンダー10社以上と「Nemotron 3 Ultra パートナープログラム」を締結した。参加企業には、富士通、NEC、NTTデータ、SCSK、アイティフォー、ブレインパッド、ABEJA、Preferred Networks、Stockmark、ELYZAなどが名を連ねる。各社は、モデル導入からデータ整備、ファインチューニング、システム統合、運用監視までをワンストップで支援するメニューを順次展開する予定だ。