プロダクト & モデル報道

国産LLM「LLM-jp-4」が日本語MT-BenchでGPT-4o超え——Gemma 4・MiniMax M2.1も続き、オープンソースLLM公開ラッシュ

NII開発の32B-A3BモデルがGPT-4o・Qwen3-8Bを上回るスコアを記録、学習データとレシピも全公開

鈴木 理恵|2026.08.26|8|更新: 2026.08.26

国立情報学研究所の「LLM-jp-4」が日本語MT-Benchで7.82点を記録しGPT-4o(7.29点)を上回った。Gemma 4のApache 2.0公開、MiniMax M2.1のリリースも続き、オープンLLMの実力がクローズドモデルに迫っている。

Key Points

Business Impact

自社データを外部に出せない業務では、GPT-4o相当の日本語性能を持つLLM-jp-4やGemma 4をローカル環境で無償検証する価値がある。学習データとレシピが公開されているため、監査要件が厳しい医療・行政分野での採用検討を始めるべき。

Close-up of a 3D printer head in operation
新たな「国産LLM」公開、国立情報学研究所 「gpt-oss-20b」超えの日本語性能うたう
出典: ITmedia AI+

NIIの国産LLM、日本語性能でGPT-4oを上回る

国立情報学研究所(NII、黒橋禎夫所長)は2026年4月3日、大規模言語モデル研究開発センター(LLMC)が主導する「LLM-jp」プロジェクトの成果として、「LLM-jp-4 8Bモデル」(約86億パラメータ)と「LLM-jp-4 32B-A3Bモデル」(約320億パラメータ)をオープンソースライセンスで公開した。対話能力を測る「日本語MT-Bench」において32B-A3Bモデルは7.82点を記録し、電波タイムズによればOpenAIの「GPT-4o」(7.29点)、Alibabaの「Qwen3-8B」(7.14点)を上回った。ITmedia AI+はさらに、OpenAIのオープンモデル「gpt-oss-20b」の日本語性能も超えたと報じている。

国産LLM新モデルをオープンソース公開 NII、一部GPT―4oやQwen3―8Bを上回る性能 | 電波タイムズ | 日本唯一の放送・情報通信の専門紙の電波タイムズのニュースサイト
出典: 電波タイムズ | 日本唯一の放送・情報通信の専門紙の電波タイムズのニュースサイト

19.5兆トークンとMoEアーキテクチャ

今回のモデルは前作「LLM-jp-3」シリーズの約6倍にあたる約19.5兆トークンの事前学習コーパスを構築し、そのうち約10.5兆トークンを事前学習に使用した。内訳は日本語約7000億トークン、英語約17.8兆トークン、中国語・韓国語約8500億トークン、プログラムコード約2000億トークンで、国立国会図書館のデジタル資料や政府公文書、AIが生成した合成データも含む。ビジネス+ITによると、性能評価は42種類のタスクを横断する独自の仕組みで実施された。32B-A3Bモデルは128の「専門家」から質問内容に応じて8個を呼び出すMixture of Experts(MoE)構造を採用し、全回路を稼働させずに高い知能を効率的に発揮する設計になっている。ITmediaの報道では、8BモデルはMeta「Llama 2」、32B-A3BモデルはAlibaba「Qwen3」に近いアーキテクチャを参考にしつつ、重みはフルスクラッチで開発したと訂正・明記されている。黒橋所長は記者懇親会で「AI主権」という言葉を用い、商用モデルのブラックボックス性やベンダー依存のリスクを回避するため、学習レシピ・データ来歴・モデルの重みまで全公開する方針を説明した。医学テキスト約800億トークンを追加学習した医療特化モデルは医師国家試験でGPT-4を上回る成績を収めたといい、2026年度中には32Bモデルの拡張版と3000億パラメータ級の超巨大MoEモデルの公開も予定している。

Gemma 4・MiniMax M2.1、海外勢もオープン化を加速

オープンLLMの潮流はNIIだけではない。Googleの研究部門DeepMindは4月2日、ZDNET Japanによれば最新世代「Gemma 4」をApache 2.0ライセンスで完全オープンソース公開した。一方、中国のMiniMaxは2025年12月23日、TECH+の報道によれば前バージョン「M2」を強化した「MiniMax M2.1」を公開し、Rust・Java・Golang・C++・TypeScriptなど幅広い言語で高い性能を発揮するとした。一部ベンチマークではGemini 3 ProやClaude 4.5 Sonnetを上回る評価も得ており、複合命令制約を処理する「Interleaved Thinking」機能も搭載する。同時期にはDeepSeekが学習の安定性を高める新手法「mHC(Manifold-Constrained Hyper-Connections)」を発表するなど、中国勢の技術革新も続いている。

ローカル実行環境の広がりとコスト試算

オープンモデルの活用を後押しするのがローカル実行ツールの進化だ。窓の杜によれば、MITライセンスのオープンソースツール「Ollama」は5月14日にv0.24.0をリリースし、デスクトップ版「Codex」アプリへの対応を追加した。複雑なコーディングやエージェント処理には「Kimi K2.6」「GLM-5.1」、クラウド非依存の軽量利用には「Nemotron 3 Super」や「gemma-4-31b」が推奨されている。ローカルLLMの経済性を示す試算として、Yahoo!ニュース掲載のビジネス+ITの検証記事では、Mac mini(M4 Pro・メモリ64GB)でGemma 4の26Bモデルを動かした場合、消費電力は平均25.6W、生成速度は毎秒63.87語で、100万トークンあたり約3.5円(31円/kWh換算)という結果が出ている。同記事では7月13日にエージェント特化型「Ornith-1.0」、翌日に27Bモデルを3.8GBまで圧縮した「Bonsai 27B」、その後「Agents-A1-4B」が相次いで公開され、わずか10日間でローカルLLMの新顔が出そろったと伝えている。

透明性競争が示す業界への影響

NIIの取り組みが象徴するのは、性能競争だけでなく「透明性」を軸にした差別化だ。多くの商用AIが学習データや手順を非公開にする中、LLM-jp-4は学習レシピからデータ来歴、モデルの重みまで全て検証可能な形で公開しており、産官学2600名以上が参加する「チーム・サイエンス」体制で開発された。医療・行政など監査要件の厳しい領域や、GPUを持たない中小企業がローカルで低コスト運用したい場合、こうした完全オープンなモデルとOllamaのような実行基盤の組み合わせは現実的な選択肢になりつつある。GPT-4o相当の日本語性能を無償で検証できる環境が整ったことで、企業のAI導入戦略における「クローズドモデル一択」の前提が崩れ始めている。

Verification

信頼ラベル報道
一次ソース7件確認
最終検証2026.08.26
VerifiedRev. 2
sha256:c0baa773d09ebc5d...29c1eefa

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score92/100
引用密度20/20
ソースURL数20/20
信頼ラベル12/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事