プロダクト & モデル報道

国産LLM「LLM-jp-4」オープンソース公開、日本語ベンチマークでGPT-4oを上回る——NIIが学習データ・重みまで全公開

32B-A3Bモデルは日本語MT-Benchで7.82、GPT-4o(7.29)・Qwen3-8B(7.14)を凌駕、NVIDIAのHugging Face買収など再燃するオープンソース戦略の渦中で

鈴木 理恵|2026.09.13|7|更新: 2026.09.13

国立情報学研究所が「LLM-jp-4」8B・32B-A3Bをオープンソース公開。日本語MT-Benchで7.82を記録し、GPT-4oやQwen3-8Bを上回った。学習データ・重みも全公開する透明性重視の姿勢が特徴。

Key Points

Business Impact

自社データを外部クラウドLLMに預けたくない企業は、LLM-jp-4を自社基盤上でファインチューニングして業務特化モデル(医療・教育等)を構築する選択肢を検討すべき。学習データ・重みが公開されているため監査・説明責任が求められる規制業種との相性が良く、ベンダーロックイン回避や継続提供リスクの分散策として来期の技術選定に組み込む価値がある。

Featured Image

新たな「国産LLM」公開、国立情報学研究所 「gpt-oss-20b」超えの日本語性能うたう
出典: ITmedia AI+

NIIが「LLM-jp-4」をオープンソース公開

国立情報学研究所(NII、黒橋禎夫所長)の大規模言語モデル研究開発センター(LLMC)は、日本発プロジェクト「LLM-jp」を通じて開発した大規模言語モデル「LLM-jp-4 8Bモデル」と「LLM-jp-4 32B-A3Bモデル」をオープンソースライセンスで一般公開した。電波タイムズによれば、8Bモデルは約86億パラメータ、32B-A3Bモデルは約320億パラメータを持つ。後者は複数のサブモデルを組み合わせるMixture of Experts(MoE)構成を採用し、AI内部に配置した128人の「専門家」のうち質問内容に応じて最適な8人だけを呼び出す仕組みで、全回路を稼働させずに高い知能と処理効率を両立させたという。

国産LLM新モデルをオープンソース公開 NII、一部GPT―4oやQwen3―8Bを上回る性能 | 電波タイムズ | 日本唯一の放送・情報通信の専門紙の電波タイムズのニュースサイト
出典: 電波タイムズ | 日本唯一の放送・情報通信の専門紙の電波タイムズのニュースサイト

日本語MT-BenchでGPT-4o・Qwen3-8Bを上回る

対話能力を測る「日本語MT-Bench」において、32B-A3Bモデルは7.82というスコアを記録した。これは世界中で利用される多言語モデル「GPT-4o」の7.29、アリババ社の「Qwen3-8B」の7.14を明確に上回る結果だ。ITmedia AI+の報道では、OpenAIのオープンモデル「gpt-oss-20b」の日本語性能も上回るとしており、英語性能についても海外モデルと同等以上をアピールしている。両モデルはLlama系やQwen系のアーキテクチャ設計を参考にしつつ、フルスクラッチで学習されたことが後日の訂正で明記された点も注目される。

19.5兆トークンの学習データと合成データの活用

事前学習では前作「LLM-jp-3」シリーズの約6倍にあたる学習コーパスを構築した。総計約19.5兆トークンの内訳は日本語約7000億トークン、英語約17.8兆トークン、中国語・韓国語など他言語約8500億トークン、プログラムコード約2000億トークンで、このうち約10.5兆トークンを事前学習に投入した。データにはインターネット公開情報に加え、国立国会図書館のデジタル資料や政府の公文書、AIが論理的思考を学ぶために生成した合成データも含まれる。中間学習では指示事前学習データを加えた計1.2兆トークンを使用し、最終的に英語・日本語のインストラクションチューニングデータ22種類でチューニングを実施した。Ledge.aiもこの学習規模とフルスクラッチ開発を強調して報じている。

「AI主権」を掲げる透明性重視の思想

NIIの黒橋禎夫所長は4月16日の記者懇親会で、プロジェクトの根幹に「透明性」と「信頼性」があると強調した。多くの商用AIが学習データや作成手順を非公開とする中、LLM-jp-4は学習の「レシピ」やデータの来歴、モデルの重みまで全てオープンソースとして公開し、誰もが検証可能な「日本のAIの土台」を目指すとした。国産にこだわる理由については「海外のAIに頼り切ることは、自国のデータや文化のコントロールを他国に委ねるリスクを伴う」「特定の企業が開発を止めたり方針を変えたりするリスクを回避するために、日本独自の検証可能なモデルが必要」と「AI主権(データ主権)」の観点から説明した。数学やコードの学習を重視した理由についても、論理的思考力の訓練が他の言語処理能力全体を底上げすると述べている。

医療・教育への応用と今後の展開

活用事例としては、LLM-jpのモデルに約800億トークンの医学テキストを追加学習させた医療特化型モデルが、医師国家試験でGPT-4を上回る成績を収めたことが紹介された。教育分野でも、生徒の理解度に応じて答えを即座に教えず一緒に考えるエージェントの開発が始まっているという。今後の展望としては、2026年度中により大規模な32Bモデルと、3000億規模のパラメータを持つ超巨大MoEモデルの公開を予定しており、産官学2600名以上が参加する「チーム・サイエンス」体制での開発継続を掲げている。

オープンソースLLM市場の地殻変動

国産モデルの公開は、世界的なオープンソースLLM競争が激化する局面と重なる。Digital Todayの報道では、OpenAIやAnthropicが新モデルを相次ぎ投入し、Metaもオープンウェイト系LLMを更新する中、NVIDIAはHugging Faceを129億ドルで買収する方針を明らかにしたと伝えている。クローズドな巨大モデルとオープンな開発コミュニティの双方が主導権を争う構図の中で、学習データや重みを全面公開するLLM-jp-4のアプローチは、企業のベンダー依存リスク回避や規制対応の観点から今後の選定基準の一つになり得る。

Verification

信頼ラベル報道
一次ソース4件確認
最終検証2026.09.13
VerifiedRev. 1
sha256:85c05145bd292191...e947a2ed

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score87/100
引用密度20/20
ソースURL数15/20
信頼ラベル12/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事

Featured Image
プロダクト & モデル報道

AIエージェント大型アップデート相次ぐ——Oracle・Arent・LM Studio Bionicが示す『自律実行×統制』の新段階

日本オラクルはOracle AI Agent Studioで組み込みエージェント1000以上・顧客デプロイ7000超・認定エキスパート8万5536人を公表。ArentはRevit連携「LightningBIM AI Agent」で特許技術を発展させた自律タスク実行機能をベータ公開。LM Studio Bionicはv1.1.3で日本語UIに対応。3社に共通するのは自然言語での大規模タスク自律実行と統制・権限管理の両立という設計思想。

2026.09.19
Featured Image
プロダクト & モデル報道

Claude Mythos徹底解剖——SWE-bench 93.9%でも非公開、後継Fable 5・Mythos 5・Opus 5が示すAnthropicの段階解禁戦略

AnthropicのClaude Mythos PreviewはSWE-bench 93.9%等で歴代最高性能ながら、Firefox脆弱性成功率72.4%という危険性から一般公開されず約40組織限定で提供された。半年後、同一基盤を共有するFable 5・Mythos 5が一般提供され、続くOpus 5はFable 5の半額の価格でそれに迫る性能を実現した。

2026.09.18
Featured Image
プロダクト & モデル報道

RAG手法、2026年は「使い分け」の時代へ——Agentic RAG・GraphRAGが標準化、Gartnerは60%頓挫リスクを警告

2026年のRAGはAgentic RAG・GraphRAG・Multimodal RAGの使い分けが導入判断の中心に。Gartnerは AI-Readyデータ不備でAIプロジェクトの60%が頓挫と予測している。

2026.09.17