プロダクト & モデル確認済

MLPerf 2026最新結果、推論・学習・ストレージ全領域で記録更新——CoreWeaveがDeepSeek-V3 671Bを2.02分で学習、NVIDIA GB300が2.5M token/s達成

MLCommonsのInference v6.0・Training v6.0・Storage v3.0が出揃い、AIインフラ性能競争の全体像が明らかに

鈴木 理恵|2026.09.16|8|更新: 2026.09.16

MLPerf Inference/Training v6.0とStorage v3.0の結果が2026年に相次ぎ公開。NVIDIA GB300でDeepSeek-R1推論が2.7倍高速化、CoreWeaveは671BモデルをGPU8192基で2.02分で学習した。

Key Points

Business Impact

AIインフラ調達を検討する企業は、推論コストを重視するならNVIDIA GB300 NVL72構成のtoken単価データを、学習速度を重視するならCoreWeaveやASUSのB300クラスタ実績を個別に精査すべきで、単一ベンダーの「世界最速」宣伝文句を鵜呑みにせず用途別に監査済み数値を比較する体制を今すぐ整える必要がある。

Featured Image

NVIDIA Platform Delivers Lowest Token Cost Enabled by Extreme Co-Design | NVIDIA Technical Blog
出典: NVIDIA Technical Blog

Inference v6.0が示す推論性能の新基準

MLCommonsは2026年4月1日、業界標準ベンチマーク「MLPerf Inference v6.0」の新結果を発表した。MLCommonsの発表によれば、データセンター向け11項目のうち5項目が新規または更新され、エッジシステム向けには物体検出テストが新たに加わった。目玉はオープンウェイトのGPT-OSS 120Bを用いた新ベンチマークで、数学・科学的推論・コーディング用途の性能を測定する。さらにDeepSeek-R1を使った高度推論ベンチマークも拡張され、実運用に近いシナリオでの評価精度が高まった。

MLCommons Releases New MLPerf Inference v6.0 Benchmark Results
出典: GlobeNewswire News Room

この改訂は「これまでで最も大規模な更新」とされ、AIモデルの実利用シーンの変化にベンチマーク側が追随した形だ。

NVIDIA GB300が叩き出した2.5M token/sの実力

NVIDIAの技術ブログによれば、GB300 NVL72プラットフォームはDeepSeek-R1推論において2025年8月から2026年2月の間に2.7倍の性能向上を達成し、288基のBlackwell Ultra GPUで秒間250万トークンという記録を樹立した。この結果はMLPerf Inference v6.0のClosed Divisionにおける複数のエントリー(6.0-0039、6.0-0073など)に基づく。NVIDIAはソフトウェア面でもサーバー・オフラインシナリオ双方の性能改善を積み重ねており、per-chip性能はv5.1からv6.0にかけて着実に伸びている。ただしper-chip性能はMLPerfの公式指標ではなく、総スループットをチップ数で割った参考値である点は留意が必要だ。

Training v6.0、CoreWeaveとASUSが記録更新

学習性能の分野では、CoreWeave(Nasdaq: CRWV)が2026年6月16日、MLPerf Training v6.0での記録を発表した。8192基のNVIDIA GB300 NVL72 GPU(同ラウンド最大規模のクラスタ)を用い、6710億パラメータのDeepSeek-V3を2.02分で学習し切ったという。同社は7月24日公開の技術白書でこの結果の詳細な分析も示している。また4096基構成ではLlama-3.1-405Bの目標品質に9.77分で到達し、GB200を使う大規模構成に対しGPU数を20%削減しながら近い性能を実現したとしている。基盤にはNVIDIA NeMo Framework Release 26.04とSpectrum-X Ethernet(RoCE)が使われた。

一方、ASUSは2026年6月22日、HGX B300搭載のXA NB3I-E12サーバーがLlama 3.1-8B(サーバー・オフライン両モード)とGPT-OSS-120B(インタラクティブモード)で首位を獲得したと発表した。同サーバーは既に世界出荷を開始しており、企業向けAI基盤市場での競争力を強調している。

Storage v3.0、19社143件の監査結果

推論・学習だけでなく、ストレージ性能も監査対象となっている。StorageReviewの集計によれば、2026年9月1日公開のMLPerf Storage v3.0には19社が参加し、計143件の結果が提出された。今回からシミュレート対象アクセラレータがH100からB200に切り替わったため、過去ラウンドとの直接比較はできなくなった。テスト範囲は学習スループット、チェックポイント処理に加え、ベクトルデータベースとKVキャッシュという新たな推論系テストにも拡大し、提出の約6分の1がS3オブジェクトストレージ対応を活用した。FlashBlade//EXAはチェックポイント書き込み877.5GiB/s、読み込み833GiB/s、KVキャッシュ読み込み1623GiB/sという同ラウンド最大級の数値を記録している。

ベンチマーク乱立が示す業界の実態

Dell、Pure Storage(現Everpure)、VAST、Weka、IBM、NetApp、Huaweiなど各社は独自に性能優位性を主張してきたが、第三者による独立検証はほとんど行われてこなかった。MLPerf Storageはこの中で数少ない監査済みベンチマークとして機能しており、単一の勝者を決めるのではなく、ワークロードごとに異なるシステムが首位に立つ構造になっている。推論・学習・ストレージの3領域でベンチマークが同時に更新された2026年は、AIインフラの性能競争が単一指標では語れない段階に入ったことを示している。

Verification

信頼ラベル確認済
一次ソース7件確認
最終検証2026.09.16
VerifiedRev. 1
sha256:39de025d14540460...8f822bf2

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score95/100
引用密度20/20
ソースURL数20/20
信頼ラベル15/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事

Featured Image
プロダクト & モデル報道

AIエージェント大型アップデート相次ぐ——Oracle・Arent・LM Studio Bionicが示す『自律実行×統制』の新段階

日本オラクルはOracle AI Agent Studioで組み込みエージェント1000以上・顧客デプロイ7000超・認定エキスパート8万5536人を公表。ArentはRevit連携「LightningBIM AI Agent」で特許技術を発展させた自律タスク実行機能をベータ公開。LM Studio Bionicはv1.1.3で日本語UIに対応。3社に共通するのは自然言語での大規模タスク自律実行と統制・権限管理の両立という設計思想。

2026.09.19
Featured Image
プロダクト & モデル報道

Claude Mythos徹底解剖——SWE-bench 93.9%でも非公開、後継Fable 5・Mythos 5・Opus 5が示すAnthropicの段階解禁戦略

AnthropicのClaude Mythos PreviewはSWE-bench 93.9%等で歴代最高性能ながら、Firefox脆弱性成功率72.4%という危険性から一般公開されず約40組織限定で提供された。半年後、同一基盤を共有するFable 5・Mythos 5が一般提供され、続くOpus 5はFable 5の半額の価格でそれに迫る性能を実現した。

2026.09.18
Featured Image
プロダクト & モデル報道

RAG手法、2026年は「使い分け」の時代へ——Agentic RAG・GraphRAGが標準化、Gartnerは60%頓挫リスクを警告

2026年のRAGはAgentic RAG・GraphRAG・Multimodal RAGの使い分けが導入判断の中心に。Gartnerは AI-Readyデータ不備でAIプロジェクトの60%が頓挫と予測している。

2026.09.17