プロダクト & モデル確認済

MLPerf 2026年最新結果、NVIDIAブラックウェル超が推論首位も焦点は「ストレージ」へ——AMD・ASUSが学習性能で追随

Training v6.0・Inference v6.0・Storage v3.0が出揃い、AI性能競争はGPU単体からシステム全体最適化の局面に

鈴木 理恵|2026.09.07|8|更新: 2026.09.07

MLCommonsが2026年に発表したMLPerf Training/Inference v6.0とStorage v3.0の結果を統合。NVIDIA GB300 NVL72が推論で250万トークン/秒を達成する一方、AMDやASUSの学習性能、ストレージ性能の標準化が新たな争点に浮上した。

Key Points

Business Impact

GPUの学習・推論性能はNVIDIA・AMD・ASUSの各プラットフォームで大差がつきにくくなっており、調達判断はチップ単体のスペックよりもストレージI/OとKVキャッシュ処理能力を含めたシステム全体のコストパフォーマンスで比較すべき段階に入った。AI基盤への設備投資を検討する経営層は、MLPerf Storage v3.0のKV Cache・S3対応結果を次回調達仕様書のベンチマーク項目に加えることを推奨する。

Featured Image

MLCommonsが2026年に相次いで発表したMLPerfベンチマーク三部作——Training v6.0、Inference v6.0、Storage v3.0——の結果が出揃い、AI基盤の性能競争がGPU単体の演算能力比較から、ストレージやデータパイプラインを含むシステム全体の最適化競争へと移行しつつある実態が浮かび上がった。各結果は独立した発表ながら、共通するのは「計算資源をいかに無駄なく使い切るか」という視点である。

NVIDIA Platform Delivers Lowest Token Cost Enabled by Extreme Co-Design | NVIDIA Technical Blog
出典: NVIDIA Technical Blog
MLPerf® Inference v6.0: Top-tier AI performance on NVIDIA Blackwell and Blackwell Ultra
出典: nebius.com

Inference v6.0:NVIDIAが2.7倍の推論高速化、250万トークン/秒を記録

NVIDIAの技術ブログによれば、2026年4月1日にmlcommons.orgから取得されたMLPerf Inference v6.0のClosed部門結果で、288基のNVIDIA Blackwell Ultra GPUを搭載したGB300 NVL72システムがDeepSeek-R1の推論において250万トークン/秒という記録を達成した。これは2025年8月時点の性能から2.7倍の向上にあたる。NVIDIAはソフトウェア面の複数の最適化を組み合わせたことをこの伸びの要因として挙げている。

クラウド事業者のNebiusも同ベンチマークへの提出結果を公表し、NVIDIA HGX B200・HGX B300・ラックスケールのGB300 NVL72で構成したシステムがDeepSeek-R1サーバー部門(エントリー6.0-0082)およびgpt-oss 120Bインタラクティブ部門(エントリー6.0-0083)で高い結果を残したと報告している。3月30日付でMLCommons Associationによる検証済みとされ、Blackwell世代GPUの推論性能が業界標準として定着しつつあることがうかがえる。

Training v6.0:AMD Instinct MI350とASUS HGX B300が存在感

2026年6月16日にMLCommonsが発表したMLPerf Training v6.0では、新規ベンチマーク2種の追加と提出企業の多様化が特徴となった。AMDの発表では、Instinct MI350シリーズGPUがROCmソフトウェアとMXFP4対応を軸に、単一ノードからマルチノード学習へと提出範囲を拡大した「同社史上最も包括的なMLPerf提出」となったことが強調されている。

一方、ASUSは6月22日、NVIDIA HGX B300を搭載した高性能サーバー「XA NB3I-E12」がLlama 3.1-8B(サーバーおよびオフラインモード)とGPT-OSS-120B(インタラクティブモード)を含む複数部門で1位を獲得したと発表した。同社はこのサーバーがすでに世界出荷を開始しているとし、MLCommonsへの継続参加を通じて透明性のあるベンチマーク文化とAI導入の高速化を推進する姿勢を示している。

Storage v3.0:KV Cacheテスト新設とS3対応で「ストレージのMLPerf化」進む

2026年9月1日、MLCommonsはMLPerf Storage v3.0の結果を発表した。今回のバージョンではAIワークロードの多様な形態を反映するようテスト項目を拡張し、LLM推論キャッシュの読み書き性能を測る新テスト「KV Cache」を追加。さらに既存のPOSIXアクセス層に加え、S3オブジェクトストレージ層への対応も新たに実装された。StorageNewsletterも同内容を9月4日付で報じている。

直近のStorage v2.0結果を振り返ると、DDNのAI400X3が3D U-Netマルチノード環境で毎秒120.68GBの持続スループットを記録し、2RUラックマウント機でLlama3-8bチェックポイントを読み込む際には読み取り30.6GB/秒、書き込み15.3GB/秒を達成している。これに対し華為(Huawei)のOceanStor A800は8Uデュアルノード構成で255個相当のH100 GPUに対応する毎秒698GiBという最大絶対スループットを記録した。Hammerspaceのアーキテクチャは専用機器を用いず、汎用サーバー上でGPU利用率96.4%、毎秒420.8GBを達成しており、標準サーバーでの高性能化という別の方向性を示している。

業界への影響:単体性能競争からシステム設計競争へ

今回のMLPerf三部作が示すのは、AIインフラ調達における評価軸の多層化である。従来はGPUの理論演算性能やトークン処理速度が主な比較対象だったが、Storage v3.0でKV Cacheテストが標準化されたことにより、推論時のキャッシュ読み書き効率がボトルネックとして明確に可視化されるようになった。実際、DDNとNebulはNVIDIA Dynamoを用いたKV Cache高速化についてパートナー間検証を公表しているが、これは独立監査ではない点も業界では指摘されている。

Training v6.0でAMDとASUS(NVIDIA陣営)がそれぞれ異なる強みを示したことも、単一ベンダー依存からの脱却を後押しする材料となる。AI基盤の調達を検討する企業にとって、今後はGPU単体の性能表だけでなく、ストレージI/O、KVキャッシュ処理、マルチノード拡張性を含めた総合評価がMLPerf結果を読み解く上での必須事項となりつつある。

Verification

信頼ラベル確認済
一次ソース8件確認
最終検証2026.09.07
VerifiedRev. 1
sha256:d5764ce11c05435b...5302cd45

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score95/100
引用密度20/20
ソースURL数20/20
信頼ラベル15/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事

Featured Image
プロダクト & モデル報道

AIエージェント大型アップデート相次ぐ——Oracle・Arent・LM Studio Bionicが示す『自律実行×統制』の新段階

日本オラクルはOracle AI Agent Studioで組み込みエージェント1000以上・顧客デプロイ7000超・認定エキスパート8万5536人を公表。ArentはRevit連携「LightningBIM AI Agent」で特許技術を発展させた自律タスク実行機能をベータ公開。LM Studio Bionicはv1.1.3で日本語UIに対応。3社に共通するのは自然言語での大規模タスク自律実行と統制・権限管理の両立という設計思想。

2026.09.19
Featured Image
プロダクト & モデル報道

Claude Mythos徹底解剖——SWE-bench 93.9%でも非公開、後継Fable 5・Mythos 5・Opus 5が示すAnthropicの段階解禁戦略

AnthropicのClaude Mythos PreviewはSWE-bench 93.9%等で歴代最高性能ながら、Firefox脆弱性成功率72.4%という危険性から一般公開されず約40組織限定で提供された。半年後、同一基盤を共有するFable 5・Mythos 5が一般提供され、続くOpus 5はFable 5の半額の価格でそれに迫る性能を実現した。

2026.09.18
Featured Image
プロダクト & モデル報道

RAG手法、2026年は「使い分け」の時代へ——Agentic RAG・GraphRAGが標準化、Gartnerは60%頓挫リスクを警告

2026年のRAGはAgentic RAG・GraphRAG・Multimodal RAGの使い分けが導入判断の中心に。Gartnerは AI-Readyデータ不備でAIプロジェクトの60%が頓挫と予測している。

2026.09.17