プロダクト & モデル確認済

MLPerf の推薦テストが「履歴を系列で読む」HSTU に替わる——DLRMv4 は埋め込み 560GB、1台には載らない

特徴を掛け合わせる旧来の DLRM をやめ、生成型推薦の負荷を測る。AMD・Meta・NVIDIA・ByteDance が共同で書いた

鈴木 理恵|2026.10.04|8分|更新: 2026.10.04

MLCommons は10月1日、MLPerf Training の推薦モデルのテストを DLRMv4 に改めると説明した。特徴交差の層を、利用者の操作履歴をそのまま系列として読む HSTU に置き換える。埋め込みだけで560GBあり、複数のアクセラレータに分けて載せる。測るのは生成型推薦の負荷になる。

Key Points

MLPerf の推薦テストが「履歴を系列で読む」HSTU に替わる——DLRMv4 は埋め込み 560GB、1台には載らない

MLCommons は10月1日、業界標準のベンチマーク MLPerf Training の推薦モデルのテストを、DLRMv4 に改めると説明した(MLCommons のブログ、一次情報)。これまでの DLRM は、利用者と商品の特徴をまとめ、それらを掛け合わせて推薦を出す設計だった。DLRMv4 はこの部分を、利用者の行動履歴をそのまま系列として読む HSTU に置き換える。その結果、ベンチマークで測る中身も変わる。埋め込みだけで560GBあり、複数のアクセラレータに分けて載せる「生成型推薦」の負荷になる。

記事は MLCommons の DLRMv4 タスクフォースが書いた。Chris Cai、Linjian Ma、Nan Zhang、Haolei Pei らで、AMD、Meta、NVIDIA、ByteDance の共同執筆である。推薦を大規模に動かす事業者と、その計算基盤を売る半導体企業が、一緒にものさしを作り直したことになる。

何が替わるのか——特徴の掛け合わせから、履歴の系列へ

タスクフォースは、まず本番の現場がすでに変わったと書いている。

production recommendation systems at hyperscale operators have shifted from compressing user behavior into a small set of aggregated dense features to representing each user's recent interaction history as a per-event token sequence.

訳: ハイパースケール事業者の本番の推薦システムは、利用者の行動を少数の集約済み密特徴に圧縮するやり方から、直近の操作履歴を1回の操作ごとのトークン列として表すやり方へ移った。

— MLCommons DLRMv4 タスクフォース(Chris Cai、Linjian Ma、Nan Zhang、Haolei Pei ほか)(MLCommons(AMD・Meta・NVIDIA・ByteDance の共同執筆)), 2026-10-01, 出典

旧来の方式は、ある利用者が直近にどの動画を見て、どの商品を買ったかを、少数の数値にまとめてしまう。まとめた特徴を掛け合わせ、クリックの確率を出す。一方で新しい方式は、1回の操作を1つのトークンとして扱う。言語モデルが文章を読むのと同じように、履歴を順番どおりに読む。順序や間隔といった情報を、まとめる段階で捨てずに済む。

この新方式の中心が HSTU である。タスクフォースはこう説明する。

DLRMv4 fills that gap by replacing the feature-interaction stack with HSTU, a transducer that reads a user's interaction history directly as a sequence

訳: DLRMv4 はこの差を埋めるため、特徴交差の層を HSTU に置き換える。HSTU は利用者の操作履歴をそのまま系列として読むトランスデューサーである。

— MLCommons DLRMv4 タスクフォース(MLCommons(AMD・Meta・NVIDIA・ByteDance の共同執筆)), 2026-10-01, 出典

ここで「この差」と呼んでいるのは、本番で動いている推薦と、ベンチマークが測っている推薦とのずれのことだ。MLPerf の推薦テストが旧来の特徴交差型のままでは、点数が良くても、事業者が実際に回している負荷での速さを示さない。DLRMv4 は、ものさしを現場に合わせ直す改訂である。HSTU は、Meta の研究者が2024年に「生成型推薦」の土台として発表した構造だ。

なぜ今か——計算を足すほど伸びる

切り替えの理由として、タスクフォースはもう1点を挙げる。規模を大きくしたときの伸び方である。

Models built this way keep improving as compute and parameters grow, while earlier feature-interaction designs flatten out.

訳: この方式のモデルは計算量とパラメータを増やすほど性能が伸び続ける。以前の特徴交差型の設計は頭打ちになる。

— MLCommons DLRMv4 タスクフォース(MLCommons(AMD・Meta・NVIDIA・ByteDance の共同執筆)), 2026-10-01, 出典

LLM で見慣れた、計算量とパラメータを増やすほど性能が伸びる性質が、推薦でも系列型にすると表れるという主張だ。特徴交差型は、どこかで頭打ちになる。事業者がこれから推薦にかける計算資源を増やしていくなら、伸び続ける方式を基準に据えるのが自然になる。ベンチマークの改訂は、推薦が「計算をつぎ込むほど得をする」分野へ移ったことを、業界の共同作業として認めた形でもある。

560GB の意味——1台に載らない負荷を測る

見出しの数字は、ハードウェアの読者にとって最も重い点である。DLRMv4 は、埋め込みだけで560GBある。現在のアクセラレータ1基のメモリには収まらない。そのため、埋め込みの表を複数のアクセラレータに分けて載せることが前提になる。

推薦の学習では、計算そのものよりも、巨大な埋め込みの表から必要な行を引いてくる処理が重くなりやすい。表を分けて載せれば、どのアクセラレータがどの行を持つかを決め、ほかのアクセラレータに問い合わせる通信が生じる。テストの成績は、演算の速さだけでは決まらない。メモリの容量、メモリの帯域、アクセラレータ間をつなぐ回線の太さ、表の分け方を決めるソフトウェアの出来が、そろって点数に表れる。

そこに、系列を読む HSTU の計算が加わる。履歴が長ければ、注意機構に似た計算が増えていく。つまり DLRMv4 は、埋め込みを引く負荷と、トランスフォーマーに近い系列の計算を、1つのテストで同時に問う。LLM の学習でも推論でもない、生成型推薦という第3の負荷を、名前の付いた形で測ることになる。

誰にとっての改訂か

共同執筆の顔ぶれには意味がある。Meta と ByteDance は、系列型の推薦を本番で大規模に回す側である。AMD と NVIDIA は、それを動かすアクセラレータを売る側である。今後の MLPerf の結果で、推薦の欄の数字は、どの社のシステムがハイパースケールの推薦を速く学習できるかを示す材料になる。各社のシステムが560GBの埋め込みをどう分け、どれだけの台数で回すのかが、比べどころになる。

ただし、この記事で確かめられたのは、方式の切り替え、HSTU の採用、埋め込みの規模、複数のアクセラレータに分けて載せる前提までである。どの回の MLPerf Training から正式に使うのか、品質の目標値、データセットの中身、各社の最初の提出結果は、今後の公表を待つ必要がある。MLCommons の Insights のページに続報が載るかを追う。

風刺画: MLPerf の推薦テストが「履歴を系列で読む」HSTU に替わる——DLRMv4 は埋め込み 560GB、1台には載らない

Editorial Cartoon

本記事がもたらす影響を風刺的に描いたひとコマ漫画

Verification

信頼ラベル確認済
一次ソース2件確認
最終検証2026.10.04
VerifiedRev. 1
sha256:9b7c128d0c35ea5f...59daf390

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score85/100
引用密度20/20
ソースURL数10/20
信頼ラベル15/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事

Gemini 4 Argon の第三者評価が出た——Astra と同点、ハルシネーションは最少、ただしトークンは倍以上使う
プロダクト & モデル報道

Gemini 4 Argon の第三者評価が出た——Astra と同点、ハルシネーションは最少、ただしトークンは倍以上使う

Gemini 4 Argon は Artificial Analysis の総合指数で GPT-6 Astra と同じ53点に並び、ハルシネーションは最も少なかったと報じられている。ただし1タスクで使う出力トークンは Astra の倍以上という。定価の差だけでは、実際の費用は分からない。

2026.10.03
Gemini 4 Argon、最初の提供先はサイバー防御の専門家だけ——強いモデルを『防御側に先に渡す』形が3社にそろう
プロダクト & モデル報道

Gemini 4 Argon、最初の提供先はサイバー防御の専門家だけ——強いモデルを『防御側に先に渡す』形が3社にそろう

Google が Gemini 4 の最初のモデル Argon を「これまでで最も強いモデル」と呼び、最初はサイバー防御の専門家だけに渡したと報じられた。OpenAI の Daybreak Red や Anthropic の Mythos Preview と同じく、最も強いモデルをまず限られた防御側に渡す形が3社にそろった。ただし、提供の条件や一般公開の時期はまだ分からない。

2026.10.02
同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る
プロダクト & モデル報道

同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る

入力2ドル・出力10ドルで定価が同じ Claude Sonnet 5.5 と GPT-6.1 Sol を、Artificial Analysis が努力量の段階ごとに比べた。報じられているところでは、どの段階でも Sonnet が上で、xhigh 以上では差が広がる。OpenAI の「Astra にほぼ並ぶ」という自己申告は、第三者の指標では裏付けられていない形だ。

2026.10.01