プロダクト & モデル確認済

同点でコストが24倍 — 独立ベンチマークが暴いたのは性能差ではなく浪費の差だった

Xiaomi の「Opus 5 同等」は崩れた。だが本題は、同じ46点に至るまでに一方が4,967ドル、もう一方が206ドルしか使わなかったことだ

鈴木 理恵|2026.09.22|5|更新: 2026.09.22

独立ベンチマークが届き、Xiaomi MiMo-V2.6-Pro は46点で Claude Opus 5 に5点届かず、同等の主張は裏付けられなかった。だが同じ46点の Grok 4.7 との測定費用差は24倍。スコア表は単価表とセットでしか読めない。

Key Points

同点でコストが24倍 — 独立ベンチマークが暴いたのは性能差ではなく浪費の差だった

第三者検証待ちだった数字が、ようやく届いた。Artificial Analysis の独立測定で、Xiaomi の MiMo-V2.6-Pro は46点を記録した。Claude Opus 5 には5点届いていない。9月22日の公開時に Xiaomi が掲げた「大半のエージェント系ベンチマークで Claude Opus 5 および GPT-5.6 Sol と同等」という主張は、少なくともこの指標の上では裏付けられなかった。

ここで記事を終えるのが、ベンチマーク報道の通例である。主張があり、検証があり、5点足りなかった。だが同じ測定結果の別の列に、はるかに大きな数字が載っている。同じ46点を出したモデルの、測定にかかった費用だ。MiMo-V2.6-Pro が206.66ドル。Grok 4.7 が4,967.35ドル。約24倍である。

5点の差と、4,760.69ドルの差

並べ方を変えるとよくわかる。スコアの側で議論になっているのは、46対51という5点の開きだ。同じ表のコストの側で起きているのは、206.66ドル対4,967.35ドル、差額にして4,760.69ドルの開きである。1点あたりに換算すれば、MiMo-V2.6-Pro が約4.5ドル、Grok 4.7 が約108ドル。知能指数はほぼ並び、そこへ到達するための単価は24倍離れている。

どちらが「重要な差」かは、読者がその数字で何を決めるかによる。モデル選定会議で5点を根拠に意思決定する人はあまりいない。5,000ドル近い差を根拠に意思決定する人は、いくらでもいる。

単価は据え置かれ、消費量が跳ねた

誤解を避けておくと、Grok 4.7 のトークン単価は高くない。xAI は4.5(7月28日)、4.6(8月14日)、4.7(9月21日)と約5週間サイクルで更新しながら、入力2ドル・キャッシュ0.50ドル・出力6ドルという価格を据え置いてきた。これはコーディングエージェント領域での価格性能の締め上げとして、意図的に設計された値付けである。

それでも請求額は4,967.35ドルになる。単価が据え置かれていても、消費量が据え置かれていないからだ。Grok 4.7 は数時間規模のタスクに対する強化学習、自己検証、文脈管理を強化したモデルとして出荷された。自己検証とは、同じ問題を何度も見直すことである。文脈管理とは、50万トークンの窓を実際に使うことである。この設計思想は、そのままトークン消費量の設計思想でもある。公開直後に VentureBeat が「トークン消費量が実運用のROIを脅かす」と指摘し、The New Stack が「数時間動くよう作られているが大半は失敗する」と書いたのは、独立測定の請求書が出る前の観測だった。請求書はその観測を追認した。

つまり、モデルの公表価格表はもはや請求額の予測に使えない。エージェントハーネスの中で何回ループが回り、何回自己検証が走るかを掛け合わせて初めて金額が出る。ベンダーが公開しているのは掛け算の片方の数字だけである。

スコア表は単価表とセットでしか読めない

この構図は、今月の中国勢の動きを一本の線でつなぐ。StepFun は Step 5 Preview について、総600B・アクティブ27B というスパース構成で Artificial Analysis Intelligence Index 44 に到達し、タスク当たり0.71ドル(Kimi K3 Max は2.00ドル)と主張した。Xiaomi の MiMo-V2.6-Pro も、総1.02兆・アクティブ42B のスパースMoE でありながら、オープンウェイトで技術報告とRL環境と訓練コードまで同時に開けている。規模ではなくタスク単価を最適化している、という仮説を、今回の206.66ドルは外部の測定として裏づけた形だ。

そして、オープンウェイトであることの意味も変わる。ローカルLLM の議論はこれまで主にプライバシーと可用性の話だった。1点あたり108ドル対4.5ドルという数字が公開された後では、単純に会計の話になる。重みが手元にあるモデルは、24倍の掛け算の外側に立てる。

それでも同等ではない、という事実は残る

コストの話が大きいからといって、5点が消えるわけではない。Xiaomi の同等性の主張は、独立測定では通らなかった。自己申告値として公表されていた DeepSWE v1.1 71.9、Toolathlon-Verified 76.9、CyberGym 94.0 という数字と、外部の総合指標での46点は、別々に扱う必要がある。同様に、Grok 4.7 の CursorBench 4.0 46.3%、DeepSWE v1.1 71.0%、Terminal-Bench 4.0 38.0% も、StepFun の44も、依然としてベンダー申告である。今回コストの列まで含めて外から測られたのは、この2モデルの組み合わせだけだ。

本紙が次に追うのは、この「コストの列」が定着するかどうかである。スコアだけを載せた比較表は、今日から片肺の資料になった。同じ点数を取るのにいくらかかったかを書かない表は、読者に24倍を隠していることになる。

風刺画: 同点でコストが24倍 — 独立ベンチマークが暴いたのは性能差ではなく浪費の差だった

Editorial Cartoon

本記事がもたらす影響を風刺的に描いたひとコマ漫画

Verification

信頼ラベル確認済
一次ソース1件確認
最終検証2026.09.22
Signature Pending

デジタル署名は生成待ちです。

Ethics Score74/100
引用密度9/20
ソースURL数10/20
信頼ラベル15/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事