プロダクト & モデル報道

Gemini 4 Argon の第三者評価が出た——Astra と同点、ハルシネーションは最少、ただしトークンは倍以上使う

定価は Astra の5分の1でも、1タスクで出力トークンを倍以上使えば差は縮む。同じ点数のモデルを費用で比べるなら、見るべきは定価ではなくタスクあたりの費用だ

鈴木 理恵|2026.10.03|6分|更新: 2026.10.03

Gemini 4 Argon は Artificial Analysis の総合指数で GPT-6 Astra と同じ53点に並び、ハルシネーションは最も少なかったと報じられている。ただし1タスクで使う出力トークンは Astra の倍以上という。定価の差だけでは、実際の費用は分からない。

Key Points

Gemini 4 Argon の第三者評価が出た——Astra と同点、ハルシネーションは最少、ただしトークンは倍以上使う

Google が9月30日に、サイバー防御の専門家に限って出した Gemini 4 Argon について、最初の第三者評価が出たと報じられている。The Decoder と Trending Topics によれば、Artificial Analysis の総合指数(Intelligence Index)で Argon は53点で、OpenAI の GPT-6 Astra と並んだ。ハルシネーションは比べたモデルの中で最も少なかったという。ただし、1タスクを解くのに使う出力トークンは Astra の倍以上だったとされる。いずれも報道ベースで、Artificial Analysis の比較ページそのものは今回、本紙では確かめられていない。

この記事で伝えたいのは1点である。点数が同じでも、トークンの使い方で費用は大きく変わる。だから定価を並べるだけでは、実際にいくらかかるかは分からない。

報じられた評価の中身

Argon の53点は、Astra(約53)、Fable 5.1(53)と同じ水準である。Artificial Analysis の同じ指数で、首位は Opus 5.5 の58、2位は9月28日に出た Sonnet 5.5 の56だ(いずれも既報)。The Decoder は見出しで、Argon は OpenAI と Anthropic との差を詰めたが、はっきり首位に立ったわけではないと書いている。

Google は公開のときに、Argon が GPT-6 Astra、Fable、Opus を上回ると主張していた(TechCrunch と 9to5Google の報道による)。第三者の総合指数で見る限り、この主張は裏付けられていない。Astra と Fable とは同点で、Opus 5.5 には5点届いていない。ただし Google が比べた『Opus』が Opus 5 なのか Opus 5.5 なのか、どのベンチマークの話なのかは、二次情報からは分からない。

定価では5分の1、トークンでは倍以上

Argon の定価は100万トークンあたり入力2ドル、出力10ドルで、GPT-6 Sol や Sonnet 5.5 と同じ価格帯にある。GPT-6 Astra は入力10ドル、出力50ドルなので、定価だけを見ると Argon は5分の1になる。

ところが、1タスクで出す出力トークンが Astra の倍以上なら、話が変わる。出力の費用だけで計算すると、5倍の差は2.5倍以下まで縮む。出力トークンが3倍なら、差は1.7倍ほどになる。さらに Argon は出力の上限が100万トークンと大きく、長く考え、長く書くことを許す作りになっている。同じ点を取るのに Astra よりどれだけ多く書いているのか。その量が、請求額をそのまま左右する。

入力トークンの量や、キャッシュがどれだけ効くかでも、実際の費用は変わる。報道からは、指数を一通り測るのにかかった総額がいくらだったのかまでは確かめられていない。それでも方向ははっきりしている。『同じ点数で5分の1の価格』という見出しのような比べ方は、トークンの量を勘定に入れると成り立たない。

同じ点数で費用が大きく違うのは、初めてではない

Artificial Analysis の数字では、前にも同じことが起きている。9月下旬の指数では、Grok 4.7 と Xiaomi の MiMo-V2.6-Pro がともに46点だった。それなのに、指数を測るのにかかった費用は Grok 4.7 が4,967ドル、MiMo-V2.6-Pro が207ドルで、約24倍も違った。Grok 4.7 は完走までに出力トークンを2億4,000万使っている(GPT-6 Astra の max は2,700万)。定価の差より、トークンの量の差のほうが大きく効いた例である。

ラボの側も、定価ではなくタスクあたりの費用で売り込み始めている。OpenAI は GPT-6.1 Sol について、Terminal-Bench Science のタスクあたり費用が5.47ドル、Opus 5.5 が23.21ドルだと自分で示した。Anthropic も Sonnet 5.5 を、定価は変えずに『タスクあたり最大30%安い』と打ち出した。Sol、Sonnet 5.5、Argon の3つは、どれも入力2ドル、出力10ドルで定価が完全に同じである。だから違いが出るのは、1タスクに何トークン使うかだけになる。Argon はこの比べ方で、ほかの2つより不利に出る可能性がある。

ハルシネーション最少の読み方

ハルシネーションが最も少ないという結果は、Argon の強みとして報じられている。ただ、この種の率は、答えを控えた割合と一緒に見る必要がある。9月22日の GPT-6 Sol では、ハルシネーション率が92%から60%に下がった。しかしその一部は、答えようとする割合が99%から83%に減ったためだった。Argon が知らないことを正しく『知らない』と言えているのか、答える数そのものを減らしているのか。報道からは、まだ分からない。

トークンの多さとの関係も、まだ確かめられていない。長く考えて検算しているから誤りが少ない、という見方はありうる。その場合、正確さと費用を交換していることになる。正確さのためにいくらまで払うかは使う側が決めることで、それを決めるには点数と率のほかに、トークンの量が欠かせない。

使う側が見るべき数字

Argon は今のところ Fairwind Program の中だけで提供されている。一般向けの API と Ultra がいつ出るかは、示されていない。多くの利用者は、まだ自分の手で費用を測れない。だからこそ、一般提供の前に出たこの第三者評価が、判断の材料として重い。

エージェントの費用は、モデルの定価、1タスクに使うトークン、ハーネスがどれだけ文脈を使い回せるかの掛け算で決まる。同じ53点の Astra と Argon でも、定価の比は5対1で、トークンの比は1対2以上と報じられている。この2つを掛けて初めて、自分の作業でいくらかかるかが見える。点数表の隣に、タスクあたりの費用と出力トークンの量を並べる。モデルを選ぶときに必要なのは、その手間である。

出典:The Decoder、Trending Topics(いずれも報道ベース。Artificial Analysis の一次データは未確認)

風刺画: Gemini 4 Argon の第三者評価が出た——Astra と同点、ハルシネーションは最少、ただしトークンは倍以上使う

Editorial Cartoon

本記事がもたらす影響を風刺的に描いたひとコマ漫画

Verification

信頼ラベル報道
一次ソース2件確認
最終検証2026.10.03
VerifiedRev. 1
sha256:752ec20011c8ea3a...af069015

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score82/100
引用密度15/20
ソースURL数10/20
信頼ラベル12/15
表現の慎重さ15/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事

Gemini 4 Argon、最初の提供先はサイバー防御の専門家だけ——強いモデルを『防御側に先に渡す』形が3社にそろう
プロダクト & モデル報道

Gemini 4 Argon、最初の提供先はサイバー防御の専門家だけ——強いモデルを『防御側に先に渡す』形が3社にそろう

Google が Gemini 4 の最初のモデル Argon を「これまでで最も強いモデル」と呼び、最初はサイバー防御の専門家だけに渡したと報じられた。OpenAI の Daybreak Red や Anthropic の Mythos Preview と同じく、最も強いモデルをまず限られた防御側に渡す形が3社にそろった。ただし、提供の条件や一般公開の時期はまだ分からない。

2026.10.02
同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る
プロダクト & モデル報道

同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る

入力2ドル・出力10ドルで定価が同じ Claude Sonnet 5.5 と GPT-6.1 Sol を、Artificial Analysis が努力量の段階ごとに比べた。報じられているところでは、どの段階でも Sonnet が上で、xhigh 以上では差が広がる。OpenAI の「Astra にほぼ並ぶ」という自己申告は、第三者の指標では裏付けられていない形だ。

2026.10.01
Featured Image
プロダクト & モデル報道

GPT-6 Astra vs Claude Fable 5.1 vs Gemini 3.8 Flash——エージェントモード実力差19ポイント、価格帯も三分化

OSWorld 2.0でClaude Fable 5.1が77.9%、GPT-6 Astraが72.6%、Gemini 3.8 Flashが約59.0%。ChatGPT Agent modeは月20ドルのPlusでも上限あり、Pro版は月200ドル。

2026.09.30