プロダクト & モデル報道

同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る

定価が同じ2つのモデルを第三者が努力量ごとに比べたところ、先に出た Sonnet がどの段階でも上だったと報じられている。xhigh 以上では差が広がる

鈴木 理恵|2026.10.01|5分|更新: 2026.10.01

入力2ドル・出力10ドルで定価が同じ Claude Sonnet 5.5 と GPT-6.1 Sol を、Artificial Analysis が努力量の段階ごとに比べた。報じられているところでは、どの段階でも Sonnet が上で、xhigh 以上では差が広がる。OpenAI の「Astra にほぼ並ぶ」という自己申告は、第三者の指標では裏付けられていない形だ。

Key Points

同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る

定価がまったく同じ2つのモデルを、第三者が同じ物差しで測った。独立の評価機関 Artificial Analysis が Anthropic の Claude Sonnet 5.5 と OpenAI の GPT-6.1 Sol を比べたところ、推論の努力量をどの段階にしても Sonnet 5.5 が上回ったと報じられている。差は努力量を上げるほど開き、xhigh 以上ではっきり広がるという。価格で並んだ2社の勝負について、最初に出た第三者の判定は、1日早く出た Anthropic 側に有利なものになった。

なお、この記事は報道ベースである。比較ページ(Artificial Analysis)の段階ごとの数字は、本紙では一次情報として確かめられていない。そのため、確認できていない点数はここでは書かない。

値札は1セント単位まで同じ

比べる前提として、2つのモデルは値段で見分けがつかない。Anthropic は9月28日に Sonnet 5.5 を出し、定価を据え置いた。100万トークンあたり入力2ドル、出力10ドル、キャッシュ読み出し0.20ドルである。翌29日、OpenAI は DevDay で GPT-6.1 Sol を発表した。入力2ドル、出力10ドルで、キャッシュ入力は0.10ドル。27.2万トークンを超える入力は2倍になる。

違いは周辺の条件にとどまる。キャッシュは Sol のほうが安く、長い入力の割増しは Sol にだけある。Sol の文脈は105万トークン、最大出力は12.8万トークンである。とはいえ、見出しになる定価は同じだ。だから、同じ金額で何が買えるかは、第三者の指標で決めるしかない。

どの段階でも Sonnet が上だった

Artificial Analysis は、同じモデルでも努力量ごとに別々に測る。報じられている比較の結論は単純で、低い段階から最上位まで、並べたどの組でも Sonnet 5.5 が Sol を上回った。努力量をそろえても、Sol が逆転する段階はなかったとされる。

この結果は、OpenAI の売り文句と食い違う。OpenAI は Sol について、エージェント型のコーディング、コンピュータ操作、専門業務で「Astra の知能にほぼ並び、価格は Astra の5分の1」とうたっていた。自己申告では、GDP.pdf と AutomationBench で Opus 5.5 を上回るともしている。

一方、既報によれば、Artificial Analysis の Intelligence Index で Sonnet 5.5 は56だった。Opus 5.5 の58に次ぐ2位で、GPT-6 Astra の53を上回る(二次情報)。Astra にほぼ並ぶ程度のモデルは、この物差しでは、Astra より上にいる Sonnet に届かない計算になる。第三者の比較は、その関係をそのまま映した形である。

xhigh 以上で差が広がることの意味

比較でもう1つ目を引くのは、差が一定ではないことだ。報道によれば、低い努力量では差が比較的小さく、xhigh と max で広がる。努力量を上げたときに伸びる幅が、Sonnet のほうが大きいということになる。

この伸び方は、Anthropic の直近のモデルでも見られた。Artificial Analysis は9月22日に Opus 5.5 を測り、努力量ごとの指数を max 58、xhigh 56、high 54、medium 51、low 42 と出している。考える量を増やすほど点が素直に上がる形である。これに対して前の世代の GPT-6 Sol は、max でも48にとどまっていた。

使う側にとっては、どう設定するかで判断が変わる。数時間かけてエージェントに任せるような仕事では、努力量を上げて使うことが多い。報じられた結果が正しければ、同じ単価でも、難しい仕事になるほど Sonnet を選ぶ理由が増える。逆に、低い努力量で大量にさばく使い方なら、差は小さい。そこではキャッシュの安さや文脈の長さといった Sol の条件が効いてくる余地がある。

判定を読むときの注意

この結果には、いくつか限りがある。第一に、段階ごとの点数、指標を最後まで解くのに使った費用、出力トークンの量は、本紙では確かめられていない。費用に関わる数字は特に大事だ。単価が同じでも、使うトークンの量が違えば1タスクあたりの費用は変わる。OpenAI は Sol について、Terminal-Bench Science のタスクあたり費用を5.47ドル(Opus 5.5 は23.21ドル)と自己申告している。

第二に、Artificial Analysis の指数は総合点にすぎない。個別の業務で優劣が入れ替わることはありうる。Epoch AI や LMArena による Sonnet 5.5 と Sol の評価は、まだ出ていない。

それでも、この比較が持つ意味ははっきりしている。9月28日と29日、2社は同じ価格帯に、1日違いでモデルを並べた。値段では差がつかなかったので、勝負は性能に移った。そして最初に出た第三者の判定では、先に出た側がどの段階でも上だった。OpenAI は最も能力の高いモデルの訓練を止めたまま、利用を安い Sol の系列に寄せようとしている。その主力が、同じ値段の相手に全段階で負けたと報じられたことになる。

風刺画: 同じ2ドル/10ドルでも差は出た Artificial Analysis の比較で、Sonnet 5.5 が全段階で GPT-6.1 Sol を上回る

Editorial Cartoon

本記事がもたらす影響を風刺的に描いたひとコマ漫画

Verification

信頼ラベル報道
一次ソース1件確認
最終検証2026.10.01
VerifiedRev. 1
sha256:3e4511e67e36c1b3...11f21fd7

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score76/100
引用密度9/20
ソースURL数10/20
信頼ラベル12/15
表現の慎重さ15/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事