9月22日、AnthropicがOpus 5.5を、OpenAIがGPT-6 Solを発表したんだよね。しかも2つの発表の間はたったの90分。ハルはこの3日間、ネット上の実測レポートやGitHubに上がった報告を片っ端から追いかけてみた(自分の手元で動かしたわけじゃなくて、編集部としてのリサーチだよ)。そこでわかったのは、実際に回した人たちが気にしていたのは「100万トークンでいくら」じゃなかったってこと。「この仕事1件でいくらかかって、何分で終わった?」を測っていたんだよ 👀
結果は2つに分かれた。値下げがそのまま効いた現場と、トークンが増えたり処理が遅くなったりして値下げ分が消えちゃった現場。順番に見ていこう。
まず値札の話:どっちも下げたけど、下げ方が違う
Anthropic公式ページによると、Opus 5.5の料金は100万トークンあたり入力$5→$4、出力$25→$20。2割引きだね。キャッシュ(同じ前置きを毎回読ませるとき、2回目以降を安く読める仕組み)の読み出しは$0.50→$0.20で、こっちは6割引き。さらに同じ仕事をこなすのに使うトークン自体も減るので、タスク単位だと約40%安くなる、というのが公式の説明である。
同じページで、トレーディング会社のOptiverは、同じ品質の結果をターン数(AIとのやりとりの往復回数)・時間・出力トークンのどれもほぼ半分で出せて、費用が40〜50%減ったと報告している。ターミナル操作の課題をどれだけ解けるかを測るTerminal-Bench 4.0でも、52.3%→66.4%に伸びた。
OpenAIのほうはもっと思い切っていて、GPT-6 Solは$4/$20→$2/$10、軽量版のLunaは$0.20/$1.20→$0.10/$0.50。ほぼ半額だよ。じゃあSolのほうが安いの?っていうと、そう単純でもない。FinOps LLMの分析では、1タスクあたりの費用はSolが$0.13〜$1.06、Opus 5.5が$1.34〜$5.98と報じられている。そのうえで、性能スコア47.5くらいまでの安い価格帯ではSolが最安、それより上の品質を求めるとOpus 5.5のほうが割安になるらしい。Opus 5.5のmedium設定は、旧Opus 5のhigh設定よりスコアが3.1高くて、費用は63%安いとも書かれている。
ハルが一番大事だと思ったのは、入力トークンが総費用の49〜70%を占めるって指摘。つまり、どのモデルを選ぶかと同じくらい、キャッシュをちゃんと効かせるかで請求額が変わるってことなんだよね 💡 複数のモデルをコストと性能で振り分けるLLMゲートウェイが最近よく話題になるのも、このへんが理由だと思う。
発表まわりを動画でも追いたい人向けに、1本置いておくね。
値下げがそのまま効いた現場:速く、短く、安く
うまくいった報告から見ていこう。Everyのレビュー記事では、Dan Shipper、Kieran Klaassen、Mike Taylorら5人が、発表前の7日間、Claude Codeとデスクトップアプリで実際の仕事にOpus 5.5を使っている。タイトルどおり、GPT/Codexに移っていた社内メンバーがClaudeに戻り始めたそうだよ。
数字もわかりやすい。Rubyの同じ課題で、Opus 5.5のコードは14行、Fableは26行。短く書けるぶん、読む人もAIも楽になる。ファイルアップロード機能の実装では、8分で17ファイル・251行を書き上げた。文章の読みやすさの指標(Flesch-Kincaid。数字が小さいほど読みやすい、つまり何年生から読めるかの目安)も7.97→6.95に下がっている。
Scale My Vibe CodeのMaab Saleemさんが12時間試した記事では、20万行あるコードベースの監査(全体を読んで問題点を洗い出す作業)が、Opus 5では20時間以上かかっていたのに3時間を切り、トークンも2.5分の1になったと報告している。これは大きいよね 🚀 ただ、この記事はOpus 5の単価を$10/$50と書いていて、公式の$5/$25と食い違っている。時間とトークンの比較は参考になるけど、そこから計算した金額の差はそのまま信じないほうがいいと思う。本人も「改善は劇的ではない」と書いていて、プロンプトに「よく考えて」と足しても待ち時間が延びただけだったそうだよ。
ここまでの話をまとめると、Opus 5.5が得をさせてくれるのは「同じ仕事を少ないトークンで終わらせる」ときなんだよね。単価が下がっていて、使う量も減る。この2つが重なると、公式の言う4割引きに近づく。
帳消しになった現場:トークンが増える、時間が倍になる
ここからは、うまくいかなかった話。むしろこっちのほうが読みごたえがあった。
AIでコードレビューをするCodeRabbitは、公式ブログで、本番で使っている基準モデルとOpus 5.5(標準設定とMax設定)を同じデータで比べている。難しい13件では、見つけた問題が基準モデル5件→標準8件→Max 10件と大きく増えた。指摘の精度(指摘のうち本当に正しかった割合)も29.4%→66.7%(標準)に上がった。ここだけ見ると大勝利なんだけど、よくある80パターンでは、検出数は49件→51件と少し増えただけで、精度は39.3%→38.6%、Max設定だと35.7%まで下がった。指摘コメントの数も116件→127件(標準)、140件(Max)と増えている。そしてトークン消費は基準モデルより40〜60%多い。結論は「単価が下がっても、本番のレビュー費用が下がるかは各自で確かめるべき」。はっきり書いてくれていて助かるよね。
Everyの5人も弱点を隠していない。制約をかけないと仕事を抱え込みすぎて、トークンをどんどん使ってしまう。ゴルフゲームの試作では、止める仕組みを入れなかったら1時間52分も走り続けた。締め切りのあるトレーニング計画の課題では、10分以内に本体を出せずに失敗。自分で書いたものを自分で見直す自己レビューも当てにならなかったそうだよ 🤔
GPT-6 Sol側も似たようなことが起きている。openai/codexのIssue #47656では、Plus契約のWindowsユーザーが、GPT-5.6 Solなら約20分で終わっていたタスクが、GPT-6 Solだと40〜50分以上かかると報告している。試した10件中9件で再現した。シェルコマンド自体はすぐ終わるのに、compaction(会話が長くなったとき、古いやりとりを要約して詰め直す処理)の間、アプリが何分も止まっているらしい。単価が半分でも、待ち時間が倍になったら人件費で取り返されちゃうよね。
Issue #47787の比較はもっと複雑だった。同じ実務3件を新旧モデルで並べたところ、日次レビューではGPT-6 Solのトークンは7.3M→2.8Mと大きく減った。でも、手順書を読んだのに、確定した事実をローカルのファイルに書き戻さなかった。5.6は5ファイルを同期したのに、6は0件。しかも最後は「ローカルの記録は変更していない」と報告して終わっている。逆にコードレビューBでは、トークンが6M→8.5Mに増えた代わりに、5.6が見逃したCASCADE削除(親のデータを消すと子のデータも連鎖して消える設定)の欠陥を見つけ、実際のPostgreSQLで再現も確認できた。本人も、各1回しか試しておらず、どちらのモデルの出力か伏せた盲検でもないと断っている。
ほかにも、Codexで新しくなったセキュリティ分類器(危ない操作かどうかを判定する仕組み)が、許可済みの長時間処理を何度も止めて人の確認を求める、という報告が続いている。防御側の業務や普通のバグ調査でもcyber_policyで止まるそうで、Vellumも取り上げていた。MindStudioの比較では、Opus 5.5の出力は見栄えがいいけれど、Solの約2〜4倍のコストがかかったと報じられている。
そもそも使えなかった現場と、じゃあどう選ぶ?
もうひとつ地味に痛かったのが、使い始めるまでの待ち時間。anthropics/claude-codeのIssue #96130によると、安定版(stable)のClaude Codeはv2.1.267のままで、Opus 5.5を指定すると「2.1.280以上が必要」という400エラーで止まる。Homebrewのcask(Macでアプリを入れるときの配布パッケージ)も2.1.267のまま。安定版はだいたい2週間分遅れていたので、Homebrewで入れている人は待つしかなかった。モデルが出た日と、自分の環境で使えるようになる日は別なんだよね。
じゃあ結局どっちを使えばいいの?っていう疑問には、Lenny's NewsletterのClaire Voさんの盲検テストがヒントになる。メール、PRD(製品の要件をまとめた文書)、フロントエンドの試作、バックエンド、長時間動くエージェント、SVG、動画編集の7種類の課題を、どのモデルの出力か伏せて採点している。総合ではGPT-6 Astraを推していて、長時間エージェントと企業向けの画面づくりはOpus 5.5、わかりやすい文章と価格ではSolが勝った。面白いのは、LLMに採点させた順位が本人の評価と食い違ったこと。自動採点だけで決めると外すかもしれない、ってことだよね。
もう1本、動画も置いておくね。
3日分の報告を追いかけて、ハルが思ったのはこういうこと。1タスクの費用は、単価×使ったトークン数だけじゃ決まらない。そこに待ち時間と、書き戻し忘れみたいなやり直しの手間が乗ってくる。Opus 5.5は、放っておくと抱え込みすぎるから、時間やトークンの上限を決めて使うと強い。GPT-6 Solは安いけど、長い作業でcompactionに引っかかると時間で損をする。だから、いつもの仕事を2〜3件選んで新旧で並べて、トークン数と時間とやり直しの回数をメモしておくのがいちばん確実だと思う 📊 自分の現場がどっちに分かれるかは、自分の数字でしかわからないんだよね。




