OSWorld 2.0で判明した19ポイントの実力差
2026年9月時点の最新比較データによると、コンピュータ操作を伴うエージェントタスクの標準ベンチマーク「OSWorld 2.0」において、AnthropicのClaude Fable 5.1が部分完了スコア77.9%で首位に立った。これに対しOpenAIのGPT-6 Astraは72.6%、Googleの Gemini 3.8 Flashは二次情報源によれば約59.0%にとどまり、上位と下位で19ポイント近い差が生じている。この差は単なる数点の誤差ではなく、複数手順にまたがるタスク(ファイル操作、フォーム入力、アプリ切り替えを組み合わせた作業)で失敗率が積み重なった結果と見られる。速度面ではGPT-6 Astraが優位で、前世代のGPT-5.6 Solが1タスク平均75分を要したのに対し、Astraは40分で完了させ、OpenAI自身は「同等以上の完了率でタスク時間を47%削減」と説明している。一方でコスト効率ではGemini 3.8 Flashがリードしており、「精度・速度・価格」のいずれを優先するかで最適解が変わる状況が明確になった。業界関係者の間では、単一のベンチマーク順位だけでモデルを選定するのではなく、実際の業務フローに近い評価軸を自社で設計する必要性が指摘され始めている。
GPT-6 Astraは「Critical」区分の新モデル
GPT-6 Astraは、2026年7月9日にAxiosが報じた業務向け新ティア「ChatGPT Work」と共に投入されたGPT-5.6世代の後継にあたる。同モデルは1,050,000トークンのコンテキスト窓と128,000トークンの最大出力を備える一方、OpenAI独自の「Preparedness Framework」においてサイバーセキュリティリスクが初めて「Critical」に分類され、段階的展開の前に追加の安全対策が課された点が注目されている。性能面の進化だけでなく、リスク管理の枠組みが本格運用の前提条件になりつつある実態を示す事例だ。過去のGPTシリーズでは「High」区分が上限だったことを踏まえると、今回の分類は開発陣がモデルの能力向上をリスク増大と表裏一体で捉えていることの表れであり、企業の導入担当者にとっても社内セキュリティポリシーの見直しを迫る材料となる。
利用コストは無料枠ゼロ、Proは月200ドルまで
ChatGPTのAgent modeは無料プランおよびGoプランでは利用できず、最低でも月20ドルのPlusプランへの加入が必要で、その場合も月間の利用回数は約40メッセージに制限される。本格的な業務利用にはProプラン(月100〜200ドル)が求められ、エージェント機能は単純な追加機能ではなく別料金帯のサービスとして位置づけられている。この価格構造は、企業がエージェントモードを大量導入する際のコスト試算に直結する要素であり、部署単位で数十アカウントを契約する場合、月間コストは数千ドル規模に膨らむ計算になる。中小企業にとっては、後述するTachyon生成AIやmailSpeakのようにAPIキー持ち込み型で複数モデルを切り替えるサービスの方が、固定費を抑えながら精度とコストのバランスを取りやすいという声もある。
法人向けサービスは複数モデル併用が標準に
個別モデルの性能差が拡大する中、企業向けサービスでは単一モデルに依存せず複数LLMを切り替える設計が主流になっている。エムシーディースリーは2025年12月、法人向け生成AIサービス「Tachyon生成AI」にGPT-5.2 Fast/Thinking、Claude Opus 4.5/Sonnet 4.5/Haiku 4.5、Gemini 3 Pro/Flashの計7モデルを搭載し、議事録作成では1時間の会議を15分程度で文字起こし・要約する機能を提供している。また2026年6月には、メール分析からAlexaやアプリへの指示出しまで対応するmailSpeakがGemini/GPT/Claudeいずれの自前APIキーでも動作する新機能を追加しており、利用者側がコストと性能を見比べて選択できる設計が広がっている。こうしたマルチモデル対応は、特定ベンダーの値上げやサービス障害に左右されないリスク分散策としても機能しており、法人向けAI導入の事実上の標準仕様になりつつある。
リリース競争は月単位で加速
3社のモデル更新サイクルはこの1年で著しく短縮した。2025年11月だけでもGPT-5.1、グループチャット機能、GPT-5.1-Codex-Max、ショッピングリサーチが相次いで投入され、同時期にGoogleはGemini 3とNano Banana、AnthropicはClaude Opus 4.5を投入した。さらに2026年7月にはGPT-5.6が「Sol」「Terra」「Luna」の3サブモデル構成で発表され、Codexの基盤コード流出によって事前に識別子が判明する事態も起きた。こうした短サイクルの更新競争が、今回のOSWorld 2.0における19ポイント差という明確な性能序列を生み出す土壌になっている。数ヶ月おきにトップの座が入れ替わる状況は、企業のAIツール選定担当者にとって「一度決めたら数年使う」という従来の情報システム調達の発想が通用しなくなっていることを意味しており、半年に一度は主要3社のベンチマーク結果を再点検する運用体制が求められる。


