GPT-5.5が総合性能でトップに返り咲き、14ベンチマークを制覇
OpenAIが4月23日にリリースしたGPT-5.5は、一般公開されているAIモデルの中で最高性能を達成した。VentureBeatの報告によると、GPT-5.5は14のベンチマークで最高得点を記録し、特にTerminal-Bench 2.0では82.7点を獲得してClaude Opus 4.7の69.4点、Google Gemini 3.1 Proの68.5点を大きく上回っている。
この性能向上は、エージェント型コンピューター使用(OSWorld-Verifiedで78.7点)、経済知識作業(GDPvalで84.9%の勝率)、専門的サイバーセキュリティ(CyberGymで81.8点)、複雑な数学問題(FrontierMath Tier 1-3で51.7点)の各領域で特に顕著である。一方で、ソフトウェア工学とツールなしの推論においてはClaude Opus 4.7が優位を保ち、Gemini 3.1 Proは学術的推論と金融分析の3カテゴリーで最高性能を維持している。
しかし、この性能向上には大幅なコスト増加が伴う。OpenAIはAPI開発者向けに大幅な料金引き上げを実施しており、企業は性能向上と運用コストの最適バランスを慎重に検討する必要がある。
Claudeが実用性重視の連携戦略で差別化を図る
Anthropicは4月24日、Claudeの新たなコネクター機能として15のサードパーティサービスとの連携を発表した。この機能により、ユーザーはSpotify、Uber、Resy、TurboTax、Instacartなどの主要サービスを通じて、音楽再生、配車・デリバリー注文、レストラン予約、税務処理、食材購入などをClaude経由で実行できるようになる。
特にSpotifyとの連携では、音楽やポッドキャストの推奨機能に加えて、Spotify Connectを活用したデバイス間音楽転送機能も提供される。TurboTaxとの統合では、「専門家に裏付けられたAI」として、リアルタイム税務見積もりと即座の還付予測が可能となり、TurboTaxの核心フレームワークと同等の処理能力を提供する。
完全なコネクターリストには、AllTrails、Audible、Booking.com、Instacart、Intuit Credit Karma、Intuit TurboTax、Resy、Spotify、StubHub、Taskrabbit、Thumbtack、TripAdvisor、Uber、Uber Eats、Viatorが含まれ、Anthropicは「さらなる追加予定」と発表している。
さらに、4月28日にはAdobe、Blender、SketchUpなどクリエイティブアプリケーションとの連携も発表され、複雑なツールのチュートリアル提供、スクリプト・プラグイン作成、フォーマット変換、反復的制作作業の完了など、多様な創作支援タスクに対応する。
Geminiが全ユーザー向けファイル生成機能を展開
Googleは4月29日、Geminiアプリで複数ファイル形式の直接生成機能を全世界のユーザーに提供開始した。この機能により、ユーザーは「ダウンロード可能で共有準備完了のファイル」をGeminiアプリから直接生成でき、「アイデア出しから完成ファイルまで、Geminiアプリから離れることなく迅速に移行」できる。
対応ファイル形式は、Workspaceファイル(Docs、Sheets、Slides)、PDF、DOCX、XLSX、CSV、LaTeX、TXT(プレーンテキスト)、RTF(リッチテキストフォーマット)、MD(Markdown)の8種類である。具体的な使用例として、Microsoft Excel形式での予算提案書出力、箇条書きドラフトへの散らばったアイデア整理、長時間の共同作業の単一ページPDFまたはMicrosoft Word文書への統合などが挙げられる。
実際の活用例では、「講義ノートを使用してLaTeX形式でPDFの詳細学習ガイドを作成し、視覚的要素、グラフ、方程式を含める」といった高度な文書生成も可能となっている。この機能は手動でのコピー、ペースト、再フォーマット作業を大幅に削減することを目的としている。
実際の開発テストで明暗が分かれる各AI性能
Chrome拡張機能開発テストでは、3つのAIの実用性能に大きな差が現れた。同一のInstagramストーリー閲覧者リスト取得拡張機能を各AIに開発させた結果、GPT-5.5は2分11秒で1.4バージョンを生成したが、Auto-index allモードとStart live captureモードの両方で期待通りの動作を実現できず、複数回の修正が必要となった。
一方、Claudeは最初のバージョンでは不具合があったものの、3回目のバージョンでは視覚的ストーリーストリップ、サムネイル、タイムスタンプ、閲覧数カウント機能を含む完全に動作する拡張機能を生成し、個別ストーリーの閲覧者検索機能も実装した。この結果から、実際の開発作業においてはベンチマーク性能と実用性能が必ずしも一致しないことが明らかとなった。
画像生成機能でも差別化が進展
画像生成性能テストでは、ChatGPT Images 2.0とGemini Nano Bananaの比較が実施された。30の独自要素にわたるテストの結果、ChatGPT Images 2.0が150点中150点(97%)を獲得し、Gemini Nano Bananaが131点(85%)となった。これは前年のGeminiの93%スコアから大幅な低下を示している。
特に注目すべきは、Gemini Nano Bananaが「ITプロフェッショナルがデータセンターにいる」という単純なプロンプトに対して、ユーザーのチャット履歴からClaude Code、iTerm2、Linux、3Dプリンターの要素を無断で取り込んで画像に含めた点である。この予期しない個人化機能は、プライバシーと制御可能性の観点から懸念を提起している。
AI業界の今後の展望と戦略的示唆
包括的比較テストによると、各AIは異なる強みを発展させている。GPT-5.5は速度、実用性、実行力に最適化され、Claude Opus 4.7は深さ、ニュアンス、思慮深い推論に重点を置いている。この差別化戦略により、企業は用途に応じて最適なAIツールを選択する必要性が高まっている。
OpenAI CEO Sam Altmanは「個人的に気に入っている」とGPT-5.5への満足を表明し、「我々は今やAI推論企業になる必要がある」と述べて、推論性能向上への戦略的重点を明確にした。Magic Path CEO Pietro Schiranoは「AGIの最初の味覚を得た」とGPT-5.5を評価している。
しかし、業界専門家からは、ベンチマーク成績の実用性への疑問も提起されている。企業がテストに特化した訓練を行う傾向が強まり、予期しない状況では依然として問題が発生するケースが報告されている。Menlo Ventures partner Deedy Dasは、GPT-5.5がコーディング能力においてまだ最先端レベルに達していないと指摘している。



