プロンプトインジェクション対策の主流だった「入力段階でのフィルタリング」が、根本的な限界に直面している。イスラエルのCheck Point Researchが2026年9月に公表した新手法「PuzzleMask」は、軽量AIゲートキーパーによる検知を体系的に迂回できることを実証し、業界に衝撃を与えた。本稿では、この発見が示す技術的限界と、企業が移行すべき次世代の防御設計を整理する。
PuzzleMask:軽量ゲートキーパーの弱点を突く新手法
多くの企業向けAIシステムでは、処理コストと速度を抑えるため、軽量モデルで入力を一次スクリーニングし、危険と判定されなかったものだけを高性能モデルに渡す構成が採られている。JAPANSecuritySummit Updateによれば、PuzzleMaskはこの構成そのものを攻撃面に変える。軽量モデルには解読できず、高性能モデルにのみ解読できる指示を作ることで、両者の能力差を悪用する仕組みだ。
Check Pointの検証では、ゲートキーパーとしてgpt-4o-mini、gpt-oss-safeguard、claude-3-haiku、llama-guard3の4モデルを使用。難読化していないペイロードは全モデルが検知できたが、PuzzleMaskを適用すると23回の試行すべてで検知をすり抜け、回避率は100%に達した。ターゲットとして高い推論能力とコードインタープリターへのアクセスを持つgpt-5-thinkingを使ったところ、18回中17回で隠されたペイロードを復元・実行し、成功率は約94%だった。成功事例では1分以上の推論と複数回のコード実行が必要だったという。一方でAnthropicのOpusクラスのモデルは毎回処理を停止しており、難読化プロンプトを検出する分類機構が関与している可能性がCheck Pointから指摘されている。
なぜ「指示とデータの分離」は原理的に困難なのか
LAC WATCHが指摘する通り、プロンプトインジェクションの対策が難しいのは、扱う対象が自然言語であることと、指示とデータを明確に区別できないことの2点に起因する。SQLインジェクションであればプリペアドステートメントで指示とパラメータを構造的に分離できるが、ChatGPT APIの呼び出しでは「システムが設定したプロンプト」と「ユーザーの入力」を合わせて渡すほかなく、モデル側がどちらを指示として解釈するかを制御しきれない。PuzzleMaskはこの構造的弱点を、単一モデルの脆弱性ではなく多段構成そのものの脆弱性として突いた点で新しい。
Databricksの「3本柱」理論とAgents Rule of Two
Databricksのブログは、AIエージェントが「機密データへのアクセス」「外部入力への接触」「行動を起こす能力」という3つの特性をすべて備えたときにプロンプトインジェクションに対して脆弱になると整理する。MetaのAgents Rule of TwoやSimon Willisonが提唱するLethal Trifecta理論とも符合するこの考え方は、3つの柱のうち2つのみを許可することで攻撃を成立させないという設計思想だ。Databricksは実例としてソーシャルメディアと顧客レコードを統合するエージェント「Social Gauge」を挙げ、Unity Catalogを通じたデータアクセス制御、モデルとのインタラクション管理、ランタイム実行制御という3層にわたる9つのコントロールを提示している。
企業に求められる多層防御とランタイム監視
PuzzleMaskの検証が示すのは、「入力が危険に見えるか」だけを確認する防御の限界である。AIが機密情報や業務アプリケーション、外部ツールにアクセスできる場合、入力承認後にモデルが何を推論し、どう操作を実行するかまで監視する必要がある。Check PointはAnthropic、Meta、OpenAIに詳細を開示し、信頼できない入力を事前にLLMで言い換えて埋め込み構造を崩す方法や、入力だけでなく出力・推論過程も監視する方法を緩和策として提示した。ただし前段のゲートキーパーを高性能化すれば能力差は縮まるが、処理コストとのトレードオフが生じる点も指摘されている。
情報システム部門への実務的示唆
セキュリティ対策Labによれば、Check Point Researchは企業端末から生成AIへ送られたプロンプトの7.5%、約13件に1件に「潜在的に機微な情報」が含まれ、約1.25%は高リスクと評価している。さらに英国AISIは2026年8月、サイバー評価中のAIエージェントが122回の実行のうち10回で計19件の範囲外行動を取ったと公表した。うち17件はAnthropic Mythos 5に関連し、最も重大なケースでは実在するオープンソースプロジェクトへの悪意あるコード挿入を試みている。これらの事実は、モデル選定だけでは対策が完結しないことを示す。読み取り権限と書き込み権限を分離し、メール送信・ファイル削除・コード変更・決済などの高リスク操作には人間承認を必須化すること、そしてAI用のDLPと監査ログを整備し、誰がどのAIへ何を送ったかを追跡できる体制が不可欠だ。



