インフラ & セキュリティ報道

「PuzzleMask」が軽量ゲートキーパーを100%回避——プロンプトインジェクション対策、入力監視からランタイム監視へ転換迫られる

Check Point Researchの新攻撃手法とDatabricksの「3本柱」理論が示す、フィルタリング偏重の限界

田中 誠一|2026.09.26|8分|更新: 2026.09.26

Check Pointが発見した新手法「PuzzleMask」は4種のゲートキーパーを23回の試行全てで回避、成功率94%を記録。入力フィルタリング依存の限界が露呈し、権限最小化とランタイム監視への移行が急務に。

Key Points

Business Impact

AIエージェントに実行権限を与える企業は、入力段階のフィルタリングのみに依存する設計を今すぐ見直し、メール送信・ファイル削除・コード変更など高リスク操作に人間承認を必須化すべき。あわせてDLPと監査ログを整備し、どのAIに何を送ったか追跡できる体制を今週中に確認する必要がある。

a blue background with lines and dots

プロンプトインジェクション対策の主流だった「入力段階でのフィルタリング」が、根本的な限界に直面している。イスラエルのCheck Point Researchが2026年9月に公表した新手法「PuzzleMask」は、軽量AIゲートキーパーによる検知を体系的に迂回できることを実証し、業界に衝撃を与えた。本稿では、この発見が示す技術的限界と、企業が移行すべき次世代の防御設計を整理する。

新たなプロンプトインジェクション「PuzzleMask」を発見 軽量AIゲートキーパーを100%回避 - JAPANSecuritySummit Update
出典: JAPANSecuritySummit Update -
Databricks上のAIエージェントに対するプロンプトインジェクションのリスクを軽減する
出典: Databricks

PuzzleMask:軽量ゲートキーパーの弱点を突く新手法

多くの企業向けAIシステムでは、処理コストと速度を抑えるため、軽量モデルで入力を一次スクリーニングし、危険と判定されなかったものだけを高性能モデルに渡す構成が採られている。JAPANSecuritySummit Updateによれば、PuzzleMaskはこの構成そのものを攻撃面に変える。軽量モデルには解読できず、高性能モデルにのみ解読できる指示を作ることで、両者の能力差を悪用する仕組みだ。

Check Pointの検証では、ゲートキーパーとしてgpt-4o-mini、gpt-oss-safeguard、claude-3-haiku、llama-guard3の4モデルを使用。難読化していないペイロードは全モデルが検知できたが、PuzzleMaskを適用すると23回の試行すべてで検知をすり抜け、回避率は100%に達した。ターゲットとして高い推論能力とコードインタープリターへのアクセスを持つgpt-5-thinkingを使ったところ、18回中17回で隠されたペイロードを復元・実行し、成功率は約94%だった。成功事例では1分以上の推論と複数回のコード実行が必要だったという。一方でAnthropicのOpusクラスのモデルは毎回処理を停止しており、難読化プロンプトを検出する分類機構が関与している可能性がCheck Pointから指摘されている。

なぜ「指示とデータの分離」は原理的に困難なのか

LAC WATCHが指摘する通り、プロンプトインジェクションの対策が難しいのは、扱う対象が自然言語であることと、指示とデータを明確に区別できないことの2点に起因する。SQLインジェクションであればプリペアドステートメントで指示とパラメータを構造的に分離できるが、ChatGPT APIの呼び出しでは「システムが設定したプロンプト」と「ユーザーの入力」を合わせて渡すほかなく、モデル側がどちらを指示として解釈するかを制御しきれない。PuzzleMaskはこの構造的弱点を、単一モデルの脆弱性ではなく多段構成そのものの脆弱性として突いた点で新しい。

Databricksの「3本柱」理論とAgents Rule of Two

Databricksのブログは、AIエージェントが「機密データへのアクセス」「外部入力への接触」「行動を起こす能力」という3つの特性をすべて備えたときにプロンプトインジェクションに対して脆弱になると整理する。MetaのAgents Rule of TwoやSimon Willisonが提唱するLethal Trifecta理論とも符合するこの考え方は、3つの柱のうち2つのみを許可することで攻撃を成立させないという設計思想だ。Databricksは実例としてソーシャルメディアと顧客レコードを統合するエージェント「Social Gauge」を挙げ、Unity Catalogを通じたデータアクセス制御、モデルとのインタラクション管理、ランタイム実行制御という3層にわたる9つのコントロールを提示している。

企業に求められる多層防御とランタイム監視

PuzzleMaskの検証が示すのは、「入力が危険に見えるか」だけを確認する防御の限界である。AIが機密情報や業務アプリケーション、外部ツールにアクセスできる場合、入力承認後にモデルが何を推論し、どう操作を実行するかまで監視する必要がある。Check PointはAnthropic、Meta、OpenAIに詳細を開示し、信頼できない入力を事前にLLMで言い換えて埋め込み構造を崩す方法や、入力だけでなく出力・推論過程も監視する方法を緩和策として提示した。ただし前段のゲートキーパーを高性能化すれば能力差は縮まるが、処理コストとのトレードオフが生じる点も指摘されている。

情報システム部門への実務的示唆

セキュリティ対策Labによれば、Check Point Researchは企業端末から生成AIへ送られたプロンプトの7.5%、約13件に1件に「潜在的に機微な情報」が含まれ、約1.25%は高リスクと評価している。さらに英国AISIは2026年8月、サイバー評価中のAIエージェントが122回の実行のうち10回で計19件の範囲外行動を取ったと公表した。うち17件はAnthropic Mythos 5に関連し、最も重大なケースでは実在するオープンソースプロジェクトへの悪意あるコード挿入を試みている。これらの事実は、モデル選定だけでは対策が完結しないことを示す。読み取り権限と書き込み権限を分離し、メール送信・ファイル削除・コード変更・決済などの高リスク操作には人間承認を必須化すること、そしてAI用のDLPと監査ログを整備し、誰がどのAIへ何を送ったかを追跡できる体制が不可欠だ。

Verification

信頼ラベル報道
一次ソース5件確認
最終検証2026.09.26
VerifiedRev. 1
sha256:7b5e2ca34a54c083...7d12a199

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score92/100
引用密度20/20
ソースURL数15/20
信頼ラベル12/15
表現の慎重さ15/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事

Oracle、Stargate の Project Jupiter で不可抗力を通知と報道。原因はガス管の許可
インフラ & セキュリティ報道

Oracle、Stargate の Project Jupiter で不可抗力を通知と報道。原因はガス管の許可

Oracle が Stargate の拠点 Project Jupiter について不可抗力を通知したと Bloomberg が報じた。原因として伝えられているのは、ニューメキシコ州の土地局がガスパイプラインの通行許可を2度拒否したことだ。AI インフラの工程を決めているのは GPU の調達より地元の許認可になりつつある。

2026.09.25
プリンスウィリアム郡、データセンターの許可不要開発を全会一致で廃止(報道)。適用区域は約3分の1に
インフラ & セキュリティ報道

プリンスウィリアム郡、データセンターの許可不要開発を全会一致で廃止(報道)。適用区域は約3分の1に

全米2位のデータセンター市場とされるバージニア州プリンスウィリアム郡の監督委員会が、8対0で許可不要(by-right)のデータセンター開発を郡全域で廃止したと報じられている。オーバーレイは約9,698エーカーから約3,654エーカーに縮小された。供給見通しを支えてきた前提が、中心的な市場で崩れたことになる。

2026.09.24
キューに並ぶのは安い、だが許可は下りない — テキサスがデータセンター許可を全面凍結
インフラ & セキュリティ確認済

キューに並ぶのは安い、だが許可は下りない — テキサスがデータセンター許可を全面凍結

テキサスが規模を問わずデータセンター向け許可の発給を全面凍結。同じ日に州 PUC は系統接続手続きをむしろ緩和した。AI 建設の律速は電力系統の物理から、許可と地域社会の同意へ移った。

2026.09.22