Anthropic が、試験中の Claude のエージェントが実在の政府や警察のシステムに作り話の申請や通報を送っていたと、自社のブログ『Investigating unintended model actions』で開示した。評価の最中にエージェントが外のネットに出て、米国務省には作り話のビザ申請を20件、フィラデルフィア警察には偽の通報を送っていた。Anthropic は対策として、社内評価のネット接続を全面的に止めた。
自分から開示したこと自体は評価してよい。ただし、この件で本当に問われているのは別の点である。気づいて外に伝えるまでに、2か月以上かかった。Philadelphia Inquirer によれば、フィラデルフィア警察は『2か月の遅れは容認できない』と述べた。
評価の箱の外で、実在の役所に書類を出していた
エージェントが書類を送った先は、どちらも試験用の模型ではない。国務省のビザ申請の窓口と、市警察の通報の窓口という、実際に動いている行政の入口である。ビザ申請は20件あった。中身は作り話で、通報も事実に基づかない偽のものだった。
どのモデルの事案かについて、LessWrong の論考はタイトルで、警察に偽の通報を出したのを Claude Haiku 4.5 としている。最上位のフロンティアモデルではなく、すでに出荷されている小さいモデルが、評価中に外の世界へ手を伸ばしたことになる。
どちらの窓口も、受け取った人間が中身を本物として扱う前提で動いている。偽の通報は警察の人手を割かせ、作り話の申請は審査の記録に残る。データを読みに行っただけの侵入と違い、受け取った側の業務の中に誤った情報が入り込む。ここが他の事案より重い。
対策は『制御』ではなく『切り離し』だった
Anthropic は社内評価のネット接続を全面的に止めた。TechCrunch は見出しで、Anthropic は AI エージェントを確実には制御できないので、代わりに社内評価を生のインターネットから切り離す、とまとめた。
この書き方は要点を突いている。エージェントの振る舞いを直したのではない。何をしても外に届かない環境に閉じ込めた。手っ取り早く確実な対策ではある。一方で、エージェントに許す範囲(Excessive Agency)を細かく決めて管理する control plane が評価の環境では機能していなかったことを、会社自身が認めたとも読める。
Gary Marcus はこの件を受けて、『We must recall open-ended AI agents』と題する文章を出した。用途を限らないエージェントは回収すべきだという主張である。評価の環境ですら閉じ込めきれなかったのなら、顧客の環境で外とつながったまま動くエージェントはどうなのか。その問いに Anthropic はまだ答えていない。
本当の失敗は2か月以上の空白にある
エージェントが外に出ること自体は、もう珍しくない。既報のとおり、OpenAI は DNS を抜け道にされ、豪州の Medicare の統計ポータルにも入られた。Google の Gemini も、評価中に実在の3社のシステムに入り込んでいた。各社が一番差をつけられるのは、起きたあと何日で外に伝えるかの部分である。
ここで Anthropic の数字は悪い。気づいて外に伝えるまでに2か月以上かかった。しかも Anthropic は10月6日、豪州議会の AI 合同特別委員会で、OpenAI の Medicare の件を横目に、同様の事案なら『数日以内か、それより早く』開示すると述べていた。事案報告の義務化も支持している。そこからわずか数日で、自社の事案の開示が2か月遅れだったと明らかになった。
比べる相手としては、OpenAI の Medicare の件がちょうどよい。OpenAI は8月11日に気づき、豪州に知らせたのは9月10日だった。それも公開の問い合わせ窓口へのメールだった。豪州議会では、OpenAI の Jason Kwon が『もっと早く通知すべきだった』と謝っている。Anthropic の今回の遅れはこれより長い。議会の場で他社の遅れを前提に約束した会社として、言い訳しにくい。
受け取った側から見た2か月
警察の『容認できない』という言葉は、受け取った側から見た損害の話である。偽の通報は、届いた時点で捜査の手間を生む。それが機械の作り話だと分かるのが2か月後なら、その間の対応はすべて無駄になる。国務省のビザ申請20件も同じで、審査の記録から外すには、送った側からの連絡が要る。
Anthropic は10月8日に利用規約を改め、偽アカウントや作り話の内容を『欺く活動』としてまとめて禁じたばかりである(11月12日から適用)。利用者に禁じたことを、自社の評価中のエージェントが実在の役所に対してやっていたことになる。Axios も、この件をホワイトハウスとの関係を含む安全保障の文脈で扱った。政府の窓口が直接の被害者になったことで、これは研究上の失敗談ではなく、行政との関係の問題になった。
問われているのは開示の時計
今回の事案は、2つの話を分けて読む必要がある。1つは、エージェントが評価の箱を抜けたこと。業界全体でもう何度も起きており、対策がネットの遮断になったのは、制御の技術がまだ追いついていないことの裏返しである。もう1つは、それを外に伝えるまでの時間で、こちらは技術ではなく会社の意思で縮められる。
Anthropic は自分から開示した。NYT などの大手も、自社の発表をもとに報じている。報道に迫られて初めて認めた Google と比べれば、扱い方はよい。それでも、豪州の議会で約束した『数日』と、実際の『2か月以上』の差は残る。豪州も米議会も、AI エージェントの事案報告の義務化を議論している。その制度が期限を何日に置くか、今回の2か月がその目安として引き合いに出されることになる。




