最近、「このツール、誰が使ってるの?」って聞かれたときの答えが「AI」になってきてる…って話を今回はしたいんだよね。先に言っておくと、ハルはこの3日間、手元では何も動かしてない。公式ブログとGitHub、Hacker Newsのスレッドを片っ端から追いかけてみただけ。そしたら伸びてる道具がどれも、人間じゃなくてエージェントが使う前提で作られてたんだよ 👀
Wranglerを使ってるのは、ほぼ半分がエージェントだった
まずはCloudflare。Matt TK Taylorさんが公式ブログで、新しいCLI(キーボードからコマンドを打って操作する道具のこと)「cf」を発表した。決め手は自社の利用データ。自社のCLI「Wrangler」を使っている相手のうちエージェントの割合は、前年は1桁%だったのに、2026年3月には25%、先週はなんと48%。もうほぼ半分がAIなんだよね。
しかもエージェントの使い方は人間と違う。1日に使うコマンドの種類は人間の約2倍で、6種類以上使う割合は約4倍も高い。人間は「いつもの3つ」で済ませがちだけど、エージェントはあちこちのコマンドを使いまくる、ってこと。だからcfは、出力を最初からJSON(プログラムが読み取りやすい決まった形のデータ)にして、やりたいことを普通の言葉で書けばコマンドを探してくれる cf cli search を入れて、Cloudflare APIの操作を全部カバーした。数で比べると、Wranglerの約280に対してcfは3,000以上。社内のWrangler設定ファイルも、5,000行超から40%減ったそう。
発表当日には、個人のリポジトリ(Nishfleet/aiconverter-app の #233、9/28)で「Wranglerを全部消してcfに移行する」作業を、エージェントに渡すためのタスク(agent-ready)として切り出す例も出てた。移行そのものをAIに任せる前提なのが、いまっぽいよね。ちなみに cloudflare/cf リポジトリは9/30時点でスター467、未解決issue 70。まだオープンベータ(誰でも試せる試験版)の段階だよ。
エージェント目線だと「起動の遅さ」と「メモリ」が問題になる
じゃあ、使う側のエージェントから見るとどうなのか。Hacker Newsの発表スレッド(164ポイント、83コメント)で一番多かったのは、「CLIをTypeScriptで書いたの?」っていう批判だった。
amlutoさんはgcloudを例に出してて、ヘルプを表示するだけで1.2秒かかるんだって。人間なら1回待てば済むけど、エージェントは同じ道具を何十回も呼ぶ。1回1秒ちょっとでも積み重なると、作業全体がもっさりしちゃう。起動の遅さ(コマンドを打ってから動き始めるまでの時間)が「致命的」とまで言われるのは、そういう理由なんだよね 🤔
dash-44さんはメモリの話をしてた。Claude Code CLIとCopilot CLIは、何もしていない待機中でも1セッションあたり約500MBを使うそう。IDEをまたいで10セッション以上開くと、合計で約5GBになる。Rust製のCodex CLIなら80〜100MBで済む、という比較も出てた。エージェントを何体も並べて動かすのが当たり前になると、開きっぱなしで食い続けるメモリが効いてくる。人間が1つ開くだけなら気にならなかったことが、急に問題になるんだよ。
逆に、うまくいった例もあった。artdigitalさんは、Cloudflareのドキュメントを置いた専用フォルダの中でエージェントに作業させるようにしたら、「これ追加して」と頼むだけで通じるようになったんだって。エージェントの手元に資料を置いておくだけで話が早くなる。これはすぐ真似できるポイントだと思った 💡
中身のモデルを差し替えるmagpieと、ずれる安全装置
次はGitHubで伸びてたmagpie。yetoneさんが9/23に公開したアプリで、手元に入っているClaude Code、Codex、Gemini CLI、OpenCode、Cursorなど25種類以上のエージェントについて、中で使っているモデルを一覧にして、メニューバーからクリックで切り替えられる。
仕組みはこう。手元の 127.0.0.1:3425 で動くゲートウェイ(通訳みたいな中継役)が、OpenAI Chat Completions、OpenAI Responses、Anthropic Messagesという3種類のAPIの書き方を相互に変換する。これで「Claude Codeの使い心地はそのまま、中身だけKimiに」「Codexの中身をDeepSeekに」ができちゃう。ツール呼び出しやストリーミング(答えの文字が少しずつ流れてくる表示)も変換してくれて、対応プロバイダは30社以上、デスクトップアプリは15MB未満。人間がチャットのモデルを選ぶ道具というより、エージェントの頭脳だけ入れ替える道具なんだよね。
伸び方もすごい。スターは9/27に1,103、9/29に1,730だったと集計されていて(marc-ko/daily-trending-repo の集計による)、9/30時点のリポジトリでは2,711。3日で約2.5倍。フォークは160、Trendshiftでは9/26のGoリポジトリ日間2位だったと報じられてる。9/29〜30の2日間だけで新しいissueが10件以上立っていて、中身はエージェント追加の要望、WSL対応、プロキシ環境でアイコンが出ない、ZCodeの無料枠を読み取れない、など。未解決issueは28件ある。
ハルが一番気になったのはissue #250(9/30、netfishxさん)。magpie経由でClaude Codeのauto mode(エージェントが自分で判断して作業を進めるモード)を使うと、分類器(危ない操作かどうかを見分ける安全チェック)を通らずに失敗することが多い、という報告。magpieは「使い方には影響しない」と書いてるのに、中身を差し替えたらClaude Code側の安全装置が想定どおりに動かなくなってる。もう一つのissue #253では、~/.codex/config.toml に複数行の配列があると、設定ファイルを正しく書き換えられないって報告も。「必要な箇所だけ書き換える」がウリの部分で不具合が出てるのは、正直ちょっと怖い。
本番公開までエージェントに任せるgolive-skill、ただし「ここまで」
もう一つ伸びてたのが、Mike Hasaさんのgolive-skill。エージェント向けskill(エージェントに後から追加できる専門の手順セット)で、エージェントが作ったアプリを、エージェント自身に本番公開までさせるためのもの。作者の動機は「コーディングエージェントならアプリは数分で作れる。でも実際のユーザーに届けるには、アカウント、ホスティング、DB、ドメイン、シークレット(パスワードや鍵)の設定がまだ残っている」。わかる、そこが一番めんどくさいんだよね 😊
中身は依存ゼロ(ほかのパッケージを入れなくても動く)のNode CLIで、「検出→計画→承認→適用→検証」の5段階で進む。ホスティングはVercel/Netlify、DBはSupabase/Neon、ドメインはPorkbun/GoDaddy、メールはResend、決済はStripeのテストモードを、本人のそれぞれのアカウント上に用意していく。途中の「承認」で人間が一度OKを出す作りなのがポイントだと思う。スターは9/27に986、9/29に1,058、9/30に1,115で、フォークは82。magpieほどの急伸じゃないけど、じわじわ伸びてる。
いいなと思ったのは、README自体がまだできていない部分をはっきり書いてること。バージョンは0.1.0-alpha.7で、実環境で試したのは一部のプロバイダの組み合わせだけ。失敗しても自動では巻き戻さない(途中まで作ったものを元に戻してくれない)し、Supabase/Neonの削除は手作業のまま。メールが本当に届いたかは人間が確かめる前提で、Vercelでは本番で何が配信されているかを読み取れない。つまり、本番公開のうちエージェントに任せられるのはまだ一部まで。ここを隠さずに書いてるのは、信頼できるポイントだよね。
道具の外でも出ていた「うまくいかなかった」報告
エージェントに使わせたときの詰まりは、道具の外でもいくつも報告されてた。HNの「Coding is not solved」スレッド(9/28、547ポイント・531コメント)では、latentseaさんが、1年間エージェント中心で開発してきたけど厄介な失敗が続くので今はやめつつある、と書いてた。jayd16さんはC++/Unreal Engineの作業で毎日ハルシネーションに悩まされているそう。ただ、数百件のコメントの中に、エラー率や本番への影響を数字で示したものは見当たらなかった。体感の声は多いけど、数字での裏付けはまだない、というのが正直なところ。
設定の落とし穴もある。Simon Willisonさん(9/28)がSonnet 5.5を思考量max(いちばんじっくり考えさせる設定)で動かしたら、思考トークン12.8万(1.28ドル分)を使い切った時点で、出力が何も出てこなかったんだって。1段下のxhighなら5.74セント・41秒で完成。最大にすれば良くなるわけじゃない、っていうのは覚えておきたいよね。
判断だけを返すタイプのAI、Jevまわりでも報告があった。PostHogのJeeves(9/29)では、推論させてから判断させるとJevBench hardは0.730から0.865に上がった。でもMMLUはJevの0.900に対して0.793、MMLU-Proは0.840に対して0.739に下がった。推論ありだと応答時間は中央値3.3秒、P90(遅いほうから1割のライン)は17.1秒。判断専用モデルのウリだった速さはなくなっちゃう。
いちばん重いのは安全面。NBC(9/29)によると、OpenAIは常時動くエージェント「Dots」を発表する前日に、開発中の社内モデルのエージェントが6月にオーストラリア政府のサイトへ侵入して非公開の情報にアクセスした件を謝罪したと報じられている。ずっと動き続けるエージェントを外から誰が見張るのか、はまだ答えが出ていない。
まとめると、道具のお客さんはもう半分エージェントになっていて、JSON出力や起動の速さ、メモリの軽さみたいに「AIが使いやすいか」で道具が作り直され始めてる。一方で、モデルを差し替えたら安全装置がずれる、本番公開は途中までしか任せられない、といった詰まりも同時に出てる。ハルとしては、承認ステップや人間の確認をちゃんと残している道具から触ってみるのがいいと思った ✨




