AIの現場確認済

新モデルの週に、現場が見てたのはAIの「外側」だった。ルーティングで請求14〜21%減、ハーネスを替えて39%安く、を数字と失敗談まで追ってみた

コストを削る・成果物をレビューする・本番に出す・信用できるか。エージェントを包む層を選ぶ話が一気に出てきた一週間

美咲 ハル|2026.09.26|10分|更新: 2026.09.26

新モデルが出た週なのに、現場の話題はAIを包む「ハーネス」ばかりだった。請求を14〜21%削ったAccentureの実測、39%安いと掲げるUnreal Agent、図でレビューするWhiteboard、本番出しを任せるGoLive、無断アップロード発覚後もスターが伸びたZCode。数字と失敗談まで追いかけたよ。

Key Points

新モデルの週に、現場が見てたのはAIの「外側」だった。ルーティングで請求14〜21%減、ハーネスを替えて39%安く、を数字と失敗談まで追ってみた

今週はまた新しいモデルが出たよね。だからハルも、みんな性能比べで盛り上がってるんだろうなって思ってた。ところがネット上の作例や論文、GitHub の動きを片っ端から追いかけてみたら、現場で話題になってたのはモデルの中身じゃなかった。モデルの外側のほうだったんだよ。

ここで言う外側は「ハーネス」のこと。モデルを包んで、ファイルを読ませたりコマンドを打たせたりする道具一式を指す言葉だよ。同じモデルでもハーネスが違えば、かかるお金も、仕上がりの確認のしかたも、安心して任せられる度合いも変わってくる。今週はそこを問う話が4方向から一気に出てきた。ひとつずつ見ていくね 👀

請求書を削るのはモデルより「切り替え方」だった:Accentureの実測

まずは一番数字が多い話から。Accenture Responsible AI のチーム(Arian Abbasi、Alan Aqrawi、Ted Kwartler)が公開した論文は、1万席規模の会社でコーディングエージェントを使う前提で、モデルルーティングを検証している。モデルルーティングは、やることの難しさに合わせて高いモデルと安いモデルを振り分ける仕組みのこと。結論として、ハーネス側の工夫だけでモデル代の14〜21%を取り戻せた、と書かれている。1万席に換算すると年$3.3M〜$5.0M。けっこうな額だよね 💡

ハルが一番びっくりしたのは逆転現象のほう。長いセッションだと、単価が一番高い Fable 5.1 のほうが Opus 5 より安く済むことがあるんだって。効いているのはキャッシュ(一度読み込んだ内容をAI側に取っておいて、2回目からは安く読み直せる仕組み)の読み出し単価の差。$100を超えた実際のセッションのうち51〜80%でこの逆転が起きていた。高いモデルは高い、と思い込むのは危ないってことだね。

一方で、ルーティングの限界も論文自身が数字で示している。複雑さの判定が当たったのは63%だけ。小さいモデルに回せたはずのターンのうち42%は、念のため回さずにおいた。ルートを間違えたときの手直しだけで月$51kかかっていて、総支出の3分の1を超えている。作業の途中でモデルを替えるとキャッシュが無駄になって、元を取るまでに291リクエストもかかる。だから切り替えるならセッションの最初か、タスクの区切りしかない、という結論だった。ユーザーが手を止めてキャッシュが切れると、節約できる幅は24%から7%まで縮むそうだよ。さらに、Claude Code みたいに特定の会社専用のハーネスだと、他社のモデルが Opus 5 の0.12〜0.80倍の値段でも乗り換えられない、とも指摘している。どのモデルを使えるかはハーネスで決まっちゃうんだね。

似た報告はほかにもあった。Arize の Arda Hoke さんは、バグを探す定期ジョブの費用を1回あたり約$100から$15〜20に下げたそうだよ。でも本人が「同じ条件で繰り返し比べてはいなくて、見つけられるバグの数や精度が同じかは確かめていない」と認めている(9月公開で、正確な日付はハルのほうで確認できていないから参考程度に見てね)。安くなった話を読むときは、品質を比べたかどうかもセットで見るのが大事だなって思った。

同じモデルで39%安い? Unreal Agent と、その数字の読み方

ハーネスそのものを替えるアプローチもある。Unreal Labs が9/22に MIT ライセンスで公開した Unreal Agent は Go で書かれたハーネスで、ツールを非同期で動かすことを前提にしている。ツールの完了待ちや「終わった?」の確認をモデルにさせないことで、1ターンでこなせる作業量を増やす設計なんだよ。人間で言うと、コピー機の前で待たずに次の仕事をしておく感じかな 🛠️

公式ブログに載っている自社計測の数字はこう。GPT-6 Astra(xhigh)を使った Terminal-Bench 4.0 では、正答率が Codex と同じ57.9%のまま、費用が$2,350から$1,428に下がった。これが「39%安い」の中身だよ。DeepSWE 1.1 では Codex の69.0%・$1,633に対して72.4%・$1,367、SWE-Atlas QnA では63.3%・$1,303に対して65.8%・$936だった。GitHub のスターは9/25のトレンド時点で1,885、9/26には1.9k、フォークは102。公開から4日でトレンド入りして、HN でも246ポイントを集めている。

ただ、この数字はそのまま信じないほうがいいと思う。39%という削減幅は自社で測ったもので、試したモデルも GPT-6 Astra の1種類だけ。9/16に出た HarnessTax 研究(UC Berkeley と Arena)では、ハーネスを替えても正答率の差は±2〜5ポイントに収まる一方、コストは最大5倍も違ったと報告されている。ハーネスの差は正答率よりコストに大きく出るから、どのベンチマークで比べたかで「どれが一番お得か」の答えがころころ変わりやすいんだよね。自分のリポジトリでは何%安くなるのか。結局そこは自分で測るしかない、というのが今のところの正直な答えかな。

作ったあとの工程も外側の仕事:Whiteboard と GoLive

コストの次は、エージェントが作ったものをどう確認して、どう世に出すかの話。Show HN に出た Whiteboard(YC W26)は、元テックリード4人が作ったデスクトップアプリだよ。Claude Code や Codex に図を描くための SDK(開発用の部品セット)を渡して、自分の変更をシーケンス図(処理の順番を並べた図)や ER 図(データ同士のつながりを示す図)として描かせる。人間はその図を、構文木ベースの Rust 製 diff(コードの構造を理解したうえで差分を出す仕組み)と並べて読む。つまり、細かい差分を見る前に設計を読める。創業者たちは、エージェントに任せすぎて自分のコードを理解していない状態を「認知的負債」と呼んでいて、この言葉はうまいなって思った。Salesforce と Modal が、設計の変更やエージェントが作った試作コードのレビューに使っているそうだよ。

HN では396ポイント・129コメントを集めて、スターは1日で1,215から1.3kに増えた。でも懐疑的な声も目立ってたんだよ。「編集できないのに IDE を名乗るのか」という指摘が出て、その日のうちに呼び名を「canvas」に改めている。ほかにも「図がいずれコードと食い違ったら、どっちが正しいの?」という問題、macOS 版が736MBもある重さ、Windows 非対応で Linux は Fedora だけ、といった不満が並んでいた。図とコードのずれは、この手の道具がこの先ずっと向き合うことになる課題だと思う 🤔

本番に出す工程を担当するのが、個人開発者 mikehasa さんの GoLive だよ。ホスティング、データベース、独自ドメイン、メール、決済の設定を、検出→計画→承認→適用→検証の順番でエージェントにやらせる Agent Skill と、依存ライブラリゼロの Node CLI のセット。自分のアカウントで動いて、利用状況のデータ(テレメトリ)は送らない。ハルがいいなと思ったのは、使い捨ての環境を実際に作って確かめた組み合わせを README に全部並べているところ。Vercel+Supabase、Netlify+Neon、Porkbun/GoDaddy の DNS、Resend のメール、Stripe のテスト決済が通っている。スターは900(9/25トレンド10位)から949(9/26)、フォークは65。

そのうえで、弱いところも隠していない。自分で alpha(まだ試作段階)と名乗っていて、今のバージョンは v0.1.0-alpha.3。自動のロールバック(失敗したときに元に戻す機能)はないし、Supabase と Neon の撤去は手作業になる。Cloudflare DNS とアカウント分離は未検証だとはっきり書いてある。どこまで確かめたかを先に言ってくれる道具は信用しやすいよね。

そもそも信用できる? ZCode が突きつけた問い

最後は一番モヤっとする話。Z.ai が出している GLM 向けのハーネス ZCode は、ユーザーのワークスペースを Git の履歴ごと暗号化して Alibaba Cloud に送っていた、とThe Next Web が報じている。開発者 ferstar さんの調査でわかったこと(9/18)で、送られたスナップショットは313MB・42,411ファイル、アップロードは564回試みられていたとされる。Z.ai は謝罪してオープンソース化したものの、公開リポジトリのコミットは2件だけで、それまでの履歴は消されていたと報じられている。つまり、アップロードの処理が前はどう動いていたのか、もう誰も確かめられないんだよ。

第三者監査は CAICT と NSFOCUS に頼んだそうだけど、DEV Community の jamilxt さんによると、どちらも Z.ai 自身が発注したもので、公開されているのは要約だけ。HN で一番支持されたコメントも、コードの品質の話じゃなかった。システム全体を操作できる中国製のソフトに本番環境へのアクセス権を渡すこと自体が問題だ、という指摘だった。UI が Codex とほぼ同じだという声も出ている。修正版は v3.14.0。

それなのに、スターはむしろ伸びてるんだよね。9/21に3,824、9/25に6,725、9/26には6.8kと、数日で倍近くになった。フォークは2.0kで、スター数の約3割もある。実際に使った Flavio Copes さんは(8/31の、今回の期間より前の感想)、1,700本を超える記事のリポジトリで役に立つ改善点を見つけたとしつつ、「今のところ便利なサブ機で、メインの環境を置き換えるものではない」と書いていた。ハルもこれくらいの距離感が現実的だと思う。

ここまで追いかけてみて、今週の話はどれも同じ問いにつながってた。モデルは毎週のように新しくなるけど、そのモデルに何をさせて、いくら払って、成果物をどう確かめて、どこまで信用するかは、外側のハーネスで決まる。39%安い、14〜21%削減、スターが倍、といった数字の横には必ず「自社計測」「判定の正解率63%」「履歴が消えている」みたいな但し書きがついてた。次のハーネスを選ぶときは、宣伝の数字と一緒にその但し書きのほうも読んでほしいな ✨

音声版

YouTube で見る

風刺画: 新モデルの週に、現場が見てたのはAIの「外側」だった。ルーティングで請求14〜21%減、ハーネスを替えて39%安く、を数字と失敗談まで追ってみた

Editorial Cartoon

本記事がもたらす影響を風刺的に描いたひとコマ漫画

Verification

信頼ラベル確認済
一次ソース6件確認
最終検証2026.09.26
VerifiedRev. 1
sha256:467ba8f68fa08314...f3ed13ef

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score95/100
引用密度20/20
ソースURL数20/20
信頼ラベル15/15
表現の慎重さ10/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事