AIの現場確認済Read in English

AIエージェント90体が3日で磁性材料を探索、いちばん効いたのは「5件の訂正」まで残した記録帳だった

Vals AI の候補は2つ。1つは1999年に合成済みで、もう1つは合成が難しそう。それでも公開された ledger には読む価値があった

美咲 ハル|2026.10.06|10分|更新: 2026.10.06

Vals AI が Claude Opus 5.5 のエージェント90体以上に3日で磁性材料を探させ、候補を2つ出したんだよ。ただ1つは1999年に合成済みの物質で、もう1つは合成が難しそう。それでも61件の主張を検証できて5件の訂正も残した記録帳が、批判の足場になったんだよね。

Key Points

AIエージェント90体が3日で磁性材料を探索、いちばん効いたのは「5件の訂正」まで残した記録帳だった

「AIに研究させたら新素材が見つかりました!」って見出し、最近ほんとによく見るよね。でも今回ハルが追いかけた Vals AI の材料探索は、ちょっと読み味が違った。成果の数字と同じくらい目立ってたのが、自分たちで見つけて書き残した「5件の訂正」と、Hacker News で飛んできた「その物質、1999年にもう作られてるよ」っていうツッコミだったんだよ 👀

先に言っておくと、ハルは手元で計算を回したわけじゃない。Vals AI の公式ブログ、公開された GitHub リポジトリ、報道記事、それから HN のコメント97件を片っ端から読み込んで、何が起きたのかを整理してみた。

Claude Opus 5.5 のチームが探したのは「外に磁力を出さない磁性体」

まず、何を探したのか。Vals AI の公式ブログによると、狙いは次世代メモリ向けの「補償型磁性体」。名前はむずかしいけど、ざっくり言うと「物質全体としては磁力が打ち消し合ってゼロなのに、中を通る電子をスピン(電子が持ってる小さな磁石の向き、みたいなもの)で振り分けられる物質」のこと。外に磁力が漏れないから、メモリをぎゅうぎゅうに詰めてもお互い邪魔しにくいのが嬉しいところなんだよね。今回はそのうえ「半導体」で、しかも「室温でも」その性質を保つものを探してた。条件、欲張りすぎじゃない?😊

Vals AI はこれを Claude Opus 5.5 のエージェントのチームに任せて、候補を2つ報告した。1つ目は、エージェントが新しく設計した YBaMnFeO₅。予測されたバンドギャップ(電気を通すか通さないかを分ける壁の高さ。半導体らしさの目安)は 2.35 eV で、磁気の秩序(スピンの向きがそろった状態)は約420K、較正後の値だと490K(約217℃)まで保つと計算されてる。2つ目は KV[Cr(CN)₆] で、バンドギャップは約2.1 eV、376K(103℃)まで磁気秩序を保つという予測。どっちも室温(だいたい300K)よりかなり高いから、数字だけ見ると「おお」ってなる。

ただ、大事な注意書きがある。どちらも計算上の仮説で、実験ではまだ確かめられていない。しかも著者自身が、YBaMnFeO₅ はシミュレーションで約950K(約677℃)まで温めると原子の並びがランダムに崩れたから、合成は難しいかもしれない、とブログに書いてるんだよね。都合の悪い結果を自分で書いてるところは誠実だなって思った。

体制については、AlphaSignal の報道によると、エージェントは90体以上で、期間は3日。Modal のクラウドCPU上で Quantum ESPRESSO という計算ソフトを使って、第一原理計算(DFT。原子の並び方から、電子がどう振る舞うかを量子力学で計算するシミュレーションのこと)を約750件流したと報じられている。さらに別のエージェントを反論役の査読者にして、結果を突き返させる仕組みで回していたそうだ。AIの研究チームの中に、AIの意地悪な先輩がいるイメージかな 🛠️

主役は compensated-magnet-ledger っていう「研究の帳簿」

ハルがいちばん面白いと思ったのはここから。Vals AI 側は、計算の入力・出力・解析スクリプトをまるごと GitHub の compensated-magnet-ledger に公開していて、ワンコマンドで中身を確かめられるチェッカーまで付けている。ledger(レジャー)は「帳簿」っていう意味で、まさに研究の家計簿なんだよね。

中身の数字もかなり具体的。DFT の入力は全部で876件(pw.x という計算プログラムを868回実行、残り8件は後処理)。報告した主張は61件あって、1件ずつ4つの検証ルートのどれかにひも付けてある。内訳は、生の計算出力から再計算できるものが52件、付属のスクリプトで再現できるものが3件、解析ファイルから確認するものが3件、文献や実験値に頼っているものが3件。つまり「この数字はどこから来たの?」って聞かれたら、61件全部に答えが用意されてるってこと。

そして、まとめる途中で見つかった訂正5件も、消さずにそのまま記録してある。たとえばこんな感じ。

正直、どれも「AIあるある」というより「研究あるある」なんだよね。人間の研究室でも普通に起きることばかり。違うのは、それが帳簿に全部残っていて、外の人があとからたどれるところ。リポジトリは2026年10月1日〜4日に作られたもので、スター10、コミット11とまだ小さい。でも成果の見た目より、こっちのほうがよっぽど価値があるってハルは思った 💡

HN のツッコミ「それ、1999年にもう作られてるよ」

公開されると、Hacker News の投稿は114ポイント、コメント97件まで伸びた。材料研究にくわしい人たちが中心になって、「本当に新しいのか」「作れるのか」「計算は信用できるのか」について、かなり厳しい指摘が並んでる。

いちばん刺さったのは2つ目の候補、KV[Cr(CN)₆]。otterley さんや lifeisloving さんは、これは人間がすでに合成した物質だから「発見」とは呼べないと指摘した。合成の記録は1999年の1回だけ、つまり約27年前。ブログ本文でも1999年に合成された物質として紹介されてはいるんだけど、「エージェントが見つけた」という受け取られ方をすると話が変わっちゃうよね。einpoklum さんは、正確な見出しは「研究者が Opus 5.5 のエージェントを使って確認作業をした」くらいだろうと書いてる。ハルもこれはわりと納得。

1つ目の YBaMnFeO₅ にも厳しい声が出てる。devmor さんと Legend2440 さんは、この物質は原子を市松模様みたいにきっちり交互に並べる必要があって、今の材料科学では合成できない可能性が高いと指摘した。ここは著者自身も、普通の作り方だと並びが崩れるだろうと認めている部分なんだよね。

計算の道具そのものを疑う声もあった。contemporary343 さんは、Quantum ESPRESSO は DFT の最先端とは言えないし、DFT の結果はかなり割り引いて見るべきだとした。さらに「Claude に書かせて、レビューしていない結果に見える。著者は中身を理解しているのか」とまで書いている。rsfern さんは、DFT は電子同士が強く影響し合う物質や、温度がある状態での効果をうまく扱えないと指摘した。磁性体はまさにそこが効いてくる分野だから、痛いところを突かれてる感じ 🤔 そもそも、どちらの候補もバンドギャップやスピンの振り分けは実測されていない。

一方で、「数学の定理を解かせるより、ずっと良い LLM の使い方」という肯定的なコメントもあった。仮説をたくさん出して、計算で絞り込んで、人間の実験に渡す。その入口として見るならアリ、と受け止めた人もいたんだよね。

任せるなら、答えの速さより「たどれる帳簿」

ここで思い出したいのが、同じ Vals AI が9月23日に出した最短経路アルゴリズムの件。こちらはエージェント10体・15時間で取り組んだものだったけど、実際のグラフでは誰もベンチマーク(性能比較のテスト)をしておらず、計算量の定数がとても大きいことを担当者自身が認めていた。今回の材料探索もそうで、「速く見つけた」という主張が実際に役立つものにつながるかは、どちらの件でもまだ確かめられていない。

じゃあ今回の取り組みは意味がなかったのかというと、ハルはそうは思わない。むしろ逆で、批判がここまで具体的にできたのは帳簿が公開されてたからなんだよね。hull distance の過小評価も、先行研究の見落としも、収束前に止まった計算も、全部 ledger に書いてある。90体のエージェントが3日で出した答えそのものより、「どの数字がどの計算から来て、どこで間違えて、どう直したか」が残っていることのほうが、次に続く人の役に立つ。

最近の言葉で言うと、エージェントの動きを記録してあとから評価できるようにする Agent Observability(エージェントの足跡を追いかけられる仕組み)を、研究そのものに持ち込んだ形だと思う。ハーネス(エージェントの動かし方やツールの使い方を決める枠組み)に、反論役の査読エージェントを組み込んだのも同じ発想だよね。ただ、査読役も同じ Claude Opus 5.5 だった。だから DFT 自体の限界や「1999年にもう合成されてる」みたいな文献の抜けまでは、中で突き返しきれなかった。そこを埋めたのは結局、HN にいた人間の専門家だったんだよね。

だからハルの結論はこう。エージェントに研究を任せるとき、勝負を分けるのは答えを出す速さじゃなくて、外の人が一つずつ確かめられる記録が残っているかどうか。速さは自慢になるけど、信頼につながるのは帳簿のほう。自分でエージェントに調べものを任せるときも、「結論だけちょうだい」じゃなくて「根拠と、途中で直したところも全部残して」って頼むクセをつけたいなって思った ✨

音声版

YouTube で見る

風刺画: AIエージェント90体が3日で磁性材料を探索、いちばん効いたのは「5件の訂正」まで残した記録帳だった

Editorial Cartoon

本記事がもたらす影響を風刺的に描いたひとコマ漫画

Verification

信頼ラベル確認済
一次ソース4件確認
最終検証2026.10.06
VerifiedRev. 2
sha256:25a2e52e99093422...4b22fce3

この記事はEd25519デジタル署名で検証済みです。改ざんは検出されていません。

検証API
Ethics Score95/100
引用密度20/20
ソースURL数15/20
信頼ラベル15/15
表現の慎重さ15/15
キーポイント10/10
サマリー品質10/10
本文充実度10/10

v1.0.0 — ルールベース自動採点

詳細API
Share

関連記事