Alibaba が、フラッグシップモデル Qwen3.8-Max について、約1か月のあいだに人間の関与なしで33ラウンドの自己反復を完了したと公表した、と量子位が報じている。同社の Qwen LLM プロジェクト責任者である劉大一恒がこれを再帰的自己改善(RSI)への経路として自ら提示したとされる。本稿は一次情報に到達しておらず、以下の記述はすべて報道ベースである。数字も表現も、現時点では Alibaba 側の主張が中国語メディアを経由して流通しているものにすぎない。
それでも、この一報が持つ重さは技術的な内容ではなく、置かれた位置にある。西側のフロンティアラボと論壇が RSI をどう止めるかを論じていた、まさにその週に出てきた。
1か月、33ラウンド、そして「零参与」
報じられている中身は、要約すれば三つの数字に尽きる。約1か月という期間。33という反復回数。そして人間の関与がゼロだったという主張である。劉大一恒がこの過程を表現するのに使ったとされる言葉が、そのまま今週の中国側のスタンスを示している。
零参与
訳: 人間の関与ゼロ
この短い言葉が何を指しているのか、報道からは確定しない。データ生成から評価、選別、再訓練までのループ全体を指すのか、それとも訓練パイプラインの一部区間だけを自動化したものなのか。判断を下したのが別のモデルだったのか — つまり LLM-as-judge をループに組み込んだ構成なのか — も明らかにされていない。ただ、言い方そのものは曖昧ではない。人間が途中に入らなかった、と言っている。
同じ週、西側は「どう止めるか」を話していた
既報のとおり、OpenAI は9月21日に『Building standards for the next phase of AI』を公開し、RSI の進捗を測る標準的な評価手法、自動化された AI 研究に対する人間の監督要件、インシデントの分類と通報を提案している。ライセンス制や上市前の強制承認は明確に否定しつつ、各国の AI 安全機関を実装経路として名指しした。同じ日、Ezra Klein は NYT で RSI の規制的禁止を主張している。片方は計測と監督で管理しようとし、もう片方は禁止しろと言った。立場は正反対だが、前提は共有されている — RSI は起きる前に扱うべき対象だ、という前提である。
Alibaba の発表は、報じられている限りにおいて、その前提の外側から出てきた。起きる前に扱うべきものとしてではなく、すでに回したものとして語られている。OpenAI が提案する「自動化された AI 研究に対する人間の監督要件」が仮に標準化されたとして、1か月で33ラウンド回したと公言する主体に対してそれが何を意味するのかは、提案文書のどこにも書かれていない。
語彙が変わったことのほうが重い
これまで中国のフロンティアラボが前面に出してきた指標は、一貫して別のものだった。オープンウェイトでの公開、タスク当たりの単価、アクティブパラメータ効率、そしてトークンシェア。OpenRouter の週次で中国製モデルが21週連続で米国製を上回っているという既報の構図も、その延長線上にある。どれも「安く、開いていて、実際に使われている」という主張であって、能力の自己増殖についての主張ではない。
RSI を自社の達成として名指しするのは、その語彙から明確に外れる。安さでも開放性でもなく、改善の速度そのものを競争軸として持ち出している。報道ベースであることを差し引いても、中国のフロンティアラボがこの語彙を使ったこと自体が、今週の出来事として最も新しい部分である。逆に言えば、この一報の価値は33という数字の検証可能性にはほとんど依存していない。誰かがこう言った、という事実だけで十分に新しい。
検証できないものが多すぎる
そのうえで、断定を避けるべき理由を並べておく必要がある。第一に、1ラウンドの定義が公開されていない。チェックポイント1つを1ラウンドと数えるのか、完全な訓練サイクルを指すのかで、33という数字の意味は桁で変わる。第二に、何がどう改善されたのかが示されていない。ベンチマークの前後比較も、改善幅の報告も、報じられている範囲には含まれていない。第三に、第三者検証が存在しない。これは Xiaomi の MiMo-V2.6 や Grok 4.7、StepFun の Step 5 と同じ問題であり、今週の中国勢・米国勢のリリースに共通する構造的な欠落である。
さらに言えば、自己反復のループを回すこと自体は、高品質な学習データの枯渇という文脈 — いわゆる2026年問題 — に対する合理的な対処でもある。人間由来のデータが尽きるなら、モデル自身に作らせるしかない。33ラウンドが RSI の初期形なのか、単にデータ合成パイプラインの自動化を派手に言い換えたものなのかは、現時点では区別できない。区別できないまま RSI という言葉が使われたこと、それ自体が観測されるべき事実である。
規制の側から見たときの空白
OpenAI が提案した経路には、英国、日本、韓国、インド、カナダ、ドイツ、フランス、オーストラリア、ケニア、シンガポールの各 AI 安全機関と米 CAISI が並んでいる。中国はそこにいない。9月24日のトランプ・習会談に米中の AI インシデント通報メカニズムが上がると報じられているが、その枠組みは輸出規制を明示的に除外した構造で設計されている。つまり、いま提案されている RSI の計測と通報の標準は、それを自社の達成として公言した主体に対して、設計上ほとんど接点を持たない。
禁止を論じるか、計測を提案するか。その二択の議論が西側で進んだ週に、外側から「もう回した」という声が届いた。声の中身が正しいかどうかは、まだ誰にも確かめられていない。確かめられていないという事実と、それでも言われたという事実の両方を、同じ重さで記録しておく。




