試す、比べる、選び直す。AI研究開発を温室に見立てた生成概念映像です。実際の研究施設やAlphaEvolveの画面ではありません。

AIにプログラムを書いてもらう。それだけでも十分便利なのに、そのプログラムが「次のAIを作るためのプログラム」だったら、何が起きるだろう。

できたAIが研究を速くする。その研究から、さらに能力の高いAIが生まれる。そのAIが、次の研究を手伝う。

言葉にするとSFのようだが、この循環の一部は、すでに動いている。面白いのは、AIが突然、自分の設計図を描き始めたという話ではないことだ。教材を作る、実験コードを書く、計算を速くする。研究を構成する仕事へ、少しずつ深く入ってきた。

「26%をAIが主導」の中身

Anthropicは、2026年8月時点で同社のAI研究開発業務の26%をClaudeが主導していると公表した。ここでいう主導とは、大まかな指示からタスクの大部分を進め、人間が監督する段階を指す。測定対象に、完全自律で運用されている領域はないという。Anthropicの測定報告

26%は、社員の26%が不要になったという数字ではない。研究開発の仕事を分類し、人員・作業の配分を近似した重みで集計した指標だ。外部機関が業界全体を調査した統計でもなく、同社による自己測定である。

それでも、「AIを使っています」という話から、「どの程度、まとまった仕事を任せています」へ説明が進んだことには意味がある。横について一手ずつ頼むのと、目的を渡して途中経過と結果を見るのとでは、研究者が試せることが変わってくる。

では、AIは具体的に何を引き受けているのか。その変化を、少し前からたどってみたい。

最初は、AIが別のAIの教材になった

AIからAIへ能力を渡す考え方は、最近突然生まれたわけではない。

代表的なものが「知識蒸留」だ。2015年のHintonらの論文は、複数モデルに蓄えられた知識を一つのモデルへ移す方法を示した。正解ラベルだけでなく、教師モデルが各候補をどの程度ありそうだと判断したかも学習に使う。Distilling the Knowledge in a Neural Network

たとえば、ある画像を「犬」とだけ教える場合と、「犬の可能性が高いが、猫にも少し似ている」と伝える場合を考える。後者には、正解一語にはなかった関係が含まれる。これは仕組みをつかむためのたとえだが、教師の出力が豊かな教材になる理由を想像しやすい。

2022年のConstitutional AIでは、別の渡し方が示された。原則に沿ってAIが回答を批評・修正し、修正した回答やAIによる比較評価を訓練に使う。安全性のための個別ラベルを人が一つずつ付ける負担を減らす試みだった。Constitutional AIの原論文

こちらは、教材になるだけでなく、教材を直したり採点したりする側にもAIが入る。人がすべての例題と赤ペンを用意しなくても、学習の材料を増やせるようになる。

ただし、教材を作ることと、研究方針を立てて新しいAIを開発することは、同じではない。次の変化は、その外側にある仕事へAIが入ってきたことだ。

「もっと速く計算する方法を探して」を任せる

23%の高速化と、全体1%の短縮

Google DeepMindが公表した、対象カーネルの23%高速化と訓練全体の時間の1%短縮。対象・指標が異なるため、共通の目盛りや面積の割合としては描いていません。

具体例として分かりやすいのが、Google DeepMindのAlphaEvolveだ。2025年に発表されたこの仕組みは、Geminiを使ってプログラムの候補を作り、自動評価し、良い候補を次の探索へ回す。AlphaEvolveの公式発表

「このコードは良さそうです」という感想で終わらない。実際に条件を満たすか、速く動くかを測り、その結果を使って次の案を作る。

同社は、Geminiの訓練に使う行列計算の処理を改善し、対象となる重要な処理を23%高速化、訓練全体の時間を1%減らしたと報告している。23%はAI全体の性能向上ではなく、特定の計算処理の高速化だ。

ここが面白い。AIが、AIを育てる計算のやり方を改善している。

1%と聞くと、小さく感じるかもしれない。でも、巨大な計算を何度も繰り返すなら、一回ごとの節約は積み上がる。空いた時間や資源を別の実験へ回せれば、試せる案も増えるだろう。

そして2026年7月には、AlphaEvolveはGoogle Cloudで一般提供へ進んだ。研究所の中の特別な実験だけでなく、外の組織が最適化に使う入口もできている。Google Cloudの提供発表

研究の変化は、「試せる回数」に現れる

試せる回数を増やす、というやり方

候補となる実験・案が自動評価を通って絞られ、次の探索へ回るという研究の流れを示した概念図。Anthropic・Google DeepMindいずれか特定の実数値を図示したものではありません。

仮に、あるモデルの回答を良くするために、三つの方法を比べたいとしよう。

まず試す条件をそろえる。実験のコードを書く。計算を実行する。結果を集める。うまくいかなければ、実装のミスなのか、仮説が外れたのかを調べる。この繰り返しに時間がかかるから、試す前に諦める案も出てくる。

AIエージェントへ、このうちのまとまった工程を任せられたらどうか。人間が考えた一案を完成させるだけでなく、別案も比較できる。外れた案を調べ直す余裕ができる。

これは具体的な研究の流れを説明するための例で、各社が同一の手順を使っているわけではない。ただ、研究の加速を「一つの答えが速く出る」だけで考えると、見落とすものがある。

昨日なら試さなかった案を、今日なら試せる。そこから新しい発見が生まれる可能性がある。AIの進化が次のAI研究を速くする、という話の手触りは、このあたりにあると思う。

速く回すほど、「何を良い結果とするか」が効いてくる

もちろん、試行回数を増やせば自動的に正しい方向へ進むわけではない。

速さを競わせたら、答えを省略して速くなった。正解率を上げようとしたら、評価に使う問題を覚えてしまった。そんな結果を改善として採用しては意味がない。これも特定製品の事故ではなく、評価を設計する際に考えたい例だ。

目的に合った測り方があって初めて、試行錯誤は進歩になる。速度だけでなく正しさも守る。開発中の問題と、最終確認の問題を分ける。別の条件でも改善が残るか確かめる。

AIが候補を出し、別のAIが確認することも有用だろう。ただ、同じ種類の間違いを二者とも見逃す可能性はある。Anthropicも、同社の測定で自社モデルを判定役に使うことの限界を説明している。

だからといって、人間がすべての行を読み直す形に戻すだけでは、得られる速さを失ってしまう。必要なのは、任せる範囲を増やすことと、確かめる方法を育てることを、一緒に進める発想だと思う。

「AIがAIを作る」は、一つの出来事ではない

別のモデルへ知識を渡す。訓練用の回答を作る。実験を進める。計算方法を改善する。これらはすべてAI開発に役立つが、自分の後継モデルを人間抜きで作り続けることとは区別したい。

同時に、完全自律に到達していないから変化は小さい、と見るのも違う。研究を進める知能そのものを、研究へ投入できるようになっているのだから。

その先にあるのは、チャットの返事が少し賢くなることだけではない。新しい薬、材料、機械、エネルギーの使い方。研究を助ける能力が広がれば、私たちが別々の分野で解きたかった問題にも、その力を回せるかもしれない。

私は、そこに大きな期待を持っている。人間が思いついた可能性を、試さずに捨てなくてよくなること。AI開発の加速が、ただ次のモデルを急いで出す競争ではなく、そういう豊かさにつながってほしい。