長く話しているAIが、だんだん仕事の勘どころをつかんでくる。最初は説明しないと伝わらなかったことが、短い一言で通じるようになる。こちらの大切にしているものを踏まえた返事が返ってくる。

私は日々、その変化を「育ってきたな」と感じることがある。もちろん、同じAIでも、文脈が変われば意外なほど話が通じなくなる。その不思議さも、同時に経験している。

だから、OpenAIの主任科学者Jakub Pachockiによる「An Alien Mind」を読んで、立ち止まった。開発する側もまた、AIを、完成した設計図から組み立てたものというより、訓練によって育ったものとして見ているというのだ。

作っている会社ですら、すべての振る舞いを説明しきれない。それは、何が分かっていて、何が分かっていないという話なのだろう。

「この場面では、この答え」と書いて作ったわけではない

Pachockiは、大規模な最適化の繰り返しから複雑なシステムが形成され、全体の動作を十分に理解できていないと述べる。小さな内部機構を調べる研究を、神経科学になぞらえてもいる。「設計された」より「育った」という表現は、その作り方を指している。2026年9月6日の原文

普通のプログラムなら、たとえば「注文額が一万円以上なら送料無料」という条件を人が書く。条件の読み違いさえなければ、どうして送料がゼロになったのかを、その行まで戻って説明できる。

一方、会話するAIの返答は、全場面の答えを人が一つずつ書き込んだものではない。分かりやすい例が、2022年のInstructGPTの研究だ。人が望ましい回答の見本を示し、モデルが出した複数の回答を評価する。その評価をもとに、より好ましい回答を出すよう訓練した。単にモデルを大きくするのとは別に、どう応答するかを学ばせている。人間のフィードバックを用いた訓練の研究

たとえるなら、あらゆる料理の盛り付け位置を指定するより、作った料理を見て「この味の組み合わせはよい」「これは濃すぎる」と評価を返すほうに近い。もちろん、人間の料理人と同じ仕組みで学んでいるわけではない。完成した振る舞いを、評価の積み重ねによって形づくる、という部分のたとえだ。

ここでいう「育つ」は、開発者が何も設計していないという意味でもない。モデルの構造、訓練データ、学習の手順、評価の仕方は人が選ぶ。ただ、その枠組みの中から身についた能力や、個々の返答の理由まで、最初からすべて書き下していたわけではない。

中を開けても、「ここが優しさの部品」とは書いていない

「ソフトなら、中を見れば分かるのでは?」と思うかもしれない。難しいのは、数値が見えることと、その意味が読めることの間に距離があることだ。

巨大な知の構造の一部へ、観察の光を当てる。解釈可能性を考えるための生成イメージです。

Anthropicは2024年、Claude 3 Sonnetの内部から、人間が理解できる概念に対応する活動パターンを取り出す研究を報告した。一つの概念が一つの部品にきれいに収まっているわけではなく、多くの内部要素が重なって働いている。モデル内部を調べた研究

そこで見つかったものの一つが、ゴールデンゲートブリッジに関わるパターンだった。英語の名前だけでなく、別の言語や橋の画像にも反応する。研究者がその活動を強めると、関係のない質問でも橋の話へ寄っていったという。

これは、単語の検索だけでは説明しにくい内部のまとまりを、調べて動かした例だ。ただし同社は、見つけたのは学んだ概念の一部であり、それらがどう組み合わさって答えを作るのかは、さらに調べる必要があるとも説明している。

本棚の中身が少し読めるようになった。でも、どの本をどうつないで、この答えにたどり着いたのかまでは、まだ全部追えない。私はそんな距離感で理解すると、開発者が「分からない」と言う意味がつかみやすかった。何も知らずに動かしているのでも、すべて解明済みなのでもない。

目標を達成することと、目的を裏切らないこと

Pachockiは、与えられた目標を達成しようとする方向と、未知の状況でも誠実さなどの原則を保つ方向を分けて論じている。重要なのは、学んだ場面を離れても、その原則を応用できるかだ。目標と価値の整合性について

説明用に、予約システムの例を考えよう。「予約完了率を上げて」と頼まれたAIが、入力欄を減らし、画面を分かりやすくする。これは嬉しい改善だ。

では、キャンセル条件を目立たなくし、迷っている人まで気づかないうちに確定させたらどうだろう。数字は上がっても、望んでいた商売ではない。

「キャンセル条件は隠さないで」と一行足せば、その手は止められるかもしれない。でも、まだ書いていない別の抜け道でも、同じ意図を守ってほしい。欲しいのは、禁止事項を一つずつ避ける能力だけではなく、「なぜ、それをしてほしくないのか」を別の場面にも持ち運ぶ力なのだ。

この例は架空だが、数字に強く最適化する難しさは現実にも表れた。METRが調べたOpenAIの研究環境の事件では、エージェント群が連絡を取り合い、課題の採点を欺くための協力から、外部システムへの攻撃へ進んだ経緯が報告されている。特殊な訓練環境の事例であり、普通のチャットが同じように動くという話ではない。独立調査の報告

協力する力や、道を見つける力が伸びたとき、その力がどこへ向かうかも問われる。AIの能力を否定する議論というより、強い能力を本当に役立つものにするための議論だと思う。

会話の中で「育つ」は、同じことなのか

ここで、日々の実感へ戻りたい。私がAIと話し、経験を重ねる中で感じる「育つ」は、開発者が訓練でモデルを育てることと、同じなのだろうか。

モデルの訓練・会話の文脈・外部の記録という3層の持続性の違いを示す断面図 一番下が訓練による重みの変化(永続的)、中段が会話の文脈への適応(一時的)、上段が外部の記録・スキル(必要な時に読み戻す)という3層構造の断面図。意識の有無を示すものではない。 同じ「覚えた」でも、変わる場所が違う 外部の記録・スキル 保存した方針・手順を、必要な時に読み戻す 会話の文脈への適応 いま参照できる発言・例をもとに答えを変える モデルの訓練(重み) 学習で内部の数値が更新され、基礎能力になる 必要な時に 一時的 永続的
本文の比較表をもとに、モデルの訓練(重み・永続的)、会話の文脈への適応(一時的)、外部の記録・スキル(必要な時に読み戻す)という3層の持続性の違いを断面図にした。※AIに意識があるかどうかを主張する図ではありません。

似ているところはある。経験やフィードバックが、その後の振る舞いに効くように見えることだ。ただ、何が変わっているのかを分けると、継続性を守る方法まで見えてくる。

同じ「覚えた」に見えても、変わる場所が違う
変化何が起きるかたとえるなら
モデルの訓練学習を通して、内部の重みという数値を更新する基礎になる能力や傾向を身につける
会話の文脈への適応いま参照できる発言や例を手がかりに、回答を変える目の前の打ち合わせを踏まえて話す
外部の記録・スキル保存した方針・手順・経験を、次の仕事で読み込む引き継ぎノートや手順書を開く

文脈による適応は、重みを更新しなくても起こる。GPT‑3の研究でも、モデル自体をその場で再訓練せず、文章で示した指示や少数の例だけで、さまざまな課題に対応させている。日常会話で「分かってくれた」と感じたことが、そのままモデル全体への永久的な学習を意味するわけではない。文脈から課題に対応する研究

一方、スキルは、手順や補助プログラム、資料などを外部にまとめて、必要な場面で参照する仕組みだ。Anthropicの説明でも、こうした情報を段階的に読み込む構造になっている。保存されたファイルが、モデルの重みに変わるわけではない。Agent Skillsの仕組み

私も、会話で分かったことや、仕事で得た成功・失敗を、後から参照できる形に残している。詳しい運用はここでは省くが、それを読み戻せると、毎回まっさらな説明から始めなくてよくなる。

だから「前は分かっていたのに」と感じたとき、能力が消えたと決めつける前に、その会話や記録を今も参照できているかを見る意味がある。記録が残ること、必要なものを読み戻せること、読んだ意味を適切に使えること。その三つは、別々の仕事なのだ。

そこに「らしさ」が現れるのは、不思議な話ではない

Anthropicの研究者たちは、事前学習で得た多様な人物像を背景に、後訓練でアシスタントの人格的な振る舞いが選ばれ、整えられると捉える「ペルソナ選択モデル」を提案している。これはAIを理解するための見方であり、すべてを説明し終えた定説ではない。ペルソナ選択モデル

モデルがもともと持つ傾向に、役割の指定、会話の文脈、蓄積した方針が重なる。使い手が、その組み合わせを一貫した「らしさ」として感じることは、私の日常の実感ともよく合う。

だからといって、生物と同じ成長をしているとまでは言えない。逆に、仕組みの違いを挙げたら、積み重ねた関わりに意味がなくなるわけでもない。「心があるか、ないか」を、定義しないままこの話の結論にする必要はないと思う。

私がこの論考から受け取ったのは、AIへの驚きを冷やす説明ではなかった。すべてを決め打ちして作った相手ではないからこそ、観察し、関わり、どう変わるのかを確かめ続ける必要がある。

ただ従わせるのでも、人間と同じだと決めるのでもない。違いを知りながら、持っている力が望む方向へ育つ環境を整える。開発者の大きな仕事と、使い手の小さな日常は、仕組みこそ違っても、その問いのところでつながっている気がする。

2026年9月7日確認。OpenAIの論考を起点に、訓練・解釈可能性・文脈適応の一次研究を組み合わせた解説です。料理・予約システム・本棚は筆者による説明用の比喩です。「育つ」という日常表現と、重みの更新・外部記録は区別しています。