洗濯物を畳む。食器を下げる。猫のトイレを掃除する。普段なら「済ませておきたい家事」であるその動きが、ロボットを育てる教材になる。

Figureが2026年8月25日に発表したIndexは、人の現実の作業を集める仕組みだ。スマートフォンのアプリを通じて、家庭や仕事場での動作を撮影してもらい、学習用データへ整える。FigureのIndex発表

面白いのは、「ネットにあるものを読む」だけでは足りなくなり、次の知性に必要な教材を、自分たちで集める場所からつくっていることだ。生成AIの学習データをめぐる話が、今度は人の手の動きにつながってきた。

猫が分かることと、猫の器を洗えることは違う

Fei-Fei Liの2015年のTED講演を覚えている人もいるだろうか。コンピューターに画像を理解させるため、大量の画像データから学ばせる取り組みを、子どもの視覚経験とも重ねながら紹介した講演だ。画像理解を教えるTED講演

猫の形を文章で細かく定義するだけでは、横向きの猫、丸まった猫、暗い場所の猫をうまく扱えない。さまざまな見え方から、共通する特徴を捉える学習が役立つ。人とAIの脳内機構が同じという証明ではないが、「たくさんの経験例が必要になる」という入口として分かりやすい。

では、猫の器を洗うロボットならどうだろう。器を認識できても、まだ仕事の半分にも届かない。どこを持つか。傾けると水はどう動くか。滑ったらどう支え直すか。洗った後、どこへ置くか。

今度の教材には、物の名前だけでなく、時間の流れと、働きかけた結果が要る。動画で動作を集める意味は、そこにある。

きれいな実演だけでは、世界のばらつきに追いつかない

同じ「タオルを畳む」でも、厚さも大きさも、置き方も違う。作業台の高さも、人の手順も違う。実験室で丁寧に揃えた条件だけでは、家庭に持ち込んだときの違いを拾いきれない。

柔らかい布、滑るガラス、形の違う器。日常のばらつきを学ぶ難しさを描いた生成イメージです。特定ロボットの実演ではありません。

FigureはIndexについて、100か国を超える地域から動画が届き、発表時点で投稿者への支払いが累計1,500万ドルに達したと説明している。集めたものは、そのまま全部投入するのではなく、品質確認、重複の除去、偏りの調整、動作に対応する説明付けなどを行うという。数値は同社公表値で、本稿の独立検証ではない。

大事なのは、同じ家事を一万回撮れば終わりではないことだ。似た映像ばかり増えても、初めて出会う器や棚に強くなるとは限らない。「違う」を集め、それが何の動作なのか分かる形へ整えるところに、教材づくりの仕事が生まれる。

人の動画を見ただけで、ロボットの腕は動くのか

ここには、もう一段の翻訳が必要だ。人の指とロボットの手は違う。動画には、その瞬間にかけた正確な力や、ロボットの関節角度が、そのまま記録されているわけではない。

人の動作が学習用の例を経てロボットの作業になる流れと実データ・合成データの違いを示す図 人の実演を動画で集め、学習用の例に整え、ロボットの動作へつなげる流れを示す図。実データを実線、シミュレーション等の合成データを破線の補助経路として区別している。 人の動作が、ロボットの教材になるまで 人の実演 (タオルを畳む等) 学習用の例 合成データ ロボットの作業 実線=実演/破線=合成(補助)
Figureの「Index」が人の実演動画を集めて学習用の例に整え、ロボットの動作へつなげる流れを図示した(FigureのIndex発表)。破線はシミュレーション等の合成データによる補助を示す。※特定企業の性能を示す図ではありません。実データと合成データを実際に組み合わせる比率を示すものではありません。

2026年6月の査読前研究HumanScaleは、人の一人称動画で事前学習し、その後、ロボット自身の動作データで適応させる方法を検証した。研究条件内では、人の動画から学ぶことが実機の課題に役立ち、同量のロボットデータによる事前学習を上回る結果も報告された。HumanScaleの研究

これはIndexそのものの性能試験ではない。それでも、仕組みの見通しは立つ。人の動画で、作業の流れや世界の変化を広く学ぶ。機体のデータで、自分の体をどう動かすかへつなぐ。

日本でもAIRoAが、約5,000時間のロボット動作データと基盤モデルなどを公開した。人の映像を広く集める道と、機体で正確な動作を集める道。どちらか一方だけというより、互いの得意な部分を生かす発想になる。AIRoAの公開データ

「学習データが足りない」の意味が変わる

文章を扱うAIでは、学習に使える良質な公開データの量が議論されてきた。Epoch AIは、人が書いた公開テキストの量と学習規模の伸びを分析し、従来の傾向が続く場合の限界を試算している。未来に必ず尽きる日の予言ではなく、学習の方法やデータ供給が変われば条件も変わる研究だ。Epoch AIのデータ資源研究

ロボットの場合は、それ以前に、欲しい種類の記録が十分あるかが問題になる。世界には動画が山ほどある。でも、その全部が、手の動きや物体の変化を学ぶのに適しているわけではない。

そこで教材を増やす方法も分かれる。

集め方得られるものつなぐ必要があるもの
人の作業を撮る多様な場所・物・手順の映像機体固有の動作や力との対応
ロボットを操作して記録する機体の動作とセンサーの対応収集コストと、環境・作業の多様さ
シミュレーション等で生成する条件を変えた大量の練習例現実とのずれを、実機データで確かめること

学習データづくりの概念比較です。Indexは主に人の実作業を収集する取り組みであり、AIが動画を自己生成するサービスではありません。

「AIが自分の教材を作り出す」と聞くと、最後の合成データを想像しやすい。Indexで起きているのは、まず教材の生産体制をつくることだ。人が実際に動き、その経験をAIへ渡す。

対してNVIDIAのCosmos Transferでは、深度や輪郭などの条件を使い、シミュレーション等の世界をより現実に近い映像表現へ変える研究が行われている。集めた経験を土台に、違う見え方の練習問題を増やす方向だ。ただし、もっともらしい映像を作れたことと、現実の力学まで正しく再現できたことは同じではない。人の実演、機体の記録、合成した練習例を、実際の動作で確かめながら組み合わせることになる。Cosmos Transferの研究

音楽や画像で揉めた問いが、手仕事にも来る

音楽生成AIでは、既存の録音を学習に使う権限をめぐって、レコード会社がSunoを提訴した。2024年の訴状で問われたのは、生成の巧さだけではなく、誰の作品を、どの条件で学んだかだった。これは提訴当時の主張であり、その後の個別の契約や解決状況とは分けている。Sunoに対する2024年の訴状

動作データも、映っているから何でも自由に使えるわけではない。職場の秘密、同僚や家族の映り込み、作業を撮影する許可が関わる。投稿した人への対価だけで、周囲の権利が全部片づくわけでもない。

一方、対立だけが続いているわけでもない。UMGとUdioは2025年10月、両社間の訴訟の和解と、許諾を受けた音楽を使う新サービスに向けた契約を発表した。ロボットの動作データと同じ法律問題ではないが、「学ぶ材料をどう用意し、提供する側へ何を返すか」を、事業の仕組みにする動きとしてつながっている。UMGとUdioの合意発表

そのうえで、最初から目的を示し、必要な許可を得て、新しい教材をつくる人へ対価を返す仕組みには、前向きな可能性があると思う。既存コンテンツを奪い合う話だけでなく、これから必要な経験を生産する仕事へ、発想を広げられるからだ。

私たちが何気なくできる動作は、機械にとってはまだ難しい。その「何気なく」の中に、次の知性を育てる価値が眠っている。世界を読んできたAIが、今度は世界で動くために、人の暮らしから学ぼうとしている。Indexの面白さは、そこにある。

2026年9月7日確認。提訴は権利者側の主張で、すべてのAI学習の違法性を認定するものではありません。本稿は参加契約や個別の権利処理を監査したものではありません。