冒頭は記事のために生成したイメージ映像です。実機、実在施設、観測データを示すものではありません。

ものすごく頭はいい。でも、三時間頼んだ仕事を二時間五十分で投げてしまう。

そんな相手を、私たちは「仕事ができる」と評価するだろうか。

AIの比較では、難しい問題を何問解けたか、コードを何件直せたか、回答品質が何点だったかが注目される。けれどAI Agentへ調査、開発、資料制作のような長い仕事を任せ始めると、別の能力が急に大きく見えてくる。

途中で道具が止まった時、復帰できるか。

会話が長くなっても、目的を忘れないか。

失敗した工程だけをやり直せるか。

そして最後に、仕事が本当に終わったことを証明できるか。

2026年、AIの評価軸は「どれだけ賢いか」から、「どれだけ長く、壊れず、最後まで運べるか」へ広がり始めた。

その変化を、真正面から言葉にした新モデルがある。2026年8月12日に発表されたGrok 4.6だ。

Grok 4.6が主役にした「長く走る力」

xAIはGrok 4.6を、long-running agentsへ重点を置いたモデルだと説明した。

一つの質問へ答えるだけではない。馴染みのない分野を調べ、情報を整理し、codebaseを横断し、アプリや仕事の成果物を形にする。その間、たくさんのstepをまたいでも仕事に留まり続けることを目指している。

xAIによれば、長いtrajectoryでは、次へ進む前に自分の仕事をtestし、確認する動きも以前より見られたという。

これは重要な方向転換だと思う。

これまでのAIは、100メートル走の選手として評価されることが多かった。合図と同時に走り、一問へ鮮やかに答える。

一方、Agentへ任せる仕事は、山を越える長距離レースに近い。天候が変わる。道具が壊れる。地図にない分岐が出る。最初に立てた計画も、途中で直さなければならない。

そこで必要なのは、最高速度だけではない。

補給し、現在地を確かめ、間違えた分岐から戻り、それでもfinish lineへ向かう力だ。

ただし、「Grok 4.6は長い仕事を必ず完遂する」と読んではいけない。長時間Agentを重視したという説明はxAI自身によるものだ。実環境の完遂率は、仕事、tool、指示、実行基盤、採点方法によって変わる。

むしろ、xAI自身が公開した数字を見ると、長距離の難しさがよく分かる。

65.9%と31.9%は、矛盾していない

Grok 4.6のmodel cardでは、long-horizon software engineeringの完了を測るDeepSWE 1.1で、high thinking effortが65.9%、xhighが67.0%と報告されている。

一方、数百万token、数時間にわたるtrajectoryを含み得る、さらに長いSWE-Marathon 1.1では、highのresolution rateは31.9%だった。

この二つを並べて「どちらが正しいのか」と考える必要はない。

courseが違う。toolやharnessが違う。成功の採点方法も違う。長さだけでなく、求められる仕事の性質が違う。

だからこそ、ここから見えるものがある。

「難問を解ける」と「大きな仕事を完成させられる」は、同じ点数では測れない。

同じmodel cardでも、複数アプリをまたぐ業務を、全criteria達成で採点するAPEX-Agentsは57.5%。terminal上の現実的なtaskを扱うTerminal-Bench 3.0は26.0%。専門家がall-passで判定するLegal Agent Benchmarkは15.8%だった。

これはGrok 4.6の弱点を並べたいのではない。他modelも含め、長い仕事では「何をもって完了とするか」で数字が大きく変わる、という話だ。

benchmarkの首位を選ぶだけでは、自社の仕事が終わる確率は分からない。

必要なのは、自分たちの仕事で、どこまでを一つのtaskと呼び、何が揃えば成功なのかを決めることだ。

Agentの強さは、試験の種類によって変わる。DeepSWE:ソフトウェア課題の解決を見る。SWE-Marathon:長い工程をまたぐ完遂を見る。APEX-Agents:複数アプリを横断する仕事を見る。Terminal-Bench:terminal上の課題を解決する力を見る

Grok 4.6の2026年8月発表を例にした試験の違い。採点条件が異なるため、数字を同じ業務成功率として並べない。 図を大きく開く

「8時間horizon」は、8時間放置できるという意味ではない

長時間Agentを語る時、よく引用される研究にMETRのtask-completion time horizonがある。

ここにも、誤解しやすい言葉がある。

METRの「50% time horizon」は、AIが実際に何時間動き続けるかを表す数字ではない。人間の専門家なら何分、何時間かかる難しさのtaskに対し、そのAI Agentが50%の確率で成功すると予測される地点だ。

つまり「8時間horizon」は、AIを8時間放置しても大丈夫という免許証ではない。

しかもMETR自身が、評価taskは主にsoftware engineering、machine learning、cybersecurityで、自己完結し、比較的はっきり採点できるよう作られていると説明している。

現実の仕事はもっと散らかっている。

担当者の頭の中にしかない前提がある。途中で優先順位が変わる。顧客の「なんとなく違う」を読み取る。成功条件を数字だけで書けない。

METRも、こうしたmessyなtaskではAgentのperformanceが下がるとしている。

だからtime horizonは、Agentの進歩を見る大切な物差しでありながら、会社の仕事をそのまま自動化できる範囲を示す地図ではない。

500k contextは、巨大な机である

Grok 4.6 APIは、500,000 tokenのcontext windowを持つ。textの出力上限も設けていない。

長い仕事には心強い。たくさんの資料、会話、tool resultを一つの作業空間へ置ける。

けれど、広い机を買ったからといって、重要書類をなくさなくなるわけではない。

机が大きければ、置ける紙は増える。同時に、古いerror log、やり直す前の指示、途中で捨てた案も積み上がる。

xAIはlong agent loop向けに、context compactionも提供している。長くなった会話から、system prompt、添付file、過去のreasoning、やり取りの重要な状態を一つの圧縮itemへまとめ、冗長なtool outputなどを落とす仕組みだ。入力costとlatencyを減らし、multi-hour loopをcontext上限の中へ収める。

よくできた機能だ。ただし、compactionも魔法の記憶ではない。

何を重要とみなすかは、圧縮処理へ委ねられる。圧縮itemはopaqueで、利用側が中身を読み、完全性を一行ずつ監査するものではない。

だから私たちは、contextと正本を分けて考えた方がいい。

contextは、いま考えるための作業台。

正本は、採用した判断、根拠、成功した成果、残課題を、次の担当や次のsessionが読み戻せる形で置く保管庫。

作業台を広くすることと、航海日誌を残すことは、別の仕事なのだ。

長時間Agentに必要な、六つの設備

長距離を走るmodelが進化しても、道路、信号、給油所、退避所はなくならない。

むしろ、遠くへ行けるようになるほど、運行設備の重要性は増える。

1.先にfinish lineを決める

「いい感じに調べて」「アプリを完成させて」では、Agentはいつ終わればよいか分からない。

必要な成果物は何か。どのtestを通すか。URLは開けるか。誰のreviewが必要か。

作業開始前にsuccess conditionを置く。finish lineのない長距離走は、ただ走り続けるだけになる。

2.checkpointは、頭と現場を同時に保存する

会話だけを戻しても、fileが書き換わったままなら、同じ場所へは戻れない。

2026年8月に公開されたpreprint、AgentRewindは、Agentのcontextとcontrolled environment stateを揃えたcheckpointへ戻すframeworkを提案した。著者らは、複数のtask、model、harnessでsuccess rateとchecklist progressが改善したと報告している。

まだ査読済みのproduction standardではない。けれど問題設定は実務的だ。

git commit、file hash、database transaction、生成物manifest。Agentの「記憶」と、toolが変えた「世界」を、同じ時点へ固定する。

片方だけでは、正しく巻き戻せない。

3.圧縮する前に、決定を外へ出す

長い会話をcompactionするなら、採用理由、重要な出典、やってはいけないこと、未完了項目を先に正本へ置く。

会話のすべてを永久保存する必要はない。次の判断に必要なものを、再利用できる形へ昇格させる。

「覚えているはず」ではなく、「読み戻せる」に変える。

4.toolの失敗と、taskの失敗を分ける

画像生成がtimeoutした。APIが一時的に落ちた。test環境だけ接続できない。

そこで最初の調査から全部やり直せば、costも時間も漏れていく。

成功した工程はcacheし、失敗したscopeだけをretryする。一定回数で止め、別routeまたは人間へ上げる。

成功済みの橋まで壊して架け直さない。

5.人間のgateは、損失が大きくなる直前へ置く

すべてのstepを人間が見るなら、自律Agentの利点は薄い。

反対に、外部公開、送金、削除、顧客への連絡まで無確認で通すと、一度の迷走が現実の損失になる。

人間のgateは回数ではなく、結果の重さで置く。

試作は広く任せる。不可逆な変更と社会へ出る瞬間は、人間が責任を持つ。

6.予算上限とsuccess receiptを持つ

長時間Agentは、失敗して止まるだけではない。終わらずに走り続けることもある。

token、paid tool、wall-clock、retry回数へ上限を置く。超えたら、黙って続けず、停止して知らせる。

そして「完了しました」という自然文だけを、完了の証拠にしない。

test結果、artifact hash、公開URL、status、timestamp。仕事に合ったreceiptを残す。

receiptがなければ、「Agentが止まった」と「仕事が終わった」を区別できない。

長時間Agentが完遂に至る回復経路。タスク開始・進行:通常の作業を続ける。エラー発生:想定外の失敗が起きる。checkpointへ巻き戻り:直前の安全地点から再開する。予算内で再試行:同じ失敗地点からやり直さない

2026年8月公開preprintの提案。査読済みproduction標準ではなく研究例として紹介。 図を大きく開く

長く走れるほど、人間は目的へ戻る

Agentが長時間の仕事を完遂できるようになれば、人間の出番は減る。

これは一面では正しい。検索、転記、定型的な修正、何度も繰り返すtestを、横で見続ける必要はなくなる。

けれど、人間の役割が消えるわけではない。

何をfinishと呼ぶのか。

どこまでの失敗を許容するのか。

いつ止めるのか。

誰に、どんな価値を届けるのか。

長時間Agentが担うのは、目的へ向かう多くの工程だ。目的そのものと、結果への責任まで、modelのscoreから自動的に生まれるわけではない。

私たちも、長いAI Agent taskでは、文脈、正本、途中保存、検証、再開可能性を、作業の付属物ではなく品質そのものとして扱っている。

内部の細かなrecipeは、私たちの仕事の価値でもあるので公開しない。

ただ、一般化できる原則は単純だ。

Agentを長く働かせる前に、帰る場所と、止まる条件と、終わった証拠を用意する。

次の比較表は、finish lineに置こう

Grok 4.6がlong-running agentsを前面に出したことは、model競争の変化をよく表している。

一問へどれだけ賢く答えるか。

そこから、何十、何百のstepをまたいで、調査し、作り、直し、確認し、成果を届けられるかへ。

ただし、その競争をmodel単体の新しい点数表だけに戻してはいけない。

長時間の成功は、model、harness、tool、context、checkpoint、予算、human gate、完了判定の掛け算だからだ。

次にAgentを選ぶ時は、「一番賢いのはどれ?」に、もう一つ質問を足したい。

この仕事を途中で投げず、壊れた場所から戻り、最後に終わったと証明できるのはどのsystemか。

100メートルの記録は、これからも更新される。

でも、仕事の価値が生まれるのは、拍手の起きるstart lineではない。

成果物が届く、finish lineの向こう側だ。

今日からできるaction plan

  1. 次にAgentへ任せる長い仕事を一つ選び、成果物と完了条件を三行で書く。

  2. 失敗すると全体をやり直す地点を探し、contextと外部状態を揃えたcheckpointを置く。

  3. 外部公開、決済、削除など不可逆な境界にだけhuman gateを置く。

  4. token、paid tool、retry、wall-clockの上限を決める。

  5. 最後に残すtest、URL、hash、status、timestampのreceiptを決める。

一次資料・関連研究

注記:Grok 4.6の性能値と定性的な挙動は、2026年8月12日のxAI公式発表およびmodel cardに基づく。benchmarkごとにtask、harness、採点条件が異なるため、異なるscoreを単純なmodel順位または一般的な業務完遂率として比較していない。AgentRewindは2026年8月20日時点のpreprintであり、production standardとしてではなく、long-horizon recoveryの研究例として紹介した。model、API、価格、仕様は変更され得るため、利用時には最新の公式資料を確認してほしい。(2026年9月28日追記:9月21日にxAIはGrok 4.7を発表した。価格とcontext windowはGrok 4.6から変わらず、長時間の作業を評価するbenchmarkの改善を同社は報告している。この記事がGrok 4.6を素材に述べた「長時間Agentの完遂力」という軸そのものは、後継modelでも覆っていない。)