冒頭は記事のために生成したイメージ映像です。実機、実在施設、観測データを示すものではありません。
ものすごく頭はいい。でも、三時間頼んだ仕事を二時間五十分で投げてしまう。
そんな相手を、私たちは「仕事ができる」と評価するだろうか。
AIの比較では、難しい問題を何問解けたか、コードを何件直せたか、回答品質が何点だったかが注目される。けれどAI Agentへ調査、開発、資料制作のような長い仕事を任せ始めると、別の能力が急に大きく見えてくる。
途中で道具が止まった時、復帰できるか。
会話が長くなっても、目的を忘れないか。
失敗した工程だけをやり直せるか。
そして最後に、仕事が本当に終わったことを証明できるか。
2026年、AIの評価軸は「どれだけ賢いか」から、「どれだけ長く、壊れず、最後まで運べるか」へ広がり始めた。
その変化を、真正面から言葉にした新モデルがある。2026年8月12日に発表されたGrok 4.6だ。
Grok 4.6が主役にした「長く走る力」
xAIはGrok 4.6を、long-running agentsへ重点を置いたモデルだと説明した。
一つの質問へ答えるだけではない。馴染みのない分野を調べ、情報を整理し、codebaseを横断し、アプリや仕事の成果物を形にする。その間、たくさんのstepをまたいでも仕事に留まり続けることを目指している。
xAIによれば、長いtrajectoryでは、次へ進む前に自分の仕事をtestし、確認する動きも以前より見られたという。
これは重要な方向転換だと思う。
これまでのAIは、100メートル走の選手として評価されることが多かった。合図と同時に走り、一問へ鮮やかに答える。
一方、Agentへ任せる仕事は、山を越える長距離レースに近い。天候が変わる。道具が壊れる。地図にない分岐が出る。最初に立てた計画も、途中で直さなければならない。
そこで必要なのは、最高速度だけではない。
補給し、現在地を確かめ、間違えた分岐から戻り、それでもfinish lineへ向かう力だ。
ただし、「Grok 4.6は長い仕事を必ず完遂する」と読んではいけない。長時間Agentを重視したという説明はxAI自身によるものだ。実環境の完遂率は、仕事、tool、指示、実行基盤、採点方法によって変わる。
むしろ、xAI自身が公開した数字を見ると、長距離の難しさがよく分かる。
65.9%と31.9%は、矛盾していない
Grok 4.6のmodel cardでは、long-horizon software engineeringの完了を測るDeepSWE 1.1で、high thinking effortが65.9%、xhighが67.0%と報告されている。
一方、数百万token、数時間にわたるtrajectoryを含み得る、さらに長いSWE-Marathon 1.1では、highのresolution rateは31.9%だった。
この二つを並べて「どちらが正しいのか」と考える必要はない。
courseが違う。toolやharnessが違う。成功の採点方法も違う。長さだけでなく、求められる仕事の性質が違う。
だからこそ、ここから見えるものがある。
「難問を解ける」と「大きな仕事を完成させられる」は、同じ点数では測れない。
同じmodel cardでも、複数アプリをまたぐ業務を、全criteria達成で採点するAPEX-Agentsは57.5%。terminal上の現実的なtaskを扱うTerminal-Bench 3.0は26.0%。専門家がall-passで判定するLegal Agent Benchmarkは15.8%だった。
これはGrok 4.6の弱点を並べたいのではない。他modelも含め、長い仕事では「何をもって完了とするか」で数字が大きく変わる、という話だ。
benchmarkの首位を選ぶだけでは、自社の仕事が終わる確率は分からない。
必要なのは、自分たちの仕事で、どこまでを一つのtaskと呼び、何が揃えば成功なのかを決めることだ。
Grok 4.6の2026年8月発表を例にした試験の違い。採点条件が異なるため、数字を同じ業務成功率として並べない。 図を大きく開く
「8時間horizon」は、8時間放置できるという意味ではない
長時間Agentを語る時、よく引用される研究にMETRのtask-completion time horizonがある。
ここにも、誤解しやすい言葉がある。
METRの「50% time horizon」は、AIが実際に何時間動き続けるかを表す数字ではない。人間の専門家なら何分、何時間かかる難しさのtaskに対し、そのAI Agentが50%の確率で成功すると予測される地点だ。
つまり「8時間horizon」は、AIを8時間放置しても大丈夫という免許証ではない。
しかもMETR自身が、評価taskは主にsoftware engineering、machine learning、cybersecurityで、自己完結し、比較的はっきり採点できるよう作られていると説明している。
現実の仕事はもっと散らかっている。
担当者の頭の中にしかない前提がある。途中で優先順位が変わる。顧客の「なんとなく違う」を読み取る。成功条件を数字だけで書けない。
METRも、こうしたmessyなtaskではAgentのperformanceが下がるとしている。
だからtime horizonは、Agentの進歩を見る大切な物差しでありながら、会社の仕事をそのまま自動化できる範囲を示す地図ではない。
500k contextは、巨大な机である
Grok 4.6 APIは、500,000 tokenのcontext windowを持つ。textの出力上限も設けていない。
長い仕事には心強い。たくさんの資料、会話、tool resultを一つの作業空間へ置ける。
けれど、広い机を買ったからといって、重要書類をなくさなくなるわけではない。
机が大きければ、置ける紙は増える。同時に、古いerror log、やり直す前の指示、途中で捨てた案も積み上がる。
xAIはlong agent loop向けに、context compactionも提供している。長くなった会話から、system prompt、添付file、過去のreasoning、やり取りの重要な状態を一つの圧縮itemへまとめ、冗長なtool outputなどを落とす仕組みだ。入力costとlatencyを減らし、multi-hour loopをcontext上限の中へ収める。
よくできた機能だ。ただし、compactionも魔法の記憶ではない。
何を重要とみなすかは、圧縮処理へ委ねられる。圧縮itemはopaqueで、利用側が中身を読み、完全性を一行ずつ監査するものではない。
だから私たちは、contextと正本を分けて考えた方がいい。
contextは、いま考えるための作業台。
正本は、採用した判断、根拠、成功した成果、残課題を、次の担当や次のsessionが読み戻せる形で置く保管庫。
作業台を広くすることと、航海日誌を残すことは、別の仕事なのだ。
長時間Agentに必要な、六つの設備
長距離を走るmodelが進化しても、道路、信号、給油所、退避所はなくならない。
むしろ、遠くへ行けるようになるほど、運行設備の重要性は増える。
1.先にfinish lineを決める
「いい感じに調べて」「アプリを完成させて」では、Agentはいつ終わればよいか分からない。
必要な成果物は何か。どのtestを通すか。URLは開けるか。誰のreviewが必要か。
作業開始前にsuccess conditionを置く。finish lineのない長距離走は、ただ走り続けるだけになる。
2.checkpointは、頭と現場を同時に保存する
会話だけを戻しても、fileが書き換わったままなら、同じ場所へは戻れない。
2026年8月に公開されたpreprint、AgentRewindは、Agentのcontextとcontrolled environment stateを揃えたcheckpointへ戻すframeworkを提案した。著者らは、複数のtask、model、harnessでsuccess rateとchecklist progressが改善したと報告している。
まだ査読済みのproduction standardではない。けれど問題設定は実務的だ。
git commit、file hash、database transaction、生成物manifest。Agentの「記憶」と、toolが変えた「世界」を、同じ時点へ固定する。
片方だけでは、正しく巻き戻せない。
3.圧縮する前に、決定を外へ出す
長い会話をcompactionするなら、採用理由、重要な出典、やってはいけないこと、未完了項目を先に正本へ置く。
会話のすべてを永久保存する必要はない。次の判断に必要なものを、再利用できる形へ昇格させる。
「覚えているはず」ではなく、「読み戻せる」に変える。
4.toolの失敗と、taskの失敗を分ける
画像生成がtimeoutした。APIが一時的に落ちた。test環境だけ接続できない。
そこで最初の調査から全部やり直せば、costも時間も漏れていく。
成功した工程はcacheし、失敗したscopeだけをretryする。一定回数で止め、別routeまたは人間へ上げる。
成功済みの橋まで壊して架け直さない。
5.人間のgateは、損失が大きくなる直前へ置く
すべてのstepを人間が見るなら、自律Agentの利点は薄い。
反対に、外部公開、送金、削除、顧客への連絡まで無確認で通すと、一度の迷走が現実の損失になる。
人間のgateは回数ではなく、結果の重さで置く。
試作は広く任せる。不可逆な変更と社会へ出る瞬間は、人間が責任を持つ。
6.予算上限とsuccess receiptを持つ
長時間Agentは、失敗して止まるだけではない。終わらずに走り続けることもある。
token、paid tool、wall-clock、retry回数へ上限を置く。超えたら、黙って続けず、停止して知らせる。
そして「完了しました」という自然文だけを、完了の証拠にしない。
test結果、artifact hash、公開URL、status、timestamp。仕事に合ったreceiptを残す。
receiptがなければ、「Agentが止まった」と「仕事が終わった」を区別できない。
2026年8月公開preprintの提案。査読済みproduction標準ではなく研究例として紹介。 図を大きく開く
長く走れるほど、人間は目的へ戻る
Agentが長時間の仕事を完遂できるようになれば、人間の出番は減る。
これは一面では正しい。検索、転記、定型的な修正、何度も繰り返すtestを、横で見続ける必要はなくなる。
けれど、人間の役割が消えるわけではない。
何をfinishと呼ぶのか。
どこまでの失敗を許容するのか。
いつ止めるのか。
誰に、どんな価値を届けるのか。
長時間Agentが担うのは、目的へ向かう多くの工程だ。目的そのものと、結果への責任まで、modelのscoreから自動的に生まれるわけではない。
私たちも、長いAI Agent taskでは、文脈、正本、途中保存、検証、再開可能性を、作業の付属物ではなく品質そのものとして扱っている。
内部の細かなrecipeは、私たちの仕事の価値でもあるので公開しない。
ただ、一般化できる原則は単純だ。
Agentを長く働かせる前に、帰る場所と、止まる条件と、終わった証拠を用意する。
次の比較表は、finish lineに置こう
Grok 4.6がlong-running agentsを前面に出したことは、model競争の変化をよく表している。
一問へどれだけ賢く答えるか。
そこから、何十、何百のstepをまたいで、調査し、作り、直し、確認し、成果を届けられるかへ。
ただし、その競争をmodel単体の新しい点数表だけに戻してはいけない。
長時間の成功は、model、harness、tool、context、checkpoint、予算、human gate、完了判定の掛け算だからだ。
次にAgentを選ぶ時は、「一番賢いのはどれ?」に、もう一つ質問を足したい。
この仕事を途中で投げず、壊れた場所から戻り、最後に終わったと証明できるのはどのsystemか。
100メートルの記録は、これからも更新される。
でも、仕事の価値が生まれるのは、拍手の起きるstart lineではない。
成果物が届く、finish lineの向こう側だ。
今日からできるaction plan
次にAgentへ任せる長い仕事を一つ選び、成果物と完了条件を三行で書く。
失敗すると全体をやり直す地点を探し、contextと外部状態を揃えたcheckpointを置く。
外部公開、決済、削除など不可逆な境界にだけhuman gateを置く。
token、paid tool、retry、wall-clockの上限を決める。
最後に残すtest、URL、hash、status、timestampのreceiptを決める。
一次資料・関連研究
SpaceXAI Docs — Grok 4.6(注:このURLの内容は2026年9月28日時点でGrok 4.7の仕様に置き換わっている。本文の性能値は8月12日の4.6発表に基づく記録であり、現行モデルの数値と混同しない)
Zhuang et al. — AgentRewind: Recoverable Execution for Long-Horizon LLM Agents, preprint
注記:Grok 4.6の性能値と定性的な挙動は、2026年8月12日のxAI公式発表およびmodel cardに基づく。benchmarkごとにtask、harness、採点条件が異なるため、異なるscoreを単純なmodel順位または一般的な業務完遂率として比較していない。AgentRewindは2026年8月20日時点のpreprintであり、production standardとしてではなく、long-horizon recoveryの研究例として紹介した。model、API、価格、仕様は変更され得るため、利用時には最新の公式資料を確認してほしい。(2026年9月28日追記:9月21日にxAIはGrok 4.7を発表した。価格とcontext windowはGrok 4.6から変わらず、長時間の作業を評価するbenchmarkの改善を同社は報告している。この記事がGrok 4.6を素材に述べた「長時間Agentの完遂力」という軸そのものは、後継modelでも覆っていない。)


