冒頭は記事のために生成したイメージ映像です。実機、実在施設、観測データを示すものではありません。

深夜0時を回ると、同じAIの値札が二倍になる。

そんなprice cardを見たら、ふつうは二つの反応に分かれる。

「安いうちに使おう」。あるいは、「後で上がるなら触らないでおこう」。

けれど、その二択は少しもったいない。

2026年8月13日に公開されたGemini 3.7 Flashは、Googleがagentic workflow向けのworkhorseと位置づけるstable modelだ(2026年9月にはさらに新しいGemini 3.8 Flashも登場しているが、3.7 Flashは引き続きフルサポートされ、shutdown予定も未発表のままだ)。そして公式価格表には、導入価格が終わる日まで明記されている。

値下げは、永住先を決める合図ではない。安く試せる間に、移行と撤退を練習する合図だ。

この記事ではGemini 3.7 Flashの勝敗表は作らない。見るのは、temporary price、cache、tool use、latency、quality、fallback、exit costを一つのarchitectureとしてどう読むかだ。

$0.75 / $3.75には、終了日が書いてある

2026年8月20日時点のGemini Developer API公式価格では、Gemini 3.7 FlashのStandard料金は、100万tokenあたりinput $0.75、output $3.75だ。outputにはthinking tokenも含まれる。

安い。しかも、1,048,576 tokenのcontext、text / image / video / audio / PDF入力、function calling、code execution、Search grounding、structured outputまでを一つのmodelで扱える。

ただし、price cardには小さくない但し書きがある。

  • input $0.75、output $3.75は2026年12月31日まで。

  • 2027年1月1日からはinput $1.50、output $7.50。

  • cached inputも$0.075から$0.15へ、cache storageも100万token・1時間あたり$0.50から$1.00へ変わる。

つまり、「月額を今の単価で12倍する」という予算表は、最初から成立しない。

2026年8月20日から一年間、毎日ほぼ同じ量を使うと仮定すれば、導入価格の日は134日、その後の標準価格の日は231日になる。単純加重したlist priceは、input約$1.225、output約$6.123 / 100万tokenだ。

これは値上げを批判する話ではない。終了日が明示されているからこそ、購買側も最初から正しい時間軸で設計できる、という話だ。

「inputが安い」は、仕事が安いという意味ではない

AI APIの価格比較では、input単価が大きく表示されやすい。

だが、月に5M input、80M outputを使うtaskを考えてみよう。導入価格ではinput $3.75に対し、outputは$300。token billの約98.8%がoutput側になる。

長いreport、code生成、何度も考え直すagent taskでは、outputとthinkingが大きくなりやすい。「inputが安いmodel」という印象は、実際の請求構造をほとんど説明しないことがある。

逆に、大きな共通文書を何度も読むtaskなら、cacheが効く可能性がある。Gemini 3.7 Flashはimplicit / explicit context cachingに対応し、導入期間のcached inputは$0.075 / 100万tokenだ。

ここでも、「cache対応=自動的にお得」ではない。

公式のcaching説明では、cache hit tokenだけでなく、明示cacheを保持するTTLに応じたstorageも費用要素になる。reuseが少ない。共通prefixが揃わない。長く保存したのに数回しか使わない。そうなれば、節約より複雑さが残る。

cacheは機能表で採用するものではない。hit rateで採否を決めるものだ。

Toolを使うと、token以外のメーターも回る

Agentが価値を出すのは、文章を返す時だけではない。検索し、codeを実行し、社内functionを呼び、結果を読んで次のactionを決める。

その時、請求も一本のmeterではなくなる。

Google Search groundingはGemini 3.x全体で月5,000 search queriesまで無料、その後は1,000 queriesあたり$14だ。注意したいのは、5,000promptではなく5,000queryだということ。利用者の一つの依頼から、modelが複数の検索queryを作ることもある。

Code Executionは実行時間そのものへの別料金はない。しかし生成したcodeと実行結果はoutput tokenになり、次の推論へ戻せばinput tokenになる。custom functionでも、tool resultを会話へ戻せばcontextは膨らむ。

Googleのtool combination資料も、見えるようになった中間tool stepがrequest historyへ含まれる時、prompt tokenとして数えられると説明している。

たとえば月100Mの通常input、300Mのcached input、20M output、10M token-hoursのstorage、20,000 Search queriesという説明用workloadを置く。無料5,000 queriesを単純適用すると、導入期間のmodel / cache / search費は約$387.50。2027年価格では約$565になる。

その中でSearchは$210。modelの値札だけを半分にしても、最大の費用項目が動かない。

Agentの原価は、model priceではない。目的を完了するまでに回った、すべてのmeterの合計だ。

半額は、どのレーンでも同じ意味じゃない。Standard:対話や即時処理へ使う基本のレーン。Batch / Flex:待てる仕事へ使う割引レーン。Priority:低遅延を優先したい仕事へ使うレーン

料金と処理レーンの対比。Priorityという名前だけで秒単位の応答保証が成立するわけではない。契約条件は別に確認する。 図を大きく開く

Batchが半額でも、すべてをBatchへ入れてはいけない

Gemini 3.7 FlashのBatchとFlexは、導入期間ならinput $0.375、output $1.875。Standardの半額だ。2027年以降も$0.75 / $3.75で、同時期のStandardの半額になる。

ここだけ見れば、全workloadを移したくなる。

けれど、価格laneは単なる割引couponではない。夜間集計、embedding前のdocument整形、翌朝までに終わればよい評価jobなら、Batchは自然だ。一方、利用者が画面の前で待つchat、tool結果に応じて分岐する対話、秒単位の応答保証が要る処理では、同じ選択にならない。

PriorityにはPriorityの価格があり、StandardにはStandardの性質がある。比較する時は「100万token」の単位だけでなく、latency、availability、締切、retry方針まで揃えなければならない。

他社modelとの価格順位も同じだ。context、thinking tokenの扱い、tool fee、cache、batch、rate limit、data policyが異なる表を横に置いても、最安のproduction architectureは分からない。

Benchmarkの一位を、本番の合格証にしない

Google DeepMindのmodel cardには、coding、agentic tool use、long context、multimodalなど、多数のbenchmarkが掲載されている。Gemini 3.7 Flashが有力な候補であることを示す材料にはなる。

ただし、それらはvendorが選び、条件を記した評価だ。自社の日本語文体、乱れたPDF、独自tool、長時間task、権限error、rate limit、壊れたfunction responseを再現しているわけではない。

model card自身も、foundation model一般のhallucinationに加え、時折の遅延やtimeoutがあり得ると明記している。

これは「遅いmodelだ」という意味ではない。逆だ。Flashという名前や平均benchmarkから、productionのp95 / p99 latencyを推測してはいけない、という意味だ。

平均2秒でも、20回に一回だけ45秒止まるなら、接客agentでは別の製品になる。99%正しくても、残り1%が注文取消や外部送信を誤るなら、人間gateが必要になる。

候補選びにはbenchmarkを使う。本番判定には、自分たちの失敗を使う。

30日pilotで、成功と撤退を同時に練習する

導入価格の期間にやるべきことは、trafficを一気に移すことではない。

小さな本番を作り、戻れることまで証明することだ。

1〜3日目:持ち運べるharnessを作る

provider固有SDKをbusiness logicへ直書きしない。request、response、tool event、errorを社内のcanonical schemaへ通す。代表taskだけでなく、長文、曖昧な指示、拒否、hallucination、tool failureを含むgolden setを固定する。

4〜10日目:shadowで測る

利用者には返さず、productionに近いinputを並走させる。input、cached input、output、thinking、tool-use tokenを分ける。latencyは平均だけでなくp50 / p95 / p99、timeout、retry、schema violation、Search query数までtraceへ残す。

11〜20日目:5〜10%のcanaryを流す

失敗しても巻き戻せるtaskから始める。quality floor、時間上限、tool errorでfallbackが本当に発火するかを見る。二重注文や二重送信を防ぐidempotencyもここで確認する。

21〜25日目:わざと壊す

timeout、429、malformed tool result、cache miss、長すぎるoutputを意図的に起こす。retryが無限loopにならないか。fallback先も同時に詰まらないか。budget capを越える前に止まるかを試す。

26〜30日目:48時間で外へ出る

golden setを、従来modelか第二providerへ戻す。business logicを書き換えず、adapter交換で動くか。tool schemaやstructured outputの差を吸収できるか。移せないprompt、cache、evaluation資産は何か。

このexit testに失敗したら、導入価格で浮いた費用の一部は、すでにvendor lock-inとして使っている。

Modelの世代交代も、仮定ではなく通常運用の一部だ。Googleはmodelごとのdeprecationとshutdown予定を公開しており、過去のFlash endpointにも終了と移行先が並んでいる。2026年8月20日時点で3.7 Flash固有のshutdown日は確認されていない。それでも、いつか移行する前提で作ることと、明日終了すると煽ることは別だ。

OpenAI互換interfaceを使う選択肢もあるが、Google自身が、File APIやSearch groundingなどGemini固有機能はschemaが1対1に対応せず、translation overheadが生じると説明している。共通interfaceは出口を広げる。それでも、出口費用をゼロにはしない。

受理された仕事の原価まで。token単価:Standard/Batch/Priorityで異なる。cacheとtool往復:cached inputとSearch課金が加わる。retry・検証コスト:失敗時の再試行とexit rehearsal費用。accepted task単価:受理済み1件あたりの最終コスト

100万tokenの単価だけでは見えない、複数meterの積み上げ(本文の試算、税・為替等は含まない)。 図を大きく開く

12か月TCOは「受理された仕事」で割る

最終的に欲しい数字は、100万token単価ではない。

受入基準を満たした一件の仕事を終えるのに、いくらかかったか。

その分子には、通常input、cached input、output / thinking、cache storage、Searchやtool、retry、fallback call、observability、evaluation、integration、incident対応、そしてexit rehearsalを入れる。

分母をAPI request数にすると、失敗して再試行した回数まで「処理件数」に見えてしまう。分母はaccepted task数にする。

30日pilotのGO条件は、少なくとも次の五つだ。

  1. critical taskでquality floorを割らない。

  2. p95 latencyとtimeout率がproduct SLOに収まる。

  3. fallback後を含むaccepted-task単価がbudget内。

  4. Search、tool、cacheの費用をtrace単位で説明できる。

  5. 48時間のexit testを完遂し、2027年価格でも12か月TCOが成立する。

安い切符より、積み替えられる荷物を持つ

Gemini 3.7 Flashは、試す価値の高いmodelに見える。stable endpointで、広いmodalitiesとagent向けtoolを持ち、導入価格も魅力的だ。

同時に、公式資料だけでも、pricing lane、cache storage、query課金、thinking token、timeout、API / model lifecycleという条件が見える。

だから結論は、「安いから採用」でも「後で上がるから見送る」でもない。

安い今、移れる形で使い始める。

promptを持ち運べる。toolを差し替えられる。qualityを再現できる。費用を成功taskまで追える。fallbackが動く。そして、48時間で別の線路へ荷物を積み替えられる。

temporary priceが本当にくれるものは、安いtokenだけではない。

architectureを試し、失敗し、逃げ道まで作る時間だ。

※価格・仕様は2026年8月20日時点のGoogle公式資料を確認した。公開時には再確認が必要。記事内の試算は税、為替、個別契約、volume discount、地域差を含まない説明用であり、RINKAKUはGemini 3.7 Flashの実production品質を独自検証していない。