冒頭は記事のために生成したイメージ映像です。実機、実在施設、観測データを示すものではありません。
深夜0時を回ると、同じAIの値札が二倍になる。
そんなprice cardを見たら、ふつうは二つの反応に分かれる。
「安いうちに使おう」。あるいは、「後で上がるなら触らないでおこう」。
けれど、その二択は少しもったいない。
2026年8月13日に公開されたGemini 3.7 Flashは、Googleがagentic workflow向けのworkhorseと位置づけるstable modelだ(2026年9月にはさらに新しいGemini 3.8 Flashも登場しているが、3.7 Flashは引き続きフルサポートされ、shutdown予定も未発表のままだ)。そして公式価格表には、導入価格が終わる日まで明記されている。
値下げは、永住先を決める合図ではない。安く試せる間に、移行と撤退を練習する合図だ。
この記事ではGemini 3.7 Flashの勝敗表は作らない。見るのは、temporary price、cache、tool use、latency、quality、fallback、exit costを一つのarchitectureとしてどう読むかだ。
$0.75 / $3.75には、終了日が書いてある
2026年8月20日時点のGemini Developer API公式価格では、Gemini 3.7 FlashのStandard料金は、100万tokenあたりinput $0.75、output $3.75だ。outputにはthinking tokenも含まれる。
安い。しかも、1,048,576 tokenのcontext、text / image / video / audio / PDF入力、function calling、code execution、Search grounding、structured outputまでを一つのmodelで扱える。
ただし、price cardには小さくない但し書きがある。
input $0.75、output $3.75は2026年12月31日まで。
2027年1月1日からはinput $1.50、output $7.50。
cached inputも$0.075から$0.15へ、cache storageも100万token・1時間あたり$0.50から$1.00へ変わる。
つまり、「月額を今の単価で12倍する」という予算表は、最初から成立しない。
2026年8月20日から一年間、毎日ほぼ同じ量を使うと仮定すれば、導入価格の日は134日、その後の標準価格の日は231日になる。単純加重したlist priceは、input約$1.225、output約$6.123 / 100万tokenだ。
これは値上げを批判する話ではない。終了日が明示されているからこそ、購買側も最初から正しい時間軸で設計できる、という話だ。
「inputが安い」は、仕事が安いという意味ではない
AI APIの価格比較では、input単価が大きく表示されやすい。
だが、月に5M input、80M outputを使うtaskを考えてみよう。導入価格ではinput $3.75に対し、outputは$300。token billの約98.8%がoutput側になる。
長いreport、code生成、何度も考え直すagent taskでは、outputとthinkingが大きくなりやすい。「inputが安いmodel」という印象は、実際の請求構造をほとんど説明しないことがある。
逆に、大きな共通文書を何度も読むtaskなら、cacheが効く可能性がある。Gemini 3.7 Flashはimplicit / explicit context cachingに対応し、導入期間のcached inputは$0.075 / 100万tokenだ。
ここでも、「cache対応=自動的にお得」ではない。
公式のcaching説明では、cache hit tokenだけでなく、明示cacheを保持するTTLに応じたstorageも費用要素になる。reuseが少ない。共通prefixが揃わない。長く保存したのに数回しか使わない。そうなれば、節約より複雑さが残る。
cacheは機能表で採用するものではない。hit rateで採否を決めるものだ。
Toolを使うと、token以外のメーターも回る
Agentが価値を出すのは、文章を返す時だけではない。検索し、codeを実行し、社内functionを呼び、結果を読んで次のactionを決める。
その時、請求も一本のmeterではなくなる。
Google Search groundingはGemini 3.x全体で月5,000 search queriesまで無料、その後は1,000 queriesあたり$14だ。注意したいのは、5,000promptではなく5,000queryだということ。利用者の一つの依頼から、modelが複数の検索queryを作ることもある。
Code Executionは実行時間そのものへの別料金はない。しかし生成したcodeと実行結果はoutput tokenになり、次の推論へ戻せばinput tokenになる。custom functionでも、tool resultを会話へ戻せばcontextは膨らむ。
Googleのtool combination資料も、見えるようになった中間tool stepがrequest historyへ含まれる時、prompt tokenとして数えられると説明している。
たとえば月100Mの通常input、300Mのcached input、20M output、10M token-hoursのstorage、20,000 Search queriesという説明用workloadを置く。無料5,000 queriesを単純適用すると、導入期間のmodel / cache / search費は約$387.50。2027年価格では約$565になる。
その中でSearchは$210。modelの値札だけを半分にしても、最大の費用項目が動かない。
Agentの原価は、model priceではない。目的を完了するまでに回った、すべてのmeterの合計だ。
料金と処理レーンの対比。Priorityという名前だけで秒単位の応答保証が成立するわけではない。契約条件は別に確認する。 図を大きく開く
Batchが半額でも、すべてをBatchへ入れてはいけない
Gemini 3.7 FlashのBatchとFlexは、導入期間ならinput $0.375、output $1.875。Standardの半額だ。2027年以降も$0.75 / $3.75で、同時期のStandardの半額になる。
ここだけ見れば、全workloadを移したくなる。
けれど、価格laneは単なる割引couponではない。夜間集計、embedding前のdocument整形、翌朝までに終わればよい評価jobなら、Batchは自然だ。一方、利用者が画面の前で待つchat、tool結果に応じて分岐する対話、秒単位の応答保証が要る処理では、同じ選択にならない。
PriorityにはPriorityの価格があり、StandardにはStandardの性質がある。比較する時は「100万token」の単位だけでなく、latency、availability、締切、retry方針まで揃えなければならない。
他社modelとの価格順位も同じだ。context、thinking tokenの扱い、tool fee、cache、batch、rate limit、data policyが異なる表を横に置いても、最安のproduction architectureは分からない。
Benchmarkの一位を、本番の合格証にしない
Google DeepMindのmodel cardには、coding、agentic tool use、long context、multimodalなど、多数のbenchmarkが掲載されている。Gemini 3.7 Flashが有力な候補であることを示す材料にはなる。
ただし、それらはvendorが選び、条件を記した評価だ。自社の日本語文体、乱れたPDF、独自tool、長時間task、権限error、rate limit、壊れたfunction responseを再現しているわけではない。
model card自身も、foundation model一般のhallucinationに加え、時折の遅延やtimeoutがあり得ると明記している。
これは「遅いmodelだ」という意味ではない。逆だ。Flashという名前や平均benchmarkから、productionのp95 / p99 latencyを推測してはいけない、という意味だ。
平均2秒でも、20回に一回だけ45秒止まるなら、接客agentでは別の製品になる。99%正しくても、残り1%が注文取消や外部送信を誤るなら、人間gateが必要になる。
候補選びにはbenchmarkを使う。本番判定には、自分たちの失敗を使う。
30日pilotで、成功と撤退を同時に練習する
導入価格の期間にやるべきことは、trafficを一気に移すことではない。
小さな本番を作り、戻れることまで証明することだ。
1〜3日目:持ち運べるharnessを作る
provider固有SDKをbusiness logicへ直書きしない。request、response、tool event、errorを社内のcanonical schemaへ通す。代表taskだけでなく、長文、曖昧な指示、拒否、hallucination、tool failureを含むgolden setを固定する。
4〜10日目:shadowで測る
利用者には返さず、productionに近いinputを並走させる。input、cached input、output、thinking、tool-use tokenを分ける。latencyは平均だけでなくp50 / p95 / p99、timeout、retry、schema violation、Search query数までtraceへ残す。
11〜20日目:5〜10%のcanaryを流す
失敗しても巻き戻せるtaskから始める。quality floor、時間上限、tool errorでfallbackが本当に発火するかを見る。二重注文や二重送信を防ぐidempotencyもここで確認する。
21〜25日目:わざと壊す
timeout、429、malformed tool result、cache miss、長すぎるoutputを意図的に起こす。retryが無限loopにならないか。fallback先も同時に詰まらないか。budget capを越える前に止まるかを試す。
26〜30日目:48時間で外へ出る
golden setを、従来modelか第二providerへ戻す。business logicを書き換えず、adapter交換で動くか。tool schemaやstructured outputの差を吸収できるか。移せないprompt、cache、evaluation資産は何か。
このexit testに失敗したら、導入価格で浮いた費用の一部は、すでにvendor lock-inとして使っている。
Modelの世代交代も、仮定ではなく通常運用の一部だ。Googleはmodelごとのdeprecationとshutdown予定を公開しており、過去のFlash endpointにも終了と移行先が並んでいる。2026年8月20日時点で3.7 Flash固有のshutdown日は確認されていない。それでも、いつか移行する前提で作ることと、明日終了すると煽ることは別だ。
OpenAI互換interfaceを使う選択肢もあるが、Google自身が、File APIやSearch groundingなどGemini固有機能はschemaが1対1に対応せず、translation overheadが生じると説明している。共通interfaceは出口を広げる。それでも、出口費用をゼロにはしない。
100万tokenの単価だけでは見えない、複数meterの積み上げ(本文の試算、税・為替等は含まない)。 図を大きく開く
12か月TCOは「受理された仕事」で割る
最終的に欲しい数字は、100万token単価ではない。
受入基準を満たした一件の仕事を終えるのに、いくらかかったか。
その分子には、通常input、cached input、output / thinking、cache storage、Searchやtool、retry、fallback call、observability、evaluation、integration、incident対応、そしてexit rehearsalを入れる。
分母をAPI request数にすると、失敗して再試行した回数まで「処理件数」に見えてしまう。分母はaccepted task数にする。
30日pilotのGO条件は、少なくとも次の五つだ。
critical taskでquality floorを割らない。
p95 latencyとtimeout率がproduct SLOに収まる。
fallback後を含むaccepted-task単価がbudget内。
Search、tool、cacheの費用をtrace単位で説明できる。
48時間のexit testを完遂し、2027年価格でも12か月TCOが成立する。
安い切符より、積み替えられる荷物を持つ
Gemini 3.7 Flashは、試す価値の高いmodelに見える。stable endpointで、広いmodalitiesとagent向けtoolを持ち、導入価格も魅力的だ。
同時に、公式資料だけでも、pricing lane、cache storage、query課金、thinking token、timeout、API / model lifecycleという条件が見える。
だから結論は、「安いから採用」でも「後で上がるから見送る」でもない。
安い今、移れる形で使い始める。
promptを持ち運べる。toolを差し替えられる。qualityを再現できる。費用を成功taskまで追える。fallbackが動く。そして、48時間で別の線路へ荷物を積み替えられる。
temporary priceが本当にくれるものは、安いtokenだけではない。
architectureを試し、失敗し、逃げ道まで作る時間だ。
※価格・仕様は2026年8月20日時点のGoogle公式資料を確認した。公開時には再確認が必要。記事内の試算は税、為替、個別契約、volume discount、地域差を含まない説明用であり、RINKAKUはGemini 3.7 Flashの実production品質を独自検証していない。


