モデル文字列の変更によって404エラーが発生し、エージェントループの開始時に躓くのは避けたいものです。Gemini 3.5 Flash APIは高速なエージェントループに組み込む価値がありますが、そのためには必ず最新のモデルリストで正確な gemini-3.5-flash モデルIDを確認する必要があります。Google Cloudでは、Gemini 3.5 Flashの価格は標準のGlobalティアで入力100万トークンあたり1.50ドル、出力100万トークンあたり9.00ドルとされており、Flex/Batch価格は入力0.75ドル、出力4.50ドルです。ソースコード内でも同様の罠が見受けられます。今日動作するモデルIDが、明日には404エラーを返す可能性があるのです。オンラインの価格表は、ベンダーが確認した価格と、クロスチェックされていないディレクトリリストが混在していることがよくあります。本稿では、現在検証可能な情報とそうでないものを整理し、モデルIDの変更によって壊れないエージェントループの構築方法を解説します。
重要なポイント
- Google CloudのAgent Platform価格ページでは、Gemini 3.5 Flashは標準のGlobalティアで入力100万トークンあたり1.50ドル、出力100万トークンあたり9.00ドルと記載されており、更新時点でのTokenLabのディレクトリリストと一致しています。
- 指定すべき正確なモデル文字列は
gemini-3.5-flashです。GoogleのGemini APIモデルページでは、安定したモデルの例として挙げられています。ただし、デプロイ前には必ずライブモデルリストを通じて確認してください。 - TokenLabの統合APIを経由すれば、プロバイダー固有のSDK文字列をハードコードする必要はありません。TokenLabは、安定したモデルスラッグを、現在有効な基盤となる識別子にマッピングします。
- 以下の表にある競合他社の価格(GPT-5.5、Claude Sonnet 5、DeepSeek V4 Flash)は、TokenLabのディレクトリのみに基づいています。本レビューではこれらのモデルについて独立したベンダーの価格ページは提供されていないため、予算を組む前にOpenAI、Anthropic、DeepSeekに直接確認してください。
- ベンチマークによるレイテンシ数値(Time-to-first-token、5ステップのループ全体の所要時間など)は、独立したソースがないためここでは引用していません。二次情報を引用するのではなく、自身のループを計測し、ステップごとのp50/p95を測定してください。
- エージェントループでは通常、出力トークンがコストの大半を占めます。Gemini 3.5 Flashの出力レート(9.00ドル/100万トークン)は入力レート(1.50ドル/100万トークン)の6倍であるため、プロンプトの長さを削るよりも
max_output_tokensに上限を設けることの方が重要です。
ソーススナップショット
| ソース | 内容 | 確認日 |
|---|---|---|
| Google Cloud Agent Platformの価格 | Gemini 3.5 Flashの標準、キャッシュ入力、およびFlex/Batchトークン価格 | 2026-07-08 |
| Google Gemini APIモデルページ | 安定したモデル命名のガイダンス。gemini-3.5-flash が安定モデルの例として記載 |
2026-07-08 |
| TokenLab モデル&価格ディレクトリ | Google、Anthropic、OpenAI、DeepSeekにわたる gemini-3.5-flash および競合モデルのトークン単価 |
2026-07-08 |
Google CloudのGemini Enterprise Agent Platformでは、Gemini 3.5 FlashはGemini Developer APIの価格ページとは別に、独自の価格スケジュールで掲載されています。標準のGlobalレートは入力100万トークンあたり1.50ドル、出力100万トークンあたり9.00ドルです。Flex/BatchのGlobalレートは入力0.75ドル、出力4.50ドルに下がります。標準ティアでのキャッシュ入力は100万トークンあたり0.15ドルです。これは、Gemini 3.5 Flashがプレースホルダーやプレビューラベルではなく、Google Cloud上のエンタープライズエージェントワークロード向けに価格設定された、安定した一般提供モデルであることの直接的な証拠です。記事間でコストを比較する読者は、数値をそのまま比較する前に、どの価格ページからレートが取得されたかを確認する必要があります。
Gemini 3.5 Flash APIのモデルとコストの比較
以下の数値はすべてTokenLabのディレクトリリストです。「ベンダーに確認」とマークされた行には、本レビュー用に独立した引用元が提供されていません。
| モデル | プロバイダー | コンテキストウィンドウ | 入力 $/100万トークン | 出力 $/100万トークン | 備考 |
|---|---|---|---|---|---|
| gemini-3.5-flash | 1,048,576 | $1.50 | $9.00 | TokenLabディレクトリ。Googleのライブ価格ページで確認のこと | |
| gemini-3.1-flash-lite | n/a | $0.25 | $1.50 | TokenLabディレクトリ | |
| gemini-3-pro-image | n/a | $2.00 | $12.00 | TokenLabディレクトリ、画像ティア。テキストエージェントの代用不可 | |
| gpt-5 | OpenAI | n/a | $1.25 | $10.00 | TokenLabディレクトリ |
| gpt-5.5 | OpenAI | 1,050,000 | $5.00 | $30.00 | TokenLabディレクトリ - OpenAIに確認のこと |
| claude-sonnet-5 | Anthropic | 1,000,000 | $2.00 | $10.00 | TokenLabディレクトリ - Anthropicに確認のこと |
| claude-haiku-4-5 | Anthropic | n/a | $1.00 | $5.00 | TokenLabディレクトリ |
| deepseek-v4-flash | DeepSeek | 1,048,576 | $0.09 | $0.18 | TokenLabディレクトリ - DeepSeekに確認のこと |
ツール呼び出しを頻繁に行うエージェントループでは、トークンあたりの単価が最も安いモデルが、必ずしもタスクあたりのコストが最も安いとは限りません。再試行回数が少なくて済むモデルや、推論トレースが短いモデルの方が、単価が低いモデルよりも優れている場合があります。トークンあたりのコストだけでなく、タスク完了あたりのコストを測定してください。
Gemini 3.5 Flash APIの実装手順
コードを書く前にモデルIDを確認してください。更新時点では、指定すべきモデルIDは
gemini-3.5-flashであり、Googleのモデルドキュメントにも安定モデルの例として記載されています。それでも、デプロイ前にはプロバイダーのモデルリストエンドポイントを呼び出すか、TokenLabのディレクトリを確認してください。これが「SDKがエラーを返した」問題の解決策です。呼び出し時に文字列が存在しなかったことが原因です。識別子が間違っている場合、どれだけ再試行ロジックを組んでも解決しません。例えば、ソースにはその障害モードが直接記述されています。生のプロバイダーSDKではなく、統合エンドポイントを経由してください。TokenLab(または同様のゲートウェイ)を使用すると、アプリケーションコードは安定したスラッグを参照し、ゲートウェイがそれをプロバイダーの現在有効な識別子に解決します。これにより、プロバイダー側のモデル名の変更や廃止からエージェントループを切り離すことができます。
明確なステップと計測機能を備えたループを構築します:
# 説明用の構造です。デプロイ前にゲートウェイの最新ドキュメントで
# 正確なエンドポイント/モデルフィールドを確認してください。
import time
def agent_loop(task):
timings = {}
t0 = time.time()
plan = call_model(model="gemini-3.5-flash", prompt=build_plan_prompt(task))
timings["plan"] = time.time() - t0
t0 = time.time()
context = retrieve_context(plan)
timings["retrieve"] = time.time() - t0
t0 = time.time()
tool_result = call_tool(plan, context)
timings["tool_call"] = time.time() - t0
t0 = time.time()
synthesis = call_model(
model="gemini-3.5-flash",
prompt=build_synthesis_prompt(tool_result),
max_output_tokens=512,
)
timings["synthesize"] = time.time() - t0
t0 = time.time()
response = format_response(synthesis)
timings["respond"] = time.time() - t0
return response, timings
私たちのパイプラインでは、実行ごとに timings をログに記録し、代表的なタスクバッチ全体で独自のp50/p95を計算しています。ネットワークの状態、プロンプトの長さ、プロバイダーの負荷によって数値は変動するため、他人の環境から取得した「1ループあたりN秒」という数値を公開したり、それに依存したりしないでください。
出力トークンに意図的に上限を設けてください。上記のディレクトリ価格によると、
gemini-3.5-flashの出力トークンは入力トークンの約6倍のコストがかかります。価格計算を検証した結果、モデルを長時間実行させるのではなく、ステップごとにmax_output_tokensを設定してください。これは、冗長な回答になりがちな合成ステップで特に重要です。フォールバックチェーンを追加してください。セカンダリモデル(コスト面では
gemini-3.1-flash-lite、あるいは全く別のプロバイダーなど)を設定し、単一のモデルの停止や廃止によってエージェント全体が機能不全に陥らないようにしてください。
TokenLabを使用すべき理由
- 壊れやすいプロバイダーの文字列ではなく、安定したモデルスラッグを使用したい場合。TokenLabのディレクトリ方式を採用すれば、プロバイダーがモデル名を変更したり廃止したりするたびにコードを書き直す必要がなくなります。Google自身のVeo 3.0の終了(2026年6月30日予定)は、そのリスクを示しています。
- ベンダーにコミットする前に、4つの異なる価格ページを手動で確認するのではなく、一箇所でプロバイダー間のコストを比較したい場合。
- マルチプロバイダーのフォールバックロジックを実行しており、4つの異なるSDK統合を維持するのではなく、Google、Anthropic、OpenAI、DeepSeekの各モデル間で一貫したリクエスト/レスポンス形式を維持したい場合。
関連資料
FAQ
gemini-3.5-flash はGoogleのSDKに対して直接呼び出せる有効なモデルIDですか?
そう決めつけないでください。デプロイ前にGoogleの最新のモデルリストで確認してください。モデルID文字列は変更される可能性があり、プレビュー/GAステータスも時間とともに変化します。TokenLabを経由している場合、ゲートウェイがこのマッピングを代行します。
比較表にある競合他社の価格はどこから来ていますか?
TokenLabのディレクトリリストです。本記事で独立した日付付きのGoogleソースに遡れるのはVeoのビデオ価格のみです(2026年7月8日確認)。GPT-5.5、Claude Sonnet 5、DeepSeek V4 Flashの価格には独立した引用元が提供されていないため、顧客向けのコスト見積もりにこれらの数値を使用する前に、各ベンダーに確認してください。
5ステップのGemini 3.5 Flashエージェントループはどのくらいの速さですか?
本記事では独立したソースがないため、ベンチマーク数値は含まれていません。自身のループを計測し(上記のコードサンプルを参照)、他人の数値に頼るのではなく、実際の環境でのp50/p95レイテンシを測定してください。
プロジェクトの途中で使用しているモデルが廃止されたらどうなりますか?
これこそが、GoogleのVeo 3.0の終了(2026年6月30日)が示しているシナリオです。フォールバックチェーンを構築し、可能な限り、更新されたモデルスラッグを維持するゲートウェイを経由することで、廃止によってコードの書き直しが発生しないようにしてください。
TokenLab APIキーを作成して、デプロイ前に現在のモデルIDを比較してください。
出典
価格確認日 2026-07-08
- Google AI Gemini API pricing2026-07-08 時点で確認
- Google Cloud Agent Platform pricing2026-07-08 時点で確認
- Google Gemini API models2026-07-08 時点で確認
- TokenLab model directory2026-07-07 時点で確認



