摘要: 本文提供 Gemini 3.8 Flash API 的完整入门与 Agent 开发教程,重点解释模型 ID、限时价格、thinking_level 努力等级、Interactions API、Function Calling、代码执行、Google Search Grounding、MCP 和生产安全。核心结论是:Gemini 3.8 Flash 已是 Stable 模型,拥有 1,048,576 Token 输入上限和 65,536 Token 输出上限,默认思考等级为 medium;2026 年 12 月 31 日前标准 API 限时价格为输入 0.75 美元、输出(含思考 Token)3.75 美元/百万 Token,2027 年 1 月 1 日起分别调整为 1.50 与 7.50 美元。适合正在开发长程编程 Agent、企业工作流和多工具智能体的开发者,但上线前必须控制思考成本、工具权限、重试、状态保存和人工审批。
核心结论
Gemini 3.8 Flash 是 Google 面向长程软件工程、自主 Agent 和复杂企业工作流推出的 Stable Flash 模型。它最值得关注的并非单纯“更快”,而是用 Flash 价格提供 100 万级上下文、可调思考等级、Function Calling、代码执行、Search Grounding、MCP 与状态化 Interactions API。对于需要多轮工具调用的 Agent,它比只调用一次 generateContent 更值得采用。
- 官方模型 ID 为
gemini-3.8-flash,不是 preview 后缀;Google 模型页标记为 Stable。 - 输入上限为 1,048,576 Token,输出上限为 65,536 Token;支持文本、图像、视频、音频和 PDF 输入,输出为文本。
thinking_level支持low、medium、high,默认medium;不支持minimal,传入会报错。- 2026 年底前标准付费价是输入 $0.75/MTok、输出 $3.75/MTok;输出价格包含可见输出 Token 和思考 Token。2027 年起价格分别为 $1.50 和 $7.50。
- 推荐日常分类、抽取和简单工具路由使用 low;多步骤 Agent 默认 medium;复杂规划、根因分析和高价值决策使用 high,并以内部评测决定,而非全局固定最高档。
Gemini 3.8 Flash是什么
Google 将 Gemini 3.8 Flash 描述为当前最智能的 Flash 模型,针对长程软件工程、自主 Agent 与复杂企业工作流设计。与单纯追求低延迟的轻量模型相比,它更强调多步骤执行、工具协同和上下文连续性。
模型输入支持 Text、Image、Video、Audio 与 PDF,输出为 Text;支持 Context Caching、Code Execution、File Search、Function Calling、Google Maps Grounding、Google Search Grounding、Structured Outputs、Thinking 和 URL Context。Computer Use 标记为 Preview;不支持图像生成、原生音频生成和 Live API。因此,它适合“理解多模态资料后调用工具完成任务”,但不是实时语音模型,也不是图片生成模型。
模型页最后更新日期为 2026 年 9 月 2 日,模型列表页在 9 月 4 日仍将其列为 Stable。Stable 通常比 Preview 更适合生产,但并不表示 API、配额和周边工具永不变化,仍需订阅官方变更日志。

价格:2026限时价与2027正式价
Gemini 3.8 Flash 的定价需要同时看调用模式与日期。Google 当前价格页明确标出 2026 年 12 月 31 日之前的限时价格,以及 2027 年 1 月 1 日起的新价格。
| 调用方式 | 2026年底前输入/输出 | 2027年起输入/输出 | 适合场景 |
|---|---|---|---|
| Standard | $0.75 / $3.75 每百万Token | $1.50 / $7.50 | 在线Agent、交互式应用 |
| Batch | $0.375 / $1.875 | $0.75 / $3.75 | 非实时批处理,约标准价50% |
| Flex | $0.375 / $1.875 | $0.75 / $3.75 | 可接受弹性延迟的任务 |
| Priority | $1.35 / $6.75 | $2.70 / $13.50 | 对吞吐和优先级要求高的生产服务 |
标准模式的 Context Caching 读取价在 2026 年底前为 $0.075/MTok,2027 年起为 $0.15/MTok;缓存存储费分别为 $0.50 与 $1.00/百万 Token/小时。Google Search Grounding 在付费层由所有 Gemini 3.x 模型共享每月 5,000 次免费搜索请求,超出后为每 1,000 次 14 美元;Maps Grounding 也有共享免费额度和后续查询费用。免费层具体 Rate Limit 以项目控制台显示为准。
一个常见误区是只统计模型的最终回答。官方说明,开启思考时,输出计费等于最终输出 Token 加思考 Token,total_thought_tokens 可从 usage 中读取。例如一次请求有 20 万输入、2 万思考和 5 千最终输出,在 2026 标准价下,粗略成本为 0.2×0.75 + 0.025×3.75 = 0.24375 美元,尚未加入搜索、缓存存储和其他工具费用。
免费层虽然输入输出 Token 免费,但价格页说明免费层内容可能用于改进 Google 产品;付费层则标注内容不用于改进产品。处理企业代码、客户数据或敏感文档时,不应因“免费”而忽略数据政策。
努力等级thinking_level怎么选
Gemini 模型默认进行动态思考,根据任务复杂度自动调整推理量。Gemini 3.8 Flash 默认档位为 medium,只支持 low、medium、high。
low:速度与成本优先
适合文本分类、字段抽取、简单摘要、明确规则校验、单次工具选择和已有模板填充。low 不等于关闭思考,但会减少推理投入。若任务成功标准明确、失败容易检测,优先从 low 开始。
medium:多步骤Agent默认档
适合读取需求、制定计划、调用两三个工具、根据结果继续执行、生成结构化报告等常规 Agent 工作。它是模型默认设置,也是大多数团队建立基线评测的起点。
high:困难推理与高价值任务
适合复杂代码根因分析、跨系统方案设计、长文档矛盾核查、多约束调度和高价值决策辅助。high 可能产生更多思考 Token、增加延迟和费用,并不能保证结果必然正确。
| 任务类型 | 推荐等级 | 主要理由 | 必须验证 |
|---|---|---|---|
| 分类、抽取、格式转换 | low | 规则清晰,追求吞吐 | JSON Schema与边界样例 |
| 一般问答和单工具调用 | low或medium | 平衡速度与判断 | 工具参数与事实来源 |
| n8n多节点规划 | medium | 需要多步骤连贯 | 节点配置与回滚 |
| 代码调试和复杂Agent | medium起步,失败升high | 避免全程高成本 | 测试、日志、diff |
| 发布、付款、删除、权限修改 | high也不能自动放行 | 模型努力等级不是授权 | 人工审批与最小权限 |
不要通过把 max_output_tokens 设得很低来间接控制思考成本。Google 文档指出,它是包含思考 Token 在内的硬上限,不改变模型如何分配思考;如果推理阶段撞到上限,响应可能变成 incomplete,并返回截断甚至空输出,同时已生成的思考 Token 仍会计费。正确方式是降低 thinking_level,再给足合理输出上限。
API Key与SDK配置
- 打开 Google AI Studio 创建 Gemini API Key。
- 将 Key 放入服务器环境变量,不要写进源码、前端 JavaScript 或 WordPress 页面。
- 创建虚拟环境并安装官方 Google Gen AI SDK。
- 用 low 等级发起第一条 Interactions API 请求。
- 输出 usage 字段,验证思考 Token 和总成本。
python -m venv .venv
source .venv/bin/activate
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="为这个Python项目生成一份测试计划,不要修改文件。",
generation_config={
"thinking_level": "low",
"thinking_summaries": "auto",
"max_output_tokens": 4096,
},
)
print(interaction.output_text)
print(interaction.usage)
SDK 字段可能随版本变化,部署时以官方文档和已安装 SDK 的类型定义为准。出现参数错误时,先升级 google-genai,再确认使用的是 Interactions API 而非旧示例。
用Function Calling开发第一个Agent
模型不会因为声明了函数就自动安全执行真实业务操作。正确流程是:模型提出函数调用,应用验证函数名与参数,执行受控代码,再把 function_result 返回模型。下面示例让 Agent 查询工单,不允许修改或删除数据。
import json
from google import genai
client = genai.Client()
get_ticket = {
"type": "function",
"name": "get_ticket",
"description": "读取工单详情,只读操作",
"parameters": {
"type": "object",
"properties": {
"ticket_id": {"type": "string"}
},
"required": ["ticket_id"],
"additionalProperties": False,
},
}
first = client.interactions.create(
model="gemini-3.8-flash",
input="读取工单 WP-1683,分析失败原因并给出修复计划。",
generation_config={"thinking_level": "medium"},
tools=[get_ticket],
store=False,
)
call = next(step for step in first.steps if step.type == "function_call")
if call.name != "get_ticket":
raise ValueError("未经允许的工具")
ticket_id = call.arguments.get("ticket_id", "")
if not ticket_id.startswith("WP-"):
raise ValueError("非法工单编号")
result = {"id": ticket_id, "status": "failed", "log": "Not Found"}
history = [step.model_dump() for step in first.steps]
history.append({
"type": "function_result",
"name": call.name,
"call_id": call.id,
"result": [{"type": "text", "text": json.dumps(result)}],
})
final = client.interactions.create(
model="gemini-3.8-flash",
input=history,
tools=[get_ticket],
store=False,
)
print(final.output_text)
代码中的业务结果是演示数据,不代表真实工单。生产系统必须加入身份鉴别、租户隔离、参数 Schema、超时、重试、幂等键、审计日志和权限 allowlist。

Interactions API状态怎么管理
Interactions API 支持状态化与无状态两种模式。状态化模式使用 store: true,后续请求传入 previous_interaction_id,服务器自动维护对话状态、thought blocks 和 signatures。它实现简单,但企业应先评估数据留存与删除要求。
无状态模式使用 store: false,应用自行回传完整历史。官方要求所有 thought blocks 必须原样重新发送,不能删改,因为其中包含维持推理连续性的加密签名;Google Search 等内置工具也可能携带独立签名。无状态并不等于不需要安全存储,历史会落在你的数据库和日志系统中,同样需要加密与访问控制。
对长任务,推荐每个阶段保存外部检查点:任务目标、已完成步骤、工具结果摘要、产物位置、测试证据、剩余风险和下一步。不要把百万 Token 上下文误当作永久记忆。
代码执行、搜索与MCP怎么组合
Gemini 3.8 Flash 支持 code_execution,可让模型生成并运行代码,用于计算、数据分析和验证。它也能同时组合 Google Search 与自定义 Function Calling;官方示例还展示了通过 Interactions API 配置远程 MCP Server。
组合工具时应建立明确顺序:搜索负责获取当前事实,代码执行负责计算或解析,自定义函数负责内部数据,MCP 负责标准化外部工具连接,最终由验证器检查证据。不要让网页文字直接成为系统指令,以防 Prompt Injection。
可在 AI Stack Nav 继续查看 Gemini API 教程、AI Agent 开发教程 和 MCP 实战内容。
成本控制与生产部署建议
第一,按任务路由努力等级,而非全局使用 high。第二,记录 total_input_tokens、total_output_tokens、total_thought_tokens、搜索次数、缓存读取与存储时长。第三,把稳定的系统提示词、工具定义和大型参考文档放入缓存,变化频繁的日志和用户输入不要混入长期缓存。
第四,非实时内容生成、离线评测和批量分类使用 Batch;可接受不稳定延迟的后台任务评估 Flex;只有明确需要优先吞吐的业务才使用 Priority。第五,在 2027 年价格变化前重新计算预算,避免按 2026 限时价制定长期报价。
风险、限制与常见错误
minimal不受 Gemini 3.8 Flash 支持,会返回错误;改用 low。max_output_tokens同时限制思考和回答,过低可能得到空输出或 incomplete。- 免费层数据政策与付费层不同,企业敏感数据不要直接放入个人免费项目。
- Computer Use 仍为 Preview,不能默认达到生产稳定性。
- Function Calling 只生成调用意图,应用必须验证参数和权限。
- Agent 可能无限循环,应设置最大步骤、墙钟超时、预算和连续失败阈值。
- 发布文章、发邮件、付款、删除数据、修改账户或权限必须人工审批。
- Rate Limit 随项目和套餐变化,应读取控制台实际配额,并对 429 实施指数退避。
- Search Grounding 与第三方 MCP 可能产生额外费用和独立数据处理风险。
事实依据与来源
模型 ID、Stable 状态、上下文、输出上限和能力列表来自 Google Gemini 3.8 Flash 官方模型页;价格、免费层数据用途、Batch/Flex/Priority 价格来自官方价格页;思考等级、默认 medium、思考 Token 计费、max_output_tokens 行为和 thought signatures 来自官方 Thinking 文档;Function Calling、代码执行与 MCP 示例来自相应官方开发文档。本文的努力等级路由、权限治理、检查点和成本控制属于实施建议,需要在真实任务集上评测。
FAQ
Gemini 3.8 Flash的模型ID是什么?
正式模型 ID 是 gemini-3.8-flash。官方将其列为 Stable,不需要添加 preview 后缀。
Gemini 3.8 Flash免费吗?
Gemini Developer API 提供有限免费层,输入输出 Token 可免费,但模型和 Rate Limit 可受限制,且免费层内容可能用于改进 Google 产品。生产系统应评估付费层。
当前API价格是多少?
2026 年 12 月 31 日前,Standard 输入 $0.75、输出 $3.75/百万 Token;2027 年 1 月 1 日起为 $1.50 和 $7.50。输出价格包含思考 Token。
支持哪些努力等级?
支持 low、medium、high,默认 medium。不支持 minimal。简单任务用 low,多步骤 Agent 用 medium,困难任务再升 high。
上下文窗口多大?
输入上限 1,048,576 Token,输出上限 65,536 Token。最大上下文不等于永久记忆,长任务仍需外部状态存储。
是否支持Function Calling和MCP?
支持。官方文档提供 Function Calling、内置 Google Search 与远程 MCP Server 示例,但工具执行权限和参数校验由开发者负责。
是否支持代码执行?
支持 code_execution 工具,可生成并运行代码进行计算和验证。敏感数据、网络和生产权限仍需隔离。
为什么响应为空或显示incomplete?
常见原因是 max_output_tokens 太低,模型在思考阶段就达到硬上限。降低 thinking_level 或合理提高输出上限,并检查 usage。
是否适合直接连接WordPress或n8n生产环境?
可以作为模型层,但不能直接授予无限权限。先使用草稿、测试工作区、工具 allowlist、幂等键、日志和人工审批。
参考来源
- Google:Gemini 3.8 Flash模型规格
- Google:Gemini Developer API价格
- Google:Gemini Thinking与努力等级
- Google:Function Calling开发文档
- Google:Code Execution开发文档
会员充值与订阅排查资料
适合阅读会员充值、订阅购买、权益对比和支付问题类文章后继续转化。