摘要: Gemini 3.7 Flash 与 3.6 Flash 的基础规格非常接近:两者都支持约 100 万 Token 输入上下文、65,536 最大输出 Token、PDF、多模态输入、Function Calling、Code Execution、File Search 和工具调用;截至 2026 年 12 月 31 日,两者 Gemini API 的促销单价也相同。真正拉开差距的是任务完成质量。Google 公开对照结果显示,3.7 Flash 在 DeepSWE、FrontierCode、GDP.pdf 和 AutomationBench 上都明显领先 3.6 Flash,分别对应软件工程、生产代码、复杂 PDF 理解和业务自动化。对于新建的编程 Agent、PDF 分析系统和 n8n 多步骤工作流,优先测试 3.7 Flash更合理;已经稳定运行在 3.6 Flash 的生产流程则不必盲目切换,应先做同 Prompt、同 Thinking Level、同工具集的回归测试。本文采用“官方公开对照数据 + 可复现 A/B 实测流程”的口径,不虚构本环境未实际执行的 Gemini API 调用结果。
核心结论
如果你的主要工作负载是代码生成/修复、复杂 PDF 分析,或者 n8n 中需要模型连续判断并调用多个节点的 Agent 工作流,Gemini 3.7 Flash 当前更值得作为默认候选模型。原因并不是上下文窗口更大或每百万 Token 更便宜——这两项与 3.6 Flash 基本相同——而是 3.7 Flash 在相同 Flash 定位下,把“第一次做对、少走错误分支、复杂任务持续执行”的能力进一步提升。
- 编程:3.7 Flash 优势最明确。 Google 公布的 DeepSWE v1.1 为 65.3% vs 49.0%,FrontierCode 1.1 Main 为 43.6% vs 34.4%,3.7 Flash 在代码修复、Issue Resolution 与生产代码质量上有明显提升。
- PDF:基础能力相同,但复杂文档推理差距明显。 两代模型都原生支持 PDF;在 GDP.pdf 复杂文档理解基准上,3.7 Flash 为 34.0%,3.6 Flash 为 22.0%,相差 12 个百分点。
- 自动化:3.7 Flash 更适合多步骤工作流。 AutomationBench 官方公开结果为 30.4% vs 17.0%。这不是 n8n 专项分数,但可以作为“模型能否稳定完成真实业务自动化任务”的代理指标。
- 价格:当前没有迁移惩罚。 截至 2026 年 12 月 31 日,两者标准 Gemini API 促销价均为输入 $0.75/百万 Token、输出 $3.75/百万 Token;2027 年 1 月 1 日起官方计划调整为 $1.50/$7.50。
- 已有 3.6 生产流程不要只看 Benchmark 直接升级。 3.7 Flash“思考更勤奋”,可能减少重试,也可能在部分任务产生更多 reasoning/output Token。真正应比较的是“每个成功任务的总成本、成功率和延迟”,而不是单看每百万 Token 单价。
本文所说的“实测”分成两层:第一层使用 Google 已公开的同代对照 Benchmark;第二层提供可在 Gemini API 与 n8n 中直接复现的 A/B 测试方法。由于当前执行环境没有用户的 Gemini API Key,本文不伪造独立 API 跑分或 n8n 执行次数。
背景与主要变化
Gemini 3.6 Flash 于 2026 年 7 月 21 日推出,Google 当时已经把它定义为面向 Agent 时代的工作马模型,重点强化代码生成、知识工作、多模态处理、Computer Use 和多步骤工具执行。仅三周后的 2026 年 8 月 13 日,Gemini 3.7 Flash 正式 GA。如此短的迭代周期意味着 3.7 更像是对 3.6 在真实开发者反馈和执行稳定性上的快速强化,而不是彻底更换一套能力边界。
Google 对 3.7 Flash 的官方定位是“most intelligent workhorse model yet for coding and agents”。官方特别强调三点:第一,更能适应执行中的 roadblock;第二,在需要时更主动澄清意图;第三,对多步骤规划和工具调用投入更充分的推理。这些变化对“问一句答一句”的聊天场景未必能形成巨大体感差异,但对代码修复、PDF 交叉核验、n8n AI Agent 这类任务影响很大,因为这类系统最贵的成本往往不是一次 Token,而是错误分支、重复调用、人工返工和工作流重跑。
两代模型的基础规格几乎对齐:
| 对比项 | Gemini 3.7 Flash | Gemini 3.6 Flash | 结论 |
|---|---|---|---|
| 模型 ID | gemini-3.7-flash | gemini-3.6-flash | 新项目直接使用稳定 ID |
| 输入上下文 | 1,048,576 Token | 1,048,576 Token | 相同 |
| 最大输出 | 65,536 Token | 65,536 Token | 相同 |
| 输入模态 | 文本、图片、视频、音频、PDF | 文本、图片、视频、音频、PDF | 相同 |
| Function Calling | 支持 | 支持 | 相同 |
| Code Execution | 支持 | 支持 | 相同 |
| File Search | 支持 | 支持 | 相同 |
| Computer Use | 支持(Preview) | 支持(Preview) | 相同 |
| Search Grounding | 支持 | 支持 | 相同 |
| Structured Output | 支持 | 支持 | 相同 |
| 3.7 Thinking Level | low / medium / high;默认 medium | 支持 Thinking | 3.7 参数边界更明确 |
| 2026 年底前标准 API 促销价 | $0.75 输入 / $3.75 输出 | $0.75 输入 / $3.75 输出 | 相同 |
因此,这次比较不能用“3.7 能做而 3.6 不能做”的方式理解,更准确的是:工具箱基本相同,但 3.7 使用这套工具箱完成复杂任务的成功率更高。
本文的“实测”口径:哪些是公开结果,哪些需要你自己复现
为了避免把官方 Benchmark 写成本站自测,先把数据来源说清楚。
本文采用的公开对照数据包括:
| 测试方向 | 公开基准 | Gemini 3.7 Flash | Gemini 3.6 Flash | 差值 |
|---|---|---|---|---|
| 生产代码质量 | FrontierCode 1.1 Main | 43.6% | 34.4% | +9.2 个百分点 |
| 长链软件工程 | DeepSWE v1.1 | 65.3% | 49.0% | +16.3 个百分点 |
| 复杂 PDF 理解 | GDP.pdf | 34.0% | 22.0% | +12.0 个百分点 |
| 业务自动化 | AutomationBench | 30.4% | 17.0% | +13.4 个百分点 |
| Web 开发 | WebDev Arena Elo | 1588 | 1538 | +50 Elo |
这些数字来自 Google 2026 年 8 月 13 日发布的 Gemini 3.7 Flash 官方文章及其引用的评测。它们可以帮助判断趋势,但不能自动等同于你的 WordPress、财务 PDF、Python 仓库或 n8n 工作流会获得同样幅度的提升。
更可靠的迁移方法是把自己的真实任务做成一个固定 A/B 测试集。建议每个方向至少准备 10~30 个任务,并保证两边的:
- Prompt 完全相同。
- 输入文件完全相同。
- Thinking Level 尽量对齐。
- 系统提示词完全相同。
- 工具列表和权限完全相同。
- 超时、Retry、最大循环次数一致。
- 不临时修改某一边 Prompt 来“救场”。
- 同时记录准确率、延迟、输入/输出 Token、工具调用次数和人工返工次数。
这样得出的才是对你自己的“真正实测”。
编程实测:3.7 Flash 的提升不只是会写更多代码
在编程方向,3.7 Flash 是这次升级中最容易看到差距的部分。Google 公布的 DeepSWE v1.1 从 49.0% 提升至 65.3%,增加 16.3 个百分点;FrontierCode 1.1 Main 从 34.4% 提升到 43.6%,增加 9.2 个百分点。Google 还明确描述 3.7 在 debugging、issue resolution、first-pass code accuracy 和 production-ready code 方面更强。
这意味着实际测试时不要只让两个模型分别“写一个贪吃蛇”然后肉眼比较。更有意义的测试应覆盖真实工程循环。
推荐的 5 组编程 A/B 测试
- 已有仓库 Bug 修复
提供错误日志、相关文件和测试用例,要求模型定位根因、修改最少代码并保持原接口不变。 - 多文件重构
让模型把同步调用改为异步队列,要求同时更新调用方、类型定义、测试和文档。 - 依赖升级
给出旧版本 SDK 的代码,让模型迁移到新 SDK,重点检查是否混用旧参数。 - 前端设计还原
输入截图或设计参考,要求生成可运行页面,比较布局完整度、交互与修改轮数。 - Agent 式代码修复
允许模型执行测试、读取日志、修改代码、再次测试,统计多少轮能够让测试全部通过。
对 AI Stack Nav 这类同时包含 WordPress、自动化脚本、n8n、Python/Node.js 工具的项目,第 5 类最有价值。传统“代码生成”只看一次回答,而生产环境更关心:
分析问题
→ 找文件
→ 修改代码
→ 跑测试
→ 读取失败
→ 二次修复
→ 验证
→ 输出变更说明
3.7 Flash 官方所强调的“减少 failed agent loops”和“更适应 roadblocks”,正对应这个流程。
一个可复现的 API 编程测试脚本
新项目优先按照 Google 推荐的 Interactions API 测试:
from google import genai
import time
client = genai.Client()
MODELS = [
"gemini-3.6-flash",
"gemini-3.7-flash",
]
prompt = """
下面是一段 Python 服务代码及错误日志。
要求:
1. 找出根因;
2. 只修改必要代码;
3. 不改变已有 API;
4. 给出修复后的完整函数;
5. 给出至少 3 个 pytest 测试用例;
6. 说明为什么这些测试能阻止回归。
"""
for model in MODELS:
start = time.perf_counter()
interaction = client.interactions.create(
model=model,
input=prompt,
generation_config={
"thinking_level": "medium"
}
)
elapsed = time.perf_counter() - start
print("=" * 60)
print("MODEL:", model)
print("LATENCY:", round(elapsed, 2))
print(interaction.output_text)
不要只比较“谁写得更长”。建议建立 100 分制评分表:测试是否通过 40 分、是否引入无关修改 20 分、是否满足接口约束 15 分、是否解释根因 15 分、代码可读性 10 分。

PDF 实测:两代都能“读 PDF”,差异在复杂推理而不是 OCR
PDF 是最容易被误解的一项。Gemini 3.7 Flash 和 3.6 Flash 的模型页都明确把 PDF 列为原生输入类型,两者也都有 1,048,576 Token 输入限制。Google 的 Document Understanding 文档说明,Gemini 可通过 native vision 理解 PDF 中的文本、图片、图表和表格,而不是仅把 PDF OCR 成文字;文档处理支持最长 1000 页。
因此,简单做“总结一份 5 页纯文字 PDF”的测试,很可能看不出 3.7 与 3.6 的真实差距。更适合的任务是:
- 在 100~300 页年报中找跨章节数据矛盾。
- 读取表格并结合脚注计算指标。
- 对比正文、图表、附录中的同一数据。
- 从合同中提取责任主体、金额、期限与例外条款。
- 让模型指出证据所在页码并返回结构化 JSON。
- 从扫描页、图表页和文本页混合的 PDF 中生成审查报告。
Google 公布的 GDP.pdf 结果为 34.0% vs 22.0%。这个基准专门考察复杂文档处理能力,因此比简单摘要更能说明 3.7 的变化。
PDF A/B 测试建议
选择一份你有权处理的 50~200 页 PDF,提前人工制作 20 个“有标准答案”的问题,例如:
- 第 32 页表格里的本期数是多少?
- 某一指标同比变化是多少?
- 正文和附录是否存在口径差异?
- 找到某个结论的原始证据页。
- 同时引用两个不同章节才能回答的问题。
- 返回固定 JSON Schema,不允许多余字段。
使用同一文件分别发给两个模型:
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="report.pdf")
questions = """
请分析这份 PDF,并严格返回 JSON:
{
"answer": "...",
"evidence_pages": [1, 2],
"evidence": ["..."],
"confidence": 0.0
}
问题:报告中现金流恶化的主要原因是什么?请至少结合两个不同章节的证据。
"""
for model in ["gemini-3.6-flash", "gemini-3.7-flash"]:
interaction = client.interactions.create(
model=model,
input=[
{
"type": "document",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
},
{
"type": "text",
"text": questions
}
],
)
print(model)
print(interaction.output_text)
对于大文件或需要多轮重复分析的 PDF,Google 官方建议使用 Files API,而不是每次请求都重新内联上传文件。Files API 可以减少重复带宽和上传延迟,文件当前会保存 48 小时。
如果你的业务是长期企业知识库,不要把“单次 PDF 上传”直接当成完整 RAG。多文档、长期复用和精确检索更适合结合 File Search 或独立向量库。AI Stack Nav 中与 Gemini 文档分析相关的内容可通过 Gemini API 站内搜索继续延伸。
n8n 工作流实测:真正要测的是“任务闭环”,不是单个 LLM 节点
n8n 官方提供 Google Gemini Chat Model,可连接 conversational agents;Google Gemini(PaLM) credentials 用于通过 API Key 等方式认证 Gemini 节点。对于刚发布的新模型,具体 n8n 版本中的模型下拉列表是否已经出现 gemini-3.7-flash,应以你当前安装版本为准。
如果下拉列表暂时没有 3.7 Flash,最稳妥的测试方式是直接使用 HTTP Request 节点调用 Gemini Interactions API,这样可以显式控制模型 ID,也能让 3.6/3.7 的 A/B 请求保持完全一致。
推荐的 n8n A/B 工作流
Manual Trigger
↓
Set / Edit Fields
↓
Code:复制出两条测试记录
┌──────────────┴──────────────┐
↓ ↓
gemini-3.6-flash gemini-3.7-flash
↓ ↓
Parse Result Parse Result
└──────────────┬──────────────┘
↓
Merge / Compare
↓
Google Sheets / DB
每条测试记录至少保存:
{
"model": "gemini-3.7-flash",
"test_case_id": "workflow-001",
"success": true,
"latency_ms": 0,
"tool_calls": 0,
"retry_count": 0,
"input_tokens": 0,
"output_tokens": 0,
"human_fix_required": false,
"score": 0
}
n8n HTTP Request 节点的核心请求
请求方法:
POST
Endpoint:
https://generativelanguage.googleapis.com/v1beta/interactions
Headers:
x-goog-api-key: {{$env.GEMINI_API_KEY}}
Content-Type: application/json
Body:
{
"model": "{{$json.model}}",
"input": "{{$json.prompt}}"
}
这里不要把 API Key 直接写入工作流 JSON。自托管 n8n 应优先使用 Credentials 或环境变量,并避免把密钥输出到执行日志。
n8n 三类任务怎么测才有价值
场景一:客服工单路由
输入一封客户邮件,让模型:
- 判断问题类型。
- 判断紧急程度。
- 提取客户名称和订单号。
- 决定调用“查询订单”还是“创建工单”。
- 输出固定 JSON。
重点统计JSON 合法率、字段准确率、错误工具调用次数。
场景二:PDF → 结构化数据 → Google Sheets
流程:
Google Drive
→ 下载 PDF
→ Gemini 分析
→ Structured Output
→ IF 校验
→ Google Sheets
→ 异常进入人工审核
重点比较:
- 表格字段是否提取正确。
- 是否把“无数据”编造成 0。
- 是否能输出证据页码。
- Schema 失败次数。
- 同一 PDF 是否需要 Retry。
场景三:多工具 Agent
例如:
用户请求
→ Gemini 判断
→ 查询 Google Sheets
→ 查询 CRM
→ 调用 HTTP API
→ 生成结论
→ 高风险操作人工审批
→ 写回系统
Google 在 AutomationBench 上给出的 30.4% vs 17.0% 非常值得关注,因为这一类 Benchmark 比普通问答更接近 n8n 的真实工作方式:模型不仅要“知道答案”,还要在多步骤流程里持续做正确决定。
但必须再次强调:AutomationBench ≠ n8n Benchmark。它只能说明 3.7 Flash 在真实业务自动化类任务上表现更强,不能据此声称“n8n 成功率提升 78%”。

如何搭建一套真正可用的 n8n 模型评测工作流
如果准备长期比较模型,而不是只手工跑两三次,建议把评测本身也做成 n8n 自动化。
- 建立 Test Cases 表。
用 Google Sheets、Airtable 或数据库保存固定测试集,包括id、category、prompt、expected_result、input_file和评分规则。 - 按模型复制测试记录。
Code 节点为每个 Case 生成两条 item,分别写入gemini-3.6-flash与gemini-3.7-flash。 - 统一调用参数。
两边使用相同 Prompt、Thinking Level、工具和最大循环次数。 - 记录 Usage。
保存输入 Token、输出 Token、总耗时、HTTP 状态码、Retry 次数和工具调用次数。 - 建立确定性校验。
JSON Schema、正则、单元测试、数据库查询结果等尽量用程序判断,而不是全部交给另一个 LLM Judge。 - 加入 LLM Judge。
对代码可读性、摘要质量、分析完整度等难以规则化的指标,再用独立 Judge 模型评分。 - 人工抽查。
对高分与低分样本都抽查,避免 Judge 偏差。 - 计算任务级成本。
不只算$ / 1M Token,而是计算“成功完成 100 个任务需要多少钱”。 - 设置迁移门槛。
例如只有当 3.7 的成功率至少提高 5 个百分点,同时 P95 延迟不恶化超过 20%,才将生产模型切换。 - 保留快速回退。
在 n8n 中用一个MODEL_ID环境变量或配置表控制默认模型,出现回归时可直接切回 3.6,而不用逐节点修改。
这类评测工作流后续也可以复用来比较 Gemini 3.7 Flash、Flash-Lite、Pro 或其他厂商模型。更多 n8n 与 AI Agent 相关教程可通过 AI Stack Nav 的 n8n Agent 站内搜索继续查找。
成本实测:同价不代表每个任务成本完全相同
截至 2026 年 12 月 31 日,Gemini 3.7 Flash 和 3.6 Flash 的 Gemini API 标准促销价格相同:
| 计费项 | 3.7 Flash | 3.6 Flash |
|---|---|---|
| 输入 | $0.75 / 100 万 Token | $0.75 / 100 万 Token |
| 输出(含 reasoning) | $3.75 / 100 万 Token | $3.75 / 100 万 Token |
| Cached Input | $0.075 / 100 万 Token | $0.075 / 100 万 Token |
| 2027-01-01 起输入 | $1.50 / 100 万 Token | $1.50 / 100 万 Token |
| 2027-01-01 起输出 | $7.50 / 100 万 Token | $7.50 / 100 万 Token |
在单价层面,2026 年内从 3.6 切换到 3.7 没有额外 Token 单价惩罚。
但 3.7 Flash 的官方描述是“thinks more diligently”,即在复杂多步骤任务中投入更多推理。如果同一个问题 3.7 输出更多 reasoning Token,那么单次 API 费用可能更高;反过来,如果它减少失败循环、重复 Tool Call 和人工重试,总任务成本又可能更低。
因此应建立:
单任务真实成本
=
首次模型调用
+ 工具调用
+ Retry
+ 后续修复调用
+ 第三方 API
+ 人工处理成本
而不是只比较模型价格表。
迁移实测:3.6 Flash 项目升级到 3.7 需要改什么
两代模型的能力接口高度一致,因此多数 Gemini API 项目的最低迁移动作只是模型 ID:
MODEL = "gemini-3.7-flash"
但生产迁移仍建议执行以下检查:
- 更新到当前 Google GenAI SDK。
- 把模型 ID 从
gemini-3.6-flash改为gemini-3.7-flash。 - 检查 Thinking Level 是否显式设置。
- 对 3.7 不要设置
minimal;官方说明其支持low、medium、high,默认medium。 - 跑完整回归测试集,而不是只验证 API 能返回 200。
- 比较 Structured Output 是否仍符合 Schema。
- 比较 Function Calling 参数是否稳定。
- 对高风险 Tool Call 保留人工审批。
- 检查平均和 P95 Token 使用量。
- 保留
gemini-3.6-flash快速回退开关。
对 n8n 来说,最方便的方法不是把模型 ID 写死在十几个节点里,而是在 workflow 开头统一设置:
{
"MODEL_ID": "gemini-3.7-flash"
}
后续节点全部引用:
{{$json.MODEL_ID}}
这样回退时只改一个值。
对比与选型建议
新建编程 Agent
优先 3.7 Flash。当前官方编程对照结果最明确,而且 2026 年底前单价与 3.6 相同。
已运行稳定的 3.6 编程流水线
先 A/B。尤其是自动 PR、Code Review、数据库迁移等高风险流程,不能因为模型平均 Benchmark 更高就省略回归。
PDF 摘要
如果只是 5~20 页纯文本总结,两者都能胜任,差距可能不大。成本敏感时还应该同时测试 Flash-Lite。
PDF 财务/合同/科研分析
优先测试 3.7。GDP.pdf 的 12 个百分点差距说明复杂文档理解是此次升级的重要收益方向。
n8n 简单分类与抽取
不一定需要 3.7。一个节点完成的低风险分类任务应同时比较 Flash-Lite。
n8n 多工具 Agent
优先 3.7。AutomationBench 和 Google 对多步骤规划/Tool Call 的官方描述都指向更强的复杂工作流完成能力。
企业生产工作流
建议采用“3.7 主模型 + 低成本模型处理简单子任务 + 人工审批高风险动作”的分层结构,而不是所有节点统一使用最高能力模型。
风险、限制与注意事项
1. 官方 Benchmark 不是你的生产数据
FrontierCode、DeepSWE、GDP.pdf 和 AutomationBench 都是重要参考,但与每家公司的代码仓库、合同格式、表格质量和 n8n 工具集不同。不要把官方百分点直接写进自己的 SLA。
2. PDF 能读不等于数据一定正确
即便 native vision 可以同时看文字、图片、表格和图表,财务金额、合同期限、身份证号等高风险字段仍应通过规则或人工验证。
3. Structured Output 也需要 Schema 校验
模型返回 JSON 不代表字段一定符合业务语义。n8n 中建议在写数据库前增加 IF / Code 校验节点。
4. Tool Calling 必须做参数白名单
AI Agent 不应直接获得“任意 URL、任意 SQL、任意邮件收件人”的无限权限。工具参数应在模型之外做校验。
5. 生产写操作需要人工审批
付款、删数据、修改账户、发布内容、发送正式邮件、修改权限等操作,都应增加 Approval Gate 或权限隔离。
6. 防止 Agent 无限循环
在 n8n 或自定义 Agent Runtime 中设置:
- 最大 Tool Call 次数
- 最大 Retry 次数
- 总超时
- 单任务 Token 上限
- 第三方 API 预算
- 幂等 Key
7. API 和 n8n 节点会持续更新
Gemini 3.7 Flash 是 2026 年 8 月刚 GA 的模型。n8n 的模型下拉项、默认模型和节点行为可能随版本更新,生产部署前应核对当前 n8n Release Notes 与 Google Gemini API 文档。
事实依据与来源
本文事实依据按来源类型区分如下:
- Google 官方已确认: Gemini 3.7 Flash 于 2026 年 8 月 13 日 GA,模型 ID 为
gemini-3.7-flash;Gemini 3.6 Flash 模型 ID 为gemini-3.6-flash。 - Google 官方已确认: 两者输入 Token 上限均为 1,048,576,最大输出均为 65,536,并都支持 Text、Image、Video、Audio 与 PDF 输入。
- Google 官方公开评测: 3.7 vs 3.6 在 FrontierCode 1.1 Main 为 43.6% vs 34.4%,DeepSWE v1.1 为 65.3% vs 49.0%,GDP.pdf 为 34.0% vs 22.0%,AutomationBench 为 30.4% vs 17.0%。
- Google 官方已确认: 3.7 Flash 的 Thinking Level 支持
low、medium、high,默认medium,minimal不支持。 - Google 官方已确认: 截至 2026 年 12 月 31 日,3.7 Flash 与 3.6 Flash 均享受 $0.75/百万输入 Token、$3.75/百万输出 Token 的促销价。
- n8n 官方已确认: n8n 提供 Google Gemini Chat Model,用于将 Gemini Chat Models 接入 conversational agents,同时提供 Google Gemini(PaLM) credentials。
- 编辑判断: AutomationBench 适合作为 n8n 多步骤业务自动化的代理指标,但不是 n8n 专项 Benchmark。
- 可复现实测方案: 本文提供的代码、PDF 和 n8n A/B 测试结构用于读者在自己的 Gemini API Key、文件和工作流中复现。
- 未声称完成的测试: 当前文章生成环境没有用户 Gemini API Key,因此没有虚构“本站运行 20 次得出某成功率”等独立数据。
FAQ
Gemini 3.7 Flash 一定比 3.6 Flash 快吗?
不能直接这样下结论。Google 当前公开资料重点说明的是复杂编码、文档理解和 Agent 工作流质量提升,而不是承诺所有请求延迟都更低。3.7 在复杂任务中会“更勤奋地思考”,因此某些请求可能使用更多 reasoning Token。应在自己的任务上同时记录平均延迟、P95 延迟和总任务完成时间。
Gemini 3.7 Flash 与 3.6 Flash 的 API 价格一样吗?
截至 2026 年 12 月 31 日,两者标准 API 促销价相同,均为输入 $0.75/百万 Token、输出 $3.75/百万 Token。Google 当前公布的计划是 2027 年 1 月 1 日起调整为 $1.50 输入、$7.50 输出。最终生产成本还取决于实际 Token、Retry 和工具调用次数。
两个模型都能直接读取 PDF 吗?
可以。Google 官方模型页面把 PDF 列为 Gemini 3.7 Flash 和 3.6 Flash 的原生输入类型。Document Understanding 文档说明 Gemini 能利用 native vision 理解 PDF 中的文本、图片、表格、图表与布局,当前支持最长 1000 页文档。
PDF 测试为什么 3.7 更值得关注?
因为 Google 公布的 GDP.pdf 复杂文档理解基准中,3.7 Flash 为 34.0%,3.6 Flash 为 22.0%。这说明升级优势更可能体现在需要跨页、跨模态、跨章节推理的复杂 PDF,而不是简单 OCR 或摘要。
n8n 里可以直接选择 Gemini 3.7 Flash 吗?
n8n 官方有 Google Gemini Chat Model,但具体模型下拉列表会随 n8n 版本和节点更新变化。如果当前版本没有显示 gemini-3.7-flash,可以先使用 HTTP Request 节点直接调用 Gemini Interactions API,并显式指定模型 ID;生产前应检查当前 n8n Release Notes。
AutomationBench 30.4% vs 17.0% 能代表 n8n 成功率吗?
不能。AutomationBench 是业务自动化 Benchmark,不是 n8n 专项测试。它可以说明 3.7 Flash 在真实业务工作流类任务上的整体能力明显更强,但不能把其百分比直接换算成某个 n8n 工作流的成功率。
已经在用 3.6 Flash,有必要马上升级吗?
如果是新项目,3.7 值得优先测试,因为促销期单价相同且官方复杂任务结果更好。已经稳定运行的生产项目建议先 A/B 回归,重点检查 JSON Schema、Function Calling、工具调用次数、P95 延迟、Token 和最终成功率,再决定切换。
Gemini 3.7 Flash 适合所有 n8n 节点吗?
不需要。简单分类、翻译、标签、字段提取等高吞吐低风险节点可以同时评估更便宜的 Flash-Lite;需要多步骤判断、PDF 分析、复杂工具编排的主 Agent 节点更适合优先使用 3.7 Flash。
3.7 Flash 的 Thinking Level 应如何设置?
官方支持 low、medium、high,默认是 medium,不支持 minimal。A/B 测试时应尽量保持两边推理设置一致;生产中可以按任务复杂度动态路由,不必所有请求都使用 high。
Gemini PDF 分析结果能直接写入数据库吗?
不建议无校验直写。即便模型输出符合 JSON Schema,也应对金额、日期、账号、状态码等关键字段做程序规则校验;高风险数据还应进入人工审核节点。
参考来源
- Google:Introducing Gemini 3.7 Flash
- Google AI for Developers:Gemini 3.7 Flash 模型规格
- Google AI for Developers:Gemini 3.6 Flash 模型规格
- Google AI for Developers:What’s new in Gemini 3.7 Flash
- Google AI for Developers:Document Understanding
- Google AI for Developers:Gemini Developer API Pricing
- n8n Docs:Google Gemini Chat Model
- n8n Docs:Google Gemini(PaLM) credentials
环境配置与 Docker 工作流
适合阅读安装部署、本地配置、服务器搭建和自动化流程类文章后继续转化。