Gemini 3.7 Flash与3.6 Flash实测对比封面,展示编程、PDF分析与n8n自动化工作流

Gemini 3.7 Flash vs 3.6 Flash:编程、PDF 与 n8n 工作流实测

Gemini 3.7 Flash 在 DeepSWE、GDP.pdf 与 AutomationBench 等公开对照中明显领先 3.6 Flash,而上下文、PDF 支持和 2026 年促销单价基本相同。文章提供编程、PDF 与 n8n 三套可复现 A/B 实测方法。

摘要: Gemini 3.7 Flash 与 3.6 Flash 的基础规格非常接近:两者都支持约 100 万 Token 输入上下文、65,536 最大输出 Token、PDF、多模态输入、Function Calling、Code Execution、File Search 和工具调用;截至 2026 年 12 月 31 日,两者 Gemini API 的促销单价也相同。真正拉开差距的是任务完成质量。Google 公开对照结果显示,3.7 Flash 在 DeepSWE、FrontierCode、GDP.pdf 和 AutomationBench 上都明显领先 3.6 Flash,分别对应软件工程、生产代码、复杂 PDF 理解和业务自动化。对于新建的编程 Agent、PDF 分析系统和 n8n 多步骤工作流,优先测试 3.7 Flash更合理;已经稳定运行在 3.6 Flash 的生产流程则不必盲目切换,应先做同 Prompt、同 Thinking Level、同工具集的回归测试。本文采用“官方公开对照数据 + 可复现 A/B 实测流程”的口径,不虚构本环境未实际执行的 Gemini API 调用结果。

核心结论

如果你的主要工作负载是代码生成/修复、复杂 PDF 分析,或者 n8n 中需要模型连续判断并调用多个节点的 Agent 工作流,Gemini 3.7 Flash 当前更值得作为默认候选模型。原因并不是上下文窗口更大或每百万 Token 更便宜——这两项与 3.6 Flash 基本相同——而是 3.7 Flash 在相同 Flash 定位下,把“第一次做对、少走错误分支、复杂任务持续执行”的能力进一步提升。

  • 编程:3.7 Flash 优势最明确。 Google 公布的 DeepSWE v1.1 为 65.3% vs 49.0%,FrontierCode 1.1 Main 为 43.6% vs 34.4%,3.7 Flash 在代码修复、Issue Resolution 与生产代码质量上有明显提升。
  • PDF:基础能力相同,但复杂文档推理差距明显。 两代模型都原生支持 PDF;在 GDP.pdf 复杂文档理解基准上,3.7 Flash 为 34.0%,3.6 Flash 为 22.0%,相差 12 个百分点。
  • 自动化:3.7 Flash 更适合多步骤工作流。 AutomationBench 官方公开结果为 30.4% vs 17.0%。这不是 n8n 专项分数,但可以作为“模型能否稳定完成真实业务自动化任务”的代理指标。
  • 价格:当前没有迁移惩罚。 截至 2026 年 12 月 31 日,两者标准 Gemini API 促销价均为输入 $0.75/百万 Token、输出 $3.75/百万 Token;2027 年 1 月 1 日起官方计划调整为 $1.50/$7.50。
  • 已有 3.6 生产流程不要只看 Benchmark 直接升级。 3.7 Flash“思考更勤奋”,可能减少重试,也可能在部分任务产生更多 reasoning/output Token。真正应比较的是“每个成功任务的总成本、成功率和延迟”,而不是单看每百万 Token 单价。

本文所说的“实测”分成两层:第一层使用 Google 已公开的同代对照 Benchmark;第二层提供可在 Gemini API 与 n8n 中直接复现的 A/B 测试方法。由于当前执行环境没有用户的 Gemini API Key,本文不伪造独立 API 跑分或 n8n 执行次数

背景与主要变化

Gemini 3.6 Flash 于 2026 年 7 月 21 日推出,Google 当时已经把它定义为面向 Agent 时代的工作马模型,重点强化代码生成、知识工作、多模态处理、Computer Use 和多步骤工具执行。仅三周后的 2026 年 8 月 13 日,Gemini 3.7 Flash 正式 GA。如此短的迭代周期意味着 3.7 更像是对 3.6 在真实开发者反馈和执行稳定性上的快速强化,而不是彻底更换一套能力边界。

Google 对 3.7 Flash 的官方定位是“most intelligent workhorse model yet for coding and agents”。官方特别强调三点:第一,更能适应执行中的 roadblock;第二,在需要时更主动澄清意图;第三,对多步骤规划和工具调用投入更充分的推理。这些变化对“问一句答一句”的聊天场景未必能形成巨大体感差异,但对代码修复、PDF 交叉核验、n8n AI Agent 这类任务影响很大,因为这类系统最贵的成本往往不是一次 Token,而是错误分支、重复调用、人工返工和工作流重跑

两代模型的基础规格几乎对齐:

对比项Gemini 3.7 FlashGemini 3.6 Flash结论
模型 IDgemini-3.7-flashgemini-3.6-flash新项目直接使用稳定 ID
输入上下文1,048,576 Token1,048,576 Token相同
最大输出65,536 Token65,536 Token相同
输入模态文本、图片、视频、音频、PDF文本、图片、视频、音频、PDF相同
Function Calling支持支持相同
Code Execution支持支持相同
File Search支持支持相同
Computer Use支持(Preview)支持(Preview)相同
Search Grounding支持支持相同
Structured Output支持支持相同
3.7 Thinking Levellow / medium / high;默认 medium支持 Thinking3.7 参数边界更明确
2026 年底前标准 API 促销价$0.75 输入 / $3.75 输出$0.75 输入 / $3.75 输出相同

因此,这次比较不能用“3.7 能做而 3.6 不能做”的方式理解,更准确的是:工具箱基本相同,但 3.7 使用这套工具箱完成复杂任务的成功率更高。

本文的“实测”口径:哪些是公开结果,哪些需要你自己复现

为了避免把官方 Benchmark 写成本站自测,先把数据来源说清楚。

本文采用的公开对照数据包括:

测试方向公开基准Gemini 3.7 FlashGemini 3.6 Flash差值
生产代码质量FrontierCode 1.1 Main43.6%34.4%+9.2 个百分点
长链软件工程DeepSWE v1.165.3%49.0%+16.3 个百分点
复杂 PDF 理解GDP.pdf34.0%22.0%+12.0 个百分点
业务自动化AutomationBench30.4%17.0%+13.4 个百分点
Web 开发WebDev Arena Elo15881538+50 Elo

这些数字来自 Google 2026 年 8 月 13 日发布的 Gemini 3.7 Flash 官方文章及其引用的评测。它们可以帮助判断趋势,但不能自动等同于你的 WordPress、财务 PDF、Python 仓库或 n8n 工作流会获得同样幅度的提升。

更可靠的迁移方法是把自己的真实任务做成一个固定 A/B 测试集。建议每个方向至少准备 10~30 个任务,并保证两边的:

  1. Prompt 完全相同。
  2. 输入文件完全相同。
  3. Thinking Level 尽量对齐。
  4. 系统提示词完全相同。
  5. 工具列表和权限完全相同。
  6. 超时、Retry、最大循环次数一致。
  7. 不临时修改某一边 Prompt 来“救场”。
  8. 同时记录准确率、延迟、输入/输出 Token、工具调用次数和人工返工次数。

这样得出的才是对你自己的“真正实测”。

编程实测:3.7 Flash 的提升不只是会写更多代码

在编程方向,3.7 Flash 是这次升级中最容易看到差距的部分。Google 公布的 DeepSWE v1.1 从 49.0% 提升至 65.3%,增加 16.3 个百分点;FrontierCode 1.1 Main 从 34.4% 提升到 43.6%,增加 9.2 个百分点。Google 还明确描述 3.7 在 debugging、issue resolution、first-pass code accuracy 和 production-ready code 方面更强。

这意味着实际测试时不要只让两个模型分别“写一个贪吃蛇”然后肉眼比较。更有意义的测试应覆盖真实工程循环。

推荐的 5 组编程 A/B 测试

  1. 已有仓库 Bug 修复
    提供错误日志、相关文件和测试用例,要求模型定位根因、修改最少代码并保持原接口不变。
  2. 多文件重构
    让模型把同步调用改为异步队列,要求同时更新调用方、类型定义、测试和文档。
  3. 依赖升级
    给出旧版本 SDK 的代码,让模型迁移到新 SDK,重点检查是否混用旧参数。
  4. 前端设计还原
    输入截图或设计参考,要求生成可运行页面,比较布局完整度、交互与修改轮数。
  5. Agent 式代码修复
    允许模型执行测试、读取日志、修改代码、再次测试,统计多少轮能够让测试全部通过。

对 AI Stack Nav 这类同时包含 WordPress、自动化脚本、n8n、Python/Node.js 工具的项目,第 5 类最有价值。传统“代码生成”只看一次回答,而生产环境更关心:

分析问题
→ 找文件
→ 修改代码
→ 跑测试
→ 读取失败
→ 二次修复
→ 验证
→ 输出变更说明

3.7 Flash 官方所强调的“减少 failed agent loops”和“更适应 roadblocks”,正对应这个流程。

一个可复现的 API 编程测试脚本

新项目优先按照 Google 推荐的 Interactions API 测试:

from google import genai
import time

client = genai.Client()

MODELS = [
    "gemini-3.6-flash",
    "gemini-3.7-flash",
]

prompt = """
下面是一段 Python 服务代码及错误日志。
要求:
1. 找出根因;
2. 只修改必要代码;
3. 不改变已有 API;
4. 给出修复后的完整函数;
5. 给出至少 3 个 pytest 测试用例;
6. 说明为什么这些测试能阻止回归。
"""

for model in MODELS:
    start = time.perf_counter()

    interaction = client.interactions.create(
        model=model,
        input=prompt,
        generation_config={
            "thinking_level": "medium"
        }
    )

    elapsed = time.perf_counter() - start

    print("=" * 60)
    print("MODEL:", model)
    print("LATENCY:", round(elapsed, 2))
    print(interaction.output_text)

不要只比较“谁写得更长”。建议建立 100 分制评分表:测试是否通过 40 分、是否引入无关修改 20 分、是否满足接口约束 15 分、是否解释根因 15 分、代码可读性 10 分。

Gemini 3.7 Flash与3.6 Flash编程和PDF A/B测试架构图,展示相同输入、模型分流、代码测试、PDF分析和统一评分流程
同一套输入、Prompt、Thinking Level 和评分标准,才能比较 Gemini 3.7 Flash 与 3.6 Flash 的真实任务完成能力。

PDF 实测:两代都能“读 PDF”,差异在复杂推理而不是 OCR

PDF 是最容易被误解的一项。Gemini 3.7 Flash 和 3.6 Flash 的模型页都明确把 PDF 列为原生输入类型,两者也都有 1,048,576 Token 输入限制。Google 的 Document Understanding 文档说明,Gemini 可通过 native vision 理解 PDF 中的文本、图片、图表和表格,而不是仅把 PDF OCR 成文字;文档处理支持最长 1000 页。

因此,简单做“总结一份 5 页纯文字 PDF”的测试,很可能看不出 3.7 与 3.6 的真实差距。更适合的任务是:

  • 在 100~300 页年报中找跨章节数据矛盾。
  • 读取表格并结合脚注计算指标。
  • 对比正文、图表、附录中的同一数据。
  • 从合同中提取责任主体、金额、期限与例外条款。
  • 让模型指出证据所在页码并返回结构化 JSON。
  • 从扫描页、图表页和文本页混合的 PDF 中生成审查报告。

Google 公布的 GDP.pdf 结果为 34.0% vs 22.0%。这个基准专门考察复杂文档处理能力,因此比简单摘要更能说明 3.7 的变化。

PDF A/B 测试建议

选择一份你有权处理的 50~200 页 PDF,提前人工制作 20 个“有标准答案”的问题,例如:

  1. 第 32 页表格里的本期数是多少?
  2. 某一指标同比变化是多少?
  3. 正文和附录是否存在口径差异?
  4. 找到某个结论的原始证据页。
  5. 同时引用两个不同章节才能回答的问题。
  6. 返回固定 JSON Schema,不允许多余字段。

使用同一文件分别发给两个模型:

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="report.pdf")

questions = """
请分析这份 PDF,并严格返回 JSON:
{
  "answer": "...",
  "evidence_pages": [1, 2],
  "evidence": ["..."],
  "confidence": 0.0
}
问题:报告中现金流恶化的主要原因是什么?请至少结合两个不同章节的证据。
"""

for model in ["gemini-3.6-flash", "gemini-3.7-flash"]:
    interaction = client.interactions.create(
        model=model,
        input=[
            {
                "type": "document",
                "uri": uploaded_file.uri,
                "mime_type": uploaded_file.mime_type
            },
            {
                "type": "text",
                "text": questions
            }
        ],
    )

    print(model)
    print(interaction.output_text)

对于大文件或需要多轮重复分析的 PDF,Google 官方建议使用 Files API,而不是每次请求都重新内联上传文件。Files API 可以减少重复带宽和上传延迟,文件当前会保存 48 小时。

如果你的业务是长期企业知识库,不要把“单次 PDF 上传”直接当成完整 RAG。多文档、长期复用和精确检索更适合结合 File Search 或独立向量库。AI Stack Nav 中与 Gemini 文档分析相关的内容可通过 Gemini API 站内搜索继续延伸。

n8n 工作流实测:真正要测的是“任务闭环”,不是单个 LLM 节点

n8n 官方提供 Google Gemini Chat Model,可连接 conversational agents;Google Gemini(PaLM) credentials 用于通过 API Key 等方式认证 Gemini 节点。对于刚发布的新模型,具体 n8n 版本中的模型下拉列表是否已经出现 gemini-3.7-flash,应以你当前安装版本为准。

如果下拉列表暂时没有 3.7 Flash,最稳妥的测试方式是直接使用 HTTP Request 节点调用 Gemini Interactions API,这样可以显式控制模型 ID,也能让 3.6/3.7 的 A/B 请求保持完全一致。

推荐的 n8n A/B 工作流

Manual Trigger
      ↓
Set / Edit Fields
      ↓
Code:复制出两条测试记录
 ┌──────────────┴──────────────┐
 ↓                             ↓
gemini-3.6-flash        gemini-3.7-flash
 ↓                             ↓
Parse Result               Parse Result
 └──────────────┬──────────────┘
                ↓
       Merge / Compare
                ↓
      Google Sheets / DB

每条测试记录至少保存:

{
  "model": "gemini-3.7-flash",
  "test_case_id": "workflow-001",
  "success": true,
  "latency_ms": 0,
  "tool_calls": 0,
  "retry_count": 0,
  "input_tokens": 0,
  "output_tokens": 0,
  "human_fix_required": false,
  "score": 0
}

n8n HTTP Request 节点的核心请求

请求方法:

POST

Endpoint:

https://generativelanguage.googleapis.com/v1beta/interactions

Headers:

x-goog-api-key: {{$env.GEMINI_API_KEY}}
Content-Type: application/json

Body:

{
  "model": "{{$json.model}}",
  "input": "{{$json.prompt}}"
}

这里不要把 API Key 直接写入工作流 JSON。自托管 n8n 应优先使用 Credentials 或环境变量,并避免把密钥输出到执行日志。

n8n 三类任务怎么测才有价值

场景一:客服工单路由

输入一封客户邮件,让模型:

  1. 判断问题类型。
  2. 判断紧急程度。
  3. 提取客户名称和订单号。
  4. 决定调用“查询订单”还是“创建工单”。
  5. 输出固定 JSON。

重点统计JSON 合法率、字段准确率、错误工具调用次数

场景二:PDF → 结构化数据 → Google Sheets

流程:

Google Drive
→ 下载 PDF
→ Gemini 分析
→ Structured Output
→ IF 校验
→ Google Sheets
→ 异常进入人工审核

重点比较:

  • 表格字段是否提取正确。
  • 是否把“无数据”编造成 0。
  • 是否能输出证据页码。
  • Schema 失败次数。
  • 同一 PDF 是否需要 Retry。

场景三:多工具 Agent

例如:

用户请求
→ Gemini 判断
→ 查询 Google Sheets
→ 查询 CRM
→ 调用 HTTP API
→ 生成结论
→ 高风险操作人工审批
→ 写回系统

Google 在 AutomationBench 上给出的 30.4% vs 17.0% 非常值得关注,因为这一类 Benchmark 比普通问答更接近 n8n 的真实工作方式:模型不仅要“知道答案”,还要在多步骤流程里持续做正确决定。

但必须再次强调:AutomationBench ≠ n8n Benchmark。它只能说明 3.7 Flash 在真实业务自动化类任务上表现更强,不能据此声称“n8n 成功率提升 78%”。

Gemini 3.7 Flash与3.6 Flash在n8n工作流中的A/B实测流程图,展示触发器、模型分流、工具调用、PDF处理、结果校验和人工审批
n8n 中应把两个模型放进同一套输入、工具、重试与评分链路,比较最终任务成功率,而不是只比较单次回复。

如何搭建一套真正可用的 n8n 模型评测工作流

如果准备长期比较模型,而不是只手工跑两三次,建议把评测本身也做成 n8n 自动化。

  1. 建立 Test Cases 表。
    用 Google Sheets、Airtable 或数据库保存固定测试集,包括 idcategorypromptexpected_resultinput_file 和评分规则。
  2. 按模型复制测试记录。
    Code 节点为每个 Case 生成两条 item,分别写入 gemini-3.6-flashgemini-3.7-flash
  3. 统一调用参数。
    两边使用相同 Prompt、Thinking Level、工具和最大循环次数。
  4. 记录 Usage。
    保存输入 Token、输出 Token、总耗时、HTTP 状态码、Retry 次数和工具调用次数。
  5. 建立确定性校验。
    JSON Schema、正则、单元测试、数据库查询结果等尽量用程序判断,而不是全部交给另一个 LLM Judge。
  6. 加入 LLM Judge。
    对代码可读性、摘要质量、分析完整度等难以规则化的指标,再用独立 Judge 模型评分。
  7. 人工抽查。
    对高分与低分样本都抽查,避免 Judge 偏差。
  8. 计算任务级成本。
    不只算 $ / 1M Token,而是计算“成功完成 100 个任务需要多少钱”。
  9. 设置迁移门槛。
    例如只有当 3.7 的成功率至少提高 5 个百分点,同时 P95 延迟不恶化超过 20%,才将生产模型切换。
  10. 保留快速回退。
    在 n8n 中用一个 MODEL_ID 环境变量或配置表控制默认模型,出现回归时可直接切回 3.6,而不用逐节点修改。

这类评测工作流后续也可以复用来比较 Gemini 3.7 Flash、Flash-Lite、Pro 或其他厂商模型。更多 n8n 与 AI Agent 相关教程可通过 AI Stack Nav 的 n8n Agent 站内搜索继续查找。

成本实测:同价不代表每个任务成本完全相同

截至 2026 年 12 月 31 日,Gemini 3.7 Flash 和 3.6 Flash 的 Gemini API 标准促销价格相同:

计费项3.7 Flash3.6 Flash
输入$0.75 / 100 万 Token$0.75 / 100 万 Token
输出(含 reasoning)$3.75 / 100 万 Token$3.75 / 100 万 Token
Cached Input$0.075 / 100 万 Token$0.075 / 100 万 Token
2027-01-01 起输入$1.50 / 100 万 Token$1.50 / 100 万 Token
2027-01-01 起输出$7.50 / 100 万 Token$7.50 / 100 万 Token

在单价层面,2026 年内从 3.6 切换到 3.7 没有额外 Token 单价惩罚。

但 3.7 Flash 的官方描述是“thinks more diligently”,即在复杂多步骤任务中投入更多推理。如果同一个问题 3.7 输出更多 reasoning Token,那么单次 API 费用可能更高;反过来,如果它减少失败循环、重复 Tool Call 和人工重试,总任务成本又可能更低。

因此应建立:

单任务真实成本
=
首次模型调用
+ 工具调用
+ Retry
+ 后续修复调用
+ 第三方 API
+ 人工处理成本

而不是只比较模型价格表。

迁移实测:3.6 Flash 项目升级到 3.7 需要改什么

两代模型的能力接口高度一致,因此多数 Gemini API 项目的最低迁移动作只是模型 ID:

MODEL = "gemini-3.7-flash"

但生产迁移仍建议执行以下检查:

  1. 更新到当前 Google GenAI SDK。
  2. 把模型 ID 从 gemini-3.6-flash 改为 gemini-3.7-flash
  3. 检查 Thinking Level 是否显式设置。
  4. 对 3.7 不要设置 minimal;官方说明其支持 lowmediumhigh,默认 medium
  5. 跑完整回归测试集,而不是只验证 API 能返回 200。
  6. 比较 Structured Output 是否仍符合 Schema。
  7. 比较 Function Calling 参数是否稳定。
  8. 对高风险 Tool Call 保留人工审批。
  9. 检查平均和 P95 Token 使用量。
  10. 保留 gemini-3.6-flash 快速回退开关。

对 n8n 来说,最方便的方法不是把模型 ID 写死在十几个节点里,而是在 workflow 开头统一设置:

{
  "MODEL_ID": "gemini-3.7-flash"
}

后续节点全部引用:

{{$json.MODEL_ID}}

这样回退时只改一个值。

对比与选型建议

新建编程 Agent

优先 3.7 Flash。当前官方编程对照结果最明确,而且 2026 年底前单价与 3.6 相同。

已运行稳定的 3.6 编程流水线

先 A/B。尤其是自动 PR、Code Review、数据库迁移等高风险流程,不能因为模型平均 Benchmark 更高就省略回归。

PDF 摘要

如果只是 5~20 页纯文本总结,两者都能胜任,差距可能不大。成本敏感时还应该同时测试 Flash-Lite。

PDF 财务/合同/科研分析

优先测试 3.7。GDP.pdf 的 12 个百分点差距说明复杂文档理解是此次升级的重要收益方向。

n8n 简单分类与抽取

不一定需要 3.7。一个节点完成的低风险分类任务应同时比较 Flash-Lite。

n8n 多工具 Agent

优先 3.7。AutomationBench 和 Google 对多步骤规划/Tool Call 的官方描述都指向更强的复杂工作流完成能力。

企业生产工作流

建议采用“3.7 主模型 + 低成本模型处理简单子任务 + 人工审批高风险动作”的分层结构,而不是所有节点统一使用最高能力模型。

风险、限制与注意事项

1. 官方 Benchmark 不是你的生产数据

FrontierCode、DeepSWE、GDP.pdf 和 AutomationBench 都是重要参考,但与每家公司的代码仓库、合同格式、表格质量和 n8n 工具集不同。不要把官方百分点直接写进自己的 SLA。

2. PDF 能读不等于数据一定正确

即便 native vision 可以同时看文字、图片、表格和图表,财务金额、合同期限、身份证号等高风险字段仍应通过规则或人工验证。

3. Structured Output 也需要 Schema 校验

模型返回 JSON 不代表字段一定符合业务语义。n8n 中建议在写数据库前增加 IF / Code 校验节点。

4. Tool Calling 必须做参数白名单

AI Agent 不应直接获得“任意 URL、任意 SQL、任意邮件收件人”的无限权限。工具参数应在模型之外做校验。

5. 生产写操作需要人工审批

付款、删数据、修改账户、发布内容、发送正式邮件、修改权限等操作,都应增加 Approval Gate 或权限隔离。

6. 防止 Agent 无限循环

在 n8n 或自定义 Agent Runtime 中设置:

  • 最大 Tool Call 次数
  • 最大 Retry 次数
  • 总超时
  • 单任务 Token 上限
  • 第三方 API 预算
  • 幂等 Key

7. API 和 n8n 节点会持续更新

Gemini 3.7 Flash 是 2026 年 8 月刚 GA 的模型。n8n 的模型下拉项、默认模型和节点行为可能随版本更新,生产部署前应核对当前 n8n Release Notes 与 Google Gemini API 文档。

事实依据与来源

本文事实依据按来源类型区分如下:

  • Google 官方已确认: Gemini 3.7 Flash 于 2026 年 8 月 13 日 GA,模型 ID 为 gemini-3.7-flash;Gemini 3.6 Flash 模型 ID 为 gemini-3.6-flash
  • Google 官方已确认: 两者输入 Token 上限均为 1,048,576,最大输出均为 65,536,并都支持 Text、Image、Video、Audio 与 PDF 输入。
  • Google 官方公开评测: 3.7 vs 3.6 在 FrontierCode 1.1 Main 为 43.6% vs 34.4%,DeepSWE v1.1 为 65.3% vs 49.0%,GDP.pdf 为 34.0% vs 22.0%,AutomationBench 为 30.4% vs 17.0%。
  • Google 官方已确认: 3.7 Flash 的 Thinking Level 支持 lowmediumhigh,默认 mediumminimal 不支持。
  • Google 官方已确认: 截至 2026 年 12 月 31 日,3.7 Flash 与 3.6 Flash 均享受 $0.75/百万输入 Token、$3.75/百万输出 Token 的促销价。
  • n8n 官方已确认: n8n 提供 Google Gemini Chat Model,用于将 Gemini Chat Models 接入 conversational agents,同时提供 Google Gemini(PaLM) credentials。
  • 编辑判断: AutomationBench 适合作为 n8n 多步骤业务自动化的代理指标,但不是 n8n 专项 Benchmark。
  • 可复现实测方案: 本文提供的代码、PDF 和 n8n A/B 测试结构用于读者在自己的 Gemini API Key、文件和工作流中复现。
  • 未声称完成的测试: 当前文章生成环境没有用户 Gemini API Key,因此没有虚构“本站运行 20 次得出某成功率”等独立数据。

FAQ

Gemini 3.7 Flash 一定比 3.6 Flash 快吗?

不能直接这样下结论。Google 当前公开资料重点说明的是复杂编码、文档理解和 Agent 工作流质量提升,而不是承诺所有请求延迟都更低。3.7 在复杂任务中会“更勤奋地思考”,因此某些请求可能使用更多 reasoning Token。应在自己的任务上同时记录平均延迟、P95 延迟和总任务完成时间。

Gemini 3.7 Flash 与 3.6 Flash 的 API 价格一样吗?

截至 2026 年 12 月 31 日,两者标准 API 促销价相同,均为输入 $0.75/百万 Token、输出 $3.75/百万 Token。Google 当前公布的计划是 2027 年 1 月 1 日起调整为 $1.50 输入、$7.50 输出。最终生产成本还取决于实际 Token、Retry 和工具调用次数。

两个模型都能直接读取 PDF 吗?

可以。Google 官方模型页面把 PDF 列为 Gemini 3.7 Flash 和 3.6 Flash 的原生输入类型。Document Understanding 文档说明 Gemini 能利用 native vision 理解 PDF 中的文本、图片、表格、图表与布局,当前支持最长 1000 页文档。

PDF 测试为什么 3.7 更值得关注?

因为 Google 公布的 GDP.pdf 复杂文档理解基准中,3.7 Flash 为 34.0%,3.6 Flash 为 22.0%。这说明升级优势更可能体现在需要跨页、跨模态、跨章节推理的复杂 PDF,而不是简单 OCR 或摘要。

n8n 里可以直接选择 Gemini 3.7 Flash 吗?

n8n 官方有 Google Gemini Chat Model,但具体模型下拉列表会随 n8n 版本和节点更新变化。如果当前版本没有显示 gemini-3.7-flash,可以先使用 HTTP Request 节点直接调用 Gemini Interactions API,并显式指定模型 ID;生产前应检查当前 n8n Release Notes。

AutomationBench 30.4% vs 17.0% 能代表 n8n 成功率吗?

不能。AutomationBench 是业务自动化 Benchmark,不是 n8n 专项测试。它可以说明 3.7 Flash 在真实业务工作流类任务上的整体能力明显更强,但不能把其百分比直接换算成某个 n8n 工作流的成功率。

已经在用 3.6 Flash,有必要马上升级吗?

如果是新项目,3.7 值得优先测试,因为促销期单价相同且官方复杂任务结果更好。已经稳定运行的生产项目建议先 A/B 回归,重点检查 JSON Schema、Function Calling、工具调用次数、P95 延迟、Token 和最终成功率,再决定切换。

Gemini 3.7 Flash 适合所有 n8n 节点吗?

不需要。简单分类、翻译、标签、字段提取等高吞吐低风险节点可以同时评估更便宜的 Flash-Lite;需要多步骤判断、PDF 分析、复杂工具编排的主 Agent 节点更适合优先使用 3.7 Flash。

3.7 Flash 的 Thinking Level 应如何设置?

官方支持 lowmediumhigh,默认是 medium,不支持 minimal。A/B 测试时应尽量保持两边推理设置一致;生产中可以按任务复杂度动态路由,不必所有请求都使用 high。

Gemini PDF 分析结果能直接写入数据库吗?

不建议无校验直写。即便模型输出符合 JSON Schema,也应对金额、日期、账号、状态码等关键字段做程序规则校验;高风险数据还应进入人工审核节点。

参考来源

安装部署教程

环境配置与 Docker 工作流

适合阅读安装部署、本地配置、服务器搭建和自动化流程类文章后继续转化。

环境配置资料包 包含 Windows / Mac / Linux 常见环境配置、依赖安装和报错排查清单。 查看资料包 Docker 工作流包 整理 Docker 部署模板、compose 示例和常用服务编排流程。 查看资料包

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站累计访问量: 296,576
AI Stack Nav 客服会员 / 支付 / 下载 / 工具库
你好,我是 AI Stack Nav 客服助手。你可以问我会员开通、微信支付、资料下载、订单入口、AI 工具库等问题。