摘要: Gemini 3.8 Live 是 Google 在 2026 年 9 月 15 日正式发布的稳定版实时音频到音频模型,模型 ID 为 gemini-3.8-live。它面向低延迟语音 Agent 和实时多模态交互,支持文本、图片、音频、视频输入、原生语音输出、Function Calling、Google Search Grounding,以及 Gemini 3.8 Live 新增强化的异步工具调用。本文从模型参数、WebSocket 连接、16 kHz PCM 音频、最高 1 FPS 视觉帧、输入/输出转写、NON_BLOCKING 工具调用、会话恢复、上下文压缩、临时令牌、安全边界和最新价格等方面给出一套可直接实施的完整教程。适合正在开发语音客服、实时视觉助手、会议助手、设备控制 Agent 和浏览器端多模态应用的开发者与企业团队。
核心结论
Gemini 3.8 Live 值得用于需要“边听、边看、边说、边调用工具”的实时 Agent。它与传统 generateContent 最大的区别不是单纯多了语音,而是应用与模型之间维护一个持续的有状态 WebSocket 会话:客户端可以连续发送麦克风音频、摄像头画面和文本,模型持续返回原生语音,同时还能在后台发起函数调用。对于客服、语音助手、视觉巡检、设备控制和实时业务查询,这种交互模型比“录完一段音频再请求一次 API”更接近真正的实时 Agent。
- 模型已经 GA,但 Live API 文档仍存在 Preview 标识。
gemini-3.8-live本身是 Stable/GA;截至 2026 年 9 月 19 日,Live API capabilities 页面仍标注 Preview,因此生产环境仍应准备协议变化、SDK 升级和回退策略。 - 实时输入是真多模态。 官方模型页列出的输入包括文本、图片、音频和视频;视频在 SDK 中实际按 JPEG/PNG 图片帧发送,官方入门文档给出的最高发送速率为 1 FPS。
- 语音链路有明确格式。 麦克风输入应转换为 16-bit、16 kHz、little-endian PCM;模型原生语音输出为 24 kHz PCM。需要文字记录时应开启输入/输出转写,而不是把原生音频模型简单改成
TEXTresponse modality。 - 异步工具调用是 Gemini 3.8 Live 的关键升级。 模型页明确说明
behavior: NON_BLOCKING已成为 Gemini 3.8 Live 的默认函数调用模式;工程实现中仍建议显式声明该行为,并用INTERRUPT、WHEN_IDLE或SILENT决定工具结果何时影响对话。 - 成本不能只按“每分钟语音价格”理解。 Live API 按 token 使用量结算,持续会话会重新处理上下文历史,长会话每轮成本可能逐步增加;需要结合上下文压缩、减少视频帧、会话恢复和业务级预算控制。
如果你此前使用 gemini-3.1-flash-live-preview,现在更合理的迁移目标是 gemini-3.8-live。如果业务需要在实时语音过程中做更复杂的后台推理,可以进一步评估 gemini-3.8-live-extended-thinking。
背景与主要变化
Gemini Live API 的定位不是传统 TTS,也不是“语音版聊天接口”。它是一个持续的双向实时会话协议。客户端建立 WebSocket 后,不需要每说一句话就重新建立一次 HTTP 请求,而是在同一会话内连续发送音频、视频帧或文本,并持续接收模型的音频、转写、工具调用和状态事件。
Google 在 2026 年 9 月 15 日的 Gemini API Release Notes 中宣布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking GA。标准版 gemini-3.8-live 被官方定位为大多数低延迟语音 Agent 的默认选择;Extended Thinking 版本则用于需要更强后台推理的实时语音任务。
从 Gemini 3.1 Flash Live 迁移到 3.8 Live,最值得注意的变化包括:
| 项目 | Gemini 3.8 Live | 对开发者的影响 |
|---|---|---|
| 模型 ID | gemini-3.8-live | 生产代码应固定使用稳定模型字符串 |
| 发布状态 | Stable / GA | 比旧 Preview 模型更适合生产评估 |
| 输入 | 文本、图片、音频、视频 | 可做真正实时多模态 Agent |
| 输出 | 原生音频为主要 Live response modality,并可获取转写 | UI 可同时播放语音并显示字幕 |
| 输入 token 上限 | 131,072 | 官方 capabilities 文档也常概括为 128K |
| 输出 token 上限 | 65,536 | 长输出仍需要业务层限制 |
| Function Calling | 支持 | 可连接 CRM、订单、搜索、设备和内部 API |
| 异步函数调用 | NON_BLOCKING 为 3.8 Live 模型页说明的默认模式 | 工具执行时对话可继续 |
| Thinking | 支持交错推理 | 标准版不接受 thinking_level 配置 |
| Search Grounding | 支持 | 可在实时会话中接入 Google Search |
| Structured Outputs | 不支持 | 不应照搬普通 Gemini JSON Schema 工作流 |
| Code Execution | 不支持 | 需要自建受控工具或外部执行服务 |
| Context Caching | 不支持 | 成本优化重点转向压缩和会话管理 |
这里有一个容易误解的地方:“模型 GA”不等于“Live API 的每一项外围能力都已经完全稳定”。 截至本文核验日期,Google 的 Live API capabilities 页面顶部仍写有 Preview。因此企业上线时仍应把 SDK 版本锁定、监控 API 变更,并保留兼容旧模型或降级到文本交互的路径。

核心功能拆解
1. 实时双向音频
Gemini Live API 使用有状态 WebSocket。对服务端应用而言,Google GenAI SDK 封装了连接、发送与接收流程;对浏览器或移动端直接连接的应用,可以使用 WebSocket 加临时令牌。
官方 SDK 入门文档对音频格式给出了明确要求:
- 输入:raw 16-bit PCM;
- 采样率:16 kHz;
- 字节序:little-endian;
- 建议发送小块数据以降低延迟,官方最佳实践建议约 20~100 ms 一块;
- 原生音频输出:24 kHz PCM。
这意味着浏览器或手机采集的 44.1 kHz / 48 kHz 音频通常需要先重采样为 16 kHz 再发送。不要直接把 MP3、AAC 或完整 WAV 文件持续塞进实时音频通道。
2. 实时视觉不是“连续视频文件上传”
Live API 的视觉流在 SDK 中表现为连续图片帧。官方 Get Started 文档说明,视频帧可以使用 JPEG 或 PNG,并给出最高 1 frame per second 的发送速率。
因此,正确的视觉设计不是“摄像头 30 FPS 全量上传”,而是:
- 在客户端持续采集画面;
- 按业务需要抽帧;
- 压缩成 JPEG;
- 最高控制在 1 FPS;
- 只有画面发生有意义变化时才发送。
对于桌面助手、设备巡检或现场指导,1 FPS 往往已经足够让模型理解“用户现在看到什么”。如果盲目持续发送帧,不仅增加网络开销,也会显著增加视觉 token 成本和上下文压力。
3. 输入与输出转写
原生音频模型以 AUDIO 作为 Live response modality。需要字幕或日志时,应使用 transcription。
典型前端可以同时展示:
input_transcription:用户说了什么;output_transcription:Gemini 回答了什么;- 24 kHz 音频流:直接播放给用户。
这样就能得到“语音 + 实时字幕 + 可审计日志”的完整交互层。
4. 异步 Function Calling
这是 Gemini 3.8 Live 最有价值的变化之一。
传统同步工具调用的体验通常是:
用户提问 → 模型决定调用工具 → 对话停止 → 等待 CRM / ERP / 搜索 → 工具返回 → 模型继续回答。
如果查询需要 3~5 秒,用户会感觉 Agent 卡死。
异步方式则允许:
用户提问 → Agent 发起工具 → Agent 继续保持对话 → 工具在后台执行 → 工具结果返回 → 根据 scheduling 决定立即插入、等待空闲或静默保存。
Gemini 3.8 Live 模型页说明,behavior: NON_BLOCKING 已成为该模型的默认函数调用模式。为了让代码意图清晰,生产配置仍建议显式写出 NON_BLOCKING。
工具结果返回时可选择的调度语义包括:
INTERRUPT:结果一到就中断当前输出并处理;WHEN_IDLE:等模型当前说完再处理;SILENT:不立即告诉用户,保留结果供后续对话使用。
例如,订单状态查询适合 WHEN_IDLE;安全告警可能适合 INTERRUPT;后台画像更新可以使用 SILENT。
5. 完整会话 Client Content 更新
Gemini 3.8 Live 支持在整个 session 生命周期里通过 send_client_content 更新内容,并明确标记 user 或 model 角色。
迁移时要特别注意:设置 turn_complete=true 会无条件中断当前正在生成的模型响应。它适合“用户明确打断模型”的场景,但不应被前端每发送一个小块内容就自动设置。
适用人群与使用场景
Gemini 3.8 Live 更适合需要低延迟、持续上下文和多模态交互的产品,而不是所有 Gemini API 请求都替换成 Live。
适合场景
实时语音客服。 用户可以自然打断,Agent 一边说话一边查询订单、CRM、库存、预约系统。
视觉助手。 摄像头或屏幕画面定期抽帧,模型根据用户看到的内容进行解释、指导或排障。
会议和协作助手。 连续接收语音,生成语音反馈和转写,并在后台查询日历、知识库或任务系统。
现场巡检 Agent。 手机摄像头提供当前设备、仪表或环境画面,语音描述问题,Agent 根据视觉输入和后端工具给出处理建议。
智能设备或车载助手。 用户无需按“发送”,系统持续监听并根据工具调用控制业务能力。
不适合场景
如果你的任务只是一次性总结 PDF、生成长文章、批量处理数据或后台离线任务,普通 generateContent、Batch API 或其他 Gemini 模型通常更简单。Live API 需要 WebSocket、音频缓冲、状态机、断线恢复、转写与工具生命周期管理,工程复杂度明显更高。
AI Stack Nav 上与 Gemini API、Agent 工作流相关的内容可以通过站内搜索继续查看:
安装、配置与第一个 Gemini 3.8 Live 会话
下面以 Python 服务端接入为例。生产环境应把 API Key 放在服务端环境变量,不要写进源码。
第一步:创建环境
先创建虚拟环境并安装 SDK:
python -m venv .venv
pip install -U google-genai
Windows PowerShell 激活环境:
.venv\Scripts\Activate.ps1
macOS / Linux 激活环境:
source .venv/bin/activate
配置环境变量:
macOS / Linux:
export GEMINI_API_KEY="YOUR_API_KEY"
Windows PowerShell:
$env:GEMINI_API_KEY="YOUR_API_KEY"
第二步:建立 Live API WebSocket 会话
import asyncio
import os
from google import genai
client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
MODEL = "gemini-3.8-live"
async def main():
config = {
"response_modalities": ["AUDIO"],
}
async with client.aio.live.connect(
model=MODEL,
config=config,
) as session:
print("Gemini 3.8 Live session started")
await session.send_realtime_input(
text="你好,请用一句话介绍你能做什么。"
)
async for response in session.receive():
if response.data is not None:
# response.data 是音频字节,可交给播放器或写入 WAV
print("audio bytes:", len(response.data))
if response.server_content:
content = response.server_content
if content.input_transcription:
print("User:", content.input_transcription.text)
if content.output_transcription:
print("Gemini:", content.output_transcription.text)
if content.turn_complete:
break
if __name__ == "__main__":
asyncio.run(main())
最小版本首先验证四件事:API Key、模型 ID、WebSocket 连接、音频返回。完成后再接麦克风和摄像头,否则调试复杂度会突然增加。
第三步:发送实时音频
假设你已经把麦克风数据重采样成 16 kHz、16-bit PCM:
from google.genai import types
await session.send_realtime_input(
audio=types.Blob(
data=pcm_chunk,
mime_type="audio/pcm;rate=16000",
)
)
工程上建议每 20~100 ms 发送一个小块,不要把几十秒音频累积到内存后再一次发送。
第四步:发送摄像头或屏幕帧
from google.genai import types
with open("frame.jpg", "rb") as f:
frame = f.read()
await session.send_realtime_input(
video=types.Blob(
data=frame,
mime_type="image/jpeg",
)
)
视觉帧最高按官方指南控制在 1 FPS。对多数 Agent,更推荐“有变化再发送”,而不是固定把每秒 1 帧永久推满。
异步工具调用完整示例
下面用“库存查询”说明如何让 Gemini 在工具执行期间继续保持 Live 会话。
1. 声明 NON_BLOCKING 工具
inventory_tool = {
"function_declarations": [
{
"name": "lookup_inventory",
"description": "查询指定商品的当前库存",
"parameters": {
"type": "object",
"properties": {
"sku": {
"type": "string",
"description": "商品 SKU",
}
},
"required": ["sku"],
},
"behavior": "NON_BLOCKING",
}
]
}
config = {
"response_modalities": ["AUDIO"],
"tools": [inventory_tool],
}
虽然 Gemini 3.8 Live 模型页已经说明 NON_BLOCKING 为默认行为,但显式声明更利于代码审计,也能避免未来多人维护时误解。
2. 把工具执行放到独立异步任务
import asyncio
from google.genai import types
async def lookup_inventory(sku: str):
# 示例:这里替换成你的数据库、ERP 或内部 API
await asyncio.sleep(2)
return {
"sku": sku,
"available": True,
"stock": 23,
}
async def execute_tool_and_reply(session, fc):
result = await lookup_inventory(fc.args["sku"])
function_response = types.FunctionResponse(
id=fc.id,
name=fc.name,
response={
"result": result,
"scheduling": "WHEN_IDLE",
},
)
await session.send_tool_response(
function_responses=[function_response]
)
3. 收到 Function Call 后不要阻塞接收循环
async for response in session.receive():
if response.tool_call:
for fc in response.tool_call.function_calls:
if fc.name == "lookup_inventory":
asyncio.create_task(
execute_tool_and_reply(session, fc)
)
if response.data:
play_audio(response.data)
这才是异步工具调用真正有意义的地方:工具查询交给后台 task,Live 会话的 receive loop 不被一个数据库请求锁死。
在正式业务里,还要增加:
- 工具参数 Schema 校验;
- 超时;
- Retry;
- 幂等键;
- 权限校验;
- 日志;
- 高风险工具人工审批;
- 工具结果长度限制。

实际工作流:实时视觉客服 Agent
一个更接近生产的案例是“视频客服 + 订单工具”。
用户打开网页后,浏览器持续采集麦克风,同时在用户允许时采集摄像头。用户可以直接说:“我手里这台设备为什么一直闪红灯?顺便帮我查一下订单是否还在保修期。”
完整链路可以拆成:
- 浏览器获得麦克风和摄像头权限。
- 音频重采样到 16 kHz PCM,按小块实时发送。
- 摄像头画面按变化抽帧,JPEG 压缩后不超过 1 FPS。
- Gemini 根据视觉帧识别设备状态,并通过语音与用户确认设备型号。
- Agent 发起
lookup_warrantyFunction Call。 - 工具配置为
NON_BLOCKING,用户仍可继续补充信息。 - 后端 ERP 查询完成后返回 FunctionResponse。
- 如果用户正在说话,可使用
WHEN_IDLE,等对话空闲时再报告保修结果。 - 输出音频直接播放,输出转写显示为字幕。
- 会话持续时间较长时启用 context window compression。
- WebSocket 即将结束时处理 GoAway,并使用 session resumption 恢复上下文。
- 把每个工具调用的用户、参数、结果和审批记录写入审计日志。
这类 Agent 的价值来自“连续感”。如果每个视觉问题、订单查询和语音回答都拆成独立 HTTP 请求,应用会变成多个功能拼接,而不是一个真正持续运行的 Agent。
会话时长、上下文与断线恢复
Live API 的低延迟来自持久连接,但持久连接不能被理解成“永不关闭”。
Google 当前文档给出的关键限制是:
- 不启用上下文压缩时,纯音频 session 最长约 15 分钟;
- 音频 + 视频 session 最长约 2 分钟;
- 单条底层 WebSocket connection 生命周期约 10 分钟;
- 可以通过 context window compression 延长 session;
- 可以通过 session resumption 跨连接继续同一 session;
- resumption token 需要妥善保存并按官方有效期规则使用;
- 服务端会在连接终止前发送 GoAway,客户端应提前重连。
因此生产架构至少要有三个状态:
CONNECTED
↓
GOAWAY / NETWORK_ERROR
↓
RESUMING
↓
CONNECTED
不要把一次 WebSocket 断开直接等同于整场对话结束。
最新价格与真实成本怎么计算
截至 2026 年 9 月 19 日,Google Gemini Developer API 定价页面把 Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking 和 Gemini 3.1 Flash Live Preview 放在同一组 Live 定价中。
| 项目 | Free Tier | Paid Tier |
|---|---|---|
| 文本输入 | 免费 | $0.75 / 1M tokens |
| 音频输入 | 免费 | $3.00 / 1M tokens,页面同时给出约 $0.005/分钟 |
| 图片 / 视频输入 | 免费 | $1.00 / 1M tokens,页面同时给出约 $0.002/分钟 |
| 文本输出 | 免费 | $4.50 / 1M tokens |
| 音频输出 | 免费 | $12.00 / 1M tokens,页面同时给出约 $0.018/分钟 |
| Google Search Grounding | 支持 | 每月共享 5,000 次免费搜索请求,之后 $14 / 1,000 次搜索请求 |
不要简单用“0.005 + 0.018 = 0.023 美元/分钟”去估算一场长期对话的最终账单。Google Live API 最佳实践明确指出,Live session 会维护有效上下文窗口,历史 token 会在后续 turn 中重新处理和计费,导致长会话的每轮成本上升。
更合理的成本控制方法是:
- 减少不必要视频帧。 视觉变化不明显时暂停发送。
- 启用 context window compression。 避免无限累积历史。
- 控制工具返回体大小。 ERP 查询不要把完整数据库行全部回传。
- 用转写做业务日志,而不是重复把字幕重新塞回上下文。
- 把长流程拆成阶段。 结束一个业务任务后,可在应用层总结状态再进入下一阶段。
- 为每个 session 设置预算和最长持续时间。
具体 Rate Limit 会随项目、账户和付费层级变化,本文不虚构固定 RPM/RPD 数值,实际以 Google AI Studio / Gemini API 控制台显示为准。
客户端直连与 Ephemeral Token
如果网页直接从浏览器连接 Gemini Live API,最大的安全问题是 API Key。
不要把标准长期 API Key 写进前端 JavaScript。
Google 专门为 Live API 提供 ephemeral token。推荐架构是:
Browser
│ 1. 登录你的业务后端
▼
Your Backend
│ 2. 使用服务器端 API Key 请求短期 token
▼
Gemini Auth Token Service
│ 3. 返回短期 token
▼
Browser
│ 4. 使用 ephemeral token 直接建立 Live WebSocket
▼
Gemini Live API
官方文档当前给出的默认值包括:新 token 默认需要在约 1 分钟内用于启动新 session,默认消息有效时间约 30 分钟;还可以把 token 限定到指定模型和 session 配置。
需要特别注意:ephemeral token 当前仍标记为 Preview,并且仅适用于 Live API / v1beta 路径。它降低了标准 API Key 暴露风险,但不能替代你自己的用户身份认证。
Gemini 3.8 Live 与 Extended Thinking 怎么选
Google 同时发布了:
gemini-3.8-livegemini-3.8-live-extended-thinking
可以按任务特征选择:
| 需求 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 低延迟语音客服 | 推荐 | 可能增加复杂度 |
| 简单 CRM / 订单工具 | 推荐 | 通常没必要 |
| 实时视觉问答 | 推荐 | 复杂分析时考虑 |
| 多步骤后台推理 | 可用 | 更适合 |
| 边说边做复杂计划 | 可用 | 更适合 |
| Function Calling | 支持 | 支持,官方模型页标注 Async only |
| Thinking 配置 | 不支持 thinking_level | 支持背景推理配置 |
标准版最适合“响应速度第一”的 Agent。Extended Thinking 更适合用户愿意等待后台推理、但又希望语音界面保持自然反馈的复杂任务。
从 Gemini 3.1 Flash Live 迁移的注意事项
如果已有旧项目,不要只改模型字符串。
迁移检查至少包括:
- 将模型改为
gemini-3.8-live。 - 删除标准 3.8 Live 中的
thinking_level/thinking_config。 - 检查工具声明,建议显式标记
NON_BLOCKING或需要兼容时明确BLOCKING。 - 检查工具 FunctionResponse 的 scheduling。
- 检查
send_client_content的 role 和turn_complete行为。 - 删除旧的
enable_affective_dialog配置,因为 Gemini 3.8 Live 已移除该选项。 - 不要设置
proactive_audio: false,模型页说明 proactive audio 现在永久启用,关闭会报错。 - 重新评估视频抽帧,因为 3.8 Live 默认 turn coverage 会覆盖视频活动。
- 如果 UI 需要文字输出,启用 output audio transcription。
- 做一次真实网络断线与 session resumption 测试。
升级前最好把旧模型路径保留为 feature flag,至少在初期部署阶段能够快速回退。
风险、限制与注意事项
1. 模型 Stable 不代表所有外围能力都 Stable
Gemini 3.8 Live 本身已经 GA,但 Live API capabilities 页面仍标记 Preview,ephemeral token 也仍为 Preview。生产系统应把这些组件分别看待。
2. 浏览器直连必须处理凭证安全
前端只能拿短期 token,不应拥有长期 Gemini API Key。后端签发 ephemeral token 时还应绑定你自己的用户身份、会话权限和速率限制。
3. 工具调用必须做权限隔离
Live Agent 一旦接上 CRM、付款、门锁、邮件、数据库或生产系统,就不再只是聊天机器人。
对以下操作应加入人工审批或额外确认:
- 付款;
- 删除数据;
- 发布内容;
- 发送外部邮件;
- 修改账户或权限;
- 修改生产数据库;
- 控制真实设备;
- 调用不可逆 API。
4. Prompt Injection 同样存在
视觉帧、网页内容、搜索结果和工具返回值都可能携带恶意或误导性指令。不要让工具结果天然拥有“系统指令级”可信度。
5. 不要让 NON_BLOCKING 变成无限并发
异步不等于无限制。生产代码应限制:
- 同一 session 同时运行的工具数;
- 单工具超时;
- Retry 次数;
- 重复请求幂等;
- 外部 API QPS;
- 最大返回体;
- 用户取消后的任务清理。
6. 长会话需要成本监控
Live API 的上下文会积累。应监控每场会话持续时间、音频分钟数、视频帧数、工具调用次数、Google Search 次数和 token usage。
事实依据与来源
本文核心事实均优先使用 Google 官方资料核验:
- 官方已确认事实: Gemini 3.8 Live 于 2026 年 9 月 15 日 GA,稳定模型 ID 为
gemini-3.8-live。 - 官方模型参数: 输入支持文本、图片、音频、视频;输入 token 上限 131,072,输出上限 65,536;支持 Function Calling、Live API、Search Grounding,不支持 Code Execution、File Search、Structured Outputs 和 Batch API。
- 官方实时媒体规范: 音频输入为 16-bit / 16 kHz PCM;视频按 JPEG/PNG 帧发送,最高 1 FPS;原生音频输出为 24 kHz PCM。
- 官方异步工具机制: Gemini 3.8 Live 模型页说明
NON_BLOCKING已成为默认 Function Calling 模式;Live API Tool Use 文档给出了INTERRUPT、WHEN_IDLE、SILENT等 FunctionResponse 调度方式。 - 官方会话限制: 未压缩时纯音频 session 约 15 分钟、音频+视频约 2 分钟,可使用 context compression 和 session resumption 延长。
- 官方价格: 本文价格来自 Gemini Developer API pricing 页面,核验日期为 2026 年 9 月 19 日。
- 实施建议: 本文关于工具审批、幂等、预算限制、视频按变化抽帧、feature flag 回退等属于工程实施建议,并非 Google 官方强制要求。
- 尚需项目实测: 真实端到端延迟、并发上限、不同地区网络表现、具体 Rate Limit 和第三方工具响应时间需以你的项目账户与部署区域为准。
FAQ
Gemini 3.8 Live 是正式版还是 Preview?
gemini-3.8-live 模型本身已经是 Stable / GA,Google Release Notes 显示它于 2026 年 9 月 15 日正式发布。但截至 2026 年 9 月 19 日,Live API capabilities 文档仍带有 Preview 标识,ephemeral token 也仍是 Preview。因此可以进入生产评估,但仍建议锁定 SDK、准备回退和持续关注变更日志。
Gemini 3.8 Live 的模型 ID 是什么?
标准低延迟版本的模型 ID 是 gemini-3.8-live。需要更强后台推理的版本是 gemini-3.8-live-extended-thinking。如果从旧版迁移,不要继续使用 gemini-3.1-flash-live-preview 作为默认生产模型。
Gemini 3.8 Live 能同时处理语音和摄像头画面吗?
可以。官方模型页支持音频、视频、图片和文本输入。Live SDK 中视频不是上传完整 MP4,而是把 JPEG/PNG 图片帧持续发送,官方入门指南给出的最高帧率为 1 FPS。
Live API 能直接返回文本吗?
Gemini 3.8 Live 的原生实时回答以 AUDIO response modality 为主。如果界面需要文字,应开启输出音频转写;同样也可以获取输入语音转写。不要简单把标准实时音频会话配置成 TEXT 来替代原生语音链路。
Gemini 3.8 Live 支持异步 Function Calling 吗?
支持,而且这是 3.8 Live 相比旧 Live 模型的重要变化。模型页说明 NON_BLOCKING 已成为默认模式。生产代码仍建议显式声明,并为 FunctionResponse 设置 INTERRUPT、WHEN_IDLE 或 SILENT 等调度策略。
Gemini 3.8 Live 支持 MCP 吗?
Live API 的核心官方工具机制是 Function Calling 和 Google Search 等。你可以在自己的服务端把 MCP Server 封装成 Function Calling 的后端执行层,但不能把“支持 Function Calling”直接等同于“Live API 原生托管任意 MCP Server”。MCP 认证、权限、超时和结果转换仍需要应用侧实现。
Gemini 3.8 Live 怎么收费?
当前 Gemini Developer API 定价页显示:付费层文本输入 $0.75/1M tokens,音频输入 $3/1M tokens(页面同时给出约 $0.005/分钟),图片/视频输入 $1/1M tokens(约 $0.002/分钟),文本输出 $4.50/1M tokens,音频输出 $12/1M tokens(约 $0.018/分钟)。Live session 还会因为历史上下文重新处理产生复合成本,因此长会话实际账单不能只按单一每分钟价格乘时长估算。
前端网页能直接调用 Gemini 3.8 Live 吗?
可以使用客户端到服务器模式直接建立 WebSocket,但生产环境不应把标准 API Key 放到浏览器。Google 推荐使用 ephemeral token,由你自己的后端签发短期凭证,再让浏览器使用该 token 连接 Live API。
一个 Live 会话可以一直保持吗?
不做会话管理时不可以。官方文档给出的未压缩限制是纯音频约 15 分钟、音频+视频约 2 分钟,单个连接也有约 10 分钟生命周期。通过 context window compression、session resumption 和 GoAway 处理,可以把用户体验扩展为长期连续会话。
Gemini 3.8 Live 适合替代普通 Gemini API 吗?
不建议全面替代。它最适合实时语音、视觉和工具协同。如果只是写文章、总结文档、离线分析或批量任务,普通生成接口通常更简单,也更容易做并发和成本管理。
参考来源
- Google AI for Developers:Gemini 3.8 Live 模型页
- Google Gemini API Release Notes
- Gemini Live API Overview
- Get started with Gemini Live API using Google GenAI SDK
- Tool use with Live API
- Live API capabilities guide
- Session management with Live API
- Live API Ephemeral Tokens
- Live API Best Practices
- Gemini Developer API Pricing
工具选型与提示词资料
适合阅读工具评测、工具推荐、对比测评类文章后继续转化。