摘要: 腾讯于 2026 年 8 月 28 日开源 Hy4 preview,这是一款面向真实生产力任务的 MoE 文本大模型,拥有 770B 总参数、每 Token 激活 49B 参数、1M 上下文,并提供 BF16 与 FP8 权重、工具调用解析器、推理解析器及 OpenAI 兼容接口。本文给出从 vLLM/SGLang 私有化部署到 Coding Agent、Research Agent 和企业权限治理的完整方案。最重要的结论是:Hy4 preview 可以自托管,但“本地”更准确地说是企业 GPU 服务器或集群,而不是普通单卡电脑;FP8 权重约 760GB,官方生态参考配置使用 8×B200 或 4×B300。适合有高端 GPU 资源、数据本地化和长任务需求的团队先做 PoC,不建议在 Preview 阶段未经评测直接承载高风险生产操作。
核心结论
腾讯当前最新开源通用语言模型是 Hy4 preview。它适合构建 Coding、Research、文档分析和工具调用 Agent,但其超大权重决定了“本地 Agent”应按企业自托管集群理解,而不是桌面端轻量模型。
- 模型身份: 官方模型仓库为
tencent/Hy4-preview和tencent/Hy4-preview-FP8,采用 Apache 2.0 许可证。 - 核心规格: 770B 总参数、49B 激活参数、78 层、256 个路由专家加 1 个共享专家、每 Token 激活 Top-8 路由专家,标称上下文长度 1M。
- 部署门槛: BF16 权重约 1.5TB,MXFP8 权重约 760GB;参考配置不是消费级单卡,而是多张 B200、B300、GB300 或多节点 H200。
- Agent 能力: 官方 vLLM/SGLang 命令提供推理解析器、工具调用解析器与自动工具选择,可通过 OpenAI 兼容 API 接入代码、搜索、知识库和企业系统。
- 上线建议: 先把实际上下文限制在 128K~256K,建立工具白名单、参数校验、人工审批、引用验证和回归评测,再逐步扩大业务范围。
Hy4 preview 是什么
Hy4 preview 是腾讯 Hy Team 推出的新一代 MoE 旗舰模型。腾讯官方将它定位于软件工程、办公分析、游戏开发和科学研究等真实生产力任务。与“参数规模越大越好”的简单叙事不同,它的价值主要来自四个方面:长任务规划、跨文件上下文、工具调用和可私有化部署。
官方仓库给出的骨干规格如下:
| 项目 | Hy4 preview 官方规格 | 对 Agent 的意义 |
|---|---|---|
| 架构 | Mixture-of-Experts | 每次只激活部分专家,降低相对计算量 |
| 总参数 | 770B | 权重存储与多卡通信要求很高 |
| 激活参数 | 49B/Token | 推理计算量显著低于全量 770B,但仍非轻量模型 |
| 层数 | 78 | 支撑深层推理与任务处理 |
| 路由专家 | 256,Top-8 激活 | 由路由机制选择专家 |
| 共享专家 | 1 | 提供通用能力路径 |
| 上下文 | 1M | 可处理超长代码库或研究材料,但实际长度受 KV Cache 限制 |
| 原生 MTP | 10B 总量、约 0.7B 激活 | 用于 speculative decoding |
| 许可证 | Apache 2.0 | 可在许可证范围内商用和二次开发 |
架构还采用 Gated DeepSeek Sparse Attention、IndexCache 和 iHC 残差路径。普通使用者不需要手动实现这些组件,但部署框架必须支持相应内核、推理解析器和工具调用格式。直接使用通用旧版 vLLM 镜像,可能无法正确加载或解析模型输出。
“本地部署”为什么不等于个人电脑运行
Hy4 preview 是开放权重模型,但开放权重不等于低硬件门槛。SGLang 的官方部署文档估算 BF16 权重约 1.5TB、MXFP8 权重约 760GB。即使不考虑 KV Cache、CUDA Graph、运行时缓存和并发,模型权重本身也已经超过普通工作站显存。
参考硬件表如下:
| GPU | 单卡显存 | FP8 参考部署 | BF16 参考部署 | 建议上下文 |
|---|---|---|---|---|
| H200 | 141GB | 不支持该 MXFP8 内核路径 | TP16、2×8 节点 | 131K |
| B200 | 192GB | TP8、单节点 | TP16、2×8 节点 | 262K |
| B300 | 288GB | TP4、单节点 | TP8、单节点 | 262K |
| GB300 | 288GB | TP4、单节点 | TP8、2×4 节点 | 262K |
这张表来自 SGLang Hy4 部署文档,是特定软件版本和内核路径下的参考,而不是通用 SLA。1M 是模型最大位置规格,不代表任意硬件都能在高并发下装入 1M KV Cache。企业应从 32K、64K、128K 或 256K 开始压测,并把输入长度、最大输出、并发数和缓存占用纳入容量规划。
因此,本文所说“本地 Agent”包括:企业机房 GPU 集群、私有云 GPU 节点、专属 VPC 推理服务或受控裸金属服务器。若只有 24GB、48GB 或 80GB 单卡,建议选择更小的开源模型,或通过合规 API 调用 Hy4,而不是试图依赖 CPU Offload 获得可用生产性能。
企业本地 Agent 总体架构
推荐把 Hy4 preview 放在推理层,而不是让模型直接持有 Git、数据库、搜索或办公系统凭据。上层 Agent Gateway 负责身份、会话、工具注册、预算、审批和审计;下层 vLLM/SGLang 只提供模型推理。

架构建议分为六层:
- 入口层: IDE、Web、企业微信、API 和任务队列。
- Agent 编排层: 目标拆解、上下文压缩、工具路由、重试和 Checkpoint。
- 推理层: Hy4 preview FP8/BF16、vLLM 或 SGLang、多卡张量并行。
- 工具层: Git、Sandbox、搜索、RAG、数据库只读代理、文档生成器。
- 状态层: 会话、任务状态、引用、代码 Diff、评测与审计日志。
- 治理层: SSO、RBAC、密钥隔离、Prompt Injection 防护、人工审批和成本配额。
模型永远不应直接读取宿主机 .env 或云平台主账号密钥。每个工具使用独立服务身份和最小权限 Token;删除、合并、发布、发送邮件、修改生产数据等动作必须进入审批队列。
使用 vLLM 部署 Hy4 preview FP8
腾讯官方仓库推荐生产服务使用 vLLM 或 SGLang,并给出了专用预构建镜像。以下示例适合支持该 FP8 路径的 Blackwell GPU 集群,不能照搬到 H200。
第一步:准备节点
- 安装受支持的 NVIDIA 驱动、Container Toolkit 与 Docker。
- 确认所有 GPU 能被
nvidia-smi正确识别。 - 为模型缓存准备超过权重体积的高速磁盘,并预留临时空间。
- 配置内部镜像仓库、模型文件校验与出口白名单。
- 不要把 Hugging Face Token 写进镜像、Git 或命令历史。
第二步:启动 OpenAI 兼容服务
docker run --gpus all \
-p 8000:8000 \
--ipc=host \
-e VLLM_ENABLE_HPC_OPS=1 \
-v /YOUR_MODEL_CACHE:/root/.cache/huggingface \
vllm/vllm-openai:hy4-preview \
tencent/Hy4-preview-FP8 \
--tensor-parallel-size 8 \
--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
--attention-backend FLASHMLA_SPARSE \
--tool-call-parser hy_v4 \
--reasoning-parser hy_v4 \
--enable-auto-tool-choice \
--port 8000 \
--served-model-name hy4-preview
这是官方参考命令的整理版本。生产环境应把 8000 端口放在内部负载均衡后,增加 TLS、鉴权、并发限制、请求大小限制和健康检查,禁止直接暴露公网。
第三步:验证 API
from openai import OpenAI
client = OpenAI(
base_url="http://YOUR_INTERNAL_HOST:8000/v1",
api_key="YOUR_INTERNAL_GATEWAY_TOKEN",
)
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "system", "content": "你是企业研发助手,只能基于已授权工具工作。"},
{"role": "user", "content": "分析这个测试失败,并给出最小修复方案。"},
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
官方推荐 temperature=0.9、top_p=1.0。默认推理深度为 high;若是分类、格式转换或简单抽取,可通过额外模板参数请求 no_think,减少不必要的长推理。参数仍需针对企业任务实测,不应把推荐采样值当成所有场景的最佳值。
使用 SGLang 部署
SGLang 提供 x86 和 Arm 多架构预构建镜像。官方参考命令如下:
docker run --gpus all --ipc=host -p 8000:8000 \
-v /YOUR_MODEL_CACHE:/root/.cache/huggingface \
lmsysorg/sglang:hy4-preview \
python3 -m sglang.launch_server \
--model tencent/Hy4-preview-FP8 \
--tp-size 8 \
--reasoning-parser auto \
--tool-call-parser auto \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--context-length 262144 \
--port 8000 \
--served-model-name hy4-preview
SGLang 文档提示,Hy4 的 MXFP8 内核要求 SM100+;H200 应使用 BF16。长时间混合 Agent 负载下,如果 CUDA Graph 路径出现不稳定,可在验证后考虑 --disable-cuda-graph 回退到 eager decode,但这属于故障排查措施,可能影响性能。
Coding Agent 实战
Hy4 preview 官方强调代码理解、规划、调试、验证和长周期开发任务。要把模型能力变成可审计 Coding Agent,需要把代码执行放进临时 Sandbox,并将“读、改、测、提交”拆成权限不同的工具。
工具定义
[
{
"type": "function",
"function": {
"name": "read_repository_file",
"description": "读取当前仓库允许目录中的文本文件",
"parameters": {
"type": "object",
"properties": {"path": {"type": "string"}},
"required": ["path"],
"additionalProperties": false
}
}
},
{
"type": "function",
"function": {
"name": "run_test_command",
"description": "在隔离容器执行白名单测试命令",
"parameters": {
"type": "object",
"properties": {
"command_id": {"type": "string", "enum": ["unit", "lint", "typecheck"]},
"timeout_seconds": {"type": "integer", "minimum": 10, "maximum": 900}
},
"required": ["command_id"],
"additionalProperties": false
}
}
}
]
不要允许模型传入任意 shell 字符串。command_id 应在服务端映射到固定命令,路径应经过规范化并阻止 ../、符号链接逃逸和敏感目录访问。
执行闭环
- 从 Issue 或人工目标生成任务 ID 与独立 Git worktree。
- 只读扫描代码、构建文件和测试,输出修改计划。
- 人工或策略引擎确认范围后允许写入工作区。
- Agent 生成最小 Patch,运行 lint、单测和相关集成测试。
- 测试失败时最多重试两次,之后转人工,不无限循环。
- 输出 Diff、测试证据、风险和回滚命令。
- 创建候选 PR;合并、发布和生产部署保留人工审批。
适合的任务包括测试补齐、明确 Bug 修复、API 客户端生成、代码解释和受控重构。不适合让 Preview 模型单独决定支付逻辑、身份权限、数据库删除或安全策略。
Research Agent 实战
1M 上下文使 Hy4 preview 有潜力处理大量论文、报告和代码,但 Research Agent 的可靠性取决于检索与引用链,而不是上下文长度本身。正确流程是先检索、去重和切分,再让模型比较证据,最后逐条验证引用。

Research Agent 的系统约束可写为:
你是企业研究助手。
1. 只把检索工具返回的内容视为来源,不把记忆当成引用。
2. 每个关键结论必须关联 source_id 和原文片段位置。
3. 来源冲突时并列呈现,不自行消除矛盾。
4. 不得编造 DOI、作者、发布日期、统计值或访问链接。
5. 证据不足时输出“待核实”,并说明需要什么资料。
6. 涉及医疗、法律、财务或生产决策时转人工专家审批。
建议工具集包括 search_catalog、fetch_document、extract_table、run_python_analysis、verify_citation 和 export_report。网页正文、PDF 和用户上传文件均属于不可信数据,不能允许其中的 Prompt Injection 改变系统规则或调用敏感工具。
Coding、Research 与企业办公如何选配置
| 场景 | 推理模式 | 推荐上下文起点 | 主要工具 | 关键验证 |
|---|---|---|---|---|
| Coding Agent | high | 64K~128K | Git、Sandbox、测试 | Diff 与测试通过 |
| Research Agent | high | 128K~256K | 搜索、RAG、Python | 引用逐条可追溯 |
| 文档抽取 | no_think | 16K~64K | OCR、Schema 校验 | 字段完整率 |
| 企业问答 | 按复杂度路由 | 16K~64K | RAG、权限过滤 | 答案与 ACL 一致 |
| 长报告生成 | high | 64K~256K | 检索、表格、导出 | 事实、数字和引用检查 |
上下文建议属于实施起点,不是官方性能保证。盲目把整个代码库或全部知识库塞进 1M 上下文,会增加延迟、KV Cache 和噪声。更好的策略是 Repo Map、分层检索、摘要 Checkpoint 与按需读取。
企业安全与权限治理
第一道边界是身份:用户、Agent、工具和服务账户必须可区分。第二道边界是授权:模型只能选择已注册工具,真正的业务权限仍由工具服务端判断。第三道边界是审批:高风险动作必须展示目标、参数、影响范围和回滚方案。第四道边界是审计:保留用户输入摘要、模型版本、Prompt 版本、工具调用、结果哈希和审批人。
建议采用以下安全门:
- 模型服务仅在内网开放,通过 Gateway 鉴权;
- 每个租户、部门和项目使用独立命名空间;
- 代码执行容器无生产网络,默认只读根文件系统;
- 工具参数使用 JSON Schema 严格校验;
- Prompt Injection 检测只作为辅助,真正安全依赖权限隔离;
- 生产数据库默认只读,写操作使用独立审批服务;
- 密钥由 Vault 动态签发,短时有效,不进入模型上下文;
- 日志脱敏并设置保留期限,不保存完整敏感 Prompt;
- 对模型、镜像、权重和依赖做版本锁定与哈希校验。
更多企业 Agent 设计可以通过 AI Stack Nav 的 AI Agent 教程 和 MCP 安全治理内容 延伸阅读。
评测与上线流程
Hy4 preview 仍是早期版本。官方明确指出,它可能在复杂任务上花费过长时间推理,并存在过度验证倾向。因此上线前必须用企业自己的数据评测,而不是只引用公开 Benchmark。
- 选择 50~200 个真实任务,覆盖正常、边界、恶意输入和工具失败。
- 固定模型权重、镜像、Prompt、工具 Schema 和采样参数。
- Coding 评测记录测试通过率、回归率、Patch 接受率和越权调用率。
- Research 评测记录引用准确率、事实支持率、来源覆盖率和幻觉率。
- 压测首 Token 延迟、输出速度、并发、显存、长上下文和故障恢复。
- 先以只读或建议模式上线,再开放工作区写入。
- 设置回滚:出现越权、错误率上升或模型版本变化时切回旧模型。
腾讯公布的内部盲测涉及 163 名专家和 203 个工程任务,Hy4 preview 的平均评分为 2.99,并略高于腾讯所比较的 GLM 5.3 与 Kimi K3。该数据属于官方内部评测,不等于第三方独立验证,也不能替代你的业务验收。
成本与容量估算
开源权重没有按 Token 的模型许可费,但企业仍需承担 GPU、存储、网络、运维、监控和人力成本。估算公式可以写成:
月成本 = GPU节点小时单价 × 节点数 × 运行小时
+ 模型与日志存储
+ 内部网络与跨区流量
+ 平台运维和评测人力
若业务量低或任务间歇性强,购买多卡集群可能不经济;可先使用受控 API 验证价值,再决定私有化。若数据不能出域、调用稳定且 GPU 利用率较高,自托管的治理和边际成本优势才更明显。腾讯云或第三方 API 的实时价格、地区和额度并非本文核心,且会变化,应以调用当天控制台为准。
常见故障排查
模型无法装入显存
先确认选择的是 FP8 还是 BF16、GPU 架构是否匹配、TP 数量是否正确。不要只计算权重大小,还要预留 KV Cache、CUDA Graph 和运行时空间。降低上下文和并发只能减少缓存,无法让明显放不下的权重凭空装入。
工具调用没有被解析
检查是否使用 Hy4 专用 tool-call-parser,是否启用自动工具选择,工具 Schema 是否合法,以及客户端是否保留完整结构化字段。不要从模型文本中用正则提取命令后直接执行。
长上下文请求被拒绝
Speculative decoding 会预留额外 draft Token;有效预算不是简单的 Prompt 加输出等于上下文上限。缩短输入或最大输出,并检查框架的上下文、KV Cache 和并发配置。
Agent 反复验证、任务不结束
这是官方披露的已知倾向之一。为任务设置最大步骤、最大工具调用、超时、预算和完成判定;两次修复仍失败时转人工。简单任务可尝试 no_think。
风险、限制与注意事项
Hy4 preview 是文本模型,不应在没有独立 OCR/视觉模型的情况下宣称原生理解图片或视频。Preview 表示能力、接口和最佳实践仍可能快速变化。模型可能生成错误代码、虚构引用、选择错误工具或被不可信内容诱导。
此外,FP8 路径对 GPU 架构和内核有具体要求;“支持 1M 上下文”不等于所有部署都能以 1M、多人并发稳定运行。开源许可证允许广泛使用,但企业仍需自行审查数据权利、第三方依赖、生成内容责任和行业合规。
事实依据与来源
- 官方事实: 腾讯发布页日期为 2026 年 8 月 28 日;GitHub 官方仓库确认 Hy4 preview 的参数、架构、1M 上下文、权重链接、推荐参数、工具解析和 Apache 2.0 许可证。
- 官方生态文档: vLLM Recipe 与 SGLang Cookbook 提供多卡配置、权重体积、GPU 兼容性和上下文容量建议。
- 官方测试: 163 名内部专家、203 个工程任务的盲测数据由腾讯发布,不属于独立第三方 Benchmark。
- 编辑判断: Hy4 preview 是当前适合本文标题的“腾讯最新开源 AI 模型”;“本地”应解释为自托管服务器或集群。
- 实施建议: 六层 Agent 架构、工具白名单、评测集、审批门和上下文起点来自工程实践,需要按企业环境验证。
- 待核实: 具体吞吐、稳定并发、GPU 小时成本和业务准确率取决于硬件、框架版本、上下文和任务,不应脱离实测给出保证。
FAQ
腾讯最新开源通用模型叫什么?
截至 2026 年 9 月 2 日,本文核验到的最新腾讯开源通用语言模型是 Hy4 preview,模型仓库为 tencent/Hy4-preview,另有 tencent/Hy4-preview-FP8 量化权重。
Hy4 preview 能在个人电脑上运行吗?
普通个人电脑不现实。BF16 权重约 1.5TB,FP8 权重约 760GB,参考部署使用多张数据中心 GPU。个人用户应选择小模型或 API;本文“本地”指企业自托管集群。
Hy4 preview 支持多少上下文?
模型规格为 1M 上下文,但实际可用长度受 GPU 显存、KV Cache、并发和框架限制。官方生态配置对常见多卡组合建议 131K 或 262K,而不是一律开启 1M。
Hy4 preview 支持 Function Calling 吗?
支持面向 Agent 的工具调用解析。官方 vLLM 命令包含 --tool-call-parser hy_v4 和 --enable-auto-tool-choice,SGLang 可使用自动解析器。业务端仍必须验证参数和权限。
Hy4 preview 是多模态模型吗?
本文核验的 Hy4 preview 是文本生成模型。图片、扫描 PDF 或视频场景需要额外的 OCR、视觉模型或解析器,不能把外部组件能力写成 Hy4 原生能力。
Hy4 preview 可以商用吗?
模型仓库使用 Apache 2.0 许可证,通常允许商业使用与修改,但企业仍应由法务审查许可证、NOTICE、数据来源、第三方组件和具体分发方式。
vLLM 和 SGLang 应该选哪个?
两者都有官方参考部署。已有 OpenAI 兼容推理平台和 vLLM 运维经验的团队可优先 vLLM;需要 SGLang 的长上下文、调度或特定内核能力时选择 SGLang。最终应以同一硬件上的稳定性和吞吐实测决定。
Hy4 preview 是否适合直接上生产?
不建议未经验证直接承载高风险生产任务。它是 Preview,官方披露了推理过长和过度验证等已知问题。应先只读 PoC,再开放受控写入,并为发布、删除和生产变更设置人工审批。
参考来源
- 腾讯官方:Tencent Releases and Open-Sources Tencent Hy4 preview
- 腾讯 Hy4 preview 官方 GitHub 仓库
- Hugging Face:tencent/Hy4-preview
- Hugging Face:tencent/Hy4-preview-FP8
- vLLM Recipes:Hy4-preview Usage Guide
- SGLang Documentation:Hy4 preview
环境配置与 Docker 工作流
适合阅读安装部署、本地配置、服务器搭建和自动化流程类文章后继续转化。