腾讯Hy4 preview本地Agent教程封面,展示Coding、Research和企业GPU集群部署

腾讯最新开源 AI 模型本地 Agent:Coding、Research 与企业部署实战

腾讯 Hy4 preview 本地 Agent 完整教程,覆盖模型规格、多卡部署、Coding、Research、工具调用与企业安全治理。

摘要: 腾讯于 2026 年 8 月 28 日开源 Hy4 preview,这是一款面向真实生产力任务的 MoE 文本大模型,拥有 770B 总参数、每 Token 激活 49B 参数、1M 上下文,并提供 BF16 与 FP8 权重、工具调用解析器、推理解析器及 OpenAI 兼容接口。本文给出从 vLLM/SGLang 私有化部署到 Coding Agent、Research Agent 和企业权限治理的完整方案。最重要的结论是:Hy4 preview 可以自托管,但“本地”更准确地说是企业 GPU 服务器或集群,而不是普通单卡电脑;FP8 权重约 760GB,官方生态参考配置使用 8×B200 或 4×B300。适合有高端 GPU 资源、数据本地化和长任务需求的团队先做 PoC,不建议在 Preview 阶段未经评测直接承载高风险生产操作。

核心结论

腾讯当前最新开源通用语言模型是 Hy4 preview。它适合构建 Coding、Research、文档分析和工具调用 Agent,但其超大权重决定了“本地 Agent”应按企业自托管集群理解,而不是桌面端轻量模型。

  • 模型身份: 官方模型仓库为 tencent/Hy4-previewtencent/Hy4-preview-FP8,采用 Apache 2.0 许可证。
  • 核心规格: 770B 总参数、49B 激活参数、78 层、256 个路由专家加 1 个共享专家、每 Token 激活 Top-8 路由专家,标称上下文长度 1M。
  • 部署门槛: BF16 权重约 1.5TB,MXFP8 权重约 760GB;参考配置不是消费级单卡,而是多张 B200、B300、GB300 或多节点 H200。
  • Agent 能力: 官方 vLLM/SGLang 命令提供推理解析器、工具调用解析器与自动工具选择,可通过 OpenAI 兼容 API 接入代码、搜索、知识库和企业系统。
  • 上线建议: 先把实际上下文限制在 128K~256K,建立工具白名单、参数校验、人工审批、引用验证和回归评测,再逐步扩大业务范围。

Hy4 preview 是什么

Hy4 preview 是腾讯 Hy Team 推出的新一代 MoE 旗舰模型。腾讯官方将它定位于软件工程、办公分析、游戏开发和科学研究等真实生产力任务。与“参数规模越大越好”的简单叙事不同,它的价值主要来自四个方面:长任务规划、跨文件上下文、工具调用和可私有化部署。

官方仓库给出的骨干规格如下:

项目Hy4 preview 官方规格对 Agent 的意义
架构Mixture-of-Experts每次只激活部分专家,降低相对计算量
总参数770B权重存储与多卡通信要求很高
激活参数49B/Token推理计算量显著低于全量 770B,但仍非轻量模型
层数78支撑深层推理与任务处理
路由专家256,Top-8 激活由路由机制选择专家
共享专家1提供通用能力路径
上下文1M可处理超长代码库或研究材料,但实际长度受 KV Cache 限制
原生 MTP10B 总量、约 0.7B 激活用于 speculative decoding
许可证Apache 2.0可在许可证范围内商用和二次开发

架构还采用 Gated DeepSeek Sparse Attention、IndexCache 和 iHC 残差路径。普通使用者不需要手动实现这些组件,但部署框架必须支持相应内核、推理解析器和工具调用格式。直接使用通用旧版 vLLM 镜像,可能无法正确加载或解析模型输出。

“本地部署”为什么不等于个人电脑运行

Hy4 preview 是开放权重模型,但开放权重不等于低硬件门槛。SGLang 的官方部署文档估算 BF16 权重约 1.5TB、MXFP8 权重约 760GB。即使不考虑 KV Cache、CUDA Graph、运行时缓存和并发,模型权重本身也已经超过普通工作站显存。

参考硬件表如下:

GPU单卡显存FP8 参考部署BF16 参考部署建议上下文
H200141GB不支持该 MXFP8 内核路径TP16、2×8 节点131K
B200192GBTP8、单节点TP16、2×8 节点262K
B300288GBTP4、单节点TP8、单节点262K
GB300288GBTP4、单节点TP8、2×4 节点262K

这张表来自 SGLang Hy4 部署文档,是特定软件版本和内核路径下的参考,而不是通用 SLA。1M 是模型最大位置规格,不代表任意硬件都能在高并发下装入 1M KV Cache。企业应从 32K、64K、128K 或 256K 开始压测,并把输入长度、最大输出、并发数和缓存占用纳入容量规划。

因此,本文所说“本地 Agent”包括:企业机房 GPU 集群、私有云 GPU 节点、专属 VPC 推理服务或受控裸金属服务器。若只有 24GB、48GB 或 80GB 单卡,建议选择更小的开源模型,或通过合规 API 调用 Hy4,而不是试图依赖 CPU Offload 获得可用生产性能。

企业本地 Agent 总体架构

推荐把 Hy4 preview 放在推理层,而不是让模型直接持有 Git、数据库、搜索或办公系统凭据。上层 Agent Gateway 负责身份、会话、工具注册、预算、审批和审计;下层 vLLM/SGLang 只提供模型推理。

腾讯Hy4 preview企业本地Agent架构图,展示用户入口、Agent Gateway、Hy4推理集群、Coding和Research工具及安全治理
模型服务与工具权限分离,由 Agent Gateway 统一处理身份、审批、状态和审计。

架构建议分为六层:

  1. 入口层: IDE、Web、企业微信、API 和任务队列。
  2. Agent 编排层: 目标拆解、上下文压缩、工具路由、重试和 Checkpoint。
  3. 推理层: Hy4 preview FP8/BF16、vLLM 或 SGLang、多卡张量并行。
  4. 工具层: Git、Sandbox、搜索、RAG、数据库只读代理、文档生成器。
  5. 状态层: 会话、任务状态、引用、代码 Diff、评测与审计日志。
  6. 治理层: SSO、RBAC、密钥隔离、Prompt Injection 防护、人工审批和成本配额。

模型永远不应直接读取宿主机 .env 或云平台主账号密钥。每个工具使用独立服务身份和最小权限 Token;删除、合并、发布、发送邮件、修改生产数据等动作必须进入审批队列。

使用 vLLM 部署 Hy4 preview FP8

腾讯官方仓库推荐生产服务使用 vLLM 或 SGLang,并给出了专用预构建镜像。以下示例适合支持该 FP8 路径的 Blackwell GPU 集群,不能照搬到 H200。

第一步:准备节点

  1. 安装受支持的 NVIDIA 驱动、Container Toolkit 与 Docker。
  2. 确认所有 GPU 能被 nvidia-smi 正确识别。
  3. 为模型缓存准备超过权重体积的高速磁盘,并预留临时空间。
  4. 配置内部镜像仓库、模型文件校验与出口白名单。
  5. 不要把 Hugging Face Token 写进镜像、Git 或命令历史。

第二步:启动 OpenAI 兼容服务

docker run --gpus all \
  -p 8000:8000 \
  --ipc=host \
  -e VLLM_ENABLE_HPC_OPS=1 \
  -v /YOUR_MODEL_CACHE:/root/.cache/huggingface \
  vllm/vllm-openai:hy4-preview \
  tencent/Hy4-preview-FP8 \
  --tensor-parallel-size 8 \
  --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
  --attention-backend FLASHMLA_SPARSE \
  --tool-call-parser hy_v4 \
  --reasoning-parser hy_v4 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy4-preview

这是官方参考命令的整理版本。生产环境应把 8000 端口放在内部负载均衡后,增加 TLS、鉴权、并发限制、请求大小限制和健康检查,禁止直接暴露公网。

第三步:验证 API

from openai import OpenAI

client = OpenAI(
    base_url="http://YOUR_INTERNAL_HOST:8000/v1",
    api_key="YOUR_INTERNAL_GATEWAY_TOKEN",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "system", "content": "你是企业研发助手,只能基于已授权工具工作。"},
        {"role": "user", "content": "分析这个测试失败,并给出最小修复方案。"},
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

官方推荐 temperature=0.9top_p=1.0。默认推理深度为 high;若是分类、格式转换或简单抽取,可通过额外模板参数请求 no_think,减少不必要的长推理。参数仍需针对企业任务实测,不应把推荐采样值当成所有场景的最佳值。

使用 SGLang 部署

SGLang 提供 x86 和 Arm 多架构预构建镜像。官方参考命令如下:

docker run --gpus all --ipc=host -p 8000:8000 \
  -v /YOUR_MODEL_CACHE:/root/.cache/huggingface \
  lmsysorg/sglang:hy4-preview \
  python3 -m sglang.launch_server \
  --model tencent/Hy4-preview-FP8 \
  --tp-size 8 \
  --reasoning-parser auto \
  --tool-call-parser auto \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --context-length 262144 \
  --port 8000 \
  --served-model-name hy4-preview

SGLang 文档提示,Hy4 的 MXFP8 内核要求 SM100+;H200 应使用 BF16。长时间混合 Agent 负载下,如果 CUDA Graph 路径出现不稳定,可在验证后考虑 --disable-cuda-graph 回退到 eager decode,但这属于故障排查措施,可能影响性能。

Coding Agent 实战

Hy4 preview 官方强调代码理解、规划、调试、验证和长周期开发任务。要把模型能力变成可审计 Coding Agent,需要把代码执行放进临时 Sandbox,并将“读、改、测、提交”拆成权限不同的工具。

工具定义

[
  {
    "type": "function",
    "function": {
      "name": "read_repository_file",
      "description": "读取当前仓库允许目录中的文本文件",
      "parameters": {
        "type": "object",
        "properties": {"path": {"type": "string"}},
        "required": ["path"],
        "additionalProperties": false
      }
    }
  },
  {
    "type": "function",
    "function": {
      "name": "run_test_command",
      "description": "在隔离容器执行白名单测试命令",
      "parameters": {
        "type": "object",
        "properties": {
          "command_id": {"type": "string", "enum": ["unit", "lint", "typecheck"]},
          "timeout_seconds": {"type": "integer", "minimum": 10, "maximum": 900}
        },
        "required": ["command_id"],
        "additionalProperties": false
      }
    }
  }
]

不要允许模型传入任意 shell 字符串。command_id 应在服务端映射到固定命令,路径应经过规范化并阻止 ../、符号链接逃逸和敏感目录访问。

执行闭环

  1. 从 Issue 或人工目标生成任务 ID 与独立 Git worktree。
  2. 只读扫描代码、构建文件和测试,输出修改计划。
  3. 人工或策略引擎确认范围后允许写入工作区。
  4. Agent 生成最小 Patch,运行 lint、单测和相关集成测试。
  5. 测试失败时最多重试两次,之后转人工,不无限循环。
  6. 输出 Diff、测试证据、风险和回滚命令。
  7. 创建候选 PR;合并、发布和生产部署保留人工审批。

适合的任务包括测试补齐、明确 Bug 修复、API 客户端生成、代码解释和受控重构。不适合让 Preview 模型单独决定支付逻辑、身份权限、数据库删除或安全策略。

Research Agent 实战

1M 上下文使 Hy4 preview 有潜力处理大量论文、报告和代码,但 Research Agent 的可靠性取决于检索与引用链,而不是上下文长度本身。正确流程是先检索、去重和切分,再让模型比较证据,最后逐条验证引用。

腾讯Hy4 preview Coding与Research Agent工作流,展示任务输入、检索或代码工具、模型推理、验证、人工审批与审计闭环
Coding 通过测试验证,Research 通过引用验证,高风险动作统一进入人工审批。

Research Agent 的系统约束可写为:

你是企业研究助手。
1. 只把检索工具返回的内容视为来源,不把记忆当成引用。
2. 每个关键结论必须关联 source_id 和原文片段位置。
3. 来源冲突时并列呈现,不自行消除矛盾。
4. 不得编造 DOI、作者、发布日期、统计值或访问链接。
5. 证据不足时输出“待核实”,并说明需要什么资料。
6. 涉及医疗、法律、财务或生产决策时转人工专家审批。

建议工具集包括 search_catalogfetch_documentextract_tablerun_python_analysisverify_citationexport_report。网页正文、PDF 和用户上传文件均属于不可信数据,不能允许其中的 Prompt Injection 改变系统规则或调用敏感工具。

Coding、Research 与企业办公如何选配置

场景推理模式推荐上下文起点主要工具关键验证
Coding Agenthigh64K~128KGit、Sandbox、测试Diff 与测试通过
Research Agenthigh128K~256K搜索、RAG、Python引用逐条可追溯
文档抽取no_think16K~64KOCR、Schema 校验字段完整率
企业问答按复杂度路由16K~64KRAG、权限过滤答案与 ACL 一致
长报告生成high64K~256K检索、表格、导出事实、数字和引用检查

上下文建议属于实施起点,不是官方性能保证。盲目把整个代码库或全部知识库塞进 1M 上下文,会增加延迟、KV Cache 和噪声。更好的策略是 Repo Map、分层检索、摘要 Checkpoint 与按需读取。

企业安全与权限治理

第一道边界是身份:用户、Agent、工具和服务账户必须可区分。第二道边界是授权:模型只能选择已注册工具,真正的业务权限仍由工具服务端判断。第三道边界是审批:高风险动作必须展示目标、参数、影响范围和回滚方案。第四道边界是审计:保留用户输入摘要、模型版本、Prompt 版本、工具调用、结果哈希和审批人。

建议采用以下安全门:

  • 模型服务仅在内网开放,通过 Gateway 鉴权;
  • 每个租户、部门和项目使用独立命名空间;
  • 代码执行容器无生产网络,默认只读根文件系统;
  • 工具参数使用 JSON Schema 严格校验;
  • Prompt Injection 检测只作为辅助,真正安全依赖权限隔离;
  • 生产数据库默认只读,写操作使用独立审批服务;
  • 密钥由 Vault 动态签发,短时有效,不进入模型上下文;
  • 日志脱敏并设置保留期限,不保存完整敏感 Prompt;
  • 对模型、镜像、权重和依赖做版本锁定与哈希校验。

更多企业 Agent 设计可以通过 AI Stack Nav 的 AI Agent 教程MCP 安全治理内容 延伸阅读。

评测与上线流程

Hy4 preview 仍是早期版本。官方明确指出,它可能在复杂任务上花费过长时间推理,并存在过度验证倾向。因此上线前必须用企业自己的数据评测,而不是只引用公开 Benchmark。

  1. 选择 50~200 个真实任务,覆盖正常、边界、恶意输入和工具失败。
  2. 固定模型权重、镜像、Prompt、工具 Schema 和采样参数。
  3. Coding 评测记录测试通过率、回归率、Patch 接受率和越权调用率。
  4. Research 评测记录引用准确率、事实支持率、来源覆盖率和幻觉率。
  5. 压测首 Token 延迟、输出速度、并发、显存、长上下文和故障恢复。
  6. 先以只读或建议模式上线,再开放工作区写入。
  7. 设置回滚:出现越权、错误率上升或模型版本变化时切回旧模型。

腾讯公布的内部盲测涉及 163 名专家和 203 个工程任务,Hy4 preview 的平均评分为 2.99,并略高于腾讯所比较的 GLM 5.3 与 Kimi K3。该数据属于官方内部评测,不等于第三方独立验证,也不能替代你的业务验收。

成本与容量估算

开源权重没有按 Token 的模型许可费,但企业仍需承担 GPU、存储、网络、运维、监控和人力成本。估算公式可以写成:

月成本 = GPU节点小时单价 × 节点数 × 运行小时
       + 模型与日志存储
       + 内部网络与跨区流量
       + 平台运维和评测人力

若业务量低或任务间歇性强,购买多卡集群可能不经济;可先使用受控 API 验证价值,再决定私有化。若数据不能出域、调用稳定且 GPU 利用率较高,自托管的治理和边际成本优势才更明显。腾讯云或第三方 API 的实时价格、地区和额度并非本文核心,且会变化,应以调用当天控制台为准。

常见故障排查

模型无法装入显存

先确认选择的是 FP8 还是 BF16、GPU 架构是否匹配、TP 数量是否正确。不要只计算权重大小,还要预留 KV Cache、CUDA Graph 和运行时空间。降低上下文和并发只能减少缓存,无法让明显放不下的权重凭空装入。

工具调用没有被解析

检查是否使用 Hy4 专用 tool-call-parser,是否启用自动工具选择,工具 Schema 是否合法,以及客户端是否保留完整结构化字段。不要从模型文本中用正则提取命令后直接执行。

长上下文请求被拒绝

Speculative decoding 会预留额外 draft Token;有效预算不是简单的 Prompt 加输出等于上下文上限。缩短输入或最大输出,并检查框架的上下文、KV Cache 和并发配置。

Agent 反复验证、任务不结束

这是官方披露的已知倾向之一。为任务设置最大步骤、最大工具调用、超时、预算和完成判定;两次修复仍失败时转人工。简单任务可尝试 no_think

风险、限制与注意事项

Hy4 preview 是文本模型,不应在没有独立 OCR/视觉模型的情况下宣称原生理解图片或视频。Preview 表示能力、接口和最佳实践仍可能快速变化。模型可能生成错误代码、虚构引用、选择错误工具或被不可信内容诱导。

此外,FP8 路径对 GPU 架构和内核有具体要求;“支持 1M 上下文”不等于所有部署都能以 1M、多人并发稳定运行。开源许可证允许广泛使用,但企业仍需自行审查数据权利、第三方依赖、生成内容责任和行业合规。

事实依据与来源

  • 官方事实: 腾讯发布页日期为 2026 年 8 月 28 日;GitHub 官方仓库确认 Hy4 preview 的参数、架构、1M 上下文、权重链接、推荐参数、工具解析和 Apache 2.0 许可证。
  • 官方生态文档: vLLM Recipe 与 SGLang Cookbook 提供多卡配置、权重体积、GPU 兼容性和上下文容量建议。
  • 官方测试: 163 名内部专家、203 个工程任务的盲测数据由腾讯发布,不属于独立第三方 Benchmark。
  • 编辑判断: Hy4 preview 是当前适合本文标题的“腾讯最新开源 AI 模型”;“本地”应解释为自托管服务器或集群。
  • 实施建议: 六层 Agent 架构、工具白名单、评测集、审批门和上下文起点来自工程实践,需要按企业环境验证。
  • 待核实: 具体吞吐、稳定并发、GPU 小时成本和业务准确率取决于硬件、框架版本、上下文和任务,不应脱离实测给出保证。

FAQ

腾讯最新开源通用模型叫什么?

截至 2026 年 9 月 2 日,本文核验到的最新腾讯开源通用语言模型是 Hy4 preview,模型仓库为 tencent/Hy4-preview,另有 tencent/Hy4-preview-FP8 量化权重。

Hy4 preview 能在个人电脑上运行吗?

普通个人电脑不现实。BF16 权重约 1.5TB,FP8 权重约 760GB,参考部署使用多张数据中心 GPU。个人用户应选择小模型或 API;本文“本地”指企业自托管集群。

Hy4 preview 支持多少上下文?

模型规格为 1M 上下文,但实际可用长度受 GPU 显存、KV Cache、并发和框架限制。官方生态配置对常见多卡组合建议 131K 或 262K,而不是一律开启 1M。

Hy4 preview 支持 Function Calling 吗?

支持面向 Agent 的工具调用解析。官方 vLLM 命令包含 --tool-call-parser hy_v4--enable-auto-tool-choice,SGLang 可使用自动解析器。业务端仍必须验证参数和权限。

Hy4 preview 是多模态模型吗?

本文核验的 Hy4 preview 是文本生成模型。图片、扫描 PDF 或视频场景需要额外的 OCR、视觉模型或解析器,不能把外部组件能力写成 Hy4 原生能力。

Hy4 preview 可以商用吗?

模型仓库使用 Apache 2.0 许可证,通常允许商业使用与修改,但企业仍应由法务审查许可证、NOTICE、数据来源、第三方组件和具体分发方式。

vLLM 和 SGLang 应该选哪个?

两者都有官方参考部署。已有 OpenAI 兼容推理平台和 vLLM 运维经验的团队可优先 vLLM;需要 SGLang 的长上下文、调度或特定内核能力时选择 SGLang。最终应以同一硬件上的稳定性和吞吐实测决定。

Hy4 preview 是否适合直接上生产?

不建议未经验证直接承载高风险生产任务。它是 Preview,官方披露了推理过长和过度验证等已知问题。应先只读 PoC,再开放受控写入,并为发布、删除和生产变更设置人工审批。

参考来源

安装部署教程

环境配置与 Docker 工作流

适合阅读安装部署、本地配置、服务器搭建和自动化流程类文章后继续转化。

环境配置资料包 包含 Windows / Mac / Linux 常见环境配置、依赖安装和报错排查清单。 查看资料包 Docker 工作流包 整理 Docker 部署模板、compose 示例和常用服务编排流程。 查看资料包

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站累计访问量: 332,703
AI Stack Nav 客服会员 / 支付 / 下载 / 工具库
你好,我是 AI Stack Nav 客服助手。你可以问我会员开通、微信支付、资料下载、订单入口、AI 工具库等问题。