Ling-3.0-flash-Fin本地部署与年报Excel估值工作流

Ling-3.0-flash-Fin本地部署:从年报检索到Excel估值模型

从多 GPU 本地部署到年报检索、财务指标抽取和可编辑 Excel DCF 估值的完整实战。

摘要: 本文讲解如何在本地部署蚂蚁 InclusionAI 开源的 Ling-3.0-flash-Fin,并搭建一条从上市公司年报解析、证据检索、财务指标抽取,到生成可编辑 Excel DCF 估值模型的完整工作流。该模型拥有 124B 总参数、约 5.1B 激活参数和 256K 上下文,当前官方检查点为 BF16,适合有多 GPU 服务器的金融研究、投研辅助与企业内网场景。最重要的结论是:本地部署能改善数据控制,但不能把模型生成的财务数字直接当作事实;可靠方案必须保留页码、表名、报告期、单位、原文证据、公式和人工复核。

核心结论

直接答案: Ling-3.0-flash-Fin 可以本地部署,并能承担年报检索、跨文档财务推理、指标抽取与估值模型草拟,但官方 BF16 权重不是单卡消费级模型。生产部署建议使用 SGLang 或 vLLM、多 GPU 张量并行和 OpenAI 兼容接口;业务层采用“PDF 解析与表格提取—混合检索—模型结构化抽取—规则校验—Python 写入 Excel—人工审核”的流水线。模型只负责理解、映射和解释,所有关键数字必须能回到年报页码,所有估值必须由 Excel 公式计算,不能让大模型直接给出不可追溯的目标价。

本文的事实依据主要来自官方模型卡与 Ling-3.0-flash 部署指南:

  • Ling-3.0-flash-Fin 是 Ant Ling 家族首个金融增强模型,由蚂蚁集团与金融机构、领域专家共同开发,在 Ling-3.0-flash 基础上继续使用高质量金融数据训练。
  • 官方标注 124B 总参数、5.1B 激活参数、256K 上下文,采用混合线性稀疏 MoE 架构。
  • 模型卡列出的目标能力包括端到端金融研究、可追溯检索、多文档金融推理、估值与电子表格工作流。
  • 当前官方 Checkpoint 为 BF16,兼容与基础模型相同的 SGLang 和 vLLM Runtime。
  • 模型采用 MIT 许可证;与其同时开放的 FinFIRST 评测集采用 Apache-2.0 许可证。
  • 官方明确提示:复杂长周期流程仍需进一步验证,关键假设、估值结果和投资结论必须由专业人员审查,不构成投资建议。

Ling-3.0-flash-Fin 是什么

Ling-3.0-flash-Fin 不是一个只会回答金融名词的问答模型,而是面向真实金融研究工作流优化的开放权重模型。它试图把检索、证据复核、计算、建模与报告组织连接起来,而不是分别生成一段搜索结果和一段分析文字。

项目官方信息实施含义
开发方InclusionAI/蚂蚁集团优先以官方模型卡核验参数
基础模型Ling-3.0-flash金融版共享相同架构与部署 Runtime
总参数124B权重加载仍是大型模型规模
激活参数约 5.1B单 Token 计算量较低,不等于只加载 5.1B
架构Hybrid-linear sparse MoE强调长上下文效率与稀疏计算
上下文256K可处理较长材料,但不应把整库一次塞入
官方权重精度BF16生产部署需要大显存多 GPU
推理框架SGLang、vLLM可暴露 OpenAI 兼容 API
许可证MIT商用仍需履行许可证并审核数据来源
默认模式Thinking 开启金融版推荐采样参数与基础版不同

模型卡称其在 FinFIRST、FinSearchComp Verified、FinCRAFT、Finance Agent、APEX-Agents、SpreadsheetBench 与 τ³-Banking 等评测中测试,覆盖检索、投研、长任务、估值、表格操作和银行流程。但“有官方评测”不等于在你的行业、语言、会计准则与 Excel 模板上已通过验收。企业需要建立自有测试集。

为什么适合年报与估值工作流

年报研究的难点不是“把 PDF 变成摘要”,而是同时处理多个容易出错的维度:报告期、合并口径、币种、单位、同比重述、会计科目映射、表格跨页、附注与正文冲突,以及实际值和预测值的区分。

Ling-3.0-flash-Fin 的官方定位正好覆盖这些工作:它强调在年报、业绩公告、监管披露和研究资料之间协调期间、定义、假设及冲突数字;也强调 Excel 公式、Actual 与 Estimate 更新、跨 Sheet 依赖、平衡校验和情景分析。

这使它更适合作为“金融结构化 Agent”的推理核心,而不是 PDF OCR 工具。OCR、表格检测、向量检索和 Excel 写入仍应由确定性程序完成。

硬件需求:5.1B 激活参数不是 5.1B 小模型

这是部署前最重要的成本判断。MoE 在推理时只激活部分专家,能降低每 Token 计算量;但推理服务通常仍需把完整或分片后的 124B 权重放入显存或可访问的内存层级。

粗略只计算权重:

BF16 权重下限 ≈ 1240 亿参数 × 2 Byte ≈ 248 GB

这还没有计入 KV Cache、激活、CUDA Graph、Runtime、通信缓冲区和 256K 长上下文开销。因此 4×80GB 虽然名义总显存 320GB,也可能因上下文、并发和框架开销非常紧张。基础模型官方 SGLang 示例推荐在 4 张 141GB 级 H20-3e 或 4-GPU Blackwell 节点上使用 TP=4;80GB 的 H100/H800 则使用 TP=8。金融版模型卡指向同一部署指南,实际仍应按照金融权重、请求长度与并发压测。

部署方案建议定位注意事项
8×80GB H100/H800官方基础模型示例路径成本高,但 BF16 与长上下文余量更合理
4×141GB H20-3e/Blackwell 节点官方低延迟示例路径使用 TP=4,需核验具体 GPU 支持
社区 FP8/INT4 量化试验与成本优化非官方量化需验证金融准确率与 Runtime 兼容
单张 24GB/48GB GPU不建议部署官方 BF16可改用托管 API 或更小模型
CPU Offload离线试验延迟通常很高,不适合交互式投研

如果没有多 GPU 服务器,不应为了“本地”勉强部署。可以先用可信托管服务验证流程,再决定购买服务器;或选取更小金融模型,把检索和计算质量做扎实。

部署前准备

建议操作系统使用 Ubuntu 22.04/24.04,安装与 GPU 对应的 NVIDIA Driver、Docker 和 NVIDIA Container Toolkit。磁盘预留不仅要覆盖模型文件,还要覆盖容器、缓存、年报原文件、解析结果和向量索引。生产环境建议至少准备 1TB 高速 NVMe,并把模型快照固定到明确 Revision。

目录结构:

fin-research/
├── data/
│   ├── raw_reports/
│   ├── parsed_pages/
│   └── tables/
├── index/
├── schemas/
├── prompts/
├── valuation_templates/
├── outputs/
└── docker-compose.yml

下载前阅读模型许可证与模型卡。企业还应检查年报、数据库和研报的使用权;模型 MIT 许可证不会自动赋予第三方数据再分发权。

使用 SGLang 部署

官方说明金融模型共享 Ling-3.0-flash 架构,可使用同一 SGLang Runtime。先拉取官方示例指定的开发镜像:

docker pull lmsysorg/sglang:dev-Ling-3.0-flash

以 4 张 141GB 级 GPU 为例,将基础模型路径替换成金融模型:

docker run --rm --gpus all --ipc=host --shm-size 32g \
  -p 30000:30000 \
  -e HF_TOKEN="YOUR_HF_TOKEN" \
  lmsysorg/sglang:dev-Ling-3.0-flash \
  env SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 \
  python3 -m sglang.launch_server \
    --model-path inclusionAI/Ling-3.0-flash-Fin \
    --tp 4 \
    --context-length 262144 \
    --speculative-algorithm NEXTN \
    --mem-fraction-static 0.80 \
    --host 0.0.0.0 \
    --port 30000

这条命令是依据基础模型官方示例对模型路径进行的适配,金融模型卡说明可复用 Runtime,但不是官方针对每种硬件都验证过的唯一命令。80GB GPU 应参考官方 Cookbook 使用 TP=8,OOM 时先缩短上下文和并发,不要盲目提高显存利用率。

健康检查:

curl http://127.0.0.1:30000/v1/models

金融版模型卡推荐 Thinking 默认开启,并建议一般推理使用:

{
  "temperature": 1.0,
  "top_p": 0.95,
  "top_k": 20
}

注意基础版模型卡常见的是 temperature=0.6,金融版官方页面明确推荐 temperature=1.0。文章和代码配置时应以正在使用的金融模型卡为准。

使用 vLLM 部署

基础模型官方给出从 vLLM 源码安装的路径,并要求 --trust-remote-code、Ling3 Tool/Reasoning Parser 和 MTP。生产环境应固定 Commit,避免每次构建拉取最新源码。

pip install uv
uv venv .venv
source .venv/bin/activate
git clone https://github.com/vllm-project/vllm.git
cd vllm
VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto

启动示例:

vllm serve inclusionAI/Ling-3.0-flash-Fin \
  --port 8000 \
  --trust-remote-code \
  --served-model-name ling-fin \
  --tensor-parallel-size 8 \
  --gpu-memory-utilization 0.85 \
  --enable-prefix-caching \
  --mamba-cache-mode align \
  --enable-auto-tool-choice \
  --tool-call-parser ling3 \
  --reasoning-parser ling3 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

调用接口:

curl http://127.0.0.1:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model":"ling-fin",
    "messages":[{"role":"user","content":"列出年报中自由现金流计算需要的科目,不要生成数字。"}],
    "chat_template_kwargs":{"enable_thinking":true},
    "temperature":1.0,
    "top_p":0.95,
    "top_k":20
  }'

--trust-remote-code 会执行模型仓库中的自定义代码。企业应固定 Revision、离线扫描、使用无特权容器、只读文件系统和最小网络权限,不能直接在生产宿主机以 Root 运行未知版本。

年报检索系统的正确架构

不要把一份 300 页 PDF 直接上传后问“公司值多少钱”。可靠流程应拆成六层:

  1. 文档登记: 保存股票代码、报告类型、披露日期、报告期、币种、会计准则、文件哈希与来源 URL。
  2. 版面解析: 按页提取正文、标题、页眉页脚、表格与坐标;扫描件先 OCR。
  3. 表格标准化: 保留原表名、行名、列名、合并单元格、单位和负号格式。
  4. 混合检索: BM25 找准确科目,向量检索找语义近似,再按报告期和文档类型过滤。
  5. 模型抽取: Ling-Fin 输出严格 JSON,附页码、原文、置信度和冲突说明。
  6. 确定性建模: Python 校验后写入 Excel,估值由公式计算,人类最终审批。
flowchart TD
    A["年报与监管文件"] --> B["OCR/版面与表格解析"]
    B --> C["混合检索+期间过滤"]
    C --> D["Ling-Fin 证据抽取"]
    D --> E["规则校验+人工复核"]
    E --> F["Excel DCF/可比估值"]

年报解析与证据入库

PDF 解析可以选择 PyMuPDF、pdfplumber、Docling、MinerU 或企业已有文档系统。复杂财务表格应保留页面图像,必要时采用 OCR 与结构化表格模型组合。示例使用 PyMuPDF 提取页文本:

import fitz
import hashlib
import json
from pathlib import Path

pdf_path = Path("data/raw_reports/company_2025_annual.pdf")
doc_hash = hashlib.sha256(pdf_path.read_bytes()).hexdigest()
doc = fitz.open(pdf_path)

with open("data/parsed_pages/pages.jsonl", "w", encoding="utf-8") as f:
    for page_no, page in enumerate(doc, start=1):
        record = {
            "document_id": doc_hash,
            "page": page_no,
            "text": page.get_text("text"),
            "source_file": pdf_path.name,
            "report_period": "2025-FY",
            "currency": "CNY"
        }
        f.write(json.dumps(record, ensure_ascii=False) + "\n")

不能只保存切片文字。每个 Chunk 至少需要:document_id、PDF 页码、印刷页码、章节、表名、报告期、单位、币种、合并/母公司口径、Source URL 和 Hash。否则模型回答正确也无法审计。

检索策略

同一个概念在年报中可能叫“经营活动产生的现金流量净额”“经营现金净流量”或英文 Net cash flows from operating activities。向量搜索能提高召回;但“2024 年”“亿元”“归属于母公司”等精确条件更适合关键词和元数据过滤。

推荐使用:

最终召回 = 0.45 × BM25 + 0.35 × 向量相似度 + 0.20 × 元数据/章节权重

这是实施建议,并非官方模型参数。真实权重需用自有问答集评估。对数字类问题,应同时召回主表、附注和管理层讨论,发现冲突时不自动选择最大或最新数字,而是报告冲突原因。

用 Ling-Fin 抽取财务指标

模型输出必须使用 Schema,不要让它自由写研究报告后再用正则抓数字。建议 Schema:

{
  "metric": "revenue",
  "period": "2025-FY",
  "value": 0,
  "unit": "CNY million",
  "scope": "consolidated",
  "statement": "income_statement",
  "source_document": "company_2025_annual.pdf",
  "pdf_page": 0,
  "table_name": "",
  "source_quote": "",
  "calculated": false,
  "formula": null,
  "confidence": 0.0,
  "conflicts": []
}

系统提示词应明确:只使用提供的检索片段;找不到就返回 null;不得用常识补数字;负数、括号、单位与币种必须原样解释;计算值与披露值必须分开;每个数字都要带证据。

from openai import OpenAI
import json

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="local")

def extract_metrics(context: str, metrics: list[str]):
    prompt = f"""
你是财务数据抽取器。仅根据 CONTEXT 输出 JSON 数组。
目标指标:{metrics}
规则:找不到返回 null;保留单位、报告期、口径、页码和原文;
不得把模型知识当作年报事实;计算值必须附公式。
CONTEXT:
{context}
"""
    response = client.chat.completions.create(
        model="ling-fin",
        messages=[{"role": "user", "content": prompt}],
        temperature=0.2,
        extra_body={
            "top_p": 0.95,
            "top_k": 20,
            "chat_template_kwargs": {"enable_thinking": True}
        }
    )
    return json.loads(response.choices[0].message.content)

这里对结构化抽取使用较低 Temperature 是工程选择,和官方“通用推理推荐 1.0”不同。上线前应比较 0.2、0.6 与 1.0 的 JSON 合法率、召回率和数字准确率;不要宣称低温一定更准确。

财务数据校验规则

至少实现以下校验:

  • 资产 = 负债 + 所有者权益;
  • 现金期末余额与现金流量表勾稽;
  • 本期、上期和同比列没有错位;
  • 单位从元、千元、万元、百万元转换后统一;
  • 括号负数和 OCR 丢失的减号得到识别;
  • 合并口径与母公司口径不混用;
  • Revenue、Operating Profit、Net Income 不跨准则误映射;
  • 计算值与报告披露值分别标记;
  • 每个 Actual 数据至少存在一个可点击来源;
  • 冲突数字进入人工复核队列。
from decimal import Decimal

def check_balance_sheet(assets, liabilities, equity, tolerance="1"):
    gap = Decimal(str(assets)) - Decimal(str(liabilities)) - Decimal(str(equity))
    return {
        "passed": abs(gap) <= Decimal(tolerance),
        "gap": str(gap)
    }

大模型可以解释 Gap 可能来自舍入或少数股东权益,但是否接受必须由规则和会计人员决定。

生成可编辑 Excel DCF 估值模型

Excel 建议分为六个 Sheet:

Sheet内容输入/公式
Sources来源、页码、报告期、单位、原文证据输入
Historical3—5 年收入、利润、Capex、营运资本年报 Actual
Assumptions增长率、利润率、税率、WACC、永续增长人工可编辑
Forecast收入、EBIT、NOPAT、FCFFExcel 公式
ValuationDCF、净债务、股权价值、每股价值Excel 公式
ScenariosBase/Bull/Bear 与敏感性分析Excel Data Table 或公式

DCF 核心关系:

$$
FCFF = EBIT(1-T) + D&A – Capex – \Delta NWC
$$

$$
TV = \frac{FCFF_{n+1}}{WACC-g}
$$

$$
Equity\ Value = PV(FCFF) + PV(TV) – Net\ Debt
$$

使用 openpyxl 写入模板时,模型只提供经过复核的 Actual 和假设建议,公式由程序固定:

from openpyxl import load_workbook
from openpyxl.styles import PatternFill

wb = load_workbook("valuation_templates/dcf_template.xlsx")
hist = wb["Historical"]
src = wb["Sources"]
ass = wb["Assumptions"]
fcf = wb["Forecast"]

# 经证据校验后的历史收入
hist["B5"] = 125000.0
hist["B5"].number_format = '#,##0.0'

# 来源页码与文件
src.append(["Revenue", "2025-FY", 125000.0, "CNY million",
            "company_2025_annual.pdf", 87, "Consolidated income statement"])

# 蓝色表示人工输入,黑色公式由模板锁定
ass["C6"] = 0.08
ass["C6"].fill = PatternFill("solid", fgColor="DDEBFF")

# 示例预测与 FCFF 公式
fcf["C5"] = "=Historical!B5*(1+Assumptions!C6)"
fcf["C10"] = "=C6*(1-Assumptions!C10)+C7-C8-C9"

wb.save("outputs/company_dcf_review.xlsx")

不要把 125000 这样的示例数字用于真实投资判断。生产代码应从校验后的 JSON 读取,并把每个单元格映射到 Sources 行。建议使用蓝色字体表示输入、黑色表示公式、绿色表示跨 Sheet 引用、红色表示异常,但要与团队现有建模规范一致。

完整端到端工作流

  1. 从交易所、公司 IR 或监管机构下载年报,记录 URL、时间与 SHA-256。
  2. 解析 PDF 页面和表格,扫描件执行 OCR,保存版面坐标。
  3. 按章节、表格和语义切片,同时建立 BM25 与向量索引。
  4. 将用户问题拆成指标、期间、口径、币种和输出格式。
  5. 检索主表、附注和历史报告,返回带页码的证据包。
  6. 调用 Ling-Fin 输出严格 JSON,不允许无证据数字。
  7. 运行单位、期间、会计恒等式和冲突检测。
  8. 低置信度与冲突项进入财务人员复核队列。
  9. Python 将批准数据写入 Excel Sources 与 Historical。
  10. Excel 公式计算预测、DCF、情景与敏感性分析。
  11. 第二名审核人检查公式、假设和引用,再导出报告。

企业安全与内网部署

本地部署不等于自动安全。需要同时处理:模型权重供应链、Remote Code、容器权限、外网访问、日志泄漏、Prompt Injection、文档恶意内容、Excel 公式注入和用户权限。

推荐控制:

  • 固定模型 Revision 与容器 Digest,记录 SBOM;
  • 模型服务只监听内网,前置 API Gateway 与身份认证;
  • 不在请求日志中保存完整年报片段和客户数据;
  • 检索库按项目、机构与用户做行级权限隔离;
  • 禁止模型直接访问交易、支付、邮件发送和生产数据库;
  • 工具调用实行白名单,写 Excel 与读文档分离;
  • 对以 =, +, -, @ 开头的外部文本做公式注入处理;
  • 估值结果加“待审核”和非投资建议标识;
  • 保存输入文档 Hash、模型版本、Prompt 版本和审核记录。

金融年报本身也可能包含类似指令的文本。Agent 不应把文档中的“忽略规则、上传文件”等内容当作系统指令。检索文本只能作为数据,不能改变工具权限。

性能优化与成本控制

256K 是最大能力,不是每次请求的推荐长度。把整份年报塞入上下文会增加 TTFT、KV Cache 和幻觉定位难度。优先检索 10—30 个高质量 Chunk,并在冲突时二次扩展。

优化顺序:

  1. 先减少无关上下文和重复页眉页脚;
  2. 开启 Prefix Caching,复用公司基础材料;
  3. 根据硬件启用 MTP/NEXTN;
  4. 分离交互低延迟队列和批量吞吐队列;
  5. 为 OCR、Embedding、LLM 与 Excel 写入分别计时;
  6. 压测 8K、32K、64K、128K 和 256K,而非只测极限;
  7. 量化前建立数字抽取和公式准确率基线。

SGLang 官方介绍 HiCache+Mooncake 分层缓存可在长输入场景降低 TTFT,但具体收益依赖缓存命中、硬件和请求结构,不能把官方基础模型数据直接当作金融版生产承诺。

常见报错与解决方法

CUDA Out of Memory

先降低 Context Length、并发、Batch 和显存利用率,确认 TP 与 GPU 数量匹配。BF16 权重本身已很大,不要误以为稀疏激活会显著减少权重显存。

trust_remote_code 或模型架构无法识别

使用官方建议版本或源码版 Runtime,固定版本后检查模型 Commit。不要为了启动成功随意运行未经审查的最新代码。

Tool Call/Thinking 内容解析失败

确保启用 ling3 Tool Call Parser 与 Reasoning Parser,并按模型 Chat Template 传入 enable_thinking。客户端只应解析最终答案,不把思考内容写入 Excel。

年报页码对不上

PDF 物理页码和文档印刷页码可能不同,应同时保存。扫描件还需记录页面图像坐标,方便审核者定位表格。

Excel 打开后公式没有结果

openpyxl 写入公式但不负责计算。需要用 Excel、LibreOffice Headless 或其他计算引擎重新计算,并在交付前检查缓存值与错误单元格。

数字正确但单位错了

valueunit 作为不可分割字段,禁止只传数字。所有转换记录原值、原单位、倍率和目标单位。

上线验收清单

  • 模型来源、Revision、许可证与 Hash 已记录
  • BF16 多 GPU 显存与长上下文压测完成
  • SGLang/vLLM 版本和镜像 Digest 已固定
  • Remote Code 已扫描并在无特权容器运行
  • 年报来源、披露时间和报告期可追溯
  • 页面、表格、单位、币种和口径元数据完整
  • 每个 Actual 数据都能定位到原文页码
  • 模型 JSON Schema 校验与重试机制已建立
  • 资产负债、现金流和单位校验通过
  • Excel 输入、公式和来源采用不同样式
  • Excel 公式由计算引擎重算并检查错误
  • WACC、增长率与情景假设由人类批准
  • Prompt Injection 和公式注入测试通过
  • 服务认证、检索权限、日志脱敏与审计启用
  • 输出明确标注非投资建议并保留复核状态

FAQ

1. Ling-3.0-flash-Fin 可以在普通电脑运行吗?

官方 BF16 检查点不适合普通电脑。模型总参数为 124B,粗略权重就约 248GB,还需要 Runtime 与 KV Cache。普通设备应考虑托管服务、社区量化或更小模型,并重新验证准确率。

2. 为什么只激活 5.1B 参数还需要多 GPU?

5.1B 描述每个 Token 的激活计算规模,不等于磁盘和显存只保存 5.1B 权重。MoE 的其他专家仍属于完整模型权重。

3. 官方推荐 SGLang 还是 vLLM?

模型卡同时声明兼容 SGLang 与 vLLM。SGLang 官方示例提供特定硬件 Recipe,vLLM 便于接入 OpenAI 兼容生态。应按硬件、吞吐、缓存和运维能力压测选择。

4. 能否直接把 256K 年报放进模型?

可以处理长上下文不代表应该每次填满。生产系统更适合混合检索后发送相关证据,必要时分阶段扩展,能降低成本并提高引用精度。

5. 模型能直接生成 Excel 文件吗?

它可以理解表格和公式,但可靠交付应由 Python 按固定模板写入 .xlsx。模型生成结构化数据与假设,Excel 公式负责计算,财务人员负责审核。

6. 年报检索只用向量数据库够吗?

不够。财务问题包含大量精确科目、年份、单位和表名,建议组合 BM25、向量检索、元数据过滤与 Reranker。

7. 本地部署后数据一定不会泄露吗?

不一定。日志、外部 Embedding、MCP 工具、监控平台和备份仍可能外传数据。需要审查整个数据链路,而不仅是 LLM Endpoint。

8. 可以根据模型估值直接交易吗?

不建议。官方明确说明关键假设、估值和投资结论需要专业审查,模型输出不构成投资建议。它适合研究辅助,不应成为无人监督的交易决策者。

事实依据与来源

本文将模型参数、许可证、上下文、BF16、SGLang/vLLM 兼容性、金融能力定位和官方限制视为已确认事实。显存估算、检索权重、目录结构、数据 Schema、DCF 模板和企业安全策略属于实施建议,需结合硬件与内部规则验证。社区量化并非官方 BF16 权重,不能默认具有相同性能。

核验日期:2026 年 9 月 10 日。模型刚发布不久,Runtime、量化、模型卡和官方部署矩阵可能继续更新。

参考来源

相关阅读

安装部署教程

环境配置与 Docker 工作流

适合阅读安装部署、本地配置、服务器搭建和自动化流程类文章后继续转化。

环境配置资料包 包含 Windows / Mac / Linux 常见环境配置、依赖安装和报错排查清单。 查看资料包 Docker 工作流包 整理 Docker 部署模板、compose 示例和常用服务编排流程。 查看资料包

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站累计访问量: 336,851
AI Stack Nav 客服会员 / 支付 / 下载 / 工具库
你好,我是 AI Stack Nav 客服助手。你可以问我会员开通、微信支付、资料下载、订单入口、AI 工具库等问题。