摘要: 本文讲怎么用即梦和可灵,把一张静态图片变成一段 10 秒左右、有电影感的镜头。最重要的结论是:图生视频的成败,七成在“首帧图”和“运镜写法”——构图、光线、主体位置要先在图片里定好;提示词里一个镜头只用一种主运镜,并按“0-3 秒铺垫、3-7 秒动作、7-10 秒收束”的时间轴来写。即梦目前主打 Seedance 2.0 的多模态参考与首尾帧,可灵主打可灵 3.0 系列与运镜控制,两者都能完成本文的工作流。本文适合想用 AI 做短视频开场、产品镜头、情绪空镜的自媒体创作者、电商运营和设计师。需要说明的是,本文的方法与示例为编辑整理,没有附带实际生成的视频片段。读完本文,你能掌握首帧图准备、运镜选择和分段提示词写法,并拿到可直接套用的示例。
免费配套资料:下载 24 种运镜提示词对照表(PDF)。
核心结论
用即梦或可灵从一张图生成 10 秒电影感镜头是完全可行的,关键是先把首帧图做对,再用“单一运镜 + 三段时间轴”写提示词。
- 首帧图决定上限:图生视频会以上传的图片为起点,构图、光线、主体位置和画幅最好在图片阶段就定好。主体清晰、背景干净、比例与目标视频一致的图片,生成结果更稳定。
- 一个镜头只用一种主运镜:推、拉、摇、移、环绕、升降各有用途,混在一个镜头里容易导致画面跳动和变形。组合运镜留给剪辑去做。
- 10 秒按三段写:0-3 秒保持首帧构图、只让环境动起来;3-7 秒加入主体动作和运镜;7-10 秒动作放缓、定格在主体上。快速运镜(FPV 穿越、航拍俯冲)建议先生成 5 秒。
- 两款工具都支持 10 秒以上:可灵官方 API 更新公告显示,可灵 3.0 Turbo 于 2026 年 6 月上线,支持 720P 与 1080P 的文生与图生视频;阿里云百炼文档列出的 kling-v3-turbo 时长为 3 至 15 秒。百度百科介绍,Seedance 2.0 于 2026 年 2 月在即梦平台开始内测,可根据描述自动规划分镜和运镜。
- 多生成几次再挑:同一个提示词每次结果不同,重要镜头建议生成 2 到 4 次,挑最稳定的一条。
背景与主要变化
2026 年,国产 AI 视频工具的竞争焦点从“能不能动”转向了“能不能控”。
可灵方面,其官方 API 更新公告显示了清晰的迭代节奏:2025 年 3 月新模型支持首尾帧、动态笔刷和运镜控制;2025 年 12 月的 V2.6 模型可在生成视频时同时生成配音;2026 年 4 月起可灵 3.0 模型支持 4K 输出;2026 年 6 月上线可灵 3.0 Turbo,支持 720P、1080P 的文生视频与图生视频。阿里云百炼的可灵 API 文档列出,kling-v3-turbo 支持 16:9、9:16、1:1 三种宽高比,视频时长 3 至 15 秒。
即梦方面,其视频生成能力来自字节跳动的 Seedance 系列模型。百度百科介绍,Seedance 2.0 于 2026 年 2 月 7 日开始在即梦平台小范围内测,4 月 2 日面向企业用户开放公测,支持文本生成视频、图片生成视频及视频、音频参考素材输入。新浪科技的实测报道提到,在即梦官网选择 Seedance 2.0 模型时,可以使用“首尾帧”和“全能参考”两个入口,全能参考模式支持图像、视频、音频、文本四种模态组合,输入上限为 12 个文件。
下表汇总两款工具与本文工作流相关的信息(核验日期 2026 年 10 月 1 日):
| 项目 | 即梦 | 可灵 |
|---|---|---|
| 出品方 | 字节跳动 | 快手 |
| 主力视频模型 | Seedance 2.0 | 可灵 3.0 系列(含 3.0 Turbo) |
| 图生视频入口 | 首尾帧、全能参考(多模态参考) | 图生视频(首帧 / 首尾帧)、运镜控制 |
| 时长 | 第三方 API 文档列出 4 至 15 秒 | 阿里云文档列出 kling-v3-turbo 为 3 至 15 秒 |
| 画质 | 第三方 API 文档列出最高 1080P | 官方公告:3.0 Turbo 支持 720P、1080P;3.0 支持 4K 模式 |
| 特色 | 多模态参考、自动规划分镜与运镜 | 运镜控制、首尾帧、动态笔刷 |
| 信息来源 | 百度百科、新浪科技报道、第三方 API 文档 | 可灵官方 API 公告、阿里云百炼文档 |
需要说明的是,App 内的模型版本、时长选项和积分消耗会随时调整,以你看到的界面为准。
核心功能拆解
一个 10 秒电影感镜头可以拆成七个部分:首帧图、运镜、主体动作、环境动态、时间轴、风格、避免项。前两项决定上限,后五项决定稳定性。

首帧图:先在图片里“拍好”
很多失败的视频,问题出在图片本身。准备首帧图时注意四点:
- 画幅一致:要做竖屏视频,就准备 9:16 的图片;比例不一致时,工具可能裁剪或填充画面。
- 主体清晰:主体占画面 40% 到 60%,边缘清楚,避免被前景大面积遮挡。
- 光线明确:有明确光源方向的图片,生成时光影变化更自然。
- 给动作留空间:如果主体要转身、奔跑,画面里要留出它运动的方向。
运镜:一种就够
可灵帮助资料中介绍的基础运镜包括水平运镜、垂直运镜、推进拉远、垂直摇镜、旋转摇镜和水平摇镜。实际写提示词时,最常用的是以下几种:
| 运镜 | 提示词写法 | 适合场景 |
|---|---|---|
| 推镜头 | 镜头缓慢向前推进,逐渐靠近主体 | 揭示细节、情绪加强 |
| 拉镜头 | 镜头缓慢向后拉远,露出周围环境 | 交代环境、结尾收束 |
| 环绕 | 镜头围绕主体缓慢旋转半圈 | 产品展示、人物高光 |
| 跟拍 | 镜头跟随主体移动,保持主体在画面中 | 行走、奔跑、车辆 |
| 升镜头 | 镜头垂直向上升起 | 开场、揭示全貌 |
| 固定机位 | 镜头保持静止,只有画面内运动 | 细节、氛围、延时 |
时间轴:10 秒分三段
10 秒对 AI 视频来说不算短,如果只写一句“女孩转头微笑”,后半段往往会出现多余动作或画面漂移。按三段写能让节奏更可控:
- 0-3 秒 铺垫:保持首帧构图,只让环境动(风、光、水、烟雾)。
- 3-7 秒 动作:主体动作 + 运镜,这是镜头的核心。
- 7-10 秒 收束:动作放缓,定格在主体上,方便剪辑衔接。
风格与避免项
风格写“电影感、浅景深、胶片色调”“商业广告质感”“国风电影感”等;避免项写“保持主体外观与首帧一致,避免肢体变形、画面闪烁和多余文字”。避免项不能保证不出问题,但能减少常见瑕疵。
适用人群与使用场景
图生视频最适合“已经有好图、需要让它动起来”的场景。相比纯文字生成视频,它的构图和主体更可控。
以下是几类典型用户的用法(编辑建议,非官方数据):
- 自媒体创作者:做视频开场、情绪空镜、转场镜头。用 AI 生图或自己拍的照片做首帧,生成 10 秒镜头再剪辑。
- 电商运营:让产品图动起来——香水揭幕、耳机环绕、咖啡拉花。产品类镜头动作简单、成功率较高。
- 设计师和插画师:让插画、海报“活”起来,做作品集动态展示。
- 旅行与风光博主:把风景照做成延时、航拍感镜头。
- 小团队广告提案:用分镜脚本 + 图生视频快速做出动态样片,和客户沟通方向。
需要提醒的是:用他人照片、明星肖像、品牌商标做首帧图,需要取得授权。站内的 AI 视频工具合集 和 短视频工作流教程 介绍了更多创作方法。
安装、配置或使用步骤
下面是从一张图到一个 10 秒镜头的完整步骤。两款工具的界面名称可能随版本调整,以实际界面为准。
- 从官方渠道进入。可灵可以访问官方网站 klingai.com 或下载官方 App;即梦从官方网站或应用商店下载官方 App。搜索结果中有不少自称“官网”的第三方站点,请认准官方渠道再登录和充值。
- 准备首帧图。按目标画幅(竖屏 9:16、横屏 16:9)准备图片,主体清晰、光线明确,并给主体动作留出空间。
- 选择图生视频入口。可灵选择“图生视频”;即梦选择视频生成,并按需选择“首尾帧”或“全能参考”。
- 选择时长与画质。常规镜头选 10 秒左右;快速运镜先选 5 秒。画质按用途和积分选择,以 App 内显示为准。
- 写分段提示词。套用下面的结构,把方括号里的内容换成你的画面:
参考首帧图。0-3 秒:画面基本保持首帧构图,【环境动态,如窗帘被风轻轻吹动】;
3-7 秒:【主体动作,如人物缓缓转头看向镜头】,【一种运镜,如镜头缓慢向前推进,逐渐靠近主体】;
7-10 秒:动作放缓并定格在主体上。
风格:【如电影感,自然光,浅景深,胶片色调】。
保持主体外观与首帧一致,避免肢体变形、画面闪烁和多余文字。
- 如果工具提供运镜按钮,二选一。可灵等工具提供运镜控制选项时,可以用按钮指定运镜,提示词里就不要再写另一种运镜,避免冲突。
- 生成 2 到 4 次,挑最稳定的一条。重点检查:主体是否变形、面部是否变成另一个人、运镜是否跳动、结尾是否稳定。
- 需要固定结尾画面时用首尾帧。如果你希望镜头结束在特定画面(比如人物回头后的侧脸),准备一张尾帧图,用首尾帧模式生成。
以“咖啡拉花”产品镜头为例,完整提示词可以这样写:
参考首帧图。0-3 秒:咖啡杯静止,热气缓缓升起;3-7 秒:奶流从画面上方注入,逐渐形成心形拉花,镜头缓慢向下推近;7-10 秒:拉花完成,镜头停在杯面。风格:商业广告质感,暖色调,浅景深。避免液体穿模、杯子变形和多余文字。
实际工作流示例
单个 10 秒镜头适合做开场或高光,一条完整的短视频通常需要多个镜头。下面以“30 秒咖啡品牌短片”为例,看从分镜到成片的工作流。

第一步:写分镜
30 秒短片拆成 6 个 5 秒左右的镜头:
| 镜号 | 时长 | 景别 | 运镜 | 画面内容 |
|---|---|---|---|---|
| 1 | 5 秒 | 全景 | 降镜头 | 镜头从招牌缓慢下降到店门 |
| 2 | 5 秒 | 中景 | 推镜头 | 咖啡师抬头微笑,开始磨豆 |
| 3 | 5 秒 | 特写 | 俯拍 | 奶流注入形成拉花 |
| 4 | 5 秒 | 近景 | 环绕 | 镜头半圈环绕咖啡杯,热气升起 |
| 5 | 5 秒 | 中景 | 固定机位 | 客人抿一口咖啡,满足地看向窗外 |
| 6 | 5 秒 | 全景 | 拉镜头 | 镜头缓慢拉远至店外,品牌名出现 |
第二步:每个镜头单独准备首帧图
6 个镜头需要 6 张首帧图。用 AI 生图时,统一光线、色调和人物外观,避免成片风格割裂。
第三步:逐个生成并挑选
每个镜头按分段时间轴写提示词,生成 2 到 4 次。常见问题的修正方法:
- 主体变形:降低动作幅度,比如“转头”改成“微微侧头”;
- 面部变成另一个人:改用首尾帧,尾帧用同一人物的另一角度图片;
- 运镜跳动:只保留一种运镜,并写“缓慢”;
- 液体或物体穿模:去掉复杂交互动作,拆成两个镜头。
第四步:剪辑与发布
在剪辑软件中拼接镜头、加转场、配乐和字幕。发布时按平台要求添加“AI 生成”标识。
成本估算
以下为示例计算,非官方数据。假设 30 秒短片需要 6 个镜头,每个镜头平均生成 3 次挑选,共 18 次生成。各工具按时长、画质和模式消耗积分,具体以 App 内显示为准。时间方面,准备 6 张首帧图约 30 分钟、生成与挑选约 60 分钟、剪辑约 30 分钟,合计约 2 小时;同等效果的实拍需要场地、设备和人员,成本和周期通常高得多。
对比与选型建议
两款工具都能完成本文的工作流,选择取决于你更需要“参考控制”还是“运镜控制”,以及你习惯的生态。
| 你的需求 | 推荐 | 理由 |
|---|---|---|
| 想用多张参考图、参考视频控制动作和运镜 | 即梦 | 新浪科技报道全能参考支持多模态输入 |
| 想用按钮精确指定运镜 | 可灵 | 官方公告与帮助资料均提到运镜控制能力 |
| 需要固定结尾画面 | 两者均可 | 都提供首尾帧模式 |
| 需要 4K 输出 | 可灵 | 官方公告:3.0 模型支持 4K 模式 |
| 日常用剪映、抖音 | 即梦 | 同属字节生态,衔接方便 |
| 日常用快手 | 可灵 | 同属快手生态 |
几条使用建议(编辑判断,不代表官方结论):
- 同一张首帧图,两款工具各跑一次。不同模型对同一提示词的理解差异很大,对比一次就知道哪个更适合你的题材。
- 先做稳定的镜头,再挑战复杂的。产品、空镜、风光成功率较高;人物大幅动作、多人互动、手部特写难度较大。
- 把成功的提示词存下来。同一类镜头复用提示词,只换首帧图,能大幅提高出片效率。
本文配套提供两份资料:免费的《运镜提示词对照表》,收录 24 种运镜的中文写法、英文术语、画面效果和写法要点;以及付费的镜头提示词包,包含 10 类场景共 200 条带首帧图要求和分段时间轴的镜头提示词、分镜脚本模板(含 30 秒示例)和 8 个案例拆解。
风险、限制与注意事项
AI 视频的门槛降低了,但版权、肖像和平台规则的风险反而更需要注意。
肖像权与版权。 用他人照片、明星肖像、影视截图、品牌商标做首帧图,可能侵犯肖像权、著作权或商标权。商业用途务必使用自有或已授权的素材。
AI 生成标识。 国内主要平台要求对 AI 生成内容进行标识。发布时按平台规定添加“AI 生成”说明,避免限流或违规。
不要制作误导性内容。 不要用 AI 视频伪造真实人物的言行、伪造新闻现场或虚假的产品使用效果。
只用官方渠道。 搜索结果中存在大量自称“官网”的第三方站点,登录、充值和上传素材都应在官方网站或官方 App 中进行。
生成结果不稳定。 同一提示词每次结果不同,人物面部、手部、文字最容易出错。重要镜头多生成几次,并逐帧检查。
积分与价格变化。 两款工具按时长、画质和模式消耗积分,会员权益与价格可能调整,以 App 内显示为准。
商用授权需确认。 生成内容能否商用、是否带水印,与会员等级和平台协议有关,商用前请阅读各自的用户协议。
事实依据与来源
本文信息按可信度分级如下:
- 官方已确认:可灵 2025 年 3 月起支持首尾帧、动态笔刷和运镜控制,2025 年 12 月 V2.6 支持同时生成配音,2026 年 4 月可灵 3.0 支持 4K 模式,2026 年 6 月上线 3.0 Turbo 并支持 720P 与 1080P 的文生与图生视频,来自可灵官方 API 更新公告。kling-v3-turbo 支持 16:9、9:16、1:1 和 3 至 15 秒时长,来自阿里云百炼官方文档。
- 权威资料与媒体报道:Seedance 2.0 于 2026 年 2 月 7 日在即梦平台内测、4 月 2 日面向企业公测,支持文本、图片及视频音频参考输入并可自动规划分镜和运镜,来自百度百科;即梦中 Seedance 2.0 的首尾帧与全能参考入口、四种模态组合与 12 个文件输入上限,来自新浪科技实测报道。
- 第三方资料:Seedance 2.0 时长 4 至 15 秒、最高 1080P,来自第三方 API 文档;可灵基础运镜类型来自第三方整理的可灵使用指南。请以官方说明为准。
- 编辑判断:七部分镜头结构、三段时间轴写法、首帧图要求、分镜示例、选型建议,均为本站编辑整理,不代表官方结论;本文没有附带实际生成的视频,提示词效果因首帧图与模型版本而异。
- 示例计算:生成次数与时间估算为示例计算,非官方数据。
内容核验日期为 2026 年 10 月 1 日。
FAQ
即梦和可灵都能生成 10 秒视频吗?
都能。阿里云百炼文档列出 kling-v3-turbo 时长为 3 至 15 秒,第三方 API 文档列出 Seedance 2.0 为 4 至 15 秒;App 内可选时长以实际界面为准。
为什么生成的视频人物会“变脸”?
通常是动作幅度太大。降低动作幅度(如“转头”改为“微微侧头”),或改用首尾帧模式,用同一人物的另一角度图片作尾帧。
一个镜头可以同时写推镜头和环绕吗?
不建议同时写。混合运镜容易导致画面跳动和变形;一个镜头只用一种主运镜,组合效果交给剪辑完成。
首帧图用什么比例?
和目标视频保持一致。竖屏短视频用 9:16,横屏用 16:9,比例不一致时工具可能会裁剪或填充画面。
用别人的照片生成视频可以吗?
需要取得授权。使用他人肖像、作品或品牌商标可能构成侵权,商业用途务必使用自有或已授权的素材。
生成的视频可以商用吗?
要看会员等级和平台协议。不同会员等级在水印、商用授权上的规定不同,商用前请阅读即梦和可灵各自的用户协议。
运镜提示词对照表在哪里下载?
在本文配套的免费资料中。对照表为 PDF 格式,收录 24 种运镜的中文写法、英文术语、画面效果、适合场景和写法要点。
参考来源
- 可灵 AI:API 更新公告(官方)
- 阿里云百炼:可灵视频生成 API 文档
- 百度百科:Seedance 2.0
- 新浪科技:实测即梦 Seedance 2.0
- API易:Seedance 2.0 接入文档(第三方)
- AITOP100:可灵 AI 使用指南(第三方)
内容核验日期:2026 年 10 月 01 日
配套镜头提示词与分镜资料
即梦 / 可灵镜头提示词包(¥59):包含 200 条分场景镜头提示词、24 种运镜写法、分镜脚本模板与 8 个案例拆解。
工具选型与提示词资料
适合阅读工具评测、工具推荐、对比测评类文章后继续转化。