聚好帧 视频创作指南
从第一个镜头开始:写清楚画面、选择参考素材、确认费用,再提交生成。
01快速开始
聚好帧 更像一位执行镜头的摄影团队,而不是自动补完故事的编剧。一个镜头只安排一个主要事件,画面会更稳定,也更听指令。
- 选择模式。纯文字或首尾图片生成,选“首尾帧模式”;需要参考图片、视频动作或音频,选“参考模式”。两种模式的素材不能混用。
- 只描述一个镜头。写清楚主体、场景、动作和声音。多个场景、多人轮流讲话,建议拆成多次生成。
- 先生成一个结果。建议从 576P、5–8 秒、10 Step 开始。确认动作和声音正确后,再提升画质或批量生成。
- 确认报价再提交。参考视频会产生输入费。查看生成按钮附近的费用明细;提交后在“任务”页查看进度和结果。
02按顺序写提示词
不是写得越长越好。先给不可改变的事实,再给动作与时间,最后补声音和禁止项。
- 主体:谁或什么,外观只保留最重要的 2—4 个特征
- 场景:地点、时间、光线,避免同时要求两个地点
- 镜头:景别 + 机位 + 最多一种运镜
- 时间轴:从 0 秒开始,动作有先后且覆盖完整时长
- 声音:对白、环境声、音乐分别说明;不需要的明确禁止
- 约束:只写真正重要的 3—5 条,不要堆几十个否定词
尽量只保留一个主体、一个主要动作和一种运镜。时间轴要与页面选择的输出时长一致。
03控制对白与声音
模型会根据画面语境主动补声音。只写“人物讲话”或放入有说话声的参考音频,都可能让它自行续写。
需要对白
- 只安排一个说话人,并写明普通话、方言或其他语言。
- 台词放在中文引号中,并写“只说这一句”。
- 保守控制长度:5 秒约 10—15 个汉字,10 秒约 20—30 个汉字。
- 给说话预留时间,开头和结尾各留 1—2 秒做动作与停顿。
不需要对白
人物全程闭口,不做说话口型。声音:全程无人说话、无旁白、无歌词、无广播人声,仅保留自然环境声。
例如站台场景,可以进一步指定“仅有风声、远处列车声和脚步声,无广播人声”。如果参考视频本身带有对白,也要明确不要沿用原声。
04把动作和运镜写得可执行
把最重要的动作放进时间轴,避免散文式叙述。若动作无法在选定时长内真实完成,模型通常会省略、混合或改写。
容易失控的写法
一个男人冲进房间,和三个人争吵,然后打翻桌子,跑到街上开车离开,镜头环绕并快速推拉,画面史诗感。
可执行的写法
8 秒,单一连续镜头。0—2 秒:男人推门进入房间;2—6 秒:他走到桌边,用右手打翻桌上的空杯;6—8 秒:他停在桌旁看向门口。中景固定机位,无对白,不换场,不出现其他人物。
出现“然后、接着、与此同时、镜头切到”超过两次,通常就该拆镜头。
05参考素材与上传限制
参考素材不是越多越好。素材之间人物、服装、动作或光线冲突时,模型不知道该听谁。
- 首帧
- 锁定开场人物、服装和构图;需要明确结尾姿势时再加尾帧。
- 参考图片
- 数量以当前上传策略为准。优先使用清晰正脸、背景简单、同一人物外观一致的图片。
- 参考视频
- 数量、单个大小和时长以当前上传策略为准。只参考动作、节奏或运镜,并在提示词中说明用途。
- 参考音频
- 数量与大小以当前上传策略为准。说明参考声音、音乐或节拍;不想复制说话内容时必须写清楚。
| 参考视频 | 限制 |
|---|---|
| 单个文件 | ≤ 20 MiB |
| 单段时长 | ≤ 32 秒 |
| 数量与总时长 | ≤ 6 个,合计不超过 192 秒 |
| 全部参考素材 | 图片、视频、音频合计 ≤ 100 MiB |
06参数与费用
- 576P:先验证构图、动作和提示词
- 5—8 秒:新手先做一个能完整完成的短镜头
- 10 Step:先确认指令正确;提高 Step 不能修复冲突提示词
- 生成 1 个:确认方向后再批量,减少无效消耗
积分费用分为输出费和参考视频输入费。输出费受输出时长、分辨率、Step 和当前时段价格影响;输入费按所有参考视频的实际总时长计算,不随 Step 增加。两部分都参与用户与活动折扣。
同一素材用于批量生成时,每个生成任务都会计算一次输入费;仅上传素材不是生成扣费。 查看当前价格与费用试算 →
07可复制的提示词模板
模板不是固定咒语。保留结构,根据实际时长调整时间轴。
只说指定的一句话对白镜头 · 建议 8 秒
适合口播、人物近景。把引号内文字替换成你的台词。
主体:一位 30 岁女性咖啡师,深色围裙,神情自然
场景:清晨的安静咖啡店,窗外暖光,背景没有其他顾客
镜头:胸部以上近景,固定机位,单一连续镜头
动作与时间:
0—2 秒:她端起咖啡,看向镜头
2—6 秒:她自然微笑并说完台词
6—8 秒:她轻轻放下咖啡,保持微笑
对白:她用清晰、自然的普通话只说一句:“这杯咖啡,送给早起的你。”
声音:只有上述对白和轻微咖啡店环境声;无旁白、无其他人声、无歌词
约束:口型与对白同步;不出现字幕、标志和可读文字;人物不离开画面产品与氛围画面无对白镜头 · 建议 6 秒
适合商品展示、空镜和纯动作,明确禁止模型自行加话。
主体:一只复古金色怀表,放在深色木桌中央
场景:傍晚书房,窗边柔和侧光,空气中有少量尘埃
镜头:微距近景,镜头缓慢向前推进一次
动作与时间:
0—2 秒:怀表保持静止,光线扫过金属表面
2—5 秒:一只手从画面右侧进入,缓慢打开表盖
5—6 秒:镜头停在清晰的表盘上
声音:全程无人说话、无旁白、无歌词,仅有轻微钟表滴答声
约束:单一连续镜头;不要出现字幕、标志、额外物体或第二只手人物、动作和声音各司其职参考模式 · 建议 6 秒
上传素材后,用顺序和用途点名,不要只写“参考上传内容”。
人物:严格参考第 1 张参考图的人物外观、发型、服装和面部特征
动作:参考第 1 个参考视频的转身动作与节奏,但保持人物身份和服装不变
声音:参考第 1 段参考音频的环境氛围,不复制其中的说话内容
场景:夜晚城市天台,远处霓虹虚化
镜头:中景,固定机位,单一连续镜头
动作与时间:
0—2 秒:人物背对镜头站立
2—5 秒:人物按照参考动作缓慢转身并看向镜头
5—6 秒:人物保持姿势
声音:无人说话、无旁白、无歌词
约束:不要改变人物年龄、发型和服装;不要新增人物;不出现文字08常见问题
人物乱说或语言不对
声音约束不完整,或参考音频带有人声。指定说话人、语言和唯一台词;无对白就明确禁止全部人声。
关键动作没有发生
一个镜头安排了太多动作。只留一个主要动作,并写入从 0 秒开始的时间轴。
人物不像参考图
脸太小、图片互相冲突或没有点名用途。减少参考图,使用清晰近脸,并明确“人物外观参考第 1 张图”。
镜头乱晃或构图漂移
同时要求了推进、环绕、跟拍等多种运镜。改成固定机位,或只保留一种缓慢运镜。
画面文字乱码
生成模型不擅长稳定呈现可读文字。提示词要求不出现文字,成片后再用剪辑软件添加字幕。
动作做到一半就结束
时长不足,或结尾没有预留稳定时间。延长时长、删动作,最后预留 1—2 秒保持结束姿势。
视频无法上传或生成按钮不可用
先依据页面显示的最新上传策略确认参考视频大小和时长,并等待时长读取完成。查看页面弹窗中的具体原因;素材超限、余额不足和服务暂停需要分别处理,不要连续重复提交。
09提交前最后检查
- 只有一个场景
- 只有一个主要动作
- 运镜不超过一种
- 时间轴覆盖完整时长
- 对白短且放在引号内
- 声音与对白要求不冲突
- 先生成 1 个测试
- 参考素材未超限,输入费和总价已确认
如果第一条结果偏离,不要只提高 Step。先删掉次要要求,找到模型没听懂的那一行,再逐项加回来。