聚好帧
聚好帧 帮助中心
聚
帮助中心/使用教程

请检查后重试

聚好帧 视频创作指南

从第一个镜头开始:写清楚画面、选择参考素材、确认费用,再提交生成。

适用于首尾帧模式与参考模式 · 可复制的提示词模板

01快速开始

聚好帧 更像一位执行镜头的摄影团队,而不是自动补完故事的编剧。一个镜头只安排一个主要事件,画面会更稳定,也更听指令。

  1. 选择模式。纯文字或首尾图片生成,选“首尾帧模式”;需要参考图片、视频动作或音频,选“参考模式”。两种模式的素材不能混用。
  2. 只描述一个镜头。写清楚主体、场景、动作和声音。多个场景、多人轮流讲话,建议拆成多次生成。
  3. 先生成一个结果。建议从 576P、5–8 秒、10 Step 开始。确认动作和声音正确后,再提升画质或批量生成。
  4. 确认报价再提交。参考视频会产生输入费。查看生成按钮附近的费用明细;提交后在“任务”页查看进度和结果。
生成结果具有随机性。更高的分辨率或 Step 不保证对白准确,也不能修复互相矛盾的指令。

02按顺序写提示词

不是写得越长越好。先给不可改变的事实,再给动作与时间,最后补声音和禁止项。

  1. 主体:谁或什么,外观只保留最重要的 2—4 个特征
  2. 场景:地点、时间、光线,避免同时要求两个地点
  3. 镜头:景别 + 机位 + 最多一种运镜
  4. 时间轴:从 0 秒开始,动作有先后且覆盖完整时长
  5. 声音:对白、环境声、音乐分别说明;不需要的明确禁止
  6. 约束:只写真正重要的 3—5 条,不要堆几十个否定词

尽量只保留一个主体、一个主要动作和一种运镜。时间轴要与页面选择的输出时长一致。

03控制对白与声音

模型会根据画面语境主动补声音。只写“人物讲话”或放入有说话声的参考音频,都可能让它自行续写。

需要对白

  • 只安排一个说话人,并写明普通话、方言或其他语言。
  • 台词放在中文引号中,并写“只说这一句”。
  • 保守控制长度:5 秒约 10—15 个汉字,10 秒约 20—30 个汉字。
  • 给说话预留时间,开头和结尾各留 1—2 秒做动作与停顿。

不需要对白

人物全程闭口,不做说话口型。声音:全程无人说话、无旁白、无歌词、无广播人声,仅保留自然环境声。

例如站台场景,可以进一步指定“仅有风声、远处列车声和脚步声,无广播人声”。如果参考视频本身带有对白,也要明确不要沿用原声。

不要同时要求“安静无声”和“人物讲话”,也不要把两个人的多轮对话塞进一个短镜头。

04把动作和运镜写得可执行

把最重要的动作放进时间轴,避免散文式叙述。若动作无法在选定时长内真实完成,模型通常会省略、混合或改写。

容易失控的写法

一个男人冲进房间,和三个人争吵,然后打翻桌子,跑到街上开车离开,镜头环绕并快速推拉,画面史诗感。

可执行的写法

8 秒,单一连续镜头。0—2 秒:男人推门进入房间;2—6 秒:他走到桌边,用右手打翻桌上的空杯;6—8 秒:他停在桌旁看向门口。中景固定机位,无对白,不换场,不出现其他人物。

出现“然后、接着、与此同时、镜头切到”超过两次,通常就该拆镜头。

05参考素材与上传限制

参考素材不是越多越好。素材之间人物、服装、动作或光线冲突时,模型不知道该听谁。

首帧
锁定开场人物、服装和构图;需要明确结尾姿势时再加尾帧。
参考图片
数量以当前上传策略为准。优先使用清晰正脸、背景简单、同一人物外观一致的图片。
参考视频
数量、单个大小和时长以当前上传策略为准。只参考动作、节奏或运镜,并在提示词中说明用途。
参考音频
数量与大小以当前上传策略为准。说明参考声音、音乐或节拍;不想复制说话内容时必须写清楚。
参考视频限制
单个文件≤ 20 MiB
单段时长≤ 32 秒
数量与总时长≤ 6 个,合计不超过 192 秒
全部参考素材图片、视频、音频合计 ≤ 100 MiB

文件大小按 1 MiB = 1,024 × 1,024 字节校验。超限请先压缩或裁剪;更改文件后缀不会缩小体积。

上传后按顺序点名:第 1 张参考图的人物、第 1 个参考视频的动作、第 1 段参考音频的节奏。参考模式不能与首尾关键帧同时使用。

06参数与费用

  • 576P:先验证构图、动作和提示词
  • 5—8 秒:新手先做一个能完整完成的短镜头
  • 10 Step:先确认指令正确;提高 Step 不能修复冲突提示词
  • 生成 1 个:确认方向后再批量,减少无效消耗

积分费用分为输出费和参考视频输入费。输出费受输出时长、分辨率、Step 和当前时段价格影响;输入费按所有参考视频的实际总时长计算,不随 Step 增加。两部分都参与用户与活动折扣。

同一素材用于批量生成时,每个生成任务都会计算一次输入费;仅上传素材不是生成扣费。 查看当前价格与费用试算 →

07可复制的提示词模板

模板不是固定咒语。保留结构,根据实际时长调整时间轴。

只说指定的一句话对白镜头 · 建议 8 秒

适合口播、人物近景。把引号内文字替换成你的台词。

主体:一位 30 岁女性咖啡师,深色围裙,神情自然
场景:清晨的安静咖啡店,窗外暖光,背景没有其他顾客
镜头:胸部以上近景,固定机位,单一连续镜头
动作与时间:
0—2 秒:她端起咖啡,看向镜头
2—6 秒:她自然微笑并说完台词
6—8 秒:她轻轻放下咖啡,保持微笑
对白:她用清晰、自然的普通话只说一句:“这杯咖啡,送给早起的你。”
声音:只有上述对白和轻微咖啡店环境声;无旁白、无其他人声、无歌词
约束:口型与对白同步;不出现字幕、标志和可读文字;人物不离开画面
产品与氛围画面无对白镜头 · 建议 6 秒

适合商品展示、空镜和纯动作,明确禁止模型自行加话。

主体:一只复古金色怀表,放在深色木桌中央
场景:傍晚书房,窗边柔和侧光,空气中有少量尘埃
镜头:微距近景,镜头缓慢向前推进一次
动作与时间:
0—2 秒:怀表保持静止,光线扫过金属表面
2—5 秒:一只手从画面右侧进入,缓慢打开表盖
5—6 秒:镜头停在清晰的表盘上
声音:全程无人说话、无旁白、无歌词,仅有轻微钟表滴答声
约束:单一连续镜头;不要出现字幕、标志、额外物体或第二只手
人物、动作和声音各司其职参考模式 · 建议 6 秒

上传素材后,用顺序和用途点名,不要只写“参考上传内容”。

人物:严格参考第 1 张参考图的人物外观、发型、服装和面部特征
动作:参考第 1 个参考视频的转身动作与节奏,但保持人物身份和服装不变
声音:参考第 1 段参考音频的环境氛围,不复制其中的说话内容
场景:夜晚城市天台,远处霓虹虚化
镜头:中景,固定机位,单一连续镜头
动作与时间:
0—2 秒:人物背对镜头站立
2—5 秒:人物按照参考动作缓慢转身并看向镜头
5—6 秒:人物保持姿势
声音:无人说话、无旁白、无歌词
约束:不要改变人物年龄、发型和服装;不要新增人物;不出现文字

08常见问题

人物乱说或语言不对

声音约束不完整,或参考音频带有人声。指定说话人、语言和唯一台词;无对白就明确禁止全部人声。

关键动作没有发生

一个镜头安排了太多动作。只留一个主要动作,并写入从 0 秒开始的时间轴。

人物不像参考图

脸太小、图片互相冲突或没有点名用途。减少参考图,使用清晰近脸,并明确“人物外观参考第 1 张图”。

镜头乱晃或构图漂移

同时要求了推进、环绕、跟拍等多种运镜。改成固定机位,或只保留一种缓慢运镜。

画面文字乱码

生成模型不擅长稳定呈现可读文字。提示词要求不出现文字,成片后再用剪辑软件添加字幕。

动作做到一半就结束

时长不足,或结尾没有预留稳定时间。延长时长、删动作,最后预留 1—2 秒保持结束姿势。

视频无法上传或生成按钮不可用

先依据页面显示的最新上传策略确认参考视频大小和时长,并等待时长读取完成。查看页面弹窗中的具体原因;素材超限、余额不足和服务暂停需要分别处理,不要连续重复提交。

09提交前最后检查

  • 只有一个场景
  • 只有一个主要动作
  • 运镜不超过一种
  • 时间轴覆盖完整时长
  • 对白短且放在引号内
  • 声音与对白要求不冲突
  • 先生成 1 个测试
  • 参考素材未超限,输入费和总价已确认

如果第一条结果偏离,不要只提高 Step。先删掉次要要求,找到模型没听懂的那一行,再逐项加回来。

聚好帧 · 系统通知

通知标题

在此展示通知内容。
聚好帧

平台公告

重大更新与维护信息

已发布公告0 条公告
正在加载公告