4 段 × 30 秒 还是 6 段 × 15 秒:换一个成片引擎,整条剧本流水线要跟着改什么

2026-08-06 · 约 7 分钟

2026-08-06 记录。段表结构、参考图上限与优先级排序均来自当天在自家代码里逐处核对的结果。

做整集 AI 短剧,绕不开一个问题:一集两分钟,要切成几段来生成。

这不是随手选一个数字。成片引擎决定了段长,段长决定了剧本该怎么写、每段能塞几张参考图、以及角色的脸能不能跨段保持一致。 换引擎不是换个下拉选项,是整条流水线的参数要跟着重算。

我们目前接了三种结构:

档位 段数 × 段长 整集
快速 / 标准 5–6 段 × 约 15 秒 约 90 秒
加长 4 段 × 约 30 秒 约 120 秒
高清 7–8 段 × 约 15 秒 约 120 秒

最后一档段数多,是因为那个引擎的时长被钉死在 15 秒——它不接受别的值,想凑到 120 秒就只能切 8 段。这是硬约束,不是我们的偏好。

下面是换段长时真正会出问题的几处。

一、对白密度门槛必须跟着段长走,字数门槛不能

这是最容易改错的一处,而且改错的方向很反直觉。

假设你有一道门槛,要求「一集至少 N 句对白」。N 从哪来?常见做法是按总秒数推:总秒数 ÷ 每段秒数 = 段数,段数 × 每段句数 = N。

问题在于「每段秒数」如果写死成 15,换成 4×30 的结构就崩了:120 ÷ 15 = 8 段,8 段 × 3 句 = 24 句(留白折算后 21 句)。而实际只有 4 段,每段写 4 句是正常密度,全集 16 句——一份结构完全正确的剧本,天然到不了门槛。

所以对白门槛要用真实段数 × 该段长对应的句数。

但同一时间,正文字数门槛不能这么改。120 秒的集比 90 秒的集更长,字数要求只能更高不能更低。如果把「按真实段数算」也套到字数上,4 段算出来的字数门槛会比 6 段的短档还松,门槛倒挂。

两个门槛,两个基准:

顺带一提,每段句数本身也该随段长变。15 秒段 3 句合理,30 秒段还写 3 句就明显撑不满——这是「AI 短剧里人物老在发呆」的一个常见来源。我们的取法是 15 秒段 3 句、30 秒及以上 4 句,按每 7 秒一句留出表演空间。

改这类门槛算法有个必须遵守的纪律:先把旧档位的阈值写成回归测试再动手。我们那个函数的注释里写着「180 秒档必须精确落回 280 字 / 30 句」,那是前人踩坑后留下的护栏。满足新场景的同时打破旧场景,几周后才会有人发现。

二、参考图只有 9 席,段长变了要重新分配

这一条是很多人做到一半才撞上的。

图生视频可以带参考图,但数量有上限。我们对接的引擎单次最多 9 张图。听起来够用,实际非常紧张,因为要放的东西很多:

一段戏里三个角色 + 两套服装 + 一个场景 + 三件道具,加上静帧和末帧,已经是 10 张——超了。

所以必须有明确的优先级。我们的排法是:

本段静帧 > 上段末帧 > 角色(证件照) > 角色(全身) > 服装 > 场景 > 道具

几个判断依据:

静帧永远占一席。 它是「这一段应该长什么样」的唯一依据,丢了它模型就只能靠文字瞎猜。

末帧只留一席。 第二张末帧几乎只是重复起幅信息,却要挤掉一个角色或场景。

同一角色拆了证件照和全身照时,证件照先行。 身份漂移是所有问题里最难治的——观众能容忍衣服细节变化,不能容忍换脸。

道具排在最后。 不是因为道具不重要,而是道具可以靠跨集编号锁来保一致性(给每件道具发一个固定编号,在提示词里声明「跨集同号,禁止另造同名道具」),对参考图位的依赖比锁脸低。

段长一变,这个预算就要重算。30 秒段里出场的角色和道具通常比 15 秒段多,同样 9 席要装更多东西,让位规则会被更频繁地触发。

三、单件参考图 vs 拼板图

顺着上一条说一个容易被忽略的点。

美术给的道具设定图,经常是「一张拼板放八件道具」的形式——省事、好看、适合给人看。但作为参考图喂给模型时,模型收到的是一张有八个物件的图,你在提示词里说「用第 3 件」,它得自己猜是哪一件。同材质的物件(两块玉、两片甲)尤其容易混。

给道具编号能解决「跨集不漂移」,但解决不了「这一张图里到底指哪件」。这是两个不同的问题,很容易被当成一个。

真要锁稳,得把拼板切成单件图。好消息是这类设定图通常是规整网格,用图像处理库按坐标裁切就行,零模型调用——不需要花钱调「智能抠图」。裁的时候记得把格子下方的中文标题一起裁掉,否则那些字有概率被当成画面内容画进视频里。

四、板式元素会被当成画面结构复制

同一个道理还有个更隐蔽的版本。

导演分镜板这类东西——主画面 + 底部几个编号小格 + 右侧文字栏——作为拍摄沟通材料非常有用。但如果直接整张丢进图生视频当参考,模型有相当概率把「四格拼贴」当成你想要的目标画面结构,生成出一段带格线和编号的视频。

处理办法是只留主画面,把编号格和文字栏裁掉。文字栏里的内容本来就已经以文字形式写进提示词了,图上留着只是徒增风险。主画面上如果有标注箭头(红色标人物走位、青色标镜头运动),可以保留,但要在提示词里明写这些是拍摄引导、不得出现在成片画面中。

换引擎前的检查清单

如果你也在多个成片引擎之间切换,这几处建议逐条确认:

一、段表有没有真的按引擎切换,还是静默回落了。 我们查过一处:某个引擎压根不在段表配置里,用户选了它,代码会静默回落到默认档的段数与秒数——段数和时长全错,但没有任何报错。加新引擎时,配置表和类型判断要一起放宽。

二、默认档位要不要跟权限联动。 如果最好的引擎是付费专享,把它设成默认,无权限的用户一进来就默认选中一个跑不了的东西。默认值应该按权限解析,有权限给好的、没权限回落。

三、门槛的单位是否和结构一致。 前面说的那种「一边按固定段长反推、一边按真实段数算」的错配,在任何有多档结构的系统里都会出现。

四、对外文案不要写死枚举。 我们踩过:提示语里手写「请选择成片引擎(快速 / 标准 / 加长)」,加了「高清」档之后这句话没跟着改,用户看到的选项和提示对不上。从配置表动态拼,加档才不会漏。

五、时长是硬约束的引擎,要在文档里标清楚。 固定 15 秒不是缺陷,是取舍——它换来的是更高的原生分辨率。但做成本对比时,这是个必须披露的混淆变量,不能假装几家条件一样。


结构与优先级为 2026-08-06 当日实现。具体数值随引擎能力变化,判断方法可复用。