Seedance 2.5 与 Wan 3.0 对决(上篇)
这是 AI 漫剧工厂实测系列的上篇。我们在同一个晚上,用同一套素材和同一份提示词,分别生成了一支 30 秒谍战短片;随后又用一支兽首乐队 MV,把三条不同的 API 路线都跑了一遍。后来,这支 MV 又补成了 50 秒完整版本。文中的耗时、费用和失误,均来自当晚的真实记录。
如果你赶时间,先看结论
- 速度差距很明显。 Seedance 2.5 生成 30 秒、720P 的视频用了约 8 分钟;20 秒核心唱段最快不到 3 分钟。同样规格的 Wan 3.0 在另一条异步通道跑了 74 分钟。对于需要连续更新的人来说,这不是单纯的快慢之别,而是“今天能不能发”的区别。
- 价格各有优势。 同规格下,Seedance 2.5 走高兼容通道最贵,聚合通道居中;Wan 3.0 明显便宜,官方直连理论上更低——但我们的接口申请当晚还没批下来,暂时没跑通。
- 真正拉开体验差距的是音频。 同一个 Seedance 2.5,经不同接口调用,参考音频的处理方式完全不同。这是整次测试里最容易踩坑、也最值得提前知道的一点。
我们是怎么测的
这一晚一共跑了三组内容:
- 《谍报追凶》:30 秒雷暴夜追车戏,包含机枪扫射、荒诞反杀和智能座舱。人物采用写实面孔,素材包括 10 张角色与场景锁定图,以及 4 段按秒定位的对白配音。
- 将同一支《谍报追凶》、同一套素材和同一份提示词,分别交给 Seedance 2.5 与 Wan 3.0,比较两个模型对相同输入的处理差异。
- 《意网情深》:先完成 20 秒核心唱段,再延展成 50 秒完整版本。银白狐负责主唱,狗鼓手、熊猫贝斯手、墨镜鹿吉他手和兔子伴唱同时表演,后半段交给黑猫钢琴手收尾,用来观察长段演唱的口型、乐手动作、声部配合,以及模型能否把一场表演真正“演完”。
制作流程也尽量保持一致:先用 gpt-image-2 生成角色锁定图,并给角色保留眉疤、痣、耳朵缺口等稳定特征;再配好按秒定位的对白;最后把图片、声音和提示词一起交给参考生视频模型。
《谍报追凶》终稿 4K|生成引擎:Seedance 2.5 参考生视频 + video-edit 原生全息|4K 超分:字节 video-upscaler
第一件事:写实面孔会产生一笔“路由税”
在这轮测试里,Seedance 2.5 的官方通道与一条低价聚合通道都拒收了写实面孔,只有兼容度更高的参考生视频通道顺利接单,代价是费用大约高出四分之一。
谍报:引擎原生全息面板·北斗路线|Seedance 2.5 video-edit 成片帧
所以,我们目前采用的办法很朴素:写实真人剧先走兼容度更高的通道;3D 国漫、兽首或明显非真人的角色,再优先尝试官方通道或低价聚合通道。这里说的是本次实测结果,不代表各平台的审核策略以后不会变化,但至少在当晚,这条分界线非常清楚。
第二件事:同一个模型,换个接口,参考音频就变了
这是整次测试中最意外的一处。
音轨频谱:对白窗与音乐层分布(分析图,非模型生成)
- 一条参考生视频通道会把参考音频原声带进成片。 我们提供的 4 段对白按原声、原顺序进入视频,时间点也基本保持不变。模型还补上了雨声、旋翼和引擎声,并在对白出现时主动压低环境音。对短剧来说,这才接近我们理解的“音轨锁定”。
- 另一条聚合通道只把参考音频当作表演依据。 它根据原歌重新唱了一版,音色接近,但并不是原始录音;环境声也由模型自行决定。如果你要做对白剧或严格对口型的 MV,这种结果很难直接交付;如果只生成没有固定台词的画面,它倒是仍有用武之地。
同一个模型,因为入口不同而出现截然不同的音频行为。只看模型名称,很容易误以为两边效果相同;真正跑一遍才知道不是这么回事。
把唱段补到 50 秒后,我反而看见了它的边界
20 秒版本更像一段能力展示:主唱亮相、乐队接力、群像收束,信息密度高,几乎没有空拍。50 秒版本则更接近一场完整演出——主唱退场后,灯光逐步熄灭,黑猫钢琴手留在舞台中央,把情绪慢慢送到结束。
《意网情深》50 秒完整版|生成引擎:Seedance 2.5(主唱原曲进片)+ extend 安可
这一段尾奏并不是简单的黑屏填时长。成片全长 50.08 秒,综合响度约 -14.7 LUFS,前后音轨没有明显断层;从热闹的群像过渡到单束顶光下的钢琴,听觉和画面都在有意识地收束。黑猫最后被幕布一点点吞没,只留下两只发亮的眼睛,这个结尾是有记忆点的。
但它也暴露了一个很现实的问题:完整,不等于紧凑。 前 20 秒有主唱、鼓手、贝斯手和吉他手之间的镜头交换;进入钢琴尾奏后,画面连续二十多秒停留在相近机位,情绪降下来了,视觉信息却没有继续推进。作为模型能力样片,这种长镜头能证明角色稳定性和舞台连续性;如果直接拿去发布,我会保留 50 秒完整测试版,同时再剪一支约 32—36 秒的观看版,在钢琴段补两三个手部、琴键和观众反应的近景。这样既留住余韵,也不至于让观众误以为视频已经结束。
第三件事:Wan 3.0 很慢,但并非没有吸引力
74 分钟当然算不上轻快。该通道页面给出的公测参考中位数约为 49 分钟,而我们这一单排得更久。不过,Wan 3.0 仍有三点让我愿意继续观察:
《谍报追凶》Wan 3.0 版(同素材同提示词)|生成引擎:Wan 3.0——文中排队 74 分钟的那一发
- 对动作题材更宽容。 在这次测试中,机枪扫射、爆炸和兵刃命中等画面,在 Seedance 的审核环节更容易受阻;Wan 3.0 接得更顺。
- 更愿意照着参考图来。 给它什么样的底图,它通常就沿着原有画面继续生成,不太爱擅自改戏。这一点和我们的静帧锁定流程很合拍。
- 价格低。 同规格里它是便宜的那个,官方直连更便宜。
因此,我暂时不会把它看作 Seedance 的替代品。它更适合打斗、机械和大场景镜头,也适合放在夜间批量提交:睡前排队,第二天再收片。前提是,你的制作节奏能容忍它慢慢跑。
第四件事:生成结束,不等于工作结束
一支 30 秒、720P 的母带接近 50MB。在跨境网络环境下,单线程下载有时比生成本身还磨人。这件事听起来很荒谬,但我们确实遇到了。
后来把流程固定成了这样:
- 母带先留在云端,并做对象存储备份;4K 超分和后期合成都尽量云端处理。
- 审片只下载约 5MB 的压缩小样,几秒钟就能拿到,足够判断画面、表演和节奏是否合格。
- 确定要交付时再下载母带,并使用断点续传,避免从头重来。
这些步骤不如“生成一支大片”听起来有趣,却直接决定了一条生产线能不能稳定运转。
第五件事:不要把 BGM 提前混进参考对白
第二晚,我们多跑了一次几十秒的生成,真心疼——为了验证一个想法:能不能把对白和配乐提前混成一条完整音轨,再让模型一次生成成片?如果可行,就能少做一道后期。
反面教材|生成引擎:Seedance 2.5——BGM 预混导致引擎重新演绎对白
结果并不理想:
- 使用纯对白轨时,句子之间保留真正的静音,五句台词都按原声和原有时间进入成片。
- 换成“对白+BGM”的预混音轨后,模型开始重新理解整段表演。女主的质问变成了男声,一句招式名被念了两遍,时间线也被整体压缩,剧情随之失去连贯性。
我们的结论是:参考音轨只放对白,BGM 留到后期再处理。
第六件事:审核拦下的未必是真人照片,而是“太像真人”
我们还尝试把写实风格的 3D 国漫角色提交到官方通道。四张图全部被判定为 may contain real person。
天雷劫:女主特写·血泪演技(写实3D质感)|Seedance 2.5 成片帧
这些素材是纯 3D 渲染,并非照片。这说明当时的审核更在意角色看起来有多逼真,而不是文件究竟来自摄影还是渲染。好在建单失败没有扣费,也算免费换来一条经验:Q 版、兽首和强风格化角色可以先试官方通道;皮肤和五官过于写实的 3D 角色,最好直接按真人素材准备备用路线。
第七件事:画面清楚了,演员也可能变成蜡像
为了减少运动模糊,我们一度在提示词里反复强调 motionless、frozen 和“保持静止”。画面确实锐利了,但演员也失去了呼吸感:眼神不动,脸上没有细微变化,一看就不像活人。
《天雷劫》v4 终稿|生成引擎:Seedance 2.5(纯对白轨+逐秒演技提示词)|配乐后期
后来我们把写法调整为:
- 在容易漂移的段落补全身关键帧,尤其是结尾长镜头。多做一张稳定的图,往往比反复抽一条视频划算。
- Seedance 和 Wan 对中文影视表达的理解都不错,中文提示词反而更直接,不必为了显得专业而堆英文术语。
关键帧锁定示例|gpt-image-2 生成
上篇小结:怎么选,取决于你最怕什么
两晚、三支片,最后留下的并不只是一批视频,更是一套比较清晰的选择方法:
| 你的需求 | 这次实测更合适的路线 |
|---|---|
| 写实人物 | Seedance 2.5 · 高兼容参考生视频通道 |
| 对白和原始音轨尽量保真 | 会保留参考原声的 reference-to-video 通道 |
| 只生成画面,不要求原音进入成片 | 低价聚合通道 |
| 打斗、机械或审核较敏感的动作场面 | Wan 3.0,可放在夜间批量生成 |
| Q 版、兽首或强风格化角色,希望降低成本 | 官方通道 |
| 配乐 | 后期添加,参考音轨只保留纯对白 |
常见问题
Seedance 2.5 和 Wan 3.0,哪个更适合新手?
建议先从 Seedance 开始。它生成速度快,试错周期短,更容易在几轮之内摸清提示词与素材的关系。Wan 可以留给动作题材,或对价格更敏感、但不赶时间的批量任务。
参考音频要注意什么?
Seedance 的单段音频建议控制在 2—30 秒;Wan 的参考音频总长上限为 15 秒。比较稳妥的顺序是:先生成音档,自己完整听一遍,确认情绪、台词和时长都没有问题,再把它送进视频模型。
为什么我的成片没有声音?
先检查两件事:第一,当前接口是否真的会保留参考音频;第二,generate_audio 在这条通道里究竟表示“补环境声”,还是让模型重新生成整条声音。不同入口的处理并不一致,最好先用一条很短的素材做低成本验证,不要凭模型名称猜。

想把 AI 漫剧做明白,扫码找我。