Seedance 2.5 与 Wan 3.0 对决(上篇)

2026-08-19 · 约 13 分钟

这是 AI 漫剧工厂实测系列的上篇。我们在同一个晚上,用同一套素材和同一份提示词,分别生成了一支 30 秒谍战短片;随后又用一支兽首乐队 MV,把三条不同的 API 路线都跑了一遍。后来,这支 MV 又补成了 50 秒完整版本。文中的耗时、费用和失误,均来自当晚的真实记录。

如果你赶时间,先看结论

我们是怎么测的

这一晚一共跑了三组内容:

  1. 《谍报追凶》:30 秒雷暴夜追车戏,包含机枪扫射、荒诞反杀和智能座舱。人物采用写实面孔,素材包括 10 张角色与场景锁定图,以及 4 段按秒定位的对白配音。
  2. 将同一支《谍报追凶》、同一套素材和同一份提示词,分别交给 Seedance 2.5 与 Wan 3.0,比较两个模型对相同输入的处理差异。
  3. 《意网情深》:先完成 20 秒核心唱段,再延展成 50 秒完整版本。银白狐负责主唱,狗鼓手、熊猫贝斯手、墨镜鹿吉他手和兔子伴唱同时表演,后半段交给黑猫钢琴手收尾,用来观察长段演唱的口型、乐手动作、声部配合,以及模型能否把一场表演真正“演完”。

制作流程也尽量保持一致:先用 gpt-image-2 生成角色锁定图,并给角色保留眉疤、痣、耳朵缺口等稳定特征;再配好按秒定位的对白;最后把图片、声音和提示词一起交给参考生视频模型。

《谍报追凶》终稿 4K|生成引擎:Seedance 2.5 参考生视频 + video-edit 原生全息|4K 超分:字节 video-upscaler

第一件事:写实面孔会产生一笔“路由税”

在这轮测试里,Seedance 2.5 的官方通道与一条低价聚合通道都拒收了写实面孔,只有兼容度更高的参考生视频通道顺利接单,代价是费用大约高出四分之一。

谍报:引擎原生全息面板·北斗路线|Seedance 2.5 video-edit 成片帧 谍报:引擎原生全息面板·北斗路线|Seedance 2.5 video-edit 成片帧

所以,我们目前采用的办法很朴素:写实真人剧先走兼容度更高的通道;3D 国漫、兽首或明显非真人的角色,再优先尝试官方通道或低价聚合通道。这里说的是本次实测结果,不代表各平台的审核策略以后不会变化,但至少在当晚,这条分界线非常清楚。

第二件事:同一个模型,换个接口,参考音频就变了

这是整次测试中最意外的一处。

音轨频谱:对白窗与音乐层分布(分析图,非模型生成) 音轨频谱:对白窗与音乐层分布(分析图,非模型生成)

同一个模型,因为入口不同而出现截然不同的音频行为。只看模型名称,很容易误以为两边效果相同;真正跑一遍才知道不是这么回事。

把唱段补到 50 秒后,我反而看见了它的边界

20 秒版本更像一段能力展示:主唱亮相、乐队接力、群像收束,信息密度高,几乎没有空拍。50 秒版本则更接近一场完整演出——主唱退场后,灯光逐步熄灭,黑猫钢琴手留在舞台中央,把情绪慢慢送到结束。

《意网情深》50 秒完整版|生成引擎:Seedance 2.5(主唱原曲进片)+ extend 安可

这一段尾奏并不是简单的黑屏填时长。成片全长 50.08 秒,综合响度约 -14.7 LUFS,前后音轨没有明显断层;从热闹的群像过渡到单束顶光下的钢琴,听觉和画面都在有意识地收束。黑猫最后被幕布一点点吞没,只留下两只发亮的眼睛,这个结尾是有记忆点的。

但它也暴露了一个很现实的问题:完整,不等于紧凑。 前 20 秒有主唱、鼓手、贝斯手和吉他手之间的镜头交换;进入钢琴尾奏后,画面连续二十多秒停留在相近机位,情绪降下来了,视觉信息却没有继续推进。作为模型能力样片,这种长镜头能证明角色稳定性和舞台连续性;如果直接拿去发布,我会保留 50 秒完整测试版,同时再剪一支约 32—36 秒的观看版,在钢琴段补两三个手部、琴键和观众反应的近景。这样既留住余韵,也不至于让观众误以为视频已经结束。

第三件事:Wan 3.0 很慢,但并非没有吸引力

74 分钟当然算不上轻快。该通道页面给出的公测参考中位数约为 49 分钟,而我们这一单排得更久。不过,Wan 3.0 仍有三点让我愿意继续观察:

《谍报追凶》Wan 3.0 版(同素材同提示词)|生成引擎:Wan 3.0——文中排队 74 分钟的那一发

  1. 对动作题材更宽容。 在这次测试中,机枪扫射、爆炸和兵刃命中等画面,在 Seedance 的审核环节更容易受阻;Wan 3.0 接得更顺。
  2. 更愿意照着参考图来。 给它什么样的底图,它通常就沿着原有画面继续生成,不太爱擅自改戏。这一点和我们的静帧锁定流程很合拍。
  3. 价格低。 同规格里它是便宜的那个,官方直连更便宜。

因此,我暂时不会把它看作 Seedance 的替代品。它更适合打斗、机械和大场景镜头,也适合放在夜间批量提交:睡前排队,第二天再收片。前提是,你的制作节奏能容忍它慢慢跑。

第四件事:生成结束,不等于工作结束

一支 30 秒、720P 的母带接近 50MB。在跨境网络环境下,单线程下载有时比生成本身还磨人。这件事听起来很荒谬,但我们确实遇到了。

后来把流程固定成了这样:

这些步骤不如“生成一支大片”听起来有趣,却直接决定了一条生产线能不能稳定运转。

第五件事:不要把 BGM 提前混进参考对白

第二晚,我们多跑了一次几十秒的生成,真心疼——为了验证一个想法:能不能把对白和配乐提前混成一条完整音轨,再让模型一次生成成片?如果可行,就能少做一道后期。

反面教材|生成引擎:Seedance 2.5——BGM 预混导致引擎重新演绎对白

结果并不理想:

我们的结论是:参考音轨只放对白,BGM 留到后期再处理。

第六件事:审核拦下的未必是真人照片,而是“太像真人”

我们还尝试把写实风格的 3D 国漫角色提交到官方通道。四张图全部被判定为 may contain real person

天雷劫:女主特写·血泪演技(写实3D质感)|Seedance 2.5 成片帧 天雷劫:女主特写·血泪演技(写实3D质感)|Seedance 2.5 成片帧

这些素材是纯 3D 渲染,并非照片。这说明当时的审核更在意角色看起来有多逼真,而不是文件究竟来自摄影还是渲染。好在建单失败没有扣费,也算免费换来一条经验:Q 版、兽首和强风格化角色可以先试官方通道;皮肤和五官过于写实的 3D 角色,最好直接按真人素材准备备用路线。

第七件事:画面清楚了,演员也可能变成蜡像

为了减少运动模糊,我们一度在提示词里反复强调 motionlessfrozen 和“保持静止”。画面确实锐利了,但演员也失去了呼吸感:眼神不动,脸上没有细微变化,一看就不像活人。

《天雷劫》v4 终稿|生成引擎:Seedance 2.5(纯对白轨+逐秒演技提示词)|配乐后期

后来我们把写法调整为:

关键帧锁定示例|gpt-image-2 生成 关键帧锁定示例|gpt-image-2 生成

上篇小结:怎么选,取决于你最怕什么

两晚、三支片,最后留下的并不只是一批视频,更是一套比较清晰的选择方法:

你的需求 这次实测更合适的路线
写实人物 Seedance 2.5 · 高兼容参考生视频通道
对白和原始音轨尽量保真 会保留参考原声的 reference-to-video 通道
只生成画面,不要求原音进入成片 低价聚合通道
打斗、机械或审核较敏感的动作场面 Wan 3.0,可放在夜间批量生成
Q 版、兽首或强风格化角色,希望降低成本 官方通道
配乐 后期添加,参考音轨只保留纯对白

常见问题

Seedance 2.5 和 Wan 3.0,哪个更适合新手?

建议先从 Seedance 开始。它生成速度快,试错周期短,更容易在几轮之内摸清提示词与素材的关系。Wan 可以留给动作题材,或对价格更敏感、但不赶时间的批量任务。

参考音频要注意什么?

Seedance 的单段音频建议控制在 2—30 秒;Wan 的参考音频总长上限为 15 秒。比较稳妥的顺序是:先生成音档,自己完整听一遍,确认情绪、台词和时长都没有问题,再把它送进视频模型。

为什么我的成片没有声音?

先检查两件事:第一,当前接口是否真的会保留参考音频;第二,generate_audio 在这条通道里究竟表示“补环境声”,还是让模型重新生成整条声音。不同入口的处理并不一致,最好先用一条很短的素材做低成本验证,不要凭模型名称猜。


想学AI漫剧这门手艺,扫码找我

想把 AI 漫剧做明白,扫码找我。