从爆款选题到 4K 成片:选题、文案、视频一条龙,我们是怎么跑通的

2026-08-12 · 约 15 分钟

2026-08-12 凌晨生产实测。使用同一账号、同一条选题和同一套内容 Skill,只更换扩写引擎。耗时来自浏览器端点击到产物落库的计时;成本是按本次 token 用量与当日渠道价格估算,不是上游账单实扣。

凌晨两点,我盯着第二个「算力紧张」报错,已经没心情讨论哪家模型更聪明了。

用户点一次扩写,要的不是模型参数,也不是排行榜名次。他只想知道两件事:多久能拿到稿子,以及失败以后积分会不会回来。

于是我们先把按条退款和备用通道补上。凌晨四点,新版本上线。我从选题池里抓出同一条 87 分选题,分别交给 Kimi K3 和千问 3.8 Max。题目是:

晚上不吃饭减肥,反而胖了十斤。

这不是一场实验室跑分。它就是一次真实的生产任务:正文、时间轴口播稿、图文结构、平台标题、封面描述和逐镜拆片表,都得一起交出来。

先给答案

在这一次同题测试里,千问 3.8 Max 用了 144 秒,Kimi K3 用了 292 秒。千问快了约 148 秒,耗时接近 Kimi 的一半;按当日渠道价格和本次 token 用量估算,千问的上游成本也更低。

但我不会因此写「千问全面碾压 Kimi」。原因很简单:这只是一个题、各跑一次,而且两边推理档位不同。真正有用的结论是:

Kimi K3 与千问 3.8 Max 同题扩写的耗时、标题、钩子和逐镜拆片表对比
同一条 87 分选题的两份原始交卷。本文的镜数与标题比较以同轮导出的 JSON 和这张总览为准。

测试条件先摊开

项目 Kimi K3 千问 3.8 Max
产品档位名 稳定档 轻快档
推理设置
本轮耗时 292 秒 144 秒
本轮原始 JSON 拆片表 7 镜 8 镜
正文视角 第三人称「我闺蜜」 第一人称「我」
用户价格 20 积分/条 20 积分/条
上游成本口径 按 token 与当日单价估算 按 token 与当日单价估算

这里有三个限制必须提前说清。

第一,两边推理档位不同(Kimi 为高档,千问为中档);第二,每个模型只跑了一次。因此,144 秒和 292 秒是这一次任务的真实结果,不是长期平均速度。

文章可以有立场,数据不能装作比自己更大。

第一回合:144 秒对 292 秒,速度差能不能感知

能,而且非常明显。

千问 144 秒交卷时,我还能把注意力留在这个选题上。Kimi 到 292 秒才回来,已经足够让人切去处理别的工作,再回来重新找上下文。

如果只是偶尔扩写一条,这两分多钟不算灾难;如果一天要处理几十条,差距会被放大。20 条任务按本轮结果粗算,串行等待时间会相差将近 50 分钟。

不过别忘了背景:Kimi 这轮开的是高档推理,千问是中档。更慢不一定代表底层模型天生慢,也可能是我们主动让它想得更久。下一轮若要得出更硬的速度结论,应当统一推理强度,并在同一时段至少各跑 10 次,记录中位数和失败率。

第二回合:便宜一半,还是一句容易误导人的标题

原稿里有一句「所有数字来自真实账单」,我把它删了。

耗时确实是真实计时,但这篇文章里的成本不是从最终账单字段直接读取,而是用本次 token 用量乘以 2026-08-12 的渠道单价估算。按这个口径,Kimi 大约是大几毛到一块出头,千问约三五毛,后者接近前者的一半。

这个差距对内部毛利有意义,对用户当次选择却没有价格差:两个档位现在都是 20 积分一条。用户真正买的是等待时间、文风和一次成功率,不是我们后台的 token 单价。

所以更准确的说法不是「千问一定便宜一半」,而是:本轮估算中,千问的上游成本约为 Kimi 的一半;价格会随 token 用量和渠道单价变化。

第三回合:两个模型,写出了两种“人设”

千问的开场很猛:

我一口晚饭没吃,坚持了整整三个月,上秤一看——胖了十斤。

它把原题改成了第一人称亲历,还把「晚上不吃饭」拧成「一口晚饭没吃」。传播上更狠,画面也立刻出来了。

问题也在这里:如果作者本人没经历过,这不是“更有网感”,而是凭空替作者捏了一段人生。短视频里最容易被忽略的失真,往往就藏在这种看起来特别顺口的第一句里。

Kimi 的开场是:

晚上不吃饭减肥?我闺蜜三个月,反而胖了十斤。

它没有把故事压到作者本人身上,但「我闺蜜」同样可能是虚构。两种写法都很像内容平台上的真人表达,也都必须由真人负责:有真实经历就保留,没有就改成「我见过一个很典型的情况」或直接讲机制。

这轮最值得记住的,不是哪家更会装人,而是:模型越会写“活人感”,越要防它顺手编造活人经历。

第四回合:拆片表有没有到“照着就能拍”

这一项两边都比正文更让我满意。

千问在第二镜写了「代谢切成省电模式」,同时给出一个很具体的画面:半透明电池图标从满格掉到一格。Kimi 对应的处理是让人物躺在床上摸肚子,把咕叫声放大,再给「身体在报警」加红色描边。

前者是视觉比喻,后者是生活声音。都不是高深创意,但导演拿到以后不用再问「这一句到底拍什么」。这就是结构化拆片表的价值:它不只是把文案切成八段,而是把台词、场景、景别、动作、运镜和剪辑备注绑在一起。

千问本轮 JSON 给了 8 镜,Kimi 本轮 JSON 给了 7 镜。镜数多不自动等于质量高,但对短视频初稿来说,多一镜通常意味着节奏更细、后期更容易取舍。

真正让我踩刹车的,是那些“听起来很对”的句子

两份稿子都引用了《中国居民膳食指南(2022)》,也都写了「代谢省电」「晚餐占全天热量三成」「七点前吃完」一类判断。

这些句子很适合传播,因为短、狠、好懂。也正因为如此,发布前更需要查证。比如「消耗热量砍了将近一半」是很具体的量化结论,原始产物没有给出对应依据;「七点前吃完」也不能脱离作息、总摄入和个体情况写成普遍规则。

这轮测试比的是内容生产能力,不是营养学正确率。若把成品直接发出去,模型写得越流畅,错误越容易被当成常识。

所以我们现在把最终流程拆成两层:模型负责生成结构和表达,人负责核对经历、数字、医学与营养建议。可拍不等于可发。

如果今天就要选,我会怎么用

日更、追热点、批量做选题,我会先用千问。它这轮速度快,成本估算低,拆片更细,而且第一版已经有明显的镜头意识。

品牌账号、专家账号或对口吻敏感的内容,我不会直接把任务全扔给某一个模型。我会让模型先交结构,再由作者把虚构经历、夸张数字和不属于自己的人设拿掉。Kimi 可以做一个更克制的备选,但这轮之前它刚出现过两次上游「算力紧张」,不能只因为产品档位叫“稳定档”就宣布它更稳定。

如果预算允许,同一条重点选题跑两个版本也有价值:用千问的镜头结构,吸收 Kimi 的表达,再由真人写最后一遍。不是把两份答案机械拼起来,而是让它们互相暴露盲点。

这次故障留下的产品结论

凌晨的两次失败,最后比模型 PK 本身更有价值。

上游模型会排队、会限流、会临时不可用,这些都不是用户能控制的。产品能控制的是:失败是否按条退款、错误有没有说人话、主通道连续失败后能不能切到备用通道,以及单机双核会不会因为自作聪明地提高并发而把整台机器拖死。

我们最后保留串行执行。慢一点可以解释,任务互相抢资源、一起挂掉就解释不通了。

所以这篇实测最后真正想回答的,不是「Kimi 和千问谁赢」,而是:当模型进入真实生产,速度、成本、内容诚实度和失败恢复,缺一个都不算交付。

这轮测试的局限

彩蛋:这条选题,我们顺手做成了 4K 成片

光比文案不过瘾。写完这篇的当晚,我们把这条选题直接推完了整条流水线:文案 → 海报 → 5 秒成片 → 4K 超分,全程没离开这个网站。

先看两版拆片表各自的第一镜,被画成了什么样:

千问版第一镜海报:越饿越胖 Kimi 版第一镜海报:反而胖了十斤

然后让海报动起来(5 秒,一条 720p、一条 480p),再各做一次 4K 超分放大:

超分到底有没有用?同一帧、同一块脸部裁切,放大到同尺寸对比(左边是原片,右边是 4K 超分):

720p 原片与 4K 超分同帧对比 480p 原片与 4K 超分同帧对比

两个数字:480p 原片 560×752,超分后 2160×2902——像素量放大约 15 倍,睫毛、碗沿反光、字幕描边全都回来了。底图生成得够干净,超分才有东西可挖;这两步一个都不能省。

(画面含站名水印;原始素材归本站所有,请勿转用。)

常见问题

Kimi K3 和千问 3.8 Max,哪个生成文章更快?

在 2026-08-12 这次同题实测中,千问 3.8 Max 用时 144 秒,Kimi K3 用时 292 秒,千问少用约 148 秒。不过 Kimi 使用高档推理,千问使用中档,而且两者通道不同;这个结果代表本次生产任务,不等于长期平均速度。

Kimi K3 和千问 3.8 Max,哪个成本更低?

按本次 token 用量和当日渠道单价估算,千问约三五毛,Kimi 约大几毛到一块出头,千问接近 Kimi 的一半。这个数字是估算,不是最终账单实扣;两者面向用户目前均为 20 积分一条。

做短视频脚本应该选 Kimi K3 还是千问 3.8 Max?

赶热点、日更或批量生产时,可以优先试千问;它本轮更快,拆片结构也更细。专家账号、品牌内容或对人设真实性要求高的内容,无论选哪一个,都应由真人复核亲历叙事、数字和专业建议,而不是直接发布模型原稿。

为什么同一个模型有时很快,有时提示算力紧张?

模型速度不只由模型本身决定,也受到供应商排队、时段流量、推理档位和备用通道状态影响。生产系统应设置明确超时、有限重试、失败退款和备用供应商,不能让用户靠反复点击碰运气。

逐镜拆片表是额外收费的吗?

不是。本产品当前按扩写任务收取 20 积分/条,逐镜拆片表与正文、时间轴脚本、图文结构、平台标题和封面描述在同一次扩写中生成,不单独收费。实际价格以后续站内页面为准。

两个模型的正文和拆片表可以混用吗?

可以。产物采用结构化字段,可以选择一个版本的正文和另一个版本的镜头设计。但混用后仍要检查台词与镜头是否一一对应,避免出现正文已经改了、拆片表还保留旧台词的情况。

模型生成的健康与营养内容可以直接发布吗?

不建议。模型可能生成听起来合理但缺少依据的具体数字、因果关系或统一时间规则。发布前应核对权威来源,删除虚构经历,并根据账号定位增加必要免责声明。本文比较的是内容生产能力,不提供个人饮食或医疗建议。


本轮测试使用选题 ID 9jB3lROllD。原始记录包括 Kimi K3 与千问 3.8 Max 的 JSON 产物、真实页面截图和同题对比总览。模型能力、渠道价格与供应商状态会变化,本文保留的是测试方法和当时结果。