从爆款选题到 4K 成片:选题、文案、视频一条龙,我们是怎么跑通的
2026-08-12 凌晨生产实测。使用同一账号、同一条选题和同一套内容 Skill,只更换扩写引擎。耗时来自浏览器端点击到产物落库的计时;成本是按本次 token 用量与当日渠道价格估算,不是上游账单实扣。
凌晨两点,我盯着第二个「算力紧张」报错,已经没心情讨论哪家模型更聪明了。
用户点一次扩写,要的不是模型参数,也不是排行榜名次。他只想知道两件事:多久能拿到稿子,以及失败以后积分会不会回来。
于是我们先把按条退款和备用通道补上。凌晨四点,新版本上线。我从选题池里抓出同一条 87 分选题,分别交给 Kimi K3 和千问 3.8 Max。题目是:
晚上不吃饭减肥,反而胖了十斤。
这不是一场实验室跑分。它就是一次真实的生产任务:正文、时间轴口播稿、图文结构、平台标题、封面描述和逐镜拆片表,都得一起交出来。
先给答案
在这一次同题测试里,千问 3.8 Max 用了 144 秒,Kimi K3 用了 292 秒。千问快了约 148 秒,耗时接近 Kimi 的一半;按当日渠道价格和本次 token 用量估算,千问的上游成本也更低。
但我不会因此写「千问全面碾压 Kimi」。原因很简单:这只是一个题、各跑一次,而且两边推理档位不同。真正有用的结论是:
- 赶热点、做日更、需要快速拿到可拍结构,千问这轮更合适。
- 更在意语气克制和标题控制时,Kimi 的原始 JSON 更稳一些,但不能把产品里的「稳定档」名称当成稳定性证明。
- 两边都会为了抓人而虚构「我」或「我闺蜜」的亲历故事,也都会生成需要查证的营养说法,不能原样发布。
测试条件先摊开
| 项目 | Kimi K3 | 千问 3.8 Max |
|---|---|---|
| 产品档位名 | 稳定档 | 轻快档 |
| 推理设置 | 高 | 中 |
| 本轮耗时 | 292 秒 | 144 秒 |
| 本轮原始 JSON 拆片表 | 7 镜 | 8 镜 |
| 正文视角 | 第三人称「我闺蜜」 | 第一人称「我」 |
| 用户价格 | 20 积分/条 | 20 积分/条 |
| 上游成本口径 | 按 token 与当日单价估算 | 按 token 与当日单价估算 |
这里有三个限制必须提前说清。
第一,两边推理档位不同(Kimi 为高档,千问为中档);第二,每个模型只跑了一次。因此,144 秒和 292 秒是这一次任务的真实结果,不是长期平均速度。
文章可以有立场,数据不能装作比自己更大。
第一回合:144 秒对 292 秒,速度差能不能感知
能,而且非常明显。
千问 144 秒交卷时,我还能把注意力留在这个选题上。Kimi 到 292 秒才回来,已经足够让人切去处理别的工作,再回来重新找上下文。
如果只是偶尔扩写一条,这两分多钟不算灾难;如果一天要处理几十条,差距会被放大。20 条任务按本轮结果粗算,串行等待时间会相差将近 50 分钟。
不过别忘了背景:Kimi 这轮开的是高档推理,千问是中档。更慢不一定代表底层模型天生慢,也可能是我们主动让它想得更久。下一轮若要得出更硬的速度结论,应当统一推理强度,并在同一时段至少各跑 10 次,记录中位数和失败率。
第二回合:便宜一半,还是一句容易误导人的标题
原稿里有一句「所有数字来自真实账单」,我把它删了。
耗时确实是真实计时,但这篇文章里的成本不是从最终账单字段直接读取,而是用本次 token 用量乘以 2026-08-12 的渠道单价估算。按这个口径,Kimi 大约是大几毛到一块出头,千问约三五毛,后者接近前者的一半。
这个差距对内部毛利有意义,对用户当次选择却没有价格差:两个档位现在都是 20 积分一条。用户真正买的是等待时间、文风和一次成功率,不是我们后台的 token 单价。
所以更准确的说法不是「千问一定便宜一半」,而是:本轮估算中,千问的上游成本约为 Kimi 的一半;价格会随 token 用量和渠道单价变化。
第三回合:两个模型,写出了两种“人设”
千问的开场很猛:
我一口晚饭没吃,坚持了整整三个月,上秤一看——胖了十斤。
它把原题改成了第一人称亲历,还把「晚上不吃饭」拧成「一口晚饭没吃」。传播上更狠,画面也立刻出来了。
问题也在这里:如果作者本人没经历过,这不是“更有网感”,而是凭空替作者捏了一段人生。短视频里最容易被忽略的失真,往往就藏在这种看起来特别顺口的第一句里。
Kimi 的开场是:
晚上不吃饭减肥?我闺蜜三个月,反而胖了十斤。
它没有把故事压到作者本人身上,但「我闺蜜」同样可能是虚构。两种写法都很像内容平台上的真人表达,也都必须由真人负责:有真实经历就保留,没有就改成「我见过一个很典型的情况」或直接讲机制。
这轮最值得记住的,不是哪家更会装人,而是:模型越会写“活人感”,越要防它顺手编造活人经历。
第四回合:拆片表有没有到“照着就能拍”
这一项两边都比正文更让我满意。
千问在第二镜写了「代谢切成省电模式」,同时给出一个很具体的画面:半透明电池图标从满格掉到一格。Kimi 对应的处理是让人物躺在床上摸肚子,把咕叫声放大,再给「身体在报警」加红色描边。
前者是视觉比喻,后者是生活声音。都不是高深创意,但导演拿到以后不用再问「这一句到底拍什么」。这就是结构化拆片表的价值:它不只是把文案切成八段,而是把台词、场景、景别、动作、运镜和剪辑备注绑在一起。
千问本轮 JSON 给了 8 镜,Kimi 本轮 JSON 给了 7 镜。镜数多不自动等于质量高,但对短视频初稿来说,多一镜通常意味着节奏更细、后期更容易取舍。
真正让我踩刹车的,是那些“听起来很对”的句子
两份稿子都引用了《中国居民膳食指南(2022)》,也都写了「代谢省电」「晚餐占全天热量三成」「七点前吃完」一类判断。
这些句子很适合传播,因为短、狠、好懂。也正因为如此,发布前更需要查证。比如「消耗热量砍了将近一半」是很具体的量化结论,原始产物没有给出对应依据;「七点前吃完」也不能脱离作息、总摄入和个体情况写成普遍规则。
这轮测试比的是内容生产能力,不是营养学正确率。若把成品直接发出去,模型写得越流畅,错误越容易被当成常识。
所以我们现在把最终流程拆成两层:模型负责生成结构和表达,人负责核对经历、数字、医学与营养建议。可拍不等于可发。
如果今天就要选,我会怎么用
日更、追热点、批量做选题,我会先用千问。它这轮速度快,成本估算低,拆片更细,而且第一版已经有明显的镜头意识。
品牌账号、专家账号或对口吻敏感的内容,我不会直接把任务全扔给某一个模型。我会让模型先交结构,再由作者把虚构经历、夸张数字和不属于自己的人设拿掉。Kimi 可以做一个更克制的备选,但这轮之前它刚出现过两次上游「算力紧张」,不能只因为产品档位叫“稳定档”就宣布它更稳定。
如果预算允许,同一条重点选题跑两个版本也有价值:用千问的镜头结构,吸收 Kimi 的表达,再由真人写最后一遍。不是把两份答案机械拼起来,而是让它们互相暴露盲点。
这次故障留下的产品结论
凌晨的两次失败,最后比模型 PK 本身更有价值。
上游模型会排队、会限流、会临时不可用,这些都不是用户能控制的。产品能控制的是:失败是否按条退款、错误有没有说人话、主通道连续失败后能不能切到备用通道,以及单机双核会不会因为自作聪明地提高并发而把整台机器拖死。
我们最后保留串行执行。慢一点可以解释,任务互相抢资源、一起挂掉就解释不通了。
所以这篇实测最后真正想回答的,不是「Kimi 和千问谁赢」,而是:当模型进入真实生产,速度、成本、内容诚实度和失败恢复,缺一个都不算交付。
这轮测试的局限
- 只有一个健康类选题,每个模型各成功运行一次,不能代表全部题材。
- 推理档位不同:Kimi 为高档,千问为中档,不能把全部耗时差归因于模型本身。
- 通道不同:两边接的上游供应商通道不同,排队情况也会影响结果。
- 成本为 token 用量乘以当日渠道单价的估算值,不是最终账单字段。
- 原始 JSON 与后补的 Kimi 页面截图时间不同;后补截图显示了另一版 8 镜页面状态,因此本文的同轮镜数比较只采用原始 JSON 与对比总览,不混用后续页面状态。
- 营养内容没有在本次测试中做专业事实核查,引用仅用于展示模型产物,不构成饮食建议。
彩蛋:这条选题,我们顺手做成了 4K 成片
光比文案不过瘾。写完这篇的当晚,我们把这条选题直接推完了整条流水线:文案 → 海报 → 5 秒成片 → 4K 超分,全程没离开这个网站。
先看两版拆片表各自的第一镜,被画成了什么样:
然后让海报动起来(5 秒,一条 720p、一条 480p),再各做一次 4K 超分放大:
超分到底有没有用?同一帧、同一块脸部裁切,放大到同尺寸对比(左边是原片,右边是 4K 超分):
两个数字:480p 原片 560×752,超分后 2160×2902——像素量放大约 15 倍,睫毛、碗沿反光、字幕描边全都回来了。底图生成得够干净,超分才有东西可挖;这两步一个都不能省。
(画面含站名水印;原始素材归本站所有,请勿转用。)
常见问题
Kimi K3 和千问 3.8 Max,哪个生成文章更快?
在 2026-08-12 这次同题实测中,千问 3.8 Max 用时 144 秒,Kimi K3 用时 292 秒,千问少用约 148 秒。不过 Kimi 使用高档推理,千问使用中档,而且两者通道不同;这个结果代表本次生产任务,不等于长期平均速度。
Kimi K3 和千问 3.8 Max,哪个成本更低?
按本次 token 用量和当日渠道单价估算,千问约三五毛,Kimi 约大几毛到一块出头,千问接近 Kimi 的一半。这个数字是估算,不是最终账单实扣;两者面向用户目前均为 20 积分一条。
做短视频脚本应该选 Kimi K3 还是千问 3.8 Max?
赶热点、日更或批量生产时,可以优先试千问;它本轮更快,拆片结构也更细。专家账号、品牌内容或对人设真实性要求高的内容,无论选哪一个,都应由真人复核亲历叙事、数字和专业建议,而不是直接发布模型原稿。
为什么同一个模型有时很快,有时提示算力紧张?
模型速度不只由模型本身决定,也受到供应商排队、时段流量、推理档位和备用通道状态影响。生产系统应设置明确超时、有限重试、失败退款和备用供应商,不能让用户靠反复点击碰运气。
逐镜拆片表是额外收费的吗?
不是。本产品当前按扩写任务收取 20 积分/条,逐镜拆片表与正文、时间轴脚本、图文结构、平台标题和封面描述在同一次扩写中生成,不单独收费。实际价格以后续站内页面为准。
两个模型的正文和拆片表可以混用吗?
可以。产物采用结构化字段,可以选择一个版本的正文和另一个版本的镜头设计。但混用后仍要检查台词与镜头是否一一对应,避免出现正文已经改了、拆片表还保留旧台词的情况。
模型生成的健康与营养内容可以直接发布吗?
不建议。模型可能生成听起来合理但缺少依据的具体数字、因果关系或统一时间规则。发布前应核对权威来源,删除虚构经历,并根据账号定位增加必要免责声明。本文比较的是内容生产能力,不提供个人饮食或医疗建议。
本轮测试使用选题 ID 9jB3lROllD。原始记录包括 Kimi K3 与千问 3.8 Max 的 JSON 产物、真实页面截图和同题对比总览。模型能力、渠道价格与供应商状态会变化,本文保留的是测试方法和当时结果。