5条视频分析费不到1美分:DeepSeek V4 Pro 0813,真把趋势分析打成白菜价了?

2026-08-14 · 约 11 分钟

2026-08-14 真实调用记录。5 条视频号样本,输入 2,887 tokens、输出 7,872 tokens,账单实扣 0.008104485 美元。这是一次小样本探针,不是大规模跑分;文章里的金额来自返回结果中的 usage.cost,不是官网标价。

凌晨三点多,我把账单 JSON 打开,第一反应是自己看错了小数点。

前面刚经历一轮模型对比,脑子里还在盘算:五条视频,要去重、分类、抓关键词、读评论、找趋势、出选题,这一大串活交给模型,怎么也得花点钱吧?

结果屏幕上躺着一个数字:

$0.008104485。

不到一美分。

我又数了一遍零,才敢确认:DeepSeek V4 Pro 0813 的确把这次整理做完了,而且不是只回一句“AI 漫剧很火”。它交了一份 7,872 tokens 的长答案,分类、关键词、评论话题、趋势、蓝海词、选题建议和周报摘要,一个都没落下。

但故事到这里还不能结束。因为它很便宜,也确实干了活;可它同样会兴奋过头,把一条孤零零的产品名喊成“蓝海”。

所以这次实测真正有价值的,不是“DeepSeek 赢麻了”,而是我们终于看清:便宜模型适合干什么,贵模型又该在哪一步出场。

先把账单摊在桌上

项目 本次记录
样本数量 5 条视频号观察
输入 tokens 2,887
输出 tokens 7,872
其中推理 tokens 5,167
总 tokens 10,759
输入成本 $0.001255845
输出成本 $0.00684864
总成本 $0.008104485

这不是“起价”,也不是拿价格表乘出来的估算。返回结果里同时给了输入、输出和上游推理成本,三笔数字能对上。

粗暴除一下,五条样本平均每条大约 $0.00162。如果硬按这个平均值线性外推,一千条大约是 $1.62

不过先别急着拿 $1.62 去做预算。大批量任务会改变提示词长度、去重比例和输出规模,成本不一定跟样本数笔直地一起涨。这个推算只能帮我们感受量级,不能冒充一千条真实账单。

它到底交了什么,不到一美分会不会只买到废话

这五条样本来自视频号,主题包括 AI 漫剧教程、漫剧变现、AI 真人短剧和 AI Agent 营销。DeepSeek 收到的不只是标题,还有点赞、分享、收藏、评论,以及部分真实评论片段。

它完成了八类整理:

  1. 判断五条记录有没有重复;
  2. 给每条内容分类;
  3. 统计高频关键词;
  4. 聚合评论区在讨论什么;
  5. 从互动数字里找趋势;
  6. 提出可能的长尾词;
  7. 给出下一轮选题;
  8. 拼出一份周报摘要。

它还注意到一个挺有意思的现象:五条样本合计点赞 8,640,分享却有 20,591;其中四条的分享数比点赞数还高。对视频号这种熟人传播味道很重的平台,这至少是个值得继续追踪的信号。

它也从评论里抓到了很具体的需求,比如:

有没有便宜做漫剧的?

这比一句“用户关注性价比”有用多了。因为做内容的人看到这句话,马上就知道下一篇该写什么:别再空讲工具多厉害,直接把免费、低价和付费方案的限制摆出来。

所以,答案不是“便宜一定没好货”。至少在去重、分类、关键词归纳和初步选题这类脏活上,它的交卷已经能用。

可它也会一激动,把一棵草说成一片蓝海

我最警惕的一处,是它把 AhaCreator 列进了蓝海词。

证据是什么?样本里只出现了一次。

一次出现,可以说明“我们看见了这个词”;不能说明“市场有缺口”,更不能说明“它值得投入”。要判断蓝海,至少还得知道搜索量、同类内容供给、互动基线和跨时间变化。只有一条视频,远远不够。

它还把部分视频画面里的 OCR 文字,当成了评论区讨论;把分享数高,写成了“话题分享率高”。可我们没有播放量,也没有账号体量,更没有平台平均值。“分享数高”都不一定能证明,更别说“分享率高”。

这就是低成本大批处理最危险的地方:它不会空着交卷。证据不够时,它也很想帮你凑出一个听起来完整的答案。

模型越勤快,人越要知道哪句话不能信。

Terra 没有负责写得更漂亮,而是负责踩刹车

同一批材料后来又交给 GPT-5.6 Terra 做清洗。它没有把文章写得更热闹,反而删掉了不少“热闹”。

它做了几件很朴素、却很值钱的事:

这轮对比里,我最喜欢的不是哪个模型写得更像专家,而是 Terra 说了一句近似“我不知道”的话:只有五条定向搜索样本,不能外推成平台趋势。

在真实业务里,敢把结论降级,比多写五个洞察更重要。

最省钱的办法,不是把所有事都交给最便宜的模型

看到 $0.0081,很容易冒出一个想法:既然这么便宜,每刷到一条视频就调用一次好了。

我们没有这么做。

真正省钱的链路应该是:

本地 OCR 和硬门槛过滤 → 数据落盘沉淀 → 批量交给 DeepSeek 整理 → 少量高价值结果再交给 Terra 审计。

不达标的视频,比如点赞 103、转发 80、收藏 42、评论 14,本机读完数字就结束。它算“扫描过”,但不算一次模型分析,API 成本是零。

只有互动达标、评论区确实有内容的数据才进入样本池。等数量够大以后,再一次性去重、分类和抓关键词。这样做有三个好处:

省钱从来不只是换一个便宜模型。先决定什么不值得送进模型,通常比模型单价更重要。

如果要做一千条,我会怎么分工

这次只有五条,样本太小,刚好适合验证链路是否能跑通。真到一千条,我不会让任何一个模型从头包办到尾。

第一层由本机完成:识别互动数字、过滤广告、排除明显不相关内容、保存原始证据。这一层不调用大模型。

第二层交给 DeepSeek V4 Pro 0813:批量做语义去重、分类、关键词和评论聚类。它便宜、能吃结构化任务,也愿意输出完整结果。

第三层才交给 Terra:检查证据覆盖、删除过度推断、把“可能”与“已经证明”分开,最后整理成用户能看的周报。

这种搭配不浪漫,却很像一支真正干活的团队:有人负责把仓库整理干净,有人负责在出门前再检查一次,别把废纸当合同带走。

这次实测给我的结论

DeepSeek V4 Pro 0813 的低价不是噱头。至少这次账单里,10,759 tokens 只花了 $0.008104485,而且交付内容并不单薄。

但它也没有便宜到可以让我们放弃判断。它会认真完成任务,也会认真地把证据不足的东西解释完整。

所以我的结论不是“用 DeepSeek 替掉所有贵模型”,而是:

让 DeepSeek 扛下大批量整理,让 Terra 守住最后一道事实边界。

便宜模型把成本打下来,高阶模型把胡说八道拦下来。两边各干自己擅长的活,才是真正能长期跑的生产系统。

本次测试的边界

常见问题

DeepSeek V4 Pro 0813 分析五条视频花了多少钱?

本次真实账单为 0.008104485 美元。输入 2,887 tokens,成本 0.001255845 美元;输出 7,872 tokens,成本 0.00684864 美元;总计 10,759 tokens。这个金额来自调用返回的 usage.cost,不是官网价格估算。

DeepSeek V4 Pro 0813 分析一千条视频大约多少钱?

如果完全按本次五条样本的平均成本线性推算,一千条约 1.62 美元。但这只是量级参考,大批量任务的提示词、去重率和输出长度都会变化,正式预算应以真实千条探针账单为准。

DeepSeek V4 Pro 0813 能直接替代 GPT-5.6 Terra 吗?

不建议直接替代。DeepSeek 很适合批量去重、分类、关键词和评论聚类;但本次也出现了把单条产品名误判成蓝海、把样本内数字写成平台趋势的情况。Terra 更适合最终证据审计、降级过度结论和整理正式报告。

为什么不让每条视频都调用一次大模型?

因为大部分扫描结果没有分析价值。先在本机用 OCR 和互动门槛过滤,低质视频的模型成本可以保持为零;达标数据积累后再批量处理,也能减少重复内容带来的浪费。

DeepSeek 这次输出了哪些分析内容?

它完成了语义去重、内容分类、关键词统计、评论话题聚类、趋势观察、长尾词候选、选题建议和周报摘要。输出并非一句简短判断,但其中的趋势和蓝海结论仍需二次审计。

这次测试能证明 DeepSeek 是最便宜、最好的分析模型吗?

不能。它只能证明在这次 5 条视频号样本的结构化整理任务中,DeepSeek V4 Pro 0813 成本很低且能交付完整结果。要比较长期质量,还需要统一任务、统一输入,记录更多批次的成本、错误率和人工返工时间。


原始测试时间为 2026-08-14 凌晨。本文保留账单数字与模型输出中的关键错误,目的不是替任何模型站台,而是记录一条能真正落地的低成本分析链路。