Seedream 5.0 Pro 对上 GPT-image-2:同一句提示词跑六张,价差三到四倍,贵的那个赢在哪

2026-08-07 · 约 15 分钟

2026-08-07 实测。六张图、计费数字、耗时全部来自当晚的真实调用,不是转述文档。

Seedream 5.0 Pro(doubao-seedream-5.0-pro)刚放出来,我第一反应不是翻参数表,而是:先拉出来跑几张再说。

OpenRouter 目前还没接这版,那边最高只到 Seedream 4.5;好在我们的网关已经能调。于是当天晚上,我把它和 GPT-image-2 塞进了同一套测试里,看看两个模型面对同一份作业,到底会交出什么东西。

测法不花哨:同一个网关、同一把 key、同一时间段、同一句提示词、同一个比例,两个模型各出一张。通道差异和时段波动尽量排掉,剩下的,就让图片自己说话。

三道题也不是随手来一张蓝天白云、看谁更会讨好眼睛。我挑的都是内容生产里真会遇到的活:

第一道是竖屏封面,专门考中文标题排版——内容平台每天都绕不开它。

第二道是古装人物定妆,看写实质感,也看模型有没有听懂人物身份。

第三道是导演分镜板,难度直接往上拧:主画面、三个编号小格、右侧七行中文信息栏,还要叠红青箭头标注。简单说,就是不只要会画,还得会排版、会听指挥,最好别临场自由发挥。

先把参数陷阱摊在桌上

后面你会看到,GPT-image-2 贵了三到四倍。先别急着替任何一方欢呼:这个差距有一部分是我的参数选择造成的,不全是模型定价的差别。这件事必须先讲清楚。

GPT-image-2 有个 quality 参数,分 low / medium / high 三档,官方给的相对成本是 0.11 倍 / 1 倍 / 4 倍。我这轮全部跑的是 high

Seedream 5.0 Pro 没有这个参数。它只有 1K / 2K 的分辨率档,没有「推理深度」这一层可选。

换句话说,这场对照实际是「Seedream 的唯一档」对上「GPT-image-2 最贵的那档」。如果换成 medium,GPT-image-2 的价格大概会掉到四分之一,两家就基本持平了。

那我为什么还选 high?因为在中文文字排版和复杂版面这两题里,medium 的出字质量掉得很明显,离「拿来就能用」还有一段距离。但如果你只是生成没有文字的普通画面,medium 就够,那时候这里看到的价格优势也就不存在了。

账先对齐,后面的比较才不至于变成带着答案找证据。

三组对照:同题不同命

第一题:竖屏封面,先把中文字写明白

Seedream 5.0 Pro

Seedream 5.0 Pro 生成的竖屏封面,中文标题「想吃瘦,别减主食」

GPT-image-2

GPT-image-2 生成的竖屏封面,同一句提示词

提示词要求画一位女性坐在窗边,看着一碗白米饭犹豫,手停在筷子上方;上方留标题区写「想吃瘦,别减主食」,下方偏右写「先做三件事」。

先报喜:两家中文都零错字、笔画完整、标点正确。

放在今天看,这句话似乎没什么戏剧性。但经历过早期 AI 生图的人都懂:当年让模型写几个中文字,效果很像它刚偷偷发明了一套新汉字。中文标题排版一度几乎是 OpenAI 系模型的独占优势,现在至少在这道题里,这道坎已经有人迈过去了。

不过,字写对只是及格,写得好不好还得另算。GPT-image-2 用的是干净的粗黑体,字重均匀、字距紧凑,看着利落。Seedream 那版的字重就有点各自为政:「想」和「瘦」偏细,「别减主食」偏粗,整体还带着一点宋体的犹豫感。缩小看没大问题,放大之后就不够干脆。

真正拉开差距的,其实不是字体,而是提示词遵从

我写的是「手停在筷子上方」。GPT-image-2 让人物捏着筷子悬在碗上,把「想吃又犹豫」变成了一个具体动作;Seedream 则把筷子规规矩矩放到了桌上,人物两手空着。画面没有坏,但那个最该有戏的瞬间没了,像演员表情已经到位,道具老师却提前收工。

这种「动作卡在半途」的细节,恰恰是封面最需要的。它通常比一个皱眉更能传递情绪。所以这一题,我把票投给 GPT-image-2。

尺寸上倒是 Seedream 略高:1584×28161536×2736

第二题:古装人物定妆,好看不等于演对了

Seedream 5.0 Pro

Seedream 5.0 Pro 生成的唐末边关低阶军官定妆照

GPT-image-2

GPT-image-2 生成的唐末边关低阶军官定妆照

这次的角色是一位唐末边关的低阶军官。提示词里写了麻布袍、肩甲皮革磨损开裂、领口有汗渍尘土,腰间挂一枚缺三分的青白残玉,光线则是黄昏侧逆光。

这一题很有意思:Seedream 更接近要求,GPT-image-2 更好看。但「更好看」和「更对」,真不是一回事。

Seedream 交出来的,确实像个低阶兵:麻布粗糙,肩甲开裂,衣服脏,头发也只是随意的短发。整个人有股被风沙和生活轮番收拾过的疲惫感,不像刚从妆造间出来。

GPT-image-2 那张明显精致得多:束发、五官立体、光影更有戏,皮肤质感也更好。问题是,他怎么看都更像偶像剧男主角,不太像戍边的下级军官。模型听见了「边关」,也听见了「军官」,唯独把低阶两个字顺手磨了个皮。

其他细节,两家都交代得不错。残玉的缺口、青白色和佩挂位置都对;侧逆光、暖橙主光配冷蓝补光也都做到了。GPT-image-2 的背景更完整,烽燧、旗帜、城墙纵深都在;Seedream 的背景相对偏平。至于我特意写进去的「下颌浅疤」,两家都没画出来——这一项谁也别笑谁。

这背后还有个和长剧集生产直接相关的问题:GPT-image-2 有很强的向「好看」收敛的倾向。 单看一张,当然赏心悦目;可一旦做群像戏,主角、配角、路人全长着精修脸,角色的身份层级就容易糊成一片。

这种时候,Seedream 的「不完美」反而是一种难得的准确。毕竟配角首先得像角色,不能人人都像等着拍海报。

第三题:导演分镜板,这次不只考画画

Seedream 5.0 Pro

Seedream 5.0 Pro 生成的导演分镜板,含七行中文信息栏

GPT-image-2

GPT-image-2 生成的导演分镜板,含七行中文信息栏

最后一题是一张 16:9 的导演分镜板:中央主画面占 65%,下方放三个编号小分镜,右侧深色信息栏逐字写七行中文;画面上还要叠 9:16 竖屏安全框(青色虚线),用红箭头标人物和道具运动,再用青箭头标镜头运动。

这一长串要求写完,我自己都觉得有点为难模型。结果是:两家居然都做出来了。 复合版面加七行准确中文,一次成型;当然,也都各自留了一处让人扶额的硬伤。

Seedream 把「第01集 残玉认主」印了两遍:信息栏顶部来一次,列表第一行又来一次。不是风格问题,是很明确的版面错误。它的主画面倒更有氛围,青瓷、书堆、窗外的橙色微光都在;可人物穿的是灰蓝布衣,我明明要求了「白大褂」,这件衣服它显然有自己的想法。

GPT-image-2 的信息栏更干净,没有重复;三个小格也老老实实带上了 1/2/3 编号,这一点是我明确要求、Seedream 没做到的;白大褂同样对了。不过它也没能全身而退:青色安全框画到了画布外,右边被裁掉;箭头标得比较随意,尤其那条从左下横穿到右边的青色长弧,看着不太像镜头轨迹,倒像有人拿荧光笔临时抒发了一下。

如果只问「哪张更接近可交付」,GPT-image-2 稍胜。它改一处就能用;Seedream 要改两处,其中重复标题基本绕不开重生成。

钱花在哪,时间又花在哪

下面是我最想看的部分,也是这轮测试里最有实际参考价值的一段。数字直接从 API 返回体的 credits_reserved 读取,不是拿定价表倒推:

题目 Seedream 5.0 Pro GPT-image-2
竖屏封面 9:16 4.59 14.82
古装人物 3:4 4.59 19.76
导演分镜板 16:9 4.59 14.88

Seedream 三题一模一样,固定 4.59。GPT-image-2 则在 14.8 到 19.8 之间浮动。

原因藏在计费方式里:Seedream 是 per_call,一次调用一个价,提示词写多长都不影响。GPT-image-2 按 token 计费,提示词越长,账单也跟着长。

人物那题最贵,19.76,比另外两题高三成;巧的是,那题也正是我写得最细的一份提示词。这个对应关系很值得记住:在按 token 计费的模型上,「写得更用心」是有成本的;在按次计费的模型上,它是免费的。 写提示词时的才华横溢,最后会不会体现在账单上,得先看模型怎么收费。

耗时方面,两家倒是相当和平,基本持平,没有谁明显拖后腿:

题目 Seedream GPT-image-2
封面 119.5s 102.4s
人物 137.2s 125.7s
导演板 109.1s 117.1s

这里顺手记一条差点让我翻车的排查经验。我最开始拿文件落盘的时间戳来算,得出了「Seedream 慢一倍」的结论,甚至差一点就写进正文。后来一查,差别全耗在任务创建的排队和脚本启动上,真实生成耗时其实持平。

所以,测速度要读接口返回的时间,不要看文件时间戳。 文件到得晚,不代表模型画得慢,也可能只是它还在门口排队。

参数表不够性感,但选型时真能救命

有些差别根本不用生图,翻文档就能确定。它们看起来没有画面对比那么热闹,做选型时却往往更关键:

Seedream 5.0 Pro GPT-image-2
参考图上限 10 张 1–16 张
参考图是否额外计费 不额外(按次) 是,参考图吃 input token
单图大小上限 30MB 50MB
支持格式 含 heic / heif / bmp / tiff / gif 只有 jpeg / png / webp
单次出图数 Pro 只能 1 张 1–10 张
提示词长度 2000 token 32000 字符(超 8000 token 会掉质量)
分辨率上限 2K 档,约 4.6MP 4K 档,3840×2160 / 8.29MP
局部重绘 mask (PNG alpha,尺寸必须完全一致)
水印开关 有显式参数 未暴露
输出格式可选 png / jpeg 未暴露

先说参考图计费。如果工作流里要同时喂人物定妆、服装、场景和道具——做连续剧集的人大概率躲不开——GPT-image-2 每多喂一张,都要多吃一份 input token;Seedream 按次计费,不额外加钱。参考图一多,两边的成本差距会继续拉开。

再说提示词长度。2000 token 是 Seedream 的硬伤。 换成中文,大约就是一千多字。我们导演板那份提示词已经逼近上限,再复杂一点,想写都没地方写。GPT-image-2 的 32000 字符余量就大得多,至少不用一边描述画面,一边像删论文摘要那样抠字数。

局部重绘则是 GPT-image-2 的硬优势。 比如「只改天空、其他别动」,GPT-image-2 可以用 mask 处理;Seedream 没有,只能整张重生成。你只是想挪一块云,它可能顺手把人物的脸也换了。这不是审美偏好,而是实打实的工作流差别。

还有一个容易被表格轻轻带过的限制:Seedream Pro 只能 n=1 想要「一次生四张、挑一张」,Seedream 得发四次请求;GPT-image-2 一次就能搞定,而且文本 input token 只算一次。真进入批量出图时,这会吃掉 Seedream 的一部分价格优势。

最后的选型:别站队,让它们各干各的

按这一轮的结果,我不会用一句「谁取代谁」收尾。三张样本还远远撑不起这种口号,实际工作也没必要把模型选型搞成球赛站队。更有用的结论,是把活分对。

用 GPT-image-2:需要精确遵从复杂指令时——它对「手停在筷子上方」这种细节明显更听话;需要局部重绘时;需要 4K 时;提示词特别长时;或者想一次出多张时。

用 Seedream 5.0 Pro:对单张成本敏感时;提示词写得很长很细、但仍在 2000 token 以内时——因为写细不加钱;需要喂大量参考图时;以及一个听起来有点反常、实际很有用的场景:需要人物「没那么好看」时。 比如群像戏里的配角,你要的是一张普通人的脸,不是又一位偷偷来抢戏的海报男主。

还有个生产角度很容易被忽略:同样的钱,Seedream 能出三到四张。 生图本来就带随机性。抽四次再挑一张,很多时候比花同样的钱只抽一张「高质量」更容易拿到能用的结果。落到实际生产里,这个价值经常比「单张精致一点」更实在。

先别把三张图写成宇宙真理

最后还是要给这轮测试踩一脚刹车,不然前面的观察很容易被传着传着就变成万能结论。

每题只有一张样本。 生图随机性很大,同一句提示词再跑一次,胜负完全可能换边。这轮能提供的是定性观察,不是统计结论。

GPT-image-2 跑的是最贵的 high 档。 前面已经说过,换成 medium,价格优势会消失,但文字质量也会掉。只截后面的价格表、不看前面的参数说明,结论一定会歪。

没有测参考图模式。 两家的图生图、多图参考、人物一致性保持,这一轮都没碰;偏偏这些又是连续内容生产里最关键的能力。这部分需要单独再跑一轮,不能靠三张文生图硬猜。

价格是网关侧的积分数,不是官方标价。 不同渠道会有差异。不过两家用的是同一个网关、同一把 key,相对比例仍然可以比较。


六张原图与调用记录均为 2026-08-06 深夜实测。模型能力与定价会随版本变化,测法可复用。