生图为什么贵几十倍 | 成本与安全 | 做产品
生图为什么贵几十倍
第一次往多模态模型里传图片的人,都会被账单吓到——一张图的价格能顶几千字。原因很简单:图片不是按「一张」计费,是按分辨率换算成等效 Token。
你会遇到的现象
-
传一张截图给模型,费用比平时高出一个数量级
-
同一张图,改了下分辨率,价格翻了几倍
-
预算表里「图片调用」一项,怎么估都不准
图片怎么计费
模型处理图片时,会把图片按比例切成若干小块,每块单独理解再拼起来。小块的数目基本由分辨率决定,所以计费天然跟着分辨率走。
各家算法略有不同,但共同点是:按长边分档。低分辨率一档,中分辨率一档,高分辨率一档,跨过阈值价格跳档。同一张图,从长边 1024 提到 2048,等效 Token 可能翻好几倍;提到 4096,再翻好几倍。
这意味着一条很容易踩的坑:你拿原始高清图去问模型,模型也看不出比低清图多多少信息,但你的账单按高清算了。
为什么贵
贵在理解工作量。模型要看懂一张图,需要的计算量远大于读一段相同字节数的文字。像素的信息密度低但计算密度高——这就是「几十倍」的来源。
而且多模态场景往往是「多图 + 文本」一起进:好几张截图 + 一个问题,总费用会明显超过纯文本对话。输入 Token 一多,成本立刻上去。
理解了这个机制,就知道省钱的方向不是「少用图片」,而是让每张图花在刀刃上。
省钱的几招
**一、按需降分辨率。**这是最大的一招。识别图片里的文字、小字 → 用高清。识别整体构图、风格、有没有人 → 用低清就够了。**先问「模型真的需要看清那么细吗」。**把长边压到刚好够用的档位,费用可能省一个数量级。
**二、只发相关的部分。**一页 PDF 截成一张大图 vs 裁出出问题的区域——后者便宜得多,识别率还可能更高(不相关的部分会干扰判断)。这和文字检索里切分的道理一样:喂进去的内容越聚焦,效果越好、成本越低。
**三、裁剪掉无关区域。**截图里的边框、菜单、空白,裁掉再发。既省 Token 又减少干扰。
**四、批量、离线任务走低价通道。**很多厂商对不需要实时返回的离线图片任务给折扣价。
**五、分清「看懂图」和「生成图」是两种计费。**本文讲的是「让模型看懂图片」的费用(视觉理解)。生成图片是另一套计费,通常按张数、按分辨率、按生成步数算,两者别混在一起估预算。
最后一条:**把「图片调用」单独记日志、单独看成本。**它量少价高,最容易偷偷吃掉预算。单独统计之后,你才能知道哪类功能在烧钱。
先问一句:模型真的需要看清那么细吗?
需要 → 用高分辨率 图里的文字、小字、表格线、编号 跨过阈值价格跳档,但这时候值 长边 1024 → 2048,等效 Token 可能翻好几倍
不需要 → 压到刚够用 整体构图、风格、有没有人、布局 费用可能直接省一个数量级 这是所有省钱手段里最大的一招
· 裁掉边框、菜单、空白再发——既省 Token,又减少干扰,识别率还可能更高 · 「让模型看懂图」和「让模型生成图」是两套完全不同的计费,别混在一起估预算 · 把图片调用单独记日志、单独看成本:它量少价高,最容易偷偷吃掉预算
最容易踩的坑是拿原始高清图直接问:**模型未必比看低清图多读出什么,你的账单却按高清算了。**图片贵在理解的计算量——像素信息密度低但计算密度高,这就是「几十倍」的来源。
一次调用的计费构成 图片是输入 Token 里最贵的一种。
Token:大模型的计价单位 理解 Token 怎么数,才能理解图片为什么贵。
模型类型 看懂图和生成图,是两类模型、两套计费。
