你的工作负载到底要花多少钱?

真实价格,公开基准。选一类任务、设定用量,就能看到每个托管模型跑起来要多少钱——有公开基准的地方还会附上质量数据。

基准数据更新于 2026年7月27日 · 方法与数据来源

全部模型一览

价格为我们的市场价 · 单次成本是一个估算值
Kimi K2.6第 1 档 · 前沿US$0.76US$3.20256KUS$0.0078估算US$0.0098估算厂商自报1,460.9
GLM-5第 2 档 · 均衡US$1.00US$3.20200KUS$0.0088估算US$0.01估算1,456.7
DeepSeek V4 FlashUS$0.20US$0.591MUS$0.0017估算无 SWE-V 数据1,435.5
DeepSeek V4 Pro第 3 档 · 经济US$0.59US$1.781MUS$0.0050估算无 SWE-V 数据1,456.6
GLM-5-TurboUS$0.96US$3.20200KUS$0.0086估算无 SWE-V 数据
Qwen3.7-PlusUS$0.32US$1.281MUS$0.0032估算无 SWE-V 数据
Qwen3.7-MaxUS$2.00US$6.001MUS$0.02估算无 SWE-V 数据
MiniMax M3US$0.24US$0.961MUS$0.0024估算无 SWE-V 数据

单次任务成本计算器

单次代码生成 / 修改任务

估算值 — 基于典型 token 画像,实际用量会有出入
成本口径:

SWE-V 校正视图:共 8 个模型,显示其中 2 个。没有 SWE-bench Verified 数据的模型被排除在本图之外,不是排名更低。

本视图排除了:DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5-Turbo和Qwen3.7-Plus还有 2 个——没有可用的 SWE-V 分数。

1,000
101001k10k100k1M
每个已解决任务最便宜第 1 档中最便宜 — 顶级能力档位里成本最低的模型

未在 SWE-V 校正口径下显示(没有 SWE-bench Verified 分数——我们绝不代为估算):DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5-Turbo、Qwen3.7-Plus、Qwen3.7-Max和MiniMax M3

方法与数据来源

数据最后变更于 2026年7月27日;下方每个分数都带有各自的截至日期(无变化的同步任务不会推进这个日期,上游排行榜也各按自己的节奏发布)。价格为我们的市场价,实时获取。基准分数来自公开论文和排行榜——绝非我们自己的测量,也绝不编造:凡是没有直接公开分数的地方,我们就什么都不显示。

所用基准

基准指标锚点 低 → 高来源
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1,2001,700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

质量分用固定锚点对每个原始基准值做归一化 —— norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 —— 再按该类别的权重求加权平均。当某个模型缺少某项基准时,其余权重会重新归一化;在某个类别里一项基准都没有分数的模型,不会得到任何质量分。

SWE-V 校正单次任务成本

对于有 SWE-bench Verified 分数的模型,我们还会展示 swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) —— 即失败后无脑重试时,每个「已解决」任务的估算成本。分母只会用 SWE-bench Verified 的通过率;Arena WebDev 和 LiveBench 的分数没有概率语义,绝不拿来替代。没有 SWE-V 分数的模型显示「—」——我们绝不代为估算。

  • 1/p 公式假设各次重试相互独立且成功率恒定。
  • 它假设每次重试消耗的 token 与首次尝试相同。
  • 真实失败往往需要人工或工具介入,而不是无脑重试——这部分开销没有计入。
  • 解决率来自 SWE-bench Verified 任务集,与你的任务分布并不相同。

能力档位

有质量分的模型会按确定性的自然断点规则分成 1-3 档(第 1 档 前沿 / 第 2 档 均衡 / 第 3 档 经济):分数先四舍五入到 1 位小数,然后相邻模型(按降序)之间只要出现不小于 max(score range × 25%, 8 points) 的间隔,就成为候选档位边界;候选中只有最大的两个会真正成为边界(并列时取排名更高的位置)。没有符合条件的间隔就只有一档。档位边界由构建期快照测试钉死,因此数据更新绝不会悄悄把模型挪档——每一次档位变化都经过人工复核。「第 1 档中最便宜」标记的是顶档内单次成本最低的模型;进入档位只需要有质量分,所以一个模型可以占着档位、同时 SWE-V 校正成本那一列显示「—」。

为什么多数类别没有质量排名

只有当我们目录中至少 5 个模型拥有直接的公开分数——确切的模型版本、确切的基准版本、注明评测模式——我们才会为该类别发布质量排名。目前达到这个门槛的只有编程 / 前端与 UI。其余类别要么公开排行榜没有覆盖我们的目录,要么已经停止更新,所以我们只提供成本计算器。我们宁可什么都不给你看,也不给一个编出来的数字。

计算器背后的任务画像

类别输入 / 输出 token假设
编程 / 前端与 UI4,000 / 1,500读入中等长度的上下文文件,产出函数级别的补丁。
写作与营销文案800 / 1,200输入简报加品牌说明,输出一段短营销文案或邮件。
数据抽取与 JSON 输出2,500 / 400输入一页非结构化文本,输出固定 schema 的 JSON。
Agent 工具调用6,000 / 800多轮工具调用会话,包含工具 schema 以及回填进上下文的中间结果。
长文档 RAG / 摘要30,000 / 1,500输入数十页文档,输出一份结构化摘要。
翻译1,500 / 1,600约 1000 词文章的中英互译;输出 token 数与输入大致相当。

估算:单次任务成本是基于上表典型 token 画像的估算值——实际用量会有出入。价格是我们真实的市场价。

Arena Text Elo 一列:来自 LMArena 的通用对话 Elo(社区投票),并非针对具体任务;仅作参考,绝不参与质量分或标记的计算。

时效:基准分数每月复核一次(每条都带有各自的截至日期);价格反映我们当前的市场价。

独立性:分数来自公开论文,而非我们自己的测试。厂商自报的数字在出现的任何地方都会被标注出来。