你的工作负载到底要花多少钱?

真实价格,公开基准。选一类任务、设定用量,就能看到每个托管模型跑起来要多少钱——有公开基准的地方还会附上质量数据。

基准数据更新于 2026年7月27日 · 方法与数据来源

质量与成本 — 编程 / 前端与 UI

分数来自公开基准 · 成本为估算值
成本轴:

SWE-V 校正视图:共 15 个模型,显示其中 3 个。没有 SWE-bench Verified 数据的模型被排除在本图之外,不是排名更低。

本视图排除了:Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash和GLM-5.2还有 8 个——没有可用的 SWE-V 分数。

帕累托最优(不存在更便宜且更好的选择)气泡大小 = 上下文窗口

未在校正轴上显示(没有 SWE-bench Verified 分数——我们绝不代为估算):Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Pro和Kimi K3

未评分(该类别没有公开基准数据):Claude Opus 4.8、Claude Sonnet 5、DeepSeek V4 Flash、Gemini 2.5 Flash、GPT-5.6 Sol、Claude Sonnet 4.5、Claude Haiku 4.5和Claude Opus 4.5

全部模型一览

价格为我们的市场价 · 单次成本是一个估算值
GLM-4.5-Air第 2 档 · 均衡US$0.20US$1.10125KUS$0.0025估算US$0.0043估算厂商自报1,372.9
GLM-4.6第 2 档 · 均衡US$0.60US$2.20200KUS$0.0057估算US$0.0084估算1,425.2
GLM-5第 2 档 · 均衡US$1.00US$3.20200KUS$0.0088估算US$0.01估算1,456.7
Claude Opus 4.8US$5.00US$25.00200KUS$0.06估算无 SWE-V 数据
Claude Sonnet 5US$3.00US$15.00200KUS$0.03估算无 SWE-V 数据
Gemini 3.5 Flash第 2 档 · 均衡US$1.50US$9.001MUS$0.02估算无 SWE-V 数据1,474.3
GLM-5.2第 2 档 · 均衡US$1.40US$4.40200KUS$0.01估算无 SWE-V 数据1,469.2
DeepSeek V4 FlashUS$0.14US$0.28128KUS$0.0010估算无 SWE-V 数据1,435.5
DeepSeek V4 Pro第 2 档 · 均衡US$0.44US$0.87128KUS$0.0030估算无 SWE-V 数据1,456.6
Gemini 2.5 FlashUS$0.30US$2.501MUS$0.0049估算无 SWE-V 数据1,410.2
GPT-5.6 SolUS$5.00US$30.00400KUS$0.07估算无 SWE-V 数据
Kimi K3第 1 档 · 前沿US$3.00US$15.001MUS$0.03估算无 SWE-V 数据1,485.7
Claude Sonnet 4.5US$3.00US$15.00200KUS$0.03估算无 SWE-V 数据
Claude Haiku 4.5US$0.80US$4.00200KUS$0.0092估算无 SWE-V 数据
Claude Opus 4.5US$15.00US$75.00200KUS$0.17估算无 SWE-V 数据

单次任务成本计算器

单次代码生成 / 修改任务

估算值 — 基于典型 token 画像,实际用量会有出入
成本口径:

SWE-V 校正视图:共 15 个模型,显示其中 3 个。没有 SWE-bench Verified 数据的模型被排除在本图之外,不是排名更低。

本视图排除了:Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash和GLM-5.2还有 8 个——没有可用的 SWE-V 分数。

1,000
101001k10k100k1M
每个已解决任务最便宜

未在 SWE-V 校正口径下显示(没有 SWE-bench Verified 分数——我们绝不代为估算):Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Flash、DeepSeek V4 Pro、Gemini 2.5 Flash、GPT-5.6 Sol、Kimi K3、Claude Sonnet 4.5、Claude Haiku 4.5和Claude Opus 4.5

方法与数据来源

数据最后变更于 2026年7月27日;下方每个分数都带有各自的截至日期(无变化的同步任务不会推进这个日期,上游排行榜也各按自己的节奏发布)。价格为我们的市场价,实时获取。基准分数来自公开论文和排行榜——绝非我们自己的测量,也绝不编造:凡是没有直接公开分数的地方,我们就什么都不显示。

所用基准

基准指标锚点 低 → 高来源
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1,2001,700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

质量分用固定锚点对每个原始基准值做归一化 —— norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 —— 再按该类别的权重求加权平均。当某个模型缺少某项基准时,其余权重会重新归一化;在某个类别里一项基准都没有分数的模型,不会得到任何质量分。

我们用到的每一个分数及其来源

  • DeepSeek V4 FlashLiveBench Coding: 69.228 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • DeepSeek V4 ProLiveBench Coding: 69.994 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Gemini 3.5 FlashLiveBench Coding: 78.185 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
  • GLM-5.2LiveBench Coding: 79.654 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Kimi K2.6LiveBench Coding: 78.567 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
  • DeepSeek V4 FlashLMArena Text (overall Elo): 1,435.5 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena Text (overall Elo): 1,456.6 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • Gemini 2.5 FlashLMArena Text (overall Elo): 1,410.2 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • Gemini 3.5 FlashLMArena Text (overall Elo): 1,474.3 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.5-AirLMArena Text (overall Elo): 1,372.9 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • GLM-4.6LMArena Text (overall Elo): 1,425.2 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • GLM-5LMArena Text (overall Elo): 1,456.7 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • GLM-5.2LMArena Text (overall Elo): 1,469.2 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena Text (overall Elo): 1,460.9 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • Kimi K3LMArena Text (overall Elo): 1,485.7 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena WebDev: 1,446.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
  • Gemini 3.5 FlashLMArena WebDev: 1,484.3 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.6LMArena WebDev: 1,338.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
  • GLM-5LMArena WebDev: 1,434.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
  • GLM-5.2LMArena WebDev: 1,587.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena WebDev: 1,509.8 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
  • Kimi K3LMArena WebDev: 1,682 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
  • GLM-4.5-AirSWE-bench Verified: 57.6 来源 (截至 2026年7月23日)厂商自报GLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
  • GLM-4.6SWE-bench Verified: 68.2 来源 (截至 2025年9月30日)SWE-bench Verified leaderboard. 提交日志尚未由 SWE-bench 维护者核验。 Official SWE-bench Verified leaderboard submission (vendor scaffold).
  • GLM-5SWE-bench Verified: 72.8 来源 (截至 2026年2月17日)SWE-bench Verified leaderboard. 在抓取到的排行榜数据里,这条提交没有核验状态字段。 mini-SWE-agent harness, high reasoning effort.
  • Kimi K2.6SWE-bench Verified: 80.2 来源 (截至 2026年7月23日)厂商自报Official Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.

SWE-bench 的分数混合了官方排行榜条目与厂商自报结果(已在上方逐条标注);各家 agent 框架不同,因此这些分数在模型之间并不严格可比。

SWE-V 校正单次任务成本

对于有 SWE-bench Verified 分数的模型,我们还会展示 swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) —— 即失败后无脑重试时,每个「已解决」任务的估算成本。分母只会用 SWE-bench Verified 的通过率;Arena WebDev 和 LiveBench 的分数没有概率语义,绝不拿来替代。没有 SWE-V 分数的模型显示「—」——我们绝不代为估算。

  • 1/p 公式假设各次重试相互独立且成功率恒定。
  • 它假设每次重试消耗的 token 与首次尝试相同。
  • 真实失败往往需要人工或工具介入,而不是无脑重试——这部分开销没有计入。
  • 解决率来自 SWE-bench Verified 任务集,与你的任务分布并不相同。

能力档位

有质量分的模型会按确定性的自然断点规则分成 1-3 档(第 1 档 前沿 / 第 2 档 均衡 / 第 3 档 经济):分数先四舍五入到 1 位小数,然后相邻模型(按降序)之间只要出现不小于 max(score range × 25%, 8 points) 的间隔,就成为候选档位边界;候选中只有最大的两个会真正成为边界(并列时取排名更高的位置)。没有符合条件的间隔就只有一档。档位边界由构建期快照测试钉死,因此数据更新绝不会悄悄把模型挪档——每一次档位变化都经过人工复核。「第 1 档中最便宜」标记的是顶档内单次成本最低的模型;进入档位只需要有质量分,所以一个模型可以占着档位、同时 SWE-V 校正成本那一列显示「—」。

为什么多数类别没有质量排名

只有当我们目录中至少 5 个模型拥有直接的公开分数——确切的模型版本、确切的基准版本、注明评测模式——我们才会为该类别发布质量排名。目前达到这个门槛的只有编程 / 前端与 UI。其余类别要么公开排行榜没有覆盖我们的目录,要么已经停止更新,所以我们只提供成本计算器。我们宁可什么都不给你看,也不给一个编出来的数字。

计算器背后的任务画像

类别输入 / 输出 token假设
编程 / 前端与 UI4,000 / 1,500读入中等长度的上下文文件,产出函数级别的补丁。
写作与营销文案800 / 1,200输入简报加品牌说明,输出一段短营销文案或邮件。
数据抽取与 JSON 输出2,500 / 400输入一页非结构化文本,输出固定 schema 的 JSON。
Agent 工具调用6,000 / 800多轮工具调用会话,包含工具 schema 以及回填进上下文的中间结果。
长文档 RAG / 摘要30,000 / 1,500输入数十页文档,输出一份结构化摘要。
翻译1,500 / 1,600约 1000 词文章的中英互译;输出 token 数与输入大致相当。

估算:单次任务成本是基于上表典型 token 画像的估算值——实际用量会有出入。价格是我们真实的市场价。

Arena Text Elo 一列:来自 LMArena 的通用对话 Elo(社区投票),并非针对具体任务;仅作参考,绝不参与质量分或标记的计算。

时效:基准分数每月复核一次(每条都带有各自的截至日期);价格反映我们当前的市场价。

独立性:分数来自公开论文,而非我们自己的测试。厂商自报的数字在出现的任何地方都会被标注出来。