质量与成本 — 编程 / 前端与 UI
分数来自公开基准 · 成本为估算值SWE-V 校正视图:共 15 个模型,显示其中 3 个。没有 SWE-bench Verified 数据的模型被排除在本图之外,不是排名更低。
本视图排除了:Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash和GLM-5.2还有 8 个——没有可用的 SWE-V 分数。
未在校正轴上显示(没有 SWE-bench Verified 分数——我们绝不代为估算):Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Pro和Kimi K3
未评分(该类别没有公开基准数据):Claude Opus 4.8、Claude Sonnet 5、DeepSeek V4 Flash、Gemini 2.5 Flash、GPT-5.6 Sol、Claude Sonnet 4.5、Claude Haiku 4.5和Claude Opus 4.5
全部模型一览
价格为我们的市场价 · 单次成本是一个估算值| GLM-4.5-Air | 第 2 档 · 均衡 | US$0.20 | US$1.10 | 125K | US$0.0025估算 | US$0.0043估算厂商自报 | 1,372.9 |
| GLM-4.6 | 第 2 档 · 均衡 | US$0.60 | US$2.20 | 200K | US$0.0057估算 | US$0.0084估算 | 1,425.2 |
| GLM-5 | 第 2 档 · 均衡 | US$1.00 | US$3.20 | 200K | US$0.0088估算 | US$0.01估算 | 1,456.7 |
| Claude Opus 4.8 | — | US$5.00 | US$25.00 | 200K | US$0.06估算 | 无 SWE-V 数据 | — |
| Claude Sonnet 5 | — | US$3.00 | US$15.00 | 200K | US$0.03估算 | 无 SWE-V 数据 | — |
| Gemini 3.5 Flash | 第 2 档 · 均衡 | US$1.50 | US$9.00 | 1M | US$0.02估算 | 无 SWE-V 数据 | 1,474.3 |
| GLM-5.2 | 第 2 档 · 均衡 | US$1.40 | US$4.40 | 200K | US$0.01估算 | 无 SWE-V 数据 | 1,469.2 |
| DeepSeek V4 Flash | — | US$0.14 | US$0.28 | 128K | US$0.0010估算 | 无 SWE-V 数据 | 1,435.5 |
| DeepSeek V4 Pro | 第 2 档 · 均衡 | US$0.44 | US$0.87 | 128K | US$0.0030估算 | 无 SWE-V 数据 | 1,456.6 |
| Gemini 2.5 Flash | — | US$0.30 | US$2.50 | 1M | US$0.0049估算 | 无 SWE-V 数据 | 1,410.2 |
| GPT-5.6 Sol | — | US$5.00 | US$30.00 | 400K | US$0.07估算 | 无 SWE-V 数据 | — |
| Kimi K3 | 第 1 档 · 前沿 | US$3.00 | US$15.00 | 1M | US$0.03估算 | 无 SWE-V 数据 | 1,485.7 |
| Claude Sonnet 4.5 | — | US$3.00 | US$15.00 | 200K | US$0.03估算 | 无 SWE-V 数据 | — |
| Claude Haiku 4.5 | — | US$0.80 | US$4.00 | 200K | US$0.0092估算 | 无 SWE-V 数据 | — |
| Claude Opus 4.5 | — | US$15.00 | US$75.00 | 200K | US$0.17估算 | 无 SWE-V 数据 | — |
单次任务成本计算器
单次代码生成 / 修改任务
SWE-V 校正视图:共 15 个模型,显示其中 3 个。没有 SWE-bench Verified 数据的模型被排除在本图之外,不是排名更低。
本视图排除了:Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash和GLM-5.2还有 8 个——没有可用的 SWE-V 分数。
未在 SWE-V 校正口径下显示(没有 SWE-bench Verified 分数——我们绝不代为估算):Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Flash、DeepSeek V4 Pro、Gemini 2.5 Flash、GPT-5.6 Sol、Kimi K3、Claude Sonnet 4.5、Claude Haiku 4.5和Claude Opus 4.5
方法与数据来源
数据最后变更于 2026年7月27日;下方每个分数都带有各自的截至日期(无变化的同步任务不会推进这个日期,上游排行榜也各按自己的节奏发布)。价格为我们的市场价,实时获取。基准分数来自公开论文和排行榜——绝非我们自己的测量,也绝不编造:凡是没有直接公开分数的地方,我们就什么都不显示。
所用基准
| 基准 | 指标 | 锚点 低 → 高 | 来源 |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1,200 → 1,700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
质量分用固定锚点对每个原始基准值做归一化 —— norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 —— 再按该类别的权重求加权平均。当某个模型缺少某项基准时,其余权重会重新归一化;在某个类别里一项基准都没有分数的模型,不会得到任何质量分。
我们用到的每一个分数及其来源
- DeepSeek V4 Flash — LiveBench Coding: 69.228 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- DeepSeek V4 Pro — LiveBench Coding: 69.994 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Gemini 3.5 Flash — LiveBench Coding: 78.185 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
- GLM-5.2 — LiveBench Coding: 79.654 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Kimi K2.6 — LiveBench Coding: 78.567 来源 (截至 2026年6月25日)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
- DeepSeek V4 Flash — LMArena Text (overall Elo): 1,435.5 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena Text (overall Elo): 1,456.6 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- Gemini 2.5 Flash — LMArena Text (overall Elo): 1,410.2 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- Gemini 3.5 Flash — LMArena Text (overall Elo): 1,474.3 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.5-Air — LMArena Text (overall Elo): 1,372.9 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- GLM-4.6 — LMArena Text (overall Elo): 1,425.2 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- GLM-5 — LMArena Text (overall Elo): 1,456.7 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- GLM-5.2 — LMArena Text (overall Elo): 1,469.2 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena Text (overall Elo): 1,460.9 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- Kimi K3 — LMArena Text (overall Elo): 1,485.7 来源 (截至 2026年7月21日)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena WebDev: 1,446.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
- Gemini 3.5 Flash — LMArena WebDev: 1,484.3 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.6 — LMArena WebDev: 1,338.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
- GLM-5 — LMArena WebDev: 1,434.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
- GLM-5.2 — LMArena WebDev: 1,587.7 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena WebDev: 1,509.8 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
- Kimi K3 — LMArena WebDev: 1,682 来源 (截至 2026年7月24日)LMArena WebDev leaderboard, category "overall".
- GLM-4.5-Air — SWE-bench Verified: 57.6 来源 (截至 2026年7月23日)厂商自报GLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
- GLM-4.6 — SWE-bench Verified: 68.2 来源 (截至 2025年9月30日)SWE-bench Verified leaderboard. 提交日志尚未由 SWE-bench 维护者核验。 Official SWE-bench Verified leaderboard submission (vendor scaffold).
- GLM-5 — SWE-bench Verified: 72.8 来源 (截至 2026年2月17日)SWE-bench Verified leaderboard. 在抓取到的排行榜数据里,这条提交没有核验状态字段。 mini-SWE-agent harness, high reasoning effort.
- Kimi K2.6 — SWE-bench Verified: 80.2 来源 (截至 2026年7月23日)厂商自报Official Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
SWE-bench 的分数混合了官方排行榜条目与厂商自报结果(已在上方逐条标注);各家 agent 框架不同,因此这些分数在模型之间并不严格可比。
SWE-V 校正单次任务成本
对于有 SWE-bench Verified 分数的模型,我们还会展示 swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) —— 即失败后无脑重试时,每个「已解决」任务的估算成本。分母只会用 SWE-bench Verified 的通过率;Arena WebDev 和 LiveBench 的分数没有概率语义,绝不拿来替代。没有 SWE-V 分数的模型显示「—」——我们绝不代为估算。
- 1/p 公式假设各次重试相互独立且成功率恒定。
- 它假设每次重试消耗的 token 与首次尝试相同。
- 真实失败往往需要人工或工具介入,而不是无脑重试——这部分开销没有计入。
- 解决率来自 SWE-bench Verified 任务集,与你的任务分布并不相同。
能力档位
有质量分的模型会按确定性的自然断点规则分成 1-3 档(第 1 档 前沿 / 第 2 档 均衡 / 第 3 档 经济):分数先四舍五入到 1 位小数,然后相邻模型(按降序)之间只要出现不小于 max(score range × 25%, 8 points) 的间隔,就成为候选档位边界;候选中只有最大的两个会真正成为边界(并列时取排名更高的位置)。没有符合条件的间隔就只有一档。档位边界由构建期快照测试钉死,因此数据更新绝不会悄悄把模型挪档——每一次档位变化都经过人工复核。「第 1 档中最便宜」标记的是顶档内单次成本最低的模型;进入档位只需要有质量分,所以一个模型可以占着档位、同时 SWE-V 校正成本那一列显示「—」。
为什么多数类别没有质量排名
只有当我们目录中至少 5 个模型拥有直接的公开分数——确切的模型版本、确切的基准版本、注明评测模式——我们才会为该类别发布质量排名。目前达到这个门槛的只有编程 / 前端与 UI。其余类别要么公开排行榜没有覆盖我们的目录,要么已经停止更新,所以我们只提供成本计算器。我们宁可什么都不给你看,也不给一个编出来的数字。
计算器背后的任务画像
| 类别 | 输入 / 输出 token | 假设 |
|---|---|---|
| 编程 / 前端与 UI | 4,000 / 1,500 | 读入中等长度的上下文文件,产出函数级别的补丁。 |
| 写作与营销文案 | 800 / 1,200 | 输入简报加品牌说明,输出一段短营销文案或邮件。 |
| 数据抽取与 JSON 输出 | 2,500 / 400 | 输入一页非结构化文本,输出固定 schema 的 JSON。 |
| Agent 工具调用 | 6,000 / 800 | 多轮工具调用会话,包含工具 schema 以及回填进上下文的中间结果。 |
| 长文档 RAG / 摘要 | 30,000 / 1,500 | 输入数十页文档,输出一份结构化摘要。 |
| 翻译 | 1,500 / 1,600 | 约 1000 词文章的中英互译;输出 token 数与输入大致相当。 |
估算:单次任务成本是基于上表典型 token 画像的估算值——实际用量会有出入。价格是我们真实的市场价。
Arena Text Elo 一列:来自 LMArena 的通用对话 Elo(社区投票),并非针对具体任务;仅作参考,绝不参与质量分或标记的计算。
时效:基准分数每月复核一次(每条都带有各自的截至日期);价格反映我们当前的市场价。
独立性:分数来自公开论文,而非我们自己的测试。厂商自报的数字在出现的任何地方都会被标注出来。