全部模型一览
价格为我们的市场价 · 单次成本是一个估算值| Kimi K2.6 | 第 1 档 · 前沿 | US$0.76 | US$3.20 | 256K | US$0.0078估算 | US$0.0098估算厂商自报 | 1,460.9 |
| GLM-5 | 第 2 档 · 均衡 | US$1.00 | US$3.20 | 200K | US$0.0088估算 | US$0.01估算 | 1,456.7 |
| DeepSeek V4 Flash | — | US$0.20 | US$0.59 | 1M | US$0.0017估算 | 无 SWE-V 数据 | 1,435.5 |
| DeepSeek V4 Pro | 第 3 档 · 经济 | US$0.59 | US$1.78 | 1M | US$0.0050估算 | 无 SWE-V 数据 | 1,456.6 |
| GLM-5-Turbo | — | US$0.96 | US$3.20 | 200K | US$0.0086估算 | 无 SWE-V 数据 | — |
| Qwen3.7-Plus | — | US$0.32 | US$1.28 | 1M | US$0.0032估算 | 无 SWE-V 数据 | — |
| Qwen3.7-Max | — | US$2.00 | US$6.00 | 1M | US$0.02估算 | 无 SWE-V 数据 | — |
| MiniMax M3 | — | US$0.24 | US$0.96 | 1M | US$0.0024估算 | 无 SWE-V 数据 | — |
单次任务成本计算器
单次代码生成 / 修改任务
SWE-V 校正视图:共 8 个模型,显示其中 2 个。没有 SWE-bench Verified 数据的模型被排除在本图之外,不是排名更低。
本视图排除了:DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5-Turbo和Qwen3.7-Plus还有 2 个——没有可用的 SWE-V 分数。
未在 SWE-V 校正口径下显示(没有 SWE-bench Verified 分数——我们绝不代为估算):DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5-Turbo、Qwen3.7-Plus、Qwen3.7-Max和MiniMax M3
方法与数据来源
数据最后变更于 2026年7月27日;下方每个分数都带有各自的截至日期(无变化的同步任务不会推进这个日期,上游排行榜也各按自己的节奏发布)。价格为我们的市场价,实时获取。基准分数来自公开论文和排行榜——绝非我们自己的测量,也绝不编造:凡是没有直接公开分数的地方,我们就什么都不显示。
所用基准
| 基准 | 指标 | 锚点 低 → 高 | 来源 |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1,200 → 1,700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
质量分用固定锚点对每个原始基准值做归一化 —— norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 —— 再按该类别的权重求加权平均。当某个模型缺少某项基准时,其余权重会重新归一化;在某个类别里一项基准都没有分数的模型,不会得到任何质量分。
SWE-V 校正单次任务成本
对于有 SWE-bench Verified 分数的模型,我们还会展示 swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) —— 即失败后无脑重试时,每个「已解决」任务的估算成本。分母只会用 SWE-bench Verified 的通过率;Arena WebDev 和 LiveBench 的分数没有概率语义,绝不拿来替代。没有 SWE-V 分数的模型显示「—」——我们绝不代为估算。
- 1/p 公式假设各次重试相互独立且成功率恒定。
- 它假设每次重试消耗的 token 与首次尝试相同。
- 真实失败往往需要人工或工具介入,而不是无脑重试——这部分开销没有计入。
- 解决率来自 SWE-bench Verified 任务集,与你的任务分布并不相同。
能力档位
有质量分的模型会按确定性的自然断点规则分成 1-3 档(第 1 档 前沿 / 第 2 档 均衡 / 第 3 档 经济):分数先四舍五入到 1 位小数,然后相邻模型(按降序)之间只要出现不小于 max(score range × 25%, 8 points) 的间隔,就成为候选档位边界;候选中只有最大的两个会真正成为边界(并列时取排名更高的位置)。没有符合条件的间隔就只有一档。档位边界由构建期快照测试钉死,因此数据更新绝不会悄悄把模型挪档——每一次档位变化都经过人工复核。「第 1 档中最便宜」标记的是顶档内单次成本最低的模型;进入档位只需要有质量分,所以一个模型可以占着档位、同时 SWE-V 校正成本那一列显示「—」。
为什么多数类别没有质量排名
只有当我们目录中至少 5 个模型拥有直接的公开分数——确切的模型版本、确切的基准版本、注明评测模式——我们才会为该类别发布质量排名。目前达到这个门槛的只有编程 / 前端与 UI。其余类别要么公开排行榜没有覆盖我们的目录,要么已经停止更新,所以我们只提供成本计算器。我们宁可什么都不给你看,也不给一个编出来的数字。
计算器背后的任务画像
| 类别 | 输入 / 输出 token | 假设 |
|---|---|---|
| 编程 / 前端与 UI | 4,000 / 1,500 | 读入中等长度的上下文文件,产出函数级别的补丁。 |
| 写作与营销文案 | 800 / 1,200 | 输入简报加品牌说明,输出一段短营销文案或邮件。 |
| 数据抽取与 JSON 输出 | 2,500 / 400 | 输入一页非结构化文本,输出固定 schema 的 JSON。 |
| Agent 工具调用 | 6,000 / 800 | 多轮工具调用会话,包含工具 schema 以及回填进上下文的中间结果。 |
| 长文档 RAG / 摘要 | 30,000 / 1,500 | 输入数十页文档,输出一份结构化摘要。 |
| 翻译 | 1,500 / 1,600 | 约 1000 词文章的中英互译;输出 token 数与输入大致相当。 |
估算:单次任务成本是基于上表典型 token 画像的估算值——实际用量会有出入。价格是我们真实的市场价。
Arena Text Elo 一列:来自 LMArena 的通用对话 Elo(社区投票),并非针对具体任务;仅作参考,绝不参与质量分或标记的计算。
时效:基准分数每月复核一次(每条都带有各自的截至日期);价格反映我们当前的市场价。
独立性:分数来自公开论文,而非我们自己的测试。厂商自报的数字在出现的任何地方都会被标注出来。