あなたのワークロード、実際のコストはいくらでしょうか?
実際の価格と公開ベンチマーク。タスクを選び、ボリュームを設定すると、各ホスト型モデルの実行コストがわかります — 公開ベンチマークが存在する場合は品質データも表示します。
ベンチマークデータ更新日: 2026年7月27日 · 算出方法とデータソース
品質 vs コスト — コーディング / フロントエンド・UI
スコアは公開ベンチマークより · コストは推定値ですSWE-V 調整後ビュー: 15 件中 3 件のモデルを表示。SWE-bench Verified データのないモデルはこのグラフから除外されているだけで、順位を下げられているわけではありません。
このビューから除外: Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2 他 8 件 — 適格な SWE-V スコアがありません。
調整後の軸には表示されません (SWE-bench Verified スコアがないため — 当サイトがスコアを推定することはありません): Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Pro、Kimi K3
未評価 (このカテゴリの公開ベンチマークデータなし): Claude Opus 4.8、Claude Sonnet 5、DeepSeek V4 Flash、Gemini 2.5 Flash、GPT-5.6 Sol、Claude Sonnet 4.5、Claude Haiku 4.5、Claude Opus 4.5
全モデル一覧
価格は当マーケットプレイスのレート · コスト/ジョブは推定値| GLM-4.5-Air | Tier 2 · バランス | $0.20 | $1.10 | 125K | $0.0025推定 | $0.0043推定自己申告 | 1,372.9 |
| GLM-4.6 | Tier 2 · バランス | $0.60 | $2.20 | 200K | $0.0057推定 | $0.0084推定 | 1,425.2 |
| GLM-5 | Tier 2 · バランス | $1.00 | $3.20 | 200K | $0.0088推定 | $0.01推定 | 1,456.7 |
| Claude Opus 4.8 | — | $5.00 | $25.00 | 200K | $0.06推定 | SWE-V データなし | — |
| Claude Sonnet 5 | — | $3.00 | $15.00 | 200K | $0.03推定 | SWE-V データなし | — |
| Gemini 3.5 Flash | Tier 2 · バランス | $1.50 | $9.00 | 1M | $0.02推定 | SWE-V データなし | 1,474.3 |
| GLM-5.2 | Tier 2 · バランス | $1.40 | $4.40 | 200K | $0.01推定 | SWE-V データなし | 1,469.2 |
| DeepSeek V4 Flash | — | $0.14 | $0.28 | 128K | $0.0010推定 | SWE-V データなし | 1,435.5 |
| DeepSeek V4 Pro | Tier 2 · バランス | $0.44 | $0.87 | 128K | $0.0030推定 | SWE-V データなし | 1,456.6 |
| Gemini 2.5 Flash | — | $0.30 | $2.50 | 1M | $0.0049推定 | SWE-V データなし | 1,410.2 |
| GPT-5.6 Sol | — | $5.00 | $30.00 | 400K | $0.07推定 | SWE-V データなし | — |
| Kimi K3 | Tier 1 · フロンティア | $3.00 | $15.00 | 1M | $0.03推定 | SWE-V データなし | 1,485.7 |
| Claude Sonnet 4.5 | — | $3.00 | $15.00 | 200K | $0.03推定 | SWE-V データなし | — |
| Claude Haiku 4.5 | — | $0.80 | $4.00 | 200K | $0.0092推定 | SWE-V データなし | — |
| Claude Opus 4.5 | — | $15.00 | $75.00 | 200K | $0.17推定 | SWE-V データなし | — |
ジョブあたりコスト計算ツール
コード生成・編集タスク 1 件
SWE-V 調整後ビュー: 15 件中 3 件のモデルを表示。SWE-bench Verified データのないモデルはこのグラフから除外されているだけで、順位を下げられているわけではありません。
このビューから除外: Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2 他 8 件 — 適格な SWE-V スコアがありません。
SWE-V 調整後基準では表示されません (SWE-bench Verified スコアがないため — 当サイトがスコアを推定することはありません): Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Flash、DeepSeek V4 Pro、Gemini 2.5 Flash、GPT-5.6 Sol、Kimi K3、Claude Sonnet 4.5、Claude Haiku 4.5、Claude Opus 4.5
算出方法とデータソース
データ最終変更日: 2026年7月27日。各スコアには下記でそれぞれの時点日が付記されています (変更のない同期実行ではこの日付は更新されません。また、上流のリーダーボードはそれぞれのスケジュールで公開されます)。価格は当マーケットプレイスのレートで、ライブで取得しています。ベンチマークスコアは公開の発表資料とリーダーボードに由来します — 当サイト自身の測定値は使わず、捏造も一切しません。直接の公開スコアが存在しない場合は、何も表示しません。
使用ベンチマーク
| ベンチマーク | 指標 | アンカー 低 → 高 | ソース |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1,200 → 1,700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
品質スコアは、各ベンチマークの生の値を固定アンカーで正規化し — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — その上でカテゴリの加重平均を取ります。モデルにあるベンチマークが欠けている場合は、残りの重みを再正規化します。カテゴリ内にスコアのあるベンチマークが 1 つもないモデルには、品質スコアを一切付与しません。
使用しているすべてのスコアと、その出典
- DeepSeek V4 Flash — LiveBench Coding: 69.228 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- DeepSeek V4 Pro — LiveBench Coding: 69.994 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Gemini 3.5 Flash — LiveBench Coding: 78.185 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
- GLM-5.2 — LiveBench Coding: 79.654 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Kimi K2.6 — LiveBench Coding: 78.567 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
- DeepSeek V4 Flash — LMArena Text (overall Elo): 1,435.5 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena Text (overall Elo): 1,456.6 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- Gemini 2.5 Flash — LMArena Text (overall Elo): 1,410.2 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- Gemini 3.5 Flash — LMArena Text (overall Elo): 1,474.3 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.5-Air — LMArena Text (overall Elo): 1,372.9 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- GLM-4.6 — LMArena Text (overall Elo): 1,425.2 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- GLM-5 — LMArena Text (overall Elo): 1,456.7 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- GLM-5.2 — LMArena Text (overall Elo): 1,469.2 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena Text (overall Elo): 1,460.9 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- Kimi K3 — LMArena Text (overall Elo): 1,485.7 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena WebDev: 1,446.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
- Gemini 3.5 Flash — LMArena WebDev: 1,484.3 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.6 — LMArena WebDev: 1,338.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
- GLM-5 — LMArena WebDev: 1,434.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
- GLM-5.2 — LMArena WebDev: 1,587.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena WebDev: 1,509.8 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
- Kimi K3 — LMArena WebDev: 1,682 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
- GLM-4.5-Air — SWE-bench Verified: 57.6 出典 (2026年7月23日 時点)自己申告GLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
- GLM-4.6 — SWE-bench Verified: 68.2 出典 (2025年9月30日 時点)SWE-bench Verified leaderboard. 提出ログはまだ SWE-bench メンテナーによって確認されていません。 Official SWE-bench Verified leaderboard submission (vendor scaffold).
- GLM-5 — SWE-bench Verified: 72.8 出典 (2026年2月17日 時点)SWE-bench Verified leaderboard. 取得したリーダーボードデータには、この提出の確認ステータスが公開されていません。 mini-SWE-agent harness, high reasoning effort.
- Kimi K2.6 — SWE-bench Verified: 80.2 出典 (2026年7月23日 時点)自己申告Official Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
SWE-bench のスコアには、公式リーダーボード掲載の結果とベンダー自己申告の結果が混在しています (各スコアごとに上記で明示)。エージェントハーネスが異なるため、モデル間でスコアを厳密に比較することはできません。
SWE-V 調整後のジョブあたりコスト
SWE-bench Verified スコアを持つモデルには、以下も表示します swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — 失敗をそのまま再試行した場合の、解決 1 タスクあたりの推定コストです。分母として使うのは SWE-bench Verified の合格率のみです。Arena WebDev や LiveBench のスコアには確率としての意味がないため、代わりに使うことは決してありません。SWE-V スコアのないモデルには「—」を表示します — 当サイトがスコアを推定することはありません。
- 1/p の式は、一定の成功率での独立した再試行を仮定しています。
- 各再試行が初回と同じトークン数を使うと仮定しています。
- 実際の失敗には、単純な再試行ではなく人手やツールの介入が必要なことが多く、そのオーバーヘッドは価格に含まれていません。
- 解決率は SWE-bench Verified のタスクセットに基づくもので、あなたのタスク分布とは異なります。
機能ティア
品質スコアを持つモデルは、決定的なナチュラルギャップ規則によって 1〜3 のティア (Tier 1 フロンティア / Tier 2 バランス / Tier 3 エコノミー) にグループ化されます。スコアを小数第 1 位に丸めたうえで、(降順に並べた) 隣接モデル間のギャップが max(score range × 25%, 8 points) 以上であれば、ティア境界の候補になります。境界となるのは最大の 2 つの候補ギャップのみです (同値の場合は上位側の位置を採用)。条件を満たすギャップがなければ単一ティアになります。ティア境界はビルド時のスナップショットテストで固定されているため、データ更新によってモデルが暗黙のうちにティア間を移動することはありません — ティアの変更はすべて人間がレビューします。「Tier 1 最安」ハイライトは、最上位ティア内でジョブあたりコストが最も低いモデルを示します。ティアへの所属に必要なのは品質スコアだけなので、SWE-V 調整後コスト列が「—」のままティアに属するモデルもあり得ます。
ほとんどのカテゴリに品質ランキングがない理由
品質ランキングを公開するのは、そのカテゴリで当サイトのモデルのうち 5 つ以上に直接の公開スコア (正確なモデルバージョン、正確なベンチマークバージョン、評価モードの明記) がある場合のみです。現時点でこの基準を満たしているのは コーディング / フロントエンド・UI だけです。それ以外のカテゴリでは、公開リーダーボードが当サイトのカタログをカバーしていないか、更新が止まっているため、コスト計算ツールのみを表示しています。でっち上げの数字をお見せするくらいなら、何も表示しない方を選びます。
計算ツールの背後にあるタスクプロファイル
| カテゴリ | 入力 / 出力トークン | 前提 |
|---|---|---|
| コーディング / フロントエンド・UI | 4,000 / 1,500 | 周辺コンテキストとして中規模のファイルを読み、関数レベルのパッチを生成します。 |
| ライティング・マーケティングコピー | 800 / 1,200 | ブリーフとブランドノートを入力し、短いマーケティング文またはメールを 1 本出力します。 |
| データ抽出・JSON 出力 | 2,500 / 400 | 非構造化テキスト 1 ページを入力し、固定スキーマの JSON を出力します。 |
| エージェントのツール呼び出し | 6,000 / 800 | 複数ターンのツール呼び出しセッションで、ツールスキーマと中間結果もコンテキストに戻して含めます。 |
| 長文ドキュメントの RAG / 要約 | 30,000 / 1,500 | 数十ページのドキュメントを入力し、構造化された要約を 1 本出力します。 |
| 翻訳 | 1,500 / 1,600 | 約 1000 語の記事の中国語/英語翻訳。出力トークンは入力とほぼ同量です。 |
推定値: ジョブあたりコストの数値は、上記の典型的なトークンプロファイルに基づく推定値です — 実際の使用量は異なります。価格は当マーケットプレイスの実際のレートです。
Arena Text Elo 列: LMArena の一般チャット Elo (コミュニティ投票) であり、タスク別のものではありません。参考として表示しているだけで、品質スコアやバッジには一切使用しません。
鮮度: ベンチマークスコアは毎月見直しています (各スコアにそれぞれの時点日を付記)。価格は現在のマーケットプレイスレートを反映します。
独立性: スコアは公開の発表資料に由来し、当サイト自身のテストによるものではありません。ベンダー自己申告の数値には、表示されるすべての箇所でその旨のラベルを付けています。