あなたのワークロード、実際のコストはいくらでしょうか?

実際の価格と公開ベンチマーク。タスクを選び、ボリュームを設定すると、各ホスト型モデルの実行コストがわかります — 公開ベンチマークが存在する場合は品質データも表示します。

ベンチマークデータ更新日: 2026年7月27日 · 算出方法とデータソース

品質 vs コスト — コーディング / フロントエンド・UI

スコアは公開ベンチマークより · コストは推定値です
コスト軸:

SWE-V 調整後ビュー: 15 件中 3 件のモデルを表示。SWE-bench Verified データのないモデルはこのグラフから除外されているだけで、順位を下げられているわけではありません。

このビューから除外: Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2 他 8 件 — 適格な SWE-V スコアがありません。

パレート効率的 (より安くて高品質な代替がない)バブルの大きさ = コンテキストウィンドウ

調整後の軸には表示されません (SWE-bench Verified スコアがないため — 当サイトがスコアを推定することはありません): Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Pro、Kimi K3

未評価 (このカテゴリの公開ベンチマークデータなし): Claude Opus 4.8、Claude Sonnet 5、DeepSeek V4 Flash、Gemini 2.5 Flash、GPT-5.6 Sol、Claude Sonnet 4.5、Claude Haiku 4.5、Claude Opus 4.5

全モデル一覧

価格は当マーケットプレイスのレート · コスト/ジョブは推定値
GLM-4.5-AirTier 2 · バランス$0.20$1.10125K$0.0025推定$0.0043推定自己申告1,372.9
GLM-4.6Tier 2 · バランス$0.60$2.20200K$0.0057推定$0.0084推定1,425.2
GLM-5Tier 2 · バランス$1.00$3.20200K$0.0088推定$0.01推定1,456.7
Claude Opus 4.8$5.00$25.00200K$0.06推定SWE-V データなし
Claude Sonnet 5$3.00$15.00200K$0.03推定SWE-V データなし
Gemini 3.5 FlashTier 2 · バランス$1.50$9.001M$0.02推定SWE-V データなし1,474.3
GLM-5.2Tier 2 · バランス$1.40$4.40200K$0.01推定SWE-V データなし1,469.2
DeepSeek V4 Flash$0.14$0.28128K$0.0010推定SWE-V データなし1,435.5
DeepSeek V4 ProTier 2 · バランス$0.44$0.87128K$0.0030推定SWE-V データなし1,456.6
Gemini 2.5 Flash$0.30$2.501M$0.0049推定SWE-V データなし1,410.2
GPT-5.6 Sol$5.00$30.00400K$0.07推定SWE-V データなし
Kimi K3Tier 1 · フロンティア$3.00$15.001M$0.03推定SWE-V データなし1,485.7
Claude Sonnet 4.5$3.00$15.00200K$0.03推定SWE-V データなし
Claude Haiku 4.5$0.80$4.00200K$0.0092推定SWE-V データなし
Claude Opus 4.5$15.00$75.00200K$0.17推定SWE-V データなし

ジョブあたりコスト計算ツール

コード生成・編集タスク 1 件

推定値 — 典型的なトークンプロファイルに基づきます。実際の使用量は異なります
コスト基準:

SWE-V 調整後ビュー: 15 件中 3 件のモデルを表示。SWE-bench Verified データのないモデルはこのグラフから除外されているだけで、順位を下げられているわけではありません。

このビューから除外: Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2 他 8 件 — 適格な SWE-V スコアがありません。

1,000
101001k10k100k1M
解決タスクあたりで最安

SWE-V 調整後基準では表示されません (SWE-bench Verified スコアがないため — 当サイトがスコアを推定することはありません): Claude Opus 4.8、Claude Sonnet 5、Gemini 3.5 Flash、GLM-5.2、DeepSeek V4 Flash、DeepSeek V4 Pro、Gemini 2.5 Flash、GPT-5.6 Sol、Kimi K3、Claude Sonnet 4.5、Claude Haiku 4.5、Claude Opus 4.5

算出方法とデータソース

データ最終変更日: 2026年7月27日。各スコアには下記でそれぞれの時点日が付記されています (変更のない同期実行ではこの日付は更新されません。また、上流のリーダーボードはそれぞれのスケジュールで公開されます)。価格は当マーケットプレイスのレートで、ライブで取得しています。ベンチマークスコアは公開の発表資料とリーダーボードに由来します — 当サイト自身の測定値は使わず、捏造も一切しません。直接の公開スコアが存在しない場合は、何も表示しません。

使用ベンチマーク

ベンチマーク指標アンカー 低 → 高ソース
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1,2001,700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

品質スコアは、各ベンチマークの生の値を固定アンカーで正規化し — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — その上でカテゴリの加重平均を取ります。モデルにあるベンチマークが欠けている場合は、残りの重みを再正規化します。カテゴリ内にスコアのあるベンチマークが 1 つもないモデルには、品質スコアを一切付与しません。

使用しているすべてのスコアと、その出典

  • DeepSeek V4 FlashLiveBench Coding: 69.228 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • DeepSeek V4 ProLiveBench Coding: 69.994 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Gemini 3.5 FlashLiveBench Coding: 78.185 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
  • GLM-5.2LiveBench Coding: 79.654 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Kimi K2.6LiveBench Coding: 78.567 出典 (2026年6月25日 時点)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
  • DeepSeek V4 FlashLMArena Text (overall Elo): 1,435.5 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena Text (overall Elo): 1,456.6 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • Gemini 2.5 FlashLMArena Text (overall Elo): 1,410.2 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • Gemini 3.5 FlashLMArena Text (overall Elo): 1,474.3 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.5-AirLMArena Text (overall Elo): 1,372.9 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • GLM-4.6LMArena Text (overall Elo): 1,425.2 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • GLM-5LMArena Text (overall Elo): 1,456.7 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • GLM-5.2LMArena Text (overall Elo): 1,469.2 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena Text (overall Elo): 1,460.9 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • Kimi K3LMArena Text (overall Elo): 1,485.7 出典 (2026年7月21日 時点)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena WebDev: 1,446.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
  • Gemini 3.5 FlashLMArena WebDev: 1,484.3 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.6LMArena WebDev: 1,338.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
  • GLM-5LMArena WebDev: 1,434.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
  • GLM-5.2LMArena WebDev: 1,587.7 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena WebDev: 1,509.8 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
  • Kimi K3LMArena WebDev: 1,682 出典 (2026年7月24日 時点)LMArena WebDev leaderboard, category "overall".
  • GLM-4.5-AirSWE-bench Verified: 57.6 出典 (2026年7月23日 時点)自己申告GLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
  • GLM-4.6SWE-bench Verified: 68.2 出典 (2025年9月30日 時点)SWE-bench Verified leaderboard. 提出ログはまだ SWE-bench メンテナーによって確認されていません。 Official SWE-bench Verified leaderboard submission (vendor scaffold).
  • GLM-5SWE-bench Verified: 72.8 出典 (2026年2月17日 時点)SWE-bench Verified leaderboard. 取得したリーダーボードデータには、この提出の確認ステータスが公開されていません。 mini-SWE-agent harness, high reasoning effort.
  • Kimi K2.6SWE-bench Verified: 80.2 出典 (2026年7月23日 時点)自己申告Official Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.

SWE-bench のスコアには、公式リーダーボード掲載の結果とベンダー自己申告の結果が混在しています (各スコアごとに上記で明示)。エージェントハーネスが異なるため、モデル間でスコアを厳密に比較することはできません。

SWE-V 調整後のジョブあたりコスト

SWE-bench Verified スコアを持つモデルには、以下も表示します swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — 失敗をそのまま再試行した場合の、解決 1 タスクあたりの推定コストです。分母として使うのは SWE-bench Verified の合格率のみです。Arena WebDev や LiveBench のスコアには確率としての意味がないため、代わりに使うことは決してありません。SWE-V スコアのないモデルには「—」を表示します — 当サイトがスコアを推定することはありません。

  • 1/p の式は、一定の成功率での独立した再試行を仮定しています。
  • 各再試行が初回と同じトークン数を使うと仮定しています。
  • 実際の失敗には、単純な再試行ではなく人手やツールの介入が必要なことが多く、そのオーバーヘッドは価格に含まれていません。
  • 解決率は SWE-bench Verified のタスクセットに基づくもので、あなたのタスク分布とは異なります。

機能ティア

品質スコアを持つモデルは、決定的なナチュラルギャップ規則によって 1〜3 のティア (Tier 1 フロンティア / Tier 2 バランス / Tier 3 エコノミー) にグループ化されます。スコアを小数第 1 位に丸めたうえで、(降順に並べた) 隣接モデル間のギャップが max(score range × 25%, 8 points) 以上であれば、ティア境界の候補になります。境界となるのは最大の 2 つの候補ギャップのみです (同値の場合は上位側の位置を採用)。条件を満たすギャップがなければ単一ティアになります。ティア境界はビルド時のスナップショットテストで固定されているため、データ更新によってモデルが暗黙のうちにティア間を移動することはありません — ティアの変更はすべて人間がレビューします。「Tier 1 最安」ハイライトは、最上位ティア内でジョブあたりコストが最も低いモデルを示します。ティアへの所属に必要なのは品質スコアだけなので、SWE-V 調整後コスト列が「—」のままティアに属するモデルもあり得ます。

ほとんどのカテゴリに品質ランキングがない理由

品質ランキングを公開するのは、そのカテゴリで当サイトのモデルのうち 5 つ以上に直接の公開スコア (正確なモデルバージョン、正確なベンチマークバージョン、評価モードの明記) がある場合のみです。現時点でこの基準を満たしているのは コーディング / フロントエンド・UI だけです。それ以外のカテゴリでは、公開リーダーボードが当サイトのカタログをカバーしていないか、更新が止まっているため、コスト計算ツールのみを表示しています。でっち上げの数字をお見せするくらいなら、何も表示しない方を選びます。

計算ツールの背後にあるタスクプロファイル

カテゴリ入力 / 出力トークン前提
コーディング / フロントエンド・UI4,000 / 1,500周辺コンテキストとして中規模のファイルを読み、関数レベルのパッチを生成します。
ライティング・マーケティングコピー800 / 1,200ブリーフとブランドノートを入力し、短いマーケティング文またはメールを 1 本出力します。
データ抽出・JSON 出力2,500 / 400非構造化テキスト 1 ページを入力し、固定スキーマの JSON を出力します。
エージェントのツール呼び出し6,000 / 800複数ターンのツール呼び出しセッションで、ツールスキーマと中間結果もコンテキストに戻して含めます。
長文ドキュメントの RAG / 要約30,000 / 1,500数十ページのドキュメントを入力し、構造化された要約を 1 本出力します。
翻訳1,500 / 1,600約 1000 語の記事の中国語/英語翻訳。出力トークンは入力とほぼ同量です。

推定値: ジョブあたりコストの数値は、上記の典型的なトークンプロファイルに基づく推定値です — 実際の使用量は異なります。価格は当マーケットプレイスの実際のレートです。

Arena Text Elo 列: LMArena の一般チャット Elo (コミュニティ投票) であり、タスク別のものではありません。参考として表示しているだけで、品質スコアやバッジには一切使用しません。

鮮度: ベンチマークスコアは毎月見直しています (各スコアにそれぞれの時点日を付記)。価格は現在のマーケットプレイスレートを反映します。

独立性: スコアは公開の発表資料に由来し、当サイト自身のテストによるものではありません。ベンダー自己申告の数値には、表示されるすべての箇所でその旨のラベルを付けています。