あなたのワークロード、実際のコストはいくらでしょうか?

実際の価格と公開ベンチマーク。タスクを選び、ボリュームを設定すると、各ホスト型モデルの実行コストがわかります — 公開ベンチマークが存在する場合は品質データも表示します。

ベンチマークデータ更新日: 2026年7月27日 · 算出方法とデータソース

全モデル一覧

価格は当マーケットプレイスのレート · コスト/ジョブは推定値
Kimi K2.6Tier 1 · フロンティア$0.76$3.20256K$0.0078推定$0.0098推定自己申告1,460.9
GLM-5Tier 2 · バランス$1.00$3.20200K$0.0088推定$0.01推定1,456.7
DeepSeek V4 Flash$0.20$0.591M$0.0017推定SWE-V データなし1,435.5
DeepSeek V4 ProTier 3 · エコノミー$0.59$1.781M$0.0050推定SWE-V データなし1,456.6
GLM-5-Turbo$0.96$3.20200K$0.0086推定SWE-V データなし
Qwen3.7-Plus$0.32$1.281M$0.0032推定SWE-V データなし
Qwen3.7-Max$2.00$6.001M$0.02推定SWE-V データなし
MiniMax M3$0.24$0.961M$0.0024推定SWE-V データなし

ジョブあたりコスト計算ツール

コード生成・編集タスク 1 件

推定値 — 典型的なトークンプロファイルに基づきます。実際の使用量は異なります
コスト基準:

SWE-V 調整後ビュー: 8 件中 2 件のモデルを表示。SWE-bench Verified データのないモデルはこのグラフから除外されているだけで、順位を下げられているわけではありません。

このビューから除外: DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5-Turbo、Qwen3.7-Plus 他 2 件 — 適格な SWE-V スコアがありません。

1,000
101001k10k100k1M
解決タスクあたりで最安Tier 1 最安 — 最上位機能ティアで最も安いモデル

SWE-V 調整後基準では表示されません (SWE-bench Verified スコアがないため — 当サイトがスコアを推定することはありません): DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5-Turbo、Qwen3.7-Plus、Qwen3.7-Max、MiniMax M3

算出方法とデータソース

データ最終変更日: 2026年7月27日。各スコアには下記でそれぞれの時点日が付記されています (変更のない同期実行ではこの日付は更新されません。また、上流のリーダーボードはそれぞれのスケジュールで公開されます)。価格は当マーケットプレイスのレートで、ライブで取得しています。ベンチマークスコアは公開の発表資料とリーダーボードに由来します — 当サイト自身の測定値は使わず、捏造も一切しません。直接の公開スコアが存在しない場合は、何も表示しません。

使用ベンチマーク

ベンチマーク指標アンカー 低 → 高ソース
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1,2001,700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

品質スコアは、各ベンチマークの生の値を固定アンカーで正規化し — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — その上でカテゴリの加重平均を取ります。モデルにあるベンチマークが欠けている場合は、残りの重みを再正規化します。カテゴリ内にスコアのあるベンチマークが 1 つもないモデルには、品質スコアを一切付与しません。

SWE-V 調整後のジョブあたりコスト

SWE-bench Verified スコアを持つモデルには、以下も表示します swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — 失敗をそのまま再試行した場合の、解決 1 タスクあたりの推定コストです。分母として使うのは SWE-bench Verified の合格率のみです。Arena WebDev や LiveBench のスコアには確率としての意味がないため、代わりに使うことは決してありません。SWE-V スコアのないモデルには「—」を表示します — 当サイトがスコアを推定することはありません。

  • 1/p の式は、一定の成功率での独立した再試行を仮定しています。
  • 各再試行が初回と同じトークン数を使うと仮定しています。
  • 実際の失敗には、単純な再試行ではなく人手やツールの介入が必要なことが多く、そのオーバーヘッドは価格に含まれていません。
  • 解決率は SWE-bench Verified のタスクセットに基づくもので、あなたのタスク分布とは異なります。

機能ティア

品質スコアを持つモデルは、決定的なナチュラルギャップ規則によって 1〜3 のティア (Tier 1 フロンティア / Tier 2 バランス / Tier 3 エコノミー) にグループ化されます。スコアを小数第 1 位に丸めたうえで、(降順に並べた) 隣接モデル間のギャップが max(score range × 25%, 8 points) 以上であれば、ティア境界の候補になります。境界となるのは最大の 2 つの候補ギャップのみです (同値の場合は上位側の位置を採用)。条件を満たすギャップがなければ単一ティアになります。ティア境界はビルド時のスナップショットテストで固定されているため、データ更新によってモデルが暗黙のうちにティア間を移動することはありません — ティアの変更はすべて人間がレビューします。「Tier 1 最安」ハイライトは、最上位ティア内でジョブあたりコストが最も低いモデルを示します。ティアへの所属に必要なのは品質スコアだけなので、SWE-V 調整後コスト列が「—」のままティアに属するモデルもあり得ます。

ほとんどのカテゴリに品質ランキングがない理由

品質ランキングを公開するのは、そのカテゴリで当サイトのモデルのうち 5 つ以上に直接の公開スコア (正確なモデルバージョン、正確なベンチマークバージョン、評価モードの明記) がある場合のみです。現時点でこの基準を満たしているのは コーディング / フロントエンド・UI だけです。それ以外のカテゴリでは、公開リーダーボードが当サイトのカタログをカバーしていないか、更新が止まっているため、コスト計算ツールのみを表示しています。でっち上げの数字をお見せするくらいなら、何も表示しない方を選びます。

計算ツールの背後にあるタスクプロファイル

カテゴリ入力 / 出力トークン前提
コーディング / フロントエンド・UI4,000 / 1,500周辺コンテキストとして中規模のファイルを読み、関数レベルのパッチを生成します。
ライティング・マーケティングコピー800 / 1,200ブリーフとブランドノートを入力し、短いマーケティング文またはメールを 1 本出力します。
データ抽出・JSON 出力2,500 / 400非構造化テキスト 1 ページを入力し、固定スキーマの JSON を出力します。
エージェントのツール呼び出し6,000 / 800複数ターンのツール呼び出しセッションで、ツールスキーマと中間結果もコンテキストに戻して含めます。
長文ドキュメントの RAG / 要約30,000 / 1,500数十ページのドキュメントを入力し、構造化された要約を 1 本出力します。
翻訳1,500 / 1,600約 1000 語の記事の中国語/英語翻訳。出力トークンは入力とほぼ同量です。

推定値: ジョブあたりコストの数値は、上記の典型的なトークンプロファイルに基づく推定値です — 実際の使用量は異なります。価格は当マーケットプレイスの実際のレートです。

Arena Text Elo 列: LMArena の一般チャット Elo (コミュニティ投票) であり、タスク別のものではありません。参考として表示しているだけで、品質スコアやバッジには一切使用しません。

鮮度: ベンチマークスコアは毎月見直しています (各スコアにそれぞれの時点日を付記)。価格は現在のマーケットプレイスレートを反映します。

独立性: スコアは公開の発表資料に由来し、当サイト自身のテストによるものではありません。ベンダー自己申告の数値には、表示されるすべての箇所でその旨のラベルを付けています。