Berapa sebenarnya biaya beban kerja Anda?

Harga nyata, benchmark publik. Pilih tugas, atur volume Anda, dan lihat berapa biaya menjalankan tiap model yang di-hosting — plus data kualitas bila benchmark publik tersedia.

Data benchmark diperbarui 27 Juli 2026 · Metodologi & sumber

Kualitas vs. Biaya — Coding / Frontend & UI

Skor dari benchmark publik · biaya adalah Estimasi
Sumbu biaya:

Tampilan disesuaikan SWE-V: menampilkan 3 dari 15 model. Model tanpa data SWE-bench Verified dikecualikan dari grafik ini, bukan diperingkat lebih rendah.

Dikecualikan dari tampilan ini: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, dan GLM-5.2 +8 lagi — tidak ada skor SWE-V yang memenuhi syarat.

Efisien Pareto (tidak ada alternatif yang lebih murah sekaligus lebih baik)Ukuran gelembung = jendela konteks

Tidak ditampilkan pada sumbu yang disesuaikan (tidak ada skor SWE-bench Verified — kami tidak pernah memperkirakan satu pun): Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Pro, dan Kimi K3

Tanpa peringkat (tidak ada data benchmark publik untuk kategori ini): Claude Opus 4.8, Claude Sonnet 5, DeepSeek V4 Flash, Gemini 2.5 Flash, GPT-5.6 Sol, Claude Sonnet 4.5, Claude Haiku 4.5, dan Claude Opus 4.5

Semua Model Sekilas

Harga adalah tarif marketplace kami · biaya/pekerjaan merupakan Estimasi
GLM-4.5-AirTier 2 · SeimbangUS$0,20US$1,10125KUS$0,0025estimasiUS$0,0043estimasidilaporkan sendiri1.372,9
GLM-4.6Tier 2 · SeimbangUS$0,60US$2,20200KUS$0,0057estimasiUS$0,0084estimasi1.425,2
GLM-5Tier 2 · SeimbangUS$1,00US$3,20200KUS$0,0088estimasiUS$0,01estimasi1.456,7
Claude Opus 4.8US$5,00US$25,00200KUS$0,06estimasiTanpa data SWE-V
Claude Sonnet 5US$3,00US$15,00200KUS$0,03estimasiTanpa data SWE-V
Gemini 3.5 FlashTier 2 · SeimbangUS$1,50US$9,001MUS$0,02estimasiTanpa data SWE-V1.474,3
GLM-5.2Tier 2 · SeimbangUS$1,40US$4,40200KUS$0,01estimasiTanpa data SWE-V1.469,2
DeepSeek V4 FlashUS$0,14US$0,28128KUS$0,0010estimasiTanpa data SWE-V1.435,5
DeepSeek V4 ProTier 2 · SeimbangUS$0,44US$0,87128KUS$0,0030estimasiTanpa data SWE-V1.456,6
Gemini 2.5 FlashUS$0,30US$2,501MUS$0,0049estimasiTanpa data SWE-V1.410,2
GPT-5.6 SolUS$5,00US$30,00400KUS$0,07estimasiTanpa data SWE-V
Kimi K3Tier 1 · TerdepanUS$3,00US$15,001MUS$0,03estimasiTanpa data SWE-V1.485,7
Claude Sonnet 4.5US$3,00US$15,00200KUS$0,03estimasiTanpa data SWE-V
Claude Haiku 4.5US$0,80US$4,00200KUS$0,0092estimasiTanpa data SWE-V
Claude Opus 4.5US$15,00US$75,00200KUS$0,17estimasiTanpa data SWE-V

Kalkulator Biaya per Pekerjaan

Satu tugas pembuatan / penyuntingan kode

Estimasi — berdasarkan profil token tipikal, pemakaian aktual bervariasi
Basis biaya:

Tampilan disesuaikan SWE-V: menampilkan 3 dari 15 model. Model tanpa data SWE-bench Verified dikecualikan dari grafik ini, bukan diperingkat lebih rendah.

Dikecualikan dari tampilan ini: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, dan GLM-5.2 +8 lagi — tidak ada skor SWE-V yang memenuhi syarat.

1.000
101001k10k100k1M
Termurah per tugas terselesaikan

Tidak ditampilkan pada basis disesuaikan SWE-V (tidak ada skor SWE-bench Verified — kami tidak pernah memperkirakan satu pun): Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Flash, DeepSeek V4 Pro, Gemini 2.5 Flash, GPT-5.6 Sol, Kimi K3, Claude Sonnet 4.5, Claude Haiku 4.5, dan Claude Opus 4.5

Metodologi & Sumber Data

Data terakhir berubah 27 Juli 2026; tiap skor mencantumkan tanggal acuannya sendiri di bawah (proses sinkronisasi tanpa perubahan tidak memajukan tanggal ini, dan papan peringkat hulu terbit sesuai jadwal masing-masing). Harga adalah tarif marketplace kami, diambil secara live. Skor benchmark berasal dari publikasi dan papan peringkat publik — tidak pernah dari pengukuran kami sendiri, dan tidak pernah dikarang: bila tidak ada skor publik langsung, kami tidak menampilkan apa pun.

Benchmark yang digunakan

BenchmarkMetrikJangkar rendah → tinggiSumber
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1.2001.700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

Skor kualitas menormalkan tiap nilai benchmark mentah dengan jangkar tetap — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — lalu mengambil rata-rata tertimbang kategori tersebut. Bila sebuah model tidak memiliki suatu benchmark, bobot yang tersisa dinormalkan ulang; model tanpa satu pun benchmark terskor dalam suatu kategori tidak mendapat skor kualitas sama sekali.

Setiap skor yang kami gunakan, beserta sumbernya

  • DeepSeek V4 FlashLiveBench Coding: 69,228 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • DeepSeek V4 ProLiveBench Coding: 69,994 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Gemini 3.5 FlashLiveBench Coding: 78,185 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
  • GLM-5.2LiveBench Coding: 79,654 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Kimi K2.6LiveBench Coding: 78,567 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
  • DeepSeek V4 FlashLMArena Text (overall Elo): 1.435,5 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena Text (overall Elo): 1.456,6 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • Gemini 2.5 FlashLMArena Text (overall Elo): 1.410,2 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • Gemini 3.5 FlashLMArena Text (overall Elo): 1.474,3 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.5-AirLMArena Text (overall Elo): 1.372,9 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • GLM-4.6LMArena Text (overall Elo): 1.425,2 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • GLM-5LMArena Text (overall Elo): 1.456,7 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • GLM-5.2LMArena Text (overall Elo): 1.469,2 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena Text (overall Elo): 1.460,9 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • Kimi K3LMArena Text (overall Elo): 1.485,7 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena WebDev: 1.446,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
  • Gemini 3.5 FlashLMArena WebDev: 1.484,3 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.6LMArena WebDev: 1.338,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
  • GLM-5LMArena WebDev: 1.434,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
  • GLM-5.2LMArena WebDev: 1.587,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena WebDev: 1.509,8 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
  • Kimi K3LMArena WebDev: 1.682 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
  • GLM-4.5-AirSWE-bench Verified: 57,6 sumber (per 23 Juli 2026)dilaporkan sendiriGLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
  • GLM-4.6SWE-bench Verified: 68,2 sumber (per 30 September 2025)SWE-bench Verified leaderboard. Log pengiriman belum diperiksa oleh pemelihara SWE-bench. Official SWE-bench Verified leaderboard submission (vendor scaffold).
  • GLM-5SWE-bench Verified: 72,8 sumber (per 17 Februari 2026)SWE-bench Verified leaderboard. Tidak ada status pemeriksaan yang dipublikasikan untuk pengiriman ini dalam data papan peringkat yang kami ambil. mini-SWE-agent harness, high reasoning effort.
  • Kimi K2.6SWE-bench Verified: 80,2 sumber (per 23 Juli 2026)dilaporkan sendiriOfficial Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.

Skor SWE-bench mencampur entri papan peringkat resmi dengan hasil yang dilaporkan sendiri oleh vendor (ditandai per skor di atas); harness agen berbeda-beda, sehingga skor tidak sepenuhnya sebanding antar model.

Biaya per pekerjaan disesuaikan SWE-V

Untuk model dengan skor SWE-bench Verified kami juga menampilkan swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — estimasi biaya per tugas terselesaikan jika kegagalan dicoba ulang secara buta. Hanya tingkat kelulusan SWE-bench Verified yang pernah dipakai sebagai penyebut; skor Arena WebDev dan LiveBench tidak memiliki semantik probabilitas dan tidak pernah disubstitusikan. Model tanpa skor SWE-V menampilkan “—” — kami tidak pernah memperkirakan satu pun.

  • Rumus 1/p mengasumsikan percobaan ulang independen dengan tingkat keberhasilan konstan.
  • Rumus ini mengasumsikan setiap percobaan ulang memakai token yang sama dengan percobaan pertama.
  • Kegagalan nyata sering membutuhkan intervensi manusia atau tool alih-alih percobaan ulang buta — overhead itu tidak dihitung dalam harga.
  • Tingkat penyelesaian berasal dari set tugas SWE-bench Verified, yang berbeda dari distribusi tugas Anda.

Tier kemampuan

Model dengan skor kualitas dikelompokkan ke dalam 1-3 tier (Tier 1 Terdepan / Tier 2 Seimbang / Tier 3 Hemat) berdasarkan aturan celah-alami deterministik: skor dibulatkan ke 1 desimal, lalu setiap celah antara model yang berdekatan (dalam urutan menurun) sebesar minimal max(score range × 25%, 8 points) menjadi kandidat batas tier; hanya dua celah kandidat terbesar yang menjadi batas (bila seri, posisi berperingkat lebih tinggi yang menang). Tanpa celah yang memenuhi syarat berarti hanya satu tier. Batas tier dipatok oleh tes snapshot saat build, sehingga pembaruan data tidak pernah bisa memindahkan model antar tier secara diam-diam — setiap perubahan tier ditinjau manusia. Sorotan “Termurah di Tier 1” menandai model dengan biaya-per-pekerjaan terendah di tier teratas; keanggotaan tier hanya membutuhkan skor kualitas, jadi sebuah model bisa menempati suatu tier sementara kolom biaya disesuaikan SWE-V-nya menampilkan “—”.

Mengapa sebagian besar kategori tidak punya peringkat kualitas

Kami hanya menerbitkan peringkat kualitas untuk suatu kategori bila minimal 5 model kami memiliki skor publik langsung — versi model persis, versi benchmark persis, mode eval dicatat. Saat ini ambang itu hanya terpenuhi untuk Coding / Frontend & UI. Untuk semua kategori lainnya, papan peringkat publik tidak mencakup katalog kami atau sudah berhenti diperbarui, jadi kami hanya menampilkan kalkulator biaya. Kami lebih memilih tidak menampilkan apa-apa daripada angka karangan.

Profil tugas di balik kalkulator

KategoriToken input / outputAsumsi
Coding / Frontend & UI4.000 / 1.500Membaca berkas berukuran sedang berisi konteks di sekitarnya dan menghasilkan patch tingkat fungsi.
Penulisan & Copy Pemasaran800 / 1.200Brief plus catatan brand masuk, satu teks pemasaran singkat atau email keluar.
Ekstraksi Data & Output JSON2.500 / 400Satu halaman teks tak terstruktur masuk, JSON berskema tetap keluar.
Pemanggilan Tool oleh Agen6.000 / 800Sesi tool-calling multi-giliran, termasuk skema tool dan hasil antara yang diumpankan kembali ke konteks.
RAG / Ringkasan Dokumen Panjang30.000 / 1.500Puluhan halaman dokumen masuk, satu ringkasan terstruktur keluar.
Terjemahan1.500 / 1.600Terjemahan Mandarin/Inggris artikel ~1000 kata; token output kurang lebih setara dengan input.

Estimasi: angka biaya-per-pekerjaan adalah estimasi berdasarkan profil token tipikal di atas — pemakaian aktual bervariasi. Harga adalah tarif marketplace kami yang sebenarnya.

Kolom Arena Text Elo: Elo chat umum dari LMArena (suara komunitas), bukan spesifik tugas; ditampilkan hanya sebagai referensi dan tidak pernah dipakai dalam skor kualitas atau badge.

Kebaruan: skor benchmark ditinjau setiap bulan (masing-masing mencantumkan tanggal acuannya sendiri); harga mencerminkan tarif marketplace kami saat ini.

Independensi: skor berasal dari publikasi publik, bukan pengujian kami sendiri. Angka yang dilaporkan sendiri oleh vendor diberi label demikian di mana pun muncul.