Berapa sebenarnya biaya beban kerja Anda?
Harga nyata, benchmark publik. Pilih tugas, atur volume Anda, dan lihat berapa biaya menjalankan tiap model yang di-hosting — plus data kualitas bila benchmark publik tersedia.
Data benchmark diperbarui 27 Juli 2026 · Metodologi & sumber
Kualitas vs. Biaya — Coding / Frontend & UI
Skor dari benchmark publik · biaya adalah EstimasiTampilan disesuaikan SWE-V: menampilkan 3 dari 15 model. Model tanpa data SWE-bench Verified dikecualikan dari grafik ini, bukan diperingkat lebih rendah.
Dikecualikan dari tampilan ini: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, dan GLM-5.2 +8 lagi — tidak ada skor SWE-V yang memenuhi syarat.
Tidak ditampilkan pada sumbu yang disesuaikan (tidak ada skor SWE-bench Verified — kami tidak pernah memperkirakan satu pun): Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Pro, dan Kimi K3
Tanpa peringkat (tidak ada data benchmark publik untuk kategori ini): Claude Opus 4.8, Claude Sonnet 5, DeepSeek V4 Flash, Gemini 2.5 Flash, GPT-5.6 Sol, Claude Sonnet 4.5, Claude Haiku 4.5, dan Claude Opus 4.5
Semua Model Sekilas
Harga adalah tarif marketplace kami · biaya/pekerjaan merupakan Estimasi| GLM-4.5-Air | Tier 2 · Seimbang | US$0,20 | US$1,10 | 125K | US$0,0025estimasi | US$0,0043estimasidilaporkan sendiri | 1.372,9 |
| GLM-4.6 | Tier 2 · Seimbang | US$0,60 | US$2,20 | 200K | US$0,0057estimasi | US$0,0084estimasi | 1.425,2 |
| GLM-5 | Tier 2 · Seimbang | US$1,00 | US$3,20 | 200K | US$0,0088estimasi | US$0,01estimasi | 1.456,7 |
| Claude Opus 4.8 | — | US$5,00 | US$25,00 | 200K | US$0,06estimasi | Tanpa data SWE-V | — |
| Claude Sonnet 5 | — | US$3,00 | US$15,00 | 200K | US$0,03estimasi | Tanpa data SWE-V | — |
| Gemini 3.5 Flash | Tier 2 · Seimbang | US$1,50 | US$9,00 | 1M | US$0,02estimasi | Tanpa data SWE-V | 1.474,3 |
| GLM-5.2 | Tier 2 · Seimbang | US$1,40 | US$4,40 | 200K | US$0,01estimasi | Tanpa data SWE-V | 1.469,2 |
| DeepSeek V4 Flash | — | US$0,14 | US$0,28 | 128K | US$0,0010estimasi | Tanpa data SWE-V | 1.435,5 |
| DeepSeek V4 Pro | Tier 2 · Seimbang | US$0,44 | US$0,87 | 128K | US$0,0030estimasi | Tanpa data SWE-V | 1.456,6 |
| Gemini 2.5 Flash | — | US$0,30 | US$2,50 | 1M | US$0,0049estimasi | Tanpa data SWE-V | 1.410,2 |
| GPT-5.6 Sol | — | US$5,00 | US$30,00 | 400K | US$0,07estimasi | Tanpa data SWE-V | — |
| Kimi K3 | Tier 1 · Terdepan | US$3,00 | US$15,00 | 1M | US$0,03estimasi | Tanpa data SWE-V | 1.485,7 |
| Claude Sonnet 4.5 | — | US$3,00 | US$15,00 | 200K | US$0,03estimasi | Tanpa data SWE-V | — |
| Claude Haiku 4.5 | — | US$0,80 | US$4,00 | 200K | US$0,0092estimasi | Tanpa data SWE-V | — |
| Claude Opus 4.5 | — | US$15,00 | US$75,00 | 200K | US$0,17estimasi | Tanpa data SWE-V | — |
Kalkulator Biaya per Pekerjaan
Satu tugas pembuatan / penyuntingan kode
Tampilan disesuaikan SWE-V: menampilkan 3 dari 15 model. Model tanpa data SWE-bench Verified dikecualikan dari grafik ini, bukan diperingkat lebih rendah.
Dikecualikan dari tampilan ini: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, dan GLM-5.2 +8 lagi — tidak ada skor SWE-V yang memenuhi syarat.
Tidak ditampilkan pada basis disesuaikan SWE-V (tidak ada skor SWE-bench Verified — kami tidak pernah memperkirakan satu pun): Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Flash, DeepSeek V4 Pro, Gemini 2.5 Flash, GPT-5.6 Sol, Kimi K3, Claude Sonnet 4.5, Claude Haiku 4.5, dan Claude Opus 4.5
Metodologi & Sumber Data
Data terakhir berubah 27 Juli 2026; tiap skor mencantumkan tanggal acuannya sendiri di bawah (proses sinkronisasi tanpa perubahan tidak memajukan tanggal ini, dan papan peringkat hulu terbit sesuai jadwal masing-masing). Harga adalah tarif marketplace kami, diambil secara live. Skor benchmark berasal dari publikasi dan papan peringkat publik — tidak pernah dari pengukuran kami sendiri, dan tidak pernah dikarang: bila tidak ada skor publik langsung, kami tidak menampilkan apa pun.
Benchmark yang digunakan
| Benchmark | Metrik | Jangkar rendah → tinggi | Sumber |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1.200 → 1.700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
Skor kualitas menormalkan tiap nilai benchmark mentah dengan jangkar tetap — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — lalu mengambil rata-rata tertimbang kategori tersebut. Bila sebuah model tidak memiliki suatu benchmark, bobot yang tersisa dinormalkan ulang; model tanpa satu pun benchmark terskor dalam suatu kategori tidak mendapat skor kualitas sama sekali.
Setiap skor yang kami gunakan, beserta sumbernya
- DeepSeek V4 Flash — LiveBench Coding: 69,228 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- DeepSeek V4 Pro — LiveBench Coding: 69,994 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Gemini 3.5 Flash — LiveBench Coding: 78,185 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
- GLM-5.2 — LiveBench Coding: 79,654 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Kimi K2.6 — LiveBench Coding: 78,567 sumber (per 25 Juni 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
- DeepSeek V4 Flash — LMArena Text (overall Elo): 1.435,5 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena Text (overall Elo): 1.456,6 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- Gemini 2.5 Flash — LMArena Text (overall Elo): 1.410,2 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- Gemini 3.5 Flash — LMArena Text (overall Elo): 1.474,3 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.5-Air — LMArena Text (overall Elo): 1.372,9 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- GLM-4.6 — LMArena Text (overall Elo): 1.425,2 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- GLM-5 — LMArena Text (overall Elo): 1.456,7 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- GLM-5.2 — LMArena Text (overall Elo): 1.469,2 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena Text (overall Elo): 1.460,9 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- Kimi K3 — LMArena Text (overall Elo): 1.485,7 sumber (per 21 Juli 2026)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena WebDev: 1.446,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
- Gemini 3.5 Flash — LMArena WebDev: 1.484,3 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.6 — LMArena WebDev: 1.338,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
- GLM-5 — LMArena WebDev: 1.434,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
- GLM-5.2 — LMArena WebDev: 1.587,7 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena WebDev: 1.509,8 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
- Kimi K3 — LMArena WebDev: 1.682 sumber (per 24 Juli 2026)LMArena WebDev leaderboard, category "overall".
- GLM-4.5-Air — SWE-bench Verified: 57,6 sumber (per 23 Juli 2026)dilaporkan sendiriGLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
- GLM-4.6 — SWE-bench Verified: 68,2 sumber (per 30 September 2025)SWE-bench Verified leaderboard. Log pengiriman belum diperiksa oleh pemelihara SWE-bench. Official SWE-bench Verified leaderboard submission (vendor scaffold).
- GLM-5 — SWE-bench Verified: 72,8 sumber (per 17 Februari 2026)SWE-bench Verified leaderboard. Tidak ada status pemeriksaan yang dipublikasikan untuk pengiriman ini dalam data papan peringkat yang kami ambil. mini-SWE-agent harness, high reasoning effort.
- Kimi K2.6 — SWE-bench Verified: 80,2 sumber (per 23 Juli 2026)dilaporkan sendiriOfficial Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
Skor SWE-bench mencampur entri papan peringkat resmi dengan hasil yang dilaporkan sendiri oleh vendor (ditandai per skor di atas); harness agen berbeda-beda, sehingga skor tidak sepenuhnya sebanding antar model.
Biaya per pekerjaan disesuaikan SWE-V
Untuk model dengan skor SWE-bench Verified kami juga menampilkan swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — estimasi biaya per tugas terselesaikan jika kegagalan dicoba ulang secara buta. Hanya tingkat kelulusan SWE-bench Verified yang pernah dipakai sebagai penyebut; skor Arena WebDev dan LiveBench tidak memiliki semantik probabilitas dan tidak pernah disubstitusikan. Model tanpa skor SWE-V menampilkan “—” — kami tidak pernah memperkirakan satu pun.
- Rumus 1/p mengasumsikan percobaan ulang independen dengan tingkat keberhasilan konstan.
- Rumus ini mengasumsikan setiap percobaan ulang memakai token yang sama dengan percobaan pertama.
- Kegagalan nyata sering membutuhkan intervensi manusia atau tool alih-alih percobaan ulang buta — overhead itu tidak dihitung dalam harga.
- Tingkat penyelesaian berasal dari set tugas SWE-bench Verified, yang berbeda dari distribusi tugas Anda.
Tier kemampuan
Model dengan skor kualitas dikelompokkan ke dalam 1-3 tier (Tier 1 Terdepan / Tier 2 Seimbang / Tier 3 Hemat) berdasarkan aturan celah-alami deterministik: skor dibulatkan ke 1 desimal, lalu setiap celah antara model yang berdekatan (dalam urutan menurun) sebesar minimal max(score range × 25%, 8 points) menjadi kandidat batas tier; hanya dua celah kandidat terbesar yang menjadi batas (bila seri, posisi berperingkat lebih tinggi yang menang). Tanpa celah yang memenuhi syarat berarti hanya satu tier. Batas tier dipatok oleh tes snapshot saat build, sehingga pembaruan data tidak pernah bisa memindahkan model antar tier secara diam-diam — setiap perubahan tier ditinjau manusia. Sorotan “Termurah di Tier 1” menandai model dengan biaya-per-pekerjaan terendah di tier teratas; keanggotaan tier hanya membutuhkan skor kualitas, jadi sebuah model bisa menempati suatu tier sementara kolom biaya disesuaikan SWE-V-nya menampilkan “—”.
Mengapa sebagian besar kategori tidak punya peringkat kualitas
Kami hanya menerbitkan peringkat kualitas untuk suatu kategori bila minimal 5 model kami memiliki skor publik langsung — versi model persis, versi benchmark persis, mode eval dicatat. Saat ini ambang itu hanya terpenuhi untuk Coding / Frontend & UI. Untuk semua kategori lainnya, papan peringkat publik tidak mencakup katalog kami atau sudah berhenti diperbarui, jadi kami hanya menampilkan kalkulator biaya. Kami lebih memilih tidak menampilkan apa-apa daripada angka karangan.
Profil tugas di balik kalkulator
| Kategori | Token input / output | Asumsi |
|---|---|---|
| Coding / Frontend & UI | 4.000 / 1.500 | Membaca berkas berukuran sedang berisi konteks di sekitarnya dan menghasilkan patch tingkat fungsi. |
| Penulisan & Copy Pemasaran | 800 / 1.200 | Brief plus catatan brand masuk, satu teks pemasaran singkat atau email keluar. |
| Ekstraksi Data & Output JSON | 2.500 / 400 | Satu halaman teks tak terstruktur masuk, JSON berskema tetap keluar. |
| Pemanggilan Tool oleh Agen | 6.000 / 800 | Sesi tool-calling multi-giliran, termasuk skema tool dan hasil antara yang diumpankan kembali ke konteks. |
| RAG / Ringkasan Dokumen Panjang | 30.000 / 1.500 | Puluhan halaman dokumen masuk, satu ringkasan terstruktur keluar. |
| Terjemahan | 1.500 / 1.600 | Terjemahan Mandarin/Inggris artikel ~1000 kata; token output kurang lebih setara dengan input. |
Estimasi: angka biaya-per-pekerjaan adalah estimasi berdasarkan profil token tipikal di atas — pemakaian aktual bervariasi. Harga adalah tarif marketplace kami yang sebenarnya.
Kolom Arena Text Elo: Elo chat umum dari LMArena (suara komunitas), bukan spesifik tugas; ditampilkan hanya sebagai referensi dan tidak pernah dipakai dalam skor kualitas atau badge.
Kebaruan: skor benchmark ditinjau setiap bulan (masing-masing mencantumkan tanggal acuannya sendiri); harga mencerminkan tarif marketplace kami saat ini.
Independensi: skor berasal dari publikasi publik, bukan pengujian kami sendiri. Angka yang dilaporkan sendiri oleh vendor diberi label demikian di mana pun muncul.