Berapa sebenarnya biaya beban kerja Anda?
Harga nyata, benchmark publik. Pilih tugas, atur volume Anda, dan lihat berapa biaya menjalankan tiap model yang di-hosting — plus data kualitas bila benchmark publik tersedia.
Data benchmark diperbarui 27 Juli 2026 · Metodologi & sumber
Semua Model Sekilas
Harga adalah tarif marketplace kami · biaya/pekerjaan merupakan Estimasi| Kimi K2.6 | Tier 1 · Terdepan | US$0,76 | US$3,20 | 256K | US$0,0078estimasi | US$0,0098estimasidilaporkan sendiri | 1.460,9 |
| GLM-5 | Tier 2 · Seimbang | US$1,00 | US$3,20 | 200K | US$0,0088estimasi | US$0,01estimasi | 1.456,7 |
| DeepSeek V4 Flash | — | US$0,20 | US$0,59 | 1M | US$0,0017estimasi | Tanpa data SWE-V | 1.435,5 |
| DeepSeek V4 Pro | Tier 3 · Hemat | US$0,59 | US$1,78 | 1M | US$0,0050estimasi | Tanpa data SWE-V | 1.456,6 |
| GLM-5-Turbo | — | US$0,96 | US$3,20 | 200K | US$0,0086estimasi | Tanpa data SWE-V | — |
| Qwen3.7-Plus | — | US$0,32 | US$1,28 | 1M | US$0,0032estimasi | Tanpa data SWE-V | — |
| Qwen3.7-Max | — | US$2,00 | US$6,00 | 1M | US$0,02estimasi | Tanpa data SWE-V | — |
| MiniMax M3 | — | US$0,24 | US$0,96 | 1M | US$0,0024estimasi | Tanpa data SWE-V | — |
Kalkulator Biaya per Pekerjaan
Satu tugas pembuatan / penyuntingan kode
Tampilan disesuaikan SWE-V: menampilkan 2 dari 8 model. Model tanpa data SWE-bench Verified dikecualikan dari grafik ini, bukan diperingkat lebih rendah.
Dikecualikan dari tampilan ini: DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5-Turbo, dan Qwen3.7-Plus +2 lagi — tidak ada skor SWE-V yang memenuhi syarat.
Tidak ditampilkan pada basis disesuaikan SWE-V (tidak ada skor SWE-bench Verified — kami tidak pernah memperkirakan satu pun): DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5-Turbo, Qwen3.7-Plus, Qwen3.7-Max, dan MiniMax M3
Metodologi & Sumber Data
Data terakhir berubah 27 Juli 2026; tiap skor mencantumkan tanggal acuannya sendiri di bawah (proses sinkronisasi tanpa perubahan tidak memajukan tanggal ini, dan papan peringkat hulu terbit sesuai jadwal masing-masing). Harga adalah tarif marketplace kami, diambil secara live. Skor benchmark berasal dari publikasi dan papan peringkat publik — tidak pernah dari pengukuran kami sendiri, dan tidak pernah dikarang: bila tidak ada skor publik langsung, kami tidak menampilkan apa pun.
Benchmark yang digunakan
| Benchmark | Metrik | Jangkar rendah → tinggi | Sumber |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1.200 → 1.700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
Skor kualitas menormalkan tiap nilai benchmark mentah dengan jangkar tetap — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — lalu mengambil rata-rata tertimbang kategori tersebut. Bila sebuah model tidak memiliki suatu benchmark, bobot yang tersisa dinormalkan ulang; model tanpa satu pun benchmark terskor dalam suatu kategori tidak mendapat skor kualitas sama sekali.
Biaya per pekerjaan disesuaikan SWE-V
Untuk model dengan skor SWE-bench Verified kami juga menampilkan swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — estimasi biaya per tugas terselesaikan jika kegagalan dicoba ulang secara buta. Hanya tingkat kelulusan SWE-bench Verified yang pernah dipakai sebagai penyebut; skor Arena WebDev dan LiveBench tidak memiliki semantik probabilitas dan tidak pernah disubstitusikan. Model tanpa skor SWE-V menampilkan “—” — kami tidak pernah memperkirakan satu pun.
- Rumus 1/p mengasumsikan percobaan ulang independen dengan tingkat keberhasilan konstan.
- Rumus ini mengasumsikan setiap percobaan ulang memakai token yang sama dengan percobaan pertama.
- Kegagalan nyata sering membutuhkan intervensi manusia atau tool alih-alih percobaan ulang buta — overhead itu tidak dihitung dalam harga.
- Tingkat penyelesaian berasal dari set tugas SWE-bench Verified, yang berbeda dari distribusi tugas Anda.
Tier kemampuan
Model dengan skor kualitas dikelompokkan ke dalam 1-3 tier (Tier 1 Terdepan / Tier 2 Seimbang / Tier 3 Hemat) berdasarkan aturan celah-alami deterministik: skor dibulatkan ke 1 desimal, lalu setiap celah antara model yang berdekatan (dalam urutan menurun) sebesar minimal max(score range × 25%, 8 points) menjadi kandidat batas tier; hanya dua celah kandidat terbesar yang menjadi batas (bila seri, posisi berperingkat lebih tinggi yang menang). Tanpa celah yang memenuhi syarat berarti hanya satu tier. Batas tier dipatok oleh tes snapshot saat build, sehingga pembaruan data tidak pernah bisa memindahkan model antar tier secara diam-diam — setiap perubahan tier ditinjau manusia. Sorotan “Termurah di Tier 1” menandai model dengan biaya-per-pekerjaan terendah di tier teratas; keanggotaan tier hanya membutuhkan skor kualitas, jadi sebuah model bisa menempati suatu tier sementara kolom biaya disesuaikan SWE-V-nya menampilkan “—”.
Mengapa sebagian besar kategori tidak punya peringkat kualitas
Kami hanya menerbitkan peringkat kualitas untuk suatu kategori bila minimal 5 model kami memiliki skor publik langsung — versi model persis, versi benchmark persis, mode eval dicatat. Saat ini ambang itu hanya terpenuhi untuk Coding / Frontend & UI. Untuk semua kategori lainnya, papan peringkat publik tidak mencakup katalog kami atau sudah berhenti diperbarui, jadi kami hanya menampilkan kalkulator biaya. Kami lebih memilih tidak menampilkan apa-apa daripada angka karangan.
Profil tugas di balik kalkulator
| Kategori | Token input / output | Asumsi |
|---|---|---|
| Coding / Frontend & UI | 4.000 / 1.500 | Membaca berkas berukuran sedang berisi konteks di sekitarnya dan menghasilkan patch tingkat fungsi. |
| Penulisan & Copy Pemasaran | 800 / 1.200 | Brief plus catatan brand masuk, satu teks pemasaran singkat atau email keluar. |
| Ekstraksi Data & Output JSON | 2.500 / 400 | Satu halaman teks tak terstruktur masuk, JSON berskema tetap keluar. |
| Pemanggilan Tool oleh Agen | 6.000 / 800 | Sesi tool-calling multi-giliran, termasuk skema tool dan hasil antara yang diumpankan kembali ke konteks. |
| RAG / Ringkasan Dokumen Panjang | 30.000 / 1.500 | Puluhan halaman dokumen masuk, satu ringkasan terstruktur keluar. |
| Terjemahan | 1.500 / 1.600 | Terjemahan Mandarin/Inggris artikel ~1000 kata; token output kurang lebih setara dengan input. |
Estimasi: angka biaya-per-pekerjaan adalah estimasi berdasarkan profil token tipikal di atas — pemakaian aktual bervariasi. Harga adalah tarif marketplace kami yang sebenarnya.
Kolom Arena Text Elo: Elo chat umum dari LMArena (suara komunitas), bukan spesifik tugas; ditampilkan hanya sebagai referensi dan tidak pernah dipakai dalam skor kualitas atau badge.
Kebaruan: skor benchmark ditinjau setiap bulan (masing-masing mencantumkan tanggal acuannya sendiri); harga mencerminkan tarif marketplace kami saat ini.
Independensi: skor berasal dari publikasi publik, bukan pengujian kami sendiri. Angka yang dilaporkan sendiri oleh vendor diberi label demikian di mana pun muncul.