Berapa sebenarnya biaya beban kerja Anda?

Harga nyata, benchmark publik. Pilih tugas, atur volume Anda, dan lihat berapa biaya menjalankan tiap model yang di-hosting — plus data kualitas bila benchmark publik tersedia.

Data benchmark diperbarui 27 Juli 2026 · Metodologi & sumber

Semua Model Sekilas

Harga adalah tarif marketplace kami · biaya/pekerjaan merupakan Estimasi
Kimi K2.6Tier 1 · TerdepanUS$0,76US$3,20256KUS$0,0078estimasiUS$0,0098estimasidilaporkan sendiri1.460,9
GLM-5Tier 2 · SeimbangUS$1,00US$3,20200KUS$0,0088estimasiUS$0,01estimasi1.456,7
DeepSeek V4 FlashUS$0,20US$0,591MUS$0,0017estimasiTanpa data SWE-V1.435,5
DeepSeek V4 ProTier 3 · HematUS$0,59US$1,781MUS$0,0050estimasiTanpa data SWE-V1.456,6
GLM-5-TurboUS$0,96US$3,20200KUS$0,0086estimasiTanpa data SWE-V
Qwen3.7-PlusUS$0,32US$1,281MUS$0,0032estimasiTanpa data SWE-V
Qwen3.7-MaxUS$2,00US$6,001MUS$0,02estimasiTanpa data SWE-V
MiniMax M3US$0,24US$0,961MUS$0,0024estimasiTanpa data SWE-V

Kalkulator Biaya per Pekerjaan

Satu tugas pembuatan / penyuntingan kode

Estimasi — berdasarkan profil token tipikal, pemakaian aktual bervariasi
Basis biaya:

Tampilan disesuaikan SWE-V: menampilkan 2 dari 8 model. Model tanpa data SWE-bench Verified dikecualikan dari grafik ini, bukan diperingkat lebih rendah.

Dikecualikan dari tampilan ini: DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5-Turbo, dan Qwen3.7-Plus +2 lagi — tidak ada skor SWE-V yang memenuhi syarat.

1.000
101001k10k100k1M
Termurah per tugas terselesaikanTermurah di Tier 1 — model termurah di tier kemampuan teratas

Tidak ditampilkan pada basis disesuaikan SWE-V (tidak ada skor SWE-bench Verified — kami tidak pernah memperkirakan satu pun): DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5-Turbo, Qwen3.7-Plus, Qwen3.7-Max, dan MiniMax M3

Metodologi & Sumber Data

Data terakhir berubah 27 Juli 2026; tiap skor mencantumkan tanggal acuannya sendiri di bawah (proses sinkronisasi tanpa perubahan tidak memajukan tanggal ini, dan papan peringkat hulu terbit sesuai jadwal masing-masing). Harga adalah tarif marketplace kami, diambil secara live. Skor benchmark berasal dari publikasi dan papan peringkat publik — tidak pernah dari pengukuran kami sendiri, dan tidak pernah dikarang: bila tidak ada skor publik langsung, kami tidak menampilkan apa pun.

Benchmark yang digunakan

BenchmarkMetrikJangkar rendah → tinggiSumber
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1.2001.700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

Skor kualitas menormalkan tiap nilai benchmark mentah dengan jangkar tetap — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — lalu mengambil rata-rata tertimbang kategori tersebut. Bila sebuah model tidak memiliki suatu benchmark, bobot yang tersisa dinormalkan ulang; model tanpa satu pun benchmark terskor dalam suatu kategori tidak mendapat skor kualitas sama sekali.

Biaya per pekerjaan disesuaikan SWE-V

Untuk model dengan skor SWE-bench Verified kami juga menampilkan swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — estimasi biaya per tugas terselesaikan jika kegagalan dicoba ulang secara buta. Hanya tingkat kelulusan SWE-bench Verified yang pernah dipakai sebagai penyebut; skor Arena WebDev dan LiveBench tidak memiliki semantik probabilitas dan tidak pernah disubstitusikan. Model tanpa skor SWE-V menampilkan “—” — kami tidak pernah memperkirakan satu pun.

  • Rumus 1/p mengasumsikan percobaan ulang independen dengan tingkat keberhasilan konstan.
  • Rumus ini mengasumsikan setiap percobaan ulang memakai token yang sama dengan percobaan pertama.
  • Kegagalan nyata sering membutuhkan intervensi manusia atau tool alih-alih percobaan ulang buta — overhead itu tidak dihitung dalam harga.
  • Tingkat penyelesaian berasal dari set tugas SWE-bench Verified, yang berbeda dari distribusi tugas Anda.

Tier kemampuan

Model dengan skor kualitas dikelompokkan ke dalam 1-3 tier (Tier 1 Terdepan / Tier 2 Seimbang / Tier 3 Hemat) berdasarkan aturan celah-alami deterministik: skor dibulatkan ke 1 desimal, lalu setiap celah antara model yang berdekatan (dalam urutan menurun) sebesar minimal max(score range × 25%, 8 points) menjadi kandidat batas tier; hanya dua celah kandidat terbesar yang menjadi batas (bila seri, posisi berperingkat lebih tinggi yang menang). Tanpa celah yang memenuhi syarat berarti hanya satu tier. Batas tier dipatok oleh tes snapshot saat build, sehingga pembaruan data tidak pernah bisa memindahkan model antar tier secara diam-diam — setiap perubahan tier ditinjau manusia. Sorotan “Termurah di Tier 1” menandai model dengan biaya-per-pekerjaan terendah di tier teratas; keanggotaan tier hanya membutuhkan skor kualitas, jadi sebuah model bisa menempati suatu tier sementara kolom biaya disesuaikan SWE-V-nya menampilkan “—”.

Mengapa sebagian besar kategori tidak punya peringkat kualitas

Kami hanya menerbitkan peringkat kualitas untuk suatu kategori bila minimal 5 model kami memiliki skor publik langsung — versi model persis, versi benchmark persis, mode eval dicatat. Saat ini ambang itu hanya terpenuhi untuk Coding / Frontend & UI. Untuk semua kategori lainnya, papan peringkat publik tidak mencakup katalog kami atau sudah berhenti diperbarui, jadi kami hanya menampilkan kalkulator biaya. Kami lebih memilih tidak menampilkan apa-apa daripada angka karangan.

Profil tugas di balik kalkulator

KategoriToken input / outputAsumsi
Coding / Frontend & UI4.000 / 1.500Membaca berkas berukuran sedang berisi konteks di sekitarnya dan menghasilkan patch tingkat fungsi.
Penulisan & Copy Pemasaran800 / 1.200Brief plus catatan brand masuk, satu teks pemasaran singkat atau email keluar.
Ekstraksi Data & Output JSON2.500 / 400Satu halaman teks tak terstruktur masuk, JSON berskema tetap keluar.
Pemanggilan Tool oleh Agen6.000 / 800Sesi tool-calling multi-giliran, termasuk skema tool dan hasil antara yang diumpankan kembali ke konteks.
RAG / Ringkasan Dokumen Panjang30.000 / 1.500Puluhan halaman dokumen masuk, satu ringkasan terstruktur keluar.
Terjemahan1.500 / 1.600Terjemahan Mandarin/Inggris artikel ~1000 kata; token output kurang lebih setara dengan input.

Estimasi: angka biaya-per-pekerjaan adalah estimasi berdasarkan profil token tipikal di atas — pemakaian aktual bervariasi. Harga adalah tarif marketplace kami yang sebenarnya.

Kolom Arena Text Elo: Elo chat umum dari LMArena (suara komunitas), bukan spesifik tugas; ditampilkan hanya sebagai referensi dan tidak pernah dipakai dalam skor kualitas atau badge.

Kebaruan: skor benchmark ditinjau setiap bulan (masing-masing mencantumkan tanggal acuannya sendiri); harga mencerminkan tarif marketplace kami saat ini.

Independensi: skor berasal dari publikasi publik, bukan pengujian kami sendiri. Angka yang dilaporkan sendiri oleh vendor diberi label demikian di mana pun muncul.