Khối lượng công việc của bạn thực sự tốn bao nhiêu?
Giá thật, benchmark công khai. Chọn một loại tác vụ, đặt mức dùng của bạn, và xem mỗi mô hình host tốn bao nhiêu khi chạy — kèm dữ liệu chất lượng ở những nơi có benchmark công khai.
Dữ liệu benchmark cập nhật 27 tháng 7, 2026 · Phương pháp & nguồn dữ liệu
Chất lượng so với chi phí — Lập trình / Frontend & UI
Điểm số từ benchmark công khai · chi phí là Ước tínhChế độ xem hiệu chỉnh SWE-V: hiển thị 3 trong 15 mô hình. Các mô hình không có dữ liệu SWE-bench Verified bị loại khỏi biểu đồ này, không phải bị xếp hạng thấp hơn.
Bị loại khỏi chế độ xem này: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash và GLM-5.2 +8 mô hình nữa — không có điểm SWE-V đủ điều kiện.
Không hiển thị trên trục hiệu chỉnh (không có điểm SWE-bench Verified — chúng tôi không bao giờ tự ước tính): Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Pro và Kimi K3
Chưa chấm điểm (không có dữ liệu benchmark công khai cho loại tác vụ này): Claude Opus 4.8, Claude Sonnet 5, DeepSeek V4 Flash, Gemini 2.5 Flash, GPT-5.6 Sol, Claude Sonnet 4.5, Claude Haiku 4.5 và Claude Opus 4.5
Toàn bộ mô hình trong một bảng
Giá là mức giá marketplace của chúng tôi · chi phí/tác vụ là Ước tính| GLM-4.5-Air | Bậc 2 · Cân bằng | 0,20 US$ | 1,10 US$ | 125K | 0,0025 US$ước tính | 0,0043 US$ước tínhtự công bố | 1.372,9 |
| GLM-4.6 | Bậc 2 · Cân bằng | 0,60 US$ | 2,20 US$ | 200K | 0,0057 US$ước tính | 0,0084 US$ước tính | 1.425,2 |
| GLM-5 | Bậc 2 · Cân bằng | 1,00 US$ | 3,20 US$ | 200K | 0,0088 US$ước tính | 0,01 US$ước tính | 1.456,7 |
| Claude Opus 4.8 | — | 5,00 US$ | 25,00 US$ | 200K | 0,06 US$ước tính | Không có dữ liệu SWE-V | — |
| Claude Sonnet 5 | — | 3,00 US$ | 15,00 US$ | 200K | 0,03 US$ước tính | Không có dữ liệu SWE-V | — |
| Gemini 3.5 Flash | Bậc 2 · Cân bằng | 1,50 US$ | 9,00 US$ | 1M | 0,02 US$ước tính | Không có dữ liệu SWE-V | 1.474,3 |
| GLM-5.2 | Bậc 2 · Cân bằng | 1,40 US$ | 4,40 US$ | 200K | 0,01 US$ước tính | Không có dữ liệu SWE-V | 1.469,2 |
| DeepSeek V4 Flash | — | 0,14 US$ | 0,28 US$ | 128K | 0,0010 US$ước tính | Không có dữ liệu SWE-V | 1.435,5 |
| DeepSeek V4 Pro | Bậc 2 · Cân bằng | 0,44 US$ | 0,87 US$ | 128K | 0,0030 US$ước tính | Không có dữ liệu SWE-V | 1.456,6 |
| Gemini 2.5 Flash | — | 0,30 US$ | 2,50 US$ | 1M | 0,0049 US$ước tính | Không có dữ liệu SWE-V | 1.410,2 |
| GPT-5.6 Sol | — | 5,00 US$ | 30,00 US$ | 400K | 0,07 US$ước tính | Không có dữ liệu SWE-V | — |
| Kimi K3 | Bậc 1 · Tiên phong | 3,00 US$ | 15,00 US$ | 1M | 0,03 US$ước tính | Không có dữ liệu SWE-V | 1.485,7 |
| Claude Sonnet 4.5 | — | 3,00 US$ | 15,00 US$ | 200K | 0,03 US$ước tính | Không có dữ liệu SWE-V | — |
| Claude Haiku 4.5 | — | 0,80 US$ | 4,00 US$ | 200K | 0,0092 US$ước tính | Không có dữ liệu SWE-V | — |
| Claude Opus 4.5 | — | 15,00 US$ | 75,00 US$ | 200K | 0,17 US$ước tính | Không có dữ liệu SWE-V | — |
Máy tính chi phí mỗi tác vụ
Một tác vụ sinh / sửa mã
Chế độ xem hiệu chỉnh SWE-V: hiển thị 3 trong 15 mô hình. Các mô hình không có dữ liệu SWE-bench Verified bị loại khỏi biểu đồ này, không phải bị xếp hạng thấp hơn.
Bị loại khỏi chế độ xem này: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash và GLM-5.2 +8 mô hình nữa — không có điểm SWE-V đủ điều kiện.
Không hiển thị theo cơ sở hiệu chỉnh SWE-V (không có điểm SWE-bench Verified — chúng tôi không bao giờ tự ước tính): Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Flash, DeepSeek V4 Pro, Gemini 2.5 Flash, GPT-5.6 Sol, Kimi K3, Claude Sonnet 4.5, Claude Haiku 4.5 và Claude Opus 4.5
Phương pháp & nguồn dữ liệu
Dữ liệu thay đổi lần cuối 27 tháng 7, 2026; mỗi điểm số bên dưới mang ngày hiệu lực riêng của nó (các lần đồng bộ không có thay đổi sẽ không đẩy ngày này lên, và các bảng xếp hạng thượng nguồn công bố theo lịch riêng của họ). Giá là mức giá marketplace của chúng tôi, lấy trực tiếp theo thời gian thực. Điểm benchmark lấy từ các công bố và bảng xếp hạng công khai — không bao giờ là phép đo của riêng chúng tôi, và không bao giờ bịa ra: nơi nào không có điểm công khai trực tiếp, chúng tôi không hiển thị gì cả.
Các benchmark được dùng
| Benchmark | Chỉ số | Mốc neo thấp → cao | Nguồn |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1.200 → 1.700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
Điểm chất lượng chuẩn hóa từng giá trị benchmark thô bằng các mốc neo cố định — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — rồi lấy trung bình có trọng số của loại tác vụ đó. Khi một mô hình thiếu một benchmark, các trọng số còn lại được chuẩn hóa lại; mô hình không có benchmark nào được chấm trong một loại tác vụ sẽ hoàn toàn không có điểm chất lượng.
Từng điểm số chúng tôi dùng, kèm nguồn của nó
- DeepSeek V4 Flash — LiveBench Coding: 69,228 nguồn (tính đến 25 tháng 6, 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- DeepSeek V4 Pro — LiveBench Coding: 69,994 nguồn (tính đến 25 tháng 6, 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Gemini 3.5 Flash — LiveBench Coding: 78,185 nguồn (tính đến 25 tháng 6, 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
- GLM-5.2 — LiveBench Coding: 79,654 nguồn (tính đến 25 tháng 6, 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Kimi K2.6 — LiveBench Coding: 78,567 nguồn (tính đến 25 tháng 6, 2026)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
- DeepSeek V4 Flash — LMArena Text (overall Elo): 1.435,5 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena Text (overall Elo): 1.456,6 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- Gemini 2.5 Flash — LMArena Text (overall Elo): 1.410,2 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- Gemini 3.5 Flash — LMArena Text (overall Elo): 1.474,3 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.5-Air — LMArena Text (overall Elo): 1.372,9 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- GLM-4.6 — LMArena Text (overall Elo): 1.425,2 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- GLM-5 — LMArena Text (overall Elo): 1.456,7 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- GLM-5.2 — LMArena Text (overall Elo): 1.469,2 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena Text (overall Elo): 1.460,9 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- Kimi K3 — LMArena Text (overall Elo): 1.485,7 nguồn (tính đến 21 tháng 7, 2026)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena WebDev: 1.446,7 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall".
- Gemini 3.5 Flash — LMArena WebDev: 1.484,3 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.6 — LMArena WebDev: 1.338,7 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall".
- GLM-5 — LMArena WebDev: 1.434,7 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall".
- GLM-5.2 — LMArena WebDev: 1.587,7 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena WebDev: 1.509,8 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall".
- Kimi K3 — LMArena WebDev: 1.682 nguồn (tính đến 24 tháng 7, 2026)LMArena WebDev leaderboard, category "overall".
- GLM-4.5-Air — SWE-bench Verified: 57,6 nguồn (tính đến 23 tháng 7, 2026)tự công bốGLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
- GLM-4.6 — SWE-bench Verified: 68,2 nguồn (tính đến 30 tháng 9, 2025)SWE-bench Verified leaderboard. Log của bài nộp chưa được nhóm bảo trì SWE-bench kiểm tra. Official SWE-bench Verified leaderboard submission (vendor scaffold).
- GLM-5 — SWE-bench Verified: 72,8 nguồn (tính đến 17 tháng 2, 2026)SWE-bench Verified leaderboard. Không có trạng thái kiểm tra nào được công bố cho bài nộp này trong dữ liệu bảng xếp hạng đã tải về. mini-SWE-agent harness, high reasoning effort.
- Kimi K2.6 — SWE-bench Verified: 80,2 nguồn (tính đến 23 tháng 7, 2026)tự công bốOfficial Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
Điểm SWE-bench trộn giữa các mục trên bảng xếp hạng chính thức và kết quả do nhà cung cấp tự công bố (đã gắn cờ theo từng điểm ở trên); harness agent mỗi bên mỗi khác, nên các điểm số không so sánh chặt chẽ được giữa các mô hình.
Chi phí mỗi tác vụ hiệu chỉnh SWE-V
Với các mô hình có điểm SWE-bench Verified, chúng tôi còn hiển thị swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — chi phí ước tính cho mỗi tác vụ đã giải quyết nếu các lần thất bại được thử lại một cách máy móc. Mẫu số chỉ dùng duy nhất tỷ lệ vượt qua của SWE-bench Verified; điểm Arena WebDev và LiveBench không mang ngữ nghĩa xác suất và không bao giờ được thay thế vào. Mô hình không có điểm SWE-V hiển thị “—” — chúng tôi không bao giờ tự ước tính.
- Công thức 1/p giả định các lần thử lại độc lập với tỷ lệ thành công không đổi.
- Nó giả định mỗi lần thử lại dùng cùng lượng token như lần thử đầu.
- Thất bại thực tế thường cần con người hoặc công cụ can thiệp thay vì thử lại máy móc — phần chi phí đó không được tính vào.
- Tỷ lệ giải quyết lấy từ bộ tác vụ SWE-bench Verified, vốn khác với phân bố tác vụ của bạn.
Bậc năng lực
Các mô hình có điểm chất lượng được nhóm vào 1-3 bậc (Bậc 1 Tiên phong / Bậc 2 Cân bằng / Bậc 3 Tiết kiệm) theo quy tắc khoảng trống tự nhiên có tính xác định: điểm được làm tròn đến 1 chữ số thập phân, sau đó bất kỳ khoảng cách nào giữa hai mô hình liền kề (theo thứ tự giảm dần) từ mức max(score range × 25%, 8 points) trở lên là một ứng viên ranh giới bậc; chỉ hai khoảng cách ứng viên lớn nhất trở thành ranh giới (hòa nhau thì lấy vị trí xếp hạng cao hơn). Không có khoảng cách đạt chuẩn nghĩa là chỉ có một bậc. Ranh giới bậc được ghim bằng test snapshot lúc build, nên một lần cập nhật dữ liệu không bao giờ có thể âm thầm chuyển mô hình giữa các bậc — mọi thay đổi bậc đều được con người rà soát. Nhãn “Rẻ nhất Bậc 1” đánh dấu mô hình có chi phí mỗi tác vụ thấp nhất trong bậc cao nhất; tư cách trong bậc chỉ cần có điểm chất lượng, nên một mô hình có thể giữ một bậc trong khi cột chi phí hiệu chỉnh SWE-V hiển thị “—”.
Vì sao đa số loại tác vụ không có xếp hạng chất lượng
Chúng tôi chỉ công bố xếp hạng chất lượng cho một loại tác vụ khi có ít nhất 5 mô hình trong danh mục của chúng tôi có điểm công khai trực tiếp — đúng phiên bản mô hình, đúng phiên bản benchmark, có ghi chú chế độ đánh giá. Hiện tại chỉ Lập trình / Frontend & UI đạt ngưỡng đó. Với mọi loại tác vụ khác, các bảng xếp hạng công khai hoặc không phủ danh mục của chúng tôi hoặc đã ngừng cập nhật, nên chúng tôi chỉ hiển thị máy tính chi phí. Chúng tôi thà không cho bạn xem gì còn hơn đưa ra một con số bịa.
Hồ sơ tác vụ đằng sau máy tính
| Loại tác vụ | Token đầu vào / đầu ra | Giả định |
|---|---|---|
| Lập trình / Frontend & UI | 4.000 / 1.500 | Đọc một file ngữ cảnh cỡ vừa và tạo ra một bản vá ở cấp hàm. |
| Viết lách & văn bản marketing | 800 / 1.200 | Đầu vào là brief kèm ghi chú thương hiệu, đầu ra là một đoạn marketing ngắn hoặc email. |
| Trích xuất dữ liệu & xuất JSON | 2.500 / 400 | Đầu vào một trang văn bản phi cấu trúc, đầu ra JSON theo schema cố định. |
| Agent gọi công cụ | 6.000 / 800 | Phiên gọi công cụ nhiều lượt, bao gồm schema công cụ và các kết quả trung gian được đưa lại vào ngữ cảnh. |
| RAG / tóm tắt tài liệu dài | 30.000 / 1.500 | Đầu vào hàng chục trang tài liệu, đầu ra một bản tóm tắt có cấu trúc. |
| Dịch thuật | 1.500 / 1.600 | Dịch Trung/Anh một bài viết ~1000 từ; số token đầu ra xấp xỉ đầu vào. |
Ước tính: các con số chi phí mỗi tác vụ là ước tính dựa trên hồ sơ token điển hình ở trên — mức dùng thực tế sẽ khác. Giá là mức giá marketplace thực của chúng tôi.
Cột Arena Text Elo: Elo hội thoại tổng quát từ LMArena (phiếu bầu cộng đồng), không dành riêng cho tác vụ nào; chỉ để tham khảo và không bao giờ được dùng trong điểm chất lượng hay nhãn.
Độ mới: điểm benchmark được rà soát hàng tháng (mỗi điểm mang ngày hiệu lực riêng); giá phản ánh mức giá marketplace hiện tại của chúng tôi.
Tính độc lập: điểm số lấy từ các công bố công khai, không phải từ thử nghiệm của chúng tôi. Con số do nhà cung cấp tự công bố được ghi chú rõ ở bất cứ nơi nào nó xuất hiện.