실제 워크로드 비용은 얼마나 될까요?
실제 가격, 공개 벤치마크. 작업을 고르고 사용량을 설정하면 각 호스팅 모델의 실행 비용을 확인할 수 있습니다 — 공개 벤치마크가 있는 경우 품질 데이터도 함께 제공됩니다.
벤치마크 데이터 업데이트: 2026년 7월 27일 · 방법론 및 출처
품질 대 비용 — 코딩 / 프런트엔드 & UI
점수는 공개 벤치마크 기준 · 비용은 추정치SWE-V 조정 보기: 15개 모델 중 3개 표시. SWE-bench Verified 데이터가 없는 모델은 이 차트에서 제외된 것이며, 순위가 낮게 매겨진 것이 아닙니다.
이 보기에서 제외됨: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash 및 GLM-5.2 외 8개 — 유효한 SWE-V 점수 없음.
조정 축에는 표시되지 않음 (SWE-bench Verified 점수 없음 — 저희는 점수를 추정하지 않습니다): Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Pro 및 Kimi K3
미평가 (이 카테고리에 대한 공개 벤치마크 데이터 없음): Claude Opus 4.8, Claude Sonnet 5, DeepSeek V4 Flash, Gemini 2.5 Flash, GPT-5.6 Sol, Claude Sonnet 4.5, Claude Haiku 4.5 및 Claude Opus 4.5
전체 모델 한눈에 보기
가격은 저희 마켓플레이스 요금 · 작업당 비용은 추정치| GLM-4.5-Air | Tier 2 · 밸런스 | US$0.20 | US$1.10 | 125K | US$0.0025추정 | US$0.0043추정자체 보고 | 1,372.9 |
| GLM-4.6 | Tier 2 · 밸런스 | US$0.60 | US$2.20 | 200K | US$0.0057추정 | US$0.0084추정 | 1,425.2 |
| GLM-5 | Tier 2 · 밸런스 | US$1.00 | US$3.20 | 200K | US$0.0088추정 | US$0.01추정 | 1,456.7 |
| Claude Opus 4.8 | — | US$5.00 | US$25.00 | 200K | US$0.06추정 | SWE-V 데이터 없음 | — |
| Claude Sonnet 5 | — | US$3.00 | US$15.00 | 200K | US$0.03추정 | SWE-V 데이터 없음 | — |
| Gemini 3.5 Flash | Tier 2 · 밸런스 | US$1.50 | US$9.00 | 1M | US$0.02추정 | SWE-V 데이터 없음 | 1,474.3 |
| GLM-5.2 | Tier 2 · 밸런스 | US$1.40 | US$4.40 | 200K | US$0.01추정 | SWE-V 데이터 없음 | 1,469.2 |
| DeepSeek V4 Flash | — | US$0.14 | US$0.28 | 128K | US$0.0010추정 | SWE-V 데이터 없음 | 1,435.5 |
| DeepSeek V4 Pro | Tier 2 · 밸런스 | US$0.44 | US$0.87 | 128K | US$0.0030추정 | SWE-V 데이터 없음 | 1,456.6 |
| Gemini 2.5 Flash | — | US$0.30 | US$2.50 | 1M | US$0.0049추정 | SWE-V 데이터 없음 | 1,410.2 |
| GPT-5.6 Sol | — | US$5.00 | US$30.00 | 400K | US$0.07추정 | SWE-V 데이터 없음 | — |
| Kimi K3 | Tier 1 · 프런티어 | US$3.00 | US$15.00 | 1M | US$0.03추정 | SWE-V 데이터 없음 | 1,485.7 |
| Claude Sonnet 4.5 | — | US$3.00 | US$15.00 | 200K | US$0.03추정 | SWE-V 데이터 없음 | — |
| Claude Haiku 4.5 | — | US$0.80 | US$4.00 | 200K | US$0.0092추정 | SWE-V 데이터 없음 | — |
| Claude Opus 4.5 | — | US$15.00 | US$75.00 | 200K | US$0.17추정 | SWE-V 데이터 없음 | — |
작업당 비용 계산기
단일 코드 생성 / 수정 작업
SWE-V 조정 보기: 15개 모델 중 3개 표시. SWE-bench Verified 데이터가 없는 모델은 이 차트에서 제외된 것이며, 순위가 낮게 매겨진 것이 아닙니다.
이 보기에서 제외됨: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash 및 GLM-5.2 외 8개 — 유효한 SWE-V 점수 없음.
SWE-V 조정 기준에는 표시되지 않음 (SWE-bench Verified 점수 없음 — 저희는 점수를 추정하지 않습니다): Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Flash, DeepSeek V4 Pro, Gemini 2.5 Flash, GPT-5.6 Sol, Kimi K3, Claude Sonnet 4.5, Claude Haiku 4.5 및 Claude Opus 4.5
방법론 및 데이터 출처
데이터 최종 변경일: 2026년 7월 27일. 각 점수에는 아래에 자체 기준일이 표기됩니다 (변경이 없는 동기화 실행은 이 날짜를 갱신하지 않으며, 업스트림 리더보드는 각자의 일정에 따라 발표됩니다). 가격은 실시간으로 가져온 저희 마켓플레이스 요금입니다. 벤치마크 점수는 공개된 발표 자료와 리더보드에서 가져옵니다 — 저희가 직접 측정한 값이 아니며, 지어내지도 않습니다. 직접적인 공개 점수가 없는 경우에는 아무것도 표시하지 않습니다.
사용된 벤치마크
| 벤치마크 | 지표 | 앵커 하한 → 상한 | 출처 |
|---|---|---|---|
| SWE-bench Verified | pass_rate_pct | 40 → 85 | https://www.swebench.com/ |
| LMArena WebDev | elo | 1,200 → 1,700 | https://arena.ai/leaderboard |
| LiveBench Coding | score_0_100 | 40 → 85 | https://livebench.ai/ |
품질 점수는 각 원시 벤치마크 값을 고정 앵커로 정규화한 뒤 — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — 카테고리의 가중 평균을 취합니다. 모델에 특정 벤치마크 점수가 없으면 나머지 가중치를 재정규화하며, 해당 카테고리에 점수가 있는 벤치마크가 하나도 없는 모델은 품질 점수를 아예 받지 않습니다.
사용하는 모든 점수와 그 출처
- DeepSeek V4 Flash — LiveBench Coding: 69.228 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- DeepSeek V4 Pro — LiveBench Coding: 69.994 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Gemini 3.5 Flash — LiveBench Coding: 78.185 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
- GLM-5.2 — LiveBench Coding: 79.654 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
- Kimi K2.6 — LiveBench Coding: 78.567 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
- DeepSeek V4 Flash — LMArena Text (overall Elo): 1,435.5 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena Text (overall Elo): 1,456.6 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- Gemini 2.5 Flash — LMArena Text (overall Elo): 1,410.2 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- Gemini 3.5 Flash — LMArena Text (overall Elo): 1,474.3 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.5-Air — LMArena Text (overall Elo): 1,372.9 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- GLM-4.6 — LMArena Text (overall Elo): 1,425.2 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- GLM-5 — LMArena Text (overall Elo): 1,456.7 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- GLM-5.2 — LMArena Text (overall Elo): 1,469.2 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena Text (overall Elo): 1,460.9 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- Kimi K3 — LMArena Text (overall Elo): 1,485.7 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
- DeepSeek V4 Pro — LMArena WebDev: 1,446.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
- Gemini 3.5 Flash — LMArena WebDev: 1,484.3 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
- GLM-4.6 — LMArena WebDev: 1,338.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
- GLM-5 — LMArena WebDev: 1,434.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
- GLM-5.2 — LMArena WebDev: 1,587.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
- Kimi K2.6 — LMArena WebDev: 1,509.8 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
- Kimi K3 — LMArena WebDev: 1,682 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
- GLM-4.5-Air — SWE-bench Verified: 57.6 출처 (2026년 7월 23일 기준)자체 보고GLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
- GLM-4.6 — SWE-bench Verified: 68.2 출처 (2025년 9월 30일 기준)SWE-bench Verified leaderboard. 제출 로그가 아직 SWE-bench 메인테이너의 확인을 받지 않았습니다. Official SWE-bench Verified leaderboard submission (vendor scaffold).
- GLM-5 — SWE-bench Verified: 72.8 출처 (2026년 2월 17일 기준)SWE-bench Verified leaderboard. 가져온 리더보드 데이터에는 이 제출에 대한 확인 상태가 게시되어 있지 않습니다. mini-SWE-agent harness, high reasoning effort.
- Kimi K2.6 — SWE-bench Verified: 80.2 출처 (2026년 7월 23일 기준)자체 보고Official Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
SWE-bench 점수에는 공식 리더보드 등재 결과와 벤더 자체 보고 결과가 섞여 있으며(위 점수별로 표시), 에이전트 하니스가 서로 달라 모델 간 점수를 엄밀히 비교할 수는 없습니다.
SWE-V 조정 작업당 비용
SWE-bench Verified 점수가 있는 모델에는 다음 값도 함께 표시합니다: swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — 실패한 작업을 그대로 재시도한다고 가정할 때 해결된 작업 하나당 추정 비용입니다. 분모로는 SWE-bench Verified 통과율만 사용합니다. Arena WebDev와 LiveBench 점수는 확률로서의 의미가 없으므로 절대 대신 사용하지 않습니다. SWE-V 점수가 없는 모델에는 “—”를 표시합니다 — 저희는 점수를 추정하지 않습니다.
- 1/p 공식은 일정한 성공률로 독립적인 재시도를 가정합니다.
- 각 재시도가 첫 시도와 같은 토큰을 사용한다고 가정합니다.
- 실제 실패는 그대로 재시도하기보다 사람이나 도구의 개입이 필요한 경우가 많으며, 그 오버헤드는 비용에 포함되지 않습니다.
- 해결률은 SWE-bench Verified 작업 세트 기준이며, 실제 작업 분포와는 다릅니다.
역량 티어
품질 점수가 있는 모델은 결정론적 자연 간격 규칙에 따라 1~3개 티어(Tier 1 프런티어 / Tier 2 밸런스 / Tier 3 이코노미)로 그룹화됩니다. 점수를 소수점 첫째 자리로 반올림한 뒤, 내림차순으로 인접한 모델 사이의 간격이 최소 max(score range × 25%, 8 points) 이상이면 티어 경계 후보가 됩니다. 후보 간격 중 가장 큰 두 개만 경계가 되며(동률이면 상위 순위 우선), 조건을 만족하는 간격이 없으면 단일 티어입니다. 티어 경계는 빌드 타임 스냅샷 테스트로 고정되므로 데이터 업데이트가 모델의 티어를 조용히 옮길 수 없습니다 — 모든 티어 변경은 사람이 검토합니다. “Tier 1 최저가” 하이라이트는 최상위 티어 안에서 작업당 비용이 가장 낮은 모델을 표시합니다. 티어 소속에는 품질 점수만 있으면 되므로, SWE-V 조정 비용 열이 “—”인 모델도 티어를 가질 수 있습니다.
대부분의 카테고리에 품질 랭킹이 없는 이유
품질 랭킹은 해당 카테고리에서 5개 이상의 모델에 직접적인 공개 점수(정확한 모델 버전, 정확한 벤치마크 버전, 평가 모드 명시)가 있을 때만 게시합니다. 현재 이 기준을 충족하는 카테고리는 코딩 / 프런트엔드 & UI뿐입니다. 그 외 모든 카테고리는 공개 리더보드가 저희 카탈로그를 다루지 않거나 업데이트가 중단된 상태이므로 비용 계산기만 제공합니다. 지어낸 숫자를 보여드리느니 아무것도 보여드리지 않는 편을 택합니다.
계산기에 사용된 작업 프로필
| 카테고리 | 입력 / 출력 토큰 | 가정 |
|---|---|---|
| 코딩 / 프런트엔드 & UI | 4,000 / 1,500 | 주변 컨텍스트의 중간 크기 파일을 읽고 함수 단위 패치를 생성합니다. |
| 글쓰기 & 마케팅 카피 | 800 / 1,200 | 브리프와 브랜드 노트를 입력받아 짧은 마케팅 문구나 이메일 하나를 출력합니다. |
| 데이터 추출 & JSON 출력 | 2,500 / 400 | 비구조화 텍스트 한 페이지를 입력받아 고정 스키마 JSON을 출력합니다. |
| 에이전트 도구 호출 | 6,000 / 800 | 도구 스키마와 중간 결과가 컨텍스트로 다시 입력되는 멀티턴 도구 호출 세션입니다. |
| 장문 문서 RAG / 요약 | 30,000 / 1,500 | 수십 페이지 분량의 문서를 입력받아 구조화된 요약 하나를 출력합니다. |
| 번역 | 1,500 / 1,600 | 약 1000단어 분량 기사의 중국어/영어 번역이며, 출력 토큰은 입력과 거의 같습니다. |
추정치: 작업당 비용 수치는 위의 일반적인 토큰 프로필에 기반한 추정치이며, 실제 사용량은 다를 수 있습니다. 가격은 저희의 실제 마켓플레이스 요금입니다.
Arena Text Elo 열: LMArena의 일반 채팅 Elo(커뮤니티 투표)로 작업별 점수가 아닙니다. 참고용으로만 표시하며, 품질 점수나 배지에는 절대 사용하지 않습니다.
최신성: 벤치마크 점수는 매월 검토하며(각 점수에 자체 기준일 표기), 가격은 현재 마켓플레이스 요금을 반영합니다.
독립성: 점수는 저희 자체 테스트가 아닌 공개된 발표 자료에서 가져옵니다. 벤더 자체 보고 수치는 표시되는 모든 곳에 그렇게 라벨을 붙입니다.