실제 워크로드 비용은 얼마나 될까요?

실제 가격, 공개 벤치마크. 작업을 고르고 사용량을 설정하면 각 호스팅 모델의 실행 비용을 확인할 수 있습니다 — 공개 벤치마크가 있는 경우 품질 데이터도 함께 제공됩니다.

벤치마크 데이터 업데이트: 2026년 7월 27일 · 방법론 및 출처

품질 대 비용 — 코딩 / 프런트엔드 & UI

점수는 공개 벤치마크 기준 · 비용은 추정치
비용 축:

SWE-V 조정 보기: 15개 모델 중 3개 표시. SWE-bench Verified 데이터가 없는 모델은 이 차트에서 제외된 것이며, 순위가 낮게 매겨진 것이 아닙니다.

이 보기에서 제외됨: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash 및 GLM-5.2 외 8개 — 유효한 SWE-V 점수 없음.

파레토 효율 (더 저렴하면서 더 좋은 대안 없음)버블 크기 = 컨텍스트 윈도우

조정 축에는 표시되지 않음 (SWE-bench Verified 점수 없음 — 저희는 점수를 추정하지 않습니다): Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Pro 및 Kimi K3

미평가 (이 카테고리에 대한 공개 벤치마크 데이터 없음): Claude Opus 4.8, Claude Sonnet 5, DeepSeek V4 Flash, Gemini 2.5 Flash, GPT-5.6 Sol, Claude Sonnet 4.5, Claude Haiku 4.5 및 Claude Opus 4.5

전체 모델 한눈에 보기

가격은 저희 마켓플레이스 요금 · 작업당 비용은 추정치
GLM-4.5-AirTier 2 · 밸런스US$0.20US$1.10125KUS$0.0025추정US$0.0043추정자체 보고1,372.9
GLM-4.6Tier 2 · 밸런스US$0.60US$2.20200KUS$0.0057추정US$0.0084추정1,425.2
GLM-5Tier 2 · 밸런스US$1.00US$3.20200KUS$0.0088추정US$0.01추정1,456.7
Claude Opus 4.8US$5.00US$25.00200KUS$0.06추정SWE-V 데이터 없음
Claude Sonnet 5US$3.00US$15.00200KUS$0.03추정SWE-V 데이터 없음
Gemini 3.5 FlashTier 2 · 밸런스US$1.50US$9.001MUS$0.02추정SWE-V 데이터 없음1,474.3
GLM-5.2Tier 2 · 밸런스US$1.40US$4.40200KUS$0.01추정SWE-V 데이터 없음1,469.2
DeepSeek V4 FlashUS$0.14US$0.28128KUS$0.0010추정SWE-V 데이터 없음1,435.5
DeepSeek V4 ProTier 2 · 밸런스US$0.44US$0.87128KUS$0.0030추정SWE-V 데이터 없음1,456.6
Gemini 2.5 FlashUS$0.30US$2.501MUS$0.0049추정SWE-V 데이터 없음1,410.2
GPT-5.6 SolUS$5.00US$30.00400KUS$0.07추정SWE-V 데이터 없음
Kimi K3Tier 1 · 프런티어US$3.00US$15.001MUS$0.03추정SWE-V 데이터 없음1,485.7
Claude Sonnet 4.5US$3.00US$15.00200KUS$0.03추정SWE-V 데이터 없음
Claude Haiku 4.5US$0.80US$4.00200KUS$0.0092추정SWE-V 데이터 없음
Claude Opus 4.5US$15.00US$75.00200KUS$0.17추정SWE-V 데이터 없음
비용 기준:

SWE-V 조정 보기: 15개 모델 중 3개 표시. SWE-bench Verified 데이터가 없는 모델은 이 차트에서 제외된 것이며, 순위가 낮게 매겨진 것이 아닙니다.

이 보기에서 제외됨: Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash 및 GLM-5.2 외 8개 — 유효한 SWE-V 점수 없음.

1,000
101001k10k100k1M
해결된 작업당 가장 저렴

SWE-V 조정 기준에는 표시되지 않음 (SWE-bench Verified 점수 없음 — 저희는 점수를 추정하지 않습니다): Claude Opus 4.8, Claude Sonnet 5, Gemini 3.5 Flash, GLM-5.2, DeepSeek V4 Flash, DeepSeek V4 Pro, Gemini 2.5 Flash, GPT-5.6 Sol, Kimi K3, Claude Sonnet 4.5, Claude Haiku 4.5 및 Claude Opus 4.5

방법론 및 데이터 출처

데이터 최종 변경일: 2026년 7월 27일. 각 점수에는 아래에 자체 기준일이 표기됩니다 (변경이 없는 동기화 실행은 이 날짜를 갱신하지 않으며, 업스트림 리더보드는 각자의 일정에 따라 발표됩니다). 가격은 실시간으로 가져온 저희 마켓플레이스 요금입니다. 벤치마크 점수는 공개된 발표 자료와 리더보드에서 가져옵니다 — 저희가 직접 측정한 값이 아니며, 지어내지도 않습니다. 직접적인 공개 점수가 없는 경우에는 아무것도 표시하지 않습니다.

사용된 벤치마크

벤치마크지표앵커 하한 → 상한출처
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1,2001,700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

품질 점수는 각 원시 벤치마크 값을 고정 앵커로 정규화한 뒤 — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — 카테고리의 가중 평균을 취합니다. 모델에 특정 벤치마크 점수가 없으면 나머지 가중치를 재정규화하며, 해당 카테고리에 점수가 있는 벤치마크가 하나도 없는 모델은 품질 점수를 아예 받지 않습니다.

사용하는 모든 점수와 그 출처

  • DeepSeek V4 FlashLiveBench Coding: 69.228 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • DeepSeek V4 ProLiveBench Coding: 69.994 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Gemini 3.5 FlashLiveBench Coding: 78.185 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is gemini-3.5-flash-high (reasoning-effort "high" mode).
  • GLM-5.2LiveBench Coding: 79.654 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25.
  • Kimi K2.6LiveBench Coding: 78.567 출처 (2026년 6월 25일 기준)LiveBench Coding category average (code_generation + code_completion), snapshot 2026-06-25. LiveBench entry is the "thinking" mode variant.
  • DeepSeek V4 FlashLMArena Text (overall Elo): 1,435.5 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena Text (overall Elo): 1,456.6 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • Gemini 2.5 FlashLMArena Text (overall Elo): 1,410.2 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • Gemini 3.5 FlashLMArena Text (overall Elo): 1,474.3 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.5-AirLMArena Text (overall Elo): 1,372.9 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • GLM-4.6LMArena Text (overall Elo): 1,425.2 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • GLM-5LMArena Text (overall Elo): 1,456.7 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • GLM-5.2LMArena Text (overall Elo): 1,469.2 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena Text (overall Elo): 1,460.9 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • Kimi K3LMArena Text (overall Elo): 1,485.7 출처 (2026년 7월 21일 기준)LMArena Text leaderboard (style control), category "overall".
  • DeepSeek V4 ProLMArena WebDev: 1,446.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
  • Gemini 3.5 FlashLMArena WebDev: 1,484.3 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall". Arena entry is gemini-3.5-flash-medium (reasoning-effort "medium" mode).
  • GLM-4.6LMArena WebDev: 1,338.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
  • GLM-5LMArena WebDev: 1,434.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
  • GLM-5.2LMArena WebDev: 1,587.7 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall". Arena entry is the "(max)" mode variant.
  • Kimi K2.6LMArena WebDev: 1,509.8 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
  • Kimi K3LMArena WebDev: 1,682 출처 (2026년 7월 24일 기준)LMArena WebDev leaderboard, category "overall".
  • GLM-4.5-AirSWE-bench Verified: 57.6 출처 (2026년 7월 23일 기준)자체 보고GLM-4.5 technical report (Air variant). Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.
  • GLM-4.6SWE-bench Verified: 68.2 출처 (2025년 9월 30일 기준)SWE-bench Verified leaderboard. 제출 로그가 아직 SWE-bench 메인테이너의 확인을 받지 않았습니다. Official SWE-bench Verified leaderboard submission (vendor scaffold).
  • GLM-5SWE-bench Verified: 72.8 출처 (2026년 2월 17일 기준)SWE-bench Verified leaderboard. 가져온 리더보드 데이터에는 이 제출에 대한 확인 상태가 게시되어 있지 않습니다. mini-SWE-agent harness, high reasoning effort.
  • Kimi K2.6SWE-bench Verified: 80.2 출처 (2026년 7월 23일 기준)자체 보고Official Moonshot forum announcement. Vendor self-reported; agent harnesses differ across vendors, so scores are not strictly comparable.

SWE-bench 점수에는 공식 리더보드 등재 결과와 벤더 자체 보고 결과가 섞여 있으며(위 점수별로 표시), 에이전트 하니스가 서로 달라 모델 간 점수를 엄밀히 비교할 수는 없습니다.

SWE-V 조정 작업당 비용

SWE-bench Verified 점수가 있는 모델에는 다음 값도 함께 표시합니다: swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — 실패한 작업을 그대로 재시도한다고 가정할 때 해결된 작업 하나당 추정 비용입니다. 분모로는 SWE-bench Verified 통과율만 사용합니다. Arena WebDev와 LiveBench 점수는 확률로서의 의미가 없으므로 절대 대신 사용하지 않습니다. SWE-V 점수가 없는 모델에는 “—”를 표시합니다 — 저희는 점수를 추정하지 않습니다.

  • 1/p 공식은 일정한 성공률로 독립적인 재시도를 가정합니다.
  • 각 재시도가 첫 시도와 같은 토큰을 사용한다고 가정합니다.
  • 실제 실패는 그대로 재시도하기보다 사람이나 도구의 개입이 필요한 경우가 많으며, 그 오버헤드는 비용에 포함되지 않습니다.
  • 해결률은 SWE-bench Verified 작업 세트 기준이며, 실제 작업 분포와는 다릅니다.

역량 티어

품질 점수가 있는 모델은 결정론적 자연 간격 규칙에 따라 1~3개 티어(Tier 1 프런티어 / Tier 2 밸런스 / Tier 3 이코노미)로 그룹화됩니다. 점수를 소수점 첫째 자리로 반올림한 뒤, 내림차순으로 인접한 모델 사이의 간격이 최소 max(score range × 25%, 8 points) 이상이면 티어 경계 후보가 됩니다. 후보 간격 중 가장 큰 두 개만 경계가 되며(동률이면 상위 순위 우선), 조건을 만족하는 간격이 없으면 단일 티어입니다. 티어 경계는 빌드 타임 스냅샷 테스트로 고정되므로 데이터 업데이트가 모델의 티어를 조용히 옮길 수 없습니다 — 모든 티어 변경은 사람이 검토합니다. “Tier 1 최저가” 하이라이트는 최상위 티어 안에서 작업당 비용이 가장 낮은 모델을 표시합니다. 티어 소속에는 품질 점수만 있으면 되므로, SWE-V 조정 비용 열이 “—”인 모델도 티어를 가질 수 있습니다.

대부분의 카테고리에 품질 랭킹이 없는 이유

품질 랭킹은 해당 카테고리에서 5개 이상의 모델에 직접적인 공개 점수(정확한 모델 버전, 정확한 벤치마크 버전, 평가 모드 명시)가 있을 때만 게시합니다. 현재 이 기준을 충족하는 카테고리는 코딩 / 프런트엔드 & UI뿐입니다. 그 외 모든 카테고리는 공개 리더보드가 저희 카탈로그를 다루지 않거나 업데이트가 중단된 상태이므로 비용 계산기만 제공합니다. 지어낸 숫자를 보여드리느니 아무것도 보여드리지 않는 편을 택합니다.

계산기에 사용된 작업 프로필

카테고리입력 / 출력 토큰가정
코딩 / 프런트엔드 & UI4,000 / 1,500주변 컨텍스트의 중간 크기 파일을 읽고 함수 단위 패치를 생성합니다.
글쓰기 & 마케팅 카피800 / 1,200브리프와 브랜드 노트를 입력받아 짧은 마케팅 문구나 이메일 하나를 출력합니다.
데이터 추출 & JSON 출력2,500 / 400비구조화 텍스트 한 페이지를 입력받아 고정 스키마 JSON을 출력합니다.
에이전트 도구 호출6,000 / 800도구 스키마와 중간 결과가 컨텍스트로 다시 입력되는 멀티턴 도구 호출 세션입니다.
장문 문서 RAG / 요약30,000 / 1,500수십 페이지 분량의 문서를 입력받아 구조화된 요약 하나를 출력합니다.
번역1,500 / 1,600약 1000단어 분량 기사의 중국어/영어 번역이며, 출력 토큰은 입력과 거의 같습니다.

추정치: 작업당 비용 수치는 위의 일반적인 토큰 프로필에 기반한 추정치이며, 실제 사용량은 다를 수 있습니다. 가격은 저희의 실제 마켓플레이스 요금입니다.

Arena Text Elo 열: LMArena의 일반 채팅 Elo(커뮤니티 투표)로 작업별 점수가 아닙니다. 참고용으로만 표시하며, 품질 점수나 배지에는 절대 사용하지 않습니다.

최신성: 벤치마크 점수는 매월 검토하며(각 점수에 자체 기준일 표기), 가격은 현재 마켓플레이스 요금을 반영합니다.

독립성: 점수는 저희 자체 테스트가 아닌 공개된 발표 자료에서 가져옵니다. 벤더 자체 보고 수치는 표시되는 모든 곳에 그렇게 라벨을 붙입니다.