실제 워크로드 비용은 얼마나 될까요?

실제 가격, 공개 벤치마크. 작업을 고르고 사용량을 설정하면 각 호스팅 모델의 실행 비용을 확인할 수 있습니다 — 공개 벤치마크가 있는 경우 품질 데이터도 함께 제공됩니다.

벤치마크 데이터 업데이트: 2026년 7월 27일 · 방법론 및 출처

전체 모델 한눈에 보기

가격은 저희 마켓플레이스 요금 · 작업당 비용은 추정치
Kimi K2.6Tier 1 · 프런티어US$0.76US$3.20256KUS$0.0078추정US$0.0098추정자체 보고1,460.9
GLM-5Tier 2 · 밸런스US$1.00US$3.20200KUS$0.0088추정US$0.01추정1,456.7
DeepSeek V4 FlashUS$0.20US$0.591MUS$0.0017추정SWE-V 데이터 없음1,435.5
DeepSeek V4 ProTier 3 · 이코노미US$0.59US$1.781MUS$0.0050추정SWE-V 데이터 없음1,456.6
GLM-5-TurboUS$0.96US$3.20200KUS$0.0086추정SWE-V 데이터 없음
Qwen3.7-PlusUS$0.32US$1.281MUS$0.0032추정SWE-V 데이터 없음
Qwen3.7-MaxUS$2.00US$6.001MUS$0.02추정SWE-V 데이터 없음
MiniMax M3US$0.24US$0.961MUS$0.0024추정SWE-V 데이터 없음
비용 기준:

SWE-V 조정 보기: 8개 모델 중 2개 표시. SWE-bench Verified 데이터가 없는 모델은 이 차트에서 제외된 것이며, 순위가 낮게 매겨진 것이 아닙니다.

이 보기에서 제외됨: DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5-Turbo 및 Qwen3.7-Plus 외 2개 — 유효한 SWE-V 점수 없음.

1,000
101001k10k100k1M
해결된 작업당 가장 저렴Tier 1 최저가 — 최상위 역량 티어에서 가장 저렴한 모델

SWE-V 조정 기준에는 표시되지 않음 (SWE-bench Verified 점수 없음 — 저희는 점수를 추정하지 않습니다): DeepSeek V4 Flash, DeepSeek V4 Pro, GLM-5-Turbo, Qwen3.7-Plus, Qwen3.7-Max 및 MiniMax M3

방법론 및 데이터 출처

데이터 최종 변경일: 2026년 7월 27일. 각 점수에는 아래에 자체 기준일이 표기됩니다 (변경이 없는 동기화 실행은 이 날짜를 갱신하지 않으며, 업스트림 리더보드는 각자의 일정에 따라 발표됩니다). 가격은 실시간으로 가져온 저희 마켓플레이스 요금입니다. 벤치마크 점수는 공개된 발표 자료와 리더보드에서 가져옵니다 — 저희가 직접 측정한 값이 아니며, 지어내지도 않습니다. 직접적인 공개 점수가 없는 경우에는 아무것도 표시하지 않습니다.

사용된 벤치마크

벤치마크지표앵커 하한 → 상한출처
SWE-bench Verifiedpass_rate_pct4085https://www.swebench.com/
LMArena WebDevelo1,2001,700https://arena.ai/leaderboard
LiveBench Codingscore_0_1004085https://livebench.ai/

품질 점수는 각 원시 벤치마크 값을 고정 앵커로 정규화한 뒤 — norm = clamp((raw − anchor_low) / (anchor_high − anchor_low), 0, 1) × 100 — 카테고리의 가중 평균을 취합니다. 모델에 특정 벤치마크 점수가 없으면 나머지 가중치를 재정규화하며, 해당 카테고리에 점수가 있는 벤치마크가 하나도 없는 모델은 품질 점수를 아예 받지 않습니다.

SWE-V 조정 작업당 비용

SWE-bench Verified 점수가 있는 모델에는 다음 값도 함께 표시합니다: swev_adjusted_cost = cost_per_job ÷ (SWE-bench Verified pass rate / 100) — 실패한 작업을 그대로 재시도한다고 가정할 때 해결된 작업 하나당 추정 비용입니다. 분모로는 SWE-bench Verified 통과율만 사용합니다. Arena WebDev와 LiveBench 점수는 확률로서의 의미가 없으므로 절대 대신 사용하지 않습니다. SWE-V 점수가 없는 모델에는 “—”를 표시합니다 — 저희는 점수를 추정하지 않습니다.

  • 1/p 공식은 일정한 성공률로 독립적인 재시도를 가정합니다.
  • 각 재시도가 첫 시도와 같은 토큰을 사용한다고 가정합니다.
  • 실제 실패는 그대로 재시도하기보다 사람이나 도구의 개입이 필요한 경우가 많으며, 그 오버헤드는 비용에 포함되지 않습니다.
  • 해결률은 SWE-bench Verified 작업 세트 기준이며, 실제 작업 분포와는 다릅니다.

역량 티어

품질 점수가 있는 모델은 결정론적 자연 간격 규칙에 따라 1~3개 티어(Tier 1 프런티어 / Tier 2 밸런스 / Tier 3 이코노미)로 그룹화됩니다. 점수를 소수점 첫째 자리로 반올림한 뒤, 내림차순으로 인접한 모델 사이의 간격이 최소 max(score range × 25%, 8 points) 이상이면 티어 경계 후보가 됩니다. 후보 간격 중 가장 큰 두 개만 경계가 되며(동률이면 상위 순위 우선), 조건을 만족하는 간격이 없으면 단일 티어입니다. 티어 경계는 빌드 타임 스냅샷 테스트로 고정되므로 데이터 업데이트가 모델의 티어를 조용히 옮길 수 없습니다 — 모든 티어 변경은 사람이 검토합니다. “Tier 1 최저가” 하이라이트는 최상위 티어 안에서 작업당 비용이 가장 낮은 모델을 표시합니다. 티어 소속에는 품질 점수만 있으면 되므로, SWE-V 조정 비용 열이 “—”인 모델도 티어를 가질 수 있습니다.

대부분의 카테고리에 품질 랭킹이 없는 이유

품질 랭킹은 해당 카테고리에서 5개 이상의 모델에 직접적인 공개 점수(정확한 모델 버전, 정확한 벤치마크 버전, 평가 모드 명시)가 있을 때만 게시합니다. 현재 이 기준을 충족하는 카테고리는 코딩 / 프런트엔드 & UI뿐입니다. 그 외 모든 카테고리는 공개 리더보드가 저희 카탈로그를 다루지 않거나 업데이트가 중단된 상태이므로 비용 계산기만 제공합니다. 지어낸 숫자를 보여드리느니 아무것도 보여드리지 않는 편을 택합니다.

계산기에 사용된 작업 프로필

카테고리입력 / 출력 토큰가정
코딩 / 프런트엔드 & UI4,000 / 1,500주변 컨텍스트의 중간 크기 파일을 읽고 함수 단위 패치를 생성합니다.
글쓰기 & 마케팅 카피800 / 1,200브리프와 브랜드 노트를 입력받아 짧은 마케팅 문구나 이메일 하나를 출력합니다.
데이터 추출 & JSON 출력2,500 / 400비구조화 텍스트 한 페이지를 입력받아 고정 스키마 JSON을 출력합니다.
에이전트 도구 호출6,000 / 800도구 스키마와 중간 결과가 컨텍스트로 다시 입력되는 멀티턴 도구 호출 세션입니다.
장문 문서 RAG / 요약30,000 / 1,500수십 페이지 분량의 문서를 입력받아 구조화된 요약 하나를 출력합니다.
번역1,500 / 1,600약 1000단어 분량 기사의 중국어/영어 번역이며, 출력 토큰은 입력과 거의 같습니다.

추정치: 작업당 비용 수치는 위의 일반적인 토큰 프로필에 기반한 추정치이며, 실제 사용량은 다를 수 있습니다. 가격은 저희의 실제 마켓플레이스 요금입니다.

Arena Text Elo 열: LMArena의 일반 채팅 Elo(커뮤니티 투표)로 작업별 점수가 아닙니다. 참고용으로만 표시하며, 품질 점수나 배지에는 절대 사용하지 않습니다.

최신성: 벤치마크 점수는 매월 검토하며(각 점수에 자체 기준일 표기), 가격은 현재 마켓플레이스 요금을 반영합니다.

독립성: 점수는 저희 자체 테스트가 아닌 공개된 발표 자료에서 가져옵니다. 벤더 자체 보고 수치는 표시되는 모든 곳에 그렇게 라벨을 붙입니다.