본문 바로가기
UtilPick.
나의 도구함
전체 도구
즐겨찾기
성경 타자
즐겨찾는 도구

불러오는 중…

최근 방문

열어 본 도구가 여기에 표시돼요.

데스크톱 앱 설치
설정
UtilPick.
AI 모델 순위 비교
전체 도구/AI 모델 순위 비교

AI 모델 순위 비교

기준을 고르면 모델들이 값만큼 트랙을 달려 순위대로 자리 잡습니다. 정확한 값은 아래 순위표에서 확인하세요.

도구를 준비하고 있어요.

이용자 평가

아직 등록된 리뷰가 없어요. 이 도구를 써 보셨다면 첫 리뷰를 남겨 주세요.

이용자 리뷰

아직 등록된 리뷰가 없어요.

리뷰 쓰기

로그인 상태를 확인하고 있어요.

    사용부터 결과 확인까지

    AI 모델 순위 비교 상세 가이드

    사용법과 예제를 살펴보고, 궁금한 내용은 주제별로 찾아보세요.

    사용법
    예제·선택 기준
    문제 해결
    자주 묻는 질문

    시작 전에 한눈에 보기

    원자료
    서버가 LiveBench 벤치마크와 OpenRouter 모델 정보를 하루 한 번 새로 받아 순위를 다시 매기고, 화면 위에 기준일을 적어요.
    받지 못한 날
    원자료를 받지 못하면 도구에 넣어 둔 순위(2026-09-24 기준)를 보여 주고 그 사실을 함께 알려요.
    보여 주는 범위
    트랙에는 상위 12개 모델이 달리고, 순위표는 기준마다 30위까지 보여 줘요. 측정 모델이 3개보다 적은 기준은 숨겨요.
    기준 묶음
    종합·분야별·가성비·속도·안정성·이미지·영상 묶음이 있어요.
    가격
    입력 3 : 출력 1로 섞은 100만 토큰당 미국 달러예요. 원화 환산은 유럽중앙은행 기준환율로 바꾼 참고값이에요.

    AI 모델 순위 비교 사용 순서

    1. 01

      비교 기준을 고르세요

      ‘비교 묶음’에서 종합·분야별·가성비 등을 고르고 그 안의 기준 탭을 누르세요. 탭마다 무엇을 쟀는지와 ‘높을수록 좋음’ 같은 방향이 적혀요.

    2. 02

      회사를 골라 보세요

      ‘회사별로 보기’에서 회사를 고르면 그 회사 모델만 남아요. 순위 번호는 전체 순위를 그대로 써요.

    3. 03

      트랙을 읽으세요

      상위 12개 모델이 값만큼 달려 순위대로 자리 잡아요. 트랙 위 눈금에 실제 값이 적혀 있으니 거리만 보지 말고 눈금을 함께 보세요.

    4. 04

      순위표와 모델 요약을 보세요

      순위표에서 ‘모두 보기’로 30위까지 펼치고, 모델 이름을 누르면 모든 기준의 순위를 한 번에 모아 봐요.

    이런 작업에 활용하세요

    종합·분야별·가성비·속도로 나눠 봅니다

    종합에는 LiveBench 종합과 OpenRouter 가 제공하는 지능·코딩·에이전트 지수(Artificial Analysis 평가)가 있습니다. 분야별은 LiveBench 의 추론·코딩·에이전트 코딩·수학·데이터 분석·언어·지시 따르기입니다. 가성비는 LiveBench 문제 하나를 맞히는 데 든 비용과 100만 토큰당 가격, 속도·안정성은 OpenRouter 가 잰 출력 속도·첫 응답 시간·가동률·컨텍스트 길이입니다. 한 기준의 1위가 다른 기준에서도 앞선다는 뜻은 아니니 쓰려는 일에 맞는 기준을 보세요.

    가성비 그래프 읽는 법

    가로는 성공 1건당 비용, 세로는 점수입니다. 파란 점선은 같은 비용에서 그보다 점수가 높은 모델이 없는 모델만 이은 가성비 선입니다. 선 아래·오른쪽에 있는 모델은 더 싸면서 점수가 높은 대안이 있다는 뜻입니다.

    트랙 눈금을 함께 읽어 주세요

    점수 차이가 작은 기준은 트랙이 0 이 아니라 최솟값보다 조금 아래에서 출발해 차이를 크게 보여 줍니다. 가격과 컨텍스트는 수십 배 차이가 나서 로그 눈금을 씁니다. 트랙 위 눈금에 실제 값을 적어 두었으니 거리 차이를 그대로 배수로 읽지 마세요.

    하루 한 번 새로 받습니다

    원자료를 하루 한 번 새로 받아 순위를 다시 매기고 화면 위에 기준일을 적습니다. 벤치마크는 추론 강도(max·high 등) 설정에 따라 달라져 가장 높은 설정의 값을 표시했고, 가격은 입력 3 : 출력 1 비율로 섞은 100만 토큰당 미국 달러이고, 한국어 화면에서는 그날 유럽중앙은행 기준환율로 바꾼 원화 참고값(≈)을 옆에 적습니다. 실제 요금은 공급사와 할인 조건에 따라 다를 수 있습니다.

    예제로 결과 이해하기

    가격 탭 고르기

    입력·설정
    비교 묶음: 가성비 → 가격
    결과·기대 조건
    싼 모델일수록 결승선에 가까워요
    트랙은 로그 눈금
    가격은 낮을수록 좋은 기준이에요. 값 차이가 커서 로그 눈금으로 그리므로 거리를 배수로 읽지 마세요.

    가성비 선 읽기

    입력·설정
    성공 1건당 비용과 점수
    A $0.02·60점, B $0.05·55점
    C $0.10·70점, D $0.40·68점
    결과·기대 조건
    가성비 선: A → C
    싼 순서로 보면서 지금까지보다 점수가 높은 모델만 남겨요. B는 A보다 비싸고 점수가 낮고, D는 C보다 비싸고 점수가 낮아 선에서 빠져요.

    회사 하나만 보기

    입력·설정
    회사별로 보기: 한 회사 선택
    결과·기대 조건
    그 회사 모델만 남고 순위 번호는 전체 순위 그대로
    회사 안에서 1등이어도 전체 순위가 몇 위인지 함께 보여 과장 없이 견줄 수 있어요.

    기준 묶음 고르기

    표를 좌우로 밀어 나머지 내용을 확인하세요.

    기준 묶음 고르기
    묶음보는 것출처
    종합LiveBench 종합과 지능·코딩·에이전트 지수LiveBench, OpenRouter(Artificial Analysis 평가)
    분야별추론·코딩·에이전트 코딩·수학·데이터 분석·언어·지시 따르기LiveBench
    가성비성공 1건당 비용과 100만 토큰당 가격LiveBench, OpenRouter
    속도·안정성출력 속도·첫 응답·가동률·컨텍스트 길이OpenRouter

    결과가 예상과 다를 때

    ‘내장 자료’라고 나와요

    그날 원자료를 받지 못해 도구에 넣어 둔 순위를 보여 주는 중이에요. 표시된 기준일을 확인하고 나중에 다시 열어 보세요.

    찾는 모델이 ‘순위 밖’이에요

    기준마다 상위 30개만 담아요. 그 기준을 재지 않았거나 30위 밖이면 요약에 ‘상위 n개에 없거나 측정 자료 없음’으로 나와요.

    고른 회사 모델이 없다고 나와요

    그 기준 순위에 해당 회사 모델이 없어서예요. 다른 기준이나 회사를 골라 보세요.

    알아두면 쉬운 용어

    LiveBench
    매달 새 문제로 바꾸는 벤치마크예요. 문제가 학습 자료에 새어 들어가기 어려워요.
    로그 눈금
    값이 열 배씩 커질 때 같은 거리만큼 나아가는 눈금이에요. 가격·컨텍스트처럼 차이가 큰 값에 써요.
    가성비 선
    같은 비용으로 더 높은 점수를 낸 모델이 없는 모델들을 이은 선이에요.

    AI 모델 순위 비교 자주 묻는 질문

    순위는 언제 기준인가요?

    화면 위에 적힌 기준일입니다. 서버가 LiveBench·OpenRouter 원자료를 하루 한 번 새로 받으므로, 새 모델은 원자료에 실린 뒤 늦어도 하루 안에 반영됩니다. 원자료를 받지 못한 날에는 도구에 넣어 둔 순위와 그 기준일을 보여 드립니다.

    가격 1위는 무슨 뜻인가요?

    100만 토큰을 입력 3 : 출력 1 비율로 썼을 때 가장 싼 모델입니다. 가격 탭은 쌀수록 결승선에 가깝습니다.

    로고와 캐릭터는 공식인가요?

    아닙니다. 로고와 캐릭터는 각 회사의 상표를 가리키려고 쓴 것이며 UtilPick 은 각 회사와 관계가 없고 후원이나 보증을 받지 않았습니다.

    모델 이름을 누르면 무엇이 나오나요?

    그 모델이 기준마다 몇 위인지 모은 요약 창이 열려요. 상위 30개에 없는 기준은 순위 밖으로 표시돼요.

    속도·첫 응답 탭이 안 보일 때가 있어요.

    측정한 모델이 3개보다 적은 기준은 순위라 부르기 어려워 숨겨요. 원자료가 다시 채워지면 나타나요.

    궁금한 주제로 바로 가기

    • #AI모델비교
    • #기준묶음
    • #가성비선
    • #내장자료

    내용 확인 2026.10.02

    함께 쓰면 좋은 도구

    전체 보기
    차트 이미지 만들기시간·생산성
    글자수 세기텍스트
    묶음상품 단가 비교금융·계산
    © 2026 유틸픽 UtilPick복잡한 일상에, 간단한 도구 하나. 무료 온라인 유틸리티 모음.데스크톱 앱 설치유틸픽(UtilPick) 소개 도구 요청하기문제 신고하기
    개인정보처리방침이용약관문의[email protected]

    오늘의 1위

    • 오늘의 변화…
    01

    모델 순위 경주

    최신 순위를 받아 오고 있어요

    LiveBench 종합
    지능 지수
    코딩 지수
    에이전트 지수
    매달 새 문제로 바꾸는 LiveBench 7개 분야 점수의 평균. 문제가 학습 자료에 새어 들어가기 어려워요높을수록 좋음출처 LiveBench

    LiveBench 종합 1위 Claude Fable 5.1 · 전체 1위 · 83.4%

    출발점이 0이 아닌 눈금
    출발 77.0%80.2%결승 83.4%
    3
    Claude Fable 5Anthropic · 2026-06-09
    83.0%평균 정답률
    1
    Claude Fable 5.1NEWAnthropic · 2026-09-02
    83.4%평균 정답률
    9
    Claude Opus 5Anthropic · 2026-07-25
    80.1%평균 정답률
    2
    Claude Opus 5.5NEWAnthropic · 2026-09-23
    83.2%평균 정답률
    6
    DeepSeek V4.1 FlashNEWDeepSeek · 2026-09-10
    81.1%평균 정답률
    12
    Gemini 3.7 FlashGoogle DeepMind · 2026-08-14
    78.8%평균 정답률
    8
    GPT-5.5OpenAI · 2026-04-25
    80.2%평균 정답률
    6
    GPT-5.6 SolOpenAI · 2026-07-09
    81.1%평균 정답률
    4
    GPT-6 AstraNEWOpenAI · 2026-09-05
    82.2%평균 정답률
    10
    GPT-6 SolNEWOpenAI · 2026-09-23
    79.2%평균 정답률
    10
    Kimi K3Moonshot · 2026-07-17
    79.2%평균 정답률
    5
    Muse Spark 1.3NEWMeta AI · 2026-09-03
    81.6%평균 정답률

    오늘의 변화

    매일 받은 순위를 모아 어제와 비교해요

    오늘부터 순위를 모으기 시작했어요. 내일부터 어제와 비교한 오름·내림과 새로 든 모델이 여기에 보여요.

    가성비 한눈에

    LiveBench 문제를 풀 때 든 실제 비용으로 매긴 가성비예요. 분야를 바꿔 볼 수 있어요.

    파란 점선(가성비 선) 위의 모델은 같은 비용으로 그보다 높은 점수를 낸 모델이 없어요. 점을 누르면 그 모델을 한눈에 볼 수 있어요.
    종합 · 성공 1건당 비용이 싼 순
    1. $0.016 · 65.5점
    2. $0.024 · 67.8점
    3. $0.026 · 72.0점
    4. $0.029 · 81.1점
    5. $0.030 · 71.6점
    6. $0.042 · 76.2점
    7. $0.044 · 77.4점
    8. $0.050 · 71.6점
    02

    순위표

    매달 새 문제로 바꾸는 LiveBench 7개 분야 점수의 평균. 문제가 학습 자료에 새어 들어가기 어려워요 · 높을수록 좋음 · 모델 이름을 누르면 모든 기준을 모아 봐요

    표를 옆으로 밀면 나머지 칸이 보여요.

    LiveBench 종합 기준 AI 모델 순위, 2026-09-24 기준
    순위모델회사평균 정답률출시일
    1 NEWAnthropic83.4% · max2026-09-02
    2 NEWAnthropic83.2% · max2026-09-23
    3Anthropic83.0% · max2026-06-09
    4 NEWOpenAI82.2% · max2026-09-05
    5 NEWMeta AI81.6% · xhigh2026-09-03
    6 NEWDeepSeek81.1% · max2026-09-10
    6OpenAI81.1% · max2026-07-09
    8OpenAI80.2% · xhigh2026-04-25
    9Anthropic80.1% · max2026-07-25
    10 NEWOpenAI79.2% · max2026-09-23
    10Moonshot79.2%2026-07-17
    12Google DeepMind78.8% · high2026-08-14
    기준·출처 보기
    기준일
    2026-09-24 · 원자료를 하루 한 번 새로 받아 순위를 다시 매겨요
    출처
    • LiveBench.AILiveBench 종합, 추론·코딩·에이전트 코딩·수학·데이터 분석·언어·지시 따르기, 성공 1건당 비용과 가성비 그래프
    • OpenRouter 제공가격·컨텍스트 길이, 최근 하루 가동률, 최근 30분 출력 속도·첫 응답 시간, 지능·코딩·에이전트 지수(Artificial Analysis 평가)
    • Artificial Analysis이미지 생성·이미지 편집·영상 생성·이미지→영상 아레나 Elo 점수와 출시 달, AI 전쟁 리플레이의 이미지·영상 경기
    트랙 읽는 법
    트랙에는 상위 12개 모델이 달리고, 나머지는 순위표에서 모두 보기로 볼 수 있어요. 점수 기준은 차이가 보이도록 최솟값보다 조금 아래에서 출발해요. 가격·컨텍스트는 로그 눈금이에요. 거리를 배수로 읽지 말고 눈금 값을 함께 보세요.
    측정 조건
    벤치마크는 모델마다 가장 높은 추론 강도(max·xhigh·high)의 값이고, 가격은 입력 3 : 출력 1 로 섞은 100만 토큰당 미국 달러예요. 성공 1건당 비용은 LiveBench 가 계산한 (문제당 비용 ÷ 점수) × 100 이에요. 출시일은 OpenRouter 에 올라온 날이고, OpenRouter 에 없는 모델은 비워 둬요. NEW 는 기준일로부터 30일 안에 나온 모델이에요. 이미지·영상은 사람들이 두 결과물을 나란히 보고 고른 투표로 매긴 Elo 점수라 점수 차가 수십 점 안이면 사실상 비슷해요. 출시는 달까지만 알려져 있어 그달 1일로 세고, NEW 는 확실히 30일 안인 모델에만 붙여요.
    상표 안내
    로고와 캐릭터는 각 회사의 상표를 가리키며 상표권은 해당 회사에 있어요. UtilPick 은 각 회사와 관계가 없고 후원이나 보증을 받지 않았어요. 로고 아이콘: Lobe Icons (MIT).
    다른 AI 순위이미지 생성 AI 순위 비교영상 생성 AI 순위 비교