本文へ移動
UtilPick.
マイツール
すべての道具
お気に入り
保存した道具

불러오는 중…

最近使った道具

열어 본 도구가 여기에 표시돼요.

デスクトップ版を入れる
設定
UtilPick.
すべての道具
すべての道具/AIモデルランキング比較

AIモデルランキング比較

AIモデルを分野別スコア・コスパ・速度で比較。LiveBenchとOpenRouterのデータを毎日更新し基準日も表示。画像・動画生成AIの順位もあります。

ツールを準備しています。

ユーザーの評価

まだレビューはありません。このツールを使ったことがあれば、最初のレビューを書いてください。

ユーザーレビュー

まだレビューはありません。

レビューを書く

ログイン状態を確認しています。

    使い方

    1. 01

      比較する指標のタブと見たい企業を選びます

    2. 02

      上位12モデルが値のぶんだけ走って順位の位置に収まる様子を見ます

    3. 03

      順位表で30位まで確認し、モデル名を押すと全指標の順位をまとめて見られます

    処理の仕組みと知っておきたいこと

    サーバーがLiveBenchのベンチマークとOpenRouterのモデル情報を1日1回取得して順位を付け直し、その基準日を画面上部に表示します。元データを取得できない場合はツールに組み込んだ順位を表示し、その旨もお知らせします。スコア系の指標はゴール付近の差が見えるよう、トラックを0ではなく最小値の少し下から始め、価格・コスト・速度・コンテキストは対数目盛りです。トラック上の目盛りに実際の値を記しているので、誇張の度合いを確認できます。価格は入力3:出力1で混ぜた100万トークンあたりの米ドルです。ロゴとキャラクターは各社の商標を示すもので、UtilPickは各社と関係ありません。

    あわせて使えるツール

    すべて見る
    グラフ画像作成時間・仕事
    文字数カウントテキスト
    単価比較お金・計算
    © 2026 UtilPick忙しい毎日に、シンプルな道具をひとつ。無料のオンラインツール集。デスクトップ版を入れるUtilPick について 道具をリクエスト不具合を知らせる
    プライバシーポリシー(韓国語)利用規約(韓国語)お問い合わせ[email protected]

    今日の1位

    • 今日の変化…
    01

    モデル順位レース

    最新の順位を取得しています

    LiveBench総合
    知能指数
    コーディング指数
    エージェント指数
    毎月新しい問題に入れ替わるLiveBench 7分野のスコア平均。問題が学習データに漏れにくい高いほど良い出典 LiveBench

    LiveBench総合 1位 Claude Fable 5.1 · 全体1位 · 83.4%

    0から始まらない目盛り
    スタート 77.0%80.2%ゴール 83.4%
    3
    Claude Fable 5Anthropic · 2026-06-09
    83.0%平均正答率
    1
    Claude Fable 5.1NEWAnthropic · 2026-09-02
    83.4%平均正答率
    9
    Claude Opus 5Anthropic · 2026-07-25
    80.1%平均正答率
    2
    Claude Opus 5.5NEWAnthropic · 2026-09-23
    83.2%平均正答率
    6
    DeepSeek V4.1 FlashNEWDeepSeek · 2026-09-10
    81.1%平均正答率
    12
    Gemini 3.7 FlashGoogle DeepMind · 2026-08-14
    78.8%平均正答率
    8
    GPT-5.5OpenAI · 2026-04-25
    80.2%平均正答率
    6
    GPT-5.6 SolOpenAI · 2026-07-09
    81.1%平均正答率
    4
    GPT-6 AstraNEWOpenAI · 2026-09-05
    82.2%平均正答率
    10
    GPT-6 SolNEWOpenAI · 2026-09-23
    79.2%平均正答率
    10
    Kimi K3Moonshot · 2026-07-17
    79.2%平均正答率
    5
    Muse Spark 1.3NEWMeta AI · 2026-09-03
    81.6%平均正答率

    今日の変化

    毎日取得した順位を集めて前日と比べます

    今日から順位の収集を始めました。明日から、前日と比べた上昇・下降と新しく入ったモデルがここに表示されます。

    コスパ早見

    LiveBenchの問題を解いたときの実際のコストで評価したコスパです。分野を切り替えられます。

    青い点線(コスパ線)上のモデルは、同じコストでそれより高いスコアを出したモデルがありません。点を押すとそのモデルの概要を見られます。
    総合 · 成功あたりコストが安い順
    1. $0.016 · 65.5点
    2. $0.024 · 67.8点
    3. $0.026 · 72.0点
    4. $0.029 · 81.1点
    5. $0.030 · 71.6点
    6. $0.042 · 76.2点
    7. $0.044 · 77.4点
    8. $0.050 · 71.6点
    02

    順位表

    毎月新しい問題に入れ替わるLiveBench 7分野のスコア平均。問題が学習データに漏れにくい · 高いほど良い · モデル名を押すとすべての指標をまとめて見られます

    表を横にスワイプすると残りの列が見られます。

    LiveBench総合によるAIモデル順位、2026-09-24時点
    順位モデル企業平均正答率公開日
    1 NEWAnthropic83.4% · max2026-09-02
    2 NEWAnthropic83.2% · max2026-09-23
    3Anthropic83.0% · max2026-06-09
    4 NEWOpenAI82.2% · max2026-09-05
    5 NEWMeta AI81.6% · xhigh2026-09-03
    6 NEWDeepSeek81.1% · max2026-09-10
    6OpenAI81.1% · max2026-07-09
    8OpenAI80.2% · xhigh2026-04-25
    9Anthropic80.1% · max2026-07-25
    10 NEWOpenAI79.2% · max2026-09-23
    10Moonshot79.2%2026-07-17
    12Google DeepMind78.8% · high2026-08-14
    基準・出典を見る
    基準日
    2026-09-24 · 元データを1日1回取得し、順位を付け直しています
    出典
    • LiveBench.AILiveBench総合、推論・コーディング・エージェントコーディング・数学・データ分析・言語・指示追従、成功あたりコストとコスパグラフ
    • OpenRouter提供価格・コンテキスト長、直近1日の稼働率、直近30分の出力速度・初回応答時間、知能・コーディング・エージェント指数(Artificial Analysis評価)
    • Artificial Analysis画像生成・画像編集・動画生成・画像→動画のアリーナEloスコアと公開月、AI戦争リプレイの画像・動画レース
    トラックの見方
    トラックでは上位12モデルが走り、残りは順位表の「すべて表示」で見られます。スコア系の指標は差が見えるよう最小値より少し下から始まります。価格・コンテキストは対数目盛りです。距離を倍率として読まず、目盛りの値もあわせて見てください。
    測定条件
    ベンチマークはモデルごとに最も高い推論強度(max・xhigh・high)の値で、価格は入力3:出力1で混ぜた100万トークンあたりの米ドルです。成功あたりコストはLiveBenchが算出した(1問あたりコスト÷スコア)×100です。公開日はOpenRouterに登録された日で、OpenRouterにないモデルは空欄にしています。NEWは基準日から30日以内に出たモデルです。画像・動画は人々が2つの結果を並べて選んだ投票によるEloスコアなので、数十点以内の差は実質的に同程度です。公開は月までしかわからないためその月の1日として数え、NEWは確実に30日以内のモデルにだけ付けます。
    商標について
    ロゴとキャラクターは各社の商標を示すもので、商標権は各社に帰属します。UtilPickは各社と関係がなく、後援や保証を受けていません。ロゴアイコン: Lobe Icons (MIT).
    ほかのAIランキング画像生成AIランキング比較動画生成AIランキング比較