AI Rank · 大模型排行榜 Arena 评分 价格 模型库

AI 大模型排行榜

实时追踪 LMArena 人类偏好评分,多维对比主流大模型的智能水平、API 价格、上下文窗口与多模态能力——打开页面即拉取最新数据,无需登录、完全免费。

—个模型 —家厂商 —榜单日期

LMArena 是什么?

LMArena(大模型竞技场,源自 UC Berkeley 的 Chatbot Arena 项目)是全球最大的 AI 模型盲测平台:任何用户提一个问题,两个匿名模型各给出回答,用户投票选出更好的那个——因为不知道回答来自哪家模型,投票天然公平。LMArena 官方定期把投票汇总为 Elo 评分公开发布,本站的智能榜与中文榜就来自它的官方公开数据集。

Elo 分数怎么读?

Elo 是相对等级分(与国际象棋同源),只表示"被用户偏好的概率",不是能力考试分数。例如 1400 对 1380 的含义是:盲测中前者约以 53% 的概率被偏好。分数后的 ±X 是 95% 置信区间——越小代表票数越多、排名越稳;比较两个模型时,区间重叠越大,名次差异越不可靠。

为什么 GPT-6 的分数比 GPT-5.5 还低?

三个常见原因:① 样本少、评分未收敛——新模型参评对战少,Elo 需要足够投票才能稳定(表现为置信区间明显更宽),随票数增加分数会逐渐逼近真实水平;② 人类偏好 ≠ 能力——回答的风格、详略、格式都会影响盲测投票,这与跑分测试的能力排名可能不一致;③ 档位差异——同一模型的不同推理强度变体(如"高推理档")在 Arena 独立参评,对比时请选择同一档位。

六个榜单分别按什么排?

智能榜:LMArena 综合类目(overall)Elo 降序。中文榜:LMArena 中文类目 Elo 降序,反映中文真实对话中的偏好。性价比:50% 智能分位 + 50% 低价分位,同时奖励聪明与便宜(仅统计有评分且有价格的模型)。低价:输入价格升序。长上下文:上下文窗口降序。最新发布:发布时间降序。

价格、上下文与标签

价格为各厂商官方 API 定价(美元 / 每百万 token),上下文为最大输入窗口,均来自 OpenRouter 与 models.dev 实时接口;"—"表示暂无公开数据。标签含义:高推理档 = 高推理强度变体;视觉 = 支持图片输入;推理 = 支持推理/思考模式;工具 = 支持函数调用;开源权重 = 权重公开可自部署;免费档 = 存在 $0 免费变体;评分收敛中 = 该模型 Arena 投票还少,分数仅供参考。

更新与免责

每次打开页面都会实时拉取最新数据:Arena 评分通常每日更新,价格随官方调整即时变化。榜单反映盲测偏好,选型时请结合自己的任务实测;本站免费、无登录、不收集任何个人数据。

👁 视觉 💭 推理 🔧 工具 📦 开源权重 🆓 有免费档
# 模型 Arena 分 中文分 输入 $/M 输出 $/M 上下文 发布

📡 AI 热榜资讯

…

AI 搞钱 · 大模型 · 优惠福利实时资讯——聚合 Hacker News、GitHub、Hugging Face、dev.to 与 RSS 管道,每 5 分钟自动刷新,点击标题直达原文。

    常见问题

    榜单数据来源是什么?

    智能评分来自 LMArena(大模型竞技场)官方公开数据集——基于真实用户盲测投票的 Elo 评分;API 价格与上下文窗口来自 OpenRouter 与 models.dev 实时接口。打开页面即自动拉取最新数据。

    智能榜 / 中文榜 / 性价比分别怎么排?

    智能榜按 LMArena 综合类目(overall)Elo 降序;中文榜按其中文类目 Elo 降序,反映中文真实对话表现;性价比 = 50% 智能分位 + 50% 低价分位,同时奖励"聪明"和"便宜"。

    为什么有的模型价格显示"—"?

    部分模型(尤其是一些未上架主流 API 市场的模型)暂无公开定价数据,该列留空。评分、票数等信息不受影响。

    网站免费吗?会收集我的数据吗?

    完全免费、无需注册。页面为纯前端实现,不收集任何个人数据;你的筛选、对比与语言偏好只保存在本地浏览器。

    为什么 GPT-6 的分数比 GPT-5.5 还低?

    Arena 评分衡量的是盲测中的人类偏好,而非绝对能力。新模型投票样本少、Elo 仍在收敛(置信区间明显更宽),常被暂时低估;回答风格与详略也会影响投票。通常随票数增加,新模型的评分会逐渐稳定到真实水平。

    已选: