Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 18:13:43
关于这份榜单

文本对话榜通过双盲对比投票产生:用户在不知道模型身份的情况下,对同一问题下两个模型的回答进行投票,场景覆盖数学推理、代码问答、创意写作、多轮对话与复杂指令遵循等真实使用情境。所有投票经 Bradley-Terry 评分模型(与国际象棋 Elo 评分同源)换算为对战积分,同时提供剔除回答长度、排版等表达技巧影响的"风格控制"版本。得分越高,代表模型在真实对话场景下越受用户认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 18:13:43
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 4
Anthropic
claude-fable-5AnthropicProprietary
1506±5
+5 / -521,533$10 / $501MAnthropic
2
1 - 4
Anthropic
claude-opus-4-6-highAnthropicProprietary
1505±4
+4 / -472,516$5 / $251MAnthropic
3
1 - 7
Anthropic
claude-opus-4-7-highAnthropicProprietary
1502±4
+4 / -460,331$5 / $251MAnthropic
4
1 - 16
Meta
muse-spark-1.2 (xHigh)MetaProprietary
1498±10
+10 / -103,280$1.25 / $4.25N/AMeta
5
3 - 13
Anthropic
claude-opus-4-6AnthropicProprietary
1497±3
+3 / -376,474$5 / $251MAnthropic
6
4 - 13
Anthropic
claude-opus-4-7AnthropicProprietary
1494±4
+4 / -461,419$5 / $251MAnthropic
7
3 - 16
Anthropic
claude-opus-5-highAnthropicProprietary
1493±5
+5 / -520,030$5 / $251MAnthropic
8
4 - 20
Alibaba
qwen3.8-maxAlibabaProprietary
1491±8
+8 / -87,004$2 / $61MAlibaba
9
3 - 20
Google
gemini-3.7-flash-highGoogleProprietary
1490±8
+8 / -85,744$0.75 / $3.571MGoogle
10
4 - 20
Anthropic
claude-opus-5-maxAnthropicProprietary
1489±7
+7 / -79,679$5 / $251MAnthropic
11
4 - 20
Meta
muse-spark-1.1MetaProprietary
1489±6
+6 / -616,928$1.25 / $4.25N/AMeta
12
4 - 20
Moonshot
kimi-k3-maxMoonshotOpen
1489±6
+6 / -611,969N/AN/AMoonshot
13
4 - 20
Meta
muse-sparkMetaProprietary
1488±6
+6 / -613,592N/AN/AMeta
14
6 - 20
Google
gemini-3.1-pro-previewGoogleProprietary
1486±3
+3 / -395,107$1 / $61MGoogle
15
6 - 21
Google
gemini-3-proGoogleProprietary
1485±4
+4 / -441,509$2 / $121MGoogle
16
6 - 28
Google
gemini-3.6-flash-highGoogleProprietary
1484±6
+6 / -613,815$0.38 / $1.881MGoogle
17
8 - 28
OpenAI
gpt-5.5-highOpenAIProprietary
1482±4
+4 / -455,454$2.50 / $151.1MOpenAI
18
8 - 29
Anthropic
claude-opus-4-8-highAnthropicProprietary
1481±5
+5 / -540,706$5 / $251MAnthropic
19
8 - 33
OpenAI
gpt-5.6-sol-xhighOpenAIProprietary
1481±6
+6 / -615,558$5 / $30N/AOpenAI
20
15 - 36
Google
gemini-3.5-flash-highGoogleProprietary
1477±5
+5 / -525,861$0.75 / $4.501MGoogle
21
16 - 37
OpenAI
gpt-5.5OpenAIProprietary
1477±4
+4 / -456,736$2.50 / $151.1MOpenAI
22
16 - 37
OpenAI
gpt-5.4-highOpenAIProprietary
1476±4
+4 / -460,823$2.50 / $151.1MOpenAI
23
16 - 38
OpenAI
gpt-5.2-chat-latest-20260210OpenAIProprietary
1476±4
+4 / -434,385$1.75 / $14128KOpenAI
24
16 - 41
SpaceXAI
grok-4.20-beta1SpaceXAIProprietary
1475±5
+5 / -526,816N/AN/ASpaceXAI
25
16 - 42
Google
gemini-3.5-flash-mediumGoogleProprietary
1474±5
+5 / -524,043$0.75 / $4.501MGoogle
显示第 125 条,共 390 条记录
每页显示:
1 / 16

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。