Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 18:13:43
关于这份榜单

前端开发榜采用真实前端开发任务:用户给出同一需求(比如"做一个贪吃蛇小游戏"),两个匿名模型各自在沙盒环境中生成可运行的网页应用,用户实际点击、体验后再投票选出更好的一方,评测内容涵盖代码正确性、界面还原度,以及需要多步推理、调用工具的 Agentic 编程能力。得分同样经 Bradley-Terry 模型换算为对战积分,越高代表模型在真实建站场景下越受开发者认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 18:13:43
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 2
Anthropic
claude-opus-5-maxAnthropicProprietary
1692
6,448$5 / $251MAnthropic
2
1 - 4
Moonshot
kimi-k3-maxMoonshotOpen
1674
4,546$3 / $151MMoonshot
3
2 - 4
Alibaba
qwen3.8-maxAlibabaProprietary
1667
2,855$2 / $61MAlibaba
4
2 - 4
Anthropic
claude-opus-5-highAnthropicProprietary
1663
7,334$5 / $251MAnthropic
5
5 - 7
SpaceXAI
grok-4.6-highSpaceXAIProprietary
1631
1,513$2 / $6500KSpaceXAI
6
5 - 7
Anthropic
claude-fable-5AnthropicProprietary
1627
7,867$10 / $501MAnthropic
7
5 - 7
OpenAI
gpt-5.6-sol-xhigh (codex-harness)OpenAIProprietary
1622
8,595$5 / $301.1MOpenAI
8
8 - 11
Google
gemini-3.7-flash-highGoogleProprietary
1587
2,543$0.75 / $3.571MGoogle
9
8 - 11
Z.ai
glm-5.2-maxZ.aiOpen
1585
8,142$1.40 / $4.401MZ.ai
10
8 - 12
DeepSeek
deepseek-v4-pro-high-20260813DeepSeekOpen
1584
2,180N/AN/ADeepSeek
11
8 - 12
DeepSeek
deepseek-v4-flash-highDeepSeekOpen
1581
2,936$0.44 / $1.321MDeepSeek
12
10 - 15
Anthropic
claude-opus-4-8-highAnthropicProprietary
1564
11,060$5 / $251MAnthropic
13
12 - 15
Anthropic
claude-opus-4-7AnthropicProprietary
1558
13,855$5 / $251MAnthropic
14
12 - 15
Anthropic
claude-opus-4-7-highAnthropicProprietary
1557
14,463$5 / $251MAnthropic
15
12 - 20
SpaceXAI
grok-4.5SpaceXAIProprietary
1555
5,721$2 / $6500KSpaceXAI
16
15 - 22
Anthropic
claude-opus-4-6-highAnthropicProprietary
1545
16,313$5 / $251MAnthropic
17
15 - 23
Anthropic
claude-sonnet-5-highAnthropicProprietary
1540
6,578$1 / $51MAnthropic
18
15 - 23
Anthropic
claude-opus-4-8AnthropicProprietary
1539
9,906$5 / $251MAnthropic
19
15 - 26
Meta
muse-spark-1.1MetaProprietary
1538
5,605$1.25 / $4.25N/AMeta
20
16 - 23
Anthropic
claude-opus-4-6AnthropicProprietary
1537
17,556$5 / $251MAnthropic
21
16 - 26
Google
gemini-3.6-flash-highGoogleProprietary
1537
5,494$0.38 / $1.881MGoogle
22
15 - 28
Meta
muse-spark-1.2 (xHigh)MetaProprietary
1535
2,055$1.25 / $4.25N/AMeta
23
20 - 28
Anthropic
claude-sonnet-4-6AnthropicProprietary
1524
19,588$1.50 / $7.501MAnthropic
24
17 - 31
Tencent
hy3TencentOpen
1522
2,284$0.13 / $0.53262.1KTencent
25
20 - 31
Bytedance
seed-2.1-pro-previewBytedanceProprietary
1522
7,121N/AN/ABytedance
显示第 125 条,共 115 条记录
每页显示:
1 / 5

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。