Arena Mirror (China)

前沿AI大模型双盲评测榜单

基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每日自动与官方同步,为您提供最新、最公正的大模型能力排名。

数据同步时间: 2026-08-17 18:13:43
关于这份榜单

搜索增强榜评测的是接入了实时联网检索能力的大模型:用户提出真实问题——既有新闻追问、产品选购建议,也有需要综合信息的深度分析类问题,并不局限于简单的事实查询——由两个匿名模型给出附带引用来源的回答,用户据此投票选出更有帮助、更值得信赖的一方。得分经 Bradley-Terry 模型换算为对战积分,越高代表模型在真实搜索场景下越受用户认可。

正在生成榜单图...
展示数量10 个模型
10 个模型
520
图片版式
圈选高亮
选择要高亮的模型
数据同步时间: 2026-08-17 18:13:43
横向滚动:Shift + 滚轮
排名
排名区间
排名区间:基于 Elo 分数估算出的模型在不同对决中可能变动的最乐观与最保守排名范围
模型
Elo 评分
Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分
95% 置信区间
95% 置信区间:表征统计排名的误差范围,误差区间重叠时代表模型间差异不显著
投票数
投票数:用户在盲测竞技场中对模型对决进行投票的总次数
价格 ($/M tokens)
价格:每百万 (Million) token 消耗的输入/输出 API 费用(或对于开源模型,指部署的计算成本参考值)
上下文长度
上下文长度:模型单次对话所能接收和处理的最大 Token 数量限制
开发厂商
1
1 - 1
Anthropic
claude-opus-4-6-searchAnthropicProprietary
1253±5
+5 / -5112,201$5 / $251MAnthropic
2
2 - 5
OpenAI
gpt-5.5-searchOpenAIProprietary
1240±5
+5 / -567,573$2.50 / $151.1MOpenAI
3
2 - 5
Anthropic
claude-fable-5AnthropicProprietary
1237±8
+8 / -820,630$10 / $501MAnthropic
4
2 - 5
Anthropic
claude-opus-4-7AnthropicProprietary
1233±5
+5 / -568,515$5 / $251MAnthropic
5
2 - 7
Baidu
ernie-5.1BaiduProprietary
1226±10
+10 / -103,815N/AN/ABaidu
6
5 - 7
Anthropic
claude-sonnet-4-6-searchAnthropicProprietary
1221±5
+5 / -5111,959$1.50 / $7.501MAnthropic
7
5 - 11
Google
gemini-3.1-pro-groundingGoogleProprietary
1212±5
+5 / -589,973N/AN/AGoogle
8
7 - 13
Google
gemini-3-pro-groundingGoogleProprietary
1207±5
+5 / -537,255$2 / $12N/AGoogle
9
7 - 14
OpenAI
gpt-5.2-searchOpenAIProprietary
1206±6
+6 / -652,718$0.88 / $7400KOpenAI
10
7 - 14
SpaceXAI
grok-4.20-multi-agent-beta-0309SpaceXAIProprietary
1205±5
+5 / -587,118$1.25 / $2.501MSpaceXAI
11
7 - 14
Anthropic
claude-opus-4-8AnthropicProprietary
1205±6
+6 / -648,610$5 / $251MAnthropic
12
8 - 16
OpenAI
gpt-5.1-searchOpenAIProprietary
1199±5
+5 / -560,019$0.63 / $5400KOpenAI
13
8 - 16
Google
gemini-3-flash-groundingGoogleProprietary
1197±5
+5 / -5125,928N/AN/AGoogle
14
9 - 16
OpenAI
gpt-5.4-searchOpenAIProprietary
1196±5
+5 / -587,364$2.50 / $151.1MOpenAI
15
12 - 17
SpaceXAI
grok-4.20-beta1SpaceXAIProprietary
1189±6
+6 / -653,877N/AN/ASpaceXAI
16
12 - 17
Anthropic
claude-sonnet-5-searchAnthropicProprietary
1188±6
+6 / -617,604$1 / $51MAnthropic
17
15 - 20
Anthropic
claude-opus-4-5-searchAnthropicProprietary
1179±6
+6 / -661,611$5 / $25200KAnthropic
18
17 - 21
OpenAI
gpt-5.2-search-non-reasoningOpenAIProprietary
1173±5
+5 / -575,752$0.88 / $7400KOpenAI
19
17 - 21
SpaceXAI
grok-4-1-fast-searchSpaceXAIProprietary
1171±5
+5 / -581,860$0.20 / $0.502MSpaceXAI
20
17 - 21
SpaceXAI
grok-4-fast-searchSpaceXAIProprietary
1170±4
+4 / -442,981$0.20 / $0.502MSpaceXAI
21
18 - 22
SpaceXAI
grok-4.3SpaceXAIProprietary
1163±5
+5 / -568,373$1.25 / $2.501MSpaceXAI
22
21 - 22
Anthropic
claude-sonnet-4-5-searchAnthropicProprietary
1158±5
+5 / -5105,762$1.50 / $7.501MAnthropic
23
23 - 27
Anthropic
claude-opus-4-1-searchAnthropicProprietary
1148±5
+5 / -577,222$7.50 / $37.50200KAnthropic
24
23 - 27
OpenAI
o3-searchOpenAIProprietary
1143±5
+5 / -520,785$1 / $4200KOpenAI
25
23 - 28
Google
gemini-2.5-pro-groundingGoogleProprietary
1142±5
+5 / -583,608$0.63 / $51MGoogle
显示第 125 条,共 32 条记录
每页显示:
1 / 2

排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。