数据同步时间: 2026-08-17 18:13:43
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分 | ||||||
|---|---|---|---|---|---|---|---|---|
1 | claude-opus-4-6-searchAnthropic • Proprietary | 1253±5 | ||||||
2 | gpt-5.5-searchOpenAI • Proprietary | 1240±5 | ||||||
3 | claude-fable-5Anthropic • Proprietary | 1237±8 | ||||||
4 | claude-opus-4-7Anthropic • Proprietary | 1233±5 | ||||||
5 | ernie-5.1Baidu • Proprietary | 1226±10 | ||||||
6 | claude-sonnet-4-6-searchAnthropic • Proprietary | 1221±5 | ||||||
7 | gemini-3.1-pro-groundingGoogle • Proprietary | 1212±5 | ||||||
8 | gemini-3-pro-groundingGoogle • Proprietary | 1207±5 | ||||||
9 | gpt-5.2-searchOpenAI • Proprietary | 1206±6 | ||||||
10 | grok-4.20-multi-agent-beta-0309SpaceXAI • Proprietary | 1205±5 | ||||||
11 | claude-opus-4-8Anthropic • Proprietary | 1205±6 | ||||||
12 | gpt-5.1-searchOpenAI • Proprietary | 1199±5 | ||||||
13 | gemini-3-flash-groundingGoogle • Proprietary | 1197±5 | ||||||
14 | gpt-5.4-searchOpenAI • Proprietary | 1196±5 | ||||||
15 | grok-4.20-beta1SpaceXAI • Proprietary | 1189±6 | ||||||
16 | claude-sonnet-5-searchAnthropic • Proprietary | 1188±6 | ||||||
17 | claude-opus-4-5-searchAnthropic • Proprietary | 1179±6 | ||||||
18 | gpt-5.2-search-non-reasoningOpenAI • Proprietary | 1173±5 | ||||||
19 | grok-4-1-fast-searchSpaceXAI • Proprietary | 1171±5 | ||||||
20 | grok-4-fast-searchSpaceXAI • Proprietary | 1170±4 | ||||||
21 | grok-4.3SpaceXAI • Proprietary | 1163±5 | ||||||
22 | claude-sonnet-4-5-searchAnthropic • Proprietary | 1158±5 | ||||||
23 | claude-opus-4-1-searchAnthropic • Proprietary | 1148±5 | ||||||
24 | o3-searchOpenAI • Proprietary | 1143±5 | ||||||
25 | gemini-2.5-pro-groundingGoogle • Proprietary | 1142±5 | ||||||
显示第 1 到 25 条,共 32 条记录
每页显示:
1 / 2
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。