数据同步时间: 2026-08-17 18:13:43
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分 | ||||||
|---|---|---|---|---|---|---|---|---|
1 | claude-opus-5-highAnthropic • Proprietary | 1520±15 | ||||||
2 | claude-opus-4-6Anthropic • Proprietary | 1510±6 | ||||||
3 | claude-opus-4-6-highAnthropic • Proprietary | 1506±7 | ||||||
4 | claude-fable-5Anthropic • Proprietary | 1504±9 | ||||||
5 | claude-opus-4-7Anthropic • Proprietary | 1498±7 | ||||||
6 | claude-opus-4-7-highAnthropic • Proprietary | 1497±7 | ||||||
7 | gpt-5.5-highOpenAI • Proprietary | 1485±7 | ||||||
8 | claude-sonnet-4-6Anthropic • Proprietary | 1483±6 | ||||||
9 | gpt-5.5OpenAI • Proprietary | 1480±7 | ||||||
10 | gpt-5.6-terra-xhighOpenAI • Proprietary | 1479±13 | ||||||
11 | gpt-5.6-sol-xhighOpenAI • Proprietary | 1479±17 | ||||||
12 | claude-opus-4-8-highAnthropic • Proprietary | 1475±8 | ||||||
13 | muse-spark-1.1Meta • Proprietary | 1472±13 | ||||||
14 | claude-sonnet-5-highAnthropic • Proprietary | 1470±10 | ||||||
15 | gpt-5.4OpenAI • Proprietary | 1470±7 | ||||||
16 | claude-opus-4-8Anthropic • Proprietary | 1469±8 | ||||||
17 | gemini-3.5-flash-highGoogle • Proprietary | 1465±15 | ||||||
18 | gemini-3.5-flash-mediumGoogle • Proprietary | 1465±10 | ||||||
19 | gpt-5.6-luna-xhighOpenAI • Proprietary | 1462±13 | ||||||
20 | claude-opus-4-5-20251101Anthropic • Proprietary | 1462±10 | ||||||
21 | grok-4.5SpaceXAI • Proprietary | 1454±12 | ||||||
22 | kimi-k2.6Moonshot • Open | 1451±8 | ||||||
23 | claude-sonnet-4-5-20250929Anthropic • Proprietary | 1446±7 | ||||||
24 | gemini-3.1-pro-previewGoogle • Proprietary | 1445±6 | ||||||
25 | muse-sparkMeta • Proprietary | 1443±18 | ||||||
显示第 1 到 25 条,共 39 条记录
每页显示:
1 / 2
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。