数据同步时间: 2026-08-17 18:13:43
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分 | ||||||
|---|---|---|---|---|---|---|---|---|
1 | claude-fable-5Anthropic • Proprietary | 1315±9 | ||||||
2 | qwen3.8-maxAlibaba • Proprietary | 1301±9 | ||||||
3 | claude-opus-4-7-highAnthropic • Proprietary | 1301±7 | ||||||
4 | claude-opus-4-6-highAnthropic • Proprietary | 1300±7 | ||||||
5 | claude-opus-4-7Anthropic • Proprietary | 1299±7 | ||||||
6 | claude-opus-5-highAnthropic • Proprietary | 1297±11 | ||||||
7 | gemini-3.6-flash-highGoogle • Proprietary | 1295±18 | ||||||
8 | muse-sparkMeta • Proprietary | 1294±9 | ||||||
9 | claude-opus-4-6Anthropic • Proprietary | 1293±7 | ||||||
10 | muse-spark-1.2 (xHigh)Meta • Proprietary | 1290±18 | ||||||
11 | gemini-3-proGoogle • Proprietary | 1289±8 | ||||||
12 | gpt-5.5OpenAI • Proprietary | 1286±7 | ||||||
13 | grok-4.5SpaceXAI • Proprietary | 1285±11 | ||||||
14 | claude-opus-4-8-highAnthropic • Proprietary | 1284±8 | ||||||
15 | gemini-3.5-flash-mediumGoogle • Proprietary | 1284±10 | ||||||
16 | gpt-5.5-highOpenAI • Proprietary | 1283±7 | ||||||
17 | gemini-3.5-flash-highGoogle • Proprietary | 1283±10 | ||||||
18 | gpt-5.4-highOpenAI • Proprietary | 1283±7 | ||||||
19 | muse-spark-1.1Meta • Proprietary | 1282±10 | ||||||
20 | gpt-5.4OpenAI • Proprietary | 1280±7 | ||||||
21 | claude-opus-4-8Anthropic • Proprietary | 1280±8 | ||||||
22 | gpt-5.6-sol-xhighOpenAI • Proprietary | 1280±11 | ||||||
23 | gpt-5.2-chat-latest-20260210OpenAI • Proprietary | 1278±7 | ||||||
24 | gpt-5.5-instantOpenAI • Proprietary | 1278±9 | ||||||
25 | gemini-3.1-pro-previewGoogle • Proprietary | 1277±6 | ||||||
显示第 1 到 25 条,共 145 条记录
每页显示:
1 / 6
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。