数据同步时间: 2026-08-17 18:13:43
排名 | 模型 | Elo 评分 Arena Elo 评分:基于用户盲测两两对决的胜负关系估算出的模型综合能力评分 | ||||
|---|---|---|---|---|---|---|
1 | gpt-image-2 (medium)OpenAI • Proprietary | 1463±4 | ||||
2 | grok-imagine-image-2.0 (low)SpaceXAI • Proprietary | 1439±8 | ||||
3 | muse-imageMeta • Proprietary | 1405±6 | ||||
4 | mai-image-2.5Microsoft AI • Proprietary | 1402±4 | ||||
5 | seedream-5.0-proBytedance • Proprietary | 1393±4 | ||||
6 | chatgpt-image-latest-high-fidelity (20251216)OpenAI • Proprietary | 1390±3 | ||||
7 | grok-imagine-image-quality (20260519)SpaceXAI • Proprietary | 1390±6 | ||||
8 | gemini-3-pro-image-2k (nano-banana-pro)Google • Proprietary | 1389±3 | ||||
9 | gemini-3-pro-image-preview (nano-banana-pro)Google • Proprietary | 1385±3 | ||||
10 | gemini-3.1-flash-image (nano-banana-2) [web-search]Google • Proprietary | 1385±4 | ||||
11 | reve-2.1Reve • Proprietary | 1374±6 | ||||
12 | gpt-image-1.5-high-fidelityOpenAI • Proprietary | 1370±3 | ||||
13 | grok-imagine-image-qualitySpaceXAI • Proprietary | 1362±4 | ||||
14 | reve-2.0Reve • Proprietary | 1358±7 | ||||
15 | uni-1.1-maxLuma AI • Proprietary | 1334±5 | ||||
16 | grok-imagine-imageSpaceXAI • Proprietary | 1330±3 | ||||
17 | gemini-3.1-flash-lite-image (nano-banana-2-lite)Google • Proprietary | 1314±5 | ||||
18 | uni-1.1Luma AI • Proprietary | 1312±4 | ||||
19 | qwen-image-2.0-pro-2026-06-22Alibaba • Proprietary | 1303±5 | ||||
20 | hunyuan-image-3.0-instructTencent • Open | 1302±3 | ||||
21 | wan2.7-image-proAlibaba • Proprietary | 1302±4 | ||||
22 | wan2.7-imageAlibaba • Proprietary | 1301±4 | ||||
23 | seedream-4.5Bytedance • Proprietary | 1301±2 | ||||
24 | gemini-2.5-flash-image-preview (nano-banana)Google • Proprietary | 1294±2 | ||||
25 | seedream-5.0-liteBytedance • Proprietary | 1293±3 | ||||
显示第 1 到 25 条,共 53 条记录
每页显示:
1 / 3
排名计算方法: 系统利用在竞技场中收集到的海量双盲人类盲测对抗数据,构建 Bradley-Terry 模型以极大似然估计模型在各个单项分类下的 Elo 相对竞技值。95% 置信区间 (CI) 表明当误差区间发生重叠时,模型的真实相对实力可能不存在统计学上的显著性差异。