Arena Mirror (China)

AI 大模型资讯

新模型发布解读、评测速览与榜单变化分析

DeepSeek V4 Pro 正式版深度解析:工程闭环跃升、榜单性能对齐与中美 AI 商业化分水岭
2026-08-16

DeepSeek V4 Pro 正式版深度解析:工程闭环跃升、榜单性能对齐与中美 AI 商业化分水岭

历经四个月的技术沉淀,DeepSeek V4 Pro 正式版全面上线。本文结合 LMSYS Arena 与 Artificial Analysis 最新榜单实测,深度剖析其从“长文本阅读器”向“独立交付工程师”的工程跃迁(DeepSWE 62.7、思考强度分级控制与原生 Responses API)、与头部中端旗舰的性能对齐与价格对比,并从全球 AI 营收走势与中美商业模式切入,透视其动态峰谷计费与 Harness 基础设施战略背后的商业逻辑。

Gemini 3.7 Flash 上线与 3.5 Pro 难产之谜:榜单实测、人事地震与 Gemini 4 决战
2026-08-14

Gemini 3.7 Flash 上线与 3.5 Pro 难产之谜:榜单实测、人事地震与 Gemini 4 决战

Google 在推出 3.6 Flash 仅三周后火速上线 Gemini 3.7 Flash,而原定 6 月推送的旗舰 3.5 Pro 至今依然跳票。本文结合 LMSYS 与 Artificial Analysis 最新榜单实测,深度剖析 Pro 难产背后的技术瓶颈、高层人事海啸与全力押注 Gemini 4 的战时转型。

MiniMax H3 发布:视频编辑双榜第一,原生音画同步 + 33B 权重开放
2026-08-13

MiniMax H3 发布:视频编辑双榜第一,原生音画同步 + 33B 权重开放

MiniMax 在 WAIC 之后发布旗舰视频生成大模型 MiniMax H3(海螺 Hailuo 3):Arena 图生视频、视频编辑双榜第一,Artificial Analysis 视频编辑同样登顶,33B 基础模型权重开放。

Grok 4.6 发布:Arena 前端开发榜第 5,Agent 成本更低
2026-08-13

Grok 4.6 发布:Arena 前端开发榜第 5,Agent 成本更低

Grok 4.6 在 Arena 前端开发榜单排名第 5,在 Artificial Analysis Intelligence Index 得分 61;更值得关注的是它在 Agent 任务中的 Token 消耗与调用成本。

Arena 榜单:Qwen3.8-Max 前端开发超越 Claude Fable 5,登顶全球第 4
2026-08-05

Arena 榜单:Qwen3.8-Max 前端开发超越 Claude Fable 5,登顶全球第 4

阿里巴巴发布 2.4T 参数的 Qwen3.8-Max,在 Arena 前端开发榜单登上全球第四,超越 Claude Fable 5,并将于 8 月中旬开源模型权重。