国产模型亮眼表现,多新模型入榜

发布时间:2026-09-02 17:23

  Arena平台发布 2026 年第 35 周AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。

  注:本榜单基于 Arena平台匿名盲测投票,通过 ELO计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

  本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 1 位以内,ELO 分差均在 30 分以内,属于统计误差范围内的接近。

  本周前端开发榜迎来重大变化,阿里新模型 Qwen3.8-max-0902 首次入榜即直接登顶,以 1691 分夺得榜首,将此前的 Claude-Opus-5-Max 挤到第二。

  本周智能体榜头部格局基本稳定,Anthropic 模型依然占据前三,Claude Opus 5 以 13.74% 的净提升度蝉联第一,工具幻觉率仅 0.8%,为头部模型中最低。值得关注的是智谱 GLM 5.2 排名大幅提升 7 位,来到第 10 名,净提升度 6.23%,任务确认成功率达到 8.65%,表现亮眼。

  总结来看,本周 Arena 周榜最大看点是多款国产新模型集中亮相并取得优异排名,glm-5.3-flash 在代码榜闯入 Top 10,qwen3.8-max-0902 更是直接登顶前端开发榜,显示国产模型在代码开发领域持续进步。头部依然是 Anthropic 模型垄断综合和代码榜,但国产模型在细分领域已经能冲击榜首位置,后续更多国产新模型的表现值得继续关注。

排行

精选