AI大模型周榜:Kimi K3首次[*]入综合榜Top 10,登顶前端开发榜

发布时间:2026-07-20 19:40

  :它不仅首次[*]入综合榜 Top 10,更直接登顶前端开发榜榜首,在细分能力上实现了对多数海外头部模型的反超。

  综合榜头部位置由 Claude、Meta、谷歌、OpenAI 等厂商的新模型主导,第一名依然由 claude-fable-5 占据,ELO 为 1507 分。Anthropic 旗下多款思考版本模型集中入驻 Top 5,彼此之间分差全部在 15 分以内,在误差范围内属于并列第一梯队。

  代码榜榜首位置发生变动,claude-opus-4-7-thinking 从第 2 位升至第 1 位,ELO 分数为 1553 分,把此前排名第一的 claude-fable-5 挤到第 2 位,后者分数降至 1551 分。两者仅有 2 分的差距,完全在置信区间范围内,属于并列第一梯队。Anthropic 的多款思考模型几乎包揽了榜单前 7 的所有位置,整体统治力依然强劲。

  而国产模型 kimi-k3 首次进入代码榜 Top 10,排名第 10 位,ELO 1529 分,和第 9 名的模型分数仅差 1 分,表现相当接近第一梯队。

  前端开发榜呈现出前所未有的格局,国产模型 kimi-k3 直接以 1679 分的高 ELO 稳居第一名,大幅领先第二名 claude-fable-5 的 1631 分,分差达到 48 分,优势十分明显。

  第四名同样由国产模型 glm-5.2 拿下,ELO 1587 分,超过了多款 Claude、OpenAI 的旗舰模型。这意味着国产大模型在前端开发这一细分场景的能力已经走在了全球最前列。

  智能体榜本周全部是全新入榜模型,排名第一的是 Claude Fable 5 ,净提升度 13.94%,同时拥有 30.65% 的最高好评 / 差评比,工具幻觉率仅 1.33% 属于较低水平。第二名 GPT 5.6 Sol 的可控性数值最高,达到 17.26%。头部三款模型的净提升度差距都明显大于各自的置信区间,属于表现分层的清晰格局。

  国产模型 GLM 5.2 [*]入榜单 Top 10 位列第 9,净提升度为 6.24%,它的 Bash 恢复速度仅 4.45,远好于头部平均水平,命令出错后能快速恢复,表现突出。

  本周 Arena 榜单的最大亮点就是国产模型的多点突破,尤其是 kimi-k3 首次冲进综合榜 Top 10,并且直接登顶前端开发榜,证明国产大模型不仅在通用能力上追平第一梯队,在特定工程类任务场景已经形成了领先优势。同时字节、阿里、智谱等厂商的多款模型也在代码、生图、、智能体多个榜单的前半区站稳脚跟。

  下周预计将有更多用户评测数据进一步积累,部分新入榜模型的排名和分数还可能出现小幅变动,值得关注后续国产模型能否在更多细分榜单拿下榜首位置。

  特别

  拳王邹市明妻子冉莹颖称邹市明拒绝上海户口,说“我是贵州人”;因二人无本地户籍,孩子没学籍,不能报名市运会

  全国学生都“卷中考”,有些地方却取消中考,背后信号太不寻常 #中考 #教育 #民生 #财经

  ✨闪闪小葵花成长记圆满收官! ️浏阳北正西购物中心收官现场才艺、互动、问答精彩不断 ⛳️长沙/衡阳/株洲/浏阳12站巡演落幕,我们下次再会!

排行

精选