整体榜单中 Anthropic 旗下多款 Claude 新模型集中入榜,头部梯队集中在 1500 分区间,国产模型在多个细分赛道持续实现突破,不少模型进入对应榜单的头部序列,整体竞争力稳步提升。
本期最大亮点是国产模型 kimi-k3 排名上升 2 位来到第 8 名,以 1530 分跻身代码榜 Top 10,与周边头部模型的分差也在 30 分的统计误差范围内,完全具备第一梯队的竞争力。
前端开发榜迎来历史性突破,国产模型 kimi-k3 以 1682 分卫冕榜首位置,超过了此前排名第一的 claude-opus-5-high,成为全球当前前端开发能力最强的大模型。
前 4 名之外的模型分数差距开始拉开,智谱的 glm-5.2 也进入了第 5 名,继续扩大国产模型在前端开发赛道的优势。
国产模型 kimi-k3 排名第 4,净提升度 9.71%,其任务确认成功率达到了 14.0%,是榜单所有头部模型中最高的表现,任务完成反馈表现突出。
AI 榜方面,谷歌 gemini-omni-flash 守住榜首,字节跳动 dreamina-seedance-2.0-720p 排在第 2 名,阿里 happyhorse-1.0 排在第 4 名,国产模型直接占据了前 4 名中的两个席位,后续字节跳动、阿里、MiniMax 的多款模型也分布在榜单中下游,形成了完整的国产模型梯队,竞争力处于全球第一梯队。
整体来看,本周 Arena 榜单最大的突破来自国产模型在前端开发赛道登顶,kimi-k3 同时在代码榜和智能体榜进入头部序列,体现出国产模型在工程开发、智能体实际应用场景的快速进步。Anthropic 大量新模型集中入榜后,头部竞争的胶着程度进一步提升,后续几周的分数和排名变化值得持续关注。
特别
台风过后,广东惠州一海滩惊现大量金鲳鱼,市民纷纷“自助打包”,当事人:捡了100多斤,吃不完已转赠亲友,晚上兴奋到睡不着
1891年,16岁的张作霖落难乞讨,孙寡妇看中了他,解开衣扣,拿出一块腰牌:你拿着,方便出入后院 这一举动成就了一代东北枭雄
震惊!曲婉婷患癌,有网友开直播拉横幅放鞭炮,其母多年前涉案贪腐3.5亿,私吞500多名下岗工人安置费










