AI 挑战高考:分数咬紧,短板仍存
AI 也去参加了高考?今年高考结束后,公众号「数字生命卡兹克」组织了 12 款主流 AI 共同应试语文与数学,并邀请教师进行盲评。最终,MiMo 以 256.3 分位居榜首,Kimi 以 256.29 分紧随其后,两者分差仅为 0.01 分。从单科成绩来看,GLM 与 Gemini 在语文科目中并列第一,而 DeepSeek、MiMo 及 ERNIE 则在数学科目中共同夺魁。这一结果既展示了 AI 的强大实力,也揭示了其明显的局限性。在数学方面,AI 善于审题、拆解条件及推导步骤;而在语文方面,特别是作文
AI 榜单僵局:Claude 继续霸榜前四
Arena 排行榜 · 2026.06.01继上周发布「前四名皆被 Claude 占据」的报道后,本周再次查看 Arena 文本榜单,发现前四席位依旧由 Claude 牢牢把控,分数波动微乎其微。1502、1500、1498、1494,冠亚季殿军悉数落入 Anthropic 囊中。总投票数已从 629 万攀升至 653 万,参评模型数量维持在 360 个。简而言之,头部阵营格局已定,变动仅体现于第 8 至 12 名的细微位次更替,以及部分模型分数 ±1~2 分的轻微调整。与 5 月 25 日的榜单相比,前
全球AI模型排名揭晓:阿里千问表现亮眼,GPT5.4不敌新秀
全球知名的大模型评测平台LMArena近日更新了最新榜单,其中阿里巴巴推出的千问模型预览版Qwen3.5-Max-Preview首次参评即获得1464分,不仅超越了GPT5.4、Grok4.1等国际主流模型,还领先于所有国内主要大模型,包括豆包2.0、GLM5、Kimi2.5等。有传言称,Qwen3.5-Max正式版即将发布,其性能有望进一步提升。此外,LMArena根据各公司最强模型对全球大模型机构进行综合评估,结果显示,中国共有5家企业进入前十,其中阿里位居全球前五,位列中国第一,字节跳动、智谱、月之