智谱发布GLM-5.3:开源编程模型逼近顶尖水平
8月14日,智谱(2513.HK)推出了GLM-5.3。虽然基础架构保持不变,但通过极致的后训练扩展,显著提升了模型的智能上限:长程任务环境增加了数十倍,环境类型更加丰富,后训练时间显著延长。智谱声称,在多个主流基准测试中,GLM-5.3是目前排名最高的开源模型,其编程和智能体能力已接近Claude Fable 5,编程体验超越其他国产模型。 智谱指出,与上一代相比,GLM-5.3的新增亮点包括:卓越的编程技能、网络安全能力、后训练扩展以及开源特性。 据智谱介绍,在Terminal-Bench 3.0(评
AI浪潮下,如何避免被时代抛弃
倘若你还觉得在AI竞争里胜出的核心要素是编程能力,那说明你已然败北了。这恰恰反映出你既不清楚这个行业的运行机制,也不明白行业从业者真正在应对哪些挑战。我近期对勇哥的视频片段痴迷不已——勇哥是位餐饮领域的自媒体创作者,主要为人们剖析餐饮经营里的各类难题,比如生意惨淡、菜品挑选之类的。你会看到从餐厅的地址抉择、加盟的品牌挑选,到菜单的定价规划、宣传的方案制定,都左右着餐厅的运营成效。而多数顾客在意的口味与服务,跟上述这些要素相比,对餐厅存亡的作用简直微不足道。说到底,决定这门生意能否长久维系的核心要素其实是人
Qwen3.8-Max登陆阿里千问AI平台,API与Token Plan同步上线
Qwen3.8总参数量2.4万亿,在编程(Coding)和专业协作(Cowork)方面能力大幅提升,整体性能处于全球大模型前列。得益于模型架构、后训练方案和软硬一体化的协同创新,Qwen3.8在实际推理中能以更快的速度产出智能,可以独立自主编程16天,全程稳定可靠。目前,Qwen3.8-Max的API服务已首发上线千问AI平台,全球开发者可直接调用,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,而输入与输出的国际价格仅为Opus5的40%与24%,实现相近智能更高性价比。在构建Co
榜单成绩亮眼、实际表现拉胯:2026年的AI评测,我劝你别全信
AI 观点 · 热议▲ 榜单上门门 A+,一到干活就「原地社死」你肯定见过这种场景:某个新模型一发布,朋友圈全是「刷新 SOTA」「屠榜」「碾压一切」的截图,气势汹汹。结果你兴冲冲打开一用——嗯,看着挺聪明,干活总差那么一口气。别怀疑自己,也别怀疑人生。真不是你的错觉——2026 年,AI 榜单的水分正在被一个个当场拧出来。今天我把几件最有意思的「翻车现场」讲给你听。先说编程界最出名的考试SWE-bench Verified(让 AI 去修真实的 GitHub bug)。搁一年半前,谁能考过 50% 都能
谷歌Gemini 3.5 Pro发布延期 编程能力提升遇瓶颈
据内部消息,谷歌(353.81, -16.40, -4.43%)旗下顶尖AI模型Gemini 3.5 Pro的推出时间已比原定计划延后数月,原因是公司正投入更多资源强化模型性能,特别是代码编写能力。 十名在职及离职员工披露,Gemini 3.5 Pro的推迟发布引发了谷歌工程师、AI科研人员和管理层的忧虑,他们担心随着Anthropic和OpenAI接连推出性能更优的模型,谷歌或将丧失市场领先地位。 上述消息人士指出,谷歌在模型面市前需通过多方利益相关者审核,同时要将AI功能融入搜索、地图和YouTube
GPT-5.6震撼登场:性能碾压Claude,成本低至对手十六分之一
OpenAI正式推出GPT-5.6系列模型,以更低的成本实现更卓越的性能,向AI行业的竞争格局释放出强烈信号。 本次发布涵盖三款型号:旗舰级的Sol、均衡型的Terra以及主打高性价比的Luna,即日起通过ChatGPT、Codex及OpenAI API面向全球用户开放。 就定价策略而言,Sol每百万输入/输出token收费5美元/30美元,Terra为2.50美元/15美元,Luna则为1美元/6美元。 OpenAI强调,GPT-5.6在多项关键基准测试中表现优于Anthropic旗下的Claude F
AI时代来临,我的工作还安全吗?
## 深夜辗转 夜半时分,久久未能入眠。说不清是白天工位旁那杯咖啡的缘故,还是下班后小酌了几杯,又或许是切身感受到 AI 正在一点点逼近我的岗位,这种难以言喻的情绪。直到凌晨时分,人反而格外清醒,思绪也异常活跃。 --- ## 零基础小白的 AI 初体验 最近这些天,下班回家后我一直在琢磨怎么借助 Hermes 处理事务。对于一个完全不懂编程的人来说,每一次运行出的结果都让我倍感惊喜。而这一切,我才刚刚起步。 我想把这份体会记录下来。 --- ## 当 AI 拥有记忆,便有了"温度" 一旦
国产编程大模型对比:小米MiMo-V2.5-Pro性价比突出 成开发降本首选
快科技7月6日消息,SuperCLUE于今日发布终端编程工具中文软件工程测评,将主流国产大模型的编程成绩与使用成本整合为对比图表,清晰呈现各家综合实力。该图表划分为四个象限,横轴表示单题平均开销,纵轴为编程任务综合得分。四个区域各自对应不同的模型定位,其中高分低价的超值领航者综合表现最为强劲,而高价低分的溢价探索者使用体验相对平庸。小米MiMo-V2.5-Pro被归入经济适用者区间,编程总分为49.47分,单题成本仅0.22元,是全部参评模型中单价最低的一款。在同等预算条件下能够完成更多编程任务,基础代码
AI专业还能冲吗?别被名字骗了
2026年高考志愿填报即将开启,人工智能相关专业已连续三年成为热门报考方向。近年来,开设AI专业的高校持续增加,具身智能、脑机科学等新兴方向陆续登场;就业市场却两极分化:大厂AI岗薪资仍具吸引力,但竞争日益激烈。对高考生而言,这是一次关键选择:作为AI在读生,我想说:AI的红利仍在,但已不再是“选了就能高薪”的被动红利。如今这条赛道更像:高回报、高波动、高自律要求的专业。能否受益,不取决于你专业名称是否含“人工智能”,而在于大学几年是否真正打磨了数学、编程、项目、表达与探索能力。很多人报考前幻想的大学生活
禁令挡不住:中国AI新星U2强势崛起
又封禁了,又他X的封禁了。美国人工智能公司Anthropic旗下两款最新大模型Fable和Mythos对外国公民实施全面封锁访问权限,甚至连公司的外籍员工都被拒之门外……你封你的,我们干我们的。1中国AI惊艳亮相一边是美国AI闭门造车,另一边,中国AI惊艳亮相。"港股AGI第一股"云知声在本月早些时候推出了其最新通用大语言模型U2。一经问世便登顶巅峰。基于快慢思维融合的MoE(混合专家)范式打造,与大多数同行堆砌参数、堆砌Token的路径截然有异,从而达成了"小参数强能力、少Token高产出、低算力低成本
AI爆发前夜,他用10亿告诉你该从哪里下手
假设今天,AI能帮你完成一个需要一小时的任务。六个月后,它能完成两小时的。五年后,85天的。十年后——239年的。Marc Warner说,这不是预测,是现实。至少在写代码这件事上,AI就在沿着这条曲线走。研究数据也印证了这一点:AI能独立完成的编程任务难度,每七个月翻一倍。他有资格这么说。2014年,他在哈佛做量子物理研究,那时候大多数同行连"AI"这个词都不愿意提——说出口会被嘲笑,因为这个词已经被过度炒作又烂掉了。他的老同学Demis Hassabis正在伦敦做一家叫DeepMind的AI公司,没多
AI专业成热门赛道,普通家庭的孩子该不该报志愿?|高考选专业系列(1)
打开志愿填报表,许多家长首先会被"人工智能"这几个字吸引目光。听起来很新潮,听起来待遇优厚,听起来代表未来趋势。但越是受关注的专业,越不能仅凭名称做决定。先表明我的观点:人工智能专业值得关注,但普通学生不能盲目跟进。它更适合那些数学功底扎实、乐于编写代码、能够坚持自主学习、所在院校具备AI教学实力和项目资源的学生。如果仅仅因为"AI很热门",但孩子对数学、调试程序、长时间伏案解决问题感到抵触,那么这个看似光鲜的专业名称,可能成为大学四年的负担。许多人对人工智能专业的认知停留在"会用ChatGPT、掌握几个
从OpenRouter排名看中美AI实力:规模与技术的错位竞争
要了解当前大模型的发展态势,OpenRouter 的 AI Model Rankings 排名是一个很有价值的参考依据。为什么选择 OpenRouter?它本质上是一个模型聚合平台,用户只需一次性充值,就能通过单一接口调用超过三百个不同的模型,包括 DeepSeek、Claude、Gemini、GPT 等主流产品可随意切换。该平台掌握着真实的调用统计数据,了解市场的实际使用情况,而非各厂商自行披露的测试分数。这种来自第三方的数据非常稀缺,因此其排名常被视为全球大模型发展的重要参考。根据 2026 年 6
AI自主进化:Anthropic揭秘代码自我生成真相
Anthropic发布了一篇深度长文,标题引人深思——《AI开始自我迭代》。参考链接:https://www.anthropic.com/institute/recursive-self-improvement建议大家别去啃原文,太枯燥,万字长文全是图表和枯燥数据。但这事儿太关键了。我替大家梳理了核心数据和结论,用通俗易懂的语言总结如下。这是截至2026年5月,Claude在Anthropic代码库中编写的代码占比。不是写草稿,不是提建议,也不是说“你可以这么改”。而是真正写入生产环境的代码,其中80%由
AI 资讯速递:RSI逼近与超级智能加速
快讯:6月5日,安全机构 Anthropic 发布长文,正式抛出“递归自我改进”概念。报告披露,至5月,Anthropic 内部超过 80% 的代码已由旗下 AI 模型 Claude 自主完成,工程师人均代码产出激增 8 倍,模型甚至能连续工作超 16 小时。基于这些数据,Anthropic 大胆预测:若趋势持续,AI 自主设计并构建下一代系统将很快成为现实,呼吁减缓或暂停相关研究。OpenAI Yann Dubois 则提出不同观点,认为 AI 能力提升呈线性,非离散跳跃。关注点:这是全球首份基于研发数