AI落地入门:模型厂商互争第一,决策者该听谁的?
你是否碰到过这种场面,每场发布会都拿排行榜宣称自己第一,你对比了三家,结果冒出三个冠军。排行榜能不能信,关键在于你会不会看。第一,关注分项指标,别只盯综合分。综合分高的模型,在你所在的领域未必出色。你做中文客服业务,就该参考中文榜和对话能力榜,而不是去关注数学推理榜。第二,聚焦你所在行业的榜单。通用榜考察综合素养,代码榜考察编程能力,行业榜才真正测试你的业务场景。榜单选错,选出来的模型就匹配不上你的实际需求。第三,留意评测时间。模型每隔几个月就迭代一次,几个月前的榜单已经过时。查看榜单时先确认测试日期。1
88%企业布局AI,仅6%真正变现——七位专家共议人工智能落地实径
"88%的企业在用AI,只有6%靠它赚到了钱"吴吉明的每日科技随笔 (本文基于20269月4日|阅·见科学"轨交筑基・数智未来" 科技创新成果与专家技术交流会内容整理)这个数据来自麦肯锡2023年的统计。念出它的是达索系统大中华区可持续发展首席专家冯升华。高盛说得更直白:AI对美国GDP增长的贡献"基本为零"。不是来砸场子的。这是一个值得追问的问题:为什么人人都在谈论AI,真正靠它产生效益的企业却寥寥无几?九月北京,一场关于轨道交通数字化、智慧运维与绿色算力的技术交流会,没有宏大的口号,七位来自一线的专家
AI运营电商店铺,十次直接倒闭
99.9分是包装出来的,AI开网店会倒闭,护栏按次公开叫卖2026年9月4日 · 周五 · 聊5件事◆ ◆ ◆今天这五件事,都在拆同一件事——AI的「能力认证」。ARC Prize官方称GPT-6 Astra那个99.9%是harness抬上去的,裸分仅63%;阿里和淘天让18个模型运营网店一年,90次评估中10次破产;一家创业公司把「扒光模型护栏」做成了明码标价的生意;纽约市直接禁止K-8学生使用生成式AI;国产端侧算力在同一天集中爆发。还有个小插曲:Meta给你95%折扣,前提是你的每条提示和每次输出
AI 评测榜单,背后或许早已藏猫腻
摘要你是否注意过一个现象:每隔几周,就有一个新大模型宣称「全面碾压、登顶榜首」。但实际用起来,似乎差距并不明显。2026 年 8 月 27 日,Google DeepMind 首次为自家 Gemini 推出了全球首个「双盲评测」方案——本文将揭开榜单「水分」的内在机制,以及普通人怎样避免被误导。图 1:键盘上的手,与屏幕上隐约流动的排行榜你是否察觉到一个怪现象:每隔几周,就有新款大模型宣告「完胜群雄、登顶第一」。然而真正使用时,差距似乎并没有那么大。这并非你一个人的感受偏差。2026 年 8 月 27 日
一文读懂国家人工智能应用中试基地(基础教育方向)
国家人工智能应用中试基地(教育领域基础教育方向)(后文简称“该基地”)是经国家发改委与教育部联合认定的、目前国内基础教育领域唯一的应用型中试平台。该项目由北京国智创科教育科技有限公司承建并运营,借助北京丰富的优质教育资源,着力打造集“AI+教育”中试验证、成果落地转化、示范带动作用于一体的关键平台,同时构建产业生态服务的创新支撑体系。该基地紧抓技术、教育与场景三大要素的深度融合,重点聚焦个性化教学、创新素养培育、思政教育推进以及身心健康发展等关键教育应用场景,搭建起贯穿全流程的中试验证架构,系统推进AI教
GPT-6 Astra震撼发布,AGI评测基准或被误读
9月3日,OpenAI正式揭晓了新一代模型GPT-6 Astra及相关演示视频。该模型名称寓意为「星辰」,官方将其誉为「全球最聪明、最对齐的AI系统」。本次发布采取分批推送策略,最初仅向特定机构开放,随后数日陆续覆盖ChatGPT Plus、Pro、企业及商务用户,并同步登陆OpenAI API与Amazon Bedrock平台。价格调整成为本次更新的焦点。Astra API的输入端定价为每百万token 10美元,输出端则为50美元,较上一代GPT-5.6 Sol涨幅显著。系统还提供Fast模式,最快可
LLM裁判实战:AI评AI的原理、偏置与应对
B1 已介绍完人工评审的关键要素:评估维度、评分锚点、双盲机制、一致性系数 κ。人工评审的核心瓶颈在于效率低和成本高——100 条数据尚可应对,若每周产出 1000 条呢?每次模型迭代都需要重新评估呢?破解之道就是本文重点:LLM-as-Judge,即让大模型担任裁判角色。AI 选型系列 B3 曾借助 RAGAS 实战演示了「AI 评 RAG 答案」的全流程,本文将深入剖析其底层机制、常见偏差及应对策略——同时厘清:何种情形可信赖它,何种情形必须慎用。自动评估为何值得单独成篇?关键在于它是目前唯一能实现「
AI研究范式转变:从模型驱动迈向智能体驱动
基于近五日1281篇文献,对当前人工智能研究前沿格局进行系统性综述发现:智能体(Agentic AI)已成为该领域新兴的组织性范式,约五分之一文章直接聚焦于智能体;研究重心正从单一模型能力转向模型与执行框架(harness)的双组件系统,并围绕推理时计算、检索增强、多模态执行、世界模型、安全治理、评测效度、效率系统与领域应用形成相互耦合的多个主题板块。本文梳理各主题的核心进展、代表性工作及其内在逻辑关系,提出"能力底座—智能体范式—领域应用"纵向传导、"安全治理与评测"双向约束、"效率系统"横向支撑的生态
AI能写代码,为何还要证明自己?
AI已经能编写代码,可为什么还得接受证明?让AI写几行代码,早就不再新鲜。真正困难的是把它放进包含大量文件、接口和依赖的真实项目后,还能说明“写出来的东西确实达到要求”。UC Berkeley等机构近日推出Vero基准,专门考察这种能力。它把任务置于Lean 4形式化环境中,要求智能体在仓库层面完成两个步骤:先写出实现,再为该实现生成机器可以核验的证明。项目涵盖43个多模块实例,包含743个API和2705条形式化规范,并涉及加密协议、分布式系统等场景。这样的设计看似有些苛刻,却比一段精彩的演示更接近我们
通用人工智能时代,智能体评测如何发展?
8月31日,全国信息技术标准化技术委员会人工智能分委会与上海市人工智能行业协会联手,在上海举办了《人工智能 智能体互联》系列国家标准应用(长三角区域)推广专题会。本次会议重点对GB/Z 185《人工智能 智能体互联》系列标准进行了深入解读与宣贯。作为国内首个覆盖智能体全生命周期的互联标准体系,该系列包含总体架构、身份码、身份管理、能力描述、跨域发现、协同交互及工具调用等七大核心标准。中国电子技术标准化研究院副院长范科峰、工信部科技司科技发展处处长王正、上海市经信委人工智能发展处副处长王鑫、上海市人工智能行
OpenAI万字深度揭秘:大模型为何沦为“满嘴跑火车”的赌徒?全因人类评测逼的!
你一定经历过这种令人崩溃的瞬间:你虔诚地向AI请教一个非常严肃的疑问。 它秒回答案,而且旁征博引、用词讲究、语气相当笃定。可是,当你顺着它给的线索去核实,却发现文献是杜撰的、数据是胡诌的、连历史事件都是凭空捏造的!大模型为何宁愿信口雌黄,也死活不肯坦坦荡荡地说一句“不清楚”?▲ OpenAI与佐治亚理工学院联合发布论文《Why Language Models Hallucinate》OpenAI 与佐治亚理工学院的学者于 2025 年 9 月推出论文《Why Language Models Halluci
AI前沿日报|8月28日 智谱GLM激活参数减半引轰动
今日聚焦两条核心线索:本土算力崛起与模型评测的可信性议题。智谱将新发布的模型激活参数量削减约一半,依托十万张国产芯片集群的算力支撑,在基准测试中实现对DeepSeek的反超;与此同时,DeepMind为模型评估流程引入密码学保障机制。机器人训练数据生成与AI基础设施两条支线也在同步演进。8月26日,智谱正式推出并开源GLM-5.3-Flash模型。该模型的规格参数颇为反直觉:总参数量达320B,但激活参数由GLM-4.5的32B压缩至18B,网络层数从92层缩减至45层——以近乎减半的激活参数量,换取了更
金融方向AI训练师招募
【远程线上】TalentsAI AI训练岗位招聘TalentsAI 为顶尖大模型实验室输送专业级数据,现面向计算机、医疗、自然科学、金融等领域广纳行业人才,参与深度学科校验及高质量多轮对话任务,涵盖指令对齐、Rubrics、HLE、RLHF、VLM、长文本解析等方向。【岗位要求】1、对人工智能、大语言模型、数据标注及模型评测方向有浓厚兴趣者2、具备金融、经济、数学、法律、医学、计算机、物理等专业背景(毕业于211、985院校或QS前100高校者优先),硕士、博士研究生学历,或拥有相关实习、科研、竞赛经历及
荣耀Robot Phone海外实测获赞,李健:将扩产提速保障交付
新浪科技8月27日夜间报道,自荣耀Robot Phone于8月12日正式亮相以来,陆续有海外媒体刊出实测体验内容,对这款国产机型在外观形态及硬件层面的突破给予了积极评价。荣耀CEO李健通过微博回应称,Robot Phone的市场反响远超预期,公司将持续扩充产能,争取早日完成产品交付。8月12日,荣耀面向全球推出业内首款机器人手机Robot Phone,起售价9999元。荣耀官方公布的数据显示,截至发布会结束,Robot Phone在全部销售渠道的预订总量已突破40万台,首销3分钟内电商平台即告售罄,全国范
小米澎湃OS 4 深度评测:设计质感与AI能力的全面进化
历经三代版本的更迭,小米澎湃 OS 完成了从无到有的构建。第一代打破了安卓的旧有框架,构建了人车家生态的统一底座;第二代优化了内核调度,提升了资源分配效率;第三代完善了编译与渲染,奠定了流畅的基础。而小米澎湃 OS 4 则带来了三项底层技术革新和 AI 能力的全面升级。 亲身体验后,我认为主要体现在四个方面:视觉设计终于具备了主流水准,质感与动画效果媲美 iOS;运行流畅度显著提升,特别是全链路的动画过渡非常丝滑;超级小爱输入法的表现超出预期,足以替代第三方输入法;全面增强的 AI 功能赋予了系统主动服务