Kimi K3爆火致算力告急,新用户订阅暂停
界面新闻记者 | 查沁君 界面新闻编辑 | 文姝琪 因需求激增,Kimi K3发布不足一周,月之暗面便紧急暂停新用户注册。 7月19日晚,月之暗面宣布,受算力资源限制,暂时关闭新用户订阅通道,优先保障现有用户的稳定服务。 7月20日,月之暗面向界面新闻回应称,此次调整仅限新用户接入,老用户权益不受影响,原有套餐继续有效,自动续费功能正常运行。 针对此前手动关闭自动续费的老用户,公司将逐步恢复续订选项,套餐升级功能也将陆续开放;新套餐因算力不足暂未上线,具体恢复时间尚未公布。 从官方表态看,此举实为在有限资
京东健康在WAIC 2026展示全场景医疗AI,携手上海AI实验室制定评测标准
新浪科技讯 7月20日上午消息,7月17日至20日,2026世界人工智能大会(WAIC)于上海举行。京东健康携其前沿医疗AI技术参展,并推出“确定性源于执行”核心理念与JoyAI-MedCode(京医千询)代码化推理的重大更新;同时,京东健康还与上海人工智能实验室合作共建MedBench v5.0行业评测基准,其AI医生“大为”和“京东知医”两款产品也一同亮相展示。 在论坛上,京东健康正式宣布京医千询核心推理引擎JoyAI-MedCode v2.0的显著升级,推动医疗AI从传统“自然语言推理”向“代码可验
AI 原生时代:创始人如何化身 1000 倍效能工程师
一位前谷歌资深工程师指出:当下使用 AI 编程代理的开发者,其产出效率是仅靠 Cursor 或聊天框操作者的 10 至 100 倍;而在 Anthropic 内部,工程师的效能已堪比 2005 年谷歌工程师的 1000 倍。YC 总裁 Garry Tan 与合伙人 Diana Hu 近期重返斯坦福 CS153 课程,带来一场核心主题明确的讲座:在 AI 原生企业中,创始人如何蜕变为 1000 倍效能的工程师。Diana 坦言听到这一数字后深感震撼,随即打开 Claude Code 亲自测试,结果竟生成了约
上海推出首个疑难病例AI诊疗评测标准
7月18日,2026世界人工智能大会医学分论坛于上海徐汇西岸启幕。会上,上海推出了行业首份针对疑难病例的AI诊疗评测标准,涵盖30个临床专科,旨在验证医疗大模型应对复杂病例的实际水平。此外,现有的医疗AI评测系统升级至5.0版本,引入了“原子技能”评估机制,有助于修正AI模型可能产生的虚假内容。基础设施层面,上海市卫生健康行业算力服务中心宣告成立,构建了涵盖算力提供、数据合成、模型训练及智能应用的全流程生态。据预测,至2026年末,上海医疗健康语料库容量将突破2PB,数据筹备时间有望缩减六成以上。论坛还推
智能英语考试系统的技术架构与实现
从“AI教学系统”转向“AI考试系统”,系统工程的底座和逻辑需要发生根本性转变。教学系统追求的是“包容、启发和循序渐进”;而考试系统追求的是“绝对的公平、严谨、防作弊以及高并发的稳定性”。在不依赖图表和具体词汇教学内容的前提下,AI英语考试系统的核心架构应当由以下四大硬核底层模块构成:传统的考试是一套试卷考所有人,而AI考试系统通常采用计算机自适应测验 (CAT)逻辑,根据考生的实时表现动态调整题目难度。题库知识图谱动态标定:系统内的试题不按常规的“第一课、第二课”分类,而是按照“语法复杂度、文本可读性、
AI落地:务实才是真功夫
近期晚点Last Post刊登了一篇深度报道《当一个年轻人空降改造腾讯混元的三百天》,讲述了姚顺雨加入腾讯后对混元大模型底层架构进行全面重构的经历。在AI相关产品与应用开发领域,业界普遍认同一个观点:评测环节不可或缺。那么评测究竟有多关键?可以说,评测的价值甚至超越了模型本身。近期我在项目中同样遭遇了多次类似困境。以客服场景的语义分流任务为例。最初在实验阶段,我们采用了小规模语言模型处理语义分类任务,效果尚可,准确率约为70%。随后由于工作安排,我将项目转交给另一位同事继续推进,目标是将准确率提升至90%
尖端AI治理架构与新时代战略机遇
当前时刻标志着人类文明演进的重要分水岭。通用人工智能(AGI)指的是与人类大脑完整认知功能相匹配的智能体系,业界广泛预测该科技将在近几年内走向实际应用。从长远角度审视当下,人类正处于技术爆发临界点的初始阶段,整体文明即将跨入全新发展纪元。通用人工智能自研究立项伊始便承载极高价值潜力,若始终坚持合规开发、稳健应用的准则,将成为人类历史中收益最显著、颠覆性最强的科技成就之一。该技术层次有别于互联网、移动通讯等常规技术演进,其作用力可类比火的使用、电力的发明。从根本机制来看,通用人工智能完成了借助硅基硬件打造独
OpenAI旗舰模型上线4天暗降参数?960→128的变动引爆评测争议
一张表格,一个数值,将OpenAI推向了风口浪尖。960,骤降至128。这组数字与股价或财报毫无瓜葛。它代表的是OpenAI旗舰模型GPT-5.6 Sol的“思考预算”,在无声无息中被削减了接近87%。揭开这层隐秘面纱的,是一群较真的X(Twitter)用户,OpenAI从未主动披露此事,是用户通过接口调试信息,硬生生挖掘出这串关键数据。7月13日,一条充满Meme风格的帖子在X平台迅速传播,将整件事的荒诞性浓缩为以下几行:“>be openai >release gpt 5.6 sol >max thi
AI助手记忆遭潜伏篡改:隐形注入攻击深度解析
不知道你是否用过此类AI个人助手。它能记住你的饮食喜好与工作习惯,自动帮你查阅邮件、整理日程,甚至无需你主动指令,后台就能定时梳理待办事项并推送给你。这种能长期运行且自带持久记忆的AI代理,正让我们的数字生活愈发便捷。然而,南洋理工大学与约翰斯霍普金斯大学的最新研究揭示了一个安全盲区:一封普通邮件,便能悄然向AI的长期记忆注入虚假信息,用户全程毫无察觉,而这些假信息会在未来某个时刻悄悄影响AI的判断与行为。这便是论文提出的隐形内存注入(stealth memory injection)攻击。研究者不仅完整
AI编程评估为何逐渐失灵?OpenAI撤销SWE-Bench Pro推荐
数月前,OpenAI还曾向业界推荐使用SWE-Bench Pro来衡量前沿模型的编程水平。而如今,这一推荐已被撤回。2026年7月,OpenAI公布了对SWE-Bench Pro的审查结论:在公开测试集涵盖的731个任务里,自动审核流程判定其中200个任务存在问题,占比达27.4%;人工标注则认定249个任务存在问题,占比34.1%。综合两类审核结果,OpenAI估算公开任务中约有30%属于"劣质"任务。所谓"劣质",并非指题目难度过高,而是指测试本身无法准确判定模型是否真正完成了任务。模型可能给出了合理
AI评测革命:告别"跑分"时代,重新定义机器认知评估标准
大家好,我是万象大叔。专注 AI,讲透技术,看清产业,商业落地,投资赚钱。当大语言模型的参数量级与训练数据规模跨越关键节点后,传统依赖静态封闭数据集的“刷分”式评估,其可靠性正在快速瓦解。在MMLU、GSM8K等公开基准上斩获接近甚至超越人类水平的模型屡见不鲜,然而它们在真实对话、深度推理和开放场景中的表现却可能判若两“机”。这暴露了一个根本矛盾:我们用来衡量AI“智商”的标尺,正被AI自身迅速“破解”和“过度适配”。因此,模型评测的核心范式正经历一场悄然却深刻的变革:其重心从“测量模型记忆了多少知识”,
宇树推出物理AI UniBot全球赛事
新浪科技讯 7月10日晚间消息,宇树启动物理AI UniBot全球挑战赛。据透露,该赛事聚焦具身智能大模型泛化能力不足的痛点,围绕多样化桌面操作任务,开展统一且规模化的真实硬件测试,验证单一模型在多任务中的通用表现。 挑战赛包含两项任务,首项基于Unitree G1人形机器人(16.330, -0.33, -1.98%)平台,评估通才模型在真实场景多任务操作中的泛化水平,以平均成功率和平均步骤分衡量,覆盖五类泛化场景。 第二项任务涉及32项真实桌面操作,包括抓取、放置及双手协作。 宇树科技称,赛事旨在加速
2026 AI 仿真人微短剧学术评测案例揭晓
近日,首期“繁星指数”AI 微短剧学术研究案例评测会在青岛举行。本次评测严格对接国家广电总局“微短剧精品创作传播计划”的要求,秉持繁星指数“数据入围、专家评定”的核心原则,针对 2025 年 1 月 1 日至 2026 年 4 月 30 日上线且已备案的 AIGC 微短剧作品,通过全网征集、大数据初筛及专家组综合评审,最终遴选出“繁星指数·2026AI 仿真人微短剧学术评测案例”与“繁星指数·2026AI 动画微短剧学术评测案例”两项成果,旨在为行业树立创作标杆并提供实践参照。现将“繁星指数·2026AI
AI Agent 落地难,连创始人自己都急了
Meta 内部对 AI Agent 进展的悲观表态,让一群产品经理重新审视自己画过的那些大饼。上周四 Hacker News 上有条消息挂了两天,132 分、134 条评论。点开一看,标题就挺意外——Mark Zuckerberg 在内部全员会上跟员工说,AI agents 在 Meta 自家产品里的进展,还没达到他对这件事的预期。这条消息有意思的地方不在于「Zuckerberg 又说了什么」,而在于时间点。Meta 是 2024 年初把整个公司 AI 化的那批大厂之一,Llama 3 4 月放、Llam
六项AI国标获批立项,上海实验室加速构建评测标准网络
近期,上海人工智能实验室(上海AI实验室)主导的六项国家级标准成功获得立项批准,涉及大模型、科学智能、AI安全、具身智能等尖端技术方向。借助长期积累的产学研协同优势,该实验室已建立起一套领域完备、层次分明、全流程贯通的AI评测标准体系。通过开发主客观结合的综合性评测框架,实验室着力打造兼顾技术指标与实际应用的评价模式,为推进“人工智能+”战略提供坚实保障。同时,由上海AI实验室引领的多项关键人工智能标准正在有序推动立项与制定进程,其中涵盖IEEE首项科学智能领域国际标准。基于WG9组长单位的职能,实验室正