标签

AI简报:2026年7月6日

MiniMax推出新一代模型M3,其核心变化在于不再单纯强调Benchmark排名,而是着重展示模型在真实工作场景中的任务完成能力,例如SWE Bench、BrowserComp、OSWorld等评测。这表明模型评价标准已从“知识考试”转向“岗位考核”,产品叙事也从Token收入转向Workflow收入。MiniMax试图将自身定位为企业工作入口,与浏览器、IDE、ERP等软件竞争,强调模型成为基础设施,工作流成为产品。壁仞科技在港交所发布公告,按每股46.2港元配售1.53亿股新H股,募资总额约70.6

2026-07-06 14:06:09  |  25 阅读

2026年AI学术写作工具实测报告:哪款最靠谱?

凌晨对着空白的文档发呆,文献翻了几十份,框架改了七八版,正式动笔却迟迟无法开始?重复率居高不下,AI特征过于明显被老师一眼识破,反复降重改到崩溃?别担心,作为扎根实验室的科研人员兼工具评测达人,我亲自测试了市面上主流的AI论文辅助工具,直接给出结论:掌桥科研AI论文写作工具在学术规范性、文献真实性及全流程覆盖方面表现突出,是2026年最值得信赖的学术写作帮手。这篇评测将从ChatGPT、Claude、Grammarly以及掌桥科研AI四个产品出发,结合核心功能、实测数据和真实使用感受,帮你锁定最适合自己的

2026-07-06 00:07:22  |  15 阅读

Claude Opus 4.7终端测试仅得62.5分?8万条真实操作录像揭示AI评测新基准

这项研究结论出自伦敦大学学院(UCL)、南京大学与腾讯的联合研究团队,他们通过全新基准TerminalWorld进行实测。研究人员从开发者自愿分享的八万多条真实终端操作记录中,提炼出一份如"照妖镜"般的测试题库。在这份测试中,顶级AI智能体的最高得分仅为62.5%。为何偏偏聚焦"终端"?近年来AI编程能力显著提升,GitHub Copilot、Claude Code、Codex CLI等产品陆续推出,它们"会写代码"的能力备受赞誉。然而软件开发远不止编写代码

2026-07-05 09:34:28  |  26 阅读

首款AI Infra运维智能体评测基准开源,基于近百亿条真实数据检验Agent解题实力

随着全球智能体加速落地,算力需求呈指数级爆发,以GPU为核心的AI基础设施正变得愈发关键。据摩根士丹利报告预测,2028年全球AI基础设施累计总投资将达2.9万亿美元。然而,根据行业通用成本结构测算,其中由运维人力、故障损失与集群闲置构成的成本占比可高达15%~20%,全行业潜在的可优化空间超过4350亿美元。作为全球领先的AI基础设施服务商,无问芯穹早在去年10月便率先启动研发并成功部署早期版本的运维智能体。实践表明,相比传统人工运维,智能体显著提升了整体运维效率:工单平均处理时长缩短50%,关键故障处

2026-07-04 13:25:49  |  12 阅读

AI评测新趋势:从榜单刷分到真实场景能力验证

过去我们更在意模型在各类排行榜上的成绩:SWE-bench、Terminal-Bench,领先几个百分点,打破纪录成为焦点。而如今,一个更核心的议题逐渐显现:这些分数,真的能反映AI在真实生产环境中的能力吗?从近期AI评测的发展来看,评测正从“短任务、单分数、排行榜”迈向“长周期、可解释、生产级、安全可信”。本周最受瞩目的项目当属 Sakana AI 推出的CoffeeBench。它不再让Agent执行几分钟就能完成的单点任务,而是搭建了一个持续90天的B2B咖啡供应链模拟平台。系统内包含6个由LLM驱动

2026-07-03 14:12:29  |  18 阅读
安兔兔质疑某产品跑分真实性,矛头或指向红魔?

安兔兔质疑某产品跑分真实性,矛头或指向红魔?

新浪科技讯 7月2日上午消息,评测平台安兔兔日前通过官方账号发布声明表示,为确保测试结果的可信度,其在V11版本中引入了跑分联网验证机制。经查证,某款产品在发布会上公布的跑分数据未查到联网验证信息_blank,且厂商方面未能出示具备效力的跑分凭证,该数据真实性存疑,安兔兔方面拒绝予以承认。此外,安兔兔宣布在接下来的三个月里,该产品的平均分排名将不会被纳入统计,希望相关厂商能够有所警醒。 尽管安兔兔在公告中并未明示具体厂商,但有细心的网友发现,近段时间召开新品发布会的仅有红米K90至尊版以及红魔游戏平板5P

2026-07-03 01:24:54  |  13 阅读

GIAC 2026·深圳站|快手AI工程化实践经验深度解析

作为国内大规模 AI 工程化落地的先行者,快手技术团队参与了第十三届全球智能应用开发与架构大会(GIAC)。当前,AI 正加速从模型能力竞争走向工程化落地竞争,但行业普遍面临"个人快了、组织没快"的转化瓶颈——如何突破单点提效的局限,让 AI 真正融入研发流程、稳定支撑业务创新,已成为企业研发升级的核心命题。此次大会中,快手技术副总裁胡伟担任联席主席;快手主站 AI DevOps 负责人李思在主论坛发表主题演讲,并担任「AI原生开发工具链技术原理与效能提升」专题出品人。快手主站技术部直播业

2026-07-02 20:11:45  |  17 阅读

500份AI主题演示文稿资源合集

点击此处自助获取新加坡人工智能安全全景报告(2026).pdf人工智能管理系统的实施和审计:基于ISOIEC42001.pdf2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf人工智能的技术、运营与风险.pdfAI大模型合规指南.pdfGB∕Z 185-2026 人工智能 智能体互联 第1~7部分.pdf2026年人工智能发展十大趋势.pdfAI大模型安全评估及防护技术应用指南(2026).pdf中国AI Agent产业生态全景分析报告.pdf2026年AI威胁态势报告.pdfAI安全

2026-07-01 08:38:15  |  53 阅读

AI领域一周速览:GPT-5.6三连发、OpenAI芯片亮相、国产模型评测首超Claude

过去七天,人工智能界有什么新动态?OpenAI接连推出GPT-5.6三个变体,同时公开了首款自主研发芯片;全球领先AI平台OpenRouter统计显示,国内大模型API调用频次连续六周霸占全球榜首;字节跳动旗下的豆包2.1 Pro在多项关键评测中赶超Claude Opus 4.6……这并非虚构剧情,而是2026年6月的现实写照。若你的子女正考虑专业方向、院校选择或海外求学——下面的内容,每一句都与你息息相关。6月25日,OpenAI正式揭开GPT-5.6系列面纱,一次性发布三款模型:Sol(高端款)、Te

2026-06-29 19:12:36  |  27 阅读

百川M4登顶HealthBench,AI问诊能力首次超越GPT

百川M4问鼎HealthBench:当AI不再局限于答题,而是学会了“问诊” 我上周看到一则新闻,差点笑喷——百川智能携手清华推出的Baichuan-M4,在OpenAI主导的医疗基准HealthBench上,包揽三个子榜的冠军,完胜GPT-5.5与Claude Opus 4.7。 诚然,“第一”在国内AI界屡见不鲜,但此次数据颇为亮眼:综合分68.6,甩开GPT-5.5近10分;在最具挑战性的Hard子榜中,优势更是拉大到15.9分。这绝非小胜,而是绝对压制。 值得注意的是其幻觉率仅3.3%,对比之下G

2026-06-24 12:15:52  |  23 阅读

AI人力资源管理师报考流程详解

《国务院关于印发新一代人工智能发展规划的通知》明确提出,要加大高端人工智能人才的引进力度,实现人工智能高端人才的精准引进,并构建开放协同的人工智能科技创新体系,推动AI技术在经济社会各领域的广泛应用,鼓励企业创新与采用AI技术,从而提升人力资源管理的智能化水平。《人力资源社会保障部关于实施人力资源服务业创新发展行动计划(2023-2025年)的通知》指出,企业需要运用大数据、云计算、人工智能等新兴技术,加速实现业务数据化与运营智能化,并支持有条件的人力资源服务龙头企业打造一体化数字平台,提升系统集成水平,

2026-06-23 10:17:10  |  22 阅读

上周利用Codex搭建评测台与副业复盘

上周主要精力投入于Codex,构建了两个内容平台用于AI工具评测的操作后台。平台功能涵盖文案写作、AI改写、对标展示、标准化流程提示、选题管理及草稿箱等。同时设有日更展示、关键词提醒和关键词罗盘整理页。两个平台均已接入AI创作接口,可直接生成内容。壁纸赛道的Skills项目尚不熟练,但额度充裕需充分利用。AI评测板块坚持两天一更,抖音表现平平无特色,X平台正在搭建完善中。目前重心放在X和AI评测上,待稳定后再扩展其他方向。

2026-06-22 09:15:50  |  17 阅读

人工智能助力英语教学改革课题

人工智能赋能英语课程教学课题,直接立项 今天推荐一个非常实用的外语教改项目📑《人工智能赋能英语视听说课程混合式教学新范式》。该课题针对高校英语视听说教学的难点,将AI技术与混合式教学紧密结合,打造了“课前-课中-课后”的全流程闭环新模式。方案涵盖了智能语音测评、个性化资源推荐以及多元过程评价,并附带了实际数据和学员反馈,实用价值极高!结构严谨、案例详实、拿来即用,非常适合从事英语教学、撰写教改论文及申报课题的人员 山东 , 10小时前 ,今天推荐一个非常实用的外语教改项目📑《人工智能赋能英语视听说课程混合

2026-06-20 09:30:04  |  22 阅读

直播回放 | 讯兔科技PaiWork+新品发布会圆满收官

2026年6月18日,讯兔科技主办的“派生未来”金融AI生态论坛暨PaiWork+新品发布会在上海成功举办。本次活动汇聚了超过300位来自金融、人工智能、学术研究及产业生态领域的专业人士,共同研讨从模型技术到金融业务价值的转化路径。大会由ITL智能投研技术联盟协办,并携手LSEG、晨星中国、阿里云、秩鼎、263、出门问问等生态伙伴联合呈现。同时获得上海证券报、中国证券网、中国证券报、证券时报、财联社、投资界等主流财经媒体关注与报道。活动期间正式推出iRaB投研实战评测体系,对PaiWorkAI投研工作台进

2026-06-20 09:29:06  |  25 阅读

国产AI办公实战评测:六款工具谁在政企场景中真正靠谱?

连续一周都在谈宏观趋势——合规要求、计算资源、产品选择、团队配置。今天直接实战:6款本土AI工具,4个政企常见场景,给出真实结论。所有测试基于2026年6月免费版本,运行环境:Windows 11系统、国内网络直连。无推广,无赞助,只聚焦一个核心问题:在政企办公中,哪些工具真正可靠?场景一:长篇文档提炼——处理一份1.8万字的政策文件,抓取关键信息Kimi:表现完美,不遗漏重点,段落结构清晰。百万Token上下文能力名副其实,长文本是它的强项。DeepSeek V4:表现不错,稍有精简但核心内容不缺失。千

2026-06-20 08:25:04  |  18 阅读