AI应用论文精选:WindowsWorld与智能体研究进展(5月7日)
2026年05月07日星期四WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments🤗 9现有GUI智能体基准多集中在单一应用的独立任务,往往忽略真实工作中常见的跨应用流程。为补足这一短板,本文提出WindowsWorld基准。该基准基于多智能体框架还原16类职业场景,构建181个多步骤任务,并统计每个任务平均包含5.0个子目标,其中跨应
AI微积分高手却解不开竞赛题:逻辑证明的短板何在
ChatGPT能解微积分,却解不开一道初中竞赛题——这背后的反差有何玄机GPT-4几秒内就能攻克高考数学压轴,但在一道需要“灵光一闪”的竞赛证明题面前却可能寸步难行。这并非算力不足,也非训练数据匮乏。这个反差,指向了一个关于“智能本质”的深层谜题。先来看一个让许多人费解的现象。你把一道高中数学题扔给 GPT-4,它大概率能给出步骤详尽的解答。但若让它严谨证明“存在无穷多个素数”——这道两千年前欧几里得已解出的题——它给出的“证明”往往逻辑存在漏洞,或者仅是在重复结论,而非真正在进行推理。一个能“解题”的系
多家出版巨头指控Meta侵权,称其AI训练盗用数百万部作品
教育出版界巨头爱思唯尔、圣智学习、阿歇特图书、麦克米伦教育及麦格劳-希尔教育在纽约南区联邦法院对Meta公司提起诉讼,指称该科技巨擘非法使用其出版物与学术文献来培育大语言模型Llama。 上述出版机构联合知名作家斯科特·图罗发起集体诉讼,在诉状中直指Meta非法复制其海量版权作品,在未经授权情形下利用这些资料训练AI系统以生成用户响应内容。 Meta官方代表随后发表回应称:"人工智能技术正为社会各界带来颠覆性创新、效率提升与创意激发,司法机关已明确认定,使用版权素材进行AI训练属于合理使用范畴,我方将坚决
生成式AI:开启智能应用新纪元
1.1. ChatGPT在短短五天内斩获百万用户1.2. 人工智能旨在让机器模拟人类思维模式,兼具技术性与创造性1.3. 生成式AI如同一位掌握多门语言、富有创意的文字大师1.3.1. 能够运用不同语言撰写故事和诗歌,呈现出接近人类的创造水准与多元的表达技巧1.3.2. 传统AI通过执行规则与指令实现惊人成就,而生成式AI凭借创新思维与内容创作能力,开辟了前所未有的机遇1.4. 1962年,科幻大师阿瑟·C·克拉克曾给出关于“创新”的精辟论断:“足够尖端的技术,无异于魔法。”1.5. 理解生成式AI的运作
揭秘AI工作原理:四步解析
以 ChatGPT 这类人工智能为例,其运作过程大致可分为 4 个主要步骤:人工智能首先会“阅读”海量的文本数据,包括书籍、各类文章、网页内容、编程代码以及问答记录等。 需要注意的是,AI 并非像人类一样真正“理解”每一本书的深层含义,而是通过分析数据来学习模式:例如,当 AI 接触到大量包含类似表述的句子时:“因为下雨了,所以需要带上伞。”它便会从中学习到“下雨”与“携带雨伞”之间存在一种紧密的关联性。计算机本身无法直接领会“苹果”、“天气”或“学习”等词语的含义。 因此,AI 的第一步是将这些文字信息
AI如何理解人类语言?揭秘Token的作用
这篇文章用通俗易懂的语言剖析了大型语言模型(LLM)中至关重要的“Token”概念。文章说明了Token是AI处理文本的最小单元,讲解了分词器如何把人类语言变成Token序列,指出了Token数量直接关系到AI的计算成本和价格,还梳理了Llama系列模型分词器的发展历程。你是否有过这样的体验?读了不少关于大模型(LLM)的文章,却总觉得像雾里看花,看不真切?别焦虑,今天咱们抛开那些晦涩的理论,只谈一个最基础且核心的概念——Token。一旦弄明白了它,你对 AI 的认知会立刻通透一大截!坦白讲,直到我完全掌
解析可解释性:走进大模型的“思考路径”
视频围绕人工智能模型的可解释性展开,重点放在语言模型到底如何“运作思考”。尽管这类模型的任务表面上是预测下一个单词,但在内部运行中往往会形成更复杂的目标,并抽取出抽象的表征。Anthropic 团队的研究人员分享了他们对 Claude 模型内部机制的观察与分析,并强调弄清模型如何进行推理与生成同样至关重要。通过实验,他们发现模型并不只是做机械的自动补全,而是具备一定的上下文理解能力。研究同时揭示了模型在输出内容时的规划与推理链条,并讨论了如何让系统表现得更可靠、更安全。大语言模型并不能被简单视为传统意义上
AI理解人类语言的真相:从双关语看认知局限
AI真的「懂」你说的话吗?双关语背后藏着一个更深的问题当你对AI说「这道菜真是要命的好吃」,它不会叫救护车,这说明它懂语言。但当你说「他这个人很圆滑」,它能感受到你语气里那点轻蔑吗?理解字面意思和理解语言,是两件完全不同的事。有一个测试语言模型的经典方式:给它讲一个冷笑话,然后问「你觉得这个笑话好笑吗」。几乎所有模型都会说「好笑」,然后解释笑点在哪里。但它说「好笑」的时候,和你真正笑出来的那一刻,中间隔着一条很深的沟。这条沟的名字,叫做语言的多义性。双关语,是语言的压缩炸弹双关语在语言学里有个更正式的名字
AI与魔法:差别到底在哪?
当你走进一座图书馆,几乎能找到所有问题的答案。把它想成《霍格沃茨传承》中的那个图书馆吧。书页会自己翻动,某些禁忌书架上封印着可能致命的知识;而真正精通魔法的巫师,只要开口念出咒语,黑暗里就会瞬间迸出光——"Lumos。"再看看《魔戒》里的甘道夫:他立在迷雾山脉,握着魔杖,口中低诵上古精灵语。几十年的记忆、横跨中土的地理认知,以及他对黑暗势力的全部了解,都在刹那间凝成一条判断——"You shall not pass!"还有《博德之门3》里的克里神术士:只需轻轻一动手指,就能
AI浪潮下中文的独特优势
过去很长一段时间里,不少人都觉得中文在科技领域有点“麻烦”。理由其实很直观:传统电脑键盘源自英文字打字机,输入英文自然更顺手。可要敲中文呢?往往要用输入法,还得熟悉拼音或笔画,门槛看起来就高了一截。于是也有人担心,方块字会不会让我们在现代技术的浪潮里跟不上。不过如今,局面已经明显不同。随着人工智能(AI)技术的兴起,尤其是涉及语言的部分,也就是自然语言处理,大家逐渐意识到:中文不但不是累赘,反而暴露出不少别的语言难以替代的优势,甚至在某些场景里比英文更“好用”。那么,为什么中文会在AI时代更受青睐?大致有
AI 写作蹩脚,人类也未必更强
AI 写作很蹩脚,但人类也好不到哪去经济学人 | 文化难度:★★★☆☆单词数:781words📍本期导读最近,米娅·巴拉德的恐怖小说《害羞女孩》在热议与曝光中迅速走红。可当读者逐渐察觉到文字里有大量人工智能参与的痕迹,这本被炒成爆款的书随即在各大书店遭遇“紧急下架”,并被回收处理。对此,舆论往往先入为主地嘲讽 AI 写作的粗糙:语言夸张、隐喻反复、煽情用力过猛。然而,今天的 AI 虽然还像学徒一样生硬,但它的进步速度却快得惊人。等到机器慢慢摆脱所谓“机器腔”,写出的句子比许多平庸人类更顺、更有流动性,我们
AI与ai之别:爱为基的多元资质
当汉语拼音把“AI”写成“爱”,一个双关就像把时代的疑问直接递到眼前:若智能缺少爱,它究竟还算是智慧吗?本文从人类多元资质所构成的生命生态,反观机器语言模型的生成机理,试图厘清两者的界限,并讨论它们在实践中可能如何相互对话。 引言:大写与小心 在键盘上,AI 是由两个拉丁字母组成的缩写,指向“Artificial Intelligence”。而放到汉语的语感里,ai——那一声平缓的发音——又成了“爱”的拼音:它承载着人类最原初的伦理与情感。看似偶然的重合,实则是必然的相遇。技术加速奔跑的今天,我们必须把问
花旗看好腾讯新模型 维持买入目标价783港元
花旗发布研报指出,腾讯控股(478.2, -15.20, -3.08%)(00700)于23日推出新模型HY3.0预览版,这是一款采用MoE(混合专家)架构的语言模型,总参数量约2,950亿,上下文窗口达到256k,在复杂推理和代理能力上均有明显改善。HY 3.0采取“务实”思路,侧重现实场景应用而非实验室评分,并称推理效率提升40%,定价也更具竞争力。花旗继续给予腾讯“买入”评级,目标价为783港元。 该行认为,尽管名义上是“预览版”,但该模型已迅速接入腾讯多条产品线,包括元宝、ima、CodeBudd
AI智能体架构探究:为何运营成本持续攀升
系列:AI智能体架构设计第十二篇:解析智能体使用成本上升现象主旨:相同任务执行,为何部分框架开销高出三倍——剖析Token消耗的深层架构成因,并探讨三种框架各自的成本优化策略适合人群:对智能体底层设计原理感兴趣,希望深入理解“为何如此设计”的读者预计阅读时长:15分钟一种令人困扰的计费模式语言模型的计费逻辑,与你通常认知的软件成本结构截然不同。常规软件中,购买一项功能后,使用频次与成本基本呈正相关。语言模型则不然,每次调用都需将完整的对话历史重新发送给模型——不仅限于你刚输入的语句,而是涵盖从对话起始至今
大摩力挺腾讯 目标价650港元 给予增持评级
摩根士丹利发表研究报告指出,腾讯控股(00700)在昨日(23日)正式推出并开放源代码的全新大语言模型Hy3 Preview,标志着其混元(HY)基础模型重构的开端。该模型采用MoE架构,融合快慢双思维模式,总参数规模达2950亿(激活参数210亿),上下文长度支持256K,在复杂推理、指令理解、上下文学习、代码编写、智能体功能及推理效能等多个维度实现优化。大摩据此给予腾讯"增持"投资评级,目标价位定于650港元。 大摩分析认为,Hy3 Preview在代码创作与智能体功能层面实现明显突破,SWE-Ben