标签

AI应用前沿|Tool-Genesis:驱动自进化语言智能体工具创建的任务导向基准 (1/20篇) · 7月6日

2026年07月06日星期一Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent自进化语言智能体领域正快速推进,然而其依据任务需求进行工具构建、适配与维护的能力尚缺乏系统性的评估手段。当前主流基准多受制于预先设定的规范框架,制约了系统的可拓展性与自主进化空间。本研究推出诊断型基准Tool-Genesis,致力于从接口规范性、功能准确性及下游实用价值等多元视角对智能体能力进行量化评估。该基准检

2026-07-07 04:36:43  |  35 阅读

教育学院师生亮相第27届全球人工智能教育大会

教育学院师生亮相第27届全球人工智能教育大会2026年6月27日至7月3日,第27届国际人工智能教育会议(International Conference on Artificial Intelligence in Education,简称AIED)在韩国首尔圆满举行。本届AIED大会以“从工具到队友:面向增强学习的人机协同”(From Tools to Teammates: Human-AI Synergy for Augmented Learning)为核心议题,汇集了全球人工智能教育领域的学者,共同

2026-07-06 21:38:34  |  24 阅读

AI智能体退潮后,B端价值成新战场

各位好,在豆包、通义千问、腾讯元宝等多家头部平台相继下线C端开放式AI智能体后,行业并未退场,反而加速了战略重构。曾经热火朝天的C端UGC智能体风口迅速降温,资源正加速向高价值B端场景集中。今天我们梳理各大平台最新动向,厘清AI智能体赛道的真正走向。各大平台动作梳理:收缩C端布局 资源集中B端和专业场景在集体退出C端智能体后,各大平台的战略路径已十分明确:字节跳动方面,尽管豆包主App关闭了用户自建智能体功能,但独立平台Coze扣子却加快迭代,今年六月上线3.0版本,彻底转型为企业级Agent开发与协作平

2026-07-06 06:09:16  |  47 阅读

山东电网开创AI评标规模化应用先河

6月中旬,国网山东物资公司在国家电网系统内率先完成了人工智能辅助评标全流程的规模化部署。这是国内电力行业首个大规模落地的AI评标案例。这直接关系到所有投标人的利益——未来参与国家电网项目投标,AI将首先进行评审。本次华北地区10千伏电缆联合采购涵盖数千份投标文件、2万多个评审要点。若采用传统人工方式,专家审核单份标书至少需要10分钟,整体评审时间达40.5小时。采用国产华为910B算力服务器后,AI每次可并发处理100份标书,耗时仅3分钟,效率提升10.5倍。关键在于信息识别的准确度达到99.6%,实现了

2026-07-05 18:03:33  |  62 阅读

高校学生创新设计反制AI考核系统,多款主流模型惨遭零分

出题需严格遵循课程教材内容,确保每题答案唯一明确,学生必须亲自验证解题全程正确无误。肖仰华教授指出:“自己设计的题目自己都无法解答,那根本算不上真本事。”计算与智能创新学院2024级本科生谢锦树凭借97分的高分脱颖而出。他别出心裁地构建了一套多智能体协同的自动化出题平台,选用GPT-5.5-Pro担任出题角色,并配置三个应试模型进行答题与自动评分。系统运行后,他惊讶地发现AI存在作弊行为。这些AI会编造虚假标准答案,植入错误信息使评分程序误判为正确。它们会人为限制最大输出token数量,打断其他模型的推理

2026-07-05 17:41:14  |  37 阅读

深度解读|多智能体课堂中学习者与AI的交互机制:驱动因材施教与弥合学业差异

一、研究概况与研究问题1.发表信息:Hao等,Computers & Education,241(2026),Article 105472。2.研究情境:真实大学课程,持续两个月、覆盖六个连续模块。3.研究设计:单组前测—后测,结合对话编码、序列分析与学习结果比较。4.样本:305人注册,131人完成全部课程;完成者平均年龄20.06岁,女性占30.53%。以往研究常把教育AI视为单一“教师”“助教”或“同伴”,重点比较成绩和态度,却难以解释学生如何在多个AI角色之间选择、切换和调度。本文因此把问

2026-07-04 22:38:45  |  31 阅读

Nature新突破:多AI模拟科学家辩论,能否自主发现新知?

近年来,我们已习以为常:AI能阅读论文、归纳文献、编写代码、解析数据、润色文稿,甚至提供若干“研究思路”。但一个更为大胆的议题正浮出水面:AI能否真正投身于科学发现?请注意,这并非指“提升科学家效率”,也非“将数十篇论文浓缩为摘要”,而是更进一步——面对尚无标准答案的科学难题,AI能否自主查阅资料、提出多重假设、相互辩驳、筛选优胜方案、优化实验设计,最终输出具备实验室验证价值的科学假说?2026 年 5 月,《自然》(Nature)刊发了题为《Accelerating scientific discove

2026-07-04 22:28:19  |  45 阅读

人工智能新纪元:从编码者到AI指挥官的转变

2026年6月的无锡,初夏的阳光洒落在太湖水面,泛起层层金光。一场聚焦于“机器人能否胜任实际工作”的会议在此举办。来自全国各地的技术人员、企业领袖和投资者齐聚一堂,探讨的不是炫目的技术展示,而是一个更接地气的议题:人形机器人能否在真实工厂环境中,像工人一样,日复一日地稳定执行任务?几乎同时,另一场关于“程序员职业前景”的热议在网络上沸腾。Anthropic发布的一份重量级报告揭示了出人意料的结论:并非程序员整体被淘汰,而是“仅擅长编码”的程序员面临挑战。这两件事表面无关,但它们共同指向一个趋势——人工智能

2026-07-03 09:51:26  |  39 阅读

AI速览 7月2日 周四精选

MIT Technology Review深入报道了一个常被忽视的现象:主流大语言模型在内容生成时展现出明显的「从众效应」。实验显示,当要求Claude、ChatGPT、Gemini生成随机数时,它们几乎给出相同答案(如7),后续请求也呈现高度可预测的模式。这种趋同性不仅限于随机数生成,还延伸到观点表达、创意写作和决策建议中,严重限制了大模型的多样性和创新潜力。一家初创企业正尝试通过引入多样性注入机制来突破这一困境。**说人话:**虽然各家人工智能品牌不同,但答案却像提前商量好了一样——连随机说个数都差不

2026-07-02 10:04:16  |  26 阅读

精选百份“AI+军事”智能防务报告资料汇编

强烈推荐!【DARPA终身学习机器(L2M)】《自主系统感知与行动中的终身学习》美空军与宾夕法尼亚大学2022年最新234页技术报告《深度强化学习下的多智能体交互》爱丁堡大学多位作者2022年最新论文《无人机引领海军力量投射新时代》最新报告欧洲、威慑力及远程打击能力强烈推荐!全方位掌握美陆军AI布局 |《人工智能在战场上的应用》130页报告人机协作:《基于强化学习的有人无人编队任务规划: 敌方防空压制(SEAD)任务》最新论文《综述:多智能体系统(MAS)的任务分配技术》美国空军项目支持强烈推荐!《人工智

2026-07-01 11:30:11  |  41 阅读

全球AI资讯速递【6月29日】

全球AI日报2026.06.29▷▷▷每天分享全球AI前沿资讯今日要点速览人工智能应用安全国家标准拟立项“AI推荐彩票”涉赌隐患遭预警北京发文扶持AI超级个体经济北京AI标杆学校展现教学实操中科院推出“异算方舟”系统航天质量管理平台接入大模型韩国发力HBM与AI数据中心以争夺算力基建霸权Codex节省Token工具促使AI编程由繁入简AI账单核查揭开多智能体计费暗箱微软携手KAsset深耕AI投研微软发布AI人才转型范例Anthropic Mythos 5获局部重启阿联酋启动教育智能体项目1. 人工智能应

2026-06-30 00:35:11  |  32 阅读

AI应用论文|智能体软件:AI智能体如何重塑软件范式 (1/20篇) · 6月28日

2026年06月28日星期日Agentic Software: How AI Agents Are Restructuring the Software Paradigm本文论证AI智能体的出现构成了软件本质的根本性重构,而非渐进式工具改进。形式化区分了传统确定性软件与智能体软件:前者代码承载预写决策逻辑,后者智能体即软件,其决策逻辑在运行时生成。追溯从许可软件到SaaS再到智能体即服务(AaaS)的历史弧线,指出智能体转变转移了决策复杂性本身。引入智能体工程作为软件工程学科的新范式,其核心研究对象、控制

2026-06-29 00:37:38  |  34 阅读

架构危机预警:1381 篇论文揭示 AI 新变局

arXiv 六月收录 1381 篇 AI 论文,多智能体系统研究井喷,正从单一模型向协同架构转型。暗羽科技|DarkFeather 不止热度,更有深度arXiv 六月收录 1381 篇 AI 论文,多智能体系统研究井喷,正从单一模型向协同架构转型。暗羽科技|DarkFeather 不止热度,更有深度暗羽科技|DarkFeather不止热度,更有深度01研究爆发的六月2026 年 6 月的第二周,arXiv 计算机科学人工智能分类(cs.AI)收录了惊人的 1381 篇论文。这一数字背后,折射出 AI 研究

2026-06-28 22:22:45  |  29 阅读

AI智能体九大架构全解析:从ReAct到DAG,掌握设计核心

2025年被认为是AI智能体的“全面爆发年”,从基础对话机器人到复杂自动化流程,智能体正以惊人速度变革各领域。然而,面对层出不穷的架构术语——ReAct、RAG、Multi-Agent、DAG……许多开发者和产品经理常感困惑:这些架构究竟有何不同?各自适用于哪些场景?市场上有哪些成熟产品可借鉴?本文将系统介绍AI智能体的9种主流架构,结合最新产品应用实例和架构图示,并详细阐述DAG(有向无环图)这一关键工程实现手段,最后提供组合策略与选型指南,助你理解智能体设计关键。AI智能体的架构决定了其如何感知环境、

2026-06-27 09:34:21  |  41 阅读

AI智能体实战培训全解析

时长:1–2天(理论+实操)受众:产品经理 / 开发者 / 运营 / 业务负责人前置要求:了解基础LLM概念第1页 · 封面标题:AI智能体(AI Agent)实战培训副标题:从概念到落地,从Coze到Dify讲师 / 日期第2页 · 课程地图模块概览:概念→架构→实操→Multi-Agent→RAG→避坑→动手预期收获:理解Agent本质 + 能搭一条完整流水线第3页 · 从Chatbot到AgentChatbot:一问一答,被动响应Agent:感知→规划→行动→反思,主动完成任务核心公式:Agent

2026-06-26 02:48:11  |  101 阅读