标签

17小时自动修Bug:Harness工程定义AI驾驭新标准

阿里技术团队近期完成了一项操作,令我反复推敲。他们部署了一个AI Agent,旨在自主修复缺陷。不同于“你指令,它执行”的模式,而是——它自主分析、定位、编码和测试。耗时17小时。修复完成。这非虚构。这是Harness Engineering——2026年AI工程中最热门的概念。当AI能自动修复Bug,程序员的地位何在?这是每一位AI技能培训师必须回应的疑问。01一个死循环:人修Bug永远追不上AI出Bug先看一个场景,AI应用开发者一定很熟悉:每周上百个坏案例涌入。调整一个Prompt需要几个小时。一天

2026-09-04 20:03:13  |  1 阅读
DeepSeek发布Harness公众号,智能体布局提速

DeepSeek发布Harness公众号,智能体布局提速

新浪科技讯 8月11日午间消息,“DeepSeek Harness团队”微信公众号近期已完成注册。该账号认证主体为北京深度求索人工智能基础技术研究有限公司,IP属地北京海淀,目前暂未发布任何内容。这是DeepSeek首次为Harness业务线设立独立的官方发布渠道,被外界视作Harness产品即将面世的重要信号。 Harness是确保大模型能够真正“跑起来”的工程化系统,主要承担工具调用、任务规划与执行调度等功能,是智能体研发中不可或缺的核心技术。今年5月,DeepSeek内部组建了Harness专项核心

2026-08-12 12:54:56  |  20 阅读

AI工程的三大架构范式

AI工程的三大架构范式 近期AI工程领域接连涌现出三个新理念:Harness Engineering、Loop Engineering、Graph Engineering。它们既非同义,也非竞争,而是AI Agent系统的三个递进层级。 ① Harness Engineering = 为AI配备操作系统 模型相当于CPU,上下文窗口等于RAM,而Harness则扮演操作系统角色,决定AI能看到什么、何时能看到。 核心产物:项目说明文档(CLAUDE.md)、任务追踪文件(JSON)、记忆存储、工具规范、反

2026-08-10 15:29:14  |  21 阅读

实在智能登顶OSWorld,揭秘企业AI Agent落地的“工程化”关键

实在智能(Intelligentrobots)推出的“实在Agent”,凭借90.20%的执行成功率,在智能体框架及总榜中均拔得头筹。这是该项评测中,智能体成功率首次突破90%大关。这一数字意味着什么?OSWorld涵盖了超过300个真实世界的电脑桌面与网页任务,要求智能体如人类般直接操控图形界面,一步界面理解偏差或操作失误都可能致败。联想研究院今年3月曾发文指出,即便是最顶尖的智能体,单次运行成绩也长期徘徊在67%左右;而在评测条件下,人类操作者的平均成功率约为72%。换言之,实在Agent不仅跨过了人

2026-08-03 18:21:36  |  30 阅读

AI写用例泛滥,谁来判断真假?三份报告揭示测试新核心

今日精选聚焦FunTester的Agentic SDLC分析、百度开发者平台的Harness Engineering实践与PractiTest的Testing Intelligence趋势。三家不约而同指向同一趋势——测试人的核心价值正从"编写用例"转向"甄别质量"。团子为你梳理今日AI测试圈动态,以下内容值得深入阅读。7月20日,FunTester在TesterHome发布《给测试看的Agentic SDLC》,基于Anthropic最新Agentic Coding报告,

2026-07-20 10:06:58  |  27 阅读

AI工作术:Harness与Loop到底指什么?

AI新名词科普:Harness和Loop是什么意思?通俗易懂地告诉你:Harness是为AI搭建的完整‘工作系统’;Loop则是让AI反复‘执行—检测—优化’,直至任务完成的循环机制。你可以把AI想象成一名新员工。 1. Harness是什么? AI模型本身仅是‘大脑’,比如GPT、Claude,虽聪明,但单靠大脑无法做事。你需要为它配备: 电脑与软件 文件访问权限 搜索、编程等工具 操作流程与规则 历史记忆与项目资料 结果校验机制 将这些组件整合,使AI真正能执行任务,这套体系就叫Harness。 简单

2026-07-18 22:17:21  |  30 阅读

易鑫推出汽车金融AI智能终端,90分钟业务办理压缩至15分钟

申请车贷时,需要准备大量纸质文件,流程繁琐,一旦漏带材料还得再跑一趟;递交申请后,何时能拿到放款心里没底,只能反复咨询业务人员;把个人证件交给他人代办,又担心隐私信息外泄?易鑫发布的国内首款汽车金融AI智能终端设备在AI技术的赋能下,这些汽车金融服务的痛点如今有了全新的解决路径。7月17日在上海开幕的"2026世界人工智能大会"(WAIC 2026)上,以AI驱动金融科技的易鑫集团(02858.HK)正式发布国内首款汽车金融AI智能终端。该产品将全流程一站式AI智能解决方案转化为可实际操作的实体设备,消费

2026-07-18 08:00:45  |  44 阅读

AI七层核心逻辑揭秘

学了三年AI,我发现大多数人连这7个词都没搞清楚我说真的,不是在凡尔赛。身边很多人用AI用了好几年,提示词写了几千条,各种工具装了又删、删了又装,结果还是感觉哪里不对劲——AI给的答案总是差那么一口气,任务交下去总是跑偏,用着用着就放弃了。问题出在哪?不是工具不好用,是根本没搞清楚AI在做什么。今天我用一篇文章,把AI世界里最核心的7个概念全部讲透。看完之后,你会发现之前那些"为什么AI总是不听话"的疑问,全部有了答案。01 Token——AI听你说话的方式先从最底层说起。你以为你跟AI说

2026-07-08 04:22:56  |  33 阅读

AI自主工作谁来监管?企业级AI的Harness工程实践

Harness,在中文里没有固定译法。在AI工程领域,它特指一种外层控制程序:负责调度AI、验证结果、决定下一步行动。用快递分拣系统来比喻:包裹在传送带上移动,背后有一个调度层——决定哪个包裹去哪个传送带、哪个格口满了需要改路线、哪个包裹扫描失败需要人工复查。Harness就是AI系统里的那个调度层。它不直接“干活”,而是把任务分配给合适的AI,检查AI是否真的完成了(而不是只听AI自己说“完成了”),并决定失败时是重试、换方法,还是交给人类处理。过去,这个调度层由人来做。Harness工程要做的,是把这

2026-07-07 18:20:13  |  44 阅读

智能体系统的四大核心架构

本质上,智能体就是一个While循环,其内部执行模型运行、工具调用和上下文组装,直到不再需要工具调用时终止。整个循环实际上包含四个工程层级:提示词工程、上下文工程、Harness工程和Loop工程。提示词工程定义了模型在单次调用中接收到的输入,通常由角色、指令、示例和输出格式组成。根据接收到的文本信息,它可以改变模型内部的计算和推理方式。常用技巧包括:少样本提示、思维链提示、提示分层、角色规范提示、反向提示、结构化提示和ARQ推理查询、自洽性抽样等。上下文工程包含了模型在回合中看到的所有内容,而不仅仅是提

2026-07-07 12:09:46  |  43 阅读

AI工具如何选?三步分类法帮你精准匹配

2026年6月,全球咨询巨头埃森哲的一份内部录音被曝光。你猜他们AI账单上花钱最多的是什么?答案让人意外——是一群非技术员工把PDF文件转成PPT幻灯片。这里说的Token,就是AI模型计费的单位——大概1000个Token相当于750个汉字。埃森哲用的很可能是最贵的Claude或GPT(都是美元计价的企业版),把这种"用普通软件就能搞定"的事,扔给了大模型来做。这就是典型的"杀鸡用牛刀"。一个能写代码、能分析数据、能做复杂推理的智能工具,被当成了普通格式转换器。问题的本质是"用错了工具"。要搞清楚"该用

2026-07-07 04:18:10  |  28 阅读

为AI装上缰绳——Harness,让智能系统循规蹈矩的秘密武器

AI 科普系列Harness,让AI不再跑偏的那个东西AI越来越强,为什么还是不能放心让它自己干活?你让AI帮你写个方案,聊了十轮之后,它突然开始给你推荐餐厅——你明明在聊营销策略。你一定遇到过类似的事——让AI帮你写个方案,聊着聊着它就开始自说自话,越聊越离谱,完全不是你想要的方向。让它干个长一点的活儿,做到一半它开始胡说八道,前面明明做对了,后面突然全跑偏。换个对话窗口,之前的事全忘了,又得从头来一遍。这不是你运气差,也不是AI能力不行。这是AI的"默认设计"问题——它没有内置"

2026-07-06 22:22:25  |  38 阅读

人工智能:悄然构筑你的日常基座

移动互联网初露锋芒之际,「扫码付款」「在线导航」尚属新潮概念,人们还会聚首探讨操作门道。如今呢?再也无需多言——它们早已如呼吸般自然,化作不言而喻的存在。当某种能力无需赘言便深入人心,它便真正实现了「原生」。AI 原生,正循着相似的轨迹演进。你或许已隐约觉察,某些改变正悄然酝酿,却道不明缘起何时——智能终端能捕捉语调、洞察心意;它的预判随你的习性而变;AI 不再止步于应答,更能代你发送邮件、查询气象、预约会议、撰写公文。这绝非零散的功能堆砌。其背后是一股更为宏阔的浪潮:AI 原生,正无声无息地浸润你的生活

2026-07-04 05:44:57  |  43 阅读
科大讯飞AI招采平台2.0亮相:交付效率翻三倍,核心环节消除幻觉

科大讯飞AI招采平台2.0亮相:交付效率翻三倍,核心环节消除幻觉

新浪科技讯 6月26日上午消息,科大讯飞(39.120, -2.56, -6.14%)发布全面升级的招采智能体平台2.0版本(简称:AI招采平台),宣布该平台已落地200余个智能体,交付速度可提升300%,实现“2大技术突破、3个安全保障、5个客户价值”,让招采智能体平台不仅严谨落地,更能自主规划、自主进化。 据悉,依托自组织、自进化的智能体协作框架,该平台可构建动态编排的多智能体协作体系,自动识别不同项目的评标规则并智能编排评审流程。其内置的多维评审专家Agent矩阵按需动态匹配评审角色,实现“一类项目

2026-06-27 02:36:50  |  39 阅读

AI写代码总出错?钱学森的控制论才是真解法

最近AI编程工具火得不行。从Cursor刷屏,到上个月Claude Code的史诗级更新(当然还有7月8日后可能需身份验证,哈哈),行业里甚至冒出个新词叫“Vibe Coding”(氛围感编程)。啥意思?就是开发者往椅子上一靠,跷着二郎腿,喝着咖啡,给AI丢几句模糊指令:“写个商城后台”、“修个Bug”。看着代码自动对齐,感觉自己像在指挥千军万马。这种“氛围”确实爽。但爽完一上手复杂项目,十有八九就崩了:AI写的代码漏洞百出,一运行报错连篇;你让它改A,它把B全毁了;折腾半天,发现查Bug、补锅的时间,比

2026-06-25 14:29:01  |  23 阅读