AI写用例泛滥,谁来判断真假?三份报告揭示测试新核心
今日精选聚焦FunTester的Agentic SDLC分析、百度开发者平台的Harness Engineering实践与PractiTest的Testing Intelligence趋势。三家不约而同指向同一趋势——测试人的核心价值正从"编写用例"转向"甄别质量"。团子为你梳理今日AI测试圈动态,以下内容值得深入阅读。7月20日,FunTester在TesterHome发布《给测试看的Agentic SDLC》,基于Anthropic最新Agentic Coding报告,
AI 工程从零起步:先打通底层全链路,再谈 Agent 构建
最近在学 AI 的朋友,常常会陷入一种尴尬处境。你能调用模型、能搭建 RAG、也能把工具接入 Agent,可一旦输出走样、检索失灵、成本爆掉,排查就像在黑箱外面敲墙。这套开源教程 ai-engineering-from-scratch,正是为了补上这一短板。它不从“搭一个聊天机器人”切入,而是把学习路径拉回底层:数学、机器学习、神经网络、Transformer、LLM 工程、工具协议、Agent、生产环境。每一阶段都要求你亲手写出可运行的小实现,再去调用成熟框架。听上去很硬核,可它的意义并非让每个人都去训
OpenAI CFO力推「每美元有用智能」指标:AI投资回报评估新标准
数据窗口:2026-07-18 08:30 ~ 2026-07-19 08:30 (UTC+8) 本期采集 14 个源 / 原始约 65 条条目 / 20 条入选 ⚠️ 数据覆盖说明:周日多源未更新;Google DeepMind、Meta AI、xAI、Mistral、GitHub Trending、HN、HuggingFace、机器之心、量子位今日未成功采集(网络限制);arXiv 周六日无新投稿,本期论文为周五(7月17日)最新批次。今日无新发布。今日未成功采集(网络限制)。今日未成功采集(网络限制
Java后端迈向AI原生的三大关键
近期 GitHub 上几个 Java AI-Native 项目迅速走红——Nubase、agent-sphere 一周内分别斩获 500+ 和 300+ star。深入代码后发现,它们并非简单封装 AI SDK,而是将 AI 能力深度嵌入后端基础设施:内存向量存储、MCP 协议原生支持、LLM 驱动的编排引擎。值得深入探讨:什么是真正的「AI-Native Java 后端」?不少人把 Spring AI 和 LangChain4j 视作 AI 集成的全部,这如同把 JDBC 当成数据库的全部——若缺乏连接
AI智能体:会自我复盘的数字员工
Agent(智能体)是以大模型(LLM)为核心控制器,具备自主规划(Planning)、工具调用(Tool Use)、记忆管理(Memory)与闭环反思(Reflection)能力的自治系统。其经典实现模式称为ReAct(Reasoning + Acting):Agent在行动时,必须用自然语言描述推理过程(如同自言自语),再依据推理结果执行任务,并根据反馈不断修正推理,循环迭代直至目标达成。打个比方:你派一位五星级大厨(Agent)准备一桌满汉全席。他环顾空厨房(感知环境),心想:“先列菜单(任务分解)
深入解析AI应用的技术架构与实现原理
深入解析AI应用的技术架构与实现原理 LLM 核心是基于上下文进行输出预测的机制,真正决定表现的关键不在于"模型能力",而在于输入内容、上下文环境和任务定义是否明确。Prompt、Token、Context、Tool、RAG、MCP 这些术语,实际上都在解决同一个挑战:如何帮助模型精准把握任务需求,并与外部环境建立有效连接以完成任务。Agent Skill 则将高效的工作模式固化为可重复使用的流程体系,使 AI 从单纯的"问题解答"升级为"稳定完成任务"的能力。 #AI学习 #LLM #Agent #Ag
NVIDIA AI 特训:7 月 16 日解锁大模型知识注入与定制全流程
诚邀您参加 NVIDIA 深度学习培训中心(DLI)于 7 月 16 日推出的 AI 特训课《为大语言模型添加新知识》。本课程将深入讲解从数据清洗、模型评测到知识融入及微调优化的全过程,助您精通定制化大语言模型(LLM)的关键技术。课程由 NVIDIA 官方认证讲师全程中文直播授课并实时答疑,结合云端实验环境进行实操演练,通过课内考核即可颁发 NVIDIA 课程结业证书。若您正筹备参加 NVIDIA 生成式 AI 中级认证(NCP-GENL / NCP-AAI),本课程即为官方推荐的备考培训。深入探究知识
AI 瓶颈非止内存:优先级地图揭示炒作方向
前文曾探讨:在 LLM 推理环节,HBM 显存常成首要制约——GPU 往往在等待数据,而非进行计算。然而,AI 基础设施实为一条完整的「瓶颈链条」,随年份更迭与场景变迁,受阻节点亦会向下游转移。本文提供一份经优先级排序的瓶颈图谱,并清晰标注哪些领域已被资本市场充分定价,哪些叙事尚属新颖。数据说明:文中数值源自 JEDEC、PJM、Goldman Sachs、Bernstein、Silicon Analysts 以及各企业财报与新闻稿等公开资料
AI从聊天到干活:七大技术揭开智能助手进化密码
旅行计划,AI能搞定吗?它可能只会甩给你一堆文字攻略,却订不了票、查不了天气。这背后,是一整套让AI从“会聊天”变成“能干活”的技术体系在进化。今天,我们就用一次旅行,拆解从LLM到Harness的AI热词通关之路。开篇:你的北京旅行,AI能搞定吗?想象一下,你下周要去杭州旅行。你告诉AI:“帮我规划一个3天2晚的行程,要文艺小众一点,预算3000块。” 你期待的,是一个能自动查好天气、比价酒店、预订门票,甚至生成详细日程表的全能管家。但现实是,它可能只会给你一段充满“建议”的文字,然后说:“具体预订请自
一文读懂AI Agent:从核心原理到关键组件
当你向智能体下达指令:"帮我提取上个月的销售数据,对比市场同类产品,生成分析报告并抄送团队"。十分钟后,智能体已完成:连接数据库、执行SQL分析、联网搜索竞品、绘制图表、生成图文报告,并等待人工确认发送。如今,智能体(AI Agent)已能替代人工完成实际任务。本文将解析其核心机制与构成要素。简言之,AI Agent是以大语言模型(LLM)为"大脑",能自主感知环境、决策推理、调用工具并循环执行直至达成目标的系统。区别在于行动力。聊天机器人止步于文字输出,Agent则能搜索
AI评测新趋势:从榜单刷分到真实场景能力验证
过去我们更在意模型在各类排行榜上的成绩:SWE-bench、Terminal-Bench,领先几个百分点,打破纪录成为焦点。而如今,一个更核心的议题逐渐显现:这些分数,真的能反映AI在真实生产环境中的能力吗?从近期AI评测的发展来看,评测正从“短任务、单分数、排行榜”迈向“长周期、可解释、生产级、安全可信”。本周最受瞩目的项目当属 Sakana AI 推出的CoffeeBench。它不再让Agent执行几分钟就能完成的单点任务,而是搭建了一个持续90天的B2B咖啡供应链模拟平台。系统内包含6个由LLM驱动
Java工程师AI转型路径:你的七成技能已可直接应用
你不必从头学习AI,你需要的是一幅从Java迈向AI的导航图。2024年下半年,我在科大讯飞主管一个教育资源检索平台——利用Elasticsearch实现全文搜索,多个LLM负责内容生成,视频经ASR转录后进行知识点分割。简单说就是一个“具备AI功能的搜索工具”。当时团队里已经有人讨论RAG、Agent、MCP,我听得一知半解。作为一个有8年Java经验的人,我的本能反应是:“这些与我何干?我又不是算法专家。”直到公司启动一个新项目——知了AI助手平台,需要从零规划RAG检索系统、Agent工作流引擎、M
Karpathy:氛围编程时代落幕,智能体工程化成为新趋势
OpenAI联合创始人、前特斯拉AI总监 Andrej Karpathy 于2025年2月在X平台首次提出 Vibe Coding(氛围编程/感觉编程),该概念当年迅速走红,入选柯林斯年度词汇及韦氏热词俚语榜单。核心概念解析:一种新兴编程范式,完全遵循直觉与需求氛围,充分利用大模型的生成能力,无需深入理解底层代码逻辑;仅需用自然语言阐述功能需求,AI一次性输出全部代码,运行通过即可,遇到bug直接将错误信息抛给AI自动修复,开发者无需逐行阅读和审查代码。Vibe Coding is dead, the f
AI测试日报7.2:最新AI测试方向解析
日期:2026-07-01 范围:AI 辅助测试、代码覆盖率、CI/CD 安全、依赖合规、测试成本治理今日最引人注目的变化,并非新增一个能生成测试的模型,而是测试治理正被直接集成到平台控制层面:覆盖率下降可阻止代码合并,许可证不合规可阻止依赖进入生产环境,不可信触发器不再污染默认分支缓存,AI 消耗也能按团队和个人设定预算。同时,LLM 测试能力正从“生成输入和断言”扩展到“将自然语言需求转化为可审计规则,并检查实现语义”。这可能缓解部分测试预言机问题,但论文也明确指出了两个限制:温度为 0 时仍会产生不
AI原生开发范式深度解析
一、总体范式:AI Native系统结构 AINative研发的核心并非"以AI取代系统",而是搭建一套分层架构: -Operator(原子化执行单元) - Skill(可复用策略/能力编排) - IR /DAG(结构化任务表征) - Runtime(执行与优化引擎) - LLM(意图解析 +规划生成 + 结构编排)完整链路: User Intent → LLM → Skill Graph / IR → Runtime DAG → OperatorExecution → Feedback → Evolut