上海AI实验室SKT方案:让AI真正掌握工具使用,而非仅停留在认知层面
2026年8月,上海人工智能实验室发布了一篇论文(arXiv:2608.02287),题目相当冗长——《SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation》,但其核心意图可以用一句话概括:
不能再简单地把技能文档丢给AI就了事。必须教会它实际操作的方法。
这番话看似平淡,却精准戳中了当前AI智能体(Agent)领域最棘手的痛点——工具数量再庞大,模型若无法有效调用,一切都是空谈。
自2025年10月起,公开渠道可获取的Agent Skill已突破60万大关,且仍在不断攀升。技能(Skill)将专业领域知识、操作流程、脚本模板整合封装,初衷是让大模型实现"即插即用"的效果。
然而实际情况却相当残酷。
研究团队发现:即便将优质的技能文档直接呈现给模型,现有的大模型仍然会在多个环节出现系统性失误——
技能选择失当:本应调用A,结果却选中了B
参数配置混乱:技能虽然成功调用,但输入格式完全不符合规范
协调能力缺失:在多技能协同任务中,执行顺序杂乱无章,甚至遗漏关键步骤
适配能力不足:前一个技能的输出结果,未能进行适当的格式化转换便直接传入下一个环节
⚠️ 这并非模型智能程度不足,而是训练数据中严重缺乏"模型规范使用技能"的行为轨迹。模型仅在其熟悉的训练分布范围内运作,当遇到陌生技能时,自然倾向于忽视或错误运用。
这就好比让一个从未接触过咖啡机的人去研读厚厚的咖啡机说明书——他或许能"认知"咖啡机,但却无法制作出一杯合格的Espresso。
上海AI实验室提出的解决方案命名为SKT(Skill-use Training at Scale,大规模技能使用训练)。其核心逻辑可归纳为:与其坐等模型自行领悟,不如构建一套经过严格质量把控的训练数据体系,通过大规模、高质量的实战演练,使模型真正具备在复杂情境下调用与协调各类技能的能力。
完整的工作流水线分为三个阶段:
第一阶段:技能配置筛选
从公开技能库中精选2000项高质量技能,系统性地采集单技能、双技能、三技能等多种配置组合。关键之处在于——多技能配置并非简单的线性串联,而是真正需要跨技能深度协同的复杂组合。
第二阶段:任务合成与校验修复
针对每一类配置,采用规则生成(适用于结构化、可形式化验证的任务)与智能体生成(适用于需要语义理解的开放型任务)两种途径,自动合成训练任务。每一道"考题"均需通过规则校验、语义校验、难度管控三重关卡。不达标者?根据反馈信息自动修正,无法修复则直接淘汰。
第三阶段:轨迹筛选与保留
让能力强劲的教师模型(MiniMax-M2.5、GLM-5、Qwen3.5-397B-A17B、DeepSeek V4 Pro)在DeepAgents与OpenCode两种执行环境中运行任务,采集完整的交互轨迹。核心质量门槛随即开启:仅保留那些"确确实实、实质性地调用了配置中每一项必需技能"的有效轨迹。
投机取巧、绕开技能限制、借助其他途径应付任务的——一律剔除。
为何如此严苛?因为训练信号追求的是"规范的技能使用行为",而非"最终答案的正确性"。
最终,这套训练体系产出的成果包括:
2000 项精选技能
4000 个任务集合(1520个单技能任务 + 1295个双技能任务 + 1185个三技能任务)
27164 条通过严格校验的执行轨迹
研究团队选用Qwen3.5-9B与Gemma 4 E4B-IT两个模型,在SkillsBench、MolBench-Bind、AgentSkillOS-bench、SkillEval四个评测基准上展开了系统测试。
测试数据相当亮眼:
16组"模型-执行环境-基准"配对对比,性能全部实现提升
绝对提升幅度介于 3.20 分至 18.91 分之间
在SkillEval基准上,Qwen3.5-9B搭配DeepAgents从51.62分跃升至70.53分
然而更值得关注的是对照实验:若将流水线中的"校验+修复"环节移除,直接采用原始合成数据进行训练,4个基准上的得分无一例外地出现下滑。校验版数据相较于原始版数据,领先优势高达 11.91 至 24.61 分。
💡 这一结果揭示了一个重要规律:在合成数据的生产闭环中,校验环节绝非"锦上添花",而是"生死攸关"的必经环节。未经校验的合成数据,不仅无法提供正向价值,反而会成为损害模型性能的负面资产。
另一个细节同样值得深思:若在推理阶段不为模型提供技能文档,SKT训练所赋予的提升效果将大打折扣(仅余0.53至5.69分)。这表明SKT赋予模型的并非将技能知识"固化进参数",而是真正掌握运用外部技能的方法——这是一种具备迁移性的能力,与死记硬背有着本质区别。
当前Agent在多工具协同方面面临的困境,业内人士都心知肚明:
工具数量超过10个时,LLM的选择失误率显著攀升;工具数量超过20个时,上下文窗口被各类schema信息充斥,单次推理的token消耗从1万激增至4至5万;多个Agent共享工具池时,还会引发工具命名冲突、重试风暴等问题。
更深层次的挑战在于"时机把握"与"组合协同":
时机:何时调用何种工具?当前多数Agent将长期任务切分为离散步骤后,默认每一步都触发完整的推理流程,工具调用沦为机械式的程序响应,而非有节奏的智能响应
组合:多工具协同绝非功能的简单叠加,而是逻辑的有机编织。真正的协同要求Agent持续维护"工具角色共识"——搜索引擎扮演侦察兵角色,代码解释器承担工匠职责,API则是执行终端
SKT恰好瞄准了这一关键环节。论文中有一项重要发现:双技能任务处于一个"复杂度适中且模型仍可驾驭"的理想区间,SKT训练对提升技能协调与组合能力的贡献最为突出。
换言之,SKT正在系统性弥补Agent在"多工具协调配合"方面的能力缺口。
作为一项训练方法的创新成果,SKT自然存在其适用边界:
其一,目前主要探索最多3个技能的组合场景。现实世界中,复杂任务往往需要协调数十个技能,形成长程的、动态博弈的工作流(如有向无环图DAG结构)。SKT框架在应对此类高阶复杂性时的表现尚不明朗,作者将其明确列为未来重点攻关方向。
其二,跨执行环境的迁移能力存在局限。在某一执行环境(harness)上完成调优的模型,直接迁移至另一种环境后,性能收益仅能保留约一半。因此"单一checkpoint适配所有运行时"的愿景尚不现实。
其三,技能库的质量设定了能力上限。SKT所采用的是从2000个公开技能中筛选出的高质量子集。若原始技能库质量本就堪忧,再精妙的训练方案也难以力挽狂澜。
其四,人工把关仍不可或缺。工具调用的准确性、输出结果的可靠性,依然需要人类监督予以保障。SKT将AI从"撰写答案的代笔者"向"可实际执行任务的研究助理"推进了一大步,但方向判断、标准制定、结论审核,仍是人类责无旁贷的工作。
SKT的问世,昭示着一个清晰的转向信号——
AI竞赛的上半场,竞技焦点在于"谁的对话能力更强":上下文窗口更长、幻觉现象更少、表达更为流畅。
AI竞赛的下半场,竞技焦点转向"谁更善于运用工具":面对从未接触过的设备手册,能否迅速定位关键信息并正确操作;面对复杂的跨系统任务,能否协调十余个工具顺利执行。
上海AI实验室凭借2000项技能、4000道考题、27164条校验轨迹,为业界树立了一种可扩展、可验证、可复用的训练范式。这条路径或许并非终极答案,但方向无疑是正确的:
📌 工具本身并未改变,关键在于掌握使用的方法。
正如论文中的类比所揭示的——一位经验丰富的工程师,面对一本陌生的设备手册,也能迅速捕捉核心要点并规范操作,而非茫然翻阅后将其搁置一旁。
SKT致力于培养的,正是AI身上的这种"熟练感"。
这种熟练感,才是AI从"对话机器人"蜕变为"数字员工"过程中最具决定性的分水岭。