Floatboat创新推出HLR指标,量化AI执行系统价值增益
8月7日,AOE Tech Labs正式发布旗下人工智能代理工作台Floatboat所搭载的底层执行系统Harness在五项权威第三方基准测试中的完整性能数据。本次测试以DeepSeek-V4-Flash作为统一的模型基座,结果显示Floatboat Harness在DeepSWE、Terminal Bench 2.1、Toolathlon、BrowseComp及AutomationBench五项评测中均显著优于搭载Claude Opus 4.8模型的对比系统,而后者的混合单价达到前者的57.1倍。
本次评测的对照组并非简单的裸模型调用,而是采用DeepSeek官方Harness系统。同一DeepSeek-V4-Flash模型在官方Harness框架下DeepSWE得分为54.4,低于Opus 4.8的58.0分;接入Floatboat Harness后该得分跃升至67.25。在模型权重与单位成本均保持一致的前提下,唯一变量仅为Harness本身。评测数据进一步揭示,任务链条越长,Harness所带来的增益效果越显著——从短程任务的1.9%逐步攀升至长程任务的23.6%。五项基准测试均由第三方专业机构独立设计,其中BrowseComp直接出自OpenAI官方。
AOE Tech Labs同步发布HLR(Harness杠杆率)这一全新评估指标,旨在对执行系统放大模型能力的效果进行精确量化。该公司同时确认,在完整的客户端环境中运行相同批次基准测试,实际成绩将优于已公布的数字,详尽数据将在后续披露。
本次评测的突破性意义在于首次将"模型之外的那半个系统"——即人工智能代理的核心执行层——纳入公开可量化的评估体系。随着人工智能代理日益深入实际业务场景,执行系统的标准化测评有望成为业界关注的新焦点。
人工智能训练师学习项目正式启动
《关于深入实施"人工智能+"行动的意见》明确指出,"到2030年,我国人工智能将全面赋能高质量发展,新一代智能终端、智能体等应用的普及率突破90%"、"到2035年,我国将全面迈入智能经济和智能社会发展的崭新阶段"。在这一系列政策红利的驱动下,人工智能训练师作为"AI+行业"落地的核心人才力量,其市场需求与人才规模有望迎来井喷式增长。
文件