标签

NVIDIA加码AI安全,Agent攻防与成本控制成新焦点

摘要今日AI领域最引人注目的趋势并非新模型的问世,而是智能体在获得高权限后,如何应对安全挑战、协作治理及成本管控。NVIDIA近期在招聘中大幅扩充“AI安全与工程”团队,涵盖漏洞发现与修复、平台工程等职位。8月9日收官的DEF CON 34 AI Village展示了Agent在真实工具环境下的攻防演练;WeClawArena、EcoAgent-Bench等新基准测试,则将跨用户权限、预算限制及多模态数据流纳入评估体系。一、NVIDIA扩充AI安全工程团队:安全开始成为独立研发能力NVIDIA此次招聘的“

2026-08-10 06:37:32  |  2 阅读

Floatboat创新推出HLR指标,量化AI执行系统价值增益

8月7日,AOE Tech Labs正式发布旗下人工智能代理工作台Floatboat所搭载的底层执行系统Harness在五项权威第三方基准测试中的完整性能数据。本次测试以DeepSeek-V4-Flash作为统一的模型基座,结果显示Floatboat Harness在DeepSWE、Terminal Bench 2.1、Toolathlon、BrowseComp及AutomationBench五项评测中均显著优于搭载Claude Opus 4.8模型的对比系统,而后者的混合单价达到前者的57.1倍。本次评

2026-08-09 16:42:35  |  6 阅读

DR贷款加速普及 多地探索新定价基准

继海南完成首批DR贷款后,全国多地也开始实施当地首单项目。专家指出,贷款定价的“锚”除了LPR外,正式增加了DR这个“新选项”。 近期,深圳、上海、武汉等地纷纷跟进,通常采用DR001(隔夜回购利率)作为定价依据。 例如,工商银行深圳分行近期落地了深圳首笔基于DR001的贷款,向本地民营战略性新兴产业企业发放了5000万元浮动利率贷款。上海银行也向国家高新技术企业S公司发放了5000万元流动资金贷款,同样以DR001为基准。 专家普遍认为,DR基准利率贷款的落地为货币政策传导开辟了新的路径。 光大证券副所

2026-08-09 14:12:03  |  2 阅读

巴西基准利率下调至14% 经济增速放缓通胀降温

下载新浪财经APP,了解全球实时汇率 巴西央行连续第四次议息会议决定下调基准利率25个基点,此前公布的最新数据表明,经济增长势头减弱,通胀降温幅度超出市场预期。 由Gabriel Galípolo领导的巴西央行货币政策委员会成员于周三晚间将基准Selic利率下调至14%,这一决定与彭博社调查的全部经济学家预期相符。自3月份以来,累计降息幅度已达100个基点。 决策层全票通过此项决议,未给出前瞻性指引,并强调未来政策走向将依据后续公布的数据而定。 政策制定者在随利率决议发布的声明中指出:"本轮调整周期的总体

2026-08-06 06:09:30  |  9 阅读

英国NHS拟调整Palantir数据平台评估标准 此前员工对统计方式提出质疑

英国国家医疗服务体系(NHS England)打算修改其对备受争议的Palantir数据平台效果的评估手段。此前内部员工曾表示相关分析方法存在不足,涵盖两项最常提及的关键绩效指标:运用该平台的医院"额外开展11万例手术"以及"出院延迟降低15%"的统计手段将进行修正。 根据邮件内容,NHS England官员对评估基准线提出疑问,认为将平台启动后六个月的手术量与启动前六个月加以对比,可能因明显的季节性起伏而产生偏差。另一名官员在审核出院延迟计算方法时也提出了类似看法。NHS England于6月11日表示

2026-08-03 15:32:13  |  7 阅读

研究指出DeepSeek新模型成性价比最高知名AI

根据一家研究机构的分析,中国初创企业DeepSeek推出的旗舰AI模型版本,在基准测试中的运行费用远低于全球知名模型,相较于Anthropic的Claude Fable 5,其成本低逾100倍。 知情人士透露,DeepSeek正在筹备潜在的首次公开募股。该公司于上周五正式发布了V4-Flash模型,这是其通过发挥核心优势——提供超低成本的AI替代方案——来重振增长势头的最新举措。研究公司Artificial Analysis的数据显示,DeepSeek的V4-Flash模型每百万输入token收费0.14

2026-08-03 15:12:03  |  12 阅读

阿里推出千问3.8-Max,中国AI模型实力再升级

阿里(122.25, 5.93, 5.10%)巴巴发布了最新的旗舰级人工智能(AI)模型,并称其性能可与Anthropic的Fable等全球领先产品相媲美。 这款名为千问3.8-Max的新模型拥有2.4万亿个参数,在某些基准测试中的排名高于月之暗面近期发布的备受瞩目的Kimi K3模型。阿里巴巴分享的结果显示,该模型的得分与Anthropic的Fable 5相当,有时甚至更胜一筹。 阿里巴巴这款新模型首次亮相前,月之暗面的Kimi K3已于上月在股市和硅谷引起了轰动。DeepSeek也于上周推出了其旗舰模

2026-08-03 12:53:05  |  11 阅读
DeepSeek-V4-Flash正式版开放公测,性能超越智谱GLM-5.2

DeepSeek-V4-Flash正式版开放公测,性能超越智谱GLM-5.2

新浪科技讯 7月31日下午消息,DeepSeek-V4-Flash(V4 Flash)正式版 API今日正式开启公测。据官方说明,V4 Flash的Agent能力获得显著提升,在多项基准测试中的表现远超V4-Pro-Preview及智谱GLM-5.2等模型。 针对公开基准测试集中的Code Agent任务,正式版V4 Flash采用DeepSeek Harness(即将推出)的极简模式作为测试框架,并启用max档位,参数设置为topp=0.95,temperature=1.0。 当前,正式版V4-Flas

2026-08-02 19:57:58  |  12 阅读

研究揭示:AI协作效能的关键不在工具,而在使用者的实力

最近我的各种AI群聊又沸腾了。起因是一家大公司推出了新一代模型,基准测试成绩霸榜,许多人连夜掏钱订阅。也有朋友截图来问:这个新模型问世,我是不是该把现在的助手换掉?说实话,看着满屏“选哪个AI最好”的争论,我脑海中全是今年七月刚发表的一篇论文。读完它,你会觉得我们很多人可能都白费力气了。论文标题很直白,叫《决定人机协作效果的,不是AI有多强,而是人有多强》(Human Capability, Not AI Benchmark Scores, Predicts Human-AI Collaboration

2026-07-18 20:36:17  |  17 阅读

上海推出首个疑难病例AI诊疗评测标准

7月18日,2026世界人工智能大会医学分论坛于上海徐汇西岸启幕。会上,上海推出了行业首份针对疑难病例的AI诊疗评测标准,涵盖30个临床专科,旨在验证医疗大模型应对复杂病例的实际水平。此外,现有的医疗AI评测系统升级至5.0版本,引入了“原子技能”评估机制,有助于修正AI模型可能产生的虚假内容。基础设施层面,上海市卫生健康行业算力服务中心宣告成立,构建了涵盖算力提供、数据合成、模型训练及智能应用的全流程生态。据预测,至2026年末,上海医疗健康语料库容量将突破2PB,数据筹备时间有望缩减六成以上。论坛还推

2026-07-18 20:13:04  |  20 阅读

榜单成绩亮眼、实际表现拉胯:2026年的AI评测,我劝你别全信

AI 观点 · 热议▲ 榜单上门门 A+,一到干活就「原地社死」你肯定见过这种场景:某个新模型一发布,朋友圈全是「刷新 SOTA」「屠榜」「碾压一切」的截图,气势汹汹。结果你兴冲冲打开一用——嗯,看着挺聪明,干活总差那么一口气。别怀疑自己,也别怀疑人生。真不是你的错觉——2026 年,AI 榜单的水分正在被一个个当场拧出来。今天我把几件最有意思的「翻车现场」讲给你听。先说编程界最出名的考试SWE-bench Verified(让 AI 去修真实的 GitHub bug)。搁一年半前,谁能考过 50% 都能

2026-07-18 09:23:21  |  19 阅读

理财基准"换装"背后:净值化转型让收益更透明 投资者需主动适应

"我行自主理财产品将在8月初全面采用挂钩指数型业绩比较基准。投资者看到的将不再是固定数值,而是由多指数加权组合构建的业绩比较基准。"7月15日,一家正在积极争取理财公司牌照的中小银行理财业务部工作人员吴莹告诉中国证券报记者,为了让客户直观看出产品业绩是否跑赢对标指数,该行正在开发测试"双曲线可视化"系统,将指数基准换算成每日数值,并与产品实际净值分别形成一条曲线并列展示,以便对比。当前,多家理财公司将理财产品的业绩比较基准由固定数值型切换为动态指数型。某头部股份行理财公司产品部人士向记者表示:"公司正全面

2026-07-16 14:35:04  |  17 阅读

韩国央行加息25个基点,基准利率升至2.75%

韩国央行决定将政策利率由2.50%提高至2.75%,并预期利率将维持在2.75%水平。 编辑:王永生 新浪财经提示:本信息源自合作媒体,新浪财经转载此内容旨在提供更多资讯,文中观点仅供用户参考,不构成任何投资指导。 郑重声明:1.依照《证券法》相关条款,严禁捏造、散布不实或误导性信息,干扰市场秩序;2.本社区用户所发布的任何资料、言论均属个人见解,不代表本平台立场,不构成投资建议。投资者需独立判断,自主决策并自负盈亏。

2026-07-16 11:27:14  |  26 阅读

AI资讯速递|2026-07-14 · Claude Sonnet 5对决Opus 4.8:编程智能体评测与成本效益全面分析

01PART模型发布/更新MODELS#1 Claude Sonnet 5对决Opus 4.8:编程智能体评测与成本效益全面分析MarkTechPostAnthropic最新推出的Claude Sonnet 5在智能体编程任务上大幅拉近了与旗舰Opus 4.8的距离,同时延续了Sonnet系列的低Token费用优势。根据MarkTechPost汇总的测评结果,Sonnet 5在多项代码生成和工具调用基准中几乎比肩Opus 4.8,但在复杂多步推理方面仍有欠缺。这一代际突破意味着预算有限的开发组也能享受到接

2026-07-14 16:11:21  |  20 阅读

AI助手记忆遭潜伏篡改:隐形注入攻击深度解析

不知道你是否用过此类AI个人助手。它能记住你的饮食喜好与工作习惯,自动帮你查阅邮件、整理日程,甚至无需你主动指令,后台就能定时梳理待办事项并推送给你。这种能长期运行且自带持久记忆的AI代理,正让我们的数字生活愈发便捷。然而,南洋理工大学与约翰斯霍普金斯大学的最新研究揭示了一个安全盲区:一封普通邮件,便能悄然向AI的长期记忆注入虚假信息,用户全程毫无察觉,而这些假信息会在未来某个时刻悄悄影响AI的判断与行为。这便是论文提出的隐形内存注入(stealth memory injection)攻击。研究者不仅完整

2026-07-14 12:20:07  |  25 阅读