印度通胀数据17个月来首超央行设定目标
印度通胀上个月呈现加速态势,一年半以来首次突破印度储备银行的既定目标,令决策层保持警觉。根据周一发布的官方统计,6月份居民消费价格指数较去年同期攀升4.38%,超出经济学家预测的4.20%中值,超越了印度央行4%的目标值,不过仍处于央行2%-6%的容忍范围之内。5月份通胀水平为3.93%。即便如此,仅凭这份最新的通胀数据不太可能动摇印度央行的政策取向。行长Sanjay Malhotra上月指出,唯有当价格压力进一步蔓延时才会采取相应措施,同时将持续密切留意原油市场动态及季风气候的影响。印度央行在最近一次政
AI编程评估为何逐渐失灵?OpenAI撤销SWE-Bench Pro推荐
数月前,OpenAI还曾向业界推荐使用SWE-Bench Pro来衡量前沿模型的编程水平。而如今,这一推荐已被撤回。2026年7月,OpenAI公布了对SWE-Bench Pro的审查结论:在公开测试集涵盖的731个任务里,自动审核流程判定其中200个任务存在问题,占比达27.4%;人工标注则认定249个任务存在问题,占比34.1%。综合两类审核结果,OpenAI估算公开任务中约有30%属于"劣质"任务。所谓"劣质",并非指题目难度过高,而是指测试本身无法准确判定模型是否真正完成了任务。模型可能给出了合理
火箭回收创全球首例!中国本周科技突破连连
中国可重复使用运载火箭技术 实现里程碑式进展 天问二号“追星”启动 首个国产十万卡AI超算系统 成功启用 本周,我国多项重大创新成就 集中展现 完美回收!中国可重复使用火箭技术实现里程碑式进展 7月10日12时15分,长征十号乙运载火箭在海南商业航天发射场点火升空,将卫星精准送入预定轨道,火箭一二级分离约6分钟后,一子级垂直返航,在海上回收平台通过网系捕获方式圆满回收,发射及一子级回收任务取得完美成功。 本次任务是我国首次成功实现运载火箭一子级精准回收,同时也是全球首次运载火箭网系回收,标志着我国在可重复
ZoomInfo发布GTM Bench,确立AI销售新标准
Zoom(89.87, -0.01, -0.01%)Info Technologies Inc.近期正式推出GTM Bench评测体系,旨在针对大型语言模型及AI智能体在实际市场推广场景中的效能进行专业评估。 该体系从“任务达成率”与“数据可溯性”两大核心指标对AI系统打分:前者反映系统完成指定任务的比例,后者评估返回数据源自真实、实时信息的程度。在首期测评中,ZoomInfo旗下的GTM.AI以77分的综合得分领先,Apollo得分为47分,Exa为36分,开放网络搜索仅为31分。数据显示,ZoomIn
AI应用前沿|Tool-Genesis:驱动自进化语言智能体工具创建的任务导向基准 (1/20篇) · 7月6日
2026年07月06日星期一Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent自进化语言智能体领域正快速推进,然而其依据任务需求进行工具构建、适配与维护的能力尚缺乏系统性的评估手段。当前主流基准多受制于预先设定的规范框架,制约了系统的可拓展性与自主进化空间。本研究推出诊断型基准Tool-Genesis,致力于从接口规范性、功能准确性及下游实用价值等多元视角对智能体能力进行量化评估。该基准检
Claude Opus 4.7终端测试仅得62.5分?8万条真实操作录像揭示AI评测新基准
这项研究结论出自伦敦大学学院(UCL)、南京大学与腾讯的联合研究团队,他们通过全新基准TerminalWorld进行实测。研究人员从开发者自愿分享的八万多条真实终端操作记录中,提炼出一份如"照妖镜"般的测试题库。在这份测试中,顶级AI智能体的最高得分仅为62.5%。为何偏偏聚焦"终端"?近年来AI编程能力显著提升,GitHub Copilot、Claude Code、Codex CLI等产品陆续推出,它们"会写代码"的能力备受赞誉。然而软件开发远不止编写代码
首款AI Infra运维智能体评测基准开源,基于近百亿条真实数据检验Agent解题实力
随着全球智能体加速落地,算力需求呈指数级爆发,以GPU为核心的AI基础设施正变得愈发关键。据摩根士丹利报告预测,2028年全球AI基础设施累计总投资将达2.9万亿美元。然而,根据行业通用成本结构测算,其中由运维人力、故障损失与集群闲置构成的成本占比可高达15%~20%,全行业潜在的可优化空间超过4350亿美元。作为全球领先的AI基础设施服务商,无问芯穹早在去年10月便率先启动研发并成功部署早期版本的运维智能体。实践表明,相比传统人工运维,智能体显著提升了整体运维效率:工单平均处理时长缩短50%,关键故障处
AI行业动态速览 06.22-06.28
回看过去七天,AI领域的震荡远比预想中剧烈。OpenAI瞄准万亿美元估值的高歌猛进、Anthropic在芯片层面的绝地反击、微信坐拥14亿月活的入口卡位——每一桩事件都在改写这个赛道的格局。从6月20日开始,部分微信用户察觉到主界面左上角悄然出现了一个“绿色眼睛”图案。这正是微信自主研发的AI助手“小微”的灰度测试入口。其技术底座融合了微信自研大语言模型WeLM与DeepSeek,可通过文字或语音指令直接操控微信原生功能,包括调整设置、发送消息乃至拨打电话。然而这仅仅是序幕。真正让开发圈沸腾的是其“一句话
OpenAI发布新系列模型 Sol性能领先竞品
OpenAI 于6月27日发布 GPT-5.6 家族,包含 Sol、Terra、Luna 三种规格。Sol 在 Terminal-Bench 2.1 编码测试中标准得分 88.8%(领先 Claude Mythos 5 的 88.0%),Ultra 模式达 91.9%;采用 Cerebras 晶圆级芯片,推理速度最高 750 tokens/秒(约为 GPT-5.5 的 15 倍)。基于美国政府安全审查要求,GPT-5.6 采用限量预览模式发布,全面上线时间尚未确定。全系型号(含轻量 Luna)在网络安全与
美债走强 通胀指标表现温和令加息概率下滑
短期美债价格上扬,此前美联储重点关注的通胀数据表现温和,令交易员对未来加息的预期略有降温。 债券价格上涨使得对货币政策变动最敏感的两年期美债收益率下挫4个基点至4.10%。10年期基准国债收益率回落3个基点至4.36%。 互换市场显示,交易员削减了对美联储年内加息的预期,目前市场定价反映至12月加息幅度约33个基点,而周三尾盘约为36个基点。定价还表明官员在7月会议上升息的可能性进一步减小。 5月个人消费支出价格指数环比增长0.4%,低于彭博调查经济学家预测的0.5%中值。扣除食品和能源的核心个人消费支出
AI领域人才争夺与政策博弈:2026年6月23日动态
🧬 诺贝尔化学奖得主转投Anthropic,AI科学人才竞争白热化 2024年诺贝尔化学奖获得者、AlphaFold关键负责人John Jumper于6月19日(韩国时间)公开声明,结束在谷歌DeepMind近九年的任职,正式加盟Anthropic。这是DeepMind一周内流失的第二位标志性专家(此前Transformer八成员之一、Gemini联合主管Noam Shazeer已宣布转投OpenAI)。核心在于,AI竞赛的重点已从“模型性能谁更优”转向“谁能将顶尖科学人才融入自身产品化路径”——Jump
AI动态 | GPT-5.6延期传闻、Transformer核心人物转投OpenAI、开源方案崛起
2026年6月23日 · 星期二在预测平台Polymarket上,"GPT-5.6不会在6月28日前公开亮相"的预期概率一天内猛增67%,现已攀升至78%。内部消息指出该模型"运行速度仍不理想,尚未就绪"。而7月31日前推出的概率则为95%。OpenAI首席科学家Jakub Pachocki在6月11日的内部文件中将GPT-5.6描述为"实质性的进步",但官方始终未公布具体发布时间。当前GPT-5.5仍是主力生产模型。据悉,GPT-5.6有望实现150万to
AI新秀Fugu登场:多模型协同能否颠覆未来?
Sakana Fugu 是否只是 AI 服务的聚合外壳?最新亮相的 Sakana Fugu,自诩为"多智能体编排框架",仿佛一位运筹帷幄的乐团指挥:包含两种配置:Fugu:在响应速度与性能表现间寻求平衡,适用于常规编程、代码审阅及交互式应用。Fugu Ultra:侧重输出品质的极致追求,专攻高复杂度挑战。在自动化数据科学探索中:先行体验者以近乎无人值守的模式运转 Sakana Fugu,观察到其在鲜有人员介入的情境下依然能够斩获突破性进展。于我方而言,这正是 Fugu Ultra 的核心使命所在:应对开放
AI看空系列:Trace盛宴与虚假繁荣
"他们不过是在驾驶着空壳飞机四处游荡。" —— MB之子英伟达堪称指路明灯,是猎户腰带,更是整片星河。英伟达正享受着旺盛需求的红利,然而其客户群体极度聚焦,而这些客户自身的需求正被一段难以为继的"基准测试期"所扭曲。这种畸形需求经由定制化供应承诺,如鞭梢般层层抽打英伟达的供应链,一路波及数据中心的融资链条。笼罩其上的是"虚假繁荣"(the bezzle)——一旦察觉便无法忘却;一旦被戳破,即刻烟消云散。所幸的是,英伟达这颗"明星"——它的Gr
马斯克预测中国AI明年Q1达Fable水准,智谱AI回应
虽说跑分数据漂亮,但从实际应用价值看,哪怕明年一季度也能令人惊叹。Anthropic找准了方向,致力于提升实用智能,这些优势虽不体现在跑分里,却实实在在地转化为了营收。翻译:虽说基准测试成绩不错,但若论实际使用价值,即便是在2027年第一季度,其表现也相当出色。Anthropic的路线非常正确,致力于构建真正有价值的智能系统,这种优势在测试榜单上看不到,但在营收上却一目了然。阿菊认为这句话的核心在于:商业变现比单纯的技术能力更关键。这种难得的良性互动也表明,马斯克始终在关注着中国AI技术的演进。据悉,GL