标签

日本3月实际工资再涨第三月 支撑央行6月加息

日本政府周五公布的数据显示,3月实际工资同比增长1%,已是连续第三个月保持上行,为日本央行在6月下次政策会议上推进加息提供了进一步支撑。 从数据看,日本薪资增长的延续性较强,日本春季劳资谈判也已连续第三年实现5%以上的加薪幅度。 日本央行将于6月15日至16日再次讨论利率决议。央行认为,薪资与物价能够稳步走高是再度加息的重要前提。相关调查显示,近三分之二的经济学家预计日本央行将在6月底前将基准利率上调至1.0%。 经通胀调整后的实际工资,是衡量家庭购买力的关键指标。虽然3月较2月修正后的2%涨幅有所回落,

2026-05-08 07:41:08  |  31 阅读

AI幻觉五因剖析与风险治理

摘要:AI大模型真正走向落地时,幻觉问题就变成行业绕不开的核心难题。相关研究对AI幻觉背后的五类关键成因进行了系统梳理:一是统计式生成驱动的补全机制,二是知识边界处出现的专业断层,三是提示环节的设计不足,四是组织层面对速度的过度追求,五是检索与生成环节之间的衔接错位;同时可以看到,幻觉风险在专业边界区域往往会明显上升。研究还强调,实验室里的基准评测与真实世界之间存在较为突出的测量偏差。在公共服务、医疗、网络安全等业务场景中,幻觉产生的错误可能越过界面限制,直接渗入业务流程,从而带来较为严重的影响。研究进一

2026-05-07 14:27:03  |  25 阅读

AI应用论文精选:WindowsWorld与智能体研究进展(5月7日)

2026年05月07日星期四WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments🤗 9现有GUI智能体基准多集中在单一应用的独立任务,往往忽略真实工作中常见的跨应用流程。为补足这一短板,本文提出WindowsWorld基准。该基准基于多智能体框架还原16类职业场景,构建181个多步骤任务,并统计每个任务平均包含5.0个子目标,其中跨应

2026-05-07 11:57:51  |  24 阅读

365天改革落地:公募基金用行动回应高质量发展

编者按: 2025年5月7日,《推动公募基金高质量发展行动方案》正式发布。作为公募行业高质量发展的纲领性文件,它聚焦行业发展中的关键难题与突出短板,勾勒清晰的未来路径,并提出25条系统性改革安排,同时配套推进多项制度部署,为行业持续深化改革提供有力支撑。 我们也看到,公募行业正呈现更强的活力,发展质量与效能稳步提升。恰逢《行动方案》发布满一周年,本报将以全景视角回顾改革推进过程,梳理阶段成效,并进一步研判行业后续发展方向。 《推动公募基金高质量发展行动方案》(以下简称《行动方案》)发布满一年后,公募基金行

2026-05-07 08:22:26  |  18 阅读

欧气市场波动不止 霍尔木兹海峡对峙成焦点

美伊矛盾再度激化,中东地区脆弱的停火状态引发交易者高度警觉,导致欧洲天然气价格出现波动。 周二的基准期货在涨跌之间摇摆不定,不确定性笼罩市场氛围,此前周一曾录得5.2%的涨幅。这些合约与原油价格保持着密切的联动关系。 美国中央司令部周一发布声明称,在护送两艘美籍货轮穿越霍尔木兹海峡时,成功拦截了来自伊朗的无人机、导弹及快艇攻击。这场军事对峙——连同针对阿联酋的最新袭击行动——使美伊两国持续四周的脆弱和平再遭威胁。 阿姆斯特丹时间12时27分,欧洲天然气标杆——荷兰近月期货合约微升0.6%,报每兆瓦时48.

2026-05-05 21:03:55  |  15 阅读
摩科瑞控告波罗的海交易所 中东原油运价基准失真致重大损失

摩科瑞控告波罗的海交易所 中东原油运价基准失真致重大损失

大型商品交易企业摩科瑞能源集团已对波罗的海交易所提起法律诉讼,指控其一项关键的中东原油运价基准出现失真,为公司带来重大经济损失。 摩科瑞能源集团已向英国伦敦高等法院对波罗的海交易所旗下负责编制运价基准的分公司Baltic Exchange Information Services Ltd提起诉讼。根据法律文件,争议的核心点在于从中东向中国运输原油的运费计算,也就是所谓的TD3C航线定价标准。 摩科瑞表示,这一运价基准的失真情况已经导致公司承受了数亿美元的财务损失。波罗的海交易所(隶属于新加坡交易所)及摩科

2026-05-01 06:53:24  |  14 阅读

人工智能测度新框架

人工智能测度新法及其应用一种面向人工智能测度与应用分析的新方法■作者简介李晓宇,武汉大学经济与管理学院博士研究生叶初升,武汉大学经济与管理学院教授、经济发展研究中心联席主任■研究内容人工智能对经济活动的影响,主要取决于其被应用的广度以及自身的智能强度。如何准确衡量人工智能水平,是相关研究中的基础性与关键性问题。本文结合人工智能在不同基准测试中的表现及其横向对比,优化了智能水平的测度思路,并据此构建出一个同时包含智能水平的人工智能应用指标。在新一轮科技革命和产业变革快速推进的背景下,人工智能正成为重塑全球产

2026-04-27 10:40:04  |  10 阅读

AI智能体评估体系全面解读

整合Anthropic工程报告、学术动态及产业应用现状,时间截至2026年4月重点提示:大语言模型评分器需定期与人类专家标准对齐;应为模型设定“难以判断”的退出机制以规避幻觉现象。基本策略:单元测试(通过/失败)+ 静态分析 + LLM代码质量评估典型基准:基本策略:多维度评估(任务达成度 + 交互体验)+ 状态校验 + LLM模拟用户典型基准:基本策略:基础性检验 + 覆盖性检验 +

2026-04-26 18:16:12  |  14 阅读

国产顶尖AI模型对决:DeepSeek-V4与GLM-5.1的科研应用深度剖析

智谱AI旗下Z.AI研究部门低调推出了新一代面向长周期智能体任务的旗舰模型GLM-5.1,该模型拥有7540亿参数。就在不久前,DeepSeek正式发布了其第四代旗舰系列DeepSeek-V4,其参数量达到1.6万亿,并将百万级超大上下文窗口设定为所有官方服务的标准配置。从科学研究的角度审视,不能仅凭其在标准化对话中的主观感受来评判,必须将其置于严苛的跨学科基准测试环境中。科研任务的复杂性要求模型必须同时具备处理高维偏微分方程的数理逻辑推演能力、在海量基因序列或学术文献中进行无损信息提取的检索能力,以及在

2026-04-26 11:46:10  |  20 阅读

OpenAI生命科学研究利器GPT-Rosalind问世

2026年4月16日,OpenAI正式发布其专为生命科学研究设计的推理模型GPT-Rosalind。该系列模型针对科研工作流进行了深度优化,融合了对化学、蛋白质工程及基因组学等领域的深刻认知,并强化了工具使用能力。在美国,一款新药从靶点发现到获批上市往往需要10至15年漫长周期。生命科学的进展不仅受制于基础学科的挑战,更因研究流程的繁琐而受阻。科研人员需在海量文献、专业数据库、实验数据及持续演化的假设间穿梭,以生成并评估创新思路。这类工作流普遍存在耗时长、碎片化且难以规模化的问题。OpenAI坚信,先进的

2026-04-24 17:31:58  |  30 阅读

强化智能优先:企业为何仍需依赖人类智慧?

如果你并非从事软件开发,在会议或董事会上,你或许曾被问及:“我们要如何落地 AI?如何真正实现投资回报?”全球都在寻找答案,但答案依旧难以捉摸。近期 AI 工程学的突破与往昔的经验教训,有助于我们构建切实可行的方案。在探讨方案前,必须正视现状。迄今为止,多数 AI 基准测试对该领域而言是一种尴尬的沉默。模型在标准化考试、法考及学术数据集上常能取得近乎完美的成绩,却在真实的专业场景中表现欠佳。缘由很简单:基准测试考查的是模型记忆了什么,而非它能做什么——这被称为“数据污染”,即模型在训练阶段已看过答案。Me

2026-04-23 07:53:34  |  20 阅读

32万亿银行理财信披迎变!规范升级引关注

登录新浪财经APP 搜索【信披】查看更多考评等级 来源:国际金融报 《银行保险机构资产管理产品信息披露管理办法》(简称《信披办法》)定于今年9月1日起正式执行,银行理财产品的信息披露细节正经历密集性的变动。 据《国际金融报》了解,齐鲁银行近期多次发布公告,补充了产品说明书中的管理人详情及单一投资者持有上限等缺失信息,并大规模修订了数十款产品的业绩基准、浮动管理费计提标准及提取比例。同时,自今年2月起,多家银行理财子公司也开始频繁更换旗下产品的业绩基准“锚点”。 业内专家表示,在强监管的宏观背景下,理财业务

2026-04-23 02:17:55  |  15 阅读

AI反洗钱技术学术前沿洞察

AI技术在反洗钱领域的学术探索正呈现井喷态势。2024至2025年,众多顶级学术会议与预印本平台相继发布了大量高质量的AML主题论文,研究范围横跨可疑交易识别到调查全流程辅助。本文筛选出其中最具代表性的研究成果,旨在为业界人士呈现一幅完整的学术技术蓝图。值得注意的是,本文集中探讨学术论文的创新贡献与方法论体系,关于监管架构的内容已在系列首篇中系统阐述,故不再赘述。图1:交易网络中正常交易(蓝绿)与异常交易(橙红)的拓扑可视化AMLNet(Huda等人,arXiv:2509.11595,2025年9月)[1

2026-04-22 02:18:22  |  25 阅读

新基准测试出炉:大模型视频理解能力遭“打脸”,专家90分遥遥领先

日常生活中,当人们依赖多模态大模型处理视频时,往往感觉它似乎无所不知,但仔细一问又显得支支吾吾。尽管各大视频理解榜单上排名靠前,实际体验却往往不尽如人意,这究竟是为何?Video-MME-v2引入了一种全新的非线性关联评分机制,将大模型拉回了现实。2024年,Video-MME团队推出了Video-MME,主要测试模型在不同时长下的跨模态视频理解水平,目前已成为Gemini和GPT等众多大模型的重要评测标准之一。经过近一年的打磨,该团队发布了新一代评估体系,通过严苛的分组连贯性测试,彻底杜绝了模型靠碎片化

2026-04-20 07:21:48  |  20 阅读

我国发布具身智能首份行业标准 助推AI技术产业化进程

2026年4月1日,工业和信息化部正式批准并发布了《YD/T 6770—2026 人工智能 关键基础技术 具身智能基准测试方法》。这份标准是具身智能领域的首份行业规范,计划于同年6月1日起实施,并将同步推动国际标准的立项工作。具身智能是人工智能的一个重要分支,指的是智能体通过物理实体与环境进行实时互动,从而实现感知、认知、决策与行动一体化的智能系统,其应用形态包括智能机器人、自动驾驶汽车、无人机等。该标准旨在建立一个统一的测试框架,对仿真环境和真实环境中的测试条件、任务集合、操作流程以及指标计算方式进行规

2026-04-18 12:12:08  |  17 阅读