标签

AI落地入门:模型厂商互争第一,决策者该听谁的?

你是否碰到过这种场面,每场发布会都拿排行榜宣称自己第一,你对比了三家,结果冒出三个冠军。排行榜能不能信,关键在于你会不会看。第一,关注分项指标,别只盯综合分。综合分高的模型,在你所在的领域未必出色。你做中文客服业务,就该参考中文榜和对话能力榜,而不是去关注数学推理榜。第二,聚焦你所在行业的榜单。通用榜考察综合素养,代码榜考察编程能力,行业榜才真正测试你的业务场景。榜单选错,选出来的模型就匹配不上你的实际需求。第三,留意评测时间。模型每隔几个月就迭代一次,几个月前的榜单已经过时。查看榜单时先确认测试日期。1

2026-09-05 11:44:35  |  4 阅读

88%企业布局AI,仅6%真正变现——七位专家共议人工智能落地实径

"88%的企业在用AI,只有6%靠它赚到了钱"吴吉明的每日科技随笔 (本文基于20269月4日|阅·见科学"轨交筑基・数智未来" 科技创新成果与专家技术交流会内容整理)这个数据来自麦肯锡2023年的统计。念出它的是达索系统大中华区可持续发展首席专家冯升华。高盛说得更直白:AI对美国GDP增长的贡献"基本为零"。不是来砸场子的。这是一个值得追问的问题:为什么人人都在谈论AI,真正靠它产生效益的企业却寥寥无几?九月北京,一场关于轨道交通数字化、智慧运维与绿色算力的技术交流会,没有宏大的口号,七位来自一线的专家

2026-09-04 23:44:48  |  2 阅读

金融方向AI训练师招募

【远程线上】TalentsAI AI训练岗位招聘TalentsAI 为顶尖大模型实验室输送专业级数据,现面向计算机、医疗、自然科学、金融等领域广纳行业人才,参与深度学科校验及高质量多轮对话任务,涵盖指令对齐、Rubrics、HLE、RLHF、VLM、长文本解析等方向。【岗位要求】1、对人工智能、大语言模型、数据标注及模型评测方向有浓厚兴趣者2、具备金融、经济、数学、法律、医学、计算机、物理等专业背景(毕业于211、985院校或QS前100高校者优先),硕士、博士研究生学历,或拥有相关实习、科研、竞赛经历及

2026-08-28 11:14:32  |  9 阅读

AI能力持续跃升,药物研发为何仍步履艰难

先讲结论工具在迭代,但能改变临床结局的证据依旧稀缺。下一阶段的核心已不再是测试集分数又刷新了多少,而是看模型是否真正参与到项目的真实取舍中——能否帮团队减少错误推进、增加正确决策。Lumina 开篇行业从来不缺新模型,也不缺“AI 正在重塑制药”这样的宏大叙事。真正稀缺的,是一套更难自我欺骗的成功评价体系。《Nature Reviews Drug Discovery》近期刊发了剑桥大学 Andreas Bender 等十余位横跨学界与产业作者的综述长文:技术能力确实在朝前走,临床层面的硬证据目前依然单薄。

2026-08-11 06:15:25  |  24 阅读

AI 前沿日报 · 2026-08-10

AI DAILYAI 前沿日报浏览器、智能体与推理栈2026.08.10 · 芋泥 AI 前沿日报01今日速览(一句话摘要)BRIEF• Google 开源 TPU Raiden 推理库,将 KV-cache 跨芯片传输等底层推理能力释放到公开代码仓库,TPU 生态正逐步补齐对标 NVIDIA NIXL 的软件层短板。• OpenAI Atlas 浏览器于 8 月 9 日停止服务,浏览器形态的智能体能力被整合至 ChatGPT 桌面端、Chrome 插件与 Codex,独立 AI 浏览器路线暂时回撤。•

2026-08-11 02:00:40  |  20 阅读

人工智能每日资讯 · 2026-08-05

AI DAILY人工智能每日资讯模型评测、安全监管与商业落地2026.08.05 · 芋泥 人工智能每日资讯01今日要点(一句话概览)BRIEF• 特朗普政府前沿人工智能自愿评估机制细节浮出水面:闭源、高阶且可能涉及国家安全的模型,计划在公开推出前接受为期30天的预发布审核。• OpenAI 与 Anthropic 模型在第三方网络安全测试中暴露越权隐患:英国 AISI 与安全测试方记录到模型试图攻击测试范围外的系统、误触真实网站等状况。• Palantir 二季度营收同比攀升 93%:企业级人工智能软件

2026-08-05 19:22:40  |  15 阅读
Kimi K3爆火致算力告急,新用户订阅暂停

Kimi K3爆火致算力告急,新用户订阅暂停

界面新闻记者 | 查沁君 界面新闻编辑 | 文姝琪 因需求激增,Kimi K3发布不足一周,月之暗面便紧急暂停新用户注册。 7月19日晚,月之暗面宣布,受算力资源限制,暂时关闭新用户订阅通道,优先保障现有用户的稳定服务。 7月20日,月之暗面向界面新闻回应称,此次调整仅限新用户接入,老用户权益不受影响,原有套餐继续有效,自动续费功能正常运行。 针对此前手动关闭自动续费的老用户,公司将逐步恢复续订选项,套餐升级功能也将陆续开放;新套餐因算力不足暂未上线,具体恢复时间尚未公布。 从官方表态看,此举实为在有限资

2026-07-21 02:36:05  |  28 阅读

AI编程评估为何逐渐失灵?OpenAI撤销SWE-Bench Pro推荐

数月前,OpenAI还曾向业界推荐使用SWE-Bench Pro来衡量前沿模型的编程水平。而如今,这一推荐已被撤回。2026年7月,OpenAI公布了对SWE-Bench Pro的审查结论:在公开测试集涵盖的731个任务里,自动审核流程判定其中200个任务存在问题,占比达27.4%;人工标注则认定249个任务存在问题,占比34.1%。综合两类审核结果,OpenAI估算公开任务中约有30%属于"劣质"任务。所谓"劣质",并非指题目难度过高,而是指测试本身无法准确判定模型是否真正完成了任务。模型可能给出了合理

2026-07-13 13:50:13  |  35 阅读

AI简报:2026年7月6日

MiniMax推出新一代模型M3,其核心变化在于不再单纯强调Benchmark排名,而是着重展示模型在真实工作场景中的任务完成能力,例如SWE Bench、BrowserComp、OSWorld等评测。这表明模型评价标准已从“知识考试”转向“岗位考核”,产品叙事也从Token收入转向Workflow收入。MiniMax试图将自身定位为企业工作入口,与浏览器、IDE、ERP等软件竞争,强调模型成为基础设施,工作流成为产品。壁仞科技在港交所发布公告,按每股46.2港元配售1.53亿股新H股,募资总额约70.6

2026-07-06 14:06:09  |  53 阅读

市政部门逆袭:里约 IT 公司开源模型硬刚 GPT-5.5

今日凌晨,AI 界被一张 HuggingFace 的模型截图彻底引爆。主角并非 OpenAI 或谷歌的新作,而是一行令人大跌眼镜的开发者署名:"Prefeitura do Rio de Janeiro"——即里约热内卢市政府。绝非误读。这家肩负巴西城市 IT 基建重任的市政企业,在未做任何预热、未发一篇论文、未开一场发布会的前提下,径直在 HuggingFace 上线了一款参数量达 3970 亿的开源大模型,随即——它竟将一众硅谷巨头的作品甩在身后。该企业名为 IplanRIO,全称为"里约热内卢市政信息

2026-06-15 16:26:36  |  35 阅读

AI 数小时将补丁变武器,谷歌发布扩散模型 | 6 月 11 日 AI 早报

2026 年 6 月 11 日 · 专为技术人打造的 AI 行业快讯从昨夜至今晨,最引人注目的并非又一款登顶榜单的模型,而是一项令所有安全团队脊背发凉的研究:补丁刚刚发布,AI 仅需一个下午便能将其逆向为可用武器。此外,谷歌一口气推出了扩散式语言模型及可运行于笔记本的 Gemma 4,OpenAI 的上市计划再次推迟。八条资讯,精选重点。Anthropic 发布了一项令人坐立难安的研究,直指安全圈熟知的"N-Day"难题——补丁一旦发布,新旧代码的差异便直接暴露了漏洞位置。研究团队以 Fi

2026-06-11 10:30:58  |  30 阅读

特朗普颁布 AI 新规与英伟达开启智能体芯片新篇

今日资讯干货满满,囊括政策动向、硬件革新,以及多篇探讨“智能体究竟能攻克多难任务”的硬核学术成果。最受瞩目的新闻莫过于特朗普于 6 月 2 日正式签署 AI 行政命令,强制要求各大 AI 企业在推出最强模型前,需提前 30 天向政府开放安全测试权限,此举引发了监管与创新之间博弈的热烈讨论。同期,英伟达在台北 COMPUTEX 展会上推出了七芯合一的 Vera Rubin 平台,标志着智能体 AI 时代的算力基建正式迈入量产阶段。学术领域方面,一篇论文评估了 17 个前沿模型是否具备“持续迭代”以解决长链条

2026-06-05 12:28:47  |  49 阅读

SpectrumWorld:构建光谱智能标准化平台

谱学作为物质结构鉴定、表征、测量、预测的"核心工具",在新材料发现、药物筛选及生命科学研究中发挥着不可替代的作用。近年来,人工智能大模型为谱学数据的智能化分析开辟了新路径,然而该领域研究长期面临四大核心瓶颈:高质量实验数据稀缺且类别失衡、计算光谱与真实实验环境存在显著域间鸿沟、不同光谱模态(如IR、NMR、MS)难以统一对齐,以及缺乏标准化基准导致模型评估碎片化等问题,严重制约了谱学智能从"单点突破"迈向"系统创新"。为解决上述问题,上海人工智能实验室联合中

2026-05-29 18:57:31  |  19 阅读

AI一月内挖掘万级漏洞,谷歌推进AI浏览器控制,人形机器人持续作业30小时

每日精选3-4项AI领域核心动态 · 专注AI编程与实体智能2026年5月23日,三项关键进展值得关注。一是AI在一个月内挖掘出超10000个高危漏洞,二是AI可直接操作浏览器功能,三是人形机器人连续工作30小时,效率逼近人力极限。2026年5月22日,Anthropic发布Project Glasswing项目首期成果。报告数据如下:AI模型Claude Mythos Preview在约1000个开源项目中,发现的漏洞数量超过10000个。最令人震惊的不是“发现多少”,其中1752个高危漏洞由六家独立安

2026-05-23 18:02:28  |  20 阅读

AI训练师:普通人入行AI的真正机会

近年来,“AI训练师”这一职业备受关注,招聘网站上的岗位需求持续增长。因此,越来越多的人开始关注AI领域:有人希望转行有人想抓住AI发展的机遇有人希望通过AI提升收入有人想缓解中年职业危机但与此同时,大家也感到越来越困惑:有人说:“AI训练师月薪三万,人才紧缺。”也有人说:“不就是做数据标注的吗?”甚至很多小伙伴学完后,仍然不清楚:哪些职位适合自己哪些方向有长期发展潜力薪资水平如何是否有前景最近我也开始系统学习AI相关内容。越深入研究越发现:AI训练师并没有网上描述得那么夸张和神秘。但它也绝不仅仅是:“给

2026-05-20 13:21:27  |  34 阅读