标签

AI运营电商店铺,十次直接倒闭

99.9分是包装出来的,AI开网店会倒闭,护栏按次公开叫卖2026年9月4日 · 周五 · 聊5件事◆ ◆ ◆今天这五件事,都在拆同一件事——AI的「能力认证」。ARC Prize官方称GPT-6 Astra那个99.9%是harness抬上去的,裸分仅63%;阿里和淘天让18个模型运营网店一年,90次评估中10次破产;一家创业公司把「扒光模型护栏」做成了明码标价的生意;纽约市直接禁止K-8学生使用生成式AI;国产端侧算力在同一天集中爆发。还有个小插曲:Meta给你95%折扣,前提是你的每条提示和每次输出

2026-09-04 22:17:17  |  3 阅读
智谱发布GLM-5.3:开源编程模型逼近顶尖水平

智谱发布GLM-5.3:开源编程模型逼近顶尖水平

8月14日,智谱(2513.HK)推出了GLM-5.3。虽然基础架构保持不变,但通过极致的后训练扩展,显著提升了模型的智能上限:长程任务环境增加了数十倍,环境类型更加丰富,后训练时间显著延长。智谱声称,在多个主流基准测试中,GLM-5.3是目前排名最高的开源模型,其编程和智能体能力已接近Claude Fable 5,编程体验超越其他国产模型。 智谱指出,与上一代相比,GLM-5.3的新增亮点包括:卓越的编程技能、网络安全能力、后训练扩展以及开源特性。 据智谱介绍,在Terminal-Bench 3.0(评

2026-08-15 15:59:09  |  20 阅读
DeepSeek-V4-Pro-0813正式发布:百万级上下文与近40万输出,多项成绩领先Opus-4.8

DeepSeek-V4-Pro-0813正式发布:百万级上下文与近40万输出,多项成绩领先Opus-4.8

新浪科技8月13日上午报道,DeepSeek官方API定价页面与文档更新显示,deepseek-v4-pro对应模型版本已升级为DeepSeek-V4-Pro-0813,意味着这款旗舰大模型从测试阶段迈入正式上线阶段。 根据官方定价页和文档说明,DeepSeek-V4-Pro-0813具备1M上下文窗口,单次最大输出量达384K Token,并同时兼容非思考与思考两种调用方式(默认为思考模式)。在超长代码库解析、海量文档研读以及需连续多步执行的智能体任务场景下,单次请求能够承载和产出的内容量显著提升,有效

2026-08-13 09:50:06  |  28 阅读

Floatboat创新推出HLR指标,量化AI执行系统价值增益

8月7日,AOE Tech Labs正式发布旗下人工智能代理工作台Floatboat所搭载的底层执行系统Harness在五项权威第三方基准测试中的完整性能数据。本次测试以DeepSeek-V4-Flash作为统一的模型基座,结果显示Floatboat Harness在DeepSWE、Terminal Bench 2.1、Toolathlon、BrowseComp及AutomationBench五项评测中均显著优于搭载Claude Opus 4.8模型的对比系统,而后者的混合单价达到前者的57.1倍。本次评

2026-08-09 16:42:35  |  38 阅读

研究指出DeepSeek新模型成性价比最高知名AI

根据一家研究机构的分析,中国初创企业DeepSeek推出的旗舰AI模型版本,在基准测试中的运行费用远低于全球知名模型,相较于Anthropic的Claude Fable 5,其成本低逾100倍。 知情人士透露,DeepSeek正在筹备潜在的首次公开募股。该公司于上周五正式发布了V4-Flash模型,这是其通过发挥核心优势——提供超低成本的AI替代方案——来重振增长势头的最新举措。研究公司Artificial Analysis的数据显示,DeepSeek的V4-Flash模型每百万输入token收费0.14

2026-08-03 15:12:03  |  30 阅读

阿里推出千问3.8-Max,中国AI模型实力再升级

阿里(122.25, 5.93, 5.10%)巴巴发布了最新的旗舰级人工智能(AI)模型,并称其性能可与Anthropic的Fable等全球领先产品相媲美。 这款名为千问3.8-Max的新模型拥有2.4万亿个参数,在某些基准测试中的排名高于月之暗面近期发布的备受瞩目的Kimi K3模型。阿里巴巴分享的结果显示,该模型的得分与Anthropic的Fable 5相当,有时甚至更胜一筹。 阿里巴巴这款新模型首次亮相前,月之暗面的Kimi K3已于上月在股市和硅谷引起了轰动。DeepSeek也于上周推出了其旗舰模

2026-08-03 12:53:05  |  17 阅读
DeepSeek-V4-Flash正式版开放公测,性能超越智谱GLM-5.2

DeepSeek-V4-Flash正式版开放公测,性能超越智谱GLM-5.2

新浪科技讯 7月31日下午消息,DeepSeek-V4-Flash(V4 Flash)正式版 API今日正式开启公测。据官方说明,V4 Flash的Agent能力获得显著提升,在多项基准测试中的表现远超V4-Pro-Preview及智谱GLM-5.2等模型。 针对公开基准测试集中的Code Agent任务,正式版V4 Flash采用DeepSeek Harness(即将推出)的极简模式作为测试框架,并启用max档位,参数设置为topp=0.95,temperature=1.0。 当前,正式版V4-Flas

2026-08-02 19:57:58  |  49 阅读

研究揭示:AI协作效能的关键不在工具,而在使用者的实力

最近我的各种AI群聊又沸腾了。起因是一家大公司推出了新一代模型,基准测试成绩霸榜,许多人连夜掏钱订阅。也有朋友截图来问:这个新模型问世,我是不是该把现在的助手换掉?说实话,看着满屏“选哪个AI最好”的争论,我脑海中全是今年七月刚发表的一篇论文。读完它,你会觉得我们很多人可能都白费力气了。论文标题很直白,叫《决定人机协作效果的,不是AI有多强,而是人有多强》(Human Capability, Not AI Benchmark Scores, Predicts Human-AI Collaboration

2026-07-18 20:36:17  |  21 阅读

榜单成绩亮眼、实际表现拉胯:2026年的AI评测,我劝你别全信

AI 观点 · 热议▲ 榜单上门门 A+,一到干活就「原地社死」你肯定见过这种场景:某个新模型一发布,朋友圈全是「刷新 SOTA」「屠榜」「碾压一切」的截图,气势汹汹。结果你兴冲冲打开一用——嗯,看着挺聪明,干活总差那么一口气。别怀疑自己,也别怀疑人生。真不是你的错觉——2026 年,AI 榜单的水分正在被一个个当场拧出来。今天我把几件最有意思的「翻车现场」讲给你听。先说编程界最出名的考试SWE-bench Verified(让 AI 去修真实的 GitHub bug)。搁一年半前,谁能考过 50% 都能

2026-07-18 09:23:21  |  25 阅读

AI资讯速递|2026-07-14 · Claude Sonnet 5对决Opus 4.8:编程智能体评测与成本效益全面分析

01PART模型发布/更新MODELS#1 Claude Sonnet 5对决Opus 4.8:编程智能体评测与成本效益全面分析MarkTechPostAnthropic最新推出的Claude Sonnet 5在智能体编程任务上大幅拉近了与旗舰Opus 4.8的距离,同时延续了Sonnet系列的低Token费用优势。根据MarkTechPost汇总的测评结果,Sonnet 5在多项代码生成和工具调用基准中几乎比肩Opus 4.8,但在复杂多步推理方面仍有欠缺。这一代际突破意味着预算有限的开发组也能享受到接

2026-07-14 16:11:21  |  27 阅读

AI编程评估为何逐渐失灵?OpenAI撤销SWE-Bench Pro推荐

数月前,OpenAI还曾向业界推荐使用SWE-Bench Pro来衡量前沿模型的编程水平。而如今,这一推荐已被撤回。2026年7月,OpenAI公布了对SWE-Bench Pro的审查结论:在公开测试集涵盖的731个任务里,自动审核流程判定其中200个任务存在问题,占比达27.4%;人工标注则认定249个任务存在问题,占比34.1%。综合两类审核结果,OpenAI估算公开任务中约有30%属于"劣质"任务。所谓"劣质",并非指题目难度过高,而是指测试本身无法准确判定模型是否真正完成了任务。模型可能给出了合理

2026-07-13 13:50:13  |  35 阅读

ZoomInfo发布GTM Bench,确立AI销售新标准

Zoom(89.87, -0.01, -0.01%)Info Technologies Inc.近期正式推出GTM Bench评测体系,旨在针对大型语言模型及AI智能体在实际市场推广场景中的效能进行专业评估。 该体系从“任务达成率”与“数据可溯性”两大核心指标对AI系统打分:前者反映系统完成指定任务的比例,后者评估返回数据源自真实、实时信息的程度。在首期测评中,ZoomInfo旗下的GTM.AI以77分的综合得分领先,Apollo得分为47分,Exa为36分,开放网络搜索仅为31分。数据显示,ZoomIn

2026-07-11 01:20:16  |  27 阅读

AI应用前沿|Tool-Genesis:驱动自进化语言智能体工具创建的任务导向基准 (1/20篇) · 7月6日

2026年07月06日星期一Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent自进化语言智能体领域正快速推进,然而其依据任务需求进行工具构建、适配与维护的能力尚缺乏系统性的评估手段。当前主流基准多受制于预先设定的规范框架,制约了系统的可拓展性与自主进化空间。本研究推出诊断型基准Tool-Genesis,致力于从接口规范性、功能准确性及下游实用价值等多元视角对智能体能力进行量化评估。该基准检

2026-07-07 04:36:43  |  35 阅读

AI行业动态速览 06.22-06.28

回看过去七天,AI领域的震荡远比预想中剧烈。OpenAI瞄准万亿美元估值的高歌猛进、Anthropic在芯片层面的绝地反击、微信坐拥14亿月活的入口卡位——每一桩事件都在改写这个赛道的格局。从6月20日开始,部分微信用户察觉到主界面左上角悄然出现了一个“绿色眼睛”图案。这正是微信自主研发的AI助手“小微”的灰度测试入口。其技术底座融合了微信自研大语言模型WeLM与DeepSeek,可通过文字或语音指令直接操控微信原生功能,包括调整设置、发送消息乃至拨打电话。然而这仅仅是序幕。真正让开发圈沸腾的是其“一句话

2026-06-29 02:05:28  |  37 阅读

AI看空系列:Trace盛宴与虚假繁荣

"他们不过是在驾驶着空壳飞机四处游荡。" —— MB之子英伟达堪称指路明灯,是猎户腰带,更是整片星河。英伟达正享受着旺盛需求的红利,然而其客户群体极度聚焦,而这些客户自身的需求正被一段难以为继的"基准测试期"所扭曲。这种畸形需求经由定制化供应承诺,如鞭梢般层层抽打英伟达的供应链,一路波及数据中心的融资链条。笼罩其上的是"虚假繁荣"(the bezzle)——一旦察觉便无法忘却;一旦被戳破,即刻烟消云散。所幸的是,英伟达这颗"明星"——它的Gr

2026-06-21 18:14:42  |  23 阅读