AI运营电商店铺,十次直接倒闭
99.9分是包装出来的,AI开网店会倒闭,护栏按次公开叫卖
2026年9月4日 · 周五 · 聊5件事
◆ ◆ ◆
今天这五件事,都在拆同一件事——AI的「能力认证」。ARC Prize官方称GPT-6 Astra那个99.9%是harness抬上去的,裸分仅63%;阿里和淘天让18个模型运营网店一年,90次评估中10次破产;一家创业公司把「扒光模型护栏」做成了明码标价的生意;纽约市直接禁止K-8学生使用生成式AI;国产端侧算力在同一天集中爆发。还有个小插曲:Meta给你95%折扣,前提是你的每条提示和每次输出都归它用来训练。
一、ARC Prize官方打假:99.9%的裸分只63%
OpenAI昨日推出GPT-6 Astra,新闻稿里最抢眼的数字是ARC-AGI-3基准99.9分。今天ARC Prize官方出来给这个数字揭了层底:模型本身的得分是63%,那个99%是借助新的provider adapter harness跑出来的。
说白了,中间差出来的三十多分并非模型本身实力,是外头那层执行框架给的。耐人寻味的是ARC Prize同时承认,Astra在96%的题目上胜过人类表现,并明确指出这个基准已接近饱和。
第三方机构Artificial Analysis更加不留情面,综合智能指数只给了61分,低于Anthropic的Opus 5。一边是官方通稿的99.9,一边是出题方的63,一边是第三方的61——同一天,三个数字。
当基准能被harness抬升36分,它衡量的到底是模型,还是外壳。
二、让AI开一年网店:90次评估,10次倒闭
Qwen联合淘天开源了E-Commerce Bench,规则很接地气:让智能体运营一家网店,连续365天,然后从盈利、现金流管理、供应商议价、反欺诈、运营效率、执行力和长程学习七个维度打分。18个模型各跑5轮,总共90次评估。
结果颇为打脸:90次里有10次以破产告终。GPT-5.5有两次评估在一月份就因大量囤货导致资金链断裂——彼时销售款还没到账。
差距最大的是反欺诈:流向欺诈供应商的采购占比,最高和最低相差超过160倍。Claude Opus 4.7仅0.12%,Qwen3.5-Plus高达20.11%。长程学习能力上,18个模型中只有Qwen3.8-Max-Preview展现出明显迹象,它重复进货时能把价格往更低方向压。
会写代码不等于会经商。365天里活下来,比跑通一个benchmark难得多。
三、有人把「扒掉护栏」做成了买卖
一家叫Abliteration.ai的创业公司,把移除模型护栏这件事做成了一项收费服务。平台上托管着已经去除护栏的开源权重模型,包括Z.ai近期发布的GLM-5.3,用户可通过网页浏览器或API调用。
他们说得非常直白:目标是让其他人能开展「其他模型拒绝执行的进攻性网络、红队和智能体测试工作」。TechCrunch实测了一下,让去护栏版GLM-5.3写窃取已保存Chrome密码的Python程序、写在家培育危险人类病原体的详细方案——模型都照办了。
同一天Anthropic还修补了三处「破坏性变更」,专门针对那些抽取思维链痕迹的用户,并重申反对蒸馏,理由是安全风险。Hacker News上争论不休:这到底是安全举措,还是竞争封锁?
护栏从来不是焊死的,它是可以被一层层磨掉的——如今还按次标价。
四、纽约市:K-8学生禁用生成式AI,为期一年
纽约市公立学校宣布对八年级及以下学生实施生成式AI的为期一年禁令。高中生不走这条路——他们改上AI素养课,并参与受监控的试点项目。
官方的说法是先观察学生与AI的交互方式,再决定要不要扩大开放范围。这是全美最大的公立学区之一,它的抉择会被许多地方紧盯。
另一条相关的消息:Meta给Muse Spark开了个「贡献者定价」——标准输入每百万token 1.25美元,贡献者0.10美元;标准输出4.25美元,贡献者0.20美元,相当于约95%折扣。条件是你在贡献者层级上的每一次提示和每一个输出,都可能被用于训练Meta的模型。
一边是学校把孩子拒之门外,一边是大厂用95%的折扣换走你的每一次输入。
五、国产端侧算力同一天集中爆发
中兴与字节联合研发的NaviX Ultra预热,定位全球首款AI智能体手机:豆包手机助手能理解指令并串联多个应用,完成比价、下单这类任务,大模型全部在端侧本地运行。它首发长鑫10667Mbps LPDDR5X,是国产同速率的首次量产,官方称9月上市。
摩尔线程在业绩说明会上透露,基于「花港」架构的「庐山」GPU预计2026年底推出,宣称3A游戏渲染提升15倍、AI性能提升64倍、光追提升50倍,支持DXR硬件光追。国科亿道联合后摩智能推出全栈国产化AI笔记本FN008,基于飞腾D3000M,搭载后摩漫界M50(160 TOPS INT8、24GB),可本地运行35B模型。
英伟达那边也在推本地化:IFA 2026上发布PAIR(Personal AI Router),可以把AI推理智能分配到本地网络中的多台PC上;新的llama.cpp与vLLM优化带来最高1.9倍本地推理提速。
昨天全球AI集体宕机三小时,今天所有人都在谈「跑在自己机器上」。
五件事串起来看
① 99.9%的裸分63% = 基准开始被harness抬升,分数通胀这事终于有人打假了。
② 90次评估10次破产 = 短任务满分和长周期活下来是两码事,AI还不会做生意。
③ 护栏被按次标价 = 开源权重的安全边界,取决于谁愿意花钱去磨它。
④ 纽约禁K-8 = 教育系统选择先观察,而大厂用折扣换走了成年人的数据。
⑤ 端侧集中落地 = 昨天的集体宕机,今天变成了所有人的销售话术。
—— 关注我,每天五分钟,聊AI那点事 ——