标签

AI早报:每日AI热点速览 | DeepSeek

发布时间:2026-08-13 11:07阅读:3

📰 资讯信息

重要动态:DeepSeek V4 Pro 正式版经由 API 渠道发布,版本号更新为 DeepSeek-V4-Pro-0813,具备 1M 上下文窗口与最高 384K Token 的输出能力,并同时适配 OpenAI 与 Anthropic 两套 API 协议。

性能表现:在 Agent 类基准测试中相较预览版实现整体跃升——DeepSWE 由 12.8 提升至 62.7,CyberGym 由 52.7 提升至 83.3,NL2Repo 由 38.5 提升至 61.5,Terminal Bench 2.1 达到 87.9。

定价方案:命中缓存、未命中缓存与输出对应的单价依次为 0.025 元、3 元、6 元(每百万 Token),与预览版保持一致;有观察者表示其价格大约仅为 Fable 5 的五十七分之一。

生态对接:OpenRouter 于同日完成接入,Cline、OpenCode Go 等工具也相继宣布支持;Simon Willison 在实测中发现低、中、高三档推理等级所生成图像的视觉风格存在显著差异,展现出类似"三个独立模型"的多样性。

🔗 OpenRouter 模型页 | Simon Willison 评测 | 爱范儿实测 | 定价文档

重要动态:xAI 正式发布 Grok 4.6,官方披露其参数量达到 1.5 万亿,在 Grok 4.5 的基础上重点增强长链路 Agent 能力与高复杂度交互及视觉任务,价格保持每百万输入 2 美元、输出 6 美元不变。

第三方测评:Artificial Analysis 公布的结果显示 Grok 4.6 在 Intelligence Index 上拿到 61 分,与 GPT-5.6 Sol Max 处于同一水平,仍不及 Claude Opus 5 与 Fable 5;Terminal-Bench v2.1 达到 88.4%,GDPval-AA v2 Elo 为 1753。

跨平台落地:上线首日即对接 Grok Build、Cursor、Devin、v0、Notion、Poe、OpenRouter 等十多个产品;Cursor 与 Grok Build 在首周内提供双倍使用额度。

定价争议:缓存 Token 单价由 4.5 版本的 0.3 美元/百万上调至 0.5 美元,加上更碎片化的推理步骤导致综合成本有所攀升,Browser Use 团队判断其"仍未抵达帕累托最优边界"。

🔗 xAI 官方公告 | Artificial Analysis 评测 | Cognition 上线声明 | Browser Use 成本分析

重要动态:微信团队对外正式公布 WeLM 模型系列,以资源利用效率为核心亮点。其中 WeLM-80B 已落地于微信原生 AI 助手小微,可调用微信原生功能与小程序服务。

模型规模:WeLM-80B 总参数量为 800 亿、单次推理激活 30 亿;WeLM-617B 采用混合专家(MoE)架构,总参数量达 6170 亿、单次激活 230 亿,规划用于小程序智能化开发及轻量工具的自动生成。

战略价值:这是继腾讯混元之后,由微信团队自主打造的又一套大模型矩阵,标志着微信围绕自身场景构建专用模型的技术路线正式确立。

🔗 微信官方公告 | 腾讯 Q2 财报提及

模型动态:阿里推出开源版本 Qwen3.8-2.4T-A95B,总参数达 2.4 万亿、激活参数 95B,是 Qwen 系列迄今最强的开源型号,许可证中附带营收门槛相关条款。

量化成果:Unsloth 借助 Dynamic 1-bit 量化技术将模型文件体量由 4.9TB 压缩至 397GB,可在内存或显存超过 410GB 的本地环境下运行;vLLM、Fireworks、Together AI 均提供发布当天(Day-0)的兼容支持。

能力表现:Vals AI 的数据显示该模型在法律研究类基准测试中三个月内由第 22 名跃升至第 4 名;Hugging Face CEO 转发并评论称其已迈入开源第一梯队。

🔗 Hugging Face 模型页 | Unsloth 量化指南 | Vals AI 法律基准

关键发现:一篇研究论文展示了一项可从 OpenAI、Anthropic、Google 等多家主流厂商 API 中还原"加密"推理链路的方法,其思路是将带有签名的思维块回放到较弱模型中,再借助预填充方式引导其完成转录。

隐私隐患:研究团队对约 7000 条公开会话记录进行扫描,检出 62 个 API 密钥、33 个邮箱地址与 33 个密码,其中 64 条敏感数据完全隐藏在推理块内。

披露进展:相关研究已按负责任披露流程上报,多家涉及厂商已完成漏洞修复;研究者指出,共享含有加密推理块的 Claude Code/Codex 会话将面临数据外泄风险。

🔗 项目主页 | Simon Willison 评述 | Latent Space 报道

融资动态:Lovable 宣布完成总额 4 亿美元的 C 轮融资,投后估值达到 133 亿美元,由 Menlo Ventures 领投,EQT 旗下 Scaleup Europe Fund 共同领投。

业务表现:平台所构建应用的月度访问量已突破 9 亿次,年化经常性收入(ARR)在过去十二个月内扩张至原来的四倍;公司战略已由"打造应用"演进为"打造并经营业务"。

行业意义:这是 AI 应用层公司在现阶段获得的规模最大的融资之一,反映出资本市场对"AI 原生业务平台"这一叙事的强烈看好。

🔗 Lovable 官方博客 | Anton Osika 声明

背景回顾:2025 年底 Manus 被 Meta 以超过 200 亿美元的价格收购,后因反垄断审查被要求解除交易,目前正处于拆分阶段。

最新动态:Manus 正式确认将重新回到独立运营状态,部分用户需在 8 月 23 日前完成数据备份,自 8 月 25 日起恢复正常服务;拆分过程中收入逆势增长约五倍,单月收入曾一度赶超 DeepSeek。

产品进展:Manus 1.6 与 Lite 版本同步开启限时免费活动,2.0 版本已完成开发,将于交易彻底收尾后正式上线。

🔗 Manus 用户公告 | 晚点 LatePost 深度报道

重点动态:Mustafa Suleyman 揭晓了微软首款完全自研的推理模型 MAI-Thinking-1,并正式登陆微软 Foundry 平台,这是微软在大模型自研路径上具有标志意义的举措。

定位与反馈:团队专门围绕"工具调用"相关能力向开发者群体征集意见,表明该模型聚焦应用型推理场景,并非单纯追求基准测试成绩。

战略背景:继在 GitHub Copilot 中部署 MAI-Code 系列模型之后,微软继续在推理方向上补齐自研能力,以降低对外部顶级模型的单一依赖。

🔗 Mustafa Suleyman 公告