标签

AMD拿下Taalas 加码AI推理ASIC硬件布局

Taalas的技术核心可归纳为"模型即硅基硬件"。在现有的通用GPU或TPU框架内,模型参数与权重数据存放于外部高带宽存储器内,运算时须通过高密度互连通道在存储与计算单元之间反复进行数据迁移。这种存算解耦的冯氏架构高度依赖高密度先进封装、三维堆叠工艺、超高IO带宽以及大功耗液冷散热方案。Taalas的革新之处恰恰是解除了对高带宽内存与先进封装的刚性依赖:模型权重硅基烧录:Taalas将固定的模型架构与绝大多数权重参数直接固化写入芯片的掩模ROM存储结构中。片上缓存深度集成:芯片将键值缓存与微调适配器直接嵌

2026-08-10 11:23:26  |  19 阅读
MiniMax Code 2.0全新升级,接入恒生金融数据库

MiniMax Code 2.0全新升级,接入恒生金融数据库

新浪科技讯 7月16日上午消息,MiniMax宣布对MiniMax Code 2.0桌面端进行更新。基于开源框架Pi Agent,MiniMax Code底层架构实现全面重构,重点提升了会话启动速度、长任务执行稳定性和工具调用的上下文衔接能力。同时,新版本优化了文件预览、图表交互等功能,并进一步增强了金融研究能力。 在新架构下,MiniMax重新设计了会话运行、状态管理与工具调用链路,改善了长任务执行中的等待、中断和上下文衔接问题。用户体验方面,从新建会话到首次输出的等待时间明显缩短,对话过程中可能出现的

2026-07-16 14:35:39  |  74 阅读

LLM智能客服架构重构与优化

一次从"让 LLM 自由发挥"到"用状态机精确控制"的架构重构实践最近我对自研的 AI 智能客服系统做了一次比较彻底的架构重构——V4 版本。这次重构的核心变化是:从向量记忆驱动转向了状态机驱动。V4架构图:简单说就是:以前每个环节都丢给 LLM 去"自由发挥",现在用结构化状态 + 显式规则来控制流程。效果很直接——Token 消耗大幅降低、流程完全可控、可观测性也好了很多。这篇文章分享一下这次重构的思路、做法和一些具体的代码实现。先快速回顾一下这个系统的

2026-06-01 20:00:29  |  35 阅读

AI优先究竟意味着什么

借助人工智能,曾经需要两个月才能完成的功能,现在可以在提出需求的当天就完成开发并进行AB测试,当晚就能迭代出更优版本。之所以能如此高效,是因为我们的工作流程深度融入了人工智能,从需求分析到开发实现,从测试验证到部署上线的每个环节都发生了根本性转变。如今研发团队的使命已不再是单纯编写代码,而是让人工智能高效地产出有价值的成果。因此即便出现问题时,也无需绞尽脑汁寻找更好的解决方案,而是思考如何让人工智能快速识别并修复问题。但这就叫AI优先吗?可以说是吧。每天上班打开Codex、Claude Code,开会讨论

2026-04-15 13:04:04  |  33 阅读

AI算力竞赛拐点:架构重构挑战

当前市场对AI算力的理解仍停留在‘国产替代’和‘需求爆发’的线性叙事上,普遍高估了单纯硬件堆砌的线性机会,而低估了由‘效率焦虑’驱动的架构重构所带来的非线性变革。真正的变量Y,是摩尔定律放缓背景下,追求单位算力成本(TCO)最优化的强大压力。因此,最被低估的投资机会Z,并非仅仅是更多的芯片和服务器,而是支撑超大规模AI集群高效、稳定运行的‘提效降本’核心环节——光互联、液冷、高速互联芯片及集群架构创新。

2026-04-04 02:18:42  |  22 阅读