NVIDIA发布Feynman架构:3D堆叠、定制HBM与1nm芯片的"AI工厂2.0"
当整个行业还在为 Vera Rubin NVL72 的 60 exaFLOPS 数字狂欢时,NVIDIA 已经在 GTC 2026 上把目光投向了更远的未来——Feynman(费曼)架构。这不是 Rubin 的简单迭代,而是 NVIDIA 首次公开描绘”AI工厂2.0”的完整蓝图:3D芯片堆叠、定制HBM内存、1nm级制程,以及一个彻底重构的机架拓扑。 一、从”协同设计”到”物理重构”:Feynman的战略定位如果说 Vera Rubin 的核心叙事是极端协同设计(extreme co-design)——用六颗芯片把计算、网络、存储、散热封装成一座AI工厂——那么 Feynman 则要把这场革命推向物理层面。黄仁勋在 GTC 主题演讲中明确指出:”从这里开始的下一代就是 Feynman。” Feynman 平台由多个全新组件构成,形成完整的代际跃迁: 组件 功能定位 关键创新 Feynman GPU AI算力核心 3D die stacking、定制HBM(或超1TB/包)、TSMC A16 1.6nm制程 Rosa CPU 主机编排 Vera的继任者,...
Hindsight 登顶 GitHub:让 AI 智能体"学会"而非"记住"的记忆系统
Hindsight 登顶 GitHub:让 AI 智能体”学会”而非”记住”的记忆系统当编码智能体(coding agent)连续工作数小时、跨越多轮会话时,一个尴尬的现实浮现出来:它每次重启都像是第一次见到这个项目。RAG(检索增强生成)和知识图谱被广泛用于给 Agent 注入上下文,但它们本质上是”回忆历史”——把过去的对话片段捞出来塞进窗口,却无法让智能体真正积累理解。2026 年 9 月,来自 Vectorize 的开源项目 Hindsight 在 GitHub 上迅速登顶 AI 热门榜,累计 Star 突破 3 万,其核心理念可以概括为一句话:好的记忆系统应该让 Agent 学会(learn),而不只是记住(remember)。 一、问题的根源:上下文腐烂与”金鱼记忆”现代 Agent 工作流有一个隐蔽的杀手——上下文腐烂(context rot)。随着检索调用、工具使用、用户消息和模型响应不断累积,上下文窗口被无关细节填满,真正有价值的信息反而被稀释。Hindsight 将这种现象类比为人脑的记忆机制:我们并非记住每一秒钟的细节,而是通过巩固(consolidatio...
MiniMax H3发布:开源多模态视频模型如何逼近闭源天花板
MiniMax H3发布:开源多模态视频模型如何逼近闭源天花板一、从”单模态玩具”到”全模态创作引擎”:视频生成赛道的分水岭过去两年,AI 视频生成几乎成了闭源巨头的专属游乐场。Runway、Pika 等早期玩家受限于算力与数据,难以在画质上逼近商业级产品;而 OpenAI、Google 等大厂虽陆续推出 Sora、Veo 类产品,却始终以 API 形式封闭交付,普通开发者与中小团队只能望洋兴叹。 这一格局在 2026年7月31日 被打破。中国 AI 初创公司 MiniMax 正式开源了其新一代多模态生成模型 H3(内部代号 Hailuo 3.0),并同步放出基础版权重。与以往”文本、图像、音频各训一个模型”的做法不同,H3 采用统一架构同时处理文本、图像、视频、音频的跨模态生成——这是开源社区首次推出能在 2K 分辨率下原生输出立体声视频的通用模型。 据 Artificial Analysis 榜单,H3 在文生视频(无音频)榜中以 Elo 1,303 位居开源模型第一;在视频编辑任务上更是登顶榜首。更关键的是,它在多项指标上已能正面硬刚闭源竞品,标志着开源多模态模型正式进入”...
Agent Substrate 登顶 GitHub Trending:把 AI 智能体变成"可持久化的进程"
当智能体开始”住进”服务器过去两年,AI 智能体的开发重心一直停留在”写一个能跑的原型”。开发者用 ReAct 循环把模型调用包起来,接上几个工具,就能在终端里演示修复 bug、生成代码。但原型和生产力之间隔着一道鸿沟:当智能体需要无人值守运行数小时、处理真实用户请求、并在 worker 崩溃后不丢失状态时,大多数”agent 库”就暴露出了它们的脆弱。 今天,GitHub Trending 榜首被一个叫 Agent Substrate 的项目占据——它在几天内斩获超过 3000 star。与层出不穷的 agent 框架不同,它明确自己不是另一个 SDK,而是一个为大规模生产部署而生的运行时系统(runtime)。它的出现,标志着智能体工程的重心正从”如何构建”转向”如何可靠地运行”。 核心问题:智能体太”重”了Agent Substrate 的设计哲学建立在一个朴素的观察上:类 agent 的应用绝大多数时候都是空闲的。一个正在等待用户输入、等待工具返回、或等待人工审批的智能体,几乎不消耗计算资源。但现有的部署模型往往为一个活跃会话独占一个进程甚至一台容器,导致物理资源被严重浪...
Google TPU v8发布:一分为二,为"智能体时代"量身定制的AI芯片
Google TPU v8发布:一分为二,为”智能体时代”量身定制的AI芯片过去十年,Google 的张量处理器(TPU)一直遵循一个朴素理念:一颗芯片同时兼顾训练与推理。从第一代到第七代 Ironwood,无论模型规模如何膨胀、负载如何分化,Google 都试图用同一块硅片把预训练、微调和在线服务串起来。 但到了第八代,这个信念动摇了。2026年4月22日的 Google Cloud Next 大会上,Google 首次把 TPU 线拆成两颗独立芯片——专为训练打造的 TPU 8t 和为推理而生、面向”智能体时代”的 TPU 8i。这不是简单的迭代,而是对 AI 算力需求分化的正式承认:当 Agent 开始连续调用工具、检索、多轮推理时,”一颗通吃”的时代结束了。 一、为什么必须拆分?”智能体”改变了负载画像要理解这次拆分的意义,先要看现代工作负载发生了什么变化。 传统大模型部署是”一问一答”的同步模式:训练阶段追求峰值算力(FLOPS-bound),推理阶段则越来越受内存带宽和通信延迟主导。而 Agent 系统的出现让这个问题进一步恶化——它们需要在一次请求中完成数十次工具调...
谷歌Fairwind计划发布:给前沿AI模型装上"信任闸门"
当护栏不够用时,信任就成了最后的防线过去两年,AI安全的叙事几乎被”护栏(mitigation)”一词垄断。模型厂商拼命给大模型加装刹车:拒绝回答、过滤输出、拦截危险指令。但一个尴尬的事实逐渐浮现——护栏越严,模型在合法场景下的可用性越低。当你想让AI帮你审计一段生产代码的安全漏洞时,它却因”疑似攻击行为”而拒答。 2026年9月2日,谷歌DeepMind给出了一个颇具争议的答案:既然无法用护栏区分”恶意黑客”和”善意防御者”,那就干脆用一套信任审查机制(trust vetting)来替代部分护栏。这就是同期推出的 Fairwind Program。 这不是又一款新模型,而是一套关于”前沿AI该如何被授权使用”的新治理范式。 Fairwind到底是什么Fairwind计划的核心,是把谷歌目前能力最强的网络安全专用模型 Gemini 3.8 Flash Cyber,连同其配套的漏洞修复智能体框架 CodeMender,开放给经过严格审查的”受信任防御者(trusted defenders)”。 注意这里的逻辑反转:Gemini 3.8 Flash Cyber 在谷歌官方描述中”以更...
GPT-6 Astra 发布:OpenAI 把模型重心从"建议"彻底转向"操作"
GPT-6 Astra 发布:OpenAI 把模型重心从”建议”彻底转向”操作”过去两年,大语言模型的叙事主线是”更聪明地回答”——更高的推理分数、更长的上下文、更像专家的写作。但就在 2026 年 9 月 3 日,OpenAI 发布的 GPT-6 Astra 给出了一个截然不同的答案:模型的价值不在于告诉你怎么做代码,而在于它自己动手把代码写完、把系统跑通、把任务交付。 这不是年度迭代的常规升级,而是一次产品定位的根本转向。当 Anthropic 的 Claude Opus 5 还在打磨”思考的深度”、Google 的 Gemini 3.8 Flash 在卷价格时,OpenAI 选择了一条更硬核的路——把整个模型的优先级从”Agentic Computing(智能体计算)”的第一性原则出发,重新定义前沿模型该干什么。 一、背景:为什么是”操作”而不是”建议”GPT-6 Astra 的诞生,直接回应了 2026 年 AI 行业最真实的痛点:用户不再满足于被喂答案,而是希望 AI 真正替他们完成工作。 传统的编程助手模式是”一问一答”——你提问,模型给出代码片段或解释,然后由人类工...
Gemini 3.8 Flash 发布:当"闪电速度"遇上"攻击者思维"
一、六周内第三次”闪速迭代”:Google 的节奏失控了?距离上一篇 Gemini 3.7 Flash 登场仅仅三周,Google DeepMind 又抛出了第三代 Flash 级模型——Gemini 3.8 Flash,并首次以”双生变体”的形式同步推出面向安全的 Gemini 3.8 Flash Cyber。这已是 Google 在六周内发布的第三款 Flash 系列模型,速度之快让生态伙伴直呼”文档跟不上”。 但真正值得关注的不是发布节奏,而是这次迭代释放的两个信号:**一是推理模式从”纯提速”转向”可控的思考深度”**;二是 Google 第一次把网络安全能力作为一等公民,塞进了一个主打低价与速度的”工作马”模型里。当前沿安全能力开始下沉到消费级定价的模型中,AI 的能力边界与风险边界正在同时被重新划定。 二、核心特性:可思考的闪电 + 攻击者视角1. “可控思考”:用 token 换质量的新范式Gemini 3.8 Flash 最大的架构性变化,是引入了设计内的 token 消耗策略。面对多步骤、长时程的复杂任务,模型会主动采取更小的推理步长、迭代式工具调用,并在每一步...
上海AI Lab开源Atria-Dawn-Preview:把744B MoE训练成"科研民工"的长时程智能体
一、一个”闷声不响”的开源发布2026年9月11日,上海人工智能实验室(Shanghai AI Laboratory,InternLM团队)在 Hugging Face 上悄悄挂出了 Atria-Dawn-Preview 的权重与 OpenAI 兼容 API,MIT 协议,可商用、可自托管。没有发布会、没有通稿、没有定价页——三天后才补出 arXiv 技术报告,24 小时内就有第三方 LLM gateway 提交了集成 PR。 这种”先上权重后写故事”的发布方式本身就很当下:开源社区早已习惯顶级实验室用代码和 benchmark 说话,而不是靠营销。对读者而言,真正值得关注的不是它低调的登场,而是它的定位——一个为”长时程科研智能体”(long-horizon research agent)而生的模型。 二、站在 GLM-5.2 的肩膀上Atria-Dawn 并非从零训练。它的底座是智谱在 6 月发布的 GLM-5.2:一颗 744B 参数的 MoE(混合专家)模型,激活参数规模适中,原生支持 256K 上下文。上海 AI Lab 在这块基座上做了两件事: 后训练(post-t...
Apple M5 Ultra发布:把数据中心级AI算力塞进桌面的统一内存革命
一、当”桌面”成为AI推理的新战场过去两年,AI算力的叙事完全由数据中心主导。NVIDIA Vera Rubin 用六颗协同芯片封装出”AI工厂”,AMD MI455X-Helios 以机架级带宽正面硬刚,Intel Gaudi 3 则押注低成本训练路线。然而就在行业把目光锁定在机柜与液冷之时,Apple 于 2026年8月25日 悄悄改写了桌面端的规则——它发布的 M5 Ultra 与首款 2nm 芯片 M6,首次让一台放在桌子上的设备拥有了”单机无妥协运行 70B 模型”的能力。 这不是一次常规的年度迭代。Apple 用 M5 Ultra 证明了:在边缘侧,统一内存架构(Unified Memory)正在成为对抗数据中心 GPU 护城河的一把利刃。当推理的瓶颈从”算力”转向”数据搬运”时,Apple 多年押注的内存带宽优势,恰好击中了大模型部署最痛的那根神经。 二、M5 Ultra:四 die 堆叠出的桌面怪兽M5 Ultra 是 Apple 首款四芯片(quad-die)设计的产品,集成在全新 Mac Studio 中。其关键规格足以让传统认知中的”桌面级”显得渺小: ...
