萨卡纳Fugu Max发布:把"一支智能体军团"封装成"一个API"
一、当”路由”成为产品:Fugu Max 的出场2026年9月11日,日本实验室 Sakana AI 一次性发布了两款产品:Fugu Max(成本优先)与 Fugu Ultra v2(性能优先)。它们共享同一套编排架构,却指向两个截然不同的优化目标——一个把智能体调用成本砍到前沿模型之下,另一个则在不含任何闭源旗舰模型的”纯净池”里打出了超越 Opus 5 的视觉推理成绩。 但真正值得关注的不是跑分,而是 Sakana 对 Fugu 的定义:它不是一个基础大模型,而是一个”被封装成单模型的智能体系统”(Multi-Agent System, Delivered as One Model)。在 GPT-6、Claude Opus 5 仍在比拼单模型参数规模的当下,Sakana 选择了一条反方向的路——不造更大的大脑,而是造一个更聪明的”调度中枢”。 二、核心架构:Conductor 与可插拔模型池Fugu 的技术内核来自两篇 ICLR 2026 的论文。其设计可以概括为三个要素: 1. Conductor(指挥者)——这是唯一被训练的模型。它通过强化学习/进化策略,学会了...
Claude Fable 5.1 发布:缓存降价背后的长时程智能体新标杆
引言:当”省钱”成为模型迭代的主线2026 年 9 月 1 日,Anthropic 发布了 Claude Fable 5.1(以及面向 Project Glasswing 参与者的同名变体 Mythos 5.1)。与过去几年”拼参数、拼基准分”的叙事不同,这次更新的核心卖点异常务实——缓存读取价格从每百万 token 1 美元直接砍到 0.25 美元。在智能体(agent)开始长时间无人值守运行的当下,这一刀切中的正是企业最痛的账本。 Fable 系列自 2026 年 6 月推出以来,定位就是”能连续跑几天、跨多个应用协作”的长时程工作模型。5.1 在输入/输出单价不变($10/$50)的前提下,靠缓存降价和智能体能力增强,重新定义了这条产品线的性价比。 核心特性:不只是更快,而是更”耐跑”1. 缓存读取成本的四分之一这是本次更新最实质的变化。Anthropic 官方测算:典型负载下整体成本下降约 25%,在涉及大量工具调用的复杂智能体工作流中,节省可达 **45%**。其原理在于——长时程任务会反复读取同一份上下文(项目规范、历史对话、代码库),如果每次调用...
NVIDIA Vera Rubin NVL72发布:60 Exaflops算力与"AI工厂"时代的到来
从”卖芯片”到”卖算力工厂”:Vera Rubin 重新定义数据中心如果说 Blackwell 让 NVIDIA 迈进了 EFLOPS(百亿亿次浮点运算)时代,那么本周在 GTC 2026 上正式亮相的 Vera Rubin 平台,则把整个数据中心的形态从”一堆 GPU 堆叠”升级为一座高度集成的 AI 工厂。 NVIDIA 官方将 Vera Rubin 定义为一个”七芯片、五机架”的 AI 超级计算机架构——它不再只是一张显卡,而是一套覆盖计算、网络、存储乃至安全的完整协同设计系统。平台已于 Q1 2026 进入全面量产阶段,合作伙伴的产品将在 2026 年下半年陆续上市。 对正在评估算力采购的企业而言,这不仅是性能参数的跃升,更是采购与运维模式的根本转变。 核心规格:单机架即是一座超级计算机Vera Rubin NVL72 是整个平台的核心载体,其关键指标令人瞩目: 维度 Vera Rubin NVL72 GPU 72 个 Rubin 芯片 + 36 个 Vera CPU 推理算力 3.6 EFLOPS(NVFP4) 训练算力 2.5 EFLOPS(NVF...
Go语言十年演进史:从诞生到 Go 1.26 的蜕变之路
Go语言十年演进史:从诞生到 Go 1.26 的蜕变之路一、缘起:一个为”现代工程”而生的语言2007年,Google 正被大规模分布式系统的构建难题困扰。代码量以指数级增长,C++ 太复杂、Java 太重、脚本语言又太慢且难以编译成高效机器码。Robert Griesemer(V8 JavaScript 引擎核心开发者)、Rob Pike 和 Ken Thompson(Unix 与 B 语言之父)三人组成团队,试图找到一种折中方案:既有 C 语言的执行效率,又有 Python 的开发速度,还能原生支持并发网络编程。 2009年11月10日,Go 以开源形式正式发布。它的命名”Go”寓意”去”——像箭头一样指向目标,简洁而直接。这个最初为 Google 内部服务的语言,如今已成为云计算、容器(Docker、Kubernetes 的母体)和云原生基础设施的事实标准。 二、从草案到稳定:1.0 之前的探索期在正式版本之前,Go 经历了 r56 到 r60 等一系列快照发布。2012年3月,Go 1.0 正式发布,标志着语言设计的成熟。1.0 版本确立了几个核心原则:简洁的语法、内置并...
Intel Gaudi 3 发布:5nm 工艺与 128GB HBM2e 的低成本 AI 训练革命
一、背景:AI 算力市场的”破局者”焦虑自 NVIDIA A100、H100 统治数据中心以来,全球 AI 训练集群几乎无可选择地绑定在 CUDA 生态之上。NVIDIA 2025 财年数据中心收入突破 400 亿美元,其护城河不仅在于芯片性能,更在于十余年积累的软件栈与开发者惯性。然而,随着大模型参数量持续膨胀、算力需求呈指数级增长,”单一供应商锁定”(vendor lock-in)的风险日益凸显——无论是供应链安全、成本可控性,还是地缘政治因素,都迫使头部 AI 实验室寻找 NVIDIA 之外的第二选择。 在这一背景下,Intel 旗下 Habana Labs 的 Gaudi 3 成为了最具说服力的非 CUDA 选项之一。它并非横空出世:作为 Gaudi 系列第三代产品(第一代于 2021 年发布),Gaudi 3 在 2024 年 4 月 Intel Vision 大会上正式亮相,经过两年生态打磨,到 2026 年已通过 IBM Cloud、Dell PowerEdge、Supermicro 等渠道实现大规模商用部署。 二、核心规格:为”大内存 + 高性价比”而生Gaudi...
DeepSeek-V4.1-Flash发布:MIT开源552B MoE模型如何用架构重写效率天花板
背景:一次”名不副实”的发布,撬动整个开源生态2026年9月10日,DeepSeek 正式发布了 DeepSeek-V4.1-Flash——一个以 MIT 协议开源、权重直接托管在 HuggingFace(deepseek-ai/DeepSeek-V4.1-Flash)的多模态 MoE 模型。 这次发布最耐人寻味的地方在于它的命名:.1 后缀通常代表一次小版本迭代或微调升级,但 DeepSeek 却用它给出一款全新架构家族的全新基座模型。更关键的是,这是 DeepSeek 首次把 .1 用在一个完全重建的基座上——而它暗示的旗舰版本 V4.1-Pro 至今仍未登场。换句话说,DeepSeek 把”正餐之前的小菜”直接做成了足以替代上一代旗舰的主菜。 与已发布过的 V4-Pro(1.6万亿参数 MoE)不同,V4.1-Flash 走的是一条截然不同的路线:用更少的激活参数、更激进的 KV Cache 压缩,换取超越上代旗舰的性价比。对于以长文档、长工具链调用为核心的 Agent 场景,这恰恰是最实在的进化。 核心特性:CED 架构 + 极致 KV Cache 压缩V4.1-Flas...
AMD发布MI455X与Helios:用72卡机架正面硬刚NVIDIA Vera Rubin
AMD发布MI455X与Helios:用72卡机架正面硬刚NVIDIA Vera Rubin一、从”单卡对标”到”机架级对抗”:AMD的第二次豪赌在 NVIDIA 于 CES 2026 抛出被称为”AI超级计算机”的 Vera Rubin NVL72 后,整个行业的目光都聚焦于这家绿色巨头如何用六颗协同芯片构建机架级护城河。彼时,AMD 和 Intel 仍被普遍认为停留在”单卡参数追赶”的阶段——直到 AMD 在 Advancing AI 2026 活动上正式推出 Instinct MI455X 与配套的 Helios 机架方案,才真正让竞争回到同一张牌桌。 MI455X 是 AMD MI400 系列的旗舰成员,基于全新的 CDNA 5 架构、采用 TSMC N2(N3P)先进制程制造。但真正让业界侧目的是它背后的 Helios:这不是一张孤立的加速卡,而是一套以机架为单位的完整 AI 计算系统。AMD 的战略意图很明确——既然在单颗 GPU 的绝对算力上难以瞬间超越 Rubin,那就用”内存容量 + 带宽 + 机架级互联”的组合拳,把竞争拉到自己熟悉的赛道。 二、核心规格:43...
GPT-6 Astra 正式发布:首个突破"Critical"网络安全阈值的代际模型
一、背景:一个被”藏起来”的模型终于登场2026年8月1日,OpenAI 曾用一种极其罕见的方式向外界展示下一代模型 Astra——没有发布会、没有产品界面,只有 10 篇由数学界顶尖学者认可的证明手稿。当时它还是一张”数学名片”。仅仅一个月后,9月3日,Astra 以 GPT-6 Astra 的正式产品名称全面亮相,被 OpenAI 称为”代际级跳跃(generational leap)”。 与以往不同,这次 GPT-6 Astra 并非无限制开放。它是 OpenAI 首个达到内部”Critical”(关键级)网络安全能力阈值的模型——这一门槛触发了公司 Preparedness Framework(准备度框架)下的最高级别发布审查。因此它的先进能力被置于受控的 Daybreak 计划中,分阶段向企业与研究伙伴开放。换句话说,OpenAI 第一次因为”太强”而主动给模型上了锁。 二、核心规格:105万上下文与”计算机使用”霸榜GPT-6 Astra 的关键参数如下: 上下文窗口:约 1,050,000 tokens(1.05M),最大输出 128,000 tokens 定价:...
NVIDIA发布Vera Rubin NVL72:336B晶体管与20.7TB HBM4的AI工厂革命
NVIDIA发布Vera Rubin NVL72:336B晶体管与20.7TB HBM4的AI工厂革命一、从”卖芯片”到”造工厂”:NVIDIA的战略跃迁当AMD MI400用432GB HBM4正面硬刚、Intel Gaudi4押注18A制程试图成为”第三极”时,NVIDIA没有选择在同一维度上缠斗。CES 2026上,黄仁勋发布了被称为”AI超级计算机”的Vera Rubin平台——它不是单颗GPU,而是由六颗协同设计的芯片组成的机架级系统。 这一转变的核心逻辑在于:现代推理模型的成本瓶颈已从”算力”转移到”数据搬运”。万亿参数模型的预填充(prefill)和解码(decode)阶段需要跨越数百块GPU移动海量激活值,网络带宽和显存容量才是真正卡脖子的一环。Vera Rubin正是围绕”内存墙”问题重构的产物。 二、六芯协同:Vera Rubin平台的完整架构Vera Rubin平台由六颗芯片组成,形成完整的计算-互联-存储闭环: 芯片 角色 关键规格 Rubin GPU AI算力核心 336B晶体管、TSMC N3P、288GB HBM4、50 PFLOPS N...
Gemini-3.7-Flash发布:Google把"最聪明的工作马"价格砍半
8月13日,Google 发布了 Gemini 3.7 Flash——距离上一代 3.6 Flash 仅过去三周。官方给它的定位很直白:”我们迄今最聪明的 workhorse(工作马)模型”,主攻编码与 Agent 场景。更关键的是价格: introductory 定价为每百万 token 输入 $0.75 / 输出 $3.75,正好是 3.6 Flash 原价的一半,优惠持续到年底(2027年1月1日起恢复 $1.50/$7.50)。 背景:Flash 系列的”三周一代”节奏Gemini 3.6 Flash 发布于7月下旬,3.7 Flash 在不到三周后接棒。Google 明确表示这次迭代是”开发者反馈 + 算法创新”的直接产物——这种节奏在旗舰模型上很少见,通常只出现在走量的中端线上。Flash 系列承担的是 Google AI 生态里最大的调用量:Gemini app、Antigravity IDE、Android Studio、企业 Agent 平台,全部以它为底座。把”最聪明的工作马”做便宜一半,本质上是把成本压力从开发者身上卸掉,换取更深的生态绑...

