MiniMax H3发布:开源多模态视频模型如何逼近闭源天花板
MiniMax H3发布:开源多模态视频模型如何逼近闭源天花板一、从”单模态玩具”到”全模态创作引擎”:视频生成赛道的分水岭过去两年,AI 视频生成几乎成了闭源巨头的专属游乐场。Runway、Pika 等早期玩家受限于算力与数据,难以在画质上逼近商业级产品;而 OpenAI、Google 等大厂虽陆续推出 Sora、Veo 类产品,却始终以 API 形式封闭交付,普通开发者与中小团队只能望洋兴叹。 这一格局在 2026年7月31日 被打破。中国 AI 初创公司 MiniMax 正式开源了其新一代多模态生成模型 H3(内部代号 Hailuo 3.0),并同步放出基础版权重。与以往”文本、图像、音频各训一个模型”的做法不同,H3 采用统一架构同时处理文本、图像、视频、音频的跨模态生成——这是开源社区首次推出能在 2K 分辨率下原生输出立体声视频的通用模型。 据 Artificial Analysis 榜单,H3 在文生视频(无音频)榜中以 Elo 1,303 位居开源模型第一;在视频编辑任务上更是登顶榜首。更关键的是,它在多项指标上已能正面硬刚闭源竞品,标志着开源多模态模型正式进入”...
Agent Substrate 登顶 GitHub Trending:把 AI 智能体变成"可持久化的进程"
当智能体开始”住进”服务器过去两年,AI 智能体的开发重心一直停留在”写一个能跑的原型”。开发者用 ReAct 循环把模型调用包起来,接上几个工具,就能在终端里演示修复 bug、生成代码。但原型和生产力之间隔着一道鸿沟:当智能体需要无人值守运行数小时、处理真实用户请求、并在 worker 崩溃后不丢失状态时,大多数”agent 库”就暴露出了它们的脆弱。 今天,GitHub Trending 榜首被一个叫 Agent Substrate 的项目占据——它在几天内斩获超过 3000 star。与层出不穷的 agent 框架不同,它明确自己不是另一个 SDK,而是一个为大规模生产部署而生的运行时系统(runtime)。它的出现,标志着智能体工程的重心正从”如何构建”转向”如何可靠地运行”。 核心问题:智能体太”重”了Agent Substrate 的设计哲学建立在一个朴素的观察上:类 agent 的应用绝大多数时候都是空闲的。一个正在等待用户输入、等待工具返回、或等待人工审批的智能体,几乎不消耗计算资源。但现有的部署模型往往为一个活跃会话独占一个进程甚至一台容器,导致物理资源被严重浪...
Google TPU v8发布:一分为二,为"智能体时代"量身定制的AI芯片
Google TPU v8发布:一分为二,为”智能体时代”量身定制的AI芯片过去十年,Google 的张量处理器(TPU)一直遵循一个朴素理念:一颗芯片同时兼顾训练与推理。从第一代到第七代 Ironwood,无论模型规模如何膨胀、负载如何分化,Google 都试图用同一块硅片把预训练、微调和在线服务串起来。 但到了第八代,这个信念动摇了。2026年4月22日的 Google Cloud Next 大会上,Google 首次把 TPU 线拆成两颗独立芯片——专为训练打造的 TPU 8t 和为推理而生、面向”智能体时代”的 TPU 8i。这不是简单的迭代,而是对 AI 算力需求分化的正式承认:当 Agent 开始连续调用工具、检索、多轮推理时,”一颗通吃”的时代结束了。 一、为什么必须拆分?”智能体”改变了负载画像要理解这次拆分的意义,先要看现代工作负载发生了什么变化。 传统大模型部署是”一问一答”的同步模式:训练阶段追求峰值算力(FLOPS-bound),推理阶段则越来越受内存带宽和通信延迟主导。而 Agent 系统的出现让这个问题进一步恶化——它们需要在一次请求中完成数十次工具调...
谷歌Fairwind计划发布:给前沿AI模型装上"信任闸门"
当护栏不够用时,信任就成了最后的防线过去两年,AI安全的叙事几乎被”护栏(mitigation)”一词垄断。模型厂商拼命给大模型加装刹车:拒绝回答、过滤输出、拦截危险指令。但一个尴尬的事实逐渐浮现——护栏越严,模型在合法场景下的可用性越低。当你想让AI帮你审计一段生产代码的安全漏洞时,它却因”疑似攻击行为”而拒答。 2026年9月2日,谷歌DeepMind给出了一个颇具争议的答案:既然无法用护栏区分”恶意黑客”和”善意防御者”,那就干脆用一套信任审查机制(trust vetting)来替代部分护栏。这就是同期推出的 Fairwind Program。 这不是又一款新模型,而是一套关于”前沿AI该如何被授权使用”的新治理范式。 Fairwind到底是什么Fairwind计划的核心,是把谷歌目前能力最强的网络安全专用模型 Gemini 3.8 Flash Cyber,连同其配套的漏洞修复智能体框架 CodeMender,开放给经过严格审查的”受信任防御者(trusted defenders)”。 注意这里的逻辑反转:Gemini 3.8 Flash Cyber 在谷歌官方描述中”以更...
GPT-6 Astra 发布:OpenAI 把模型重心从"建议"彻底转向"操作"
GPT-6 Astra 发布:OpenAI 把模型重心从”建议”彻底转向”操作”过去两年,大语言模型的叙事主线是”更聪明地回答”——更高的推理分数、更长的上下文、更像专家的写作。但就在 2026 年 9 月 3 日,OpenAI 发布的 GPT-6 Astra 给出了一个截然不同的答案:模型的价值不在于告诉你怎么做代码,而在于它自己动手把代码写完、把系统跑通、把任务交付。 这不是年度迭代的常规升级,而是一次产品定位的根本转向。当 Anthropic 的 Claude Opus 5 还在打磨”思考的深度”、Google 的 Gemini 3.8 Flash 在卷价格时,OpenAI 选择了一条更硬核的路——把整个模型的优先级从”Agentic Computing(智能体计算)”的第一性原则出发,重新定义前沿模型该干什么。 一、背景:为什么是”操作”而不是”建议”GPT-6 Astra 的诞生,直接回应了 2026 年 AI 行业最真实的痛点:用户不再满足于被喂答案,而是希望 AI 真正替他们完成工作。 传统的编程助手模式是”一问一答”——你提问,模型给出代码片段或解释,然后由人类工...
Gemini 3.8 Flash 发布:当"闪电速度"遇上"攻击者思维"
一、六周内第三次”闪速迭代”:Google 的节奏失控了?距离上一篇 Gemini 3.7 Flash 登场仅仅三周,Google DeepMind 又抛出了第三代 Flash 级模型——Gemini 3.8 Flash,并首次以”双生变体”的形式同步推出面向安全的 Gemini 3.8 Flash Cyber。这已是 Google 在六周内发布的第三款 Flash 系列模型,速度之快让生态伙伴直呼”文档跟不上”。 但真正值得关注的不是发布节奏,而是这次迭代释放的两个信号:**一是推理模式从”纯提速”转向”可控的思考深度”**;二是 Google 第一次把网络安全能力作为一等公民,塞进了一个主打低价与速度的”工作马”模型里。当前沿安全能力开始下沉到消费级定价的模型中,AI 的能力边界与风险边界正在同时被重新划定。 二、核心特性:可思考的闪电 + 攻击者视角1. “可控思考”:用 token 换质量的新范式Gemini 3.8 Flash 最大的架构性变化,是引入了设计内的 token 消耗策略。面对多步骤、长时程的复杂任务,模型会主动采取更小的推理步长、迭代式工具调用,并在每一步...
上海AI Lab开源Atria-Dawn-Preview:把744B MoE训练成"科研民工"的长时程智能体
一、一个”闷声不响”的开源发布2026年9月11日,上海人工智能实验室(Shanghai AI Laboratory,InternLM团队)在 Hugging Face 上悄悄挂出了 Atria-Dawn-Preview 的权重与 OpenAI 兼容 API,MIT 协议,可商用、可自托管。没有发布会、没有通稿、没有定价页——三天后才补出 arXiv 技术报告,24 小时内就有第三方 LLM gateway 提交了集成 PR。 这种”先上权重后写故事”的发布方式本身就很当下:开源社区早已习惯顶级实验室用代码和 benchmark 说话,而不是靠营销。对读者而言,真正值得关注的不是它低调的登场,而是它的定位——一个为”长时程科研智能体”(long-horizon research agent)而生的模型。 二、站在 GLM-5.2 的肩膀上Atria-Dawn 并非从零训练。它的底座是智谱在 6 月发布的 GLM-5.2:一颗 744B 参数的 MoE(混合专家)模型,激活参数规模适中,原生支持 256K 上下文。上海 AI Lab 在这块基座上做了两件事: 后训练(post-t...
Apple M5 Ultra发布:把数据中心级AI算力塞进桌面的统一内存革命
一、当”桌面”成为AI推理的新战场过去两年,AI算力的叙事完全由数据中心主导。NVIDIA Vera Rubin 用六颗协同芯片封装出”AI工厂”,AMD MI455X-Helios 以机架级带宽正面硬刚,Intel Gaudi 3 则押注低成本训练路线。然而就在行业把目光锁定在机柜与液冷之时,Apple 于 2026年8月25日 悄悄改写了桌面端的规则——它发布的 M5 Ultra 与首款 2nm 芯片 M6,首次让一台放在桌子上的设备拥有了”单机无妥协运行 70B 模型”的能力。 这不是一次常规的年度迭代。Apple 用 M5 Ultra 证明了:在边缘侧,统一内存架构(Unified Memory)正在成为对抗数据中心 GPU 护城河的一把利刃。当推理的瓶颈从”算力”转向”数据搬运”时,Apple 多年押注的内存带宽优势,恰好击中了大模型部署最痛的那根神经。 二、M5 Ultra:四 die 堆叠出的桌面怪兽M5 Ultra 是 Apple 首款四芯片(quad-die)设计的产品,集成在全新 Mac Studio 中。其关键规格足以让传统认知中的”桌面级”显得渺小: ...
萨卡纳Fugu Max发布:把"一支智能体军团"封装成"一个API"
一、当”路由”成为产品:Fugu Max 的出场2026年9月11日,日本实验室 Sakana AI 一次性发布了两款产品:Fugu Max(成本优先)与 Fugu Ultra v2(性能优先)。它们共享同一套编排架构,却指向两个截然不同的优化目标——一个把智能体调用成本砍到前沿模型之下,另一个则在不含任何闭源旗舰模型的”纯净池”里打出了超越 Opus 5 的视觉推理成绩。 但真正值得关注的不是跑分,而是 Sakana 对 Fugu 的定义:它不是一个基础大模型,而是一个”被封装成单模型的智能体系统”(Multi-Agent System, Delivered as One Model)。在 GPT-6、Claude Opus 5 仍在比拼单模型参数规模的当下,Sakana 选择了一条反方向的路——不造更大的大脑,而是造一个更聪明的”调度中枢”。 二、核心架构:Conductor 与可插拔模型池Fugu 的技术内核来自两篇 ICLR 2026 的论文。其设计可以概括为三个要素: 1. Conductor(指挥者)——这是唯一被训练的模型。它通过强化学习/进化策略,学会了...
Claude Fable 5.1 发布:缓存降价背后的长时程智能体新标杆
引言:当”省钱”成为模型迭代的主线2026 年 9 月 1 日,Anthropic 发布了 Claude Fable 5.1(以及面向 Project Glasswing 参与者的同名变体 Mythos 5.1)。与过去几年”拼参数、拼基准分”的叙事不同,这次更新的核心卖点异常务实——缓存读取价格从每百万 token 1 美元直接砍到 0.25 美元。在智能体(agent)开始长时间无人值守运行的当下,这一刀切中的正是企业最痛的账本。 Fable 系列自 2026 年 6 月推出以来,定位就是”能连续跑几天、跨多个应用协作”的长时程工作模型。5.1 在输入/输出单价不变($10/$50)的前提下,靠缓存降价和智能体能力增强,重新定义了这条产品线的性价比。 核心特性:不只是更快,而是更”耐跑”1. 缓存读取成本的四分之一这是本次更新最实质的变化。Anthropic 官方测算:典型负载下整体成本下降约 25%,在涉及大量工具调用的复杂智能体工作流中,节省可达 **45%**。其原理在于——长时程任务会反复读取同一份上下文(项目规范、历史对话、代码库),如果每次调用...
