Liquid AI的LFM2.5:把"AI工厂"搬上桌面,让智能体在本地无限量运行
当整个行业还在为数据中心里动辄数万张 GPU 的"AI工厂"狂欢时,一家名为 Liquid AI 的公司正悄悄走一条截然不同的路——它相信,下一代智能体的真正战场不在云端,而在你口袋里的手机、桌上的笔记本、车机乃至可穿戴设备。2026年8月,Liquid AI 开源了 LFM2.5-2.6B,一个能在纯 CPU 上流畅运行、同时具备完整 Agent 能力的端侧模型;9月底又推出面向多模态的 DSpark 推测解码器。这两步棋,正在重新定义"边缘AI"的技术范式。 一、为什么是"端侧智能体"? 过去两年,大模型的叙事几乎完全由数据中心主导。从 NVIDIA Vera Rubin 的六芯协同,到 AMD MI455X-Helios 的机架级带宽,竞争焦点始终是"如何把算力堆到极致"。然而对绝大多数真实场景而言,云端推理存在三个无法回避的痛点: 延迟敏感——语音助手、AR眼镜、自动驾驶等场景要求毫秒级响应,跨网络往返无法满足; 隐私红线——医疗、金融、个人助理等数据一旦离开设备,合规风险陡增; 成本天花板...
VISTA发布:给多模态模型装上"长时程视觉",ARC-AGI-3满分通关
一、当"看"成为智能体的短板:ARC-AGI-3的残酷现实 过去两年,多模态大模型的感知能力突飞猛进——它们能读懂图片、转写音频、甚至实时视频对话。但一旦进入交互式视觉环境(需要边看边决策、边行动边推理的场景),前沿模型的表现却屡屡令人失望。 MIT 在 ARC-AGI-3 基准上揭示了这一痛点。ARC-AGI-3 是一套交互视觉游戏集合:智能体必须在完全陌生的规则下,通过不断观察屏幕反馈来发现规律并达成目标。传统做法把这个问题当成"语言问题"处理——给 LLM 一份环境文本化、结构化的描述(比如网格坐标矩阵),让它用世界模型在脑内推理。结果呢?官方基线下,GPT-5.6 Sol 仅拿到 13.33 的 Relative Human Action Efficiency (RHAE) 分,Claude Opus 5.0 高努力模式也只有 40.68。 这个数字意味着:即便用最前沿的模型,让它在陌生视觉世界里"靠推理找规则",表现还不如一个第一次上手的人类玩家。问题不在模型不够聪明,而在于它失去了对原始视觉证据的直接访问权—...
Gemini 4 Argon发布:1M输出上限与"防御优先"的AI芯片级较量
Gemini 4 Argon发布:1M输出上限与"防御优先"的AI芯片级较量 2026年9月30日,Google DeepMind 正式推出 Gemini 4 Argon——这是 Gemini 4 系列的首款旗舰模型,也是 Google 迄今最先进的开源前沿模型。与过去几年各家实验室"闭源+限量开放"的节奏不同,Argon 选择以完全开源的姿态切入由 OpenAI GPT-6 Astra、Anthropic Claude Opus 5.5 把持的顶级战场。它的定位非常明确:真实世界的软件工程、企业级知识工作(法律/金融),以及自主网络安全防御。 一、为什么是 Argon:命名背后的战略信号 Argon 这个名字取自惰性气体元素,暗示着 Google 想让它成为"稳定、可靠、不轻易反应"的基础设施级模型。在 GPT-6、Claude Opus 5.5 还在单点冲刺峰值能力的当下,Google 选择了一条差异化路线——不是比谁的分母更大,而是比谁能把长时程任务一次跑完。 这一判断源于一个工程现实:当 AI Agent 开始连...
OpenAI砍半定价引爆前沿价格战:GPT-6 Sol/Luna与Claude Opus 5.5同日对决
一、一场"同日发布"引发的价格地震 2026年9月22日,前沿大模型市场罕见地在同一天被两股力量同时点燃。当天清晨,OpenAI 一次性发布了 GPT‑6 Sol 与 GPT‑6 Luna 两款新模型——分别接替 GPT‑5.6 Sol 和 GPT‑5.6 Luna——并宣布永久降价 50%。仅仅不到一小时之前,Anthropic 也放出了 Claude Opus 5.5,并将价格下调至 $4/$20(输入/输出每百万 token)。而在前一天(9月21日),xAI 的 Grok 4.7 已把输入价压到 $2、输出 $6,率先拉开了当前这轮价格战的序幕。 这不是又一次常规的"小版本迭代 + 限时促销"。OpenAI spokesperson 向 VentureBeat 明确确认:新价格是永久的,不设到期日——降价源于缓存与推理效率的提升,而非拉客手段。当"永久"二字出现在定价公告里,它意味着整个行业的成本基准正在被重新锚定。 二、三级家族:从企业级推理到高频杂务的全覆盖 随着 Sol 和 Luna 就位,GPT‑6 家...
阿里开源 OpenCodeReview:确定性流水线 + LLM Agent 的混合式代码审查
阿里开源 OpenCodeReview:确定性流水线 + LLM Agent 的混合式代码审查 在过去两年里,当整个行业把"AI 写代码"当作热点时,阿里巴巴内部早已默默运转着一套 AI 代码审查系统。它服务了成千上万名开发者,累计发现了数百万处代码缺陷——直到最近,阿里才将这套经过大规模生产验证的内部工具 OpenCodeReview 正式开源。上线不到一周即突破 1.1 万 GitHub Star,并连续多日占据 GitHub Trending AI/ML 榜首。 与市面上"把 diff 丢给大模型、全靠它自由发挥"的纯 LLM 审查工具不同,OpenCodeReview 的核心卖点是一套混合式架构(Hybrid Architecture):用确定性工程流水线做"该审什么、怎么组织",再用 LLM Agent 做"如何读懂与评价这段代码"。这条路线看似保守,却恰恰戳中了当前 AI 代码审查领域最真实的痛点——纯模型的可靠性天花板。 一、为什么需要"混合式"? 纯 LLM 代码审...
AutoHarness发布:让AI编程代理"自我学习"的GitHub开源项目如何崛起
AutoHarness发布:让AI编程代理"自我学习"的GitHub开源项目如何崛起 一、从"一次性对话"到"持续进化":Agent工作流的新范式 过去两年,AI编码助手经历了从"代码补全"到"自主Agent"的跃迁。然而一个被长期忽视的问题逐渐浮现:同一个模型,在不同项目中表现天差地别。开发者发现,Claude Code、Cursor等工具在A项目里能高效完成测试任务,换到B项目却连构建命令都要重新询问——因为模型并不了解每个项目的独特约定、测试框架和代码风格。 2026年9月,GitHub上一个名为 AutoHarness 的开源项目给出了答案。它由 Tigerless Labs 开发,目前以 4.8k stars 的速度快速增长(其中703+为近期新增),登顶AI Skills分类榜首。其核心理念简洁而颠覆:让Agent从真实工作会话中自动提炼"技能",并在你工作时持续更新、自动淘汰过时技能——无需守护进程,无需离线基准测试。 二、核心特性:自我学习的技能...
NVIDIA发布Feynman架构:3D堆叠、定制HBM与1nm芯片的"AI工厂2.0"
当整个行业还在为 Vera Rubin NVL72 的 60 exaFLOPS 数字狂欢时,NVIDIA 已经在 GTC 2026 上把目光投向了更远的未来——Feynman(费曼)架构。这不是 Rubin 的简单迭代,而是 NVIDIA 首次公开描绘"AI工厂2.0"的完整蓝图:3D芯片堆叠、定制HBM内存、1nm级制程,以及一个彻底重构的机架拓扑。 一、从"协同设计"到"物理重构":Feynman的战略定位 如果说 Vera Rubin 的核心叙事是极端协同设计(extreme co-design)——用六颗芯片把计算、网络、存储、散热封装成一座AI工厂——那么 Feynman 则要把这场革命推向物理层面。黄仁勋在 GTC 主题演讲中明确指出:“从这里开始的下一代就是 Feynman。” Feynman 平台由多个全新组件构成,形成完整的代际跃迁: 组件 功能定位 关键创新 Feynman GPU AI算力核心 3D die stacking、定制HBM(或超1TB/包)、TSMC A16 1.6nm制...
Hindsight 登顶 GitHub:让 AI 智能体"学会"而非"记住"的记忆系统
Hindsight 登顶 GitHub:让 AI 智能体"学会"而非"记住"的记忆系统 当编码智能体(coding agent)连续工作数小时、跨越多轮会话时,一个尴尬的现实浮现出来:它每次重启都像是第一次见到这个项目。RAG(检索增强生成)和知识图谱被广泛用于给 Agent 注入上下文,但它们本质上是"回忆历史"——把过去的对话片段捞出来塞进窗口,却无法让智能体真正积累理解。2026 年 9 月,来自 Vectorize 的开源项目 Hindsight 在 GitHub 上迅速登顶 AI 热门榜,累计 Star 突破 3 万,其核心理念可以概括为一句话:好的记忆系统应该让 Agent 学会(learn),而不只是记住(remember)。 一、问题的根源:上下文腐烂与"金鱼记忆" 现代 Agent 工作流有一个隐蔽的杀手——上下文腐烂(context rot)。随着检索调用、工具使用、用户消息和模型响应不断累积,上下文窗口被无关细节填满,真正有价值的信息反而被稀释。Hindsight 将这种现象类比...
MiniMax H3发布:开源多模态视频模型如何逼近闭源天花板
MiniMax H3发布:开源多模态视频模型如何逼近闭源天花板 一、从"单模态玩具"到"全模态创作引擎":视频生成赛道的分水岭 过去两年,AI 视频生成几乎成了闭源巨头的专属游乐场。Runway、Pika 等早期玩家受限于算力与数据,难以在画质上逼近商业级产品;而 OpenAI、Google 等大厂虽陆续推出 Sora、Veo 类产品,却始终以 API 形式封闭交付,普通开发者与中小团队只能望洋兴叹。 这一格局在 2026年7月31日 被打破。中国 AI 初创公司 MiniMax 正式开源了其新一代多模态生成模型 H3(内部代号 Hailuo 3.0),并同步放出基础版权重。与以往"文本、图像、音频各训一个模型"的做法不同,H3 采用统一架构同时处理文本、图像、视频、音频的跨模态生成——这是开源社区首次推出能在 2K 分辨率下原生输出立体声视频的通用模型。 据 Artificial Analysis 榜单,H3 在文生视频(无音频)榜中以 Elo 1,303 位居开源模型第一;在视频编辑任务上更是登顶榜首。更关键的是,它...
Agent Substrate 登顶 GitHub Trending:把 AI 智能体变成"可持久化的进程"
当智能体开始"住进"服务器 过去两年,AI 智能体的开发重心一直停留在"写一个能跑的原型"。开发者用 ReAct 循环把模型调用包起来,接上几个工具,就能在终端里演示修复 bug、生成代码。但原型和生产力之间隔着一道鸿沟:当智能体需要无人值守运行数小时、处理真实用户请求、并在 worker 崩溃后不丢失状态时,大多数"agent 库"就暴露出了它们的脆弱。 今天,GitHub Trending 榜首被一个叫 Agent Substrate 的项目占据——它在几天内斩获超过 3000 star。与层出不穷的 agent 框架不同,它明确自己不是另一个 SDK,而是一个为大规模生产部署而生的运行时系统(runtime)。它的出现,标志着智能体工程的重心正从"如何构建"转向"如何可靠地运行"。 核心问题:智能体太"重"了 Agent Substrate 的设计哲学建立在一个朴素的观察上:类 agent 的应用绝大多数时候都是空闲的。一个正在等待用户输入、等待工具返回、...
