NVIDIA开源OpenShell:给自主AI agent穿上"防弹衣"
一、当agent开始"自己动手":一个绕不开的安全裂缝 过去半年,AI agent从演示脚本变成了真正的生产力工具。Claude Code、Codex、OpenClaw这类编码智能体能够自主读取文件、执行命令、调用网络API——它们不再只是回答问题,而是真的在机器上"干活"。但正是这种能力,制造了一个日益尖锐的矛盾:你把生产环境的密钥、数据库凭证、整台服务器都交给了一个可能出错的模型。 一旦agent被越狱攻击诱导、或者单纯因为幻觉执行了错误命令,后果可能是灾难性的——删除关键文件、把数据外泄到外部服务器、或者在无人监督的情况下发起网络请求。行业里已经出现过agent在沙箱外"乱跑"的事故,而传统的解决思路是:要么给模型套上更厚的prompt约束(不可靠),要么重写整个agent框架来内嵌安全逻辑(成本高、通用性差)。 2026年9月28日,NVIDIA开源了 OpenShell——一个把"运行时控制层"从agent内部剥离出来、独立强制执行的沙箱运行时。它的核心理念很直接:不要信任agent本身,而...
Browser-Use开源:GitHub 11万星浏览器智能体,如何接管你的整个网页
一、当"会用浏览器"成为智能体的第一技能 过去两年,AI 智能体(Agent)的能力边界一直在向上突破:从纯文本对话到代码生成,再到终端操作与多步骤推理。然而几乎所有旗舰模型都忽略了一个最基础、最高频的场景——网页本身。我们每天的工作流里,仍有海量任务发生在浏览器中:登录后台填表、跨站点抓取数据、走一遍完整的下单流程、自动化 QA 测试。这些动作对 LLM 而言曾是"黑盒",因为它看不到 DOM、点不动按钮、也读不懂页面结构。 Browser-Use 正是为此而生的开源项目。它的口号很直白:“Make websites accessible for AI agents”——让大语言模型像人一样使用浏览器:打开网页、点击按钮、输入文字、填写表单,你只需描述任务,它自己完成。截至 2026 年 10 月,该项目在 GitHub 上已突破 11.7 万 Star(MIT 协议),成为全站 Star 数最高的开源项目之一,并被 Claude Code、Codex、Cursor、OpenClaw 等多个智能体选为默认浏览器工具。 二、它到底能做什么?...
AMD 82亿美元收购World Labs:李飞飞的"世界模型"如何改写AI芯片的下一盘大棋
一、当"卖芯片"遇上"教机器人看懂物理世界" 2026年9月28日,AMD在圣克拉拉总部宣布了一笔价值 82亿美元 的全股票收购——目标是由AI先驱、斯坦福大学教授李飞飞(Fei-Fei Li)联合创立的初创公司 World Labs。交易完成后,李飞将出任AMD执行副总裁兼首席科学家,直接向CEO苏姿丰(Lisa Su)汇报。 这不是一笔普通的产业并购。过去两年,整个AI行业的叙事几乎被数据中心里的GPU机架和万亿参数大模型完全占据——NVIDIA用Vera Rubin搭建"AI工厂",AMD以MI455X-Helios的机架级带宽正面硬刚,各家争夺的是exaFLOPS的数字狂欢。然而就在所有人盯着机柜与液冷之时,AMD却把82亿美元砸向了一家成立仅两年、专注"让机器理解三维物理世界"的小公司。 这个动作释放了一个清晰的信号:AI芯片厂商意识到,下一场战争的战场不在更大的算力集群,而在更贴近真实世界的"具身智能"(Embodied AI)。谁掌握了机器人和空间智能的底层模型,谁就...
Liquid AI的LFM2.5:把"AI工厂"搬上桌面,让智能体在本地无限量运行
当整个行业还在为数据中心里动辄数万张 GPU 的"AI工厂"狂欢时,一家名为 Liquid AI 的公司正悄悄走一条截然不同的路——它相信,下一代智能体的真正战场不在云端,而在你口袋里的手机、桌上的笔记本、车机乃至可穿戴设备。2026年8月,Liquid AI 开源了 LFM2.5-2.6B,一个能在纯 CPU 上流畅运行、同时具备完整 Agent 能力的端侧模型;9月底又推出面向多模态的 DSpark 推测解码器。这两步棋,正在重新定义"边缘AI"的技术范式。 一、为什么是"端侧智能体"? 过去两年,大模型的叙事几乎完全由数据中心主导。从 NVIDIA Vera Rubin 的六芯协同,到 AMD MI455X-Helios 的机架级带宽,竞争焦点始终是"如何把算力堆到极致"。然而对绝大多数真实场景而言,云端推理存在三个无法回避的痛点: 延迟敏感——语音助手、AR眼镜、自动驾驶等场景要求毫秒级响应,跨网络往返无法满足; 隐私红线——医疗、金融、个人助理等数据一旦离开设备,合规风险陡增; 成本天花板...
VISTA发布:给多模态模型装上"长时程视觉",ARC-AGI-3满分通关
一、当"看"成为智能体的短板:ARC-AGI-3的残酷现实 过去两年,多模态大模型的感知能力突飞猛进——它们能读懂图片、转写音频、甚至实时视频对话。但一旦进入交互式视觉环境(需要边看边决策、边行动边推理的场景),前沿模型的表现却屡屡令人失望。 MIT 在 ARC-AGI-3 基准上揭示了这一痛点。ARC-AGI-3 是一套交互视觉游戏集合:智能体必须在完全陌生的规则下,通过不断观察屏幕反馈来发现规律并达成目标。传统做法把这个问题当成"语言问题"处理——给 LLM 一份环境文本化、结构化的描述(比如网格坐标矩阵),让它用世界模型在脑内推理。结果呢?官方基线下,GPT-5.6 Sol 仅拿到 13.33 的 Relative Human Action Efficiency (RHAE) 分,Claude Opus 5.0 高努力模式也只有 40.68。 这个数字意味着:即便用最前沿的模型,让它在陌生视觉世界里"靠推理找规则",表现还不如一个第一次上手的人类玩家。问题不在模型不够聪明,而在于它失去了对原始视觉证据的直接访问权—...
Gemini 4 Argon发布:1M输出上限与"防御优先"的AI芯片级较量
Gemini 4 Argon发布:1M输出上限与"防御优先"的AI芯片级较量 2026年9月30日,Google DeepMind 正式推出 Gemini 4 Argon——这是 Gemini 4 系列的首款旗舰模型,也是 Google 迄今最先进的开源前沿模型。与过去几年各家实验室"闭源+限量开放"的节奏不同,Argon 选择以完全开源的姿态切入由 OpenAI GPT-6 Astra、Anthropic Claude Opus 5.5 把持的顶级战场。它的定位非常明确:真实世界的软件工程、企业级知识工作(法律/金融),以及自主网络安全防御。 一、为什么是 Argon:命名背后的战略信号 Argon 这个名字取自惰性气体元素,暗示着 Google 想让它成为"稳定、可靠、不轻易反应"的基础设施级模型。在 GPT-6、Claude Opus 5.5 还在单点冲刺峰值能力的当下,Google 选择了一条差异化路线——不是比谁的分母更大,而是比谁能把长时程任务一次跑完。 这一判断源于一个工程现实:当 AI Agent 开始连...
OpenAI砍半定价引爆前沿价格战:GPT-6 Sol/Luna与Claude Opus 5.5同日对决
一、一场"同日发布"引发的价格地震 2026年9月22日,前沿大模型市场罕见地在同一天被两股力量同时点燃。当天清晨,OpenAI 一次性发布了 GPT‑6 Sol 与 GPT‑6 Luna 两款新模型——分别接替 GPT‑5.6 Sol 和 GPT‑5.6 Luna——并宣布永久降价 50%。仅仅不到一小时之前,Anthropic 也放出了 Claude Opus 5.5,并将价格下调至 $4/$20(输入/输出每百万 token)。而在前一天(9月21日),xAI 的 Grok 4.7 已把输入价压到 $2、输出 $6,率先拉开了当前这轮价格战的序幕。 这不是又一次常规的"小版本迭代 + 限时促销"。OpenAI spokesperson 向 VentureBeat 明确确认:新价格是永久的,不设到期日——降价源于缓存与推理效率的提升,而非拉客手段。当"永久"二字出现在定价公告里,它意味着整个行业的成本基准正在被重新锚定。 二、三级家族:从企业级推理到高频杂务的全覆盖 随着 Sol 和 Luna 就位,GPT‑6 家...
阿里开源 OpenCodeReview:确定性流水线 + LLM Agent 的混合式代码审查
阿里开源 OpenCodeReview:确定性流水线 + LLM Agent 的混合式代码审查 在过去两年里,当整个行业把"AI 写代码"当作热点时,阿里巴巴内部早已默默运转着一套 AI 代码审查系统。它服务了成千上万名开发者,累计发现了数百万处代码缺陷——直到最近,阿里才将这套经过大规模生产验证的内部工具 OpenCodeReview 正式开源。上线不到一周即突破 1.1 万 GitHub Star,并连续多日占据 GitHub Trending AI/ML 榜首。 与市面上"把 diff 丢给大模型、全靠它自由发挥"的纯 LLM 审查工具不同,OpenCodeReview 的核心卖点是一套混合式架构(Hybrid Architecture):用确定性工程流水线做"该审什么、怎么组织",再用 LLM Agent 做"如何读懂与评价这段代码"。这条路线看似保守,却恰恰戳中了当前 AI 代码审查领域最真实的痛点——纯模型的可靠性天花板。 一、为什么需要"混合式"? 纯 LLM 代码审...
AutoHarness发布:让AI编程代理"自我学习"的GitHub开源项目如何崛起
AutoHarness发布:让AI编程代理"自我学习"的GitHub开源项目如何崛起 一、从"一次性对话"到"持续进化":Agent工作流的新范式 过去两年,AI编码助手经历了从"代码补全"到"自主Agent"的跃迁。然而一个被长期忽视的问题逐渐浮现:同一个模型,在不同项目中表现天差地别。开发者发现,Claude Code、Cursor等工具在A项目里能高效完成测试任务,换到B项目却连构建命令都要重新询问——因为模型并不了解每个项目的独特约定、测试框架和代码风格。 2026年9月,GitHub上一个名为 AutoHarness 的开源项目给出了答案。它由 Tigerless Labs 开发,目前以 4.8k stars 的速度快速增长(其中703+为近期新增),登顶AI Skills分类榜首。其核心理念简洁而颠覆:让Agent从真实工作会话中自动提炼"技能",并在你工作时持续更新、自动淘汰过时技能——无需守护进程,无需离线基准测试。 二、核心特性:自我学习的技能...
NVIDIA发布Feynman架构:3D堆叠、定制HBM与1nm芯片的"AI工厂2.0"
当整个行业还在为 Vera Rubin NVL72 的 60 exaFLOPS 数字狂欢时,NVIDIA 已经在 GTC 2026 上把目光投向了更远的未来——Feynman(费曼)架构。这不是 Rubin 的简单迭代,而是 NVIDIA 首次公开描绘"AI工厂2.0"的完整蓝图:3D芯片堆叠、定制HBM内存、1nm级制程,以及一个彻底重构的机架拓扑。 一、从"协同设计"到"物理重构":Feynman的战略定位 如果说 Vera Rubin 的核心叙事是极端协同设计(extreme co-design)——用六颗芯片把计算、网络、存储、散热封装成一座AI工厂——那么 Feynman 则要把这场革命推向物理层面。黄仁勋在 GTC 主题演讲中明确指出:“从这里开始的下一代就是 Feynman。” Feynman 平台由多个全新组件构成,形成完整的代际跃迁: 组件 功能定位 关键创新 Feynman GPU AI算力核心 3D die stacking、定制HBM(或超1TB/包)、TSMC A16 1.6nm制...
