萨卡纳Fugu Max发布:把"一支智能体军团"封装成"一个API"
一、当”路由”成为产品:Fugu Max 的出场
2026年9月11日,日本实验室 Sakana AI 一次性发布了两款产品:Fugu Max(成本优先)与 Fugu Ultra v2(性能优先)。它们共享同一套编排架构,却指向两个截然不同的优化目标——一个把智能体调用成本砍到前沿模型之下,另一个则在不含任何闭源旗舰模型的”纯净池”里打出了超越 Opus 5 的视觉推理成绩。
但真正值得关注的不是跑分,而是 Sakana 对 Fugu 的定义:它不是一个基础大模型,而是一个”被封装成单模型的智能体系统”(Multi-Agent System, Delivered as One Model)。在 GPT-6、Claude Opus 5 仍在比拼单模型参数规模的当下,Sakana 选择了一条反方向的路——不造更大的大脑,而是造一个更聪明的”调度中枢”。
二、核心架构:Conductor 与可插拔模型池
Fugu 的技术内核来自两篇 ICLR 2026 的论文。其设计可以概括为三个要素:
1. Conductor(指挥者)——这是唯一被训练的模型。它通过强化学习/进化策略,学会了一套”自然语言协调策略”:面对用户查询,它负责决定调用池中的哪些智能体、给它们分配什么角色与指令、如何组合或校验中间输出、何时合成最终答案。
2. 可插拔的 LLM 模型池——Conductor 本身不产生主要算力,而是把任务动态路由到池中”最轻量但够用”的模型上。池子可以包含开源权重模型(如 NVIDIA Nemotron 系列)、专用小模型,甚至递归调用自身的实例。
3. 单一 OpenAI 兼容接口——无论背后调度了多少个模型、多少轮协作,对外只暴露一个标准 API 端点。用户无需关心路由逻辑,就像在调用一个”全能模型”。
1 | # 对开发者而言,Fugu 的用法与调用普通 LLM 完全一致 |
关键区别在于:fugu-max 这个名字背后,是一个会自己”组队干活”的系统。Conductor 把复杂任务拆解后分派给池中的专业模型,再汇总校验——没有权重合并(weight merging),也没有共享架构,各模型保持独立,这正是它抗风险能力的来源。
三、技术分析:编排即套利
Fugu Max 的定价是 $2/百万输入 token、$6/百万输出 token。Sakana 称其输出价格比 Sonnet 5、GPT-5.6 Terra、Kimi K3 低 40%–60%,并在十个基准中的七个上扩展了”成本-性能帕累托前沿”,在 Terminal Bench 2.1、GPQA Diamond、SWEFish 等六个基准上取得最佳总分。
而 Fugu Ultra v2 的叙事更加激进:它的模型池里刻意排除了 Fable 5、Fable 5.1 和 GPT-6-Astra 任何前沿闭源模型,训练截止日为 2026年8月28日。结果在 Chartography 视觉推理基准上拿到 48.3 分,远超 Opus 5 的 27.3 分。这证明了一个核心主张——编排(orchestration)可以超越孤立模型:一个会调度的”二流组合”能打赢单点最强的”一流单体”。
| 维度 | Fugu Max | Fugu Ultra v2 |
|---|---|---|
| 定位 | 成本优先 | 性能优先 |
| 输入价格 | $2 / M tokens | $5 / M tokens |
| 输出价格 | $6 / M tokens | $30 / M tokens |
| 模型池 | 最大规模(含开源+专用) | 不含前沿闭源模型 |
| 上下文窗口 | 1M tokens | 1M tokens |
但”编排套利”也有代价。最明显的是延迟:在 OpenRouter 上 Fugu Max 的中位响应时间约 5.4 秒,这正是路由步骤与多模型协作带来的开销——每一次调用都要先”开会讨论”再作答。此外,Sakana 不公开模型池的具体构成(proprietary),开发者对底层到底用了哪些模型缺乏可见性。
四、影响与未来展望:智能体中间层的崛起
Fugu 的意义远超产品本身,它指向 AI 应用架构的一次权力转移。
第一,定价权从”模型厂商”流向”编排层”。 当一个 API 可以模型无关地动态路由到更便宜的专用模型时,底层模型提供商就失去了索取溢价的能力。这类似于 DeepSeek V4.1 Flash 所体现的逻辑——架构效率决定市场存亡,而非单纯的参数规模。
第二,供应链韧性成为设计原则。 可插拔的模型池意味着:某个模型不可用、降级或被供应商限制时,系统可以无缝替换。Sakana 将这一点称为”AI 主权(AI sovereignty)”的基础设施——减少对外部单一闭源模型的依赖,也就减少了 API 被封禁、服务被突然切断的风险。
第三,”Model as a System”新范式。 过去我们习惯把模型当作原子:越大越强。Fugu 提出了另一种可能——一个学会如何调度的协调者,配合可组合的智能体池,可以比任何单体都更强。这个范式的成熟,取决于 Conductor 的编排能力能否持续跟上底层模型的迭代。
从 4 月 beta、6 月 GA、7 月加入 Claude Code 接口、8 月接入 NVIDIA Nemotron,到 9 月同时推出成本与性能两档——Sakana 的节奏本身就是”编排即产品”的最佳注脚。当 GPT-6、Opus 5 还在单点冲刺时,Fugu 已经告诉我们:未来的竞争,或许不在于谁的大脑最强,而在于谁能把一支军团调度得最好。

