一、当”路由”成为产品:Fugu Max 的出场

2026年9月11日,日本实验室 Sakana AI 一次性发布了两款产品:Fugu Max(成本优先)与 Fugu Ultra v2(性能优先)。它们共享同一套编排架构,却指向两个截然不同的优化目标——一个把智能体调用成本砍到前沿模型之下,另一个则在不含任何闭源旗舰模型的”纯净池”里打出了超越 Opus 5 的视觉推理成绩。

但真正值得关注的不是跑分,而是 Sakana 对 Fugu 的定义:它不是一个基础大模型,而是一个”被封装成单模型的智能体系统”(Multi-Agent System, Delivered as One Model)。在 GPT-6、Claude Opus 5 仍在比拼单模型参数规模的当下,Sakana 选择了一条反方向的路——不造更大的大脑,而是造一个更聪明的”调度中枢”。

二、核心架构:Conductor 与可插拔模型池

Fugu 的技术内核来自两篇 ICLR 2026 的论文。其设计可以概括为三个要素:

1. Conductor(指挥者)——这是唯一被训练的模型。它通过强化学习/进化策略,学会了一套”自然语言协调策略”:面对用户查询,它负责决定调用池中的哪些智能体、给它们分配什么角色与指令、如何组合或校验中间输出、何时合成最终答案。

2. 可插拔的 LLM 模型池——Conductor 本身不产生主要算力,而是把任务动态路由到池中”最轻量但够用”的模型上。池子可以包含开源权重模型(如 NVIDIA Nemotron 系列)、专用小模型,甚至递归调用自身的实例。

3. 单一 OpenAI 兼容接口——无论背后调度了多少个模型、多少轮协作,对外只暴露一个标准 API 端点。用户无需关心路由逻辑,就像在调用一个”全能模型”。

1
2
3
4
5
6
7
8
9
10
11
# 对开发者而言,Fugu 的用法与调用普通 LLM 完全一致
from openai import OpenAI

client = OpenAI(base_url="https://api.sakana.ai/v1", api_key=...)

response = client.chat.completions.create(
model="fugu-max", # 背后是整套编排引擎在调度
messages=[{"role": "user", "content": "分析这份财报 PDF 并给出投资建议"}],
max_tokens=4096,
)
print(response.choices[0].message.content)

关键区别在于:fugu-max 这个名字背后,是一个会自己”组队干活”的系统。Conductor 把复杂任务拆解后分派给池中的专业模型,再汇总校验——没有权重合并(weight merging),也没有共享架构,各模型保持独立,这正是它抗风险能力的来源。

三、技术分析:编排即套利

Fugu Max 的定价是 $2/百万输入 token、$6/百万输出 token。Sakana 称其输出价格比 Sonnet 5、GPT-5.6 Terra、Kimi K3 低 40%–60%,并在十个基准中的七个上扩展了”成本-性能帕累托前沿”,在 Terminal Bench 2.1、GPQA Diamond、SWEFish 等六个基准上取得最佳总分。

而 Fugu Ultra v2 的叙事更加激进:它的模型池里刻意排除了 Fable 5、Fable 5.1 和 GPT-6-Astra 任何前沿闭源模型,训练截止日为 2026年8月28日。结果在 Chartography 视觉推理基准上拿到 48.3 分,远超 Opus 5 的 27.3 分。这证明了一个核心主张——编排(orchestration)可以超越孤立模型:一个会调度的”二流组合”能打赢单点最强的”一流单体”。

维度 Fugu Max Fugu Ultra v2
定位 成本优先 性能优先
输入价格 $2 / M tokens $5 / M tokens
输出价格 $6 / M tokens $30 / M tokens
模型池 最大规模(含开源+专用) 不含前沿闭源模型
上下文窗口 1M tokens 1M tokens

但”编排套利”也有代价。最明显的是延迟:在 OpenRouter 上 Fugu Max 的中位响应时间约 5.4 秒,这正是路由步骤与多模型协作带来的开销——每一次调用都要先”开会讨论”再作答。此外,Sakana 不公开模型池的具体构成(proprietary),开发者对底层到底用了哪些模型缺乏可见性。

四、影响与未来展望:智能体中间层的崛起

Fugu 的意义远超产品本身,它指向 AI 应用架构的一次权力转移。

第一,定价权从”模型厂商”流向”编排层”。 当一个 API 可以模型无关地动态路由到更便宜的专用模型时,底层模型提供商就失去了索取溢价的能力。这类似于 DeepSeek V4.1 Flash 所体现的逻辑——架构效率决定市场存亡,而非单纯的参数规模。

第二,供应链韧性成为设计原则。 可插拔的模型池意味着:某个模型不可用、降级或被供应商限制时,系统可以无缝替换。Sakana 将这一点称为”AI 主权(AI sovereignty)”的基础设施——减少对外部单一闭源模型的依赖,也就减少了 API 被封禁、服务被突然切断的风险。

第三,”Model as a System”新范式。 过去我们习惯把模型当作原子:越大越强。Fugu 提出了另一种可能——一个学会如何调度的协调者,配合可组合的智能体池,可以比任何单体都更强。这个范式的成熟,取决于 Conductor 的编排能力能否持续跟上底层模型的迭代。

从 4 月 beta、6 月 GA、7 月加入 Claude Code 接口、8 月接入 NVIDIA Nemotron,到 9 月同时推出成本与性能两档——Sakana 的节奏本身就是”编排即产品”的最佳注脚。当 GPT-6、Opus 5 还在单点冲刺时,Fugu 已经告诉我们:未来的竞争,或许不在于谁的大脑最强,而在于谁能把一支军团调度得最好。