Liquid AI的LFM2.5:把"AI工厂"搬上桌面,让智能体在本地无限量运行
当整个行业还在为数据中心里动辄数万张 GPU 的"AI工厂"狂欢时,一家名为 Liquid AI 的公司正悄悄走一条截然不同的路——它相信,下一代智能体的真正战场不在云端,而在你口袋里的手机、桌上的笔记本、车机乃至可穿戴设备。2026年8月,Liquid AI 开源了 LFM2.5-2.6B,一个能在纯 CPU 上流畅运行、同时具备完整 Agent 能力的端侧模型;9月底又推出面向多模态的 DSpark 推测解码器。这两步棋,正在重新定义"边缘AI"的技术范式。
一、为什么是"端侧智能体"?
过去两年,大模型的叙事几乎完全由数据中心主导。从 NVIDIA Vera Rubin 的六芯协同,到 AMD MI455X-Helios 的机架级带宽,竞争焦点始终是"如何把算力堆到极致"。然而对绝大多数真实场景而言,云端推理存在三个无法回避的痛点:
- 延迟敏感——语音助手、AR眼镜、自动驾驶等场景要求毫秒级响应,跨网络往返无法满足;
- 隐私红线——医疗、金融、个人助理等数据一旦离开设备,合规风险陡增;
- 成本天花板——按 token 计费的模式下,一个持续运行的 Agent 若每天消耗数百万 token,月成本可能高达数千美元。
Liquid AI 的创始人 Daniel Levy(前 DeepMind 研究员)正是看穿了第三点。他在 LFM2.5-2.6B 的发布博客中写道:"当 token 花费不再是约束,Agent 就能在本地硬件上被大规模并行化——那些烧掉数百万 token 的后台任务,边际成本为零。"这句话看似平淡,实则点破了端侧智能体的核心价值:免费推理带来的规模化可能。
二、LFM2.5-2.6B:小身材,大能力
LFM2.5-2.6B 是 Liquid AI 第二代架构(LFM2)的代表作。它仅有 26亿参数,却能在不依赖云端 API 的情况下完成规划、工具调用和多步任务等完整 Agent 工作流。关键规格如下:
| 维度 | LFM2.5-2.6B | 行业对照 |
|---|---|---|
| 内存占用 | 低于 2.5GB | 主流闭源模型需数十 GB |
| M5 Max 解码速度 | 220 tokens/s | 同尺寸模型普遍 30-60 tok/s |
| Ryzen AI Max+ 395 | 113 tokens/s | — |
| 手机端 | 仍可达 30 tokens/s | 基本不可用 |
| 开源协议 | 完全开放权重 | 多数端侧模型闭源或受限 |
最引人注目的是它的推理效率。Liquid AI 自研的 LFM2 架构通过稀疏注意力机制和高效的内存访问模式,在保持低显存占用的同时实现了惊人的解码速度。官方测试显示,在高并发下它几乎能达到 1.5万 output tokens/秒(单张 H100),或约每天 13亿 token——这个吞吐对本地部署意味着什么?一个团队可以并行运行成百上千个 Agent,而无需采购任何云算力。
代码示例:本地部署一个端侧 Agent
Liquid AI 提供了极简的两步接入方式。首先将模型暴露为 OpenAI 兼容端点:
1 | # 1. 用 llama.cpp 或 vLLM 服务 LFM2.5-2.6B |
它提供天一级生态支持:llama.cpp(GGUF)、MLX(Apple Silicon 优化)、vLLM/SGLang(GPU serving)、ONNX(跨平台)。这意味着开发者可以沿用熟悉的工具链,无需为硬件重新学习一套栈。
三、DSpark:给多模态端侧模型装上"推测解码"引擎
如果说 LFM2.5-2.6B 解决了"能不能在本地跑 Agent"的问题,那么 9月24日发布的 LFM2.5-VL-3B-DSpark 则回答了"如何跑得更快"。
这是一个约 2.8亿参数的推测解码(speculative decoding)draft model,与主模型 LFM2.5-VL-3B 配合使用。其核心思想是:用一个轻量级"草稿模型"快速提出候选 token,再由主模型在一次前向传播中并行验证多个 token,从而把原本受内存带宽限制的 decode 阶段大幅压缩。
实测数据显示显著加速:
| 硬件平台 | 解码吞吐提升 | 端到端吞吐提升 |
|---|---|---|
| Apple M5 Max (MLX-VLM) | 2.30×–3.13× | 1.56×–2.62× |
| NVIDIA H100 (SGLang) | 2.04×–2.66× | 1.64×–2.27× |
| Apple M3 Ultra (llama.cpp) | 1.57×–2.14× | 1.30×–1.77× |
值得注意的是,DSpark 的草稿模型仅使总参数量增加 8.9%,却换来了数倍的解码加速。Liquid AI 在技术博客中坦诚指出:由于视觉编码和 prompt prefill 阶段无法被推测解码加速,端到端提升受**阿姆达尔定律(Amdahl’s law)**约束——这体现了研究团队罕见的工程诚实。
四、影响与未来展望
Liquid AI 的路线对整个行业释放了三个信号:
-
边缘 AI 从概念走向现实。当本地就能跑起具备 Agent 能力的多模态模型,数据无需离开设备即可处理——这对隐私敏感场景具有战略价值。Apple M5 Ultra 用统一内存给出的答案,Liquid AI 用算法效率给出了另一种解法。
-
"免费推理"将重塑 Agent 经济。按 token 计费的云端模式可能被本地并行化大幅冲击。当边际推理成本趋近于零,开发者构建 Agent 的方式将从"精打细算"转向"大规模并发"。
-
算法与硬件的协同创新仍未触顶。在摩尔定律放缓的背景下,LFM2 这类专为效率设计的架构证明:更好的模型设计可以比单纯堆芯片带来更大的收益。
当然,端侧方案仍有短板:2.6B 参数在复杂推理、长链条任务上仍落后于 GPT-6、Claude Opus 5 等云端旗舰;手机端 30 tok/s 的吞吐也仅够基础交互。但对延迟敏感、隐私优先、高并发的工作负载,Liquid AI 已经给出了极具说服力的答案。
当 NVIDIA 用"AI工厂"重新定义数据中心时,Liquid AI 正在证明:智能体的下一站,或许不在更大的机柜,而在更贴近用户的设备里。这场关于效率与边界的革命,才刚刚开始。
