一、当”看得清”让位于”看得快”:边缘多模态的新战场

过去两年,多模态大模型的竞争几乎被两件事垄断:参数规模与上下文长度。谁能把图片切成上千个 token、谁能塞进百万级上下文,谁就占据叙事高地。然而就在所有人卷”视觉分辨率”时,Reka AI 于 2026 年 10 月初发布了 Reka Edge 2603——一个约 7B 参数的多模态视觉语言模型(VLM),把火力对准了一个被长期忽视的维度:token 效率。

在实时视频、机器人操控、车载系统等”物理 AI”场景里,延迟和显存才是生死线。Reka 的判断很直接:让模型用更少的 token 看懂同一张图,比让它看更多细节更重要。这个朴素判断背后,是一套从训练阶段就为”紧凑视觉表征”设计的全新架构。

二、核心规格:657M 编码器 + 6.4B 语言骨干

Reka Edge 2603 的架构并不复杂,但每个选择都服务于同一个目标——压缩。

  • 视觉编码器:657M 参数的 ConvNeXt V2,负责把图像/视频帧转成视觉 token。
  • 语言骨干:6.4B 参数、从零训练的 Transformer,承担理解与生成。
  • 输入模态:文本 + 图像 + 视频 → 纯文本输出。
  • 上下文窗口:16K tokens,最大输出 16K。

最关键的设计在于视觉 token 的紧凑度。Reka 采用”分块(tile)”编码,每块图片仅生成约 64 个视觉 token。实测中,一张 1024×1024 的图片被压缩到 331 个输入 token——作为对照,同属 7B–8B 级别的 Cosmos-Reason2 8B 需要 1063 个,Gemini 3 Pro 需要 1094 个。

1
2
3
4
5
6
7
8
9
┌──────────────────── Reka Edge 2603 架构 ────────────────────┐
│ │
│ 图像/视频帧 → [ConvNeXt V2 657M] → 紧凑视觉 token (331) │
│ ↓ │
│ 视觉 token + 文本 prompt │
│ ┌───────[ 6.4B Transformer ]────────┐ │
│ ↓ │ │
│ 纯文本输出 ← 工具调用 / 空间定位 │ │
└──────────────────────────────────────────────────────────────┘

三、技术分析:为什么”少 token”能改变游戏规则

token 效率的提升不是数字游戏,它直接映射到三个工程指标:

  1. 延迟(Latency)。自回归模型中,视觉 token 会全部进入 KV cache 并参与每一步解码。331 vs 1063 的差距意味着预填充阶段减少约 70% 的计算量——对实时视频流(每秒 30 帧)而言,这可能是”流畅”与”卡顿”的区别。

  2. 显存/成本。更少的视觉 token = 更小的上下文占用。在 $0.10/百万输入、$0.10/百万输出的定价下(OpenRouter),单次请求成本被压到接近于零,使高频调用成为可能。

  3. 流式与边缘部署。紧凑表征让模型更容易跑在算力受限的设备上——车载 ECU、机器人主控、移动端。

性能是否牺牲了质量? 从 Reka 公布的模型卡看,答案是否定的:

基准 Reka Edge 2603 说明
VQA-V2(视觉问答) 88.40 图像理解能力
MLVU(视频理解) 74.30 长视频时序推理
RefCOCO-A(目标检测/空间定位) 93.13 物理空间 grounding

其中 RefCOCO-A 的高分尤其值得注意——它要求模型精确理解”图中某个物体相对其他物体的位置”,这正是机器人抓取、自动驾驶决策所需的物理空间感知能力。Reka 用”少而精”的 token 同时拿下了效率与精度。

四、影响与未来展望:多模态的”性价比拐点”

Reka Edge 2603 的意义不在单项跑分,而在于它验证了一条新范式:多模态模型的下一个突破口是表征效率,而非单纯的规模扩张。

  1. “物理 AI”迎来合适的大脑。机器人、自动驾驶、实时视频检测长期受困于端侧算力。一个能在有限硬件上低延迟运行的开源 VLM,补上了从”云端演示”到”落地部署”的关键一环。Reka 明确将 Edge 定位为面向机器人、汽车和实时视频的模型,并开放权重下载——这与它此前 MuseGlimmer 走本地部署路线一脉相承。

  2. 开源权重 + 极低定价 = 生态杠杆。与闭源旗舰不同,Edge 2603 同时提供可下载权重和 $0.10/M 的 API。对想自建视觉 Agent、做工具调用(language-guided tool use)的团队,这意味着无需为每次图像理解支付旗舰模型的高价。

  3. 对行业的信号。当 Gemini、Cosmos 还在卷”看更多 token”时,Reka 用”看更少 token”证明了效率本身可以成为竞争力。未来多模态研究的焦点,很可能从”分辨率战争”转向”表征经济学”——如何用最少信息承载最大语义。

当然,挑战依然存在:16K 上下文在长视频分析上仍显局促;ConvNeXt V2 编码器在极端光照、超高分辨率下的鲁棒性尚待验证;而 7B 规模面对 GPT-6、Opus 5 级旗舰时,复杂多步视觉推理仍有差距。但对绝大多数”实时 + 低成本”的真实场景而言,Reka Edge 2603 已经给出了一个极具说服力的答案:在物理世界,快就是硬道理。