Reka Edge 2603发布:把一张图压到331个token,7B多模态模型如何杀向"物理AI"边缘
一、当”看得清”让位于”看得快”:边缘多模态的新战场
过去两年,多模态大模型的竞争几乎被两件事垄断:参数规模与上下文长度。谁能把图片切成上千个 token、谁能塞进百万级上下文,谁就占据叙事高地。然而就在所有人卷”视觉分辨率”时,Reka AI 于 2026 年 10 月初发布了 Reka Edge 2603——一个约 7B 参数的多模态视觉语言模型(VLM),把火力对准了一个被长期忽视的维度:token 效率。
在实时视频、机器人操控、车载系统等”物理 AI”场景里,延迟和显存才是生死线。Reka 的判断很直接:让模型用更少的 token 看懂同一张图,比让它看更多细节更重要。这个朴素判断背后,是一套从训练阶段就为”紧凑视觉表征”设计的全新架构。
二、核心规格:657M 编码器 + 6.4B 语言骨干
Reka Edge 2603 的架构并不复杂,但每个选择都服务于同一个目标——压缩。
- 视觉编码器:657M 参数的 ConvNeXt V2,负责把图像/视频帧转成视觉 token。
- 语言骨干:6.4B 参数、从零训练的 Transformer,承担理解与生成。
- 输入模态:文本 + 图像 + 视频 → 纯文本输出。
- 上下文窗口:16K tokens,最大输出 16K。
最关键的设计在于视觉 token 的紧凑度。Reka 采用”分块(tile)”编码,每块图片仅生成约 64 个视觉 token。实测中,一张 1024×1024 的图片被压缩到 331 个输入 token——作为对照,同属 7B–8B 级别的 Cosmos-Reason2 8B 需要 1063 个,Gemini 3 Pro 需要 1094 个。
1 | ┌──────────────────── Reka Edge 2603 架构 ────────────────────┐ |
三、技术分析:为什么”少 token”能改变游戏规则
token 效率的提升不是数字游戏,它直接映射到三个工程指标:
延迟(Latency)。自回归模型中,视觉 token 会全部进入 KV cache 并参与每一步解码。331 vs 1063 的差距意味着预填充阶段减少约 70% 的计算量——对实时视频流(每秒 30 帧)而言,这可能是”流畅”与”卡顿”的区别。
显存/成本。更少的视觉 token = 更小的上下文占用。在 $0.10/百万输入、$0.10/百万输出的定价下(OpenRouter),单次请求成本被压到接近于零,使高频调用成为可能。
流式与边缘部署。紧凑表征让模型更容易跑在算力受限的设备上——车载 ECU、机器人主控、移动端。
性能是否牺牲了质量? 从 Reka 公布的模型卡看,答案是否定的:
| 基准 | Reka Edge 2603 | 说明 |
|---|---|---|
| VQA-V2(视觉问答) | 88.40 | 图像理解能力 |
| MLVU(视频理解) | 74.30 | 长视频时序推理 |
| RefCOCO-A(目标检测/空间定位) | 93.13 | 物理空间 grounding |
其中 RefCOCO-A 的高分尤其值得注意——它要求模型精确理解”图中某个物体相对其他物体的位置”,这正是机器人抓取、自动驾驶决策所需的物理空间感知能力。Reka 用”少而精”的 token 同时拿下了效率与精度。
四、影响与未来展望:多模态的”性价比拐点”
Reka Edge 2603 的意义不在单项跑分,而在于它验证了一条新范式:多模态模型的下一个突破口是表征效率,而非单纯的规模扩张。
“物理 AI”迎来合适的大脑。机器人、自动驾驶、实时视频检测长期受困于端侧算力。一个能在有限硬件上低延迟运行的开源 VLM,补上了从”云端演示”到”落地部署”的关键一环。Reka 明确将 Edge 定位为面向机器人、汽车和实时视频的模型,并开放权重下载——这与它此前 MuseGlimmer 走本地部署路线一脉相承。
开源权重 + 极低定价 = 生态杠杆。与闭源旗舰不同,Edge 2603 同时提供可下载权重和 $0.10/M 的 API。对想自建视觉 Agent、做工具调用(language-guided tool use)的团队,这意味着无需为每次图像理解支付旗舰模型的高价。
对行业的信号。当 Gemini、Cosmos 还在卷”看更多 token”时,Reka 用”看更少 token”证明了效率本身可以成为竞争力。未来多模态研究的焦点,很可能从”分辨率战争”转向”表征经济学”——如何用最少信息承载最大语义。
当然,挑战依然存在:16K 上下文在长视频分析上仍显局促;ConvNeXt V2 编码器在极端光照、超高分辨率下的鲁棒性尚待验证;而 7B 规模面对 GPT-6、Opus 5 级旗舰时,复杂多步视觉推理仍有差距。但对绝大多数”实时 + 低成本”的真实场景而言,Reka Edge 2603 已经给出了一个极具说服力的答案:在物理世界,快就是硬道理。
