上海AI Lab开源Atria-Dawn-Preview:把744B MoE训练成"科研民工"的长时程智能体
一、一个”闷声不响”的开源发布
2026年9月11日,上海人工智能实验室(Shanghai AI Laboratory,InternLM团队)在 Hugging Face 上悄悄挂出了 Atria-Dawn-Preview 的权重与 OpenAI 兼容 API,MIT 协议,可商用、可自托管。没有发布会、没有通稿、没有定价页——三天后才补出 arXiv 技术报告,24 小时内就有第三方 LLM gateway 提交了集成 PR。
这种”先上权重后写故事”的发布方式本身就很当下:开源社区早已习惯顶级实验室用代码和 benchmark 说话,而不是靠营销。对读者而言,真正值得关注的不是它低调的登场,而是它的定位——一个为”长时程科研智能体”(long-horizon research agent)而生的模型。
二、站在 GLM-5.2 的肩膀上
Atria-Dawn 并非从零训练。它的底座是智谱在 6 月发布的 GLM-5.2:一颗 744B 参数的 MoE(混合专家)模型,激活参数规模适中,原生支持 256K 上下文。上海 AI Lab 在这块基座上做了两件事:
- 后训练(post-training)聚焦 agent 化——把原本偏”通用问答 + 长上下文工作机”的 GLM-5.2,改造成能持续理解环境、反复调用工具、跨多步完成任务的研究型智能体。
- 上下文窗口扩展到 1M token——这是长时程科研的关键。一篇论文从方法综述到复现代码再到结果验证,需要把大量文献、代码库和运行日志同时”记在脑子里”,256K 往往中途就”失忆”了。
换句话说,Atria-Dawn 与 GLM-5.2 是”同一块面团,两种烤法”:前者要的是通用高效,后者要的是科研闭环里的持久专注。
三、四个场景、16 个基准的考核
官方把评估分成四大研究环节,覆盖 16 个基准,并附上一条 769 对”人-AI”协作的对照研究——这是它相对其他开源 agent 模型的一个差异化亮点:它不仅看机器跑分,还看人和模型配合时的真实产出。
- Discovery(发现):从文献中定位尚未解决的问题、提出假设。
- Creation(创造):设计实验方案、生成可运行的代码与数据流水线。
- Delivery(交付):把文档、数据和设计要求转成报告、演示文稿等结构化成果。
- Cybersecurity(安全):在授权环境中分析漏洞、验证漏洞、应用修复并重新验证——形成”攻击-防御”闭环。
已披露的几个硬指标相当能打:
| 基准 | 成绩 | 说明 |
|---|---|---|
| DeepSearchQA(自研科研检索) | 96.0% | 长时程文献调研的准确率 |
| SWE-bench 2026 | 59.6% | 真实仓库级软件工程任务,开源 agent 第一梯队 |
作为参照,SWE-bench 2026 这类”在真实代码库里修 bug、过 CI”的任务,开源模型能突破 50% 就已经属于顶尖水平。Atria-Dawn 用 MIT 协议把这个能力免费开放,对中小团队和学术实验室是实打实的利好。
四、技术解读:为什么”长时程”这么难
当前大多数 LLM 的短板不是”单次推理不够聪明”,而是在连续几十次甚至上百次工具调用中保持目标不漂移。Atria-Dawn 针对的正是这个痛点:
1 | # 用 vLLM >= 0.23 本地部署(OpenAI 兼容接口) |
这段伪代码展示了它的典型工作流:接收一个模糊的科研目标 → 自主拆解 → 反复检索、读文献、写代码、验证 → 输出结构化成果。模型需要在整个过程中维持对”我到底要解决什么问题”的认知,这正是长时程智能体与一次性问答的本质区别。
五、影响与未来展望
Atria-Dawn-Preview 的意义在于它把**开源 agent 模型的战场从”单点能力”推向了”全流程科研闭环”**:
- 对学术界——MIT 协议 + 本地可部署,意味着任何实验室都能拿它搭一套”AI 科研助理”,而不必担心 API 成本或数据外泄。
- 对工业界——Discovery→Creation→Delivery→Security 的完整链路,恰好覆盖了研发部门最耗人力的环节。当 Claude Fable、GPT-6 Astra 还在拼单点推理时,Atria-Dawn 走的是”把一支科研小队编队成模型”的路线(与 Sakana Fugu 的编排思路异曲同工,但 Atria 是单体大模型而非多模型调度器)。
- 对开源生态——它证明了 744B MoE 基座经过针对性后训练,就能在 SWE-bench 2026 这类硬基准上逼近闭源前沿。
当然,preview 阶段仍有局限:官方明确它不支持视觉或音频输入,纯文本 + 代码定位;benchmark 多为自研指标,独立第三方复现尚缺。但即便如此,它已是当前开源长时程科研智能体中最值得上手试用的一个。
当”AI 能不能自己做完一项研究”从科幻走向工程问题,Atria-Dawn-Preview 用一份 MIT 权重给出了它的初步答案:可以,而且免费。
