caveman:这个10万星的开源项目,让AI编程代理学会"省着说话"
一、一个玩笑,怎么炸上了 GitHub 榜首?
2026年4月的一个周五,开发者 JuliusBrussee 随手开了个仓库 caveman,初衷纯粹是玩梗:让 AI 编程代理(coding agent)像原始人一样说话——砍掉所有冠词、介词、客套话,只留最干的技术骨架。效果类似把 “Please provide a summary of this article” 直接压成 “Summarize article”。
结果这个玩笑一夜之间失控了。一周内冲到 4,000 star,如今累计突破 107,000 star,先后登顶 GitHub Trending(2026年7月 #1)、Hacker News(904 points、366 comments)和 Trendshift “当日第一仓库”。连 ThePrimeagen 都在视频里对着镜头喊出那句著名的 “No way this actually works”——而它确实有效。
caveman 的爆火,标志着一个微妙风向的转变:当所有实验室都在卷大模型本身时,开发者社区最疯狂的追捧,却给了一个夹在模型外围的小工具。
二、它到底是什么?Skill + Proxy 的双层结构
caveman 不是又一个编码代理,也不是新模型。它是两层东西的组合:
- 一个 Skill(技能文件)——本质是一页用大白话写成的指令,告诉 agent “说话时砍掉所有填充词”。它没有安装负担、没有新的心智模型,你把它丢进 Claude Code / Codex / Cursor 这类代理就能用。
- 一个 Proxy(代理服务)——当项目走红后,作者又推出了配套代理层,在运行时对 token 流做压缩中转。
这种”Skill + Proxy”的结构,正是它低门槛的关键:第一层几乎零成本试错,第二层则把省 token 的效果从”聊天场景”推进到了”真实 agentic 任务”。
三、65% 的谎言与 8.5% 的真相
caveman 最出圈的卖点是 **”节省 65% 的 token”**。这个数字吓人了,但 JetBrains 用一次严谨的 A/B 实测给它泼了盆冷水。
JetBrains 在自家 SkillsBench 平台上,用 Claude Code 跑了 86 个真实 agentic 任务,对比开了 caveman skill 前后的表现。结论有两个:
- 省是真的省:实际输出 token 下降了约 **8.5%**——不是聊天场景里测出来的 65%,而是真实多步任务里的数字。
- 质量没掉:在任务完成度上没有可观测的退化。也就是说,少说废话确实不牺牲结果质量。
| 指标 | caveman 宣称 | JetBrains 实测(86任务) |
|---|---|---|
| Token 节省 | 65% | ~8.5%(输出 token) |
| 场景 | 纯聊天对话 | 真实 agentic 任务 |
| 质量退化 | 未声明 | 无可观测退化 |
这个”宣称 vs 实测”的落差本身,就是今天 AI 工具生态的一个缩影:营销数字在聊天窗口里很性感,工程评测却在复杂任务里打回原形。 好消息是,8.5% 的净节省叠加”零质量损失”,对按 token 计费的开发者来说依然是一笔划算的账。
四、为什么是现在?Agent 经济的”隐形成本”
caveman 的走红不是偶然,它踩中了三个结构性痛点:
- 代理是按字计费的。与一次性问答不同,编码代理会连续调用工具、检索、多轮推理——上下文窗口越填越长,账单也随之膨胀。省 token 从”优化项”变成了”成本项”。
- “滚过前言”是全行业的共同烦恼。caveman 之所以引发共鸣,正是因为它把那个”没人说出口、但人人都骂过”的痛点大声喊了出来。一个 skill 文件,比任何新框架都更容易让人点 star。
- 外围软件正在成为一等公民。看看同期 GitHub:agent harness(DeepSeek Harness +152K star)、可复用 skills(mattpocock/skills +34K)、多代理编排(Orca)霸榜。围绕模型的”中间层”——技能、网关、记忆、路由——正成长为独立的一等开源品类。
五、影响与未来展望:省 token,还是省注意力?
caveman 的真正意义不在那 8.5%,而在于它揭示了一个趋势:在 Agent 时代,提升杠杆的最强手段,可能不是一篇更聪明的模型权重,而是一页你用大白话写成的指令。
对开发者而言,有三点值得记住:
- 读清楚再上手。作者明确建议”用之前先读一遍 skill 文件本身”——好的 skill 应该是一页清晰的说明,而不是黑箱。
- 警惕营销数字。65%→8.5% 的落差提醒我们:任何效率宣称都要问一句”在什么场景、怎么测的”。
- 关注外围创新。当模型能力趋于同质化,真正拉开体验差距的,往往是这些夹缝中的小优化。
caveman 从玩笑到研究论文、从玩梗到 JetBrains 实验室评测,只用了半年。它像是一个隐喻:AI 编程的下一场革命,或许不在更大的算力里,而在我们怎么说、以及让 AI 怎么省着说之中。
