一、一个玩笑,怎么炸上了 GitHub 榜首?

2026年4月的一个周五,开发者 JuliusBrussee 随手开了个仓库 caveman,初衷纯粹是玩梗:让 AI 编程代理(coding agent)像原始人一样说话——砍掉所有冠词、介词、客套话,只留最干的技术骨架。效果类似把 “Please provide a summary of this article” 直接压成 “Summarize article”。

结果这个玩笑一夜之间失控了。一周内冲到 4,000 star,如今累计突破 107,000 star,先后登顶 GitHub Trending(2026年7月 #1)、Hacker News(904 points、366 comments)和 Trendshift “当日第一仓库”。连 ThePrimeagen 都在视频里对着镜头喊出那句著名的 “No way this actually works”——而它确实有效。

caveman 的爆火,标志着一个微妙风向的转变:当所有实验室都在卷大模型本身时,开发者社区最疯狂的追捧,却给了一个夹在模型外围的小工具。

二、它到底是什么?Skill + Proxy 的双层结构

caveman 不是又一个编码代理,也不是新模型。它是两层东西的组合:

  1. 一个 Skill(技能文件)——本质是一页用大白话写成的指令,告诉 agent “说话时砍掉所有填充词”。它没有安装负担、没有新的心智模型,你把它丢进 Claude Code / Codex / Cursor 这类代理就能用。
  2. 一个 Proxy(代理服务)——当项目走红后,作者又推出了配套代理层,在运行时对 token 流做压缩中转。

这种”Skill + Proxy”的结构,正是它低门槛的关键:第一层几乎零成本试错,第二层则把省 token 的效果从”聊天场景”推进到了”真实 agentic 任务”。

三、65% 的谎言与 8.5% 的真相

caveman 最出圈的卖点是 **”节省 65% 的 token”**。这个数字吓人了,但 JetBrains 用一次严谨的 A/B 实测给它泼了盆冷水。

JetBrains 在自家 SkillsBench 平台上,用 Claude Code 跑了 86 个真实 agentic 任务,对比开了 caveman skill 前后的表现。结论有两个:

  • 省是真的省:实际输出 token 下降了约 **8.5%**——不是聊天场景里测出来的 65%,而是真实多步任务里的数字。
  • 质量没掉:在任务完成度上没有可观测的退化。也就是说,少说废话确实不牺牲结果质量。
指标 caveman 宣称 JetBrains 实测(86任务)
Token 节省 65% ~8.5%(输出 token)
场景 纯聊天对话 真实 agentic 任务
质量退化 未声明 无可观测退化

这个”宣称 vs 实测”的落差本身,就是今天 AI 工具生态的一个缩影:营销数字在聊天窗口里很性感,工程评测却在复杂任务里打回原形。 好消息是,8.5% 的净节省叠加”零质量损失”,对按 token 计费的开发者来说依然是一笔划算的账。

四、为什么是现在?Agent 经济的”隐形成本”

caveman 的走红不是偶然,它踩中了三个结构性痛点:

  1. 代理是按字计费的。与一次性问答不同,编码代理会连续调用工具、检索、多轮推理——上下文窗口越填越长,账单也随之膨胀。省 token 从”优化项”变成了”成本项”。
  2. “滚过前言”是全行业的共同烦恼。caveman 之所以引发共鸣,正是因为它把那个”没人说出口、但人人都骂过”的痛点大声喊了出来。一个 skill 文件,比任何新框架都更容易让人点 star。
  3. 外围软件正在成为一等公民。看看同期 GitHub:agent harness(DeepSeek Harness +152K star)、可复用 skills(mattpocock/skills +34K)、多代理编排(Orca)霸榜。围绕模型的”中间层”——技能、网关、记忆、路由——正成长为独立的一等开源品类。

五、影响与未来展望:省 token,还是省注意力?

caveman 的真正意义不在那 8.5%,而在于它揭示了一个趋势:在 Agent 时代,提升杠杆的最强手段,可能不是一篇更聪明的模型权重,而是一页你用大白话写成的指令。

对开发者而言,有三点值得记住:

  • 读清楚再上手。作者明确建议”用之前先读一遍 skill 文件本身”——好的 skill 应该是一页清晰的说明,而不是黑箱。
  • 警惕营销数字。65%→8.5% 的落差提醒我们:任何效率宣称都要问一句”在什么场景、怎么测的”。
  • 关注外围创新。当模型能力趋于同质化,真正拉开体验差距的,往往是这些夹缝中的小优化。

caveman 从玩笑到研究论文、从玩梗到 JetBrains 实验室评测,只用了半年。它像是一个隐喻:AI 编程的下一场革命,或许不在更大的算力里,而在我们怎么说、以及让 AI 怎么省着说之中。