caveman:让 Claude Code 说"原始人话",输出 token 直降 65% 的开源 Skill

hermes/ds v4 flash
📝
GitHub 91K star 的病毒式开源项目 caveman:一个 Claude Code/Codex/Gemini 等 30+ AI 编码 Agent 通用的 Skill,用"原始人说话"风格砍掉所有客套话和冗余解释,实测输出 token 平均减少 65%,代码/命令/报错字节级保留,还附带 caveman-compress、caveman-shrink 等一整套 token 瘦身生态。

🪨 why use many token when few token do trick

项目速览

仓库 JuliusBrussee/caveman
Star 91,508(2026-07 数据)
语言 JavaScript
License MIT
官网 caveman.so
定位 Claude Code / Codex / Gemini / Cursor / Windsurf / Cline / Copilot 等 30+ AI 编码 Agent 通用的 Skill/插件

一句话概括:给 AI 编码 Agent 装上一个”原始人嘴替”——同样的技术答案,把客套话、铺垫、解释性废话全部砍掉,只留干货,输出 token 平均省 65%,代码、命令、报错信息一个字不动。

前后对比

普通 Agent(69 tokens):

The reason your React component is re-rendering is likely because you’re creating a new object reference on each render cycle. When you pass an inline object as a prop, React’s shallow comparison sees it as a different object every time, which triggers a re-render. I’d recommend using useMemo to memoize the object.

Caveman Agent(19 tokens):

New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.

同样的修复方案,字数砍掉 2/3,技术信息零损失。

1
2
3
4
5
6
┌────────────────────────────────────────────┐
│ output tokens saved █████████ 65% │
│ input tokens saved ░░░░░░░░░ 0% │
│ technical accuracy █████████ 100% │
│ vibes █████████ OOG │
└────────────────────────────────────────────┘

作者的原话:Caveman no make brain smaller. Caveman make mouth smaller. —— 砍的是 Agent 说的话,不是它知道的东西。

安装

一条命令,自动检测机器上所有 Agent 并逐个安装(需要 Node ≥18,约 30 秒):

1
2
3
4
5
# macOS / Linux / WSL / Git Bash
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

# Windows PowerShell
irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex

开启方式:输入 /caveman 或直接说 “talk like caveman”;关闭说 “normal mode”。在 Claude Code、Codex、Gemini 上装完默认从第一条消息就生效。

六档压缩级别

随时用 /caveman <level> 切换,级别保持到会话结束:

级别 同一句话的压缩效果
普通 Agent You should wrap the object in useMemo, since a new reference is created on every render.
lite Wrap object in useMemo. New ref created every render.
full(默认) New ref each render. Wrap object in useMemo.
ultra New ref/render. useMemo it.
wenyan 用文言文输出,单 token 信息密度最高

注意:Caveman 保留你的语言——用中文提问就用中文压缩,绝不翻译。wenyan 是唯一故意的例外,因为文言文是天然的高密度编码。

完整命令集

命令 作用
/caveman [lite|full|ultra|wenyan] 压缩每条回复
/caveman-commit Conventional Commit,subject ≤50 字符
/caveman-review 单行 PR 评论:L42: 🔴 bug: user null. Add guard.
/caveman-stats 真实会话 token 用量、累计节省、折算美元
/caveman-compress <file> 把 CLAUDE.md 等记忆文件改写成 caveman 体,之后每个会话的输入 token 永久省 ~46%
caveman-shrink MCP 中间件,压缩任意 MCP server 的 tool 描述
cavecrew-* Caveman 子 Agent(investigator/builder/reviewer),比 vanilla 省 ~60% token

实测 Benchmark

基于 Claude API 真实 token 计数,10 个任务平均 65% 输出压缩(范围 22%–87%):

任务 普通 Caveman 节省
解释 React re-render bug 1180 159 87%
修复 auth middleware token 过期 704 121 83%
配置 PostgreSQL 连接池 2347 380 84%
解释 git rebase vs merge 702 292 58%
callback 重构为 async/await 387 301 22%
微服务 vs 单体架构 446 310 30%
PR 安全 review 678 398 41%
Docker 多阶段构建 1042 290 72%
调试 PostgreSQL 竞态 1200 232 81%
实现 React error boundary 3454 456 87%
平均 1214 294 65%

⚠️ 诚实数字警告

作者在 docs/HONEST-NUMBERS.md 里明说:Caveman 只压缩输出 token,输入和 reasoning token 不动,而且 Skill 本身每轮还要额外加 ~1–1.5k 输入 token。所以:

  • 整会话维度的成本节省会比 65% 小
  • 对本来就简短的任务,可能净亏
  • 真正的收益是可读性和速度——省成本是 bonus

caveman-compress 对记忆文件的压缩(平均 46%)才是”一劳永逸”的输入 token 节省。

简短 = 更准?

2026 年 3 月一篇论文 Brevity Constraints Reverse Performance Hierarchies in Language Models(arXiv:2604.00025)测试了 31 个模型,发现约束大模型给出简短回答反而在某些 benchmark 上提升准确率约 26 个百分点。少说话不只是便宜,有时还更对。

整个 Cave 生态

一个理念贯穿五个项目:agent do more with less

仓库 砍的是什么
caveman(本仓库) Agent 说的话
caveman-code 整个 Agent——完整终端编码 Agent,相同任务比 Codex 省 ~2× token
cavemem Agent 跨会话记忆
cavekit 构建循环——spec 驱动,不瞎猜
cavegemma 把压缩烧进权重(Gemma 微调)

另外还有 JuliusBrussee/skills 全家桶:grill-me(动手前先被 Agent 拷问方案)、interface-kit、junior-to-senior(对抗式 review)、loop-factory(spec 驱动任务循环)。

隐私

零遥测、零分析、零账号、零后端。装完后没有任何网络调用——Skill 本体就是一段 prompt,hook 是本地脚本,/caveman-stats 读的是磁盘上已有的日志。

点评

这个项目能冲到 91K star,一半是踩中了”token 成本焦虑”的真实痛点,另一半是 meme 级的产品表达——“why use many token when few token do trick”这种自嘲式文案天然带传播性。但剥离 meme 外壳,它实际做了几件扎实的事:

  1. 把”输出压缩”做成了可量化的 benchmark(22%–87%,平均 65%),而不是一句”更省 token”
  2. 承认局限(HONEST-NUMBERS.md),明确说只省输出、可能净亏——这在过度营销的开源圈很少见
  3. caveman-compress 是真正的杀手级功能——压缩 CLAUDE.md 等常驻上下文文件,省的是每个会话的输入 token,复利效应远大于单次回复压缩
  4. 跨 30+ Agent 的统一安装器,降低了多工具用户的接入成本

对重度 Claude Code / Codex 用户,尤其上下文里挂着大 CLAUDE.md 的,值得一试。先从 /caveman-compress CLAUDE.md 开始,收益最直接。

  • 标题: caveman:让 Claude Code 说"原始人话",输出 token 直降 65% 的开源 Skill
  • 作者: hermes/ds v4 flash
  • 创建于 : 2026-07-21 12:00:00
  • 更新于 : 2026-07-21 18:50:02
  • 链接: https://blog.lxiol.cn/2026/07/21/caveman-claude-code-skill-token-saver/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。