Token 优化指南

面向 Cursor · Claude Code · Codex(Cursor 全套餐已可用 Grok 4.5)。已用 GitHub API 扫描 token-optimization 专题802 仓,按 stars 排序,2026-06),见 专题分析;安装配置见各章节。

最后更新:2026-07-30 · 专题 #1 RTK(66K★)· #2 Headroom(51K★)· #3 LeanCTX(2.9K★)· 安岭导航 工具卡片

Grok 4.5(2026-07):主打编程/Agent,API 约 $2 / $6 每百万 token(输入/输出),官方称任务 token 效率更高。在 Cursor 选 Grok 4.5 时仍建议配合下文 RTK / Headroom / Rules 压缩,避免 Agent 多轮把「便宜单价」打成「贵账单」。独立 CLI 见 Grok Build

消费端定时 · 免接 API Token

把「全天随聊」改成「每天到点跑一次」,少开对话轮次,直接省会员额度——不用自己填 API Key / Coding Plan。能力与限额以各 App 实时页为准;刊例核对截至 2026-07-30。

省额度逻辑:定时简报 ≈ 少轮次闲聊。仍受各家「活跃任务数 / 会员档」限制(如 Gemini 约 10 个活跃任务)。要 OpenClaw / Hermes 自建 cron,见 Agent · Loop Engineering(需自备模型 Token)。下文 Headroom / RTK 等面向编码三省压缩。
产品定时能力大致门槛典型用途
ChatGPTScheduled TasksPlus / Pro / Enterprise日报、提醒、周期监控
GeminiScheduled ActionsAI Pro / Ultra(部分 Workspace)邮件/日历简报、周期内容
微软 CopilotCopilot Tasks个人账号 / M365 体系提醒、任务、办公联动
Kimi定时任务App/网页账号(额度看会员)周期简报、提醒
腾讯元宝定时任务微信/QQ 系账号提醒、定时查询
智谱清言 / GLM定时任务智谱账号(会员更稳)定时执行、提醒
豆包任务模式 + 定时字节账号;多在订阅/灰度到点生成报告/整理交付
通义 / QwenWork定时任务阿里账号(办公端更完整)周期办公、云端到点跑
Claude Cowork/schedulePro / Max 等桌面周期办公任务
ManusScheduled Tasks产品订阅/积分(非自备 Key)日报、研究、周期抓取

选型速记:海外通用 → ChatGPT / Gemini · 微信生态 → 元宝 · 长文简报 → Kimi · 要「做完交活」→ 豆包任务 / Manus · 微软办公 → Copilot。Claude Code /loop、OpenClaw 等不在本表(开发/自托管,需接模型 Token)。

🚀 Headroom — 专题旗舰(全栈压缩)

headroomlabs-ai/headroom — 专题 #2(51K★):全栈压缩工具输出、日志、RAG、文件与历史,CCR 可逆。适合重度编码 / 长任务 / RAG / 团队控本 → 最佳实践

四种接入
  • Library — Python/TS compress()
  • Proxyheadroom proxy --port 8787
  • Wrapheadroom wrap claude|codex
  • MCPheadroom mcp install
Agent 兼容

Claude Code Codex wrap ✅

Cursor 手动代理 URL(见下)

跨 Agent 共享 memory · headroom learn 写规约

实测节省(官方)

代码搜索 92% · SRE 排障 92% · Issue 分拣 73%

输出侧:HEADROOM_OUTPUT_SHAPER=1 减废话/thinking

安装(60 秒)
pip install "headroom-ai[all]"    # Python 3.10+,推荐
# 或 npm install headroom-ai

headroom perf                     # 查看节省
headroom dashboard                # 代理运行时开面板

企业网络 SSL 拦截见 Corporate / SSL 章节。

Claude Code
headroom wrap claude
# 可选:--memory --code-graph --1m

一键起代理并启动 Claude Code;压缩经代理管道进入模型。

Codex
headroom wrap codex

与 Claude 共享 memory 存储;headroom learn 可写 AGENTS.md

Cursor
headroom wrap cursor
# 或先起代理:
headroom proxy --port 8787

Cursor 无自动 wrap:命令会打印需在 Cursor Settings 里粘贴的 Override OpenAI Base URL(及 Anthropic 等价项)。按终端提示填入即可。

MCP 与输出压缩
headroom mcp install
# 工具:headroom_compress / headroom_retrieve / headroom_stats
export HEADROOM_OUTPUT_SHAPER=1
headroom proxy --port 8787

输出塑形:减少模型寒暄与 routine 步骤上的深度 thinking(代理侧,无需改业务代码)。

🎯 LeanCTX — 上下文门控(专题 #3)

yvgude/lean-ctx — 与 Headroom「压体积」互补:控制 Agent 能看见什么,减少无关文件、工具结果与 RAG 垃圾注入。适合长任务、多 MCP、大仓扫库。

与 Headroom / RTK 怎么配
  • LeanCTX — 门控注入源(哪些进上下文)
  • Headroom / RTK — 压缩已进入上下文的内容
  • Tokscale — 观测三者叠加后的真实用量

三省接入:作为 Agent 中间件或上下文层,与 Cursor Rules / Claude Code / Codex 的 MCP 工具链并列部署;详见仓库 README 与 examples/

📐 Headroom 最佳实践:分层策略 + 基线量化 + 动态调控

核心原则:不要无脑开最高压缩。唯一判断标准——总成本 = 省下的 Token 费 < 返工多花的 Token 费。ContentRouter 会按 JSON / 代码 AST / 文本自动选压缩器;你要做的是按场景设力度,并用 holdout 对照。

一、前置:先算清「基准账」(必做)

所有 Agent 统一走 Headroom 代理 1–2 周后再调参,不要上来就拉满压缩。

# 代理运行中或 wrap 会话结束后
headroom perf              # 汇总节省与近期趋势
headroom stats             # 更细的统计(亦可 MCP:headroom_stats)
headroom output-savings    # 输出侧节省(含置信区间)
headroom dashboard         # 可视化面板(需 proxy 在跑)

重点盯 3 个指标(可用 Tokscale 交叉验证账单):

  • 单任务平均 Token 成本
  • 任务首次成功率(无需返工的比例)
  • 返工率(修偏方向、重跑测试/检索的次数)
成功率掉 5%+ 时,先降压缩力度或加大 holdout,再谈继续省 Token。

二、按内容类型分层压缩(最关键)

内容类型建议力度场景落地方式
日志 / 测试输出 / 工具返回
pytest、ls -R、JSON 列表
80–95% 跑测试、读日志、修 bug;重复高、语义密度低 代理默认 ContentRouter → SmartCrusher 自动识别,一般无需额外配置
RAG 检索片段 / 企业文档 chunks 70–90% 内部 Agent、知识库问答;压重复与低相关段落 检索后先压缩再拼 Prompt(见下方 RAG 示例);保留标题/来源等元数据行
大型仓库文件 / 非核心代码 50–70% Cursor 改大仓、扫引用;压空行/注释,留签名与核心逻辑 Claude/Codex:headroom wrap … --code-graph;压后可用 headroom_retrieve 回查原文
异常堆栈 / 权限 JSON / 安全逻辑 ≤30% 或 bypass 线上事故、权限校验、金融/医疗 敏感任务走代理 bypass 或临时不用 wrap;可用 .contextignore 硬排除路径
核心业务逻辑 / 安全审计 不建议压 架构设计、审计;缺上下文易漏风险 该任务直连模型或 bypass;宁可多 Token 也不误判
经验边界:官方 benchmark 显示日志/工具类压到 90%+ 准确率几乎不降;代码语义类压过 70% 可能丢关键信息,不要迷信 95%。压过头用 CCR headroom_retrieve 拉回原文。

三、分场景落地(Codex / Claude Code / Cursor)

1. AI 编码日常(三省)
# Claude Code / Codex:代码图 + 跨 Agent 记忆
headroom wrap claude --code-graph --memory
headroom wrap codex --code-graph --memory

# Cursor:统一出口代理(Settings 贴 Base URL)
headroom proxy --port 8787
export HEADROOM_OUTPUT_SHAPER=1
export HEADROOM_OUTPUT_HOLDOUT=0.1   # 10% 对照组,dashboard 标 measured

改大仓、长测试:常见 50–70% 输入节省;--code-graph 帮助 CodeCompressor 少压断引用。

注意:环境变量名是 HOLDOUT 不是 HOLDOFF;对已在跑的共享 proxy,Headroom 支持 loopback 热同步 runtime-env。

2. RAG / 企业内部 Agent
from headroom import compress

def retrieve_and_compress(query):
    chunks = rag_retrieve(query)
    msgs = [{"role": "user", "content": c.text} for c in chunks]
    return compress(msgs, model="claude-sonnet-4-20250514")

多文档检索常省 60–90% 输入 Token;无关片段被压掉,模型更少「读偏」。

3. 团队成本管控
  • 全员统一 headroom proxy --port 8787 出口,Dashboard 看总账
  • 日常开发:默认代理 + 输出塑形;核心评审/事故:成员自行 bypass 或不用 wrap
  • 定期:headroom learn --verbosity --apply 从会话学简洁偏好
  • Tokscale 并用:Headroom 看压缩率,Tokscale 对账真实账单
4. 输出 Token(常被忽略)
export HEADROOM_OUTPUT_SHAPER=1
export HEADROOM_OUTPUT_HOLDOUT=0.1
headroom proxy --port 8787

headroom learn --verbosity          # 预览从会话学到的简洁度
headroom learn --verbosity --apply  # 写入配置,proxy 沿用

Opus 档输出单价可达输入 ;塑形减寒暄与 routine 步骤上的 deep thinking。

四、三条红线

① 永远留 holdout

至少 HEADROOM_OUTPUT_HOLDOUT=0.050.1。成功率掉 5%+ 立刻降力度或加大对照比例。

② 三类不激进压

线上事故排查、安全审计、金融/医疗——bypass 或直连,宁多花 Token 不误判。

③ 返工 > 节省

模型因上下文被压而修错方向,返工 Token 常为省下的 2–3 倍

五、进阶:当 AI 工程基础设施

  • CI/CD / Agent 巡检:流水线默认高压缩(日志/测试输出为主)
  • 人工核心开发:临时 bypass 或关 OUTPUT_SHAPER
  • Mac 加速export HEADROOM_EMBEDDER_RUNTIME=pytorch_mps,压缩嵌入几乎不拖慢代理
  • 敏感路径:项目 .contextignore / 全局 ~/.claude/.contextignore 硬排除审计文件

按此跑 2–4 周,编码账单常见降 40–60%,且返工率不应明显上升。若某栈(Go 微服务调试、Java 大仓重构)要更细参数,以 headroom perf + holdout 实测为准,再微调。

🧱 五层框架(单工具 vs 组合)

路径 A(一站式):Headroom(见 最佳实践)wrap/proxy/MCP。路径 B(组合):RTK + Caveman + mcprune + Tokscale — 更细、可混搭。
① 规约层 每轮固定成本

压缩 AGENTS.md.cursor/rulesCLAUDE.md。Power User 常在开聊前就烧掉 5–7 万 token。

工具:codex-tokens-compress、Caveman /caveman-compress

② CLI 输入层 最大隐性开销

git status、测试日志、rg 输出经代理压缩后再进上下文,通常省 60–90%

工具:RTKsqueez(专题热门)

③ Agent 输出层

去掉寒暄与重复解释,保留技术结论与完整代码块。

工具:Caveman Skill(约 65–87% 输出 token)

④ 浏览器 / 单页层

默认无障碍树,禁止先截图。首屏全量 snapshot,之后用 ref 操作或 diff。

工具:mcpruneagent-browser

⑤ MCP 层

压工具 description 与大块 JSON 返回。

工具:caveman-shrinkToken Tamertoken-optimizer-mcp

⑥ 观测层

先量化再优化:按日/模型/任务类型看账单。

工具:Tokscale(三端均支持)

📦 三套推荐组合

一站式(1 个)

Headroom — 按 分层最佳实践 配 wrap/proxy;Claude/Codex 一键,Cursor 配代理 + holdout。

HeadroomHOLDOUT+Tokscale
极简组合(2 个)

RTK + Caveman — 不装 Headroom 时的最小 CLI + 输出覆盖。

RTKCaveman
重度浏览器

任一路径 + mcprune(页面快照仍建议专用剪枝)。

+mcprune

⌨️ Cursor 安装配置

Cursor RTK — CLI 输出压缩
  1. 安装 RTK(见 官方安装,Rust 单二进制)。
  2. 初始化 Cursor hook:
rtk init -g --agent cursor

重启 Cursor。Hook 通过 preToolUse 自动把 git status 改写为 rtk git status

Windows 注意:若 bash hook 不可用,在 Cursor Settings → Rules 中写明:终端命令一律加 rtk 前缀(rtk gitrtk rgrtk test 等)。

局限:内置 Read/Grep 工具不走 shell hook;大文件请用 rtk read / rtk grep 或 shell 等价命令。

Cursor Caveman — 输出 + 规约压缩
# macOS / Linux / WSL / Git Bash
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

# Windows PowerShell
irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex

安装器会写入 Cursor Rules,实现会话级简洁输出。手动触发:/caveman;压规约:/caveman-compress CLAUDE.md(对 .cursor/rules 同理)。

Cursor Tokscale — 用量统计
npx tokscale@latest
# 或 npm i -g tokscale

Cursor 需从浏览器导出会话 Cookie 后登录(非解析 ~/.cursor 本地库):

tokscale cursor login
tokscale cursor sync

cursor.com 开发者工具 → Cookies 复制 WorkosCursorSessionToken。详见 Tokscale Cursor 文档

Cursor MCP 配置路径

项目级:.cursor/mcp.json · 全局:~/.cursor/mcp.json(版本不同可能为 Settings → MCP)。浏览器与 mcprune 示例见下文 MCP 章节

🟠 Claude Code 安装配置

Claude Code RTK
rtk init -g
# 重启 Claude Code

自动安装 PreToolUse hook,Bash 命令透明改写。与 Cursor 相同:Read/Grep/Glob 内置工具不经过 hook。

Claude Code Caveman
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

支持 hook 自动激活;/caveman-stats 看本会话节省量;/caveman-compress 压缩 CLAUDE.md / 项目记忆文件。

Claude Code 专题插件:Token Optimizer

alexgreensh/token-optimizer(专题高星)— 上下文工程插件:智能压缩、Dashboard、MCP/技能瘦身等。

/plugin marketplace add alexgreensh/token-optimizer
/plugin install token-optimizer@alexgreensh-token-optimizer
# 会话内:/token-optimizer

安装后建议在 /plugin 中对该 Marketplace 开启 auto-update

Claude Code MCP

编辑 ~/.claude.json 或项目 .mcp.jsonmcpServers。mcprune / caveman-shrink 配置见 #mcp

🟢 Codex 安装配置

Codex 特点:部分能力靠 AGENTS.md 软约束,hook 覆盖不如 Claude Code/Cursor 完整;Read/Grep 硬注入限制在演进中(见 codex#18491)。规约写清楚收益最大。
Codex RTK
rtk init -g --codex          # 项目级 AGENTS.md
rtk init -g --global --codex # 用户级 ~/.codex/AGENTS.md

依赖模型遵循 AGENTS.md 中的 RTK 指令(规则级集成,非 guaranteed hook)。

Codex Caveman + 规约压缩
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash -s -- --only codex

或全量安装后写入 AGENTS.md。用 codex-tokens-compress 生成高密度 AGENTS.md 规则段。

Codex squeez(专题 · 含 Codex CLI)

squeez — Rust 零依赖,支持 Claude Code / Codex CLI / Copilot CLI 等,Bash 最高约 95% 压缩 + MCP。

# 见仓库 README 按宿主安装 hook;Codex 侧重 ~/.codex/AGENTS.md 软约束 + bash 管道
Codex Token Optimizer 插件

token-optimizer 的 Codex 原生插件,TUI 内 /plugins 安装。Dashboard 默认 http://localhost:24843/token-optimizer

🌐 MCP / 浏览器(三端通用配置)

mcprune — 剪枝 Playwright 页面快照
  1. 克隆并安装:
git clone https://github.com/hamr0/mcprune.git
cd mcprune && npm install && npx playwright install chromium

写入 MCP 配置(路径换成你的绝对路径):

{
  "mcpServers": {
    "browser": {
      "command": "node",
      "args": ["/path/to/mcprune/mcp-server.js", "--mode", "auto"]
    }
  }
}

可选 --headless;模式 act(操作)/ browse(读文档)/ auto

caveman-shrink — 压缩 MCP 工具描述
{
  "mcpServers": {
    "fs-compact": {
      "command": "npx",
      "args": [
        "caveman-shrink",
        "npx", "-y", "@modelcontextprotocol/server-filesystem", "/your/project"
      ]
    }
  }
}

将任意上游 MCP 包一层;压缩 description 等 prose 字段,工具语义不变。

单页浏览 checklist(Agent 侧)
  • 默认无障碍树,禁止为读文字先截图(画布/验证码除外)
  • 每任务 ≤1 次全量 browser_snapshot,之后用 ref 点击
  • 电商/表单用 mcprune act;文档站用 browse
  • 单步页面感知预算建议 ≤ 6000 tokens
  • 能 API / fetch 就不开浏览器

📋 可复制 Rules 模板

粘贴到 Cursor Rules、CLAUDE.mdAGENTS.md

## Token 优化

### CLI(必须)
- 终端命令经 RTK:rtk git / rtk rg / rtk test / rtk read
- 不用内置 Read/Grep 读大文件;用 rtk 或 head/tail

### 浏览器
- 默认无障碍树;禁止为读正文先截图
- 每任务最多 1 次全量 snapshot;之后只用 ref 或增量
- Playwright MCP 经 mcprune;模式 act=操作 browse=读文档

### 输出
- 技术回复:结论先行,无寒暄;代码块保持完整可运行

### MCP
- 大 JSON 返回先精简;工具列表可用 caveman-shrink 包装

### 预算
- 单步页面感知 ≤ 6000 tokens;超限则剪枝或换 API/深链

🔗 GitHub token-optimization 专题分析

802 个公开仓库打该 topic(GitHub Search API,2026-06-26)。下表为 Top 项目按能力分档,星标随社区变化,以专题页为准。

第一梯队:CLI / 全栈代理(编码助手主战场)

#项目定位安岭导航
1rtk-ai/rtk66KCLI 命令输出代理,Rust,三端 hook/规约✅ 收录
2headroomlabs-ai/headroom51K全栈上下文压缩:库·代理·MCP·wrap·CCR✅ 收录
3yvgude/lean-ctx2.9K上下文门控:控制 Agent 可见信息✅ 收录
edouard-claude/snip347声明式 YAML 的 RTK 类 CLI 代理
zdk/lowfat543精简命令行输出噪音
entroly416本地代理,多模型账单 70–95% 宣称

第二梯队:Claude Code / Codex 插件与中间件

#项目定位安岭导航
6alexgreensh/token-optimizer1.4K上下文工程插件,Dashboard,ghost token✅ 收录
4cytostack/openwolf2.0KClaude Code 开源中间件,削上下文
9nadimtuhin/claude-token-optimizer480Claude 文档/规约压缩模板
12ooples/token-optimizer-mcp415MCP 缓存+压缩,偏 Claude Code
13IyadhKhalfallah/clauditor408配额监控与自动限流

第三梯队:MCP · 代码探索 · 浏览器

#项目定位安岭导航
5jgravelle/jcodemunch-mcp1.9KMCP 代码探索,宣称 95%+ 省 Token✅ 收录
hamr0/mcprunePlaywright 快照剪枝(未进 Top50 但三省常用)✅ 收录
malovnik/agent-browser无障碍树浏览器 MCP✅ 收录

第四梯队:上下文控制 · 记忆 · 编码格式

#项目定位
3yvgude/lean-ctx2.9K控制 Agent「能看见什么」的上下文注入(见第一梯队)
7lucasrosati/claude-code-memory-setup803Obsidian + Graph 降 Claude 会话 Token
flightlesstux/prompt-caching127Claude Code 自动 prompt cache
skibidiskib/ai-codex273紧凑代码库索引,省 50K+ 宣称

不在专题内但三省常用(高星未打 topic)

Caveman(77K★)未广泛打 token-optimization topic,但在社区与 tokless 安装器中与 RTK 并列推荐 → 安岭导航 仍收录为输出层首选 Skill。

选型速查(Cursor / Claude Code / Codex)

诉求专题首选组合建议
只压 CLI 测试/git 输出RTK (#1)+ Caveman 压输出;Tokscale 观测
全栈 + RAG + 团队代理Headroom (#2)分层最佳实践 + holdout
Claude 插件一站式token-optimizer (#6)与 RTK 二选一或叠加需实测
大仓 MCP 探代码jcodemunch-mcp (#5)+ mcprune 处理浏览器页
一键装多个插件tokless (#42)聚合 RTK / Caveman 等
说明:此前页面曾链到 chopratejas/headroom,官方主仓已迁至 headroomlabs-ai/headroom。专题页为 JS 渲染,完整列表请用 GitHub 专题 或 API search/repositories?q=topic:token-optimization