RTK Benchmark体系解析:如何用benchmark.sh快速复现Token节省数据 RTK Benchmark体系解析如何用benchmark.sh快速复现Token节省数据【免费下载链接】rtkCLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies项目地址: https://gitcode.com/GitHub_Trending/rtk4/rtkRTK是一个用 Rust 编写的 CLI 代理能把 LLM 读取的命令输出压缩 60%~90%。而它的可信度正来自一套可复现的 Benchmark 体系一条benchmark.sh命令就能在你自己的机器上重新算出这些省了多少 token的数据。本文带你走完全部流程。一、为什么性能数据需要可复现RTK 的核心卖点是ls、git log、cargo test这类高频命令的原始输出经过 RTK 过滤后再交给 AI Agent输入 token 能砍掉一大半。但省多少不是宣传口号而是每次跑基准测试都能验证的指标。RTK 的 benchmark 体系做了两件关键事✅全离线、可重复不依赖任何外部网络服务curl/wget 测试用本地回环 HTTP 服务器✅双向验证既验证省了多少也验证没坏过滤后的输出不能比原始输出更长。二、Benchmark 体系的两层架构RTK 的 benchmark 分为本地轻量版和云端完整版两层层级入口运行环境耗时用途本地scripts/benchmark.sh你自己的机器数分钟快速复现 token 节省数据完整scripts/benchmark/run.tsMultipass 虚拟机10~30 分钟发布前的全量集成验证本地版覆盖ls、tree、read、find、git、grep、json、log、curl、cargo等几十个命令对比完整版则在一个装好 Rust/Go/Node/.NET 全家桶的 Ubuntu 虚拟机里跑约 200 条命令由 scripts/benchmark/cloud-init.yaml 负责初始化环境。三、一键运行三步复现 benchmark.sh 的数据第 1 步拿到 rtk 二进制脚本会优先使用本地 release 构建./target/release/rtk否则回退到 PATH 里已安装的rtk。所以只需二选一cargo build --release # 本地构建 # 或先 brew install rtk第 2 步在项目根目录执行./scripts/benchmark.sh第 3 步等待汇总输出。过程中脚本会自动完成这些隐形工作你无需干预 清理上一次的调试产物unix/、rtk/、diff/三个输出目录CI 环境则跳过清理 用python3拉起一个随机端口的本地 HTTP 服务器给 curl/wget 测试提供固定的JSON 响应——早期用过外部 mock 服务因输出随机导致结果飘现已被完全离线方案替代 为每个测试生成三份原始输出存档本地运行时方便逐条核对。四、读懂输出每行数据在说什么运行结束时你会看到一张汇总表每项测试带一个状态图标图标标签含义✅GOOD节省率 ≥ 60%合格⚠️WARN有节省但不足 60%或无节省NEG负面过滤后反而更长了❌FAIL过滤后输出为空功能坏了末尾的汇总行形如✅ 42 good ⚠️ 5 warn 0 negative ❌ 0 fail Tokens: 52000 → 14000 (-73%)几个关键规则Token 估算公式是字节数 ÷ 4见 benchmark.sh 中的count_tokens。RTK 不内置分词器所以百分比是可靠的绝对数值只是近似——这也和官方口径一致退出码是可信度开关只要出现 NEG 或 FAIL脚本就以非零码退出并打印BENCHMARK FAILED——也就是说压缩不能变负是硬性红线GOOD 占比目标 ≥ 60%低于该值会收到 WARNING 提示。 想深挖每个命令的原始输出本地运行会在 scripts/benchmark/ 下生成unix/、rtk/、diff/三组 Markdown 存档diff-前缀的文件还带 Unix vs RTK 的 token 对照表。五、进阶Multipass 虚拟机全量套件本地版验证省多少虚拟机版验证发布前是否万事俱备两者互补环境准备vm.ts 自动创建/复用名为rtk-test的 Multipass VM2 核 / 4G / 20Gcloud-init 装好全套工具链首次需 10~15 分钟12 个测试阶段见 run.ts传输源码并 release 构建含二进制体积 ≤ 8MB 检查→ cargo fmt/clippy/test 质量检查 → 各语言内置命令 → TOML 过滤器命令 → hook 重写引擎 → 退出码保真 →token 节省达标检查→ 管道兼容性 → 边界情况 → hyperfine 启动性能 → 并发常用参数--quick跳过性能与并发阶段快速反馈--phase 3只跑指定阶段rebuild.ts复用已有 VM只重传源码重编译cleanup.ts用完删除 VM 释放磁盘。测试判定逻辑在 lib/test.ts其中testSavings会同时执行原始命令与 RTK 命令要求节省率达到每项设定的目标值如git log≥ 60%、日志去重 ≥ 80%才算 PASS最终报告由 lib/report.ts 汇总结论只有一句——READY FOR RELEASE或 NOT READY。六、常见问题排查现象原因与处理Error: rtk not found没有本地构建也没装 rtk先cargo build --release或安装tree、gh、docker等段落被跳过对应工具未安装属正常脚本显示⏭️ skipped后继续BENCHMARK FAILED ... negative某条过滤器产出变长了属于真实回归应查看diff/NEG-*.md定位VM 创建卡住看/var/log/cloud-init-output.log或--quick先跑本地版数字和官方 README 不完全一致正常token 是字节/4 估算且测试项随你安装的工具有增减七、总结这份 benchmark 体系值得借鉴的三点数据可证伪把节省 60-90%变成任何用户一条命令就能复核的数字负面结果直接让 CI 变红确定性优先外部依赖全部本地化fixture JSON、回环服务器、mock 工具结果不再看网络脸色轻量与重型分层本地 shell 脚本负责日常反馈Multipass VM 负责发布级验证各取所需。 想继续深入建议按序阅读scripts/benchmark.sh主脚本→ docs/usage/AUDIT_GUIDE.md审计指南→ docs/contributing/TECHNICAL.md性能与架构细节。【免费下载链接】rtkCLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies项目地址: https://gitcode.com/GitHub_Trending/rtk4/rtk创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考