省下 80% 的 Token 钱:一套路由的账
先给结论:54,184 vs 10,875
同样 50 条真实业务请求,两种处理方式跑完:
- 全部直连云端大模型:消耗 54,184 Token style="padding-left:20px;margin:12px 0;">
- 走 MTClaw 三层路由:消耗 10,875 Token
节省 80%。 不是理论测算,是同口径实测(2026-08-02,/api/mtclaw-metrics 端点统计)。
钱省在哪一层
50 次请求的路由分布:
| 路由层 | 占比 | 单次 Token |
|---|---|---|
| L1 规则命中 | 30% | 0 |
| L2 端侧模型 | 46% | ~100 |
| L3 云端兜底 | 24% | ~600 |
三个事实:
1. 76% 的请求完全不消耗云端 Token(L1 零 Token + L2 本地推理);
2. 高频场景(巡检、预警、日报、规则判定)天然落在 L1/L2——这些场景恰恰是调用量最大的;
3. 云端 API 价格不可控。我们自己的开发日志里就有 DeepSeek 账户欠费 402 被迫切云端的记录。端侧方案把价格风险也归零了。
怎么算你的账
我们不给"3 年省 X 万"的现成数字——不同企业调用量差太多。公式自己代入:
月省 = 你的月 Token 消耗 × 80% × 你的单价。再减一次性的端侧服务器投入(数万元量级,视 NPU 配置)。调用量越大、数据越敏感,这条曲线越陡。
边界
80% 是 50 次请求样本下的实测值,你的业务里 L3 占比可能更高(比如长文生成类场景)。但方向不会变:凡是高频、确定性的任务,规则层和端侧层都能截流。
左帮右臂(BossAgents):71 个数字员工,端侧私有部署,成本曲线从线性上涨变成近乎平坦。
本文数据均可在 BossAgents 技术文档库中溯源 · 左帮右臂 · 老板私有智能体
BossAgents