187 倍延迟差:为什么工业 AI 必须端侧
同一个问题,两种回答速度
我们在同一个平台、同一批 50 条真实请求上做了同口径对比:走 MTClaw 三层路由,和直连云端大模型,各自跑一遍,计时。结果不是一个量级的差距——
| 执行路径 | 平均延迟 | Token 消耗 |
|---|---|---|
| L1 规则命中(企业内网) | ~11ms | 0 |
| L2 端侧模型(Ollama 本地) | ~450ms | ~100 |
| L3 云端兜底 | ~1700ms | ~600 |
| 云端直连(无路由) | ~2060ms | ~800 |
L1 规则层对云端直连,是 187 倍的延迟差。11ms 是什么概念?人眼感知不到。2060ms 是什么概念?车间工人已经把手放回鼠标上了。
怎么做到的:三层路由,能本地就不出网
MTClaw 的调度逻辑很简单:L1 关键词规则(2,306 条规则库)→ L2 端侧模型(本地 5 个 Ollama 模型)→ L3 云端兜底。50 次请求里,30% 在 L1 就返回了(11ms,零 Token),46% 在 L2 端侧完成(~450ms),只有 24% 真正走了云端。
关键设计不是"堆模型",而是分流:高频确定性任务(健康检查、库存预警、规则判定)根本不需要大模型,规则引擎几百毫秒内就能给答案;真正需要推理的才上模型;模型也在本地。
两个边界,如实说
1. L3 是可选的,不是必需的。 关掉云端(LLM_REMOTE_ONLY=false),系统完全离线运行——这是"数据不出厂"的物理保证,不是合同条款。
2. 端侧不是万能的。 实测里我们明确发现:端侧 7B 模型生成 RTL 代码质量不足,这类强任务直接走云端强模型,不硬撑。哪里不行就在哪标注,比"全端侧"的口号更接近生产现实。
实测口径
数据来源:MTClaw-Technical-Report §5.1,2026-08-02 通过 /api/mtclaw-metrics 端点对 50 次请求的完整统计(路由成功率 98%,49/50)。不是单次 demo,是可复测的端点。
左帮右臂(BossAgents):让每个老板拥有一支数据不出厂的 AI 员工队伍。71 个数字员工,端侧私有部署,体验入口见评论区。
本文数据均可在 BossAgents 技术文档库中溯源 · 左帮右臂 · 老板私有智能体
BossAgents