187 倍延迟差:为什么工业 AI 必须端侧

187 倍延迟差:为什么工业 AI 必须端侧

同一个问题,两种回答速度

我们在同一个平台、同一批 50 条真实请求上做了同口径对比:走 MTClaw 三层路由,和直连云端大模型,各自跑一遍,计时。结果不是一个量级的差距——

执行路径平均延迟Token 消耗
L1 规则命中(企业内网)~11ms0
L2 端侧模型(Ollama 本地)~450ms~100
L3 云端兜底~1700ms~600
云端直连(无路由)~2060ms~800

L1 规则层对云端直连,是 187 倍的延迟差。11ms 是什么概念?人眼感知不到。2060ms 是什么概念?车间工人已经把手放回鼠标上了。

怎么做到的:三层路由,能本地就不出网

MTClaw 的调度逻辑很简单:L1 关键词规则(2,306 条规则库)→ L2 端侧模型(本地 5 个 Ollama 模型)→ L3 云端兜底。50 次请求里,30% 在 L1 就返回了(11ms,零 Token),46% 在 L2 端侧完成(~450ms),只有 24% 真正走了云端。

关键设计不是"堆模型",而是分流:高频确定性任务(健康检查、库存预警、规则判定)根本不需要大模型,规则引擎几百毫秒内就能给答案;真正需要推理的才上模型;模型也在本地。

两个边界,如实说

1. L3 是可选的,不是必需的。 关掉云端(LLM_REMOTE_ONLY=false),系统完全离线运行——这是"数据不出厂"的物理保证,不是合同条款。

2. 端侧不是万能的。 实测里我们明确发现:端侧 7B 模型生成 RTL 代码质量不足,这类强任务直接走云端强模型,不硬撑。哪里不行就在哪标注,比"全端侧"的口号更接近生产现实。

实测口径

数据来源:MTClaw-Technical-Report §5.1,2026-08-02 通过 /api/mtclaw-metrics 端点对 50 次请求的完整统计(路由成功率 98%,49/50)。不是单次 demo,是可复测的端点。

左帮右臂(BossAgents):让每个老板拥有一支数据不出厂的 AI 员工队伍。71 个数字员工,端侧私有部署,体验入口见评论区。


本文数据均可在 BossAgents 技术文档库中溯源 · 左帮右臂 · 老板私有智能体

← 返回案例列表
分享:
🤖 Try Now →
🤖
🎁