> 本文为 BossAgents 技术分享文章,基于 HICOOL 2026 开发者挑战赛智能体赛道参赛作品。
工业场景的 AI 困境
制造业拥抱大模型时,会遇到一道绕不开的墙:数据不能出内网。
工艺配方、BOM、设备参数、质量数据——这些是企业最核心的资产,也是合规红线。公有云大模型再聪明,数据出不去,就等于没用。
端侧 AI 是答案之一,但它带来了新的问题:端侧模型的推理能力和稳定性,如何匹配工业场景"必须答对"的要求?
MTClaw 三层路由,是我们在实践中给出的架构解法。
三层路由:确定性优先,LLM 兜底
用户自然语言请求 │ ▼ ┌─────────────────────────────┐ │ L1 关键词规则匹配(毫秒级) │ ← 高频/关键操作,结果可预测 │ ├─ 命中 → 直接执行工具 │ │ └─ 未命中 → 降级 │ └─────────────────────────────┘ │ ▼ ┌─────────────────────────────┐ │ L2 端侧推理(Ollama 本地模型) │ ← 中等复杂度,数据不出厂 │ └─ 仍不确定 → 降级 │ └─────────────────────────────┘ │ ▼ ┌─────────────────────────────┐ │ L3 云端 LLM 兜底 │ ← 长尾开放问题,才出内网 └─────────────────────────────┘ 设计哲学:能确定,就不让模型自由发挥。
L1:110ms 的确定性路由
工业场景里,大量操作是高频且确定的:查 BOM 影响、查库存、查质量记录、查治理日志。
这些操作如果走大模型,会有两个风险:慢(一次推理数百毫秒到数秒)和飘(同样的问法可能得到不同的答案)。
MTClaw 的做法:把高频操作沉淀为关键词规则,L1 层直接命中路由。实测:
- L1 关键词匹配:平均 110ms
- 命中后直接调用对应工具执行,结果 100% 确定; - 全程可审计、可回放。
在黔磷智脑决赛演示中,三个场景(BOM 影响分析、数据质量巡检、治理记录追溯)全部走 L1 确定性路由,现场稳定复现——不依赖网络,不依赖模型状态。
L2:端侧推理,数据不出厂
L1 覆盖不了的中等复杂度需求,交给 L2 端侧模型。平台验证了完整的端侧模型栈:
- gemma3:4b(3.1GB):轻量路由与意图识别; - qwen3.6(22.3GB):端侧推理主力; - deepseek-r1:8b(4.9GB):复杂推理; - qwen3-coder:30b(17.3GB):代码与结构化输出。
端侧推理的另一个价值是成本:推理发生在本地 GPU,没有按 token 计费的云账单。对工业客户,这是可量化的 TCO 优势。
L3:云端兜底,长尾问题的出口
规则与端侧模型都覆盖不到的长尾问题,才允许出内网走云端 LLM。这个"最后一道闸门"的设计,把数据外发量控制到最低——绝大多数请求根本不离开企业内网。
与行业实践的对照
MTClaw 的三层架构,与当前端侧 AI 行业的主流趋势一致:
- 确定性优先
- 分级推理
- 本地优先
结语
工业 AI 的落地,比拼的不是谁的模型最大,而是谁能在数据不出厂的约束下,把 AI 用得最稳、最快、最省。
MTClaw 三层路由的价值在于:它把"AI 能不能用"的问题,变成了"AI 怎么分层用"的工程问题。规则、端侧、云端各司其职,工业客户才能真正放心地把数字员工请进车间。
---
技术数据来源:BossAgents × MTClaw 工业智能体平台参赛说明(HICOOL 2026 开发者挑战赛) 赛事官方信息:https://www.hicool.com/
BossAgents