端侧 AI 的工业落地:MTClaw 三层路由架构实践

> 本文为 BossAgents 技术分享文章,基于 HICOOL 2026 开发者挑战赛智能体赛道参赛作品。

工业场景的 AI 困境

制造业拥抱大模型时,会遇到一道绕不开的墙:数据不能出内网

工艺配方、BOM、设备参数、质量数据——这些是企业最核心的资产,也是合规红线。公有云大模型再聪明,数据出不去,就等于没用。

端侧 AI 是答案之一,但它带来了新的问题:端侧模型的推理能力和稳定性,如何匹配工业场景"必须答对"的要求?

MTClaw 三层路由,是我们在实践中给出的架构解法。

三层路由:确定性优先,LLM 兜底

用户自然语言请求     │     ▼ ┌─────────────────────────────┐ │ L1 关键词规则匹配(毫秒级)      │ ← 高频/关键操作,结果可预测 │   ├─ 命中 → 直接执行工具        │ │   └─ 未命中 → 降级             │ └─────────────────────────────┘     │     ▼ ┌─────────────────────────────┐ │ L2 端侧推理(Ollama 本地模型)  │ ← 中等复杂度,数据不出厂 │   └─ 仍不确定 → 降级           │ └─────────────────────────────┘     │     ▼ ┌─────────────────────────────┐ │ L3 云端 LLM 兜底              │ ← 长尾开放问题,才出内网 └─────────────────────────────┘ 

设计哲学:能确定,就不让模型自由发挥。

L1:110ms 的确定性路由

工业场景里,大量操作是高频且确定的:查 BOM 影响、查库存、查质量记录、查治理日志。

这些操作如果走大模型,会有两个风险:(一次推理数百毫秒到数秒)和(同样的问法可能得到不同的答案)。

MTClaw 的做法:把高频操作沉淀为关键词规则,L1 层直接命中路由。实测:

  • L1 关键词匹配:平均 110ms
  • 命中后直接调用对应工具执行,结果 100% 确定; - 全程可审计、可回放。

在黔磷智脑决赛演示中,三个场景(BOM 影响分析、数据质量巡检、治理记录追溯)全部走 L1 确定性路由,现场稳定复现——不依赖网络,不依赖模型状态。

L2:端侧推理,数据不出厂

L1 覆盖不了的中等复杂度需求,交给 L2 端侧模型。平台验证了完整的端侧模型栈:

  • gemma3:4b(3.1GB):轻量路由与意图识别; - qwen3.6(22.3GB):端侧推理主力; - deepseek-r1:8b(4.9GB):复杂推理; - qwen3-coder:30b(17.3GB):代码与结构化输出。

端侧推理的另一个价值是成本:推理发生在本地 GPU,没有按 token 计费的云账单。对工业客户,这是可量化的 TCO 优势。

L3:云端兜底,长尾问题的出口

规则与端侧模型都覆盖不到的长尾问题,才允许出内网走云端 LLM。这个"最后一道闸门"的设计,把数据外发量控制到最低——绝大多数请求根本不离开企业内网

与行业实践的对照

MTClaw 的三层架构,与当前端侧 AI 行业的主流趋势一致:

  • 确定性优先
:业界共识是"规则能解决的别用模型",减少幻觉、控制成本;
  • 分级推理
:轻量模型先试,重模型兜底,这是推理成本优化的标准范式;
  • 本地优先
:数据主权与合规,是端侧 AI 在工业落地的核心驱动力。

结语

工业 AI 的落地,比拼的不是谁的模型最大,而是谁能在数据不出厂的约束下,把 AI 用得最稳、最快、最省

MTClaw 三层路由的价值在于:它把"AI 能不能用"的问题,变成了"AI 怎么分层用"的工程问题。规则、端侧、云端各司其职,工业客户才能真正放心地把数字员工请进车间。

---

技术数据来源:BossAgents × MTClaw 工业智能体平台参赛说明(HICOOL 2026 开发者挑战赛) 赛事官方信息:https://www.hicool.com/

← 返回案例列表
分享:
🤖 Try Now →
🤖
🎁