无 GPU 也能跑:端侧 AI 的三种部署形态
同一套代码,三种形态
很多端侧 AI 方案的潜台词是"你得先有一台 GPU 服务器"。BossAgents 的部署是梯度式的:
| 形态 | 硬件要求 | 路由行为 | 适用场景 |
|---|---|---|---|
| 纯 CPU | 普通工控机/服务器 | 规则引擎兜底,L2 自动禁用 | 车间现场、预算有限试点 |
| Ollama 服务器 | 有 GPU 的服务器 | L1+L2 全启用(5 个本地模型) | 企业机房、主力生产环境 |
| 昇腾 NPU | 昇腾 NPU 服务器 | 全端侧,云端可完全关闭 | 高安全要求、国产化环境 |
环境探测是自动的:启动时检测本地模型可用性,无 GPU 环境自动降级,不需要改配置、不需要改代码。
端侧模型底座(已加载并运行验证)
| 模型 | 体积 | 用途 |
|---|---|---|
| gemma3:4b | 3.1GB | 轻量路由 |
| deepseek-r1:8b | 4.9GB | 复杂推理 |
| qwen2:7b | ~5GB | 快任务识别 |
| qwen3-coder:30b | 17.3GB | 代码生成 |
| qwen3.6 | 22.3GB | 端侧主力推理 |
5 个模型全部运行验证通过。端侧不是"一个 7B 模型撑全场",是按任务分级配置。
云端是兜底,不是依赖
路由架构决定了一切:L1 规则层(30% 请求)+ L2 端侧层(46% 请求)= 76% 的请求不依赖云端。L3 云端层存在是为了 24% 的强推理任务,并且可以整体关闭(LLM_REMOTE_ONLY=false 完全离线)。
所以"数据不出厂"是物理事实:数据根本没有出厂的通道。
边界
纯 CPU 形态下 L2 禁用,复杂推理全部落到规则兜底或(若开启)云端——纯 CPU + 完全离线的组合,能力是有边界的,选型时要如实评估。
左帮右臂(BossAgents):从车间工控机到 NPU 机房,同一套代码,三种形态。
本文数据均可在 BossAgents 技术文档库中溯源 · 左帮右臂 · 老板私有智能体
BossAgents