无 GPU 也能跑:端侧 AI 的三种部署形态

无 GPU 也能跑:端侧 AI 的三种部署形态

同一套代码,三种形态

很多端侧 AI 方案的潜台词是"你得先有一台 GPU 服务器"。BossAgents 的部署是梯度式的:

形态硬件要求路由行为适用场景
纯 CPU普通工控机/服务器规则引擎兜底,L2 自动禁用车间现场、预算有限试点
Ollama 服务器有 GPU 的服务器L1+L2 全启用(5 个本地模型)企业机房、主力生产环境
昇腾 NPU昇腾 NPU 服务器全端侧,云端可完全关闭高安全要求、国产化环境

环境探测是自动的:启动时检测本地模型可用性,无 GPU 环境自动降级,不需要改配置、不需要改代码。

端侧模型底座(已加载并运行验证)

模型体积用途
gemma3:4b3.1GB轻量路由
deepseek-r1:8b4.9GB复杂推理
qwen2:7b~5GB快任务识别
qwen3-coder:30b17.3GB代码生成
qwen3.622.3GB端侧主力推理

5 个模型全部运行验证通过。端侧不是"一个 7B 模型撑全场",是按任务分级配置。

云端是兜底,不是依赖

路由架构决定了一切:L1 规则层(30% 请求)+ L2 端侧层(46% 请求)= 76% 的请求不依赖云端。L3 云端层存在是为了 24% 的强推理任务,并且可以整体关闭LLM_REMOTE_ONLY=false 完全离线)。

所以"数据不出厂"是物理事实:数据根本没有出厂的通道。

边界

纯 CPU 形态下 L2 禁用,复杂推理全部落到规则兜底或(若开启)云端——纯 CPU + 完全离线的组合,能力是有边界的,选型时要如实评估。

左帮右臂(BossAgents):从车间工控机到 NPU 机房,同一套代码,三种形态。


本文数据均可在 BossAgents 技术文档库中溯源 · 左帮右臂 · 老板私有智能体

← 返回案例列表
分享:
🤖 Try Now →
🤖
🎁