11,044 篇文档炼出 116 条工艺,0 编造
转化率不漂亮,但每条数据经得起追问
把 11,044 篇磷化工行业的文档(GB/T 标准、专利、论文)灌进管道,最后入库的是:116 条真实工艺 + 279 条 BOM 数据,0 错误。
86 / 11,044 的转化率很难看。但我们更在意另一组数字:10,958 篇被诚实跳过。
零数据铁律
管道里的 LLM 只干一件事:判断这篇文档里有没有真实工艺信息。有,就按原文抽取;没有,就跳过。 不允许"根据行业知识补全"。
为什么?因为工业场景里,一条编造出来的工艺参数进入生产系统就是事故。模型说"我记得湿法磷酸一般是 80 度"——这句话在论文里是常识,在反应釜边上就是隐患。
入库长什么样(真实样本)
- 湿法磷酸分级利用:设备=洗涤塔,温度 50~60℃,NH₄H₂PO₄ 浓度 0.5~1%(来源:专利 CN100441502C) style="padding-left:20px;margin:12px 0;">
- 热法磷酸生产:电炉/反应塔,1450℃以上,浓度 80~85% style="padding-left:20px;margin:12px 0;">
- 湿法磷酸分解磷矿:反应器/搅拌/洗涤,70℃,P₂O₅ 30%,时长 3.0h
每条都能回溯到来源文档。抽取的不是"AI 理解后的知识",是文档里本来就有的数据。
这条管道的完整链路
采集(11,044 篇入库,真实 URL+摘要)→ LLM 结构化(86 篇转换成功)→ 工艺/BOM 入 pskb 知识库 → 资产化(进 data_assets,可独立估值)→ 数字员工消费(工艺优化师、质量检验员直接查询)。
全量跑批验证日期:2026-08-02,验证报告在 docs/ 里可查。
左帮右臂(BossAgents):工业数据资产化的第一步,是让数据先"真实",再谈"值钱"。
本文数据均可在 BossAgents 技术文档库中溯源 · 左帮右臂 · 老板私有智能体
BossAgents