这篇文章来自我们 2026 年上半年交付的一个项目:某机械加工车间的安全生产 AI 监控系统。客户的需求很典型——车间已经装了 40 多路摄像头,但全靠安全员定时巡逻,效果有限,希望用 AI 自动识别违规行为。

项目最终交付的结果是:两台边缘算力盒子,支撑 16 路并发分析,识别安全帽佩戴、反光衣穿戴、危险区域入侵、人员离岗四类行为,误报率控制在管理人员可接受的水平。下面把完整过程写出来,包括我们踩过的坑。

第一步:把需求边界定清楚,这一步比技术更重要

客户最初的表述是「帮我们把车间的违规行为都识别出来」。这是个无法执行的需求——什么叫「都」?识别多少种行为?哪种优先级最高?

我们把需求拆成了三个必须明确的问题:

  1. 具体检测什么行为?最后收敛到四类:安全帽、反光衣、危险区域入侵、人员离岗。范围一收窄,技术方案立刻清晰了。
  2. 误报的容忍度是多少?这个问题客户一开始没想过。我们解释:如果每天产生 500 条告警,管理人员会直接关掉通知,系统就废了。最后约定:每天告警控制在 20 条以内,且准确率不低于 85%。
  3. 告警之后要做什么?是弹窗提醒、现场声光报警、还是推送给班组长?这决定了系统的联动设计。最后确定:现场声光报警 + 企业微信推送班组长。

这三个问题定下来,项目就成功了一半。很多 AI 项目失败,不是因为算法不行,而是因为验收标准模糊,做完了双方对「好不好用」的判断不一致。

第二步:算力估算,别拍脑袋买硬件

硬件选型是客户最关心成本的部分。我们的估算方法是这样的:

单路算力需求 ≈ 模型计算量 × 分析帧率 × 安全系数

具体到本项目:选用 YOLOv8s 模型,输入分辨率 640×640,单帧推理约 8.5 GFLOPs。车间场景不需要逐帧分析,我们设置每路每秒抽 5 帧,那么单路算力需求约为:

8.5 GFLOPs × 5 帧 ÷ 1000 ≈ 0.043 TOPS,考虑解码、后处理和多算法并行的开销,实际按 0.3 到 0.5 TOPS 每路估算。

结论:一台 Jetson Orin NX(约 100 TOPS 算力)理论上可以支撑 100 路以上,但实际要扣除视频解码开销(1080P 解码本身就消耗大量算力),工程上按 8 路每台配置比较稳妥。我们最终用了两台盒子覆盖 16 路。

这里有个常见的坑:很多方案商按显卡的理论算力报路数,忽略了解码开销。1080P H.264 解码在边缘设备上是实打实的算力消耗,往往占到总开销的 40% 以上。按理论值配置,现场一定跑不动。

第三步:数据采集与标注

客户有历史录像,这是好事,但不是所有录像都能用作训练数据。我们筛选的标准是:

  • 覆盖不同时段:白班、夜班、不同光照条件下都要有。只采白天的数据,夜里模型就瞎了。
  • 覆盖不同视角:不同点位的摄像头角度不同,目标在画面里的形态差异很大,都要覆盖。
  • 正负样本都要:戴安全帽和不戴的都要有,而且负样本(不戴的情况)往往更少,需要单独补采。

最终我们从 16 路视频中抽取了约 12000 帧,标注了约 18000 个目标框。标注采用外包 + 内部复核的方式,复核这一步不能省——标注质量直接决定模型上限,标错的样本会让模型学到错误的特征。

第四步:模型选型与训练

选 YOLOv8s 而不是更大的模型,理由很实际:

  • YOLOv8n(nano)精度不够,小目标(远处的人)漏检严重。
  • YOLOv8m 及以上精度提升有限,但算力需求翻倍,边缘设备跑不动。
  • YOLOv8s 在精度和速度之间取得了平衡,是边缘部署的常用选择。

训练过程中做了几轮针对性的数据增强:随机亮度与对比度调整(应对车间光线变化)、随机遮挡(应对设备遮挡)、Mosaic 拼接(提升小目标检测能力)。

验证集上的指标:安全帽检测 mAP@0.5 达到 0.94,反光衣 0.91。但请注意——验证集指标不等于现场效果,真正的工作在下一步。

第五步:现场调优,决定项目成败的环节

模型部署到现场后,第一天的告警量是 300 多条,管理人员直接打电话来说「没法用」。我们花了一周时间做调优,主要手段有三个:

1. 设置感兴趣区域(ROI)

车间的监控画面里,有相当一部分区域是不需要检测的——比如窗外、走道、已经确认合规的工位。把这些区域排除后,无效告警立刻减少了 40%。

2. 连续帧确认

单帧检测容易出现偶发误判(比如某个角度看起来像没戴帽子)。改成连续 3 帧都判定为违规才触发告警后,偶发误报基本消失。代价是告警延迟约 0.6 秒,对这个场景完全可以接受。

3. 按点位调整阈值

不同点位的检测难度差异很大。逆光的门口点位误报率高,我们单独把这个点位的置信度阈值从 0.5 提到 0.65;而光线稳定的装配区可以降到 0.4 以提高召回。这种细粒度的调整,是通用方案做不到的。

经过调优,日均告警降到 16 条左右,管理人员反馈「基本每条都值得看一眼」。

踩过的坑,供你参考

坑一:逆光点位。车间门口是逆光环境,人走过去几乎是个黑影,模型完全无法判断是否戴安全帽。解决办法是在门口加了一个补光灯——有时候解决光学问题比优化算法更有效

坑二:小目标。车间很大,远处的工人在画面里只有 20 多像素高,检测效果差。解决办法是调整摄像头焦距,或者在关键区域增加点位。这也是为什么我们坚持要到现场勘测,而不是远程看看录像就报价。

坑三:工人配合度。项目上线初期,工人发现摄像头能识别违规并推送给班组长,有抵触情绪,甚至出现故意遮挡摄像头的情况。后来客户调整了管理方式——初期以提醒教育为主,不直接处罚,并明确告知系统是为了安全而非监视,配合度才上来。技术和管理的配合,比技术本身更重要。

成本构成

这个项目的成本大致包括:

  • 数据采集与标注:约占总投入的 30%(12000 帧的标注工作量不小)
  • 模型训练与调优:约 25%
  • 边缘盒子与部署实施:约 30%(含两台 Jetson 盒子)
  • 管理后台与告警联动开发:约 15%

需要说明的是,数据标注成本与场景复杂度强相关。如果使用成熟算法(比如通用的人形检测),可以省掉标注成本,价格会低很多。定制模型的价值在于针对你的特定场景优化,适合对准确率有明确要求的项目。

小结

做好一个 AI 监控项目的关键,不在于用了多先进的模型,而在于:需求边界是否清晰、验收标准是否可量化、现场调优是否做到位。这三点做到了,用 YOLOv8 这样成熟的模型就能交付让客户满意的系统;做不到,用再新的模型也白搭。

如果你正在考虑类似的视觉算法项目,欢迎把具体场景告诉我们,我们可以先做一个可行性评估——包括技术路线、算力需求和大致的成本范围。

这篇文章对你有帮助吗?

如果你正在考虑类似的项目,欢迎把具体情况告诉我们,我们会给出针对性的建议——不收费,也不推销。