工业视觉检测「看得见的缺陷」(外观、静态),工业声学检测「听得到的缺陷」(内部、动态)。两者能力互补而非替代 —— 异音类、动态类缺陷视觉检测不到,外观类缺陷声学检测不到。
选型时应该先判断缺陷类型,再匹配技术路线,而不是反过来。
01 从物理层面理解两者的边界
为什么视觉看不到内部缺陷,声学看不到划痕?答案在感知介质上。
视觉依赖光反射,只能获取被测件表面的光学信息。一个封闭在壳体内部的齿轮啮合不良、一个埋在电机绕组里的匝间短路,在外观上没有任何表征 —— 光打不进去,相机自然拍不到。
声学依赖振动辐射,获取的是被测件运行时的动态信息。只要缺陷会改变物体的振动或发声特性,声学就能感知 —— 哪怕这个缺陷在物理上完全不可见。
反过来,一条表面划痕如果不影响运行状态,它就不会产生特征性的声学变化,声学检测同样无能为力。
一句话概括:视觉看静态形貌,声学听动态状态。
这也解释了为什么两者在产线上往往是互补关系,而不是竞争关系。
02 十个维度的完整对比
维度 工业视觉检测 工业声学检测
检测对象 外观缺陷:划痕、缺料、毛刺、装配偏移、印刷/贴标错误 内部与动态缺陷:轴承异音、齿轮啮合不良、电机换向噪声、卡滞、松动、气隙不均
技术原理 面阵/线阵相机 + 光源,图像处理与深度学习目标检测/分类 近场拾音传感器 + 声纹特征提取(FFT/MFCC)+ SVM/CNN 声学判定
感知能力 只能看到「表面」与「静态」;被遮挡的内部结构无法感知 感知「声音」即运行状态;内部结构问题通常伴随特征性声纹变化
适用工况 对光照、遮挡敏感,需要稳定打光环境与清洁视窗 对车间背景噪声敏感,需要近场采集与信噪比处理;对光照无要求
单件检测速度 毫秒到秒级,取决于视野、分辨率与算法复杂度 ≤5 秒/件可覆盖绝大多数产线节拍;采集时长决定下限
设备成本(单工位) 相机 + 光源 + 工控机,综合成本通常高于声学方案 拾音传感器 + 边缘计算单元,硬件成本低,主要成本在样本与模型
实施周期 标准算法库成熟,常规缺陷 2–6 周可上线 需采集真实产线样本训练,首条线通常 4–8 周
误检/漏检控制 外观缺陷误检可通过打光与算法调优控制 阈值 + 置信度双保险,低置信度进入人工复核回流训练,持续下降
数据与可追溯 保留图像记录,可追溯外观缺陷 保留声纹波形记录,可复听复判,追溯内部缺陷根因
ROI 参考 适合大批量外观检验,替代人工目检 适合异音/动态类缺陷全检,替代人工听音,消除漏检索赔风险
03 缺陷归属对照表
选型时最实用的一张表 —— 按缺陷类型直接对应技术路线:
缺陷类型 典型表现 归属
表面划痕、磕碰 外观可见 视觉
缺料、漏装、错装 结构缺失或位置错误 视觉
印刷/贴标错误 字符、图案异常 视觉
尺寸偏差、装配偏移 几何位置异常 视觉
轴承异音、磨损 运转时发出特征性噪声 声学
齿轮啮合不良 周期性啮合噪声 声学
电机换向噪声、电磁啸叫 高频特征音 声学
卡滞、阻滞 运动不畅导致的声音变化 声学
装配松动、间隙不均 振动与声音异常 声学
气隙不均、动平衡失效 特定转速下的声学特征 声学
灰色地带:有些缺陷两者都能检,但可靠性差异很大。例如装配不到位 —— 如果导致了外观可见的缝隙,视觉可检;如果只是内部预紧力不足导致异音,只能靠声学。
04 四步选型决策
第 1 步:缺陷是否与「声音」直接相关?
轴承异音、齿轮啮合、电机换向、卡滞松动 —— 这些动态缺陷首选声学。
第 2 步:缺陷是否在外观表面?
划痕、缺料、毛刺、装配偏移 —— 这些外观缺陷首选视觉。
第 3 步:现场环境是否允许?
车间噪声大但有近场采集条件 → 声学
需要稳定打光与洁净视窗 → 视觉
第 4 步:预算与周期?
硬件预算低、可接受 4–8 周模型训练 → 声学
需要快速上线标准检测 → 视觉
05 组合使用:总成类产品的完整方案
对总成类产品(如座椅电机、转向器、压缩机),推荐「视觉检外观 + 声学检异音」的组合:
上料 → 视觉工位(拦截外观缺陷)→ 声学工位(检测内部与动态缺陷)→ 分流
视觉工位在前,拦截掉外观不良品;声学工位在后,检测内部与动态缺陷。两个工位形成完整的在线全检闭环,兼顾两类缺陷覆盖。
这样做的另一个好处是:视觉先筛掉一部分不良品后,声学工位面对的样本更干净,误报率也会相应降低。
06 真实场景验证
以下数据来自已交付的产线项目:
汽车零部件:座椅电机异响检测
产线不良率 0.3%,缺陷表现为运转异音 —— 外观完全正常,视觉方案无法检出。
采用声学方案后,先用良品基线学习上线(此时无任何不良品样本),运行 3 个月积累 30 台不良品后平滑切换为有监督学习。漏检率从 0.5% 下降至 0.1% 以下。
这个案例典型地说明了:当缺陷不产生外观表征时,无论视觉算法多先进都无解,只能换感知介质。
07 四个常见误区
误区一:声学检测会替代机器视觉
不会。两者感知的物理量不同,能力边界是硬性的。同一产线可以组合使用,不存在谁替代谁。
误区二:声学检测对环境噪声过于敏感,产线上没法用
声学确实对背景噪声敏感,但可以工程化处理:近场拾音、指向性采集、信噪比增强。
关键动作是在方案设计阶段做现场声学可行性测试 —— 采集典型合格/不合格样本,验证目标缺陷声纹与背景噪声的可分性,再决定是否立项。跳过这一步直接上设备,是项目失败的主要原因之一。
误区三:视觉做不了的,声学都能做
不成立。前提是缺陷必须产生可感知的振动或声音变化。完全静止、无发声的零部件缺陷,声学同样无解。
误区四:声学检测需要大量不良品样本
这是早期方案的限制,现在已有成熟的应对方式。通过良品基线学习(One-Class Learning),最低 30 条良品样本即可建立正常声纹基线(推荐 50 条以获得稳健边界),对「偏离正常」的样本统一报警,零缺陷样本即可上线。
结语
选型的起点不是「哪个技术更先进」,而是「缺陷的物理表征是什么」。
先回答缺陷是外观的还是动态的、是静态的还是运行时的,技术路线的选择会自然浮现。
对大多数总成类产品而言,最终的答案往往不是二选一,而是两者组合 —— 视觉管住看得见的,声学管住听得见的,合起来才是完整的质量防线。
作者:贺中义
单位:上海创单电子科技有限公司(ISSAUTO)
职务:研发总监
本文技术对比数据基于公开产品参数与已交付项目实测整理。
