机器听觉-AI声学与声纹识别

工业声学检测 vs 机器视觉:能力边界与选型决策

作者:admin发布于 2026-08-3110分钟
机器听觉,AI声学,智能制造,异音检测
工业声学检测 vs 机器视觉:能力边界与选型决策

工业视觉检测「看得见的缺陷」(外观、静态),工业声学检测「听得到的缺陷」(内部、动态)。两者能力互补而非替代 —— 异音类、动态类缺陷视觉检测不到,外观类缺陷声学检测不到。

选型时应该先判断缺陷类型,再匹配技术路线,而不是反过来。

01 从物理层面理解两者的边界

为什么视觉看不到内部缺陷,声学看不到划痕?答案在感知介质上。

视觉依赖光反射,只能获取被测件表面的光学信息。一个封闭在壳体内部的齿轮啮合不良、一个埋在电机绕组里的匝间短路,在外观上没有任何表征 —— 光打不进去,相机自然拍不到。

声学依赖振动辐射,获取的是被测件运行时的动态信息。只要缺陷会改变物体的振动或发声特性,声学就能感知 —— 哪怕这个缺陷在物理上完全不可见。

反过来,一条表面划痕如果不影响运行状态,它就不会产生特征性的声学变化,声学检测同样无能为力。

一句话概括:视觉看静态形貌,声学听动态状态。

这也解释了为什么两者在产线上往往是互补关系,而不是竞争关系。

02 十个维度的完整对比

维度 工业视觉检测 工业声学检测

检测对象 外观缺陷:划痕、缺料、毛刺、装配偏移、印刷/贴标错误 内部与动态缺陷:轴承异音、齿轮啮合不良、电机换向噪声、卡滞、松动、气隙不均

技术原理 面阵/线阵相机 + 光源,图像处理与深度学习目标检测/分类 近场拾音传感器 + 声纹特征提取(FFT/MFCC)+ SVM/CNN 声学判定

感知能力 只能看到「表面」与「静态」;被遮挡的内部结构无法感知 感知「声音」即运行状态;内部结构问题通常伴随特征性声纹变化

适用工况 对光照、遮挡敏感,需要稳定打光环境与清洁视窗 对车间背景噪声敏感,需要近场采集与信噪比处理;对光照无要求

单件检测速度 毫秒到秒级,取决于视野、分辨率与算法复杂度 ≤5 秒/件可覆盖绝大多数产线节拍;采集时长决定下限

设备成本(单工位) 相机 + 光源 + 工控机,综合成本通常高于声学方案 拾音传感器 + 边缘计算单元,硬件成本低,主要成本在样本与模型

实施周期 标准算法库成熟,常规缺陷 2–6 周可上线 需采集真实产线样本训练,首条线通常 4–8 周

误检/漏检控制 外观缺陷误检可通过打光与算法调优控制 阈值 + 置信度双保险,低置信度进入人工复核回流训练,持续下降

数据与可追溯 保留图像记录,可追溯外观缺陷 保留声纹波形记录,可复听复判,追溯内部缺陷根因

ROI 参考 适合大批量外观检验,替代人工目检 适合异音/动态类缺陷全检,替代人工听音,消除漏检索赔风险

03 缺陷归属对照表

选型时最实用的一张表 —— 按缺陷类型直接对应技术路线:

缺陷类型 典型表现 归属

表面划痕、磕碰 外观可见 视觉

缺料、漏装、错装 结构缺失或位置错误 视觉

印刷/贴标错误 字符、图案异常 视觉

尺寸偏差、装配偏移 几何位置异常 视觉

轴承异音、磨损 运转时发出特征性噪声 声学

齿轮啮合不良 周期性啮合噪声 声学

电机换向噪声、电磁啸叫 高频特征音 声学

卡滞、阻滞 运动不畅导致的声音变化 声学

装配松动、间隙不均 振动与声音异常 声学

气隙不均、动平衡失效 特定转速下的声学特征 声学

灰色地带:有些缺陷两者都能检,但可靠性差异很大。例如装配不到位 —— 如果导致了外观可见的缝隙,视觉可检;如果只是内部预紧力不足导致异音,只能靠声学。

04 四步选型决策

第 1 步:缺陷是否与「声音」直接相关?

轴承异音、齿轮啮合、电机换向、卡滞松动 —— 这些动态缺陷首选声学。

第 2 步:缺陷是否在外观表面?

划痕、缺料、毛刺、装配偏移 —— 这些外观缺陷首选视觉。

第 3 步:现场环境是否允许?

车间噪声大但有近场采集条件 → 声学

需要稳定打光与洁净视窗 → 视觉

第 4 步:预算与周期?

硬件预算低、可接受 4–8 周模型训练 → 声学

需要快速上线标准检测 → 视觉

05 组合使用:总成类产品的完整方案

对总成类产品(如座椅电机、转向器、压缩机),推荐「视觉检外观 + 声学检异音」的组合:

上料 → 视觉工位(拦截外观缺陷)→ 声学工位(检测内部与动态缺陷)→ 分流

视觉工位在前,拦截掉外观不良品;声学工位在后,检测内部与动态缺陷。两个工位形成完整的在线全检闭环,兼顾两类缺陷覆盖。

这样做的另一个好处是:视觉先筛掉一部分不良品后,声学工位面对的样本更干净,误报率也会相应降低。

06 真实场景验证

以下数据来自已交付的产线项目:

汽车零部件:座椅电机异响检测

产线不良率 0.3%,缺陷表现为运转异音 —— 外观完全正常,视觉方案无法检出。

采用声学方案后,先用良品基线学习上线(此时无任何不良品样本),运行 3 个月积累 30 台不良品后平滑切换为有监督学习。漏检率从 0.5% 下降至 0.1% 以下。

这个案例典型地说明了:当缺陷不产生外观表征时,无论视觉算法多先进都无解,只能换感知介质。

07 四个常见误区

误区一:声学检测会替代机器视觉

不会。两者感知的物理量不同,能力边界是硬性的。同一产线可以组合使用,不存在谁替代谁。

误区二:声学检测对环境噪声过于敏感,产线上没法用

声学确实对背景噪声敏感,但可以工程化处理:近场拾音、指向性采集、信噪比增强。

关键动作是在方案设计阶段做现场声学可行性测试 —— 采集典型合格/不合格样本,验证目标缺陷声纹与背景噪声的可分性,再决定是否立项。跳过这一步直接上设备,是项目失败的主要原因之一。

误区三:视觉做不了的,声学都能做

不成立。前提是缺陷必须产生可感知的振动或声音变化。完全静止、无发声的零部件缺陷,声学同样无解。

误区四:声学检测需要大量不良品样本

这是早期方案的限制,现在已有成熟的应对方式。通过良品基线学习(One-Class Learning),最低 30 条良品样本即可建立正常声纹基线(推荐 50 条以获得稳健边界),对「偏离正常」的样本统一报警,零缺陷样本即可上线。

结语

选型的起点不是「哪个技术更先进」,而是「缺陷的物理表征是什么」。

先回答缺陷是外观的还是动态的、是静态的还是运行时的,技术路线的选择会自然浮现。

对大多数总成类产品而言,最终的答案往往不是二选一,而是两者组合 —— 视觉管住看得见的,声学管住听得见的,合起来才是完整的质量防线。

作者:贺中义

单位:上海创单电子科技有限公司(ISSAUTO)

职务:研发总监

本文技术对比数据基于公开产品参数与已交付项目实测整理。

需要定制化解决方案?

技术专家一对一沟通,深入了解您的需求

联系我们