声音AI开源模型与算法全景

(2026 V1.0)

Audio AI Open-source Models & Algorithms Landscape

精炼版 · 工程选型手册 · 约 15 页 适用场景:城市噪声 · 鸟类声学 · 无人机预警 · 工业异常 · 声源定位 版本日期:2026 年 7 月 23 日

CHAPTER 00 — 使用说明与一页选型

这不是模型百科,而是一份"先选路线、再选模型、最后验证许可与部署"的工程速查手册。

核心结论 环境声音产品优先从 BEATs / PANNs / AST / CLAP 迁移;Whisper、Wav2Vec2、HuBERT、WavLM 主要解决语音,不应直接当作城市噪声分类器。最终部署模型几乎都需要目标设备与真实场景数据微调或校准。

任务—首选方案

需求首选起点工程动作不建议
城市声事件分类BEATs / PANNs自采数据微调 + 阈值校准从零训练
零样本检索CLAP文本提示词 + 向量检索直接替代最终分类器
实时端侧分类YAMNet / EfficientAT蒸馏、量化、TFLite/ONNX直接部署大模型
时间段检测 SEDDCASE CRNN/Conformer强/弱标签训练 + 后处理仅做片段分类
阵列定位 SELDSELDnet / DCASE baseline阵列标定 + 多通道自采用单通道数据训练定位
工业异常BEATs embedding + kNN/AE正常样本建模 + 域适配把视觉 PatchCore 原样套音频
鸟类识别BirdNET + 本地化微调物种清单与地域先验忽略模型权重非商用限制

阅读规则

CHAPTER 01 — Foundation Models:横向比较

先看任务匹配,再看精度;"基础模型"并不等于"适合所有音频任务"。

模型核心域典型输出微调端侧推荐
BEATs通用声音Embedding / 分类★★★★★
PANNs通用声音527 类 / Embedding较强★★★★★
AST通用声音分类 Logits较弱★★★★☆
CLAP音频-文本联合向量可选★★★★★
AudioMAE通用声音 SSL表征 / 分类★★★☆☆
Wav2Vec2语音帧级语音表征★★★☆☆
HuBERT语音离散/连续表征★★★☆☆
WavLM语音全栈语音表征★★★★☆
WhisperASR/翻译文本可选分规格★★★★☆

工程边界

判断说明
最适合城市噪声迁移BEATs、PANNs、AST:预训练域直接覆盖大量环境事件。
最适合检索与零样本CLAP:用文本描述与音频向量对齐,适合探索与数据筛选。
最适合语音链路Wav2Vec2 / HuBERT / WavLM / Whisper:用于 ASR、说话人、语音表征。
端侧优先先用 YAMNet / EfficientAT,或把大模型蒸馏为小型 CNN。
商用注意AudioMAE 许可证为 CC BY-NC 4.0;模型权重条款必须单独核对。

Foundation Models:环境声音主力

四个优先级最高的通用声音模型,以及一个适合继续预训练的自监督模型。

BEATs ★★★★★ Audio Foundation Model

离散声学 tokenizer 驱动的通用声音表征模型。开发:Microsoft Research。许可:MIT(代码仓库)

PANNs / CNN14 ★★★★★ CNN Audio Tagging

AudioSet 预训练 CNN 家族,兼顾分类与 embedding。开发:Qiuqiang Kong 等。许可:MIT(仓库)

AST ★★★★☆ Spectrogram Transformer

将 log-Mel 频谱切成 patch 的纯 Transformer 分类器。开发:MIT CSAIL。许可:BSD-3-Clause

CLAP ★★★★★ Audio–Text Contrastive

把音频与文本映射到同一向量空间。开发:LAION。许可:CC0-1.0(仓库)

AudioMAE ★★★☆☆ Masked Autoencoder / SSL

对音频频谱做遮挡重建的自监督预训练。开发:Meta AI。许可:CC BY-NC 4.0

Foundation Models:语音表征与 ASR

这些模型很强,但任务域主要是语音;做城市环境声时应先做基准验证。

Wav2Vec2 ★★★☆☆ Speech SSL

从原始波形学习上下文化语音表示。开发:Meta AI。许可:MIT(fairseq)

HuBERT ★★★☆☆ Speech SSL

用隐藏单元预测学习语音结构。开发:Meta AI。许可:MIT(fairseq)

WavLM ★★★★☆ Full-stack Speech SSL

面向 ASR、说话人和语音增强的统一语音表征。开发:Microsoft Research。许可:MIT

Whisper ★★★★☆ ASR / Speech Translation

多语种语音识别、翻译与语言识别模型。开发:OpenAI。许可:MIT(代码与权重)

选型提醒 如果目标是"汽车、喇叭、施工、鸟叫、无人机"等事件标签,先选 BEATs / PANNs / AST;只有当目标包含语音内容、说话人或转写时,再引入 WavLM / Whisper。

CHAPTER 02 — Classification Models

分类回答"这段音频里有什么";它不直接给出精确起止时间和方位。

YAMNet ★★★★★ MobileNetV1 / 521 类

Google AudioSet 预训练轻量分类模型。开发:Google / TensorFlow。许可:Apache-2.0(TensorFlow Models)

EfficientAT ★★★★★ Efficient CNN / Distillation

面向高效音频标注的小型网络与蒸馏方案。开发:Johannes Kepler University Linz。许可:以仓库声明为准

HTS-AT ★★★★☆ Hierarchical Audio Transformer

层次化 token-semantic Transformer,兼顾分类与定位。开发:Ke Chen 等。许可:以官方仓库为准

CNN14 ★★★★★ PANNs Classifier

PANNs 中最常用的 AudioSet CNN 分类器。开发:Qiuqiang Kong 等。许可:MIT(仓库)

优先级

策略建议
最快跑通YAMNet
端侧产品EfficientAT / 蒸馏 CNN
云端高精度BEATs / AST / HTS-AT
稳健基线PANNs CNN14

CHAPTER 03 — SED:声音事件检测

SED 输出事件类别及起止时间;工程关键是标签粒度、时间分辨率、阈值与后处理。

DCASE / DESED Baseline ★★★★★ CRNN + teacher–student

DCASE Task 4 的官方/社区 SED 起点。开发:DCASE Community。许可:MIT(DESED_task)

CRNN ★★★★☆ CNN + RNN

频谱 CNN 提特征,RNN 建模时间上下文。开发:通用架构。许可:取决于实现

Conformer SED ★★★★☆ CNN + Attention

卷积捕捉局部模式,注意力处理长时间依赖。开发:多种 DCASE 实现。许可:取决于实现

BEATs + SED Head ★★★★★ Pretrained encoder + temporal head

用 BEATs 帧级表征连接线性/CRNN/Transformer 检测头。开发:工程组合。许可:需同时遵守组件许可

标签条件与训练策略

标签条件首选训练策略
只有片段标签弱监督 + teacher–student + 伪标签
有起止时间强监督帧级 BCE / focal loss
真实数据很少冻结预训练 encoder,只训练 temporal head
要实时因果 CRNN + 滑窗 + 滞回阈值

CHAPTER 04 — SELD:检测与声源定位

SELD 同时输出事件、时间和方向;必须使用同步多通道音频、已知阵列几何与空间标注。

SELDnet ★★★★☆ CRNN + SED/DOA heads

联合事件检测与到达方向估计的经典基线。开发:Tampere University 团队。许可:以仓库为准

DCASE 2025 SELD Baseline ★★★★★ Stereo + Multi-ACCDOA

立体声/视频场景的事件、方位与距离基线。开发:DCASE Task 3 Organizers。许可:以仓库为准

SALSA ★★★★☆ Spatial Feature

把功率谱与空间协方差特征在时频点对齐。开发:NTU / UIUC 团队。许可:取决于实现

EINV2 / Multi-ACCDOA ★★★★☆ Event-independent SELD

支持同类重叠声源的事件独立输出范式。开发:DCASE 研究社区。许可:取决于实现

硬件前置条件 SELD 不是把分类模型换个输出头即可。需要阵列通道同步、几何标定、相位一致性、时钟漂移控制,以及在目标安装高度和反射环境下采集的空间标签。

CHAPTER 05 — Anomaly Detection:异常声音

工业异常通常只有正常样本。首选"强 embedding + 距离/密度建模",再考虑重建式模型。

DCASE AE Baseline ★★★★☆ Autoencoder + Mahalanobis

DCASE 2023–2026 Task 2 持续维护的异常声基线。开发:NTT / DCASE。许可:以仓库为准

BEATs/CLAP + kNN ★★★★★ Embedding memory bank

冻结预训练编码器,以正常向量建立近邻或原型分布。开发:工程组合。许可:遵守编码器/索引库许可

Deep SVDD / One-Class ★★★☆☆ One-class objective

把正常特征压到紧致超球或边界内。开发:Lukas Ruff 等。许可:MIT(参考实现)

PatchCore / PaDiM(适配) ★★★☆☆ Memory / Gaussian feature model

原本为视觉异常,需将时频块或音频 embedding 视作 patch。开发:Anomalib / 社区。许可:Apache-2.0(Anomalib)

数据情况与推荐方案

数据情况推荐
只有正常音频BEATs embedding + kNN / Mahalanobis
有少量异常监督对比学习 + 原型分类
跨机器/工况域适配 + 分设备阈值 + 属性条件化
需要定位异常片段帧级 embedding + 滑窗异常分数

CHAPTER 06 — Audio Embedding

Embedding 是分类、检索、聚类、相似声音搜索和异常检测之间的通用接口。

CLAP Embedding ★★★★★ Audio–text joint vector

文本与音频可直接做余弦相似度。开发:LAION。许可:CC0-1.0(仓库)

BEATs Embedding ★★★★★ Self-supervised audio vector

从中间层或池化层提取通用声音表示。开发:Microsoft。许可:MIT

PANNs Embedding ★★★★★ CNN embedding

CNN14 常用 2048 维表征,工程上成熟。开发:Qiuqiang Kong 等。许可:MIT

YAMNet Embedding ★★★★☆ 1024-D MobileNet vector

轻量帧级 embedding,便于端侧和原型验证。开发:Google。许可:Apache-2.0

OpenL3 ★★★☆☆ Audio–visual embedding

基于视听对应关系学习的经典开放 embedding。开发:NYU MARL。许可:MIT;权重 CC BY 4.0

CHAPTER 07 — Audio LLM

Audio LLM 更适合音频问答、描述和跨任务交互,不应替代低延迟、可校准的事件检测器。

Qwen2-Audio ★★★★☆ Audio + Text → Text

支持语音、音乐和环境音理解的 7B 级音频语言模型。开发:Alibaba Cloud。许可:Apache-2.0(仓库;权重看模型卡)

SALMONN ★★★★☆ Speech–Audio LLM

融合语音与通用音频编码器的多模态 LLM 家族。开发:ByteDance / Tsinghua。许可:Apache-2.0(仓库)

Audio Flamingo 3 ★★★★☆ Long-audio LALM

覆盖声音、音乐与语音,支持长音频理解与推理。开发:NVIDIA。许可:代码 MIT;权重非商用/附加条款

LTU ★★★☆☆ Listen–Think–Understand

面向开放式音频理解与推理的早期代表模型。开发:MIT。许可:以仓库/权重声明为准

何时使用 Audio LLM

问题答案
何时使用 Audio LLM需要自然语言解释、问答、摘要或跨任务交互时。
何时不用毫秒级告警、固定类别计量、端侧低功耗、严格阈值审计。
推荐架构小模型负责持续检测;Audio LLM 只分析触发后的关键片段。

CHAPTER 08 — Deployment Overview

部署选择由目标芯片、延迟、功耗、算子支持和模型许可证共同决定。

目标优先模型运行时/工具关键动作风险
手机/ARMYAMNet、轻量 CNNTFLite / ONNXINT8 量化、流式前处理音频算子与量化精度
RK3588 NPUEfficientAT、蒸馏 CNNRKNN Toolkit2静态 shape、算子替换Transformer 转换兼容性
Jetson OrinBEATs-small、AST、SEDTensorRT / ONNXFP16、动态批、插件算子显存与端到端延迟
Intel CPU/GPUPANNs、YAMNet、AEOpenVINO模型转换、线程与流优化前处理成为瓶颈
云端 GPUBEATs、CLAP、Audio LLMPyTorch / TensorRT批量推理、缓存 embedding成本、并发、权重许可

推荐的部署验证顺序

阶段验证项通过标准
1. 桌面基线准确率、召回率、误报率、延迟目标场景验证集达标
2. 导出ONNX/TFLite/RKNN 数值一致性关键类别概率偏差可接受
3. 端侧持续音频流、内存、温度、功耗长时间运行无泄漏/降频
4. 现场风雨、远场、安装高度、设备差异误报与漏报满足业务阈值
5. 回流困难样本、漂移、版本追踪可复现、可回滚、可再训练
部署原则 先在目标设备上测"完整链路":采集、重采样、STFT/Mel、模型、后处理和上报。只看模型前向时间通常会严重低估真实延迟。

CHAPTER 09 — Engineering Recommendation Routes

下面路线以"最短时间获得可验证产品能力"为目标。

城市噪声 / 声事件

PANNs/BEATs → 自采微调 → SED → 阈值校准 → 端侧蒸馏

先做 8–15 个业务类;重点积累真实背景与误报样本。

鸟类识别

BirdNET → 地域/季节先验 → 本地物种微调 → 人工复核

研究可直接用;商用需关注模型 CC BY-NC-SA 4.0。

无人机声音

BEATs → 自采正负样本 → SED → 多节点/阵列融合

公开数据不足;必须覆盖距离、机型、风噪和交通背景。

工业异常

BEATs embedding → kNN/Mahalanobis → 分设备阈值 → 域适配

先只用正常数据;保留工况、转速、负载等条件属性。

声源定位

阵列标定 → SELDnet/DCASE baseline → 空间增强 → 现场重采

分类与定位分两阶段验收,避免问题互相掩盖。

从 PoC 到产品的四个里程碑

里程碑范围交付物退出条件
M1 基线公开权重 + 少量自采离线评测脚本、混淆矩阵可复现且优于简单规则
M2 适配目标设备/目标城市微调权重、阈值、误报清单核心类召回与误报达标
M3 端侧连续流 + 目标芯片可升级模型包、监控日志7×24h 稳定运行
M4 闭环多站点线上回流样本队列、版本治理、再训练漂移可发现、效果可回滚
推荐组合 云端/训练:BEATs + CLAP + DCASE;端侧:EfficientAT / YAMNet / 蒸馏 CNN;异常:BEATs embedding + 轻量统计后端;解释与报告:只在触发后调用 Audio LLM。

CHAPTER 10 — Recommended Open-source Projects(上)

优先收录能直接形成工程工作流的项目,而不是只收录单篇论文代码。

BirdNET-Analyzer ★★★★★ Bioacoustics

批量鸟声识别、分析与科学监测工具。开发:Cornell Lab / TU Chemnitz。许可:代码 MIT;模型 CC BY-NC-SA 4.0

SpeechBrain ★★★★☆ Speech Toolkit

ASR、说话人、分离、增强等 PyTorch 语音工具箱。开发:开源社区。许可:Apache-2.0

ESPnet ★★★★☆ End-to-end Speech Toolkit

覆盖 ASR、TTS、增强、分离和 SpeechLM 的端到端工具箱。开发:ESPnet Community。许可:Apache-2.0

NVIDIA NeMo ★★★★☆ Enterprise AI Toolkit

面向语音、LLM 和多模态训练部署的 NVIDIA 框架。开发:NVIDIA。许可:GitHub Apache-2.0;容器另有协议

pyannote.audio ★★★★☆ Speaker Diarization

说话人分离、VAD、重叠语音与说话人 embedding。开发:CNRS / pyannote。许可:MIT(代码)

CHAPTER 10 — Recommended Open-source Projects(下)

工具许可与其下载的模型权重许可可能不同;项目接入前做一次完整许可证清单。

OpenSoundscape ★★★★☆ Bioacoustics Workflow

生态声学数据切片、训练、推理和分析工具。开发:Kitzes Lab / Community。许可:开源;以仓库声明为准

Asteroid ★★★★☆ Source Separation

基于 PyTorch 的语音/音频源分离研究工具箱。开发:Asteroid Team。许可:MIT

AudioCraft ★★★☆☆ Generative Audio

MusicGen、AudioGen、EnCodec 等生成式音频框架。开发:Meta AI。许可:代码 MIT;权重/数据另行核对

WhisperX ★★★★☆ ASR Alignment

Whisper 转写 + 对齐 + 说话人时间戳工作流。开发:Community。许可:BSD-4-Clause(仓库)

Anomalib ★★★☆☆ Anomaly Toolkit

PatchCore、PaDiM、FastFlow 等异常检测统一框架。开发:Open Edge Platform。许可:Apache-2.0

文档维护说明:建议每 6 个月复核:仓库活跃状态、默认分支、权重下载地址、代码/权重/数据许可、主要运行时版本。本文链接核验日期为 2026-07-23;"已知许可"仅用于技术筛选,不构成法律意见。