声音AI开源模型与算法全景
(2026 V1.0)
Audio AI Open-source Models & Algorithms Landscape
CHAPTER 00 — 使用说明与一页选型
这不是模型百科,而是一份"先选路线、再选模型、最后验证许可与部署"的工程速查手册。
任务—首选方案
| 需求 | 首选起点 | 工程动作 | 不建议 |
|---|---|---|---|
| 城市声事件分类 | BEATs / PANNs | 自采数据微调 + 阈值校准 | 从零训练 |
| 零样本检索 | CLAP | 文本提示词 + 向量检索 | 直接替代最终分类器 |
| 实时端侧分类 | YAMNet / EfficientAT | 蒸馏、量化、TFLite/ONNX | 直接部署大模型 |
| 时间段检测 SED | DCASE CRNN/Conformer | 强/弱标签训练 + 后处理 | 仅做片段分类 |
| 阵列定位 SELD | SELDnet / DCASE baseline | 阵列标定 + 多通道自采 | 用单通道数据训练定位 |
| 工业异常 | BEATs embedding + kNN/AE | 正常样本建模 + 域适配 | 把视觉 PatchCore 原样套音频 |
| 鸟类识别 | BirdNET + 本地化微调 | 物种清单与地域先验 | 忽略模型权重非商用限制 |
阅读规则
- 评分以"对城市与环境声音工程的可用性"为主,不代表论文排行榜名次。
- "许可"仅作工程筛查;代码、权重、数据集和依赖可能采用不同条款,商用前需逐项复核。
- Hugging Face 链接优先指向官方或主流维护模型卡;若无可靠官方权重则标注"无"。
CHAPTER 01 — Foundation Models:横向比较
先看任务匹配,再看精度;"基础模型"并不等于"适合所有音频任务"。
| 模型 | 核心域 | 典型输出 | 微调 | 端侧 | 推荐 |
|---|---|---|---|---|---|
| BEATs | 通用声音 | Embedding / 分类 | 强 | 中 | ★★★★★ |
| PANNs | 通用声音 | 527 类 / Embedding | 强 | 较强 | ★★★★★ |
| AST | 通用声音 | 分类 Logits | 强 | 较弱 | ★★★★☆ |
| CLAP | 音频-文本 | 联合向量 | 可选 | 弱 | ★★★★★ |
| AudioMAE | 通用声音 SSL | 表征 / 分类 | 强 | 弱 | ★★★☆☆ |
| Wav2Vec2 | 语音 | 帧级语音表征 | 强 | 中 | ★★★☆☆ |
| HuBERT | 语音 | 离散/连续表征 | 强 | 中 | ★★★☆☆ |
| WavLM | 语音全栈 | 语音表征 | 强 | 中 | ★★★★☆ |
| Whisper | ASR/翻译 | 文本 | 可选 | 分规格 | ★★★★☆ |
工程边界
| 判断 | 说明 |
|---|---|
| 最适合城市噪声迁移 | BEATs、PANNs、AST:预训练域直接覆盖大量环境事件。 |
| 最适合检索与零样本 | CLAP:用文本描述与音频向量对齐,适合探索与数据筛选。 |
| 最适合语音链路 | Wav2Vec2 / HuBERT / WavLM / Whisper:用于 ASR、说话人、语音表征。 |
| 端侧优先 | 先用 YAMNet / EfficientAT,或把大模型蒸馏为小型 CNN。 |
| 商用注意 | AudioMAE 许可证为 CC BY-NC 4.0;模型权重条款必须单独核对。 |
Foundation Models:环境声音主力
四个优先级最高的通用声音模型,以及一个适合继续预训练的自监督模型。
BEATs ★★★★★ Audio Foundation Model
离散声学 tokenizer 驱动的通用声音表征模型。开发:Microsoft Research。许可:MIT(代码仓库)
- 推荐:城市声、工业异常、无人机、鸟类迁移
- 优势:泛化强,适合冻结特征或端到端微调
- 短板:模型较重;导出与端侧优化需额外工程
PANNs / CNN14 ★★★★★ CNN Audio Tagging
AudioSet 预训练 CNN 家族,兼顾分类与 embedding。开发:Qiuqiang Kong 等。许可:MIT(仓库)
- 推荐:通用分类、迁移、检索、负样本挖掘
- 优势:成熟、稳定、工程资料多,CNN14 性价比高
- 短板:时间定位能力弱于专用 SED;HF 权重可能为第三方转换
AST ★★★★☆ Spectrogram Transformer
将 log-Mel 频谱切成 patch 的纯 Transformer 分类器。开发:MIT CSAIL。许可:BSD-3-Clause
- 推荐:云端分类、模型对比、注意力可视化
- 优势:基线强、权重与复现路径清楚
- 短板:计算与内存开销高于轻量 CNN;实时端侧不占优
CLAP ★★★★★ Audio–Text Contrastive
把音频与文本映射到同一向量空间。开发:LAION。许可:CC0-1.0(仓库)
- 推荐:零样本分类、声音检索、数据筛选、聚类
- 优势:无需先定义固定类别;自然语言可快速试验
- 短板:提示词敏感;零样本结果不能替代场景化校准
AudioMAE ★★★☆☆ Masked Autoencoder / SSL
对音频频谱做遮挡重建的自监督预训练。开发:Meta AI。许可:CC BY-NC 4.0
- 推荐:研究、继续预训练、少标签迁移
- 优势:适合利用大量无标签音频学习表征
- 短板:官方仓库已归档;非商用许可限制明显
Foundation Models:语音表征与 ASR
这些模型很强,但任务域主要是语音;做城市环境声时应先做基准验证。
Wav2Vec2 ★★★☆☆ Speech SSL
从原始波形学习上下文化语音表示。开发:Meta AI。许可:MIT(fairseq)
- 推荐:ASR、语音识别、语音特征迁移
- 优势:生态成熟、模型规格丰富
- 短板:预训练域偏语音,对非语音环境事件并非首选
HuBERT ★★★☆☆ Speech SSL
用隐藏单元预测学习语音结构。开发:Meta AI。许可:MIT(fairseq)
- 推荐:语音表征、说话人、低资源语音任务
- 优势:下游语音任务迁移能力强
- 短板:对城市声、鸟叫和工业声需重新验证
WavLM ★★★★☆ Full-stack Speech SSL
面向 ASR、说话人和语音增强的统一语音表征。开发:Microsoft Research。许可:MIT
- 推荐:说话人、语音活动、语音增强、ASR
- 优势:语音全栈任务强,HF 支持好
- 短板:非语音事件识别不如专用 AudioSet 模型直接
Whisper ★★★★☆ ASR / Speech Translation
多语种语音识别、翻译与语言识别模型。开发:OpenAI。许可:MIT(代码与权重)
- 推荐:语音转写、事件后的语义取证、语音内容分析
- 优势:多语种稳健,规格从 tiny 到 turbo
- 短板:不是环境声分类器;30 秒窗口与自回归解码增加延迟
CHAPTER 02 — Classification Models
分类回答"这段音频里有什么";它不直接给出精确起止时间和方位。
YAMNet ★★★★★ MobileNetV1 / 521 类
Google AudioSet 预训练轻量分类模型。开发:Google / TensorFlow。许可:Apache-2.0(TensorFlow Models)
- 推荐:端侧原型、实时分类、embedding 基线
- 优势:部署简单、TFLite 生态友好、低门槛
- 短板:类别体系固定;复杂重叠场景需微调与后处理
EfficientAT ★★★★★ Efficient CNN / Distillation
面向高效音频标注的小型网络与蒸馏方案。开发:Johannes Kepler University Linz。许可:以仓库声明为准
- 推荐:边缘设备、低算力分类、蒸馏基线
- 优势:精度/速度平衡优秀,适合移动和嵌入式
- 短板:不同导出后端需自行验证算子与量化误差
HTS-AT ★★★★☆ Hierarchical Audio Transformer
层次化 token-semantic Transformer,兼顾分类与定位。开发:Ke Chen 等。许可:以官方仓库为准
- 推荐:云端分类、弱定位、CLAP 音频编码器
- 优势:AudioSet/ESC-50 强,层次结构比 AST 更高效
- 短板:工程栈较研究化;端侧仍需压缩
CNN14 ★★★★★ PANNs Classifier
PANNs 中最常用的 AudioSet CNN 分类器。开发:Qiuqiang Kong 等。许可:MIT(仓库)
- 推荐:通用基线、迁移学习、embedding
- 优势:成熟稳定,适合先建立可复现强基线
- 短板:参数量不算小;精确 SED 需决策级输出或专用头
优先级
| 策略 | 建议 |
|---|---|
| 最快跑通 | YAMNet |
| 端侧产品 | EfficientAT / 蒸馏 CNN |
| 云端高精度 | BEATs / AST / HTS-AT |
| 稳健基线 | PANNs CNN14 |
CHAPTER 03 — SED:声音事件检测
SED 输出事件类别及起止时间;工程关键是标签粒度、时间分辨率、阈值与后处理。
DCASE / DESED Baseline ★★★★★ CRNN + teacher–student
DCASE Task 4 的官方/社区 SED 起点。开发:DCASE Community。许可:MIT(DESED_task)
- 推荐:弱/强标签 SED、家庭与城市事件迁移
- 优势:评测、数据配方和后处理完整,最适合工程起步
- 短板:版本与任务逐年变化,需锁定 recipe 与依赖
CRNN ★★★★☆ CNN + RNN
频谱 CNN 提特征,RNN 建模时间上下文。开发:通用架构。许可:取决于实现
- 推荐:实时/离线 SED、端到端强标签训练
- 优势:结构直观、时序能力强、部署相对成熟
- 短板:长上下文有限;重叠事件与阈值调参敏感
Conformer SED ★★★★☆ CNN + Attention
卷积捕捉局部模式,注意力处理长时间依赖。开发:多种 DCASE 实现。许可:取决于实现
- 推荐:长音频、复杂多事件、云端 SED
- 优势:兼顾局部时频结构与全局上下文
- 短板:训练和推理成本高于 CRNN;端侧需要裁剪
BEATs + SED Head ★★★★★ Pretrained encoder + temporal head
用 BEATs 帧级表征连接线性/CRNN/Transformer 检测头。开发:工程组合。许可:需同时遵守组件许可
- 推荐:少标签迁移、复杂城市事件、工业事件
- 优势:利用强预训练显著降低从零训练成本
- 短板:特征时间分辨率、冻结策略和显存需系统调优
标签条件与训练策略
| 标签条件 | 首选训练策略 |
|---|---|
| 只有片段标签 | 弱监督 + teacher–student + 伪标签 |
| 有起止时间 | 强监督帧级 BCE / focal loss |
| 真实数据很少 | 冻结预训练 encoder,只训练 temporal head |
| 要实时 | 因果 CRNN + 滑窗 + 滞回阈值 |
CHAPTER 04 — SELD:检测与声源定位
SELD 同时输出事件、时间和方向;必须使用同步多通道音频、已知阵列几何与空间标注。
SELDnet ★★★★☆ CRNN + SED/DOA heads
联合事件检测与到达方向估计的经典基线。开发:Tampere University 团队。许可:以仓库为准
- 推荐:FOA/MIC 阵列算法入门、2D/3D DOA
- 优势:结构清楚、研究资料多、便于改造
- 短板:老代码栈;真实户外和同类多声源仍有挑战
DCASE 2025 SELD Baseline ★★★★★ Stereo + Multi-ACCDOA
立体声/视频场景的事件、方位与距离基线。开发:DCASE Task 3 Organizers。许可:以仓库为准
- 推荐:立体声 SELD、距离估计、音视频融合
- 优势:输出格式与评测接近最新工程需求
- 短板:数据与任务设定专用;前后模糊和真实泛化需验证
SALSA ★★★★☆ Spatial Feature
把功率谱与空间协方差特征在时频点对齐。开发:NTU / UIUC 团队。许可:取决于实现
- 推荐:FOA 与 MIC 阵列、多声源重叠
- 优势:空间线索表达强,可替换传统 GCC/IV 特征
- 短板:不是完整网络;前处理与阵列格式耦合
EINV2 / Multi-ACCDOA ★★★★☆ Event-independent SELD
支持同类重叠声源的事件独立输出范式。开发:DCASE 研究社区。许可:取决于实现
- 推荐:同类多实例、复杂重叠 SELD
- 优势:比单一 class-wise DOA 更能处理同类重叠
- 短板:训练匹配、输出关联和评测更复杂
CHAPTER 05 — Anomaly Detection:异常声音
工业异常通常只有正常样本。首选"强 embedding + 距离/密度建模",再考虑重建式模型。
DCASE AE Baseline ★★★★☆ Autoencoder + Mahalanobis
DCASE 2023–2026 Task 2 持续维护的异常声基线。开发:NTT / DCASE。许可:以仓库为准
- 推荐:机器状态监测、正常样本建模、基准复现
- 优势:任务规范完整,适合建立第一条可复现链路
- 短板:重建误差可能也重建异常;跨设备域偏移明显
BEATs/CLAP + kNN ★★★★★ Embedding memory bank
冻结预训练编码器,以正常向量建立近邻或原型分布。开发:工程组合。许可:遵守编码器/索引库许可
- 推荐:小样本异常、快速试验、可解释近邻检索
- 优势:训练成本低,可直接查看最相似正常样本
- 短板:阈值和域漂移敏感;内存库需治理
Deep SVDD / One-Class ★★★☆☆ One-class objective
把正常特征压到紧致超球或边界内。开发:Lukas Ruff 等。许可:MIT(参考实现)
- 推荐:固定设备、单类正常状态、embedding 后端
- 优势:目标清晰、推理简单、易与预训练特征组合
- 短板:可能表示坍缩;对运行工况变化敏感
PatchCore / PaDiM(适配) ★★★☆☆ Memory / Gaussian feature model
原本为视觉异常,需将时频块或音频 embedding 视作 patch。开发:Anomalib / 社区。许可:Apache-2.0(Anomalib)
- 推荐:频谱局部异常、研究验证、跨模态借鉴
- 优势:内存库和分布建模成熟,OpenVINO 工具链好
- 短板:并非原生音频算法;不可直接照搬视觉预处理
数据情况与推荐方案
| 数据情况 | 推荐 |
|---|---|
| 只有正常音频 | BEATs embedding + kNN / Mahalanobis |
| 有少量异常 | 监督对比学习 + 原型分类 |
| 跨机器/工况 | 域适配 + 分设备阈值 + 属性条件化 |
| 需要定位异常片段 | 帧级 embedding + 滑窗异常分数 |
CHAPTER 06 — Audio Embedding
Embedding 是分类、检索、聚类、相似声音搜索和异常检测之间的通用接口。
CLAP Embedding ★★★★★ Audio–text joint vector
文本与音频可直接做余弦相似度。开发:LAION。许可:CC0-1.0(仓库)
- 推荐:语义检索、零样本标签、数据发现
- 优势:文本查询自然,适合快速建立搜索系统
- 短板:对提示词和语言表述敏感
BEATs Embedding ★★★★★ Self-supervised audio vector
从中间层或池化层提取通用声音表示。开发:Microsoft。许可:MIT
- 推荐:下游分类、聚类、工业异常、无人机
- 优势:环境声迁移强,适合特征冻结
- 短板:向量层选择和池化方式影响明显
PANNs Embedding ★★★★★ CNN embedding
CNN14 常用 2048 维表征,工程上成熟。开发:Qiuqiang Kong 等。许可:MIT
- 推荐:相似音频、分类后端、聚类
- 优势:稳定、批量提取方便、成本低于大 Transformer
- 短板:语义对齐不如 CLAP;长音频需切片聚合
YAMNet Embedding ★★★★☆ 1024-D MobileNet vector
轻量帧级 embedding,便于端侧和原型验证。开发:Google。许可:Apache-2.0
- 推荐:端侧检索、轻量分类、在线聚类
- 优势:体积小、推理快、TFLite 友好
- 短板:表示上限低于大型基础模型
OpenL3 ★★★☆☆ Audio–visual embedding
基于视听对应关系学习的经典开放 embedding。开发:NYU MARL。许可:MIT;权重 CC BY 4.0
- 推荐:传统基线、环境声聚类、跨模态研究
- 优势:接口清楚、经典可复现
- 短板:维护与性能已落后于新一代 CLAP/BEATs
CHAPTER 07 — Audio LLM
Audio LLM 更适合音频问答、描述和跨任务交互,不应替代低延迟、可校准的事件检测器。
Qwen2-Audio ★★★★☆ Audio + Text → Text
支持语音、音乐和环境音理解的 7B 级音频语言模型。开发:Alibaba Cloud。许可:Apache-2.0(仓库;权重看模型卡)
- 推荐:音频问答、描述、语音交互、离线分析
- 优势:中文生态好,Transformers 接入方便
- 短板:显存与延迟高;类别阈值不可直接校准
SALMONN ★★★★☆ Speech–Audio LLM
融合语音与通用音频编码器的多模态 LLM 家族。开发:ByteDance / Tsinghua。许可:Apache-2.0(仓库)
- 推荐:语音+环境音问答、研究与多模态原型
- 优势:任务覆盖广,训练代码与数据流程开放
- 短板:部署复杂;权重与底座许可需逐项核对
Audio Flamingo 3 ★★★★☆ Long-audio LALM
覆盖声音、音乐与语音,支持长音频理解与推理。开发:NVIDIA。许可:代码 MIT;权重非商用/附加条款
- 推荐:长音频摘要、复杂问答、研究评测
- 优势:长上下文和综合音频理解强
- 短板:权重非商用限制;资源需求大
LTU ★★★☆☆ Listen–Think–Understand
面向开放式音频理解与推理的早期代表模型。开发:MIT。许可:以仓库/权重声明为准
- 推荐:音频推理研究、开放问答基线
- 优势:概念清晰,与 AST 生态相连
- 短板:能力与维护活跃度落后于新一代 Audio LLM
何时使用 Audio LLM
| 问题 | 答案 |
|---|---|
| 何时使用 Audio LLM | 需要自然语言解释、问答、摘要或跨任务交互时。 |
| 何时不用 | 毫秒级告警、固定类别计量、端侧低功耗、严格阈值审计。 |
| 推荐架构 | 小模型负责持续检测;Audio LLM 只分析触发后的关键片段。 |
CHAPTER 08 — Deployment Overview
部署选择由目标芯片、延迟、功耗、算子支持和模型许可证共同决定。
| 目标 | 优先模型 | 运行时/工具 | 关键动作 | 风险 |
|---|---|---|---|---|
| 手机/ARM | YAMNet、轻量 CNN | TFLite / ONNX | INT8 量化、流式前处理 | 音频算子与量化精度 |
| RK3588 NPU | EfficientAT、蒸馏 CNN | RKNN Toolkit2 | 静态 shape、算子替换 | Transformer 转换兼容性 |
| Jetson Orin | BEATs-small、AST、SED | TensorRT / ONNX | FP16、动态批、插件算子 | 显存与端到端延迟 |
| Intel CPU/GPU | PANNs、YAMNet、AE | OpenVINO | 模型转换、线程与流优化 | 前处理成为瓶颈 |
| 云端 GPU | BEATs、CLAP、Audio LLM | PyTorch / TensorRT | 批量推理、缓存 embedding | 成本、并发、权重许可 |
推荐的部署验证顺序
| 阶段 | 验证项 | 通过标准 |
|---|---|---|
| 1. 桌面基线 | 准确率、召回率、误报率、延迟 | 目标场景验证集达标 |
| 2. 导出 | ONNX/TFLite/RKNN 数值一致性 | 关键类别概率偏差可接受 |
| 3. 端侧 | 持续音频流、内存、温度、功耗 | 长时间运行无泄漏/降频 |
| 4. 现场 | 风雨、远场、安装高度、设备差异 | 误报与漏报满足业务阈值 |
| 5. 回流 | 困难样本、漂移、版本追踪 | 可复现、可回滚、可再训练 |
CHAPTER 09 — Engineering Recommendation Routes
下面路线以"最短时间获得可验证产品能力"为目标。
城市噪声 / 声事件
PANNs/BEATs → 自采微调 → SED → 阈值校准 → 端侧蒸馏
先做 8–15 个业务类;重点积累真实背景与误报样本。
鸟类识别
BirdNET → 地域/季节先验 → 本地物种微调 → 人工复核
研究可直接用;商用需关注模型 CC BY-NC-SA 4.0。
无人机声音
BEATs → 自采正负样本 → SED → 多节点/阵列融合
公开数据不足;必须覆盖距离、机型、风噪和交通背景。
工业异常
BEATs embedding → kNN/Mahalanobis → 分设备阈值 → 域适配
先只用正常数据;保留工况、转速、负载等条件属性。
声源定位
阵列标定 → SELDnet/DCASE baseline → 空间增强 → 现场重采
分类与定位分两阶段验收,避免问题互相掩盖。
从 PoC 到产品的四个里程碑
| 里程碑 | 范围 | 交付物 | 退出条件 |
|---|---|---|---|
| M1 基线 | 公开权重 + 少量自采 | 离线评测脚本、混淆矩阵 | 可复现且优于简单规则 |
| M2 适配 | 目标设备/目标城市 | 微调权重、阈值、误报清单 | 核心类召回与误报达标 |
| M3 端侧 | 连续流 + 目标芯片 | 可升级模型包、监控日志 | 7×24h 稳定运行 |
| M4 闭环 | 多站点线上回流 | 样本队列、版本治理、再训练 | 漂移可发现、效果可回滚 |
CHAPTER 10 — Recommended Open-source Projects(上)
优先收录能直接形成工程工作流的项目,而不是只收录单篇论文代码。
BirdNET-Analyzer ★★★★★ Bioacoustics
批量鸟声识别、分析与科学监测工具。开发:Cornell Lab / TU Chemnitz。许可:代码 MIT;模型 CC BY-NC-SA 4.0
- 推荐:鸟类监测、生态声学、离线批处理
- 优势:模型成熟、界面完整、生态应用广
- 短板:模型权重非商用;本地物种仍需验证
SpeechBrain ★★★★☆ Speech Toolkit
ASR、说话人、分离、增强等 PyTorch 语音工具箱。开发:开源社区。许可:Apache-2.0
- 推荐:语音链路、说话人、分离与增强
- 优势:配方和预训练模型多,商用友好
- 短板:主域是语音,不是城市环境声
ESPnet ★★★★☆ End-to-end Speech Toolkit
覆盖 ASR、TTS、增强、分离和 SpeechLM 的端到端工具箱。开发:ESPnet Community。许可:Apache-2.0
- 推荐:研究型语音系统、可复现实验、模型训练
- 优势:任务广、论文配方丰富、社区活跃
- 短板:配置复杂、学习成本较高
NVIDIA NeMo ★★★★☆ Enterprise AI Toolkit
面向语音、LLM 和多模态训练部署的 NVIDIA 框架。开发:NVIDIA。许可:GitHub Apache-2.0;容器另有协议
- 推荐:NVIDIA GPU、企业训练、ASR/TTS/LLM
- 优势:GPU 规模化与企业工具链完整
- 短板:容器和模型可能有附加许可;环境较重
pyannote.audio ★★★★☆ Speaker Diarization
说话人分离、VAD、重叠语音与说话人 embedding。开发:CNRS / pyannote。许可:MIT(代码)
- 推荐:会议、语音取证、说话人时间轴
- 优势:预训练 pipeline 强、Python API 友好
- 短板:部分模型需接受访问条款;非环境声工具
CHAPTER 10 — Recommended Open-source Projects(下)
工具许可与其下载的模型权重许可可能不同;项目接入前做一次完整许可证清单。
OpenSoundscape ★★★★☆ Bioacoustics Workflow
生态声学数据切片、训练、推理和分析工具。开发:Kitzes Lab / Community。许可:开源;以仓库声明为准
- 推荐:鸟类/动物声、被动声学监测、自建分类器
- 优势:从数据到模型的工作流完整
- 短板:大型通用模型与端侧部署需自行整合
Asteroid ★★★★☆ Source Separation
基于 PyTorch 的语音/音频源分离研究工具箱。开发:Asteroid Team。许可:MIT
- 推荐:ConvTasNet、DPRNN、语音分离、增强
- 优势:模块化、研究配方清晰
- 短板:对城市非语音混合需重新训练
AudioCraft ★★★☆☆ Generative Audio
MusicGen、AudioGen、EnCodec 等生成式音频框架。开发:Meta AI。许可:代码 MIT;权重/数据另行核对
- 推荐:声音生成、数据增强、音频编码研究
- 优势:生成模型与音频 codec 集成完整
- 短板:不是检测框架;模型权重可能限制商用
WhisperX ★★★★☆ ASR Alignment
Whisper 转写 + 对齐 + 说话人时间戳工作流。开发:Community。许可:BSD-4-Clause(仓库)
- 推荐:会议转写、精确词时间戳、语音后处理
- 优势:批量转写和时间对齐实用
- 短板:依赖多;仍不解决环境声分类
Anomalib ★★★☆☆ Anomaly Toolkit
PatchCore、PaDiM、FastFlow 等异常检测统一框架。开发:Open Edge Platform。许可:Apache-2.0
- 推荐:异常检测方法管理、OpenVINO 部署、音频适配研究
- 优势:算法统一、实验与部署工具齐全
- 短板:以视觉异常为主,音频必须重新定义输入与评测
文档维护说明:建议每 6 个月复核:仓库活跃状态、默认分支、权重下载地址、代码/权重/数据许可、主要运行时版本。本文链接核验日期为 2026-07-23;"已知许可"仅用于技术筛选,不构成法律意见。