城市声音识别公开数据集与应用指南

面向城市噪声、鸟叫、无人机、异常声音与声源定位

内容范围:数据集总表|应用分层|模型与定位差异|数据组合|实施优先级

一、核心结论

公开数据集适合完成预训练、算法选型、流程验证和基线评测;真正决定产品效果的,是使用目标设备在目标部署环境中持续采集并迭代形成的自有数据集。

二、公开数据集总表

数据集规模与标签适合做什么获取入口
AudioSet 约208万段、每段约10秒;训练标注常用527类;完整声音本体含632个类别节点;多标签、片段级标注。 大规模预训练、通用音频表征、类别体系参考、迁移学习。 官方网站
FSD50K 51,197段、约108小时、200类;多标签,提供片段级事件存在性标签。 开放波形预训练、迁移学习、类别补充、负样本扩充。 Zenodo
ESC-50 2,000段、50类;每段5秒、每类40段;44.1 kHz单声道。 算法入门、小模型验证、模型结构对比、数据处理流程测试。 官方GitHub
UrbanSound8K 8,732段、10类;每段不超过4秒;来源采样率、位深和声道不完全统一。 城市声音分类基线、端侧原型、交叉验证实验。 官方项目页
SONYC-UST-V2 18,510段真实城市传感器录音;带采集时间、传感器位置及多标签。 真实城市噪声标注、时空上下文建模、长期传感器场景研究。 论文与说明
DCASE任务数据 按年份与任务变化,可能含弱标签、强时间标签、异常/正常标签、多通道空间音频和合成场景。 SED事件检测、SELD定位与检测、工业异常检测、少样本动物声音识别。 数据集目录
STARSS22/23 真实空间声景,多通道录音;事件具有时间与空间方向标注,STARSS23另含视频。 麦克风阵列SELD、DOA估计、音视频融合定位。 STARSS23 Zenodo
TAU-NIGENS空间声景 利用真实房间脉冲响应构建混响空间声景,包含静止/移动声源及环境噪声。 空间音频算法预研、SELD训练、移动声源定位基线。 论文说明

三、数据集的分层使用方法

3.1 通用预训练与声音表征层

优先使用 AudioSet 预训练权重、FSD50K 波形数据及其类别体系。目标是让模型先学会通用声学特征,而不是直接训练最终产品类别。典型产物包括音频 Embedding、预训练编码器、类别相似度和迁移学习初始权重。

3.2 城市声音分类原型层

使用 ESC-50 和 UrbanSound8K 快速跑通切片、频谱、训练、验证和端侧推理流程。适合比较 Mel频谱+CNN、CRNN、PANNs、YAMNet、AST 和轻量模型。该层的结论主要用于算法工程验证,不能直接代表真实街区部署效果。

3.3 真实城市传感器建模层

重点使用 SONYC-UST-V2,结合时间、位置和多标签信息研究真实城市噪声。可分析白天/夜间、工作日/周末、街区差异、季节变化和传感器漂移。应同步建设自采数据集,用相同设备、安装高度和采样参数获取现场数据。

3.4 声音事件检测层(SED)

分类回答"这段音频里有什么",SED 进一步回答"什么时候开始、什么时候结束"。适合持续监听、低事件率、长录音切片和报警触发。优先选用 DCASE 中具有时间边界标注的任务数据,并按自己的目标事件补充强时间标注。

3.5 声源定位与检测层(SELD)

使用 STARSS、TAU-NIGENS 等多通道空间音频数据进行预研。模型同时输出事件类别、事件时间区间和声源方向,部分任务还估计距离。公开空间数据可帮助验证算法,但户外阵列、风噪、反射和远距离弱信号仍需自采数据校准。

四、按业务场景选择数据

业务方向优先公开数据可解决的问题仍需自建的数据
城市噪声分类 SONYC-UST-V2、UrbanSound8K、FSD50K 车辆、施工、警笛、人声、音乐等多标签分类;研究时空差异。 必须补充当地城市、设备和安装点位的真实背景数据。
鸟叫识别 AudioSet/FSD50K相关鸟类声音、DCASE少样本生物声任务 通用表征、鸟类声学类别迁移、少样本检测。 需按物种、叫声类型、季节、距离及环境噪声自采并由专业人员复核。
无人机声音 AudioSet/FSD50K中相关机械声与飞行器声,外加专用公开数据 建立旋翼/电机声音的初始表征和负样本库。 核心必须自采:机型、转速、距离、方向、飞行状态、风速、建筑反射和鸟虫背景。
工业异常声音 DCASE Task 2及相关机器异常数据 正常/异常检测、无监督或半监督异常评分。 不同设备型号、工况和安装位置差异大,必须基于目标设备建立正常基线。
事件定位 STARSS22/23、TAU-NIGENS、DCASE SELD 多通道同步、DOA、时间边界、移动声源和音视频融合。 最终阵列几何、户外环境与真实距离必须自采标定。

五、分类数据与定位数据的根本区别

不能混用的原因:ESC-50、UrbanSound8K、FSD50K 等单通道或普通音频数据可以训练"是什么声音",但通常无法训练"声音从哪个方向、哪个位置传来"。

比较项分类/事件检测数据定位/SELD数据
输入数据单通道或普通音频片段同步多通道阵列录音,或FOA空间音频
核心标签一个或多个声音类别类别 + 开始/结束时间 + 方位角/仰角,部分含距离
关键依赖类别数量、样本多样性、难负样本阵列几何、通道同步、标定、空间标签精度
典型任务Audio Tagging、Audio Classification、SEDDOA、Beamforming、TDOA、SELD
产品输出"检测到无人机声""检测到无人机声,方向约35°,持续8秒"

六、公开数据、自采数据与训练的组合

各数据源的作用

推荐训练数据配比思路

  1. 阶段一:用 AudioSet 预训练模型或 FSD50K 建立通用声学编码器。

  2. 阶段二:用 ESC-50、UrbanSound8K 或目标公开集跑通训练、评估和部署链路。

  3. 阶段三:用自采目标声正样本 + 大量真实背景负样本进行迁移训练。

  4. 阶段四:用线上误报与漏报回流做难例挖掘、阈值校准和增量迭代。

  5. 阶段五:定位任务单独使用多通道数据训练,并在真实阵列上完成几何与时延标定。

七、自采数据建议的标签结构

标签组建议字段
基础文件信息文件ID、设备ID、采集时间、地点编码、采样率、声道数、位深、增益。
事件类别主类、子类、未知类、背景类;支持多标签。
时间标签事件开始时间、结束时间、是否完整、是否重叠。
场景标签室内/户外、道路/园区/建筑、天气、风速、时段、安装高度。
质量标签信噪比等级、是否削波、是否有风噪/雨噪、是否存在通道异常。
目标属性无人机机型与状态、鸟类物种与叫声类型、设备工况与异常类型等。
空间标签阵列坐标、声源方位角、仰角、距离或位置轨迹;仅定位数据需要。
标注可信度标注者、复核者、置信度、争议状态、专家确认状态。

八、实施优先级

阶段数据组合主要工作阶段产物
P0:先跑通ESC-50 / UrbanSound8K完成音频读取、切片、特征、训练、评估和端侧推理。形成可重复的工程流水线。
P1:迁移能力AudioSet预训练权重 + FSD50K建立通用声音Embedding和迁移学习基线。减少自采数据量需求。
P2:真实城市SONYC-UST-V2 + 自采城市背景验证多标签、时空特征、持续监听和误报控制。形成第一版城市监测模型。
P3:目标专项无人机/鸟叫/异常声音自采数据围绕目标类别做精细标签、难负样本和距离分层。形成可交付专项模型。
P4:空间定位STARSS/TAU-NIGENS + 自有阵列数据完成SELD、DOA、阵列标定和真实场景定位。形成"识别+方向/位置"能力。
P5:持续迭代线上数据回流误报复核、漂移检测、阈值自适应、模型版本管理。形成数据闭环和长期护城河。

九、最终推荐的数据组合

AudioSet 预训练权重 + FSD50K 通用波形 + SONYC 真实城市数据 + DCASE/STARSS 空间数据 + 自采目标数据 + 线上难例回流。

主要资料入口

Google AudioSet:https://research.google.com/audioset/

FSD50K Zenodo:https://zenodo.org/records/4060432

ESC-50 GitHub:https://github.com/karolpiczak/ESC-50

UrbanSound8K:https://urbansounddataset.weebly.com/urbansound8k.html

SONYC-UST-V2 论文:https://arxiv.org/abs/2009.05188

DCASE 数据集目录:https://dcase-repo.github.io/dcase_datalist/

DCASE Challenge:https://dcase.community/

STARSS23 Zenodo:https://zenodo.org/records/7880637

TAU-NIGENS 空间声景论文:https://arxiv.org/abs/2006.01919