声音识别监测模型训练:数据采集标注到落地全流程解析

硬件、采集、标注、训练到真实部署全流程解析 — 安防 · 工业 · 无人机 · 园区监测

JediX AI · 2026 年 7 月

本文关注的问题不是"哪里能下载声音数据",而是怎样建立一套能在真实城市、园区、工厂或自然环境中稳定工作的声音识别监测数据工程

导读:模型离开实验室后,为什么突然"听不懂"了?

几乎所有声音识别团队都会经历同一个阶段:在公开数据集或内部验证集上,分类准确率看起来很高;设备挂到路灯、厂房、林区或无人机禁飞区之后,却开始频繁漏报和误报。风声被认成旋翼,切割机被认成无人机,远处警笛被车流完全掩盖;换一款麦克风、换一个安装高度,性能又掉一截。

问题通常不只在模型。更常见的根源,是训练数据描述的"声音世界"与设备部署后真正听到的世界不是同一个分布:录音设备不同、前端算法不同、声源距离不同、混响和风噪不同、事件发生率不同,甚至训练集只保留了清晰正样本,而现场绝大多数时间都是背景与相似干扰声。

声音模型的上限,首先由数据采集系统决定。硬件定义能听到什么;采集脚本定义见过哪些变化;标注定义模型学会区分什么;数据切分决定测试成绩是否可信;真实运行回流则决定系统能否持续进化。

本文延续"先识别公开数据的能力边界,再定义合格数据标准,随后拆解采集与标注流水线,最后给出分阶段落地路径"的分析框架,面向声音分类、声音事件检测(SED)以及声音事件定位与检测(SELD)三类系统。

核心结论

  1. 公开数据集适合预训练和建立基线,不能直接替代目标现场数据。AudioSet、FSD50K、ESC-50、UrbanSound8K 扩大了类别知识,却无法覆盖你的麦克风、安装方式、距离、噪声底和真实事件先验。
  2. "可用于真实监测"的音频必须匹配部署链路:同类或经过标定的麦克风、相同采样和前端处理、相似安装结构,并保留未经降噪/AGC/波束形成破坏的原始通道数据。
  3. 负样本不是配角,而是工程主体。现场告警系统的可用性,往往由"每设备每天误报次数"而非离线准确率决定;必须系统采集背景、近邻类别、极难混淆声和完全静默片段。
  4. 仅有片段级类别标签远远不够。事件检测至少需要起止时间、重叠事件、可闻度与标注置信度;定位任务还要记录阵列几何、声源方位/距离和同步状态。
  5. 数据集必须按地点、日期、设备和连续录音源分组切分。随机切片会让同一段背景纹理同时进入训练集和测试集,产生严重的数据泄漏与虚高成绩。
  6. 最佳路径不是一开始追求上万小时,而是"少量真实闭环 → 扩充变化矩阵 → 现场影子运行 → 难例回流"。每一轮新增数据都要用固定场景、未见设备和真实告警指标验证价值。

专题:长时连续监听为什么首先是一道"低事件率"工程题?

安防、工业、无人机和园区监测的共同点,是设备需要 24/7 运行,但真正需要告警的事件可能每小时甚至每天才出现几次。训练集通常人为平衡正负样本,现场却可能连续数万次判断都没有目标;这会把一个离线指标不错的分类问题,放大成严苛的低基率告警问题。

假设模型每 5 秒判断一次,一台设备每天需要作出 17,280 次判断。即使单窗口假阳性率只有 0.1%,在事件合并和时序平滑之前,理论上仍可能产生约 17 次错误触发。部署规模扩大到 100 个节点后,任何微小的误报率都会转化为真实的运维负担。

事件召回率误报强度首次可靠告警延迟
在约定误报水平下,真正发生的目标事件能找回多少按每设备日、每站点日或每 100 小时统计,而非只看 Accuracy从事件进入可检测范围,到系统形成可执行告警的时间

关键公式 低事件率下的可用性 = 固定误报水平下的事件召回 + 告警延迟 + 设备在线稳定性

重点提示 指标不能写成通用固定值。"每天误报少于 2–5 次"或"延迟低于 5–10 秒"只能作为项目示例:200 个节点每台每天误报 2 次,仍会带来 400 次人工处置;高速无人机的 10 秒延迟可能不可接受,慢性机械异常却可能允许分钟级确认。指标必须由节点规模、事件后果、目标速度和业务响应时间共同倒推。

一、绝大多数公开声音数据为何无法直接满足监测任务?

分类、检测与定位,本质上是三种不同的数据任务

任务模型要回答的问题最低标注要求典型输出
声音分类 / Tagging这个片段里有没有目标声?片段级单标签或多标签无人机 0.87;鸟叫 0.31
声音事件检测 SED目标何时开始、何时结束?类别 + onset/offset;允许重叠12.4–15.7 s 有警笛
声音定位 SSL声音从哪个方向/位置来?阵列同步 + DOA/坐标真值方位角 73°
声音事件定位与检测 SELD什么声音、何时发生、来自哪里?强时间标注 + 类别 + 方位/距离无人机,12.4–15.7 s,73°

如果目标是"连续监听并告警",仅把长录音切成若干 5 秒片段再做分类,会在事件边界、短促声音和多声源重叠时产生结构性误差。若还要跟踪方位,则单麦克风数据从信息层面就不完整。

公开数据集的价值与能力边界

数据集规模与标签适合做什么直接落地的主要缺口
AudioSet约 208 万段 10 秒视频片段;527 个已发布类别;片段级弱标签大规模预训练、类别本体参考网络音频、压缩与版权/链接稳定性;无现场设备匹配;缺少强时间标注
FSD50K51,197 段、约 108 小时、200 类;16-bit/44.1kHz 单声道;片段级弱标签开放波形预训练、迁移学习、类别补充上传者与设备异质;不是连续监测流;缺起止时间
ESC-502,000 段、50 类、每段 5 秒、44.1kHz 单声道算法入门与小型基准每类仅 40 段;片段干净且规模小;非部署分布
UrbanSound8K8,732 段、10 类、≤4 秒;源采样率和声道不一城市声音分类基线来自 Freesound 切片;类别少;录音链路与安装信息不足
SONYC-UST-V218,510 段城市传感器录音;带小时级时间与街区级位置;多标签真实城市噪声标注方法、时空上下文建模纽约特定网络与类别;仍需适配本地设备、法规和目标声
DCASE 任务数据真实弱标注、未标注域内数据、合成强标注等组合SED/SELD 评测、强弱监督与合成声景方法任务定义固定;部署类别、阵列结构和现场声学仍不同

重点提示 正确用法:公开数据用于预训练、类别迁移、标注规范参考和基线对比;目标场景数据用于校准最后一公里。二者是"通识 + 现场经验" 的组合,不是替代关系。

声音数据最隐蔽的分布偏移

二、符合监测模型训练标准的数据,需要具备哪些特质?

六项硬标准

  1. 采集链路可追溯:记录麦克风型号/序列号、增益、采样率、位深、通道顺序、固件、前端处理版本、安装外壳和校准信息。
  2. 部署域匹配:训练数据中必须有足够比例来自与量产设备等效的传感器、安装高度、朝向和处理链路。
  3. 原始数据可复算:阵列任务保留同步的原始多通道 PCM;处理音频可以另存,但不可只留下单路降噪结果。
  4. 变化矩阵完整:覆盖声源个体、工况、距离、方位、速度、环境、天气、时段、设备和背景噪声等关键因子。
  5. 负样本体系化:背景负样本、近邻负样本、硬负样本和未知类/OOD 样本都要有明确采集配额与回流机制。
  6. 标签与业务输出一致:告警需要事件级标签;定位需要空间真值;噪声执法还要保存经校准的声压指标,不能拿分类标签代替计量。

先定义"要识别什么",再决定采什么

类别名称必须写成可执行的声学定义,而不是业务口号。例如"无人机声"至少要明确:是否包括开机怠速、起飞、悬停、加速飞行、降落、远距弱信号;是否把固定翼航模纳入;割草机、电动工具、摩托车和昆虫群分别属于负类还是相邻类。

字段应当写清楚的内容示例:无人机监测
目标类定义可听特征、工况和纳入边界多旋翼电机/桨叶声;开机、起飞、悬停、航行、降落
排除规则不属于目标类的相似声电动割草机、吹叶机、摩托、直升机、蜂群、空调外机
告警单位按帧、片段、事件或连续轨迹连续命中并合并为一次飞行事件
最短事件业务必须捕获的最短持续时间由响应目标和模型窗长共同确定
目标距离/方位系统声明的有效范围及覆盖角例如按场地测试定义,不以实验室最大值代替
可接受误报业务可承受的假警报强度每设备每天或每 100 小时的误报上限

三、硬件选型:不是"录得清楚"就够了

单麦克风、录音机和阵列如何选择

方案能力优点限制建议用途
全向 MEMS/USB 单麦分类、SED便宜、易铺设不能可靠提供方位;设备差异明显单点检测、快速验证
枪式指向麦克风定向拾音、分类、SED可抑制侧后方干扰覆盖角有限,安装方向敏感;仍不能独立定位已知监测方向的远距检测
测量麦克风 + 专业录音机高动态、高保真、声压参考频响与动态范围好,可校准成本和功耗高;不代表量产设备建立参考真值、声学测量
4–8 麦克风阵列DOA、波束形成、SELD保留空间相位差要求通道同步、几何固定、标定严格定位与多目标监测
分布式多节点区域定位、覆盖扩展基线长、可做 TDOA时钟/GNSS/PTP、网络和站点标定复杂大范围无人机/异常声定位

注意:RØDE NTG-2 属于枪式电容麦克风,并非 MEMS 麦克风。Class 1 测量链路通常用于建立声压参考;若系统承担法规计量,则它可能成为生产测量链路,而不只是一次性校准工具。

关键提醒 ReSpeaker 等语音阵列可用于概念验证,但其内置降噪、AGC、波束形成和 16 kHz 带宽会改变声学信息。定位或环境声训练应优先导出原始同步通道,并评估频带是否覆盖目标。

采样率、位深和动态范围

阵列数据必须保留的工程信息

重点提示 通信不等于授时。LoRa、4G、5G 和以太网负责传输结果、特征或触发片段;GNSS PPS、IEEE 1588 PTP、本地稳定时钟与硬件时间戳才负责同步。LoRa 不适合持续回传原始多通道音频,也不会自动提供跨节点 TDOA 所需的采样级同步;5G 的低网络时延同样不能替代采样时钟同步。

户外采集先解决风,再讨论算法

风噪往往是户外弱声监测最主要的干扰之一,但解决顺序应当是防风罩与机械结构 → 安装点选择 → 风速/风向记录 → 真实风噪采集 → 风噪检测和派生抑制。对阵列信号直接做不可逆自适应抑制,可能改变通道相位并破坏 DOA/TDOA;因此原始同步通道必须保留,抑制结果只能作为派生视图。

建议的三级采集硬件

阶段采集端辅助真值计算与存储目标
PoC 基线量产候选单麦/4 麦阵列;48k/24-bit 优先手机视频、激光测距或人工距离/方位记录笔记本/树莓派;本地 SSD证明目标声可分、找到主要混淆类
场景扩展量产候选 + 一套校准参考麦;必要时 8 麦阵列同步视频、气象、GNSS/姿态、声源工况日志边缘主机或 Jetson;集中对象存储建立变化矩阵和强标签
生产采集与部署 BOM/外壳/固件一致的节点;多站点自动设备健康、时钟、气象、运维记录端侧触发 + 环形缓存 + 云端数据湖难例回流、持续学习与版本审计

四、数据采集流水线:从目标定义到可训练数据

第一步:建立"场景—声源—设备"变化矩阵

不要先问"要录多少小时",先问关键变化是否被覆盖。数据量是矩阵覆盖后的结果。对于每个目标类,至少从以下维度组合设计:

维度要覆盖的变量为什么影响模型
声源型号/个体、转速、负载、动作阶段、故障状态决定基础频谱、谐波与调制模式
空间按近距/业务工作区/远距极限分档;方位、高度、静止/移动、遮挡决定声压、直达/反射比例和多普勒变化;不预设"20–500 米"一类未经实测的承诺
环境室内/室外、街道/林地/厂房、混响、地面与建筑改变传播和背景纹理;"雾"本身通常不是首要分层变量
天气时段风速风向及阵风、降雨、温湿度、昼夜、季节、工厂作息影响噪声、传播、设备状态和生物声活动
设备麦克风型号、批次、外壳、增益、安装朝向形成设备域差异
并发声车流、人声、机械、鸟虫、警报等单独及组合决定现场检测难度与误报结构

第二步:采集四类数据,而不是只录"好听的正样本"

数据类型定义采集策略训练用途
受控正样本目标声源与距离、方位、工况可控系统扫描变化矩阵;同步视频/工况日志学习目标声学特征,建立强标签
自然正样本目标在真实背景中自然发生现场长录音、事件触发后人工复核缩小实验到现场的域差
背景负样本没有目标的真实连续声景按地点/季节/时段长期采集;保留静默校准真实先验,降低泛化误报
硬负样本声学上最像目标、最易触发的非目标由专家清单 + 影子运行误报挖掘训练判别边界,是落地价值最高的负样本

训练批次可以为了优化而重采样,但验证集和测试集必须尽可能保留自然发生率。否则模型在"50% 正样本"的测试集里表现很好,也无法推断全天候监测时的误报负担。

不要把"80% 精力用于负样本"写成固定比例。实际连续录音时长可能 95% 以上都是背景,但标注资源不应平均消耗在普通静默上;人工与专家工时应优先投向硬负样本、低 SNR 正样本、模型高不确定样本和疑似漏报。PoC 可先以约 50–200 设备小时的真实现场录音形成首轮闭环,但是否够用仍由变化矩阵和置信区间决定,而不是由小时数单独决定。

低事件率专用采集:长期环形缓存 + 多级触发

节点可以持续维护本地环形缓存,但不持续上传原始音频。当触发器命中时,保存事件发生前后的上下文,再进入人工复核或二级模型。这里不应把 VAD 当作通用触发器:VAD 主要服务人声,可能直接漏掉无人机、机械异常和鸟叫。

触发层作用典型方法
一级超轻量排除大量稳定背景能量变化、目标频带能量、频谱新颖度
二级目标触发形成候选事件轻量异常检测或低功耗目标分类器
外部触发提高召回或降低误报视频、雷达、RF、门磁或设备工况信号
保存策略保留完整事件上下文按任务配置触发前后缓存,而不是只保存命中窗口

第三步:同步记录上下文与真值

第四步:现场质检不能等到回公司再做

五、标注流水线:从"听到了"升级到"何时、何地、是否确定"

三级标注体系

层级标注内容适用任务局限
Level 1 片段级弱标签10 秒内是否出现目标;可多标签预训练、候选筛选、音频分类不知道起止;短事件标签稀释;重叠关系弱
Level 2 事件级强标签类别 + onset/offset + 截断/重叠 + 可闻度连续 SED、告警与事件统计人工成本高;边界存在主观差异
Level 3 空间与状态标签事件标签 + 方位/距离/轨迹 + 工况 + 声压参考SELD、多节点定位、故障诊断需要同步传感器和高质量真值系统

建议的事件级标签字段

字段含义备注
recording_id / channel_set原始连续录音与阵列通道组避免切片后丢失来源关系
class_id / subtype层级类别与子类型类别本体必须版本化
onset / offset事件起止时间(秒或采样点)边界规则应写进标注手册
presence / salience存在性与显著度/可闻度"听不清"不应强行标确定标签
confidence / ambiguity标注员置信度与歧义原因支持软标签、复审和主动学习
overlap_ids同时发生的其他事件多标签,不强迫单类互斥
truncated / clipped是否被片段边界截断或信号削波影响窗长、损失和质检
azimuth/elevation/distance方位、俯仰、距离或位置轨迹仅在真值可信时填写
device/site/time/weather设备、站点、时间和天气关联用于分层评估与域分析
privacy_state人声/隐私检测与脱敏状态原始数据和公开/训练副本分权管理

标注中的五个高风险问题

人机协同标注的现实方案

  1. 预标注:用 YAMNet、PANNs 或内部模型生成候选类别和时间区间;预标注只降低搜索成本,不直接作为真值。
  2. 双人独立标注:关键测试集、低信噪比样本和硬负样本由两名标注员独立判断。
  3. 冲突仲裁:专家查看音频、频谱图、同步视频与工况日志,形成最终标签。
  4. 质量统计:按类别计算一致率、边界偏差、漏标率和仲裁率;标注员表现也要分层监控。
  5. 版本冻结:测试集标签冻结并限制访问;新增知识进入下一版测试集,避免反复调参污染。

六、数据处理与模型训练:哪些处理可以做,哪些会毁掉数据?

推荐的数据处理顺序

阶段处理原则
原始层 Raw保存多通道 PCM、采集元数据、校验和只追加,不覆盖;禁止不可逆降噪后替代原始母带
标准层 Canonical统一容器、通道定义、时间戳和标注坐标重采样/位深转换必须记录参数并可复现
训练层 Training View切窗、归一化、log-Mel、增强、采样策略通过配置生成,不复制失控的多个版本
部署层 Deployment View复刻端侧滤波、量化、窗长和延迟训练/评估必须包含与部署完全一致的视图

数据增强的正确角色

DCASE 的声音事件检测任务长期组合真实弱标签、域内未标注数据与合成强标签声景,说明强弱监督和合成数据可以协同;但合成声景仍需用真实现场数据校准。

重点提示 合成数据的可信度有等级。优先采用"真实隔离目标声 + 真实现场背景 + 实测或仿真的 RIR/多通道 RIR + 受控 SNR 混合"。AudioLDM 等生成模型可以帮助提出候选干扰声或扩展预训练材料,但其类别、物理机理和空间相位不一定可靠,不能直接作为高可信测试集或 DOA/TDOA 真值。

模型路线:先迁移学习,再决定是否做"大模型"

路线适合阶段优点风险
YAMNet / MobileNet 类PoC 和轻量端侧模型小、起步快、AudioSet 通识特征域差和类别粒度有限
PANNs / CNN14 类服务端或较强边缘端迁移表现成熟,可做 embedding 和微调算力/内存高于轻量模型
AST / BEATs 等 Transformer 表征数据较多、复杂多标签长程建模与预训练表征强部署和延迟成本高,需严控域适配
CRNN / Conformer SED连续事件检测兼顾时频局部结构与时间序列强标签和后处理规则决定上限
SELDnet / 空间网络阵列定位 + 检测联合输出类别与 DOA高度依赖阵列一致性和空间真值

七、数据集切分与评估:最容易"骗过自己"的环节

禁止随机按小切片切分

一段 30 分钟连续录音若切成数百个 5 秒片段再随机分配,训练集和测试集会共享同一地点底噪、同一设备频响、同一声源个体,甚至相邻时间帧。模型可能记住背景纹理而非目标声。FSD50K 专门按上传者隔离开发集与评估集;TAU 城市声景数据还显式设置未见设备和未见城市,都是为了检验域泛化。

推荐切分单位 以原始连续录音源、站点、日期、设备、声源个体为 Group。至少保留"未见站点"和"未见设备"测试;对无人机、机械等任务,再保留"未见型号/个体"测试。

离线指标必须与运营指标配对

维度算法指标运营指标
分类/检测macro/micro F1、mAP、PR-AUC、event-based F1、PSDS每设备每天误报数、每 100 小时误报、事件召回率、漏报事件数
时间onset/offset 误差、短事件召回告警延迟、事件合并/重复告警次数
定位角度误差、距离误差、定位召回可用方位比例、跨节点轨迹连续性
鲁棒性按 SNR/距离/天气/设备分层指标最差站点、最差天气和最差设备表现
资源参数量、MACs、实时因子端侧功耗、温度、内存、网络流量、掉帧率

准确率通常不是监测系统的主指标。类别不平衡时,一个"永远预测无事件"的模型也可能获得很高准确率。真正应锁定的是:在可接受误报率下能召回多少真实事件,以及在目标硬件上能否按要求实时运行

对低事件率系统,建议额外报告检测概率—误报/小时曲线、每站点日误报、首次可靠告警延迟,以及 SNR<0 dB、不同距离、风雨和未见设备上的分层召回。PSDS 和事件级 F1 适合算法比较,但不能替代运维指标。所有阈值都应在保留自然事件率的长时测试集上确定。

八、从实验室到现场:部署闭环怎样建立?

端侧不是简单放一个模型文件

回流桶设计

回流桶内容处理方式
高置信误报模型确信但人工判非目标优先形成硬负样本;检查是否类别定义错误
低置信高频接近阈值且大量出现用于阈值校准、主动学习和未知类聚类
疑似漏报视频/人工/其他传感器确认有事件但模型未报补强远距、遮挡、低 SNR 与新型号正样本
设备异常静音、削波、通道错位、时钟漂移进入硬件运维,不应简单标为负样本

影子运行:上线前最重要的一轮数据采集

模型先连续运行但不触发真实业务动作,只记录候选事件、置信度和上下文,由人员复核。影子运行的目的不是再证明离线 F1,而是得到三类过去缺失的数据:真实误报、真实漏报线索和设备故障模式。

九、当前行业仍客观存在的技术短板

短板一:远距离低信噪比不是"再加数据"就能完全解决

当目标声低于麦克风自噪和环境噪声,信息已经不存在。阵列增益、站点布局、风噪控制和多传感器融合与模型同样重要。

短板二:开放集与未知声源

现场永远会出现训练集中没有的声音。闭集 softmax 会被迫把未知声归入某个已知类,需要未知类拒识、置信度校准、嵌入聚类和持续回流。

短板三:设备与季节漂移

麦克风老化、外壳积水/积尘、固件升级、植被和交通季节变化都会造成慢漂移。必须维护固定回归集与设备健康基线。

短板四:重叠声源与声源分离

分离算法可能提升可听度,也可能制造伪影并改变分类特征。检测、分离和定位需要联合评估,不能只听"处理后更干净"。

短板五:空间真值成本高

DOA 和轨迹标注不能只凭人耳估计。移动声源需要同步轨迹或受控几何;多节点 TDOA 还依赖严格授时和站点坐标。

短板六:隐私与可审计性

城市与园区连续音频可能包含可识别人声。端侧特征化、触发式保存、访问分权、保留期限、脱敏和用途限制必须在采集前设计。

十、给算法与产品团队的分阶段落地建议

贯穿三阶段的唯一原则 任何硬件升级、标注加细或模型变大,都必须由真实未见场景和现场运营指标证明有增益。不能用"数据更多了"代替"系统更可用了"

阶段一:可行性验证(0–2 个月)

阶段二:场景扩展(2–6 个月)

阶段三:生产化(6 个月以后)

十一、一套可直接执行的数据采集 SOP

步骤负责人产出物放行条件
1. 任务定义产品 + 算法 + 领域专家类别本体、排除规则、告警指标所有边界案例能归类或标未知
2. 声学勘察声学/硬件频谱、底噪、距离与站点报告确认传感器频带和动态范围
3. 硬件冻结硬件 + 算法设备 BOM、采样/DSP 配置、阵列几何可导出原始数据并完成通道校准
4. 场景设计数据工程 + 领域专家变化矩阵、正负/硬负采集脚本关键因子有覆盖和优先级
5. 小批试采采集团队样例数据、问题清单、更新 SOP模型和标注团队确认可用
6. 批量采集采集团队原始音频、元数据、真值、日志现场自动质检和每日抽检通过
7. 标注质检标注 + 专家强/弱标签、冲突记录、质量报告一致率、漏标率和仲裁率达标
8. 数据冻结数据工程版本清单、Group Split、数据卡无泄漏;许可与隐私状态清楚
9. 模型验证算法 + 边缘工程离线、分层、端侧与现场报告同时满足召回、误报、延迟和资源
10. 影子回流产品 + 运维 + 算法难例池、漂移报告、下一轮采集计划回流样本经过复核与版本控制

十二、数据护城河究竟在哪里?

声音识别项目的护城河通常不在"拥有多少小时音频",而在能否持续获得别人难以复制、且能明确改善现场指标的数据。真正有价值的资产包括:

换句话说,壁垒不是一个静态"声纹库",而是一套不断发现失效边界、获取真值、验证增益并更新系统的工程能力

结语

声音识别监测的数据采集,不是"买一个麦克风、录一堆 WAV、切成几秒钟"这么简单。它是一项由传感器、声学环境、任务本体、强弱标签、数据切分、端侧部署和持续运营共同决定的系统工程。

公开数据让模型先学会听懂世界;目标场景数据让模型听懂你的现场。原始多通道数据保留了重新计算的可能;硬负样本定义了真正的决策边界;按站点和设备隔离的测试集阻止团队被虚高指标欺骗;影子运行与难例回流则把一次性模型变成可持续进化的产品。

最稳妥的落地方式仍然是:从小规模真实闭环开始,以目标硬件上的现场召回、误报和延迟为唯一判定标准,再分阶段扩充场景、硬件与标注精度。先证明每一批数据的价值,再追求规模。

参考资料与延伸阅读

  1. Google Research — AudioSet research.google.com/audioset
  2. Gemmeke et al., Audio Set: An ontology and human-labeled dataset for audio events research.google/pubs/audio-set
  3. FSD50K 官方数据页 fsannotator.upf.edu/fsd/release/FSD50K | Zenodo zenodo.org/records/4060432
  4. ESC-50 官方仓库 github.com/karolpiczak/ESC-50
  5. UrbanSound8K urbansounddataset.weebly.com/urbansound8k
  6. SONYC-UST-V2 论文与数据说明(Adobe Research)
  7. DCASE 2023 Task 4 — 弱标签与合成声景 dcase.community/challenge2023/task-4
  8. DCASE 2025 — 低复杂度声景分类与设备信息 dcase.community/challenge2025
  9. Kong et al., PANNs arxiv.org/abs/1912.10211
  10. TensorFlow — YAMNet 官方教程 tensorflow.org/hub/tutorials/yamnet
  11. Adavanne et al., SELDnet arxiv.org/abs/1807.00129
  12. Seeed Studio — ReSpeaker USB Mic Array 规格 wiki.seeedstudio.com/ReSpeaker-USB-Mic-Array
  13. IEC 60942:2017 — Sound calibrators webstore.iec.ch/en/publication/30045
  14. NVIDIA Jetson Orin Nano Developer Guide docs.nvidia.com/jetson/orin-nano-devkit
  15. RØDE — NTG2 枪式电容麦克风与 WS6 防风罩 rode.com/products/ntg2 | WS6 rode.com/products/ws6
  16. Mydlarz et al., The Life of a New York City Noise Sensor Network(SONYC 实际部署网络) mdpi.com/1424-8220/19/6/1415
  17. Yun et al., Infrastructure-free, Deep Learned Urban Noise Monitoring at Scale(SONYC-L3,107 mW 研究原型) par.nsf.gov/servlets/purl/10394256
  18. NETLINE SonicScan 商业产品页(仅作市场案例) netlinetech.com/sonicscan