首页 > 科技周边 > 人工智能

智源南开联合发布低幼儿中文语音数据集

时间：2025-04-21 17:45:39 364浏览收藏

智源研究院与南开大学联合发布了ChildMandarin，一个针对3-5岁儿童普通话语音的大型数据集。该数据集包含来自22个省份397名儿童的41.25小时高质量语音数据，旨在推动儿童语音识别、语言发展研究和智能语音交互系统的发展。ChildMandarin数据采集模拟真实对话场景，并进行专业标注，涵盖发音、停顿等语言现象及元数据信息。其应用涵盖儿童语音识别、说话人识别、儿童语言发展研究等领域，并可用于开发儿童语言学习应用、互动教育平台、智能玩具和儿童语音助手等。数据集已公开发布在GitHub和Hugging Face平台，相关论文也已发表。

ChildMandarin：专为3-5岁儿童打造的普通话语音数据集

智源研究院与南开大学计算机学院人类语言技术实验室（HLT Lab）联合推出ChildMandarin，这是一个针对3-5岁儿童普通话语音的大型数据集。它包含来自中国22个省份的397名儿童的41.25小时高质量语音数据，数据采集过程模拟真实自然对话场景，确保数据真实可靠，并平衡了性别分布。ChildMandarin的发布填补了低幼儿童语音数据领域的空白，将有力推动儿童语音识别、语言发展研究以及智能语音交互系统的发展。

ChildMandarin— 智源联合南开开源的低幼儿童中文语音数据集

ChildMandarin的核心应用：

提升儿童语音识别技术： ChildMandarin为自动语音识别 (ASR) 模型提供海量训练数据，显著提升模型对3-5岁儿童语音的识别准确率和鲁棒性。
儿童说话人识别： 该数据集支持说话人验证 (SV) 任务，有助于开发能够准确识别和区分不同儿童声音的系统，应用于儿童身份认证等场景。
儿童语言发展研究： ChildMandarin为儿童语言学研究提供宝贵的数据资源，有助于开发更有效的儿童语言学习工具和互动教育系统。

ChildMandarin的技术细节：

数据采集采用家长引导式对话，模拟自然交流，并使用智能手机（Android和iOS）进行录音，确保16kHz采样率和16位精度的高质量音频。专业人员对数据进行人工标注，包括发音、停顿、重复等语言现象，并记录说话人的年龄、性别、籍贯、录音设备和口音等级等元数据。模型训练和评估采用多种先进的ASR模型（如Transformer、Conformer、Paraformer）和技术（如CTC、AED、RNN-T），并对预训练模型（如HuBERT、Whisper）进行微调。说话人验证则采用说话人嵌入提取模型（如x-vector、ECAPA-TDNN、ResNet-TDNN）。数据集被划分为训练集、验证集和测试集，确保模型评估的科学性和有效性。

获取ChildMandarin：

GitHub: http://github.com/flageval-baai/ChildMandarin
Hugging Face: http://huggingface.co/datasets/BAAI/ChildMandarin
论文: http://arxiv.org/pdf/2409.18584

ChildMandarin的应用前景：

ChildMandarin的应用范围广泛，包括：

儿童语言学习应用: 开发智能语音辅助学习工具，提升儿童语言能力。
互动教育平台: 为儿童教育软件和互动学习平台提供更自然的语音交互功能。
智能玩具: 提升智能玩具的语音识别能力，增强互动体验。
儿童语音助手: 优化语音助手对儿童语音的识别和响应。
儿童语言发展监测: 辅助监测儿童语言发展和健康状况，支持早期干预。

今天关于《智源南开联合发布低幼儿中文语音数据集》的内容介绍就到此结束，如果有什么疑问或者建议，可以在golang学习网公众号下多多回复交流；文中若有不正之处，也希望回复留言以告知！