登录
首页 >  科技周边 >  业界新闻

微软开源长音频模型VibeVoice-ASR解析

时间:2026-01-26 08:36:43 113浏览 收藏

小伙伴们有没有觉得学习科技周边很有意思?有意思就对了!今天就给大家带来《微软开源长音频语音模型 VibeVoice-ASR》,以下内容将会涉及到,若是在学习中对其中部分知识点有疑问,或许看了本文就能帮到你!

微软开源了参数量达 90 亿的全新统一语音识别模型 VibeVoice-ASR,该模型专为长时音频理解设计,可一次性处理最长 60 分钟的连续语音流,并在单次推理中直接输出结构化转录结果——包含说话人身份标识、毫秒级精确时间戳及对应文本内容。此外,模型支持用户灵活注入领域专属热词,从而增强对专业术语、专有名词或上下文敏感词汇的识别鲁棒性。

VibeVoice-ASR 的核心能力亮点:

  • 原生支持长达 60 分钟的端到端音频处理:区别于传统自动语音识别(ASR)模型需将长音频切分为数秒级短片段(易造成上下文断裂与说话人混淆),VibeVoice-ASR 原生适配最大长度为 64K token 的音频序列,完整覆盖一小时语音,保障跨时段说话人一致性建模与语义连贯性建模。
  • 可配置热词引导机制:用户可通过简单接口传入自定义热词列表(如企业名称、产品型号、学术概念等),模型在解码阶段动态强化相关词元概率,显著提升垂直场景下的识别精度。
  • 三位一体结构化输出(Who-When-What):模型深度融合语音识别、声纹区分与时间定位能力,同步完成说话人分离、起止时间标注与文本转写,最终生成清晰可解析的「谁 在 何时 说了什么」格式结果。

模型整体架构如下:

微软开源统一语音识别模型 VibeVoice-ASR,专为长音频设计

开源地址

https://huggingface.co/microsoft/VibeVoice-ASR
https://github.com/microsoft/VibeVoice

本篇关于《微软开源长音频模型VibeVoice-ASR解析》的介绍就到此结束啦,但是学无止境,想要了解学习更多关于科技周边的相关知识,请关注golang学习网公众号!

前往漫画官网入口并下载 ➜
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>