AI INSIGHT

小米开源工业级语音识别大模型,过滤干扰精准转录特定人声

AI新闻 太平洋科技 2026-09-13 15:52
AI 摘要

小米开源工业级目标说话人语音识别大模型 CocktailASR-1。它采用基于参考声纹的识别机制,能在多人混合音频中过滤干扰,只转录特定人物语音。其底层是端到端大语言模型,输入为参考与目标音频拼接。在模拟和真实场景测试中表现出色,还具备负样本拒识和思维链推理功能,代码已在 GitHub 开源。技术上,该模型架构创新,权重整合在同一检查点,输入格式独特。这将推动语音识别技术发展,为相

小米开源工业级目标说话人语音识别大模型 CocktailASR-1。它采用基于参考声纹的识别机制,能在多人混合音频中过滤干扰,只转录特定人物语音。其底层是端到端大语言模型,输入为参考与目标音频拼接。在模拟和真实场景测试中表现出色,还具备负样本拒识和思维链推理功能,代码已在 GitHub 开源。

技术上,该模型架构创新,权重整合在同一检查点,输入格式独特。这将推动语音识别技术发展,为相关领域提供新方案,未来有望在更多场景落地应用。

来源:太平洋科技
阅读原文