小米技术团队近日宣布,一款名为Xiaomi-CocktailASR-1的工业级目标说话人语音识别大模型正式发布,并同步开源。该模型聚焦于破解语音识别领域长期存在的“鸡尾酒会”难题——当多人同时说话时,传统技术难以精准分离并识别特定目标说话人的语音内容。
据介绍,Xiaomi-CocktailASR-1采用端到端大语言模型(LLM)架构,通过引入目标说话人的参考音频作为声纹特征,可在复杂声学环境中精准定位并转录特定用户语音。实验数据显示,该模型在多个国际主流多说话人测试集上均达到当前最优水平(SOTA),识别准确率较现有方案提升显著,尤其在嘈杂场景下表现突出。
技术团队强调,该模型不仅具备多说话人场景下的精准识别能力,其单人语音识别性能亦可媲美传统标准语音识别(ASR)模型。更值得关注的是,模型内置了抗干扰机制——当目标说话人未发声时,系统会自动输出空文本,避免因环境噪音或其他说话人语音导致误触发。通过引入思维链推理模式,模型还能为识别结果提供可追溯的逻辑推导过程,增强结果的可解释性。
开源社区对这一成果表示期待。行业分析师指出,Xiaomi-CocktailASR-1的发布或将推动语音交互技术在会议记录、智能客服、车载语音等场景的落地应用,其开源特性也将为相关领域研究提供重要参考。










