【CNMO科技动静】9月11日,小米正式发布并开源工业级方针措辞人语音辨认年夜模子Xiaomi-CocktailASR-1。CNMO科技从@小米技能 官微获悉,该模子面向多人同时措辞的繁杂语音场景,重点解决语音辨认中的“鸡尾酒会”难题,即于嘈杂情况下从多名措辞者中辨认并转录指定方针用户的语音内容。
小米
据先容,Xiaomi-CocktailASR-1采用端到端LLM架构,利用方针措辞人的一段参考音频作为声纹提醒,于多人堆叠讲话的环境下,可提取并仅转录方针措辞人的内容。官方暗示,该模子基在年夜范围多措辞人数据练习,于AliMeeting、AMI、LibriMix等多个主流多措辞人测试集上到达最优机能。与此同时,其于单措辞人场景下的辨认体现也可与主流单人ASR模子相媲美,可以或许经由过程统一模子统筹单人与多人场景,无需于差别语音辨认模子之间切换。

除了方针措辞人辨认外,该模子还有具有负样本拒识能力。对于在音频中不存于方针措辞人的环境,模子可输出空文本,以降低非方针语音带来的误辨认及误触发危害。小米同时提到,Xiaomi-CocktailASR-1撑持思维链推理模式,可为辨认成果提供具有可注释性的推理历程。
今朝,Xiaomi-CocktailASR-1的模子权重与推理代码已经经开源。
版权所有,未经许可不患上转载
-U8国际官网