小米开源工业级目标说话人语音识别大模型 CocktailASR-1

在嘈杂的人群中精准锁定并听清某个人的声音,人类的听觉系统能够轻而易举地做到这一点,但对于传统的自动语音识别(ASR)模型来说,多人同时讲话的“鸡尾酒会难题”却长期是一个未被彻底攻克的行业痛点。为了解决这一长期困扰业界的难题,小米近日正式开源…