← 返回资讯热点
AI热点开源中国发布时间:2026-09-11 09:00热度 124.0000

小米开源工业级目标说话人语音识别大模型 CocktailASR-1,解决鸡尾酒会难题

把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...

来源:开源中国
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。