Компания Xiaomi выпустила и открыла исходный код Xiaomi-CocktailASR-1, модели распознавания речи, разработанной для решения одной из самых сложных задач в аудиотранскрипции: выделения голоса одного человека, когда одновременно говорят несколько человек.
Xiaomi называет это «проблемой коктейльной вечеринки». Большинство моделей распознавания речи хорошо работают, когда говорит только один человек, но ситуация значительно усложняется, когда несколько голосов перекрываются.
Эта задача похожа на ту, которую Xiaomi решала с помощью своей модели преобразования текста в речь OmniVoice, хотя CocktailASR-1 работает в обратном направлении, выделяя и расшифровывая речь, а не генерируя её.
Для использования CocktailASR-1 сначала необходимо предоставить короткий аудиоклип с речью человека, чью речь вы хотите отследить. Модель использует этот клип в качестве голосового эталона, а затем просматривает запись с несколькими говорящими, чтобы идентифицировать и расшифровать речь только этого человека.
Компания Xiaomi разработала CocktailASR-1 на основе сквозной архитектуры LLM. По словам компании, он достиг передовых результатов в нескольких тестах распознавания речи с участием нескольких говорящих, превзойдя существующие подходы, разработанные для той же задачи.
Xiaomi-CocktailASR-1 — это очередная модель искусственного интеллекта, которую Xiaomi открыла для публичного доступа. Она следует за такими релизами, как MiMo-V2-Flash и Xiaomi Robotics-0. Модель уже доступна на GitHub и Hugging Face для разработчиков, которые могут её протестировать и изучить.



