Meta近日开源了其多语言语音翻译模型MMS(Massively Multilingual Speech),该模型支持超过1100种语言的语音识别、文本转语音和语言识别,覆盖全球约10亿人口。MMS基于自监督学习,利用未标注的音频数据训练,显著降低了数据标注成本。
与现有技术相比,MMS在低资源语言上的表现尤为突出,错误率平均降低50%以上。Meta表示,该模型将助力保护语言多样性,并推动语音技术在偏远地区的应用。目前,MMS已在GitHub开源,提供预训练模型和推理代码。
Meta近日开源了其多语言语音翻译模型MMS(Massively Multilingual Speech),该模型支持超过1100种语言的语音识别、文本转语音和语言识别,覆盖全球约10亿人口。MMS基于自监督学习,利用未标注的音频数据训练,显著降低了数据标注成本。
与现有技术相比,MMS在低资源语言上的表现尤为突出,错误率平均降低50%以上。Meta表示,该模型将助力保护语言多样性,并推动语音技术在偏远地区的应用。目前,MMS已在GitHub开源,提供预训练模型和推理代码。