Language Discrimination Improves Linguistic Learning in Multilingual Speech Models
Language Discrimination Improves Linguistic Learning in Multilingual Speech Models
Multilingual self-supervised speech models can benefit from sharing information across languages, but under a matched total pretraining data budget they still fall short of monolingual models. We show that strengthening the model’s ability to discriminate languages during pretraining reduces and, on some measures, closes this multilingual gap on continuous phonetic and higher-level linguistic measures, while preserving substantial cross-language sharing. Using a controlled English/French HuBERT setting, we test two interventions which strengthen language discrimination: an auxiliary language…
当前提供采集摘要与原文入口。完整内容请阅读原文。
来源:Apple Machine Learning Research · machinelearning.apple.com