Generating Synthetic Data for Mixed Russian-Kazakh Code-Switching Translation
Researchers from MWS AI and several universities developed a method to generate synthetic parallel corpora for translating Russian-Kazakh code-switching (mix of languages). Using SimAlign-based word replacement, they fine-tuned models like NLLB-3.3B, achieving a human-evaluated score of 3.09/5, outperforming commercial systems (2.80-3.49) despite synthetic data limitations.
Meta








