arXiv · Computation and Language· Vinko Sabol\v{c}ec, Bettina Messmer, Yassine Turki, Martin Jaggi·· 4 hr agoAI score31
英语质量分类器如何适配多语言 LLM 预训练数据筛选
Adapting English Quality Classifiers for Multilingual LLM Pretraining Data Selection
AI brief
研究提出一种多语言适配方法,把现有英语质量分类器扩展至 100 多种语言:在 Transformer encoder-only 模型嵌入之上训练一个小型多层感知机,以多语言文本为输入、以机器翻译后英语分类器给出的分数为标签。
Source: arXiv · Computation and Language · arxiv.org