跳到正文
原文
Lilian Weng·· 2021-03-21AI 评分37

Reducing Toxicity in Language Models

Reducing Toxicity in Language Models

AI 导读

summary_zh: 大型预训练语言模型在训练过程中会不可避免地从互联网数据中习得毒性行为与偏见,安全部署需要对生成过程进行有效控制。毒性内容涵盖侮辱、仇恨言论、网络欺凌等多种类型,现有分类体系如 OLID 采用三级层次结构区分攻击类型与目标。

来源:Lilian Weng · lilianweng.github.io