跳到正文

#安全/对齐

今日 83 条
11月12日周二
10月24日周四
  1. Vector Institute25

    Vector Institute 发布多模态数据集 Newsmediabias-plus(NMB+)以支持伦理 AI 系统开发

    Vector Institute 发布了多模态数据集 Newsmediabias-plus(NMB+),包含约 90,000 篇新闻文章,覆盖文本与图像,并附带偏见分类和发布详情。该数据集面向学术研究者、NGO 及社会导向团队,用于检测虚假信息、分析媒体偏见及训练公平性模型。数据集在 Hugging Face 上以非商业许可开放。

9月17日周二
4月8日周一
  1. The Gradient27

    AI 中的性别偏见综述

    summary_zh: AI 模型会反映并放大现实世界中的性别偏见,量化这些偏见是缓解问题的前提。文章梳理了词嵌入中的性别类比偏见(如“男人:程序员 = 女人:家庭主妇”),以及面部识别系统中交叉性别与种族准确率差异(如深肤色女性错误率高达 34.7%)。

10月25日周三
  1. Lilian Weng47

    LLM 对抗攻击综述

    对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。

10月8日周日
  1. The Gradient38

    对齐的人工性

    summary_zh: 文章批评当前 AI“对齐”研究被商业利益主导,认为其核心是打造能付费的产品,而非解决人类灭绝风险。OpenAI 与 Anthropic 等公司虽宣称研究对齐,但营收目标始终影响其治理与技术决策。

7月28日周五
  1. Jeremy Howard · fast.ai38

    AI 的真正风险在于权力集中

    summary_zh: 最新一代大语言模型(如 ChatGPT4、Bard、Bing Chat)引发广泛讨论,但仅靠可解释性和公平性不足以防范 AI 风险。关键在于提供可操作的救济机制和有意义且及时的申诉渠道,并将质疑与异议能力内置到算法系统中,而非作为外部附加项。

5月29日周一
10月13日周三
3月21日周日
  1. Lilian Weng37

    Reducing Toxicity in Language Models

    summary_zh: 大型预训练语言模型在训练过程中会不可避免地从互联网数据中习得毒性行为与偏见,安全部署需要对生成过程进行有效控制。毒性内容涵盖侮辱、仇恨言论、网络欺凌等多种类型,现有分类体系如 OLID 采用三级层次结构区分攻击类型与目标。