英国肝移植匹配算法是否系统性排除年轻患者?
Arvind Narayanan 等指出英国 2018 年启用的肝移植分配算法以 5 年生存率为目标变量,导致年轻患者净收益被低估、优先级偏低。2024 年 The Lancet 研究确认该算法对年轻患者存在严重偏见,且后移植生存模型几乎不起作用、算法主要在评估需求。
Arvind Narayanan 等指出英国 2018 年启用的肝移植分配算法以 5 年生存率为目标变量,导致年轻患者净收益被低估、优先级偏低。2024 年 The Lancet 研究确认该算法对年轻患者存在严重偏见,且后移植生存模型几乎不起作用、算法主要在评估需求。
Vector Institute 发布了多模态数据集 Newsmediabias-plus(NMB+),包含约 90,000 篇新闻文章,覆盖文本与图像,并附带偏见分类和发布详情。该数据集面向学术研究者、NGO 及社会导向团队,用于检测虚假信息、分析媒体偏见及训练公平性模型。数据集在 Hugging Face 上以非商业许可开放。
summary_zh: Vector Institute 举办第二届机器学习安全与隐私研讨会,汇聚 Faculty Members、Faculty Affiliates、Postdoctoral Fellows 及 wider Vector research community 研究人员,围绕 ML 安全与隐私的创新、趋势、工具及研究成果展开讨论。
summary_zh: AI 模型会反映并放大现实世界中的性别偏见,量化这些偏见是缓解问题的前提。文章梳理了词嵌入中的性别类比偏见(如“男人:程序员 = 女人:家庭主妇”),以及面部识别系统中交叉性别与种族准确率差异(如深肤色女性错误率高达 34.7%)。
对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。
summary_zh: 文章批评当前 AI“对齐”研究被商业利益主导,认为其核心是打造能付费的产品,而非解决人类灭绝风险。OpenAI 与 Anthropic 等公司虽宣称研究对齐,但营收目标始终影响其治理与技术决策。
summary_zh: 最新一代大语言模型(如 ChatGPT4、Bard、Bing Chat)引发广泛讨论,但仅靠可解释性和公平性不足以防范 AI 风险。关键在于提供可操作的救济机制和有意义且及时的申诉渠道,并将质疑与异议能力内置到算法系统中,而非作为外部附加项。
summary_zh: fast.ai与哲学家Seth Lazar、AI研究员Arvind Narayanan合作发文,质疑"AI灭绝风险应列为全球优先事项"的声明。
斯坦福 AI Lab 研究发现,选择性分类虽能提升平均准确率,但可能对某些子群体无效甚至有害。以胸片诊断胸腔积液为例,模型依赖胸腔引流管这一虚假相关信号,导致对尚未治疗的关键子群体识别不准。
summary_zh: 大型预训练语言模型在训练过程中会不可避免地从互联网数据中习得毒性行为与偏见,安全部署需要对生成过程进行有效控制。毒性内容涵盖侮辱、仇恨言论、网络欺凌等多种类型,现有分类体系如 OLID 采用三级层次结构区分攻击类型与目标。