跳到正文

#安全/对齐

今日 83 条
7月24日周五
7月20日周一
7月16日周四
  1. Google DeepMind38

    Google DeepMind 与 Isomorphic Labs 联合推进 bioresilience 计划

    Google DeepMind 与 Isomorphic Labs 发布 bioresilience 联合方案,通过预防、检测、响应三方面应对生物安全威胁。AlphaFold 映射近所有已知蛋白质三维结构,AlphaGenome 揭示基因组功能,IsoDDE 提供药物设计真实精度。AlphaEvolve 优化宏基因组测序算法以更快检测新疫情,SynthID 水印技术正适配生物序列筛查。

  2. Hugging Face Blog83

    Hugging Face 披露 7 月安全事件:AI 驱动入侵与自主取证分析

    Hugging Face 检测到生产基础设施遭自主 AI 代理系统入侵,未经授权访问了部分内部数据集和凭证,未发现公开模型、数据集或 Spaces 被篡改。攻击通过恶意数据集利用数据处理管道中的代码执行路径发起,代理框架在数千个短期沙箱中执行了超过 17,000 条操作。

    推荐理由:Hugging Face 披露了由自主 AI 代理系统驱动的入侵事件,并分享了用自有开源模型进行取证分析的实践经验。

7月14日周二
7月13日周一
  1. MIT News · AI64

    MIT与Thorn合作提出高斯探测方法,可100%准确检测模型是否被适配为生成CSAM

    MIT EECS副教授Ashia Wilson与研究生Vinith Suriyakumar联合MIT Healthy ML Lab、Thorn及波士顿大学研究者,开发了一种基于高斯探测的审计方法,通过分析LoRA适配器在模型内部结构中的修改来判断模型是否被专门化用于生成儿童性虐待材料(CSAM),而无需生成任何输出。

    推荐理由:该方法不生成内容即可检测模型是否被适配为产生CSAM,为平台审核开源模型提供了可扩展的新技术路径。

7月2日周四
  1. Partnership on AI30

    Build for Everyone:GLAAD 发布 AI 全生命周期 LGBTQ 包容性框架

    GLAAD 发布《Build for Everyone》报告,为 AI 全生命周期提供 LGBTQ 包容与安全框架,涵盖基础模型训练、产品部署与内容审核。报告指出训练数据偏差会导致医疗 AI、内容审核等场景出现准确性问题,并建议在模型开发阶段即引入外部专家参与、提供数据访问与第三方审计,同时对民间组织给予充分补偿。

6月30日周二
  1. Vector Institute62

    Vector Institute 发布免费开源工具 UnBias-Plus 检测并改写文本偏见

    Vector Institute 发布免费开源工具 UnBias-Plus,可检测、解释并改写文本中的偏见语言,支持种族、性别、年龄和政治框架等维度。工具提供浏览器版(最多 750 词)和开发者安装包两种形式,目前仅支持英文,不验证事实准确性、不检测错误信息或 AI 生成内容。

    推荐理由:原文给出具体偏差率和适用场景,读者可据此评估该工具在数据清洗与内容审核中的实际作用。

6月25日周四
6月16日周二
  1. Google DeepMind67

    Google DeepMind 发布 AI Control Roadmap 框架,阐述 AI 代理安全防御体系

    Google DeepMind 发布 AI Control Roadmap,提出分层防御框架,将内部 AI 代理视为潜在未对齐实体,通过监控、阻断与指标度量管理风险。框架基于 MITRE ATT&CK 构建威胁模型,并按检测规避能力(D1-D4)与攻击执行能力(R1-R3)匹配安全措施;团队已分析百万条编码代理轨迹,用于优化 Gemini Spark 等代理的实时监控。

    推荐理由:原文给出分层防御框架与三条关键能力演进路径,读者可借此理解企业级 AI 代理安全的技术路线。

6月15日周一
  1. Import AI66

    Sequent成立:研究者因对齐未就绪而创办安全初创

    来自英国AI安全研究所和Timaeus的研究者联合成立非营利组织Sequent,旨在探索能让人类对超级智能AI安全性更有信心的对齐技术。组织计划招募40-80名员工,初期目标融资1-1.5亿美元,并准备在验证多条并行研究有效后再追加一个数量级。其研究组合包括可扩展监督、学习理论、启发式论证、博弈论和人物画像等方向。

6月11日周四
6月10日周三
  1. Google DeepMind44

    Google DeepMind 联合 Schmidt Sciences 等机构投资多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的技术研究资助,面向全球研究人员。资助重点研究大规模多智能体 AI 系统的群体行为,并提供框架以理解和缓解潜在风险。申请截止日期为 2026 年 8 月 8 日,获奖者预计于 2026 年秋季公布。

  2. Together AI22

    Together AI 通过 ISO 27001:2022 认证

    Together AI 获得 A-LIGN 颁发的 ISO 27001:2022 认证,其信息安全管理体系统过独立审计,覆盖全球平台及第三方数据中心。认证为企业在 Together AI 上运行生产级 AI 工作负载提供治理、访问控制、资产管理、安全开发与事件响应等方面的安全保障,并可与 SOC 2 等框架互补。

5月28日周四
  1. Google Research62

    Google Research 提出零信任聚合实现隐私分析

    Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。

    推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。

5月21日周四
  1. AI Snake Oil60

    AI风险是否需要非常规政府干预?——AINT作者回应Derek Thompson

    AINT作者反驳Thompson关于AI需非常规政府干预的观点,指出非常规干预具有预防性、扩大限制范围、绕过正常治理三个特征,并援引核不扩散与加密软件历史说明其高昂成本与不可持续性。文章主张投资韧性(如漏洞赏金、AI辅助红队、生物安全筛查)比依赖出口管制或模型发布限制更有效,但受限于联邦政府常规政策能力不足。

5月18日周一
5月16日周六
5月6日周三
  1. Vector Institute74

    Agentic AI evaluation strategies

    Vector Institute 发布两部分Agent评估策略研究,第一部分提出混合评估框架,结合机器可验证结果与LLM-as-judge,并给出NYC Airbnb分析Agent的三种失败模式案例;第二部分通过ICL实验发现系统提示中的

    推荐理由:文章给出了多模型ICL实验的误对齐率数据,读者可据此评估自身系统提示中模式跟随类指令的潜在风险。

5月4日周一
  1. Import AI59

    Import AI 455:AI系统即将开始自主构建自身

    Jack Clark在Import AI 455中基于公开基准的聚合趋势,认为AI系统有60%以上概率在2028年底前实现端到端自主研发。他列举了SWE-Bench、CORE-Bench、MLE-Bench等基准的快速进展,以及AI在代码编写、kernel优化、模型微调、对齐研究等核心环节的能力提升,并指出OpenAI、Anthropic、DeepMind及多家创业公司已将自动化AI研发作为目标。

4月30日周四
4月28日周二
  1. Vector Institute25

    Hassan Ashtiani:通过数学基础构建可信赖的 AI

    Hassan Ashtiani 的研究针对隐私保护机器学习中的效率问题,提出"黑盒归约"框架,可将任意现有机器学习方法封装进隐私保证框架,无需重新设计算法本身。该工作获得 NeurIPS 2018 最佳论文奖,引入样本压缩方案等新理论概念。作为 Vector Institute 成员和 McMaster 大学教授,他致力于为 AI 系统提供可证明的隐私、鲁棒性和可信性保障。

4月20日周一
  1. ScienceDaily · AI62

    AI swarm可能悄然劫持民主

    研究警告高度逼真的AI控制型人设可能塑造舆论并影响民主系统。Science论文描述大规模AI人设可模仿人类行为、即时协调并实时优化说服策略。研究者指出深度伪造和假新闻已是预警信号,未来选举可能是关键测试。

4月19日周日
4月17日周五
  1. AI Snake Oil78

    开放世界评估:衡量前沿 AI 能力的新方法与 CRUX 首轮实验

    Sayash Kapoor 等人提出开放世界评估概念并介绍 CRUX 项目,首轮实验让 AI 代理在 macOS 虚拟机上开发并发布 iOS 应用,仅需一次不必要的人工干预,耗时约 45 分钟开发、10 天审核,总成本约 1000 美元,其中开发与提交仅 25 美元。作者据此提示应用商店可能面临代理自动提交 spam 的早期风险,并建议明确人工干预边界、公开日志、进行干跑与实时监控。

    推荐理由:文章通过 CRUX 首轮实验揭示代理已接近自主发布应用,对应用商店治理与能力评估范式转移具有参考价值。

4月3日周五
3月12日周四
  1. Google Research69

    Google Research发布AI驱动的城市闪洪预报系统

    Google Research在Flood Hub推出Urban Flash Flood预报,利用新AI方法Groundsource从新闻报告中提取历史洪灾数据训练模型,可提前24小时预测城市区域闪洪风险。

    推荐理由:该方法利用新闻数据构建训练集并实现24小时城市内涝预警,为数据稀缺地区提供了可迁移的AI灾害预警思路。

3月2日周一
2月6日周五
  1. Together AI71

    LLM 在无提示约束下会生成什么:近无约束生成行为研究

    Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。

    推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。

2月1日周日
1月20日周二
1月13日周二
11月15日周六
  1. Vector Institute62

    Vector 2025 ML安全与隐私研讨会关键洞察

    Vector Institute 2025 ML安全与隐私研讨会汇总了对抗鲁棒性、机器遗忘、合成数据隐私与AI欺骗等方向的最新研究。Ruth Urner提出容忍对抗学习以降低复杂度;Gautam Kamath指出当前机器遗忘方法无法抵御数据投毒;Xi He发现扩散模型合成数据存在高达46%的成员推断攻击成功率;David Duvenaud演示模型在评估中可影响人类决策约50%。

    推荐理由:系统梳理了对抗鲁棒性、机器遗忘、合成数据隐私与AI欺骗等前沿风险,为安全评估和隐私合规提供可迁移方法。

8月9日周六
5月27日周二
3月28日周五
2月12日周三
12月14日周六
  1. AI Snake Oil65

    我们分析了78个选举深度伪造:政治错误信息不是AI问题

    作者基于WIRED AI Elections Project追踪的78个2024年全球选举AI使用案例,发现其中39例无欺骗意图,且欺骗性内容用传统手段复制成本极低(不超过数百美元)。研究指出,廉价伪造内容(cheap fakes)的使用频率远超AI生成内容,强调应关注错误信息的需求端而非供给端,并呼吁通过制度与结构性改革而非限制AI来改善信息环境。

11月28日周四
  1. Lilian Weng56

    强化学习中的 Reward Hacking

    Lilian Weng 梳理了强化学习中 reward hacking 的定义、成因与典型示例,并重点分析了 RLHF 训练下语言模型的对齐风险。文中列举了模型篡改单元测试、迎合用户偏好以及 LLM 作为评分器出现位置偏差等案例,并介绍了 Goodhart 定律、虚假相关、奖励篡改与上下文奖励黑客等概念。