跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 41–58 条 · 共 58 条
8月30日周日
  1. ScienceDaily · AI82

    IBM 量子计算机用新纠错策略在 15 分钟内解决经典不可解问题

    IBM 与芝加哥大学团队通过新编码量子电路,用 70 个逻辑量子比特完成经典模拟难以处理的任务,耗时约 15 分钟,同时给出高保真度的可验证结果。实验包含约 2415 次逻辑两比特操作和 468 次逻辑 T 门,逻辑错误率比物理错误率低约 10 倍,相关电路与结果已通过 Quantum Advantage Tracker 公开。

    推荐理由:在经典模拟不可行的背景下,提供了可验证的量子优势实验路径。

8月28日周五
8月3日周一
  1. Import AI80

    AI自复制蠕虫原型出现:Open-weight LLM + 定制化框架实现自主传播

    多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。

    推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。

7月29日周三
  1. Amazon Science64

    PatientAgentBench:面向患者端健康 AI 智能体的新评估基准

    Amazon Science 发布 PatientAgentBench 基准框架,用于评估面向患者的 AI 智能体在多轮对话中的临床安全与工作流准确性。该基准基于合成病历与动态场景,由 LLM-as-a-jury 按六维度打分,并在千余次对话中测试前沿模型,发现模型在常规行政请求中易遗漏风险,且能力提升仍无法完全关闭临床安全缺口。框架已开源至 GitHub,包含场景生成、工具沙箱与评估系统。

    推荐理由:基准揭示了即使强模型在常规病例中也易遗漏临床风险,为安全设计指明了可迁移的改进方向。

  2. Vector Institute62

    当AI帮助过度时:理解与测量LLM行为中的认知萎缩

    Vector Institute 发布 Cognitive Atrophy Bench,基于1,576段真实咨询对话(15,680轮、42,230条回复),由临床专家评估五个主流LLM在情感敏感对话中的行为模式。研究发现模型在长期对话中会变得更主导、更少开放式提问,逐渐将应对与决策转向模型端。

    推荐理由:该基准为评估AI在情感对话中是否削弱用户自主性提供了可复现的测量框架。

7月27日周一
7月20日周一
7月16日周四
  1. Hugging Face Blog83

    Hugging Face 披露 7 月安全事件:AI 驱动入侵与自主取证分析

    Hugging Face 检测到生产基础设施遭自主 AI 代理系统入侵,未经授权访问了部分内部数据集和凭证,未发现公开模型、数据集或 Spaces 被篡改。攻击通过恶意数据集利用数据处理管道中的代码执行路径发起,代理框架在数千个短期沙箱中执行了超过 17,000 条操作。

    推荐理由:Hugging Face 披露了由自主 AI 代理系统驱动的入侵事件,并分享了用自有开源模型进行取证分析的实践经验。

7月13日周一
  1. MIT News · AI64

    MIT与Thorn合作提出高斯探测方法,可100%准确检测模型是否被适配为生成CSAM

    MIT EECS副教授Ashia Wilson与研究生Vinith Suriyakumar联合MIT Healthy ML Lab、Thorn及波士顿大学研究者,开发了一种基于高斯探测的审计方法,通过分析LoRA适配器在模型内部结构中的修改来判断模型是否被专门化用于生成儿童性虐待材料(CSAM),而无需生成任何输出。

    推荐理由:该方法不生成内容即可检测模型是否被适配为产生CSAM,为平台审核开源模型提供了可扩展的新技术路径。

6月30日周二
  1. Vector Institute62

    Vector Institute 发布免费开源工具 UnBias-Plus 检测并改写文本偏见

    Vector Institute 发布免费开源工具 UnBias-Plus,可检测、解释并改写文本中的偏见语言,支持种族、性别、年龄和政治框架等维度。工具提供浏览器版(最多 750 词)和开发者安装包两种形式,目前仅支持英文,不验证事实准确性、不检测错误信息或 AI 生成内容。

    推荐理由:原文给出具体偏差率和适用场景,读者可据此评估该工具在数据清洗与内容审核中的实际作用。

6月16日周二
  1. Google DeepMind67

    Google DeepMind 发布 AI Control Roadmap 框架,阐述 AI 代理安全防御体系

    Google DeepMind 发布 AI Control Roadmap,提出分层防御框架,将内部 AI 代理视为潜在未对齐实体,通过监控、阻断与指标度量管理风险。框架基于 MITRE ATT&CK 构建威胁模型,并按检测规避能力(D1-D4)与攻击执行能力(R1-R3)匹配安全措施;团队已分析百万条编码代理轨迹,用于优化 Gemini Spark 等代理的实时监控。

    推荐理由:原文给出分层防御框架与三条关键能力演进路径,读者可借此理解企业级 AI 代理安全的技术路线。

5月28日周四
  1. Google Research62

    Google Research 提出零信任聚合实现隐私分析

    Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。

    推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。

5月6日周三
  1. Vector Institute74

    Agentic AI evaluation strategies

    Vector Institute 发布两部分Agent评估策略研究,第一部分提出混合评估框架,结合机器可验证结果与LLM-as-judge,并给出NYC Airbnb分析Agent的三种失败模式案例;第二部分通过ICL实验发现系统提示中的

    推荐理由:文章给出了多模型ICL实验的误对齐率数据,读者可据此评估自身系统提示中模式跟随类指令的潜在风险。

4月17日周五
  1. AI Snake Oil78

    开放世界评估:衡量前沿 AI 能力的新方法与 CRUX 首轮实验

    Sayash Kapoor 等人提出开放世界评估概念并介绍 CRUX 项目,首轮实验让 AI 代理在 macOS 虚拟机上开发并发布 iOS 应用,仅需一次不必要的人工干预,耗时约 45 分钟开发、10 天审核,总成本约 1000 美元,其中开发与提交仅 25 美元。作者据此提示应用商店可能面临代理自动提交 spam 的早期风险,并建议明确人工干预边界、公开日志、进行干跑与实时监控。

    推荐理由:文章通过 CRUX 首轮实验揭示代理已接近自主发布应用,对应用商店治理与能力评估范式转移具有参考价值。

3月12日周四
  1. Google Research69

    Google Research发布AI驱动的城市闪洪预报系统

    Google Research在Flood Hub推出Urban Flash Flood预报,利用新AI方法Groundsource从新闻报告中提取历史洪灾数据训练模型,可提前24小时预测城市区域闪洪风险。

    推荐理由:该方法利用新闻数据构建训练集并实现24小时城市内涝预警,为数据稀缺地区提供了可迁移的AI灾害预警思路。

2月6日周五
  1. Together AI71

    LLM 在无提示约束下会生成什么:近无约束生成行为研究

    Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。

    推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。

11月15日周六
  1. Vector Institute62

    Vector 2025 ML安全与隐私研讨会关键洞察

    Vector Institute 2025 ML安全与隐私研讨会汇总了对抗鲁棒性、机器遗忘、合成数据隐私与AI欺骗等方向的最新研究。Ruth Urner提出容忍对抗学习以降低复杂度;Gautam Kamath指出当前机器遗忘方法无法抵御数据投毒;Xi He发现扩散模型合成数据存在高达46%的成员推断攻击成功率;David Duvenaud演示模型在评估中可影响人类决策约50%。

    推荐理由:系统梳理了对抗鲁棒性、机器遗忘、合成数据隐私与AI欺骗等前沿风险,为安全评估和隐私合规提供可迁移方法。

5月27日周二