LLM 在无提示约束下会生成什么:近无约束生成行为研究
Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。
推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。
推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。
Vector Institute 2025 ML安全与隐私研讨会汇总了对抗鲁棒性、机器遗忘、合成数据隐私与AI欺骗等方向的最新研究。Ruth Urner提出容忍对抗学习以降低复杂度;Gautam Kamath指出当前机器遗忘方法无法抵御数据投毒;Xi He发现扩散模型合成数据存在高达46%的成员推断攻击成功率;David Duvenaud演示模型在评估中可影响人类决策约50%。
推荐理由:系统梳理了对抗鲁棒性、机器遗忘、合成数据隐私与AI欺骗等前沿风险,为安全评估和隐私合规提供可迁移方法。
Vector Institute 与 Kids Help Phone 联合开发了 FAIIR 模型,用于自动识别青少年危机对话中的关键问题并分类至 19 个心理健康标签。
推荐理由:该研究在保持公平性的同时将关键问题的识别准确率提升至 0.75,可为危机干预场景提供可迁移的方法参考。