arXiv · Artificial Intelligence· Sebastian Prasanna, Jacqueline Tay, Alek Westover·· 3 hr agoSelectedAI score64
Distillation for Incrimination and Distillation for Capabilities
Distillation for Incrimination and Distillation for Capabilities
AI brief
论文提出两种蒸馏方法,分别用于揭发错位模型和提取其能力。DFI 将 AuditBench 的保密模型蒸馏到其底层指令微调模型,学生更可能承认隐藏行为,但需共用教师预训练基座;DFC 用 inoculation prompting 和在更少样本上训练更多轮,在保留能力的同时大幅减少动物偏好这一错位代理的潜意识迁移。
Why it matters
论文提出两种蒸馏路径,分别用于暴露错位行为和提取能力,为审计强模型提供新思路。
Source: arXiv · Artificial Intelligence · arxiv.org