Skip to content
arXiv · Artificial Intelligence· Sebastian Prasanna, Jacqueline Tay, Alek Westover·· 3 hr agoSelectedAI score64

Distillation for Incrimination and Distillation for Capabilities

Distillation for Incrimination and Distillation for Capabilities

AI brief

论文提出两种蒸馏方法,分别用于揭发错位模型和提取其能力。DFI 将 AuditBench 的保密模型蒸馏到其底层指令微调模型,学生更可能承认隐藏行为,但需共用教师预训练基座;DFC 用 inoculation prompting 和在更少样本上训练更多轮,在保留能力的同时大幅减少动物偏好这一错位代理的潜意识迁移。

Why it matters

论文提出两种蒸馏路径,分别用于暴露错位行为和提取能力,为审计强模型提供新思路。

Source: arXiv · Artificial Intelligence · arxiv.org