跳到正文
原文
arXiv · Computer Vision· Ruochen Zhang, Yao Huang, Yitong Sun, Jiahe Xie, Jin Yan, Jifan Ma, Yuanfang Guo, Xingxing Wei·· 6 小时前AI 评分34

ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式风险

ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

AI 导读

ThinkingGuard 是针对多模态大语言模型隐式风险检测的训练框架,结合 Step-Supervised Structured Reasoning 与 step-reward Monte Carlo Tree Search 探索推理轨迹,并通过 Dual-Constraint Preference Alignment 蒸馏到模型中。

来源:arXiv · Computer Vision · arxiv.org