热点事件持续更新
MoE路由logits用于VLM生成前安全检测
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月7日,arXiv Computation and Language 发表一手研究,提出一种轻量级 router-logit 安全检测器。该方法在 prompt prefill 阶段读取 MoE 视觉语言模型的路由信号,在生成前识别不安全请求,不修改模型参数或专家路由。研究称该检测器在 Qwen3-VL 和 Kimi-VL 上显著降低 HoliSafe 基准的安全错误,并泛化至 MISHard 和 MM-SafetyBench 等分布外安全基准。目前未见与早先报道矛盾之处,也无后续独立验证报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
新研究提出在prefill阶段读取MoE路由logits,生成前检测不安全请求。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Computation and Language阅读而非操控:利用 MoE 视觉语言模型中的 Router Logits 提升多模态安全性
研究提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取路由信号,在生成前识别不安全请求,不修改模型参数或专家路由。该检测器在 Qwen3-VL 和 Kimi-VL 上显著降低 HoliSafe 基准的安全错误,并泛化至 MISHard 和 MM-SafetyBench 等分布外安全基准。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。