Skip to content
Hot eventLive

对话幽默中的自动化奖励漏洞与防御措施研究

1 reports1 sources3 hr ago updated

Get the story

AI overview

研究探讨训练语言模型进行对话幽默时的自动化奖励漏洞与防御方法。基于嵌入的惊喜奖励会接受词序打乱的回复;流畅度过滤器可检测但组合奖励仍会误拒幽默回复;观众模型的笑声预测易受提示词攻击,跨说话人归一化可阻断部分攻击但未匹配表达仍可利用。最终强化学习运行使组合评估分数提升0.0903,零分会话减少40%,但幽默专项提升未达预设目标。

Generated from reports · updated 2 hr ago

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Artificial Intelligence
    对话幽默中的自动化奖励漏洞与防御措施研究

    研究探讨了训练语言模型进行对话幽默时的自动化奖励漏洞与防御方法。基于嵌入的惊喜奖励会接受词序打乱的回复,流畅度过滤器可检测但组合奖励仍会误拒幽默回复;观众模型的笑声预测易受提示词攻击,跨说话人归一化可阻断部分攻击但未匹配表达仍可利用。最终强化学习运行使组合评估分数提升0.0903,零分会话减少40%,但幽默专项提升未达预设目标。

Heat trend

There is not enough continuous observation data to draw a trend yet.