跳到正文
原文
arXiv · Artificial Intelligence· Fan Huang, Minsuk Kim, C. Tyler Diggans, Filippo Radicchi·· 2 小时前精选AI 评分62

评估大语言模型生成的偏好分布

Evaluating LLM-Generated Preference Distributions

AI 导读

论文系统分析了 LLM 在航空出行、餐饮和消费品三个领域生成的偏好分布,发现所有模型均表现出自一致性,但模型家族和规模之间分歧明显,且结果更多取决于模型选择而非提示词措辞。

推荐理由

同一提示词下不同模型输出的偏好分布差异显著,提示实际应用中需优先选择并验证模型,而非依赖提示词工程。

来源:arXiv · Artificial Intelligence · arxiv.org