arXiv · Artificial Intelligence· Fan Huang, Minsuk Kim, C. Tyler Diggans, Filippo Radicchi·· 2 小时前精选AI 评分62
评估大语言模型生成的偏好分布
Evaluating LLM-Generated Preference Distributions
AI 导读
论文系统分析了 LLM 在航空出行、餐饮和消费品三个领域生成的偏好分布,发现所有模型均表现出自一致性,但模型家族和规模之间分歧明显,且结果更多取决于模型选择而非提示词措辞。
推荐理由
同一提示词下不同模型输出的偏好分布差异显著,提示实际应用中需优先选择并验证模型,而非依赖提示词工程。
来源:arXiv · Artificial Intelligence · arxiv.org