Skip to content
arXiv · Artificial Intelligence· Fan Huang, Minsuk Kim, C. Tyler Diggans, Filippo Radicchi·· 3 hr agoSelectedAI score62

评估大语言模型生成的偏好分布

Evaluating LLM-Generated Preference Distributions

AI brief

论文系统分析了 LLM 在航空出行、餐饮和消费品三个领域生成的偏好分布,发现所有模型均表现出自一致性,但模型家族和规模之间分歧明显,且结果更多取决于模型选择而非提示词措辞。

Why it matters

同一提示词下不同模型输出的偏好分布差异显著,提示实际应用中需优先选择并验证模型,而非依赖提示词工程。

Source: arXiv · Artificial Intelligence · arxiv.org