Skip to content

#多模态

4 today
TodayOct 1Thu
  1. arXiv · Computation and Language60

    KlinikeBench:超越诊断准确率的大语言模型临床评估基准

    arXiv 论文提出 KlinikeBench,包含 333 个由临床医生撰写的任务,在隔离沙盒中评估大语言模型与虚拟患者的交互式临床接诊能力。31 个模型和 7 个模型家族的实验显示,表现最好的模型(如 GPT-6-astra 和 Claude Opus 5)在任务成功率低于 30%,尽管其诊断准确率达 90.7%。基准揭示诊断准确率与交互式临床评估之间存在显著差距。

    Why it matters: 原文揭示了诊断准确率与交互式临床评估之间的显著差距,为理解大语言模型在真实医患对话中的实际边界提供了新测试平台。

  2. arXiv · Artificial Intelligence60

    AI语音代理中的人格与说服框架:面向儿童的2×2现场实验

    研究者在德国圣诞老人电话热线嵌入2×2随机现场实验,将儿童通话随机分配至四种LLM语音代理。说服框架使亲社会愿望概率从11.6%升至45.7%;人格权威(Santa vs. Helper)近零效应,但Helper首分钟挂断率更高(65% vs. 39%)。结论为:当场景已赋予代理合法性时,说话方式比声称身份更能影响儿童顺从。

    Why it matters: 真实场景中的儿童语音交互实验提供了说服框架与角色设定的相对权重,对设计面向儿童的产品有参考价值。

  3. arXiv · Artificial Intelligence62

    Learning to Route in Visual Space via Multi-Step Embedding Retrieval

    论文提出 VHOP 数据生成框架与 VHOP-Router 端到端训练管线,将标准嵌入模型转为自回归多步检索器,直接在视觉潜在空间检索关联图像链。实验显示检索率从不足 5% 提升至 76.3%,智能体搜索成功率提高 52.7%,平均 token 长度从 1886 降至 728,同时减少上下文图像 23 倍、累计 API 负载 35 倍。

    Why it matters: 论文提出端到端训练方案,将检索器改造为多步自回归模型,在视觉智能体搜索上显著提升成功率并大幅降低 token 开销。