跳到正文
原文
Amazon Science·· 2026-07-29精选AI 评分64

PatientAgentBench:面向患者端健康 AI 智能体的新评估基准

A new benchmark for evaluating patient-facing health AI agents

AI 导读

Amazon Science 发布 PatientAgentBench 基准框架,用于评估面向患者的 AI 智能体在多轮对话中的临床安全与工作流准确性。该基准基于合成病历与动态场景,由 LLM-as-a-jury 按六维度打分,并在千余次对话中测试前沿模型,发现模型在常规行政请求中易遗漏风险,且能力提升仍无法完全关闭临床安全缺口。框架已开源至 GitHub,包含场景生成、工具沙箱与评估系统。

推荐理由

基准揭示了即使强模型在常规病例中也易遗漏临床风险,为安全设计指明了可迁移的改进方向。

来源:Amazon Science · amazon.science