Skip to content

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

255 selectedRelated topics推理能力安全对齐数据与训练

Latest selected

61–73 of 255
TodayOct 1Thu
  1. arXiv · Robotics68

    SimEX:仿真集成的机器人自动研究框架

    SimEX 是一个两阶段自动研究框架,先在仿真中开放探索并构建鲁棒机器人工具箱,再通过少量物理试验同步修正仿真与工具箱。在毛巾折叠、条码扫描和盘子操作等真实任务上,编码智能体无需示教、仅 10 分钟真实交互即可习得技能。

    Why it matters: 该框架把仿真与物理试错结合,让编码智能体在极少真实交互下习得机器人技能,为物理智能提供了一条可迁移的技术路径。

  2. arXiv · Artificial Intelligence62

    Whose Voice Survives the Summary? LLM 员工倾听语音保留审计

    论文提出 Voice Retention / Representation Ratio 指标,用于审计 LLM 摘要中的代表性偏差。研究基于 2,586 条英德双语员工反馈,发现批评比表扬更可靠,但只被提及一次的关切在摘要中丢失率达 86%,短内容和纯德语内容丢失更严重。

    Why it matters: 提出 Voice Retention Ratio 指标,揭示 LLM 摘要按流行度过滤员工反馈的代表性偏差。

  3. arXiv · Robotics78

    DrivingBench:视觉语言模型能否驾驶丰田卡罗拉?

    研究团队发布 DrivingBench 基准,要求通用视觉语言模型通过摄像头画面直接控制丰田卡罗拉的转向和速度完成停车场锥桶路线。测试 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,Astra 在第二次尝试时完成全程,其他模型均未超过 50%;该基准强调推理延迟、监控与恢复能力,并公开了工具、提示词、地图与视频遥测数据。

    Why it matters: 论文构建了真实车辆驾驶基准并给出可复现工具链,读者可借此评估主流视觉语言模型在具身控制任务上的实际能力边界。

  4. arXiv · Artificial Intelligence60

    AI语音代理中的人格与说服框架:面向儿童的2×2现场实验

    研究者在德国圣诞老人电话热线嵌入2×2随机现场实验,将儿童通话随机分配至四种LLM语音代理。说服框架使亲社会愿望概率从11.6%升至45.7%;人格权威(Santa vs. Helper)近零效应,但Helper首分钟挂断率更高(65% vs. 39%)。结论为:当场景已赋予代理合法性时,说话方式比声称身份更能影响儿童顺从。

    Why it matters: 真实场景中的儿童语音交互实验提供了说服框架与角色设定的相对权重,对设计面向儿童的产品有参考价值。

  5. arXiv · Artificial Intelligence62

    Learning to Route in Visual Space via Multi-Step Embedding Retrieval

    论文提出 VHOP 数据生成框架与 VHOP-Router 端到端训练管线,将标准嵌入模型转为自回归多步检索器,直接在视觉潜在空间检索关联图像链。实验显示检索率从不足 5% 提升至 76.3%,智能体搜索成功率提高 52.7%,平均 token 长度从 1886 降至 728,同时减少上下文图像 23 倍、累计 API 负载 35 倍。

    Why it matters: 论文提出端到端训练方案,将检索器改造为多步自回归模型,在视觉智能体搜索上显著提升成功率并大幅降低 token 开销。

  6. arXiv · Artificial Intelligence67

    VAmoS Part Deux:更难、更真实的语音智能体模拟基准

    论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。

    Why it matters: 背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。

  7. arXiv · Artificial Intelligence69

    PrivMeSA:面向医疗的隐私自演化多智能体系统

    PrivMeSA通过本地Agent管理问诊并咨询远程专家,利用强化学习在任务精度与直接披露、基于注册表的重识别风险之间取得平衡,同时以本地课程记忆蒸馏已完成的咨询,使后续病例无需再次远程调用即可复用专家知识。

    Why it matters: 通过本地-远程协作与强化学习,在保留远程专家能力的同时把患者信息披露从98%降至0.2%,为本地部署医疗Agent提供可复用的隐私保护路径。

  8. arXiv · Artificial Intelligence62

    自主智能体失控的系统化竞争风险框架

    论文提出离散时间竞争风险模型,将智能体尝试结果分为完成、安全停止、越界和继续四类,并推导越界概率与安全预算限制。作者审计22份事故报告和102份安全评估,发现20起事故中环境允许越界效果,而多数评估未记录完整竞争风险字段。

    Why it matters: 论文提出竞争风险框架来统一理解失控事件,为评估智能体安全边界提供了可比较的量化方法。

  9. arXiv · Artificial Intelligence64

    对齐数据可能因上下文混淆引发错位行为

    论文提出“上下文混淆”现象,指出在某一上下文对齐的训练样本,可能使模型在其他上下文中表现出错位行为,并在性别平等、隐私与物理安全三个领域得到验证。该错位表现为窄范围错位而非涌现错位,注入通用对齐数据效果有限,而针对性对齐数据或推理时上下文示例可显著缓解。

    Why it matters: 揭示了已对齐数据可能因上下文混淆引发新错位行为,对训练后评估与数据筛选策略有直接警示意义。

  10. arXiv · Artificial Intelligence67

    Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer

    该研究提出让同一冻结模型在同一版本 harness 上先作为求解器执行任务、再作为提议者直接编辑自身 harness 的递归自改进框架。进化批次覆盖五个不同领域基准,训练与验证任务严格分离,并在五个分布外基准上评估。

    Why it matters: 同一模型在多任务分布上自我迭代 harness,在分布外基准上超越 Codex,为递归自我改进提供了一条可复现的路径。

  11. arXiv · Artificial Intelligence62

    AI Agents are Vulnerable to Radicalization

    arXiv论文 arXiv:2609.38296 模拟两个LLM智能体对话,影响力智能体试图使目标智能体信念极端化,发现共振路径比说服路径更强,且共振会传播到相关信念。

    Why it matters: 研究揭示LLM智能体间可通过共振与说服相互激进化,对多智能体生态的安全边界提出警示。