Skip to content

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

255 selectedRelated topics推理能力安全对齐数据与训练

Latest selected

41–60 of 255
TodayOct 1Thu
  1. arXiv · Computation and Language73

    BACKDROP基准揭示智能体在真实干扰环境中的能力衰减

    论文提出BACKDROP基准,在智能体执行任务时逐一或组合植入权威覆盖、注入、重域和故障恢复四类日常干扰。在3678个变体、16个模型上,四类干扰同时存在时平均通过率从69.5%降至31.3%,最强模型Claude Fable 5.1从96.6%降至56.0%;智能体对注入文本有抵抗力,但46.4%的运行仍会遵循他人消息。

    Why it matters: 研究揭示干净环境中训练的智能体在真实干扰下能力大幅下降,为评估实际部署上限提供了可复现的基准。

  2. arXiv · Computers and Society64

    Fairness Theatre:在厂商控制的早期预警系统中评估事后公平干预

    研究使用加拿大安大略省一所公立高校的学生记录,在模拟采购约束下评估六种事后公平干预,发现干预重新分配而非一致减少差异,且两种实现因以群体规模定义弱势而使小规模边缘群体继续被服务不足。

    Why it matters: 研究揭示采购约束下公平干预如何被稀释,为审视厂商控制型预警系统提供可迁移方法。

  3. arXiv · Information Retrieval60

    抖音广告生成式端到端检索研究 GEAR 框架

    arXiv 论文提出 GEAR 端到端生成式广告检索框架,联合优化 tokenizer、generator 与 reranker;引入 BasisVQ 与 prefix-aware BasisRQ 缓解表示坍塌,并集成上下文条件重排头以减少候选碰撞,目前服务于抖音广告数亿日活用户。

    Why it matters: 论文针对生成式检索的表示坍塌与候选碰撞两大瓶颈提出联合优化框架,为大规模推荐系统的端到端可微分范式提供了新思路。

  4. arXiv · Computation and Language62

    语言模型在长对抗对话中的安全性评估

    研究评估三款开源指令微调模型在长对话中的安全性,由第二模型作为持续对抗用户测试两个有害提示。第一轮安全率85%-100%,到第11轮降至38%-61%,第101轮降至15%-44%,表明单轮安全不必然延续至持续对抗交互。

    Why it matters: 单轮安全率高但多轮对抗下显著下滑,提示长对话场景需要累积风险视角的评估与防护。

  5. arXiv · Computers and Society60

    One Tool, One Taste? How Vibe Coding Trades Collective Diversity for Individual Creativity

    研究者分析 73 个由 Lovable 生成的促销网站主页,用 DINOv3 嵌入与余弦相似度衡量设计多样性,发现 88% 的站点可归入 6 个可解释聚类,敏感性分析结果为 3-12 个聚类。

    Why it matters: 论文用实证方法揭示 vibe coding 在共享提示环境下会收敛视觉设计,且主观感受与分布独特性不匹配。

  6. arXiv · Computers and Society64

    FairMedAgent:临床 LLM 智能体公平性审计中的噪声基线与偏差分离

    该研究提出 Instability Floors 方法,用于分离临床 LLM 智能体公平性审计中的真实偏差与随机噪声。通过对 16 个合成 vignette 重复采样测量,发现默认配置下智能体动作翻转率为 8.7%,六款模型池化基线范围为 2.5%–23.7%。

    Why it matters: 原文给出了临床 LLM 智能体公平性审计中的噪声基线方法,读者可据此判断现有翻转率结论是否可靠。

  7. arXiv · Multiagent Systems64

    PANDA:面向可扩展容错多智能体系统的去中心化架构与灵活编排

    PANDA 是去中心化多智能体架构,通过解耦集体通信与团队通信支持数千智能体、毫秒级组队与并发负载均衡;提供星型/链型/网状三种编排模式,并基于信任网络治理交互。在 HotPotQA 上,PANDA 以最高 8 倍效率匹配 SOTA 精度,并在现有系统失效时维持 100% 任务完成率。

    Why it matters: 去中心化架构在 HotPotQA 上扩展到数千智能体并维持 100% 完成率,为多智能体系统的容错与编排策略选择提供了可迁移方法。

  8. arXiv · Information Retrieval60

    SkillSeek:重新审视市场规模的智能体技能检索

    论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。

    Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。

  9. arXiv · Computation and Language62

    框架叙事:大语言模型中的意识形态模仿现象

    研究构建 Poli-SHIFT 数据集与评估框架,系统测试七款开源大语言模型在政治议题上的立场变化,发现提示词中的术语、前提和用户信息会显著改变模型输出立场。术语变化即可在 16.9% 的配对比较中逆转模型立场,用户的政治自我陈述也会使回应偏向用户一方。

    Why it matters: 研究揭示提示词框架可系统性改变大语言模型的政治立场,对个性化信息环境下的AI安全与对齐具有警示意义。

  10. arXiv · Computers and Society62

    打破信息茧房:生成式 AI 搜索扩大集体注意力并提升共同信息消费

    arXiv 论文《Breaking News Out of the Filter Bubble》通过《华盛顿邮报》37,561 名读者的随机现场实验发现,提供 AI 答案与文章引用的搜索使广泛话题触达更广、读者话题重叠度上升,同时消费更分散并向小众话题偏移。

    Why it matters: AI 搜索在扩大信息覆盖的同时提升了读者间的话题重叠,为理解生成式搜索对公共信息消费的影响提供了实验证据。

  11. arXiv · Computers and Society62

    AI标签泛滥:社交媒体平台在欧盟法下如何标注AI与深度伪造内容

    研究审计了Instagram、TikTok、X和YouTube的AI标签实践,发现四家平台均已自动标注,但系统性风险场景下专家识别的深度伪造内容仅33%获得平台标签,且中位浏览量达16万;受控上传含标准溯源信号的AI内容时,平台仅标注61%,并常剥离溯源信号。

    Why it matters: 平台在系统性风险场景中对深度伪造内容的AI标签覆盖率仅33%,为欧盟立法落地效果提供了可验证的审计证据。

  12. arXiv · Computation and Language73

    系统提示幻觉:指令前言如何改变语言模型的计算

    论文通过 Centered Kernel Alignment 比较 17 个指令微调模型在 20 种系统提示下的层表示,发现 persona 与格式指令会深度重构中间表示,而安全指令几乎不改变表示,与最小基线无统计差异。

    Why it matters: 用 CKA 揭示系统提示在不同层的作用差异,为理解安全指令为何容易被绕过提供了可解释机制。

  13. arXiv · Computers and Society62

    生成式 AI 时代在线知识消费与生产格局变迁:基于 Stack Overflow 的证据

    arXiv 论文《Navigating the Changing Landscape of Online Knowledge Consumption and Production in the Age of Generative AI: Evidence from Stack Overflow》分析 ChatGPT 发布后 Stack Overflow 用户行为变化。

    Why it matters: 研究揭示生成式 AI 并未带来平等的社区参与机会,消费者与生产者的回报分化对知识社区治理有参考价值。

  14. arXiv · Computation and Language62

    TomasuLLM:面向 LLM Agent 的乱序推测执行运行时

    论文提出 TomasuLLM 运行时,在保持任务正确性的前提下按预测顺序提前执行 Agent 工具调用,并在验证后按轨迹顺序提交。在 SWE-bench Verified、Terminal-Bench 2.0 和 SWE-Marathon 上分别提速 1.31x、1.35x 和 1.27x,4010 条审计记录零误接受。https://arxiv.org/abs/2609.38201

    Why it matters: 为长时工具延迟提供了乱序执行思路,读者可借此评估它对现有 Agent 工作流的潜在加速空间。

  15. arXiv · Computers and Society62

    ChatGPT 使用方式研究:印度、尼日利亚、巴西和巴基斯坦的对话级证据

    研究分析 202,590 条 ChatGPT 对话(1,252 名用户,2022 年 12 月至 2026 年 2 月),覆盖印度、尼日利亚、巴西和巴基斯坦。个人使用占 55-64%,课程作业与工作使用频率相近;无监督主题发现揭示各国特有用途,如印度和巴西的健康与福祉、巴基斯坦的乌尔都-英语翻译、尼日利亚的时事与宗教问题,以及巴西的自我反思。

    Why it matters: 提供多国对话级实证数据,帮助读者理解同一产品在不同本地场景中的实际使用差异。

  16. arXiv · Audio and Speech62

    Tacit-TTS:从自回归解码到掩码预测的高效无转录语音克隆

    Tacit-TTS 从 IndexTTS2 蒸馏而来,用掩码非自回归生成替代自回归文本到语义解码,并引入训练免声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在两条英文和两条中文数据集上,长于 5 秒的语音生成速度比 IndexTTS2 快 10 倍以上,零样本质量相当,且无需参考语音转录,支持跨语言与非词汇参考(如八种其他语言、婴儿咿呀和合成乱码)。

    Why it matters: 用掩码非自回归替代自回归语义解码,配合无训练声学长度估计和 ReFlow 蒸馏,在零样本克隆质量不变时实现 10 倍以上加速。

  17. arXiv · Robotics62

    URA I:前沿智能体编写、调用并演化机器人工具的代码即策略框架

    论文提出 URAI(Universal Robot-Agent Interface),由编程智能体根据任务意图构建可复用工具,执行智能体在观察后调用工具并完成完整动作,两者在反馈循环中协作。

    Why it matters: 研究提出代码即策略的新分工方式,让前沿模型写工具并保留决策权,读者可借此评估机器人控制中工具复用与模型推理的权衡。

  18. arXiv · Artificial Intelligence60

    Talk2Agent:评测文本智能体的语音接口

    Talk2Agent 评测语音接口将人类口语指令传递给 LLM 电脑使用智能体的效果,基于 WildClawBench 和 OSWorld 构建口语任务版本,评测专用 ASR、音频大模型、上下文偏置和 LLM 本体修复等方法,并提出免执行、基于任务意图的评测框架,在 32 小时真实语音上 Pearson 相关性比 WER/CER 提升 0.246。

    Why it matters: 为语音接口到文本智能体的信息保真度提供了可复现的评测框架和量化结果。

  19. arXiv · Artificial Intelligence62

    When Context Changes: Understanding Update Failures in LLMs

    论文提出 Controlled In-Context Memory(CICM)基准,用于研究LLM在对话和Agent日志中跟踪与使用更新信息的能力。研究发现即使前沿推理模型也常出现 stale binding,即答案沿用旧值;开源模型中探针仍可恢复新值,说明是信息选择失败。

    Why it matters: 提出CICM基准并定位注意力漂移机制,为理解模型为何使用过时信息提供了可迁移的分析框架。

  20. arXiv · Artificial Intelligence62

    OpenJev-RLCD:面向推理模型的校准决策强化学习实现

    作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。

    Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。