跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Multiagent Systems50

    多智能体 LLM 在推理投入与通信拓扑下的集体状态研究

    研究50个无状态LLM智能体在局部同伴信息更新下的行为,识别出同步、扭曲和类 chimera 三种集体状态。增加 gpt-5-mini 的推理投入使面板从碎片化转向局部有序的扭曲状态,提高通信连通性则推动全局同步。40% 的低空间异质性试验在最终20轮仍保持扭曲构型,表明聚合一致性不足以刻画多智能体协调行为。

  2. arXiv · Statistics Machine Learning15

    Hierarchical Utility Calibration for Structured Multiclass Decisions

    论文提出分层效用校准(HUC)方法,将实际效用与预测均值的差异分解为标签树内部节点的贡献之和,揭示各节点正负贡献可能相互抵消,即使 UC 指标较小,层次中部分节点的效用误差仍可能较大。HUC 在求和前逐节点评估贡献,并提出仅更新违反节点的 HUC-Boost,两者均提供有限样本理论保证。

  3. arXiv · Human-Computer Interaction47

    基于单试次 EEG 在线推断人类意图的潜在控制状态

    研究提出一种基于刺激范式的方法,从单试次 EEG 中推断与目标相关的意图状态,使用可解释模糊原型网络编码意图特异性神经动力学。在线验证准确率达 70.11%±10.87%,离线达 93.22%±3.21%,优于代表性深度学习基线,推动意图感知 BCI 从刺激驱动检测转向目标依赖内部状态的原理性推断。

  4. arXiv · Computers and Society26

    通过学习分析早期预测在线考试中 AI 辅助作弊风险

    土耳其一所公立大学对 52 名计算机教育专业新生进行研究,利用学生在 LMS 前 8 周的数字痕迹预测期末考试 AI 辅助作弊风险。通过 27 个特征中选取 5 个,Logistic Regression 在 LOOCV 下准确率达 73.1%,课程模块浏览、作业提交和视频访问天数是最稳定特征。预测结果仅用于及时学业指导,不作为违纪认定依据。

  5. arXiv · Artificial Intelligence58

    MemEvo:流视频记忆机制的自动发现

    论文提出MemEvo框架,将流视频记忆设计建模为可执行记忆程序的搜索问题,通过LLM迭代生成和精炼候选程序,并在StreamingBench和OVO-Bench上验证了训练免训、有界记忆的流视频理解性能与效率。

  6. arXiv · Robotics19

    多关节仿生水下机器人多模态运动控制:融合游泳与步态能力

    研究提出一种基于多关节四腿鳍结构的多模态水下机器人运动控制机制,通过传感器模态非线性行为实现游泳与步态间的平滑切换。利用势函数验证了双模态与三模态行为过渡,并在物理与仿真环境中基于多传感器数据完成测试。该方法有望提升水下探索的适应能力,项目页面已公开。

  7. arXiv · Computation and Language30

    DraftTrace:面向AI辅助写作的多视角分析环境

    DraftTrace联合捕获写作的最终产物、写作过程与AI助手交互三视图,重建文档随时间的演化并组织为提交级、长程级和班级级分析。在81名研究生的NLP课程中部署后,过程指标能区分文本输入方式(如复制粘贴与LLM生成),学生在前阶段用助手澄清问题、后阶段验证答案。教师初步调查肯定了多视角写作分析的可解释性价值。

  8. arXiv · Computer Vision32

    DuLBE:双模低秩学习与桥接原型集成用于视觉-语言类增量学习

    DuLBE 提出双模低秩学习与桥接原型集成分类器,实现无样本类增量学习。根据梯度需求分配两种视觉低秩更新模式,由梯度路由协调:共享模式复用历史可迁移知识,残差模式提供任务特定变化通道。在单位超球面上构建视觉原型与文本嵌入间的测地线桥,集成可靠桥接原型以补偿文本决策边界的模态差距,在多个设置下达到 SOTA CIL 性能并保持低秩调参的高参数效率。

  9. arXiv · Computation and Language38

    当更新不再等于学习:重新思考 LLM 自我演化中的可学习信息增益

    LLM 自我演化常出现性能先升后降的退化现象,现有方法仅针对 Questioner 或 Solver 单独优化,忽略了系统耦合性。该研究提出基于可学习信息增益的整体框架,理论等价于两轮数据分布的 KL 散度加熵变,实际通过拟合小语言模型并以负对数似然评分来估计。基于该诊断,ATRI 框架在轮内重加权样本、信息增益持续偏低时跨轮停止训练,在公开数据集上验证了有效性。

  10. arXiv · Computation and Language62

    检索器对查询中身份信号的敏感性研究

    论文评估了五种稠密检索器与一种稀疏基线在政治新闻和消费者健康问答中的偏差,发现检索结果会对齐查询的政治倾向,且对非裔美国英语(AAL)问题的表现弱于白人标准英语(WME)。通过词汇不对称分数控制和线性探针分析,确认偏差来自查询的身份信号而非表层词汇,代码已公开。

    推荐理由:论文揭示检索器对政治倾向和方言的敏感偏差,为理解信息过滤中的身份信号影响提供可复现证据。

  11. arXiv · Artificial Intelligence39

    MAADBench:多智能体系统异常检测的可刷新基准

    MAADBench 是首个支持多智能体系统异常检测的可刷新基准,结合约 10^37 任务空间的采样耦合生成任务、可配置 LLM 回溯的刷新轨迹生成,以及自动化确定性逐步标注。MAADBench-Full 数据集包含 5,200 条逐步标注轨迹,基于 5 个前沿 LLM 骨干对 25 种异常检测方法进行基准测试,揭示当前方法高度依赖监督、对多智能体特异性异常鲁棒性不足。开源地址见原文。

  12. arXiv · Computation and Language62

    大规模因子分析显示机器智能仅部分可解释

    研究对 13,251 个评测分数、1,618 个语言模型、456 个文本基准做潜变量因子分析,发现通用智能因子最多解释 70.8% 的方差,且常被标准

    推荐理由:大规模因子分析挑战了语言模型存在单一通用智能因子的假设,对当前以通用智能为目标的开发策略提出质疑。

  13. arXiv · Robotics40

    低保真模拟器即可实现机器鱼控制零样本仿真到现实迁移

    研究人员提出一种低保真仿真方法,使用无状态准稳态流体模型训练机器鱼控制器,无需调参即可迁移到真实硬件。平台为单电机腱驱动软体机器鱼,策略仅依赖硬件可测信号,通过带限节奏轨迹生成器动作。在户外泳池部署后,单一策略实现了闭环目标追踪、扰动抑制和分布外目标捕获。

  14. arXiv · Artificial Intelligence44

    BRIDGE:双层次检索信用感知智能体强化学习

    BRIDGE 将检索增强智能体 RL 建模为双层次优化问题,通过内存高效的一阶方法解决检索与 LLM 策略学习的顺序敏感性问题。在 7 个开放域 QA 基准上,3B 和 7B 主干的平均准确率均最高,多跳平均分别提升 9.6 和 3.4 EM 点,并在医学 QA 基准上取得最佳平均准确率与推理质量。

  15. arXiv · Machine Learning22

    Transformer 中前馈层的动力学角色

    研究从控制论视角分析 Transformer 中前馈层的动力学行为,将自注意力机制解释为相互作用粒子系统,前馈层视为独立控制。理论结果表明前馈网络可将 token 驱动至任意接近一致状态,且可扩展至多聚类与多头注意力。论文通过数值实验验证理论,并与真实大语言模型的阈值行为进行对比。

  16. arXiv · Computation and Language28

    跨模态关联中人类与视觉语言模型的注视差异研究

    研究比较了人类(N=53)与多个视觉语言模型在跨模态关联任务中的选择与注视模式,发现较大 VLMs 在选择上与人类一致,但其显著性图与人类注视的匹配度不如中心高斯基线。微调小 VLMs 可使其选择对齐达到人类多数投票参考水平,但注视仍不及基线;仅训练模型注视可提升注视相关性,却不改善选择对齐。

  17. arXiv · Artificial Intelligence38

    AVIO:学习在音视频场景中添加与移除发声物体

    AVIO 通过源条件特征调制适配预训练文本到音视频生成模型,联合学习物体添加与移除,并引入参考帧课程逐步减少参考条件以实现仅指令编辑。AVIOBench 数据集包含 37.9 小时、覆盖 1,878 个目标物体名称的配对音视频样本,通过视觉定位与跨模态一致性筛选目标声音移除候选。定量与定性评估表明,AVIO 在音视频物体移除与添加上有效,可选参考引导为添加提供外观与位置控制。

  18. arXiv · Machine Learning42

    BASE:基于预测移除误差的批量感知 MoE 专家选择方法

    BASE 根据移除专家对 MoE 层输出的影响排序专家,训练轻量线性预测器估计每个 token 的移除代价,并配合自定义 GPU 内核实现批量感知的专家选择。在 Qwen3-30B-A3B 上,BASE 在严格专家预算下比最强基线平均精度提升 29.5 点;在更高专家预算下比稠密推理快 60%,精度差距保持在 0.4 点以内。

  19. arXiv · Machine Learning27

    语言模型在序列任务需求下如何重新分配注意力头活动

    研究固定提示长度、变化序列步骤需求,测量了 17 个开源权重模型各层的注意力头活动分布。Qwen2.5(0.5B–7B)比平均模型更分散活动、集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。

  20. arXiv · Artificial Intelligence20

    Human-AI Collaboration: From Paradoxes to Patterns

    论文提出人类与AI协作的四个模式:Instruction、Delegation、Assistance 和 Co-creation。研究围绕自主性与主动性两个设计维度展开,通过悖论视角分析协作中的内在张力,并推导出模式描述。该版本为作者预印本,将发表于 PLoP 2026。