Agentic Federated Learning:基于规则的客户端与服务器智能体实现自适应训练
该论文提出 Agentic Federated Learning(AFL)框架,在客户端引入 Client-Side Agent(CSA)动态调整局部训练参数并评估更新可靠性,在服务器端引入 Server-Side Orchestrator Agent(SSOA)进行质量感知客户端选择与自适应聚合。
该论文提出 Agentic Federated Learning(AFL)框架,在客户端引入 Client-Side Agent(CSA)动态调整局部训练参数并评估更新可靠性,在服务器端引入 Server-Side Orchestrator Agent(SSOA)进行质量感知客户端选择与自适应聚合。
summary_zh: 本文提出面向工业级检索与排序模型连续训练的可扩展 Soft Curriculum Learning 框架,通过 loss annealing 与 in-graph weight 调整替代刚性数据过滤,打破热门物品反馈循环,实现动态课程调度且不牺牲系统吞吐。
summary_zh: 该章节提出"平台提取主义"框架,分析数字平台如何作为AI基础设施使企业攫取数据与劳动力,将价值集中至硅谷等核心地区。研究指出AI依赖不稳定的平台劳动进行数据生产、清洗、标注与维护,标注系统将美国规范默认为普遍知识,再现殖民等级秩序。
Brešar 和 Mijatović 证明 Ornstein-Uhlenbeck 扩散在排除超线性漂移的假设下难以超越。本文测试超线性 Langevin 扩散用于基于分数的图像生成,通过 Fokker--Planck 方程数值计算条件分数。
FinDeCrowd-Stress 通过匹配兼容与不兼容候选池,发现不兼容候选使 top-10 证据召回率相对下降 0.147。FinDeCrowd-RAG 引入身份门控重排序,在受控候选上将 top-10 证据包含率从 0.757 提升至 0.902,在 FinDER 索引上从 0.420 提升至 0.492。
研究50个无状态LLM智能体在局部同伴信息更新下的行为,识别出同步、扭曲和类 chimera 三种集体状态。增加 gpt-5-mini 的推理投入使面板从碎片化转向局部有序的扭曲状态,提高通信连通性则推动全局同步。40% 的低空间异质性试验在最终20轮仍保持扭曲构型,表明聚合一致性不足以刻画多智能体协调行为。
论文提出分层效用校准(HUC)方法,将实际效用与预测均值的差异分解为标签树内部节点的贡献之和,揭示各节点正负贡献可能相互抵消,即使 UC 指标较小,层次中部分节点的效用误差仍可能较大。HUC 在求和前逐节点评估贡献,并提出仅更新违反节点的 HUC-Boost,两者均提供有限样本理论保证。
研究提出一种基于刺激范式的方法,从单试次 EEG 中推断与目标相关的意图状态,使用可解释模糊原型网络编码意图特异性神经动力学。在线验证准确率达 70.11%±10.87%,离线达 93.22%±3.21%,优于代表性深度学习基线,推动意图感知 BCI 从刺激驱动检测转向目标依赖内部状态的原理性推断。
土耳其一所公立大学对 52 名计算机教育专业新生进行研究,利用学生在 LMS 前 8 周的数字痕迹预测期末考试 AI 辅助作弊风险。通过 27 个特征中选取 5 个,Logistic Regression 在 LOOCV 下准确率达 73.1%,课程模块浏览、作业提交和视频访问天数是最稳定特征。预测结果仅用于及时学业指导,不作为违纪认定依据。
论文提出MemEvo框架,将流视频记忆设计建模为可执行记忆程序的搜索问题,通过LLM迭代生成和精炼候选程序,并在StreamingBench和OVO-Bench上验证了训练免训、有界记忆的流视频理解性能与效率。
研究提出一种基于多关节四腿鳍结构的多模态水下机器人运动控制机制,通过传感器模态非线性行为实现游泳与步态间的平滑切换。利用势函数验证了双模态与三模态行为过渡,并在物理与仿真环境中基于多传感器数据完成测试。该方法有望提升水下探索的适应能力,项目页面已公开。
arXiv 论文提出 SafeCoEvo,一种测试时 Harness-Guard 协同进化框架,用于在真实部署中持续适应 LLM 智能体安全。S-Harness 将近期运行经验快速外部化为可更新的显式安全知识,GuardVPO 在更长时间尺度上将累积安全经验内化为参数化风险判断能力。
DSPO 是一种针对多模态大语言模型情感推理的强化学习框架,通过 Distribution-Aligned Emotional Diversity Reward(DEDR)和 Counterfactual Visual Intervention Gating(CVIG)分别提升主观情感覆盖与视觉 grounding。
BCNav 提出解耦框架,利用到达方向(DOA)估计提供标量方位角,使导航策略仅处理深度图像和方位角两个输入。方法通过模仿学习输出连续速度指令,在仿真和物理机器人上验证,无需声学微调、先验地图或真实音频数据采集。代码已开源。
DraftTrace联合捕获写作的最终产物、写作过程与AI助手交互三视图,重建文档随时间的演化并组织为提交级、长程级和班级级分析。在81名研究生的NLP课程中部署后,过程指标能区分文本输入方式(如复制粘贴与LLM生成),学生在前阶段用助手澄清问题、后阶段验证答案。教师初步调查肯定了多视角写作分析的可解释性价值。
论文提出 AdaLCPI 攻击,将恶意指令拆分为不完整片段嵌入检索内容,并通过重构提示让 Agent 组合。实验显示 AdaLCPI 宏平均攻击成功率 61.4%,显著高于 Trojan Hippo 风格的 32.8% 和 AgentVigil 的 30.0%。研究建议安全评估应测试 Agent 在需从片段重构恶意目标时的鲁棒性。
本文提出一种几何辅助的三功能变形机器人,结合空中飞行、地面移动与可控深度种子植入,形成飞-驱-植架构。着陆后平台重构为四轮种植配置:电子耦合双电机驱动后臂展开为地面轮,前部托盘下降并与推进电机通过钻齿轮组复用推进电机进行钻孔,无需专用钻驱动。
DuLBE 提出双模低秩学习与桥接原型集成分类器,实现无样本类增量学习。根据梯度需求分配两种视觉低秩更新模式,由梯度路由协调:共享模式复用历史可迁移知识,残差模式提供任务特定变化通道。在单位超球面上构建视觉原型与文本嵌入间的测地线桥,集成可靠桥接原型以补偿文本决策边界的模态差距,在多个设置下达到 SOTA CIL 性能并保持低秩调参的高参数效率。
summary_zh: 研究探讨表示学习是否在训练损失停止改善时就停止,以矩阵 Muon 为对象,其 polar-normalised updates 的步长由梯度秩而非梯度范数设定。
LLM 自我演化常出现性能先升后降的退化现象,现有方法仅针对 Questioner 或 Solver 单独优化,忽略了系统耦合性。该研究提出基于可学习信息增益的整体框架,理论等价于两轮数据分布的 KL 散度加熵变,实际通过拟合小语言模型并以负对数似然评分来估计。基于该诊断,ATRI 框架在轮内重加权样本、信息增益持续偏低时跨轮停止训练,在公开数据集上验证了有效性。
PSC通过学习预测未来安全代价来分配训练经验,优先地形与随机事件,不改变任务奖励与策略优化目标。在ANYmal-D上相对学习进度课程,PSC将小腿碰撞发生率降低63%,三个训练种子均下降;在生产楼梯攀爬平台上消除观察到的小腿碰撞。
Qwen2.5-VL-7B 在四组多模态推理基准中 27.81% 的正确答案包含图像不支持的直接视觉断言,RLVR 因结果级奖励使这些断言继承正信用。研究提出固定回放反事实诊断,揭示 DAPO 与 VPPO 下 EFS 提升但断言的持续性强化的 SPD 现象,而 GRPO 仅提升 EFS。
FastVR 是一个基于一步扩散模型的流式视频修复框架,结合轻量 VAE 与分块因果注意力,将 1080p 视频推理成本降至单张 H20 GPU 11 FPS。训练阶段引入速度一致性正则与连续轨迹学习,在合成与真实基准上达到当前最优性能,同时保持较强恢复质量与时间一致性。
论文评估了五种稠密检索器与一种稀疏基线在政治新闻和消费者健康问答中的偏差,发现检索结果会对齐查询的政治倾向,且对非裔美国英语(AAL)问题的表现弱于白人标准英语(WME)。通过词汇不对称分数控制和线性探针分析,确认偏差来自查询的身份信号而非表层词汇,代码已公开。
推荐理由:论文揭示检索器对政治倾向和方言的敏感偏差,为理解信息过滤中的身份信号影响提供可复现证据。
FACT(保真度感知的可动双胞胎构建)是一个智能体框架,通过证据—诊断—修正循环逐步构建可动双胞胎,提升几何、接触和动态保真度。实验表明,FACT 在几何重建、碰撞代理交互和物理响应复现上均优于基线。
MAADBench 是首个支持多智能体系统异常检测的可刷新基准,结合约 10^37 任务空间的采样耦合生成任务、可配置 LLM 回溯的刷新轨迹生成,以及自动化确定性逐步标注。MAADBench-Full 数据集包含 5,200 条逐步标注轨迹,基于 5 个前沿 LLM 骨干对 25 种异常检测方法进行基准测试,揭示当前方法高度依赖监督、对多智能体特异性异常鲁棒性不足。开源地址见原文。
summary_zh: Transversal Pooling Neural Networks 将空间最大池化推广到仿射群作用,对选定子群建立等变性,并为单个池化小波系数推导出显式稳定性边界。
NesTok 提出嵌套自对齐框架,针对动态视觉 Tokenizer 引入跨长度训练,用完整长度序列指导较短序列的重建优化。在 ImageNet 上 rFID 达 0.98,下游图像生成取得 gFID 1.46 的当前最优成绩。代码将开源。
研究对 13,251 个评测分数、1,618 个语言模型、456 个文本基准做潜变量因子分析,发现通用智能因子最多解释 70.8% 的方差,且常被标准
推荐理由:大规模因子分析挑战了语言模型存在单一通用智能因子的假设,对当前以通用智能为目标的开发策略提出质疑。
研究人员提出一种低保真仿真方法,使用无状态准稳态流体模型训练机器鱼控制器,无需调参即可迁移到真实硬件。平台为单电机腱驱动软体机器鱼,策略仅依赖硬件可测信号,通过带限节奏轨迹生成器动作。在户外泳池部署后,单一策略实现了闭环目标追踪、扰动抑制和分布外目标捕获。
BRIDGE 将检索增强智能体 RL 建模为双层次优化问题,通过内存高效的一阶方法解决检索与 LLM 策略学习的顺序敏感性问题。在 7 个开放域 QA 基准上,3B 和 7B 主干的平均准确率均最高,多跳平均分别提升 9.6 和 3.4 EM 点,并在医学 QA 基准上取得最佳平均准确率与推理质量。
研究从控制论视角分析 Transformer 中前馈层的动力学行为,将自注意力机制解释为相互作用粒子系统,前馈层视为独立控制。理论结果表明前馈网络可将 token 驱动至任意接近一致状态,且可扩展至多聚类与多头注意力。论文通过数值实验验证理论,并与真实大语言模型的阈值行为进行对比。
summary_zh: MoRe-Drag 将像素空间变形作为粗运动证据注入生成采样轨迹,通过区域感知潜在重组合与阶段自适应条件化,在 DragBench-SR 和 DragBench-DR 上显著提升拖拽精度,达到 SOTA 水平。
研究比较了人类(N=53)与多个视觉语言模型在跨模态关联任务中的选择与注视模式,发现较大 VLMs 在选择上与人类一致,但其显著性图与人类注视的匹配度不如中心高斯基线。微调小 VLMs 可使其选择对齐达到人类多数投票参考水平,但注视仍不及基线;仅训练模型注视可提升注视相关性,却不改善选择对齐。
AVIO 通过源条件特征调制适配预训练文本到音视频生成模型,联合学习物体添加与移除,并引入参考帧课程逐步减少参考条件以实现仅指令编辑。AVIOBench 数据集包含 37.9 小时、覆盖 1,878 个目标物体名称的配对音视频样本,通过视觉定位与跨模态一致性筛选目标声音移除候选。定量与定性评估表明,AVIO 在音视频物体移除与添加上有效,可选参考引导为添加提供外观与位置控制。
现有 VLA 剪枝策略主要按任务语义相关性选择视觉 token,忽略机器人操作所需的空间信息。研究提出 GeoScaffold,一种无需训练的视觉 token 剪枝方法,将图像划分为空间区域,按任务相关性权重分配区域间 token 预算,并通过最远点采样选择区域内骨架 token。
BASE 根据移除专家对 MoE 层输出的影响排序专家,训练轻量线性预测器估计每个 token 的移除代价,并配合自定义 GPU 内核实现批量感知的专家选择。在 Qwen3-30B-A3B 上,BASE 在严格专家预算下比最强基线平均精度提升 29.5 点;在更高专家预算下比稠密推理快 60%,精度差距保持在 0.4 点以内。
FinRT 框架将自适应红队策略蒸馏为可复用的对抗提示生成器,在六个消费金融 victim 模型上攻击成功率 32.9%,较 Rainbow Teaming 基线 17.2% 翻倍,最大对抗严重性提升 33%,并保持与迭代搜索方法相当的语义多样性。
研究固定提示长度、变化序列步骤需求,测量了 17 个开源权重模型各层的注意力头活动分布。Qwen2.5(0.5B–7B)比平均模型更分散活动、集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。
论文提出人类与AI协作的四个模式:Instruction、Delegation、Assistance 和 Co-creation。研究围绕自主性与主动性两个设计维度展开,通过悖论视角分析协作中的内在张力,并推导出模式描述。该版本为作者预印本,将发表于 PLoP 2026。