边端 SNN 如何在推理中学习:跨感知模态的局部并行学习
研究提出双向脉冲蒸馏(BSD),让边端 SNN 在推理过程中持续学习。BSD 耦合刺激驱动的前向网络与目标驱动的反向网络,通过局部目标对齐中间表示,使前向推理、反向推理与分阶段更新并行执行;在 SOUL 五种感知模态的 25 个基准上,平均与匹配 BP 基线相差 3.8 个百分点,部署仅需前向分支,训练延迟降至 BP 的 $0.72\times$、训练能耗降至 $0.36\times$。
研究提出双向脉冲蒸馏(BSD),让边端 SNN 在推理过程中持续学习。BSD 耦合刺激驱动的前向网络与目标驱动的反向网络,通过局部目标对齐中间表示,使前向推理、反向推理与分阶段更新并行执行;在 SOUL 五种感知模态的 25 个基准上,平均与匹配 BP 基线相差 3.8 个百分点,部署仅需前向分支,训练延迟降至 BP 的 $0.72\times$、训练能耗降至 $0.36\times$。
该综述系统回顾进化计算(EC)在可信 AI 中的应用,覆盖进化攻击、进化防御与可信自进化 AI 系统三大方向。文章指出 EC 凭借基于种群、无梯度的搜索及灵活的变异选择机制,适配离散选择、多目标与高昂评估成本下的攻防场景。
SEDIMA 为 LLM 驱动的进化搜索智能体引入持久化分层洞察记忆,把原始轨迹蒸馏为自然语言洞察、按注意力加权质心做语义聚类,并检索相关指导以条件化后续变异。
论文提出一个统一的多任务学习框架,将类别型(如快乐、悲伤)与维度型(如 valence-arousal)情绪标签结合,实现在多个数据集上训练。
研究基于预训练符号音乐 Transformer,发现其表征已足以在两个基准上高精度分类钢琴家身份,并通过交叉注意力接入学习到的钢琴家身份嵌入,生成特定艺术家风格的音乐。
研究构建多通道检测-提取模型,并评测推理时算法以改进多阶段架构中的类别检测与目标声音提取。评估了二元交叉熵与混合一致性两种适应度函数、朴素与条件混淆矩阵重标注两种策略,以及多标签分类器、微调单源分类器和现成音频评判三种源估计评估模型。在 DCASE 2025 Task 4 数据集上验证设计选择影响,并在留出评估集上验证基于熵的推理时更新门控机制。
OpenGameEval 是一个面向 Roblox Studio 中智能体游戏开发的基准与评测框架,在可复现、有状态的引擎会话中运行模型,并用可执行检查对编辑后的场景与模拟游玩打分。
论文提出 SCOUT,首个在测试时通过动作精炼将生成式基础模型与学习价值函数结合的离线 MARL 框架。SCOUT 训练流匹配行为先验与分解价值函数两个解耦组件,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,输运步数控制自适应测试时缩放。论文在 IGM 原则下证明联合软价值差的单一项 KL 界,并在离散与连续离线 MARL 基准上取得最佳平均性能,在所有离线到在线配置中均有提升。
该研究针对带逐步安全约束的 episodic tabular 约束马尔可夫决策过程(CMDP),提出 Safe Variance-Adaptive Exploration(SVAE)算法,在学习安全子图的同时进行方差自适应乐观规划。
研究者将多保真策略梯度(MFPG)框架扩展到现代 actor-critic 学习,提出 MFPG-PPO 与预算感知版本,用低成本低保真数据构造控制变量以降低方差、避免策略梯度估计偏差。
论文提出 Language Model Agent Machine(LAM),一种在固定底层语义模型的同时显式计费 harness 层资源的资源受限抽象。
论文提出 Threshold-Aware Conformal Routing(TACR),在标量指标是否越过固定阈值的判定场景中,用保形区间完全落在阈值一侧时采用学习型代理模型、区间与阈值相交时回退全仿真。TACR 通过阈值感知目标学习输入相关尺度,在保持无分布边际覆盖率的同时,在多个科学与工程数据集上将仿真回退减少 14-75%,相比无阈值局部加权的变体进一步减少 10-24%。
论文提出将残差量化(RQ)作为表示层,用离线训练的 RQ 码本把连续上下文映射为多层离散质心分配,以严格有界内存实现非线性表达。在 13 个数据集上,RQ 变体在 11 个数据集上胜过非 RQ 对应算法,同时以最高 1000 倍更少内存匹配 doubling-retrain XGBoost 与神经基线。论文已被 NeurIPS 2026 接收。
该研究提出一种基于多重分步 graphon 与神经逆算子的生成图模型,在函数空间中同时完成生成建模与参数恢复,可对训练时未见过的图规模进行推理。仅用合成多重分步 graphon 样本训练,模型在零样本图生成基准的四项指标中三项平均表现最佳,优于在真实网络上预训练的图基础模型;在单观测网络与多被试 EEG 案例中,参数恢复效果可比拟逐图优化方法,并对脑状态可逆变化更敏感。
论文提出一种几何感知时间重参数化方法,为 Flow-Map 蒸馏中学生模型分配更多时间以学习教师生成 ODE 中法向加速度较大的轨迹段,同时保留教师几何路径与终端分布。该方法在蒸馏前一次性估计共享时钟,无需重新训练教师模型,也不增加学生参数或推理时的网络评估开销。在合成数据、CIFAR-10 和 CelebA-64 上,该方法在相同推理预算下优于恒等时间蒸馏,包括一步和两步图像生成质量提升。
VisAudit 是一个评测可视化诊断、修复与验证的基准,覆盖 21 种图表类型、10 类缺陷,含 1,900 个有缺陷实例和 300 个初始正确图表,并设诊断修复、自主修复与开放世界验证三条赛道。基准通过受控扰动构建,注入缺陷可定义且可恢复。实验显示,最强评测模型在自主修复设定下仅完全恢复 47.4% 的有缺陷图表。
一份技术报告提出面向次日电力需求预测的数据接入流水线,在训练前仅用预测时可得信息检测并修复电表数据缺陷。
研究者提出 Inherit-MAS,在测试时通过工作流继承与执行继承演化多智能体系统:meta-model 合成带角色、通信输入与工具权限的 worker agents 工作流,judge 诊断缺陷并做受验证编辑,执行继承仅在完整请求与上下文匹配时复用结果。
研究者预训练了共享内存的循环语言模型:仅第一次递归写入 KV cache,后续递归读取它并保留短窗口。
研究者推出 Co-design Gym,一个用于联合优化智能体具身(设计)与策略的基准环境套件。套件覆盖机器人操作与运动、多机器人协作、可变形与柔性动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库与最优控制等领域,共 20 个环境族、85 个以上协同设计预设。论文还对代表性协同设计算法做了系统评测,刻画当前 SOTA 水平。
论文提出词典序多目标在线策略蒸馏 LMOPD,用多教师方式按显式优先级整合奖励专用策略,在每个学生 rollout 中选择首个检测到缺陷的专家,并投影其 log-policy 修正以移除与更高优先级专家相悖的分量。
该研究分析以概率 p 独立保留边的 ReLU 网络对 W^{n,∞}([0,1]^d) 单位球的逼近,给出以至少 1-δ 概率成立的一致误差上界,构造出常数深度、规模 Õ_{n,d}(p^{-9}ε^{-max{d/n,2}} log(1/δ)) 的网络。
研究者提出 Rank-Aware Speculative Sampling(RASS),一种用于扩散模型投机草稿树的验证规则,按候选在 proposal-target 平均位移上的排序采样秩权重,并以残差修正保证精确采样。
论文提出 SSU-LSF(State-Space Unlearning for Land Surface Forecasting),首个面向地球科学 Mamba 型 SSM 的机器遗忘框架,用于消除灌溉激增、坝调度变化、传感器重校准等非平稳混淆对 NDVI、LST 与作物物候预测的长期偏差。
一项研究用机器学习框架分析 $\mathbb{X}$(原 Twitter)2024 年 5 月的选举相关对话,识别出一个协同虚假行为者网络,其链接分享行为高度相似。
研究以单次异议交流后决策的概率偏移衡量说服力,在三项语言理解任务上测试七个开源模型,发现模型意见不合时接收方常放弃原有判断。独立确定性与模型规模都无法可靠预测说服动态,小模型可与大模型同样有说服力并同样抗影响,偏移大小更多取决于听者易受影响程度。说服模式因具体模型配对而异,交互模型的行为必须在其组合中评估。
文章综述 ChatGPT 等高级 AI 聊天机器人兴起背景下社交机器人检测的挑战与机遇,梳理现有技术与真实应用,指出 AI 生成对话与行为带来的独特难题。研究提出四个方向:用生成式智能体做合成数据生成、测试与评估;基于网络与行为特征的多模态跨平台检测;扩展到非英语与低资源语言;发展协作式联邦学习检测模型以在保护用户隐私的同时促进机构与平台合作。
GlanceWAM 在单一共享视频 DiT 骨干上把想象与控制解耦:异步 proposer 在后台以慢时钟预想数秒后的一帧,动作头以 48 ms 控制频率在潜空间解码动作块而不阻塞。
MobiAgent 是一个双循环智能体框架,用内循环将高层推理与底层控制解耦,通过可组合原子技能与视觉反思实现错误恢复,外循环自动切分、聚类部署轨迹并持续微调技能库。
I2CD 可从单张 RGB 图像直接预测凸分解,冻结预训练的 Hunyuan3D-2 图像条件扩散 Transformer 与形状解码器,仅训练 38M 参数的交叉注意力头,约 0.5 秒/图输出可直接载入物理引擎、无需后处理的 K 个凸多面体半平面参数。
KungfuAthleteBot(KAB)提出从视频学习高动态人形运动的框架,依次解决视频运动物理不一致、无驱动信息、缺失败恢复数据三类问题。框架构建 KungfuAthlete 数据集,引入物理引导抛物线轨迹校正与物理驱动伪低动能(LKE)采样,并在同一策略内学习扰动抑制与跌倒恢复。在人形机器人上,KAB 可从任意跌倒约 0.7 s 恢复,为统一策略下已报道最快恢复速度。
论文提出,分阶段人形机器人 RL 流水线中奖励、课程门、评测统计与参考动作四类代理各有偏差机制,并给出对应重构方案,包括一阶 L1 代价、峰值与结果统计、门可达性与信息检查、确定性且相位去同步评测、课程状态纳入模型、可行性优先参考设计与残差前馈、以及函数保持输入扩展。
研究者提出 MixVLA,一种模型无关的训练框架,通过自适应混合非不变信息(AMI)提升 VLA 模型在分布外条件下的零样本泛化能力,无需额外 OOD 数据或架构改动。
论文提出 LLMersion,一套完全在家庭本地运行、面向语言学习的 AI 教育方案,并发布开源原型 LLMersion-1 及配套工具 LLMersion Narrator。
研究者提出 Split Label-Localized Conformal Prediction(SLLCP),在冻结的 VLM 之上加后处理校准层,把不可靠预测转成概率校准的安全预测集,并按场景局部加权历史经验计算不确定性阈值。
研究者提出 RoboBridge 框架,将 sim-to-real 迁移视为可执行任务技能的持续适应,让具身智能体在部署后跨仿真与真实环境持续进化。
GeoScaffold 是一种几何监督框架,把深度、连通性、可通行性等几何信息在训练时内化到策略中,避免推理时依赖深度传感器、3D 编码器或逐步感知工具调用。它先学习并冻结一个紧凑深度 tokenizer,再用少量可学习几何 query token 的隐藏状态重建导航关键几何,训练后 tokenizer、目标生成器和重建头全部丢弃,仅保留主干与动作接口。
DeltaWorld 提出 Delta Latent Transition Model(Delta-LTM),通过预测机器人动作引发的潜变量特征变化并叠加到当前潜状态来生成下一状态,替代直接预测下一潜状态。
该研究提出一种连续时间事件相机立体视觉里程计(VO)管线,用物理驱动的白噪声加速度(WNOA)先验将测量值插值到精确时间戳,把估计状态压缩到关键时间点(keytimes),在保留异步事件原生时间分辨率的同时实现实时运行。
研究者发布 MoRoOp 数据集,记录自主移动机器人(AMR)在实验室套件准备与供应场景中九个八小时班次的作业与运行状态。数据集包含 1,382 个作业、4,815 个操作、19,352 条调度事件和 140,386 条机器人状态观测,并保留延迟、导航受阻与失败操作等有效观测。可用于评估 AI 智能体的运营决策记录、扰动检测、操作预测、数据驱动仿真与事件日志分析。