TaRL:从触觉演示中学习通用与物理奖励
TaRL从触觉变形图序列中回归任务完成进度,融合成功与失败演示提供反馈。仿真Nut threading成功率从34%提升至56%,真实世界cube pickup从37%提升至97%。结合视觉奖励进一步提升性能,且可跨物体实例泛化。
TaRL从触觉变形图序列中回归任务完成进度,融合成功与失败演示提供反馈。仿真Nut threading成功率从34%提升至56%,真实世界cube pickup从37%提升至97%。结合视觉奖励进一步提升性能,且可跨物体实例泛化。
OCA 通过常微分方程建模图像与点云的理想特征交互,改进跨注意力机制以缓解注意力模糊问题。该模块可无缝集成到现有 I2P 配准框架中,在四个公开基准数据集上,将配准召回率在标准、微调和零样本设置下分别最高提升 5%、9% 和 15%。论文已被 ECCV'26 接收。
summary_zh: Population Fidelity 是一个评估框架,通过群体级准确性、组间变异量和变异结构三个维度衡量 LLM 生成回复对人口的代表性。
EN-HMTFL 提出一种编码器共享的分层联邦多任务学习框架,车辆在本地保留任务专属解码器,仅通过层级结构交换全局共享编码器。实验在 MNIST 和 GTSRB 数据集上进行,相比表示共享基准准确率最高提升 24.0%,收敛场景最多减少 69 轮通信(28.8%)。原始数据和本地解码器参数始终保留在车辆端。
提出一种尺度不变的可操作性形状跟踪方法,将仅相差正标量的矩阵视为等价并使用单位行列式代表元。在四台异构机器人上评估机器人间与人机迁移,所提方法在无需尺度调参时末端形状距离达 9.30×10⁻⁵,Full 方法在 KR500 和 UR20 上的轴比误差为 0.19–0.31;人机协同任务中末端位置误差为参考臂长的 2.4–5.6%,Full 方法最高达 75%。
提出 Graded Margin Direct Preference Optimization(GM-DPO),对肢体动作错误分配更强的偏好边距和训练权重,在 Qwen3-8B 上相对 DPO 将加权幻觉率降低 21.3%,GPA 提升 2.02-3.40 分。
PersonaDose 通过特质描述与期望均值强度控制语言模型人格表达,在 Llama-3.1-8B、Qwen3-8B、Gemma-3-4B 上将核心特质表达在 Persona Vectors 一致性基线 75 处分别提升 33.2、18.3、17.8 分。
OLIVE(OnLine InterVEntion)在每次迭代中让学生策略生成新前缀,教师自回归续写,学生基于教师生成的 token 计算交叉熵更新。它解决了离线 SFT 的序贯协变量偏移、前缀失败的碎片监督以及分布匹配蒸馏需要教师 token 概率的问题。
summary_zh: DRHeC 提出一种基于 RGB 的可微渲染框架,融合颜色与掩码几何特征,提升手眼标定精度与优化稳定性,并在 UR5e 真实实验中达到 88.9% 抓取成功率与 57.4% 插入成功率,相比 EasyHeC 分别提升 46.3 和 48.1 个百分点。
EHRFlow 是一个多边际流匹配框架,通过编码患者历史条件化未来动力学,支持不规则观测时间与任意预测 horizon。在超过 100 万患者的真实临床数据集及独立外部验证队列上,EHRFlow 提升 horizon-averaged top-5 临床代码准确率,并在受控反事实模拟中近似降压干预的已知效果。
关系型上下文学习(ICL)在支持集包含目标派生特征时会产生目标泄露失败模式,查询集本身不受影响。研究构建了14种合成泄露类型、对应20列,涵盖不同噪声、覆盖度、模态与关系距离。用冻结关系编码器加ICL头在RelBench数据库评估,Integrated Gradients可排序并移除可疑列,在泄露影响最大的设置下部分恢复性能。
论文提出 VIGOR-his 数据集,包含 11 座城市、三个大洲的 43,653 个地点四级配对,并构建 CrossTimeEdit 模型,将历史街景生成转化为编辑任务,以近期街景约束视角与不变外观、以卫星时序差异作为变化证据。
summary_zh: 研究测试了 Neural Cellular Automata(NCAs)在视觉推理任务中的表现,发现其通过严格局部连接和异步更新能解决大型迷宫、数独和 ARC-AGI-1 等挑战性任务。
研究通过简化交互界面与文本支架引导大语言模型智能体在拍卖与匹配场景中的决策表现。四种模型族的实验表明,升序拍卖界面显著降低出价偏差,收益说明与诚实陈述安全性的解释能改善选择,但智能体简短计划中的语言指标与行为改善并不一致。
研究通过提示和微调构建六个认知领域专家 LLM 变体,发现每个专家对相应脑区的预测更准确。该结论在三个基础模型和三个 fMRI 数据集上均成立,且仅认知领域干预有效。汇总对齐分数可能掩盖特定模型在区域上的差异。
summary_zh: PixExpo 提出"时间换空间"的像素级曝光框架,通过循环曝光调度与非迭代像素融合,在 MEX-Drive 数据集(48 名真实驾驶参与者)上将心率 MAE 从 13.94 bpm 降至 6.73 bpm,成功率从 25.95% 提升至 63.24%,无需硬件改动但需可编程帧级曝光控制。
LexiconVLA 提出可检索的原子动作代码本,实现跨任务复用。全局与细节代码本分别捕捉共享交互结构与细粒度执行变化,通过视觉-原子动作对齐将轨迹重建与动作码视觉预测结合。在 26 个 RLBench 任务上,BridgeVLA 未见任务成功率从 16.67% 提升至 34.17%,整体达 71.08%,为已报告结果中最高。
ThinQuant 提出数据选择与精确降维优化,将旋转校准所需校准数据降至数个数量级,并在 Llama-3-70B W4A4KV4 下 12 分钟完成校准、WikiText-2 困惑度 5.63(DartQuant 需 111 分钟、7.55)。
LLM-Guided Graph Pruning(LGP)框架利用 LLM 推理优化现有 ANN 图索引,替换节点低价值邻居并保留稀疏性与可导航性。在 DiskANN 和 HNSW 等图索引上的语义检索基准实验表明,LGP 相比原始贪心搜索和 LLM 重排序持续提升端到端检索性能。
研究通过2x2x2魔方预测任务评估视频生成模型的推理能力与计算成本。70M参数模型在0.1 PF-days训练后可见贴纸配置准确率达44.6%,1B模型需3.14 PF-days达83.7%。符号状态监督使20M模型在相同数据预算下帧准确率从31.1%提升至67.3%,表明学习状态变化表征可补充扩展。
CineSubBench 是一个基于多语言电影字幕的长上下文理解评测基准,覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目。基准包含 7 项任务,涵盖叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全。评测显示,9 个 LLM 中情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。
针对隧道、管道等轴对称结构中 LiDAR SLAM 沿特征弱方向的不可约束漂移问题,本文提出 Degeneracy-orthogonal Contour Offset Descriptor(DeCOD),一种基于横截面边界的结构对齐几何描述子。
HyperZip 利用扩散大语言模型与多Token预测加速LLM数据压缩,通过超网络生成数据特定更新来适配目标数据。该方法在压缩率与吞吐量之间取得更优平衡,相比现有基线实现更高压缩率和更快解码速度,且无需昂贵微调。
summary_zh: 该研究通过分析被投毒高斯混合数据上的二次神经元,推导出成功后门攻击所需触发器强度 α 与投毒比例 π 的标度关系:懒惰学习下 α ∝ π^(-1/2),特征学习下 α ∝ π^(-1/4)。
论文提出FABLE数据集,包含190,911个英语提示变体,源自174K条真实用户写作类任务提示。评估34个开源权重大语言模型后发现,模型不会传播拼写等表面错误,但会镜像用户提示中的高阶修辞与词汇特征;提示词流利度越低,模型回复质量与流利度均显著下降。
VidScribe 是一个覆盖 T2V、R2V、I2V、V2V 四种生成模式的视频文本诊断基准,包含 803 个人工验证样本和 12 轴正交因子空间。评测 11 个商业与开源系统后发现,视频文本能力非单一,I2V 最稳定,V2V 编辑是主要瓶颈,且退化集中在文本结构与时序因素。基准对齐的偏好优化可带来可测量的视觉文本生成提升。
T$^2$Mem 在无需外部记忆支持的情况下,让预训练的视觉-语言-动作策略通过测试时训练将观测历史编码为紧凑的快速权重。在 16 个 RoboMME 任务上,平均成功率从 17.93% 提升至 56.83%,推理速度较显式方法至少快 3 倍。
Dyad 在预训练 LLM 上附加环境条件动作编码器,并行嵌入候选动作描述并与模型内部状态打分。冻结 LLM 仅训练动作编码器在四个未见过环境中取得一致提升;联合优化在 ALFWorld 上相对 9B 模型获得 3.80% 绝对增益,同时改善通用知识、推理与编码能力。
研究发现大语言模型在内部以规范序(如字母序或时间序)组织多值关系,集合生成可拆分为检索、内部排序和下一元素选择三阶段。当提示词要求偏离该规范序构建知识库时,模型生成完整集合的可靠性显著下降。论文已被 AKBC@EMNLP2026 接收。
AffectReveal 提出事件锚定情感识别(EGER),在 10,052 个视频和 10,734 张图像上构建 EGER-Bench,覆盖 11 种情感。实验显示事件上下文将人类识别准确率从 33.96% 提升至 72.08%。该框架无需微调,在三个下游模型和四种输入设置下平均 UAR 提升 5.26–10.53 点,未微调模型在 12 项对比中全部超越微调基线。
该方法从手部和物体轨迹输入出发,输出考虑中间路径点、环境障碍、时间偏移和不同起止构型的高质量非线性轨迹扭曲。基于接触分布的利用,能够可靠地计算复杂高维灵巧手部轨迹。实验在公开人类手部运动数据集的 4 个演示共 12 种变体上进行基线对比,并展示了跨不同操作器的泛化能力,结果和代码将在发表时公开。
summary_zh: ThuRunel 是一种面向医疗美容、法律咨询、教育规划等高 stakes 咨询场景的 AI 咨询智能体,采用动态解耦框架决定提问时机、何时停止、自主解决或转交专家。
Koa-action 将分类等原子动作约束为单 token 输出,通过监督微调实现确定性一步解码。在生产意图路由基准上达到 85.5% 准确率,与 Claude-4.8-Opus、Gemini-Pro-3.1 持平,领先 GPT-5 和 Gemini-2.5-Pro;响应约半秒,中位速度较前沿模型快最高约 7.5 倍,同时支持多模态输入与多标签输出。
研究使用探针和对比方向分析 Gemma 4 31B 对九种非洲语言及三种对照语言的表征相似性。英语迁移效果因语言和层而异,非洲语言间的 Africa/West 对比方向在多个层上比与对照语言更对齐。
summary_zh: 研究探讨预测性监督如何塑造视觉-语言-动作(VLA)策略学到的表征。通过控制目标构建、预测范围和训练条件的对比实验,发现不同预测接口产生显著不同的预测结果和视觉表征,包括空间、动力学和动作信息在陌生场景中的迁移。
ThinkingGuard 是针对多模态大语言模型隐式风险检测的训练框架,结合 Step-Supervised Structured Reasoning 与 step-reward Monte Carlo Tree Search 探索推理轨迹,并通过 Dual-Constraint Preference Alignment 蒸馏到模型中。
PILLAR是一种隐私保护检索增强生成(PPRAG)系统,基于私有信息检索(PIR)技术,在服务器持有语料库的情况下,客户端可获取与查询最相似的k个文档而服务器无法获知查询内容或访问模式。
LoopICL 采用单模块循环架构,将参数规模与计算深度解耦,在相同计算量(FLOPs)下以近 90% 更少参数达到 TabICLv2 在 TabArena 和 TALENT 上的水平。用户可在推理时通过循环次数与学习退出门在性能与成本之间权衡。
summary_zh: 该研究提出一种基础模型引导的拓扑感知语义风险场,将操作安全从碰撞避免扩展到语义风险感知。基础模型为每个被操作物体/场景物体对提供六个方向性风险权重和特定配对的空间衰减尺度,结合体素化3D场景几何与拓扑屏蔽和测地空间衰减。
FastGuide 采用并行与自回归混合解码加速扩散语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码快 4.4×,生成质量相近。它每步一次奖励模型反向传播并复用 guidance 生成多个 token,利用 KV cache 和注意力稀疏重计算逐步 unmask token,并对模型不自信的 token 延迟解码。