重新思考面向组合式与上下文学习的机器人操作的世界-动作模型
论文提出 Visual Goal-conditioned Action Reasoning(ViGAR),一种分层框架,将操作分解为视觉子目标规划器与子目标执行器,二者共享预训练世界模型表示。
论文提出 Visual Goal-conditioned Action Reasoning(ViGAR),一种分层框架,将操作分解为视觉子目标规划器与子目标执行器,二者共享预训练世界模型表示。
SoTa 是一种低成本电容式触觉皮肤,可在人手与机器人手上实现全掌覆盖,并保持 202 个 taxel 的共享布局,材料成本低于 $10。该传感器在 10,000 次加载-卸载循环后保留超过 97% 的初始响应范围,轨迹在 1,280 次紧握折叠循环中保持连续。
Awomo-PhysicalRSI 团队提出 Awomo-SimDataEngine,把资产与场景生成接入机器人演示合成:ISArt 生成刚体与铰接物体,Unravel 从图像重建可编辑场景,SimForge 从文本构建单房间与多房间环境,PolicyForge 绑定任务与机器人本体产出可回放演示。
VDOT++ 提出统一蒸馏框架,将同一训练方案分别用于 text-to-video、image-to-video 和 condition-based 生成三类任务。
PocketSplat 是一个前馈框架,用于在给定输出预算下构建移动端高斯资产。它在预测的世界空间中组织稠密几何感知潜在候选,对局部潜在单元分配精确整数容量,仅对保留候选解码完整高斯属性。
论文提出跨模态平面图像配准方法 CDPM,通过几何一致的跨模态 patch 对渐进适配 DINOv3,并构建 DINO-Centric Feature Pyramid,让多尺度 DINO 表示主导对应关系估计、轻量 CNN 分支辅助局部细化。
FORESIGHT 提出双流架构,用两个共享权重、输入编码器与 KV cache 的 Siamese LLM,让一个持续处理输入 token,另一个超前运行以预测未来上下文、规划未来计算并生成响应。
研究者提出空间落地手势生成基准,含约 2K 条来自自然 VR 对话的指向标注片段与真实 3D 指涉对象,要求系统判断何时、如何及在何处指向,并分离时间对齐、空间落地与自然度三项评估。该基准提供流匹配基线 MM-Conv-Flow,与独立检索系统和真人动作对比后发现,几何落地可超过真人指向但自然度并无提升。这是 ECCV 2026 HSI Workshop 指涉手势挑战赛基准。
研究者推出电商跨视频推理基准 AdsCVR,含 2,483 个视频和 6,110 个问答对,覆盖六个推理维度,并提出智能体框架 AdSeek,在多轮探索中动态选择视觉与音频工具主动获取证据。
研究者推出 NegT2IBench,包含 4,800 条提示,覆盖两种属性类型与四类关系,按极性组织以区分否定与提示复杂度的影响。基于检测器的评分在 600 张图像、三名标注者上与至多 30 倍大的视觉语言评判一致,而仅用其一小部分 GPU 内存。覆盖 11 个 T2I 模型与 211,200 张图像,九个模型在单条否定句上得分低于单条肯定句,41.5% 失败句恰好渲染了提示禁止的内容。
研究通过受控的 anchor–stress 协议评估文本编码器诊断与去噪器干预,提出纯文本的 Compositional Stress Index(CSI),在 SD1.5、SDXL 和 SD3 文本路径上区分常见与罕见组合,并提供上游诊断坐标。
ReSCUE 提出面向未切分长手语视频的同传 SLT 统一框架,对齐真实流式条件下的训练与推理。框架结合推理感知训练、稳定重译与句子提交机制,处理部分输入、非手语停顿与多句上下文。标准句级基准上延迟更低、低延迟下翻译质量最佳;长视频数据集上接近使用真实句边界的离线 oracle 系统,且延迟显著更低。
OmniAct3D 把基于视觉基础模型(VFM)的透视视角 3D 检测器适配到等距柱状投影(ERP)全景输入,提出 ERP-Ray Geometry Adapter(ERGA-Ray)、Visual-Action Reasoning Chain(VARC)与 Appearance-Guided Heading Expert(AGHE)三个模块。
RYOPO 提出端到端可训练的查询式 RGB-D 集合预测器,联合完成检测、分割与 9-DoF 位姿估计,无需 CAD 形状先验或单独训练的实例分割器。共享图像与场景编码避免逐物体裁剪编码,在 NOCS 上显著优于已发表的 RGB-D 联合检测与位姿估计结果,并在 REAL275 与 HouseCat6D 全物体评估中达到与两阶段方法相当的性能。
研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。
研究者提出 FaVOS 基准,用于评估目标在长视频中仅间歇出现的低时间可见度场景下的视频目标分割(VOS)方法。在该场景下,标准 J&F 指标会把评测退化为“目标缺席分类”,空预测在目标缺席帧上获得高奖励,导致一个简单的空掩码预测器也能胜过 SAM 3 等强模型。为此论文提出 Volumetric J&F,将掩码序列作为时空体评估,削弱目标缺席奖励的主导地位,同时保留对分割质量与时间结构的敏感度。
ViTok 将 AM-RADIO 式学生模型(由 SigLIP2 与 DINOv3-L 蒸馏)整合为兼顾全局识别与密集语义的多教师蒸馏方案,采用 CLS/patch 分离适配头、非对称 cosine/MSE 损失、DINOv3-L 初始化、教师重加权、MIM 与 PHI-S 特征平衡。
研究提出检索—阅读鸿沟:文档视觉语言模型(VLM)即使检索到正确页面,也常不利用其中证据。在带可追溯证据的 FoveaDoc-Bench 上,检索几乎覆盖全部证据页,但加入 CPU-OCR 文本使严格准确率提升 13 至 16 个百分点,精确文本层约使增益翻倍。
研究提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 事实绑定、L2 关系组合、L3 跨观察一致性、L4 变换下状态判断四级空间状态构建与使用。
论文提出免训练框架 TRAC,用于高效自回归(AR)视频生成,针对分块去噪轨迹顺序耦合导致近似误差累积与传播的问题,给出稳健累积调度(RCS)、自回归轨迹感知引导调度(ATGS)与谱结构校正(SSC)三个组件。在 SkyReels-V2 和 FramePack-F1 上实验显示,TRAC 相比现有方法取得最高推理效率与最佳生成质量。
论文提出 Spectral Correction Guidance,用谱对齐作为准则评估并校正引导扩散采样过程。该方法无需训练,可跨扩散骨干与条件生成任务使用,不修改底层模型。在 text-to-image 生成中较基线引导方法提升偏好指标,在 ImageNet 上优于 CFG,且在更少的去噪步数下仍保持改进。
SymRegFlow 是一种对称正则化流匹配框架,可在无真值新视角 RGB 监督下实现连续视角的多视角一致视频生成。它将源视角几何扭曲为噪声锚点,结合掩码双锚点监督与跨锚点去噪输出一致性,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优。在 nuScenes 上,其 FVD 较最佳基线降低超过 31%,FVD 与 FVMD 均为被评估基线中最低,源条件推理的 FID 与实例保持也最佳。
提出 IG-VLA 框架,让 VLA 模型在视觉表示空间中想象任务相关的未来场景演化,并用 Scene Gist Memory 将推理得到的场景-行为关联压缩为 Scene Gist Token,避免推理时显式生成未来画面。
研究者提出 GRAFT,一种持续多教师蒸馏框架,让统一骨干网络从开放式基础模型序列中逐步习得能力。新教师加入时,GRAFT 将已蒸馏模型作为教师以保留既有能力,学生同时从旧模型与新教师学习,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 调和异构教师的表征几何。
DAGS 是一种轻量、无注意力的解耦外观与几何条件方案,引导冻结图像 DiT 生成高保真、可独立控制的渲染结果。两个小型卷积编码器每帧计算一次条件特征,以逐层逐元素残差注入图像 token,避免通过注意力堆叠条件带来的二次开销。
MeshQuery 是一种免训练的智能体 UV 展开方法,用 VLM 结合边选择工具规划贴合艺术家意图的接缝。它通过可查询网格表示与 DSL 按需检索网格信息,把接缝计划写成紧凑算子程序并依据 UV 质量反馈迭代优化。
OctLLM 把几何表示为显式八叉树占据 token 序列,并通过随机清空倒数第二层节点、省略后代生成更短的 Sparse Octree(S-Octree),用于位置感知掩码建模生成与 3D 理解。
DeskForge 是一个可控桌面环境,通过组合与探索真实应用生成大规模监督数据,并融合截图、可访问性树与窗口几何信息形成密集元素标注。研究者据此构建 DeskForge-1M,包含 1.2M 条标注桌面观察与 159.7M 个元素实例,并在 200K grounding 样本上微调四个视觉语言模型。
论文提出 BenchGuard,首个对执行式智能体基准进行跨工件联合审计的框架,用前沿 LLM 按结构化协议交叉验证基准工件,可选地纳入智能体解法或执行轨迹作为诊断证据。
该研究首次系统分析了智能体编码任务中的 token 消耗模式,在 SWE-bench Verified 上追踪八个前沿 LLM 的轨迹并评估模型对自身 token 成本的预测能力。
论文将突变分析应用于多会话智能体状态投影层的不变式套件,发现常规验证会认证一个让移除事件身份去重的一阶突变体存活的套件。冻结修复后的十二项检查套件并对抗读者指定的十个突变体运行,杀死五个;五个存活者分为从未激活与内部状态损坏两种模式。作者枚举七个判别维度,按未覆盖维度各添加一个夹具并复用现有 oracle,五个存活者全部死亡,公开含冻结哈希与运行日志的 artifact。
SimuVerity 是一个包含 101 个文本到可执行 Simulink 模型生成任务的基准,覆盖十个工程领域,用于评估智能体是否真正满足工程需求。其分层评估器先检查交付物、可执行性与工程合格性,再从六个维度打分;六个智能体系统的最佳总分仅 42.86。结果显示结构相似性不能代表工程性能,部分高分模型仍存在严重视觉布局混乱。
研究训练一个标量条件、状态保持的 sequence-to-sequence 深度学习模型,根据给定位移历史预测黏弹性黏附接触的完整力演化轨迹,覆盖短程与长程黏附区间。
论文提出 DAGR,用多尺度门控交叉注意力把任意后融合编码器的静态目标嵌入细化为状态条件化表征,并以门控残差和差分感知注意力规则约束细化过程。理论分析指出后归一化放置会破坏“闭合门时返回输入”的条件,在冻结检查点上造成损失,恢复该条件可部分挽回。OGBench 上 DAGR 改进导航任务、其他任务持平或落后于基线,消融显示增益来自门控残差而非差分偏置,代码已开源。
研究者提出弹性形状变分自编码器 ES-VAE,一种面向骨架轨迹的几何感知生成模型,基于 Kendall 形状流形上的 TSRVF 表示,可消除刚性平移、旋转、全局缩放与时间速率变化。
论文提出一种新颖且简单的非可逆采样方案,用于贝叶斯混合模型(组件数固定或可变),在多种场景下显著优于经典采样器,尤其在收敛阶段和组件存在不可忽略重叠时。理论上,该非可逆方案的渐近方差不会比标准方案差超过 4 倍;尺度极限分析表明其可将收敛时间从 O$(n^2)$ 降至 O$(n)$。
论文针对 score 扩散模型给出 KL 散度下的收敛保证,聚焦源自 Ornstein-Uhlenbeck 半群及其动力学对应版本的固定步长模型。研究放宽了以往要求 score 函数或其近似一致 Lipschitz 的限制,为任何对标准高斯分布具有有限 Fisher 信息的数据分布提供简单、改进且尖锐的 KL 收敛界。论文编号 arXiv:2308.12240v3。
论文提出惩罚非可逆 Langevin 算法,用于从定义在紧凸集上的约束分布 π(x)∝e^{-f(x)}1_C(x) 中采样。算法将平方距离惩罚与保持惩罚 Gibbs 分布的常数或相容状态相关反对称扰动结合,在 log Sobolev 不等式下给出全梯度算法的非渐近全变差界,在随机梯度下建立 2-Wasserstein 界。
论文提出 CVaR 惩罚生成粒子算法(CVaR-GPA),一种面向重尾目标的微调算法,可基于预训练模型输出样本、无需访问其内部架构。该算法在四个目标上验证,包括 Ohio River 流域日径流(d=64)与 Fama-French 投资组合(d=25),尾指数介于 1.05 到 3.34。
论文提出 SCAP(Stiefel Cross-Attention Pool),用 K 个专家池经 cross-attention 组合成样本专属双线性映射,替代 SPDNet 中堆叠 BiMap 与 ReEig 的固定滤波结构。