OTT3R:用 1% 计算量实现多视角 3D 重建与快速数据集生成
OTT3R 将 π³(959M 参数)蒸馏为 102M 参数学生模型,实现 9.4× 压缩、推理提速 7×,训练仅需 VGGT 1.6% 计算量。集成伪标签流水线在 2 张消费级 GPU 上 3.5 小时生成 667K 图像密集点图与 SE(3) 相机位姿,COLMAP 失败序列均成功。
OTT3R 将 π³(959M 参数)蒸馏为 102M 参数学生模型,实现 9.4× 压缩、推理提速 7×,训练仅需 VGGT 1.6% 计算量。集成伪标签流水线在 2 张消费级 GPU 上 3.5 小时生成 667K 图像密集点图与 SE(3) 相机位姿,COLMAP 失败序列均成功。
提出一种教师-学生视觉蒸馏框架,将特权 CBF 教师的安全行为迁移到仅 RGB 的学生安全滤波器,用于动态环境中的端到端视觉导航。学生仅依赖短时序 RGB 历史、机器人速度和名义控制动作直接输出安全动作,教师在真实到模拟的动态 3D 高斯泼溅环境中利用真值状态构建安全约束,并通过考虑障碍速度不确定性及动作增强来缩小师生信息差距。
Pruned CTC 通过将对齐计算限制在目标 token 与 blank 的并集子集,同时保留全词汇归一化,证明词汇缩减在损失和梯度上等价于标准 CTC。实验显示,在 Zipformer-M 编码器和 180K 词汇下,全步内存降低 5.1×,步时仅增加 17%。
EnJoi 提出一种基于扩散模型的同化算法,通过学习联合状态分布并动态平衡当前状态与观测的置信度来恢复动力系统全状态。该方法在流体和交通流模拟中表现出更优的重构性能,尤其在观测稀疏且非均匀的场景下优势明显。
论文提出无监督定量方法 HSTA,分析 arXiv 学术预印本与 USPTO 专利申请的 30,000 条记录,通过 Transformer 句向量投影到超球面、Spherical K-Means 聚类与 UMAP 降维,追踪语义演变与商业化时滞。
论文 sweeping 八种 Agent 编排架构与五款 7-9B 指令模型,在 GSM8K、GSMHard、ARC、GPQA、MMLU 及可执行代码基准上最多 30 次调用,发现团队扩展收益高度任务依赖:算术题提升最高 17 分,其余基准最多 4 分。
推荐理由:用可验证的生成-变换分解解释不同架构在算术与多选任务上的收益差异,为团队扩展策略提供迁移方法。
KernelOnet 将核函数显式嵌入神经算子架构,用数据驱动核、物理信息核和混合核三种互补核替代 DeepONet 的隐式基函数网络。在三个基准和一个浅水波导工程问题上,KernelOnet 以更少可学习参数达到更高精度,无需内部解标签的无监督配置,且每次查询推理成本远低于逐实例求解器。
summary_zh: PACC 使用学习型压缩器将历史帧聚合为紧凑记忆 token,通过在线蒸馏训练:同一冻结生成器在压缩记忆下作学生、在完整历史下作教师,仅更新压缩器以对齐学生预测与教师目标。
论文研究大语言模型内在自修正在 BoolQ、GSM8K 和 Corr2Cause 上的修正行为,发现二次推理既可纠正错误,也可能把初始正确答案翻错,例如 Llama-3.1-8B 在 GSM8K 提升 25.5 个百分点但改变 19.1% 的初始正确答案。
推荐理由:研究揭示自修正可能把正确答案翻成错误答案,读者可据此评估何时值得启用二次推理。
LIBERO-MAX 是一个包含 8,000 对案例的基准,涵盖几何、观测、外观、杂乱和路径 8 类变化,每对案例固定任务、初始状态、策略种子和事件前动作序列,对比有无中途事件的任务执行表现。测试覆盖 14 个当前 VLA、混合和世界动作策略,事件导致成功率下降 11.0-25.7 个百分点。该基准为诊断机器人策略在执行中途面对环境变化时的失败提供了可复现的测试平台。
本文提出无教师自蒸馏一致性轨迹框架,去除外部教师模型,每轮训练时间减少 5 倍。模型采用三阶段课程训练,在 VoiceBank+DEMAND 上达到宽带 PESQ 3.01、ESTOI 0.87、SI-SDR 19.07 dB,优于基于教师模型的 3.57、0.87 和 12.8 dB。研究发现低步数几何调度最大化感知质量,高步数均匀调度有利于信号保真度。
GeoOutageBench 是一个评估 LLM 时空知识图谱问答能力的基准,融合停电记录、遥感、气象与领域本体等多模态数据。它提供从时空包含、共现分析到假设评估的分层查询分类,并支持用户配置对 NL-to-SPARQL 解释、本体效用和检索准确性的三项评估。基准代码、数据与结果在 arXiv:2609.36082 可获取。
该研究提出一种力到笛卡尔构型的闭合形式模型,以笛卡尔 backbone 中心线与累积材料扭转为广义坐标,避免迭代平衡求解。数值对比 GVS 模型,单段与三段机器人 tip-position 偏差分别为 8.91×10⁻⁶ 与 1.01×10⁻⁵,评估耗时 1.52μs 与 2.94μs,相对基线加速约 1864x 与 3348x。
论文提出 EDAR 框架,在推理时根据 RAG 响应前几个 token 的预测熵决定是使用检索结果还是升级到全长上下文处理,并在 LongBench v2 和 Infinity-Bench 上验证。预测熵与幻觉率高度相关(Pearson r=0.85),EDAR 保留纯长上下文 97.4% 的准确率,同时降低 70.7% 的 token 消耗,仅升级 18.2% 的查询。
推荐理由:用预测熵在推理时动态选择 RAG 或长上下文,可在几乎不损失精度的前提下大幅降低 token 支出。
StructRL 是一种在线 RL 框架,将长时序 VLA 任务分解为可验证的子任务,在前置子任务完成后才给予中间奖励,并按完成节奏缩放奖励。在 RoboCasa365 和 LIBERO-Long 上,基于 GR00T-N1.5 和 pi 0.5 的实验中,StructRL 一致优于已评估的在线 RL 基线。代码已开源。
CADENCE 是一种纯 CPU 原生的双专家架构,在 109 个 UCR 数据集上平均准确率 0.8864,仅比 HIVE-COTE 2.0 低 0.31 个百分点。每个数据集平均耗时 17.53 秒,通过内部验证元路由器在纯专家路由与置信度加权软融合间动态选择。代码和评估脚本已公开。
summary_zh: HPRO 提出分层渐进式奖励优化框架,通过 HD-Emo codec 将语音解耦为内容与风格偏好 token,缓解信息冲突并桥接帧级、词级与句级奖励差距。
论文提出 LLM 是"复调"(polyphonic)系统,输出由多个并行机制以不同可靠性组合而成,多个机制可共同完成同一任务而无单一不可或缺者。复调性使得单一声誉归因变得危险,作者据此提出以"可靠且受控的电路"为核心的理解框架,为 AI 信任提供可验证的内部组织判据。
summary_zh: 该研究在 Diffusion Transformer 预训练中引入跨视角类别 Token 对齐,将两个独立加噪的双时间步观测的类别 Token 表示与 EMA-teacher 目标对齐,与流匹配和局部 patch 目标联合优化。
研究测试了7个LLM、12种任务设计、3次独立运行,对3000条推文进行冒犯性语言与仇恨言论标注。同一模型与任务设计下中位Fleiss' κ达0.91,更换任务设计后Cohen' κ降至0.76。
summary_zh: DQ-MPCC 将四旋翼位姿表示为单位双四元数,把轮廓误差投影到双四元数流形切空间,并在期望机体坐标系中统一表达姿态与速度。
summary_zh: TMLN(Trajectory-Modulatory Landscape Navigation)将持续学习形式化为曲率损失景观上的最优控制问题,利用对角经验 Fisher 信息矩阵(FIM)定义局部 Riemannian 流形,并通过网络参数值的历史轨迹动态调节预条件器,直接集成到梯度更新中,从而在不依赖加法惩罚的情况下保护历史关键参数方向。
研究在零真实音视频资源场景下,仅用合成视觉数据自举音视频语音识别(AVSR)。团队合成超700小时说话人视频并微调预训练AV-HuBERT模型,在手动标注的加泰罗尼亚语基准上达到接近SOTA的性能,参数和训练数据远少于Whisper-large-v3,且优于纯音频基线、在声学降级下仍保持多模态优势。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,结合增强版 LongCat 模型与多智能体工作流,生成证据充分的综合报告。
研究提出一个10,000神经元脉冲神经网络(SNN)模型,基于Izhikevich动力学,由5,000个常规放电皮层神经元和5,000个内源性爆发DMN起搏器神经元组成。DMN层通过连续紧张性电流维持自主生物电节律,DMN到网络突触权重高于感觉层连接。数值模拟展示内源性起搏活动与外部感觉扰动如何产生持续自持的"自我"神经表征。
SAGE-Restore 提出一种基于笔画引导注意力机制的选择性修复框架,通过补丁级修复概率预测与像素级软门控控制修复应用范围。在满文古籍全页盲修复任务上,该方法达到 R-Recovery 0.463、RFS 0.626、U-Fidelity 0.968,在修复质量与内容保留之间取得平衡。论文已提交 IEEE ICASSP 2027。
该研究使用因果中介分析识别语言模型 sycophantic agreement 的机制:观点在最后一个 prompt token 的残差流中被早期整合,并通过一组稀疏的早期注意力头传递;消融这些头可显著降低奉承性同意,同时基本保持事实准确性。当观点通过无内容的 pushback(如
推荐理由:论文用因果中介分析定位了奉承性同意的机制,为更精准的对齐干预提供了可验证的切入点。
EmoRES-TTS 提出残差增强向量引导方法,将情感向量分解为共享分量与残差分量,在不微调主干的前提下分别控制。在 IEMOCAP 上,EmoRES 在 IndexTTS-2 和 CosyVoice2 上均超越 CoCoEmo,秩相关相对提升最高 118.8%,情感命中率相对提升最高 20.1%,人类评估中主导情感识别率相对提升最高 35.0%,自然度偏好达 63.8%。代码已发布。
STAIRCASE POLICY(S-WAM)将流匹配 VLA 转为 JEPA 风格的世界动作模型,把大动作块在去噪阶段交错切分为子块,近端动作可执行、远端动作持续精炼,并在子块边界用最新观测重预测未来潜变量以更新未执行动作。
研究在单个 NEMS 谐振器中利用两个相互作用模式,通过不同模态驱动幅度分配回放相同输入序列,并将响应拼接为单一特征矩阵。在 NARMA-2 上,相比单模式运行将方差归一化测试误差降低超过 28 倍,相比最优双模式设置降低超过 3 倍;线性记忆容量测量显示可回忆跨度仅少数符号,随延迟快速衰减。复用 NEMS 特征在非线性映射任务上的误差显著低于电气馈通特征。
SMat-Attention 通过引入具有结构化长程路由的因果掩码族,将 VC 维数 d 作为控制访问模式复杂度、预填充成本和解码内存的显式旋钮。d=1 恢复标准因果掩码,增大 d 允许更丰富的子集路由模式;硬路由构造的预填充复杂度为 O(T^{2-3/d}+T),固定时间窗流式解码每 token 使用 O(T^{1-1/d}) 缓存状态实现常数时间。
MATE 是一种基于强化学习的统一多模态模型后训练框架,让生成与理解分支轮流担任挑战者与求解者,挑战来自模型自身输出且随训练演化。在 Janus-Pro-1B 上,MATE 将 GenEval 提升 2.4 点、DPG-Bench 提升 1.7 点、九项理解基准平均提升 0.7 点,并增强图像-文本循环一致性。
研究复现了不确定性感知图神经网络在伦敦三区道路事故预测中的11项设计决策,仅4项在第二区复现成功,7项失败且4项符号反转。多种子评估显示参考架构在各区种子波动高达35.7点。在匹配历史深度下,所提模型与按累计历史事故数排序的无参数基线统计不可区分(-0.90点,p=0.61),而参考架构在18个保留窗口中全部败于基线(-17.37点,p<10⁻⁶)。
研究构建了 12,000 条文本数据集,涵盖 9 起灾害中人类原文、LLM 润色人类文、事实型 AI 生成文和情感型 AI 生成文,并测试 OSM-Det、Fast-DetectGPT、Binoculars 与 LLM 法官。
推荐理由:研究提供了实证证据,说明当前文本 AI 检测器在灾害推文中可靠性不足,读者可据此重新评估仅依赖文本检测来保障灾害信息可信度的做法。
论文提出 StepLearn,将单步迁移作为假设即时用于下一步,再经跨轮次验证后才持久复用,在 WebArena-Lite 和 ALFWorld 上相对 EvoTest 提升 2.2–12.7 个百分点。
推荐理由:提出了即时使用与跨轮次信任分离的非参数框架,在两个基准上相对最强基线提升最高12.7个百分点。
Zephyr 将 SOTA 音频降噪网络 Spiking-FullSubNet 转换为硬件友好版本,通过 QAT 与激活函数简化实现约 28× 功耗下降至 52.9nJ/32ms 音频帧,并在 PYNQ-Z1 FPGA 上以 100MHz 实现 0.727 实时因子。系统采用稀疏感知柔性 PE 阵列处理异构计算负载,面向手机、无线耳机与助听器等边缘设备低功耗推理。
Mirror-Score 是一个针对异手性 D-肽/L-蛋白复合物的推理专用校准评分框架,附带涵盖 4 个靶标家族、31 个晶体复合物的公开基准,其中 18 个有文献验证的亲和力数据。
论文提出均值场理论分析 dropout 在混沌边缘的行为,识别平滑与折角激活的普适类及对应标度指数,并推导出最大化正则化效果时 dropout 应集中于输入层。实验在视觉、语音和金融时间序列上验证,MLP 增益最一致,Transformer 增益较小。论文已被 ICML 2026 接收。
World4Scorer 将评分器构建为轨迹条件下的 JEPA 风格预测器,利用模拟器为所有候选轨迹提供结果监督,并用已执行轨迹的观测未来锚定预测器。在 NAVSIM-v2 上达到当前最优,闭环 Bench2Drive 上取得强结果,并在 OGBench-Cube 操控规划中提升表现。
LeRF 训练视觉语言模型构建并使用显式参考坐标系进行视角依赖推理,判断是否需要坐标系、定位参考实体并预测原点与实体中心坐标系,再通过轻量渲染器叠加到图像上供后续推理。研究采用监督微调与强化学习,在多个视角推理基准上超越基座模型与现有开源方法,同时提升坐标系定位与朝向估计效果。