跳到正文

全部动态

今日 368 条
今天9月30日周三
  1. arXiv · Audio and Speech50

    可微分声学仿真重建声道

    论文提出可微分且 GPU 加速的声道声学模拟器,通过梯度下降从声音重建声道形状。技术贡献包括频域流体公式(比时域有限差分并行度高 70 倍)、可微分湍流模型以及神经网络参数化几何。实验覆盖 11 语言的自监督声道编码,以及与 MRI 生成模型耦合实现无配对数据的动态声道重建。

  2. arXiv · Neural and Evolutionary Computing28

    Elastic Dictionary Learning Networks(EDLNets)提升对抗鲁棒性与泛化能力

    论文提出 Elastic Dictionary Learning Networks(EDLNets),一种基于字典结构先验的新型 ResNet 架构,在多个数据集、主干网络和威胁模型上显著提升对抗鲁棒性与泛化能力。实验表明该方法是首个验证字典结构可在强自适应攻击下可靠增强深度学习鲁棒性的工作。

  3. arXiv · Computation and Language48

    构建具有挑战性的浏览器使用任务:基于受控环境干预的 BreakingWeb 基准

    BreakingWeb 通过在七家自托管网站的 519 组任务对上施加确定性、可检测且可恢复的环境干预,构建了挑战性浏览器使用基准,涵盖 29 种干预家族。评估六种主流浏览器智能体、三种仅看截图的 GUI 智能体及人类后,干预使智能体通过率平均下降 22.9%,近半数任务被推翻;75% 的失败属于智能体在未完成实际变更时声明成功。代码、数据与环境已公开。

  4. arXiv · Robotics30

    ATLAS:通过对齐传输潜在结构实现可靠世界模型规划

    ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。

  5. Google Developers · AI40

    如何评估、迭代与守护 AI 编程智能体:Harness Engineering 行为评测方法解析

    行为评测把智能体拆解为可观测的离散动作(如是否先运行本地校验再提交、是否追问模糊需求),比端到端基准更能定位回归原因。评测框架将断言拆分为本地快速确定性检查,配合 LLM-as-a-judge 与批量评测监控稳定性,在提示词/工具/模型升级时提供安全网。文中示例基于 Antigravity SDK 的异步断言,验证智能体是否调用 SEARCH_WEB 而非凭记忆回答。

  6. arXiv · Robotics35

    Bilinear World Models:通过双线性参数化学习表示与结构化动力学以实现高效控制

    提出 JEPA 风格的世界模型,将动力学限制为双线性参数化,把建模负担转移至编码器,鼓励更丰富的表示并暴露系统的可控几何结构。该结构可结构性强制动作可恢复性,防止表示坍缩;非线性动力系统可通过变换变为双线性形式。在 2D 和 3D 控制任务中,从高维观测直接学习后规划时间减少近三个数量级,同时保持或提升控制精度,并支持更长时序规划与实时控制。

  7. arXiv · Artificial Intelligence43

    自发现 RL 在经验时代:学习历史是资产还是负担?

    研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。

  8. arXiv · Machine Learning62

    Mara Chain:重新思考失败作为 AI 系统自动演进的踏脚石

    论文提出 Mara Chain,一种将拒绝候选保留并迭代细化为优化踏脚石的精炼过程,在 AppWorld、TerminalBench 2.1 和 MuSiQue 上以更少 rollout 取得更高性能提升。

    推荐理由:提出将失败候选保留并迭代优化的 Mara Chain,在多个基准上以更少 rollout 提升性能,为 AI 系统自动演进提供可迁移方法。

  9. arXiv · Computer Vision34

    Xiaomi-OCR-0 技术报告

    Xiaomi-OCR-0 是一个统一的 0.8B 文档解析与 OCR 理解模型,基于 Qwen3.5-0.8B 训练,在 Real5-OmniDocBench、OmniDocBench v1.6 和 Wild-OmniDocBench 上分别取得 95.24、96.83 和 87.94 的成绩,五个 OCR 导向 VQA 基准平均 83.2。

  10. arXiv · Audio and Speech23

    信号无关与信号相关神经 Ambisonic 矩阵编码:支持任意阵列与可变麦克风数量

    论文提出基于 Transformer 的矩阵编码方法,通过共享麦克风级处理和掩码自注意力,实现任意麦克风阵列且支持可变麦克风数量。信号无关(SI)编码从阵列传递函数预测编码矩阵,信号相关(SD)扩展额外引入观测麦克风信号。两者在 LibriSpeech 模拟场景训练并在源类型、未见麦克风数量和源数量变化上评估,SD 整体强于 SI,均优于传统最小二乘编码。

  11. arXiv · Robotics31

    双向拮抗肌腱驱动灵巧机械手的设计与验证

    本文提出一种仿人型、200 mm长、220 g重的17-DoF 3D打印机械手,基于双向拮抗肌腱路由机制实现掌侧与背侧双向抓取。实验显示电机到关节传动误差平均3.0%,关节带宽平均13.2 Hz,最大指尖力29 N,定位重复性达0.15 mm,Kapandji评分8,完成全部33种GRASP抓取类型验证。

  12. arXiv · Artificial Intelligence50

    Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

    研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。

  13. Google Developers · AI60

    构建零信任 AI 智能体:基于意图而非语法的运行时治理

    Google 开发者博客第二部分演示了基于 ADK 的 Customer Support & Returns Agent,在 Gemini Enterprise Agent Platform 上引入 Model Armor、Semantic Governance Policies 与 Agent Anomaly Detection 三层运行时治理。

    推荐理由:原文给出了三层运行时治理的具体分工与闭环方式,读者可据此理解零信任智能体在平台侧如何覆盖单请求与多轮会话两类边界。

  14. arXiv · Neural and Evolutionary Computing36

    一种基于上下文维护和检索记忆的神经网络

    研究者训练了一个带情景记忆缓冲区的循环神经网络(RNN),通过贝叶斯推理持续预测自然电影中的场景并推断上下文。上下文以低秩方式调节 RNN 的循环连接(工作记忆基础),模型活动模式与人类 fMRI 响应最匹配。上下文同时调节情景记忆检索,模型基于内容相似性和上下文相似性检索记忆,比无上下文调节的模型学习更快。

  15. arXiv · Audio and Speech35

    Selective Lookahead for Attention-Based Streaming ASR

    提出 Selective Lookahead 机制解决基于注意力模型的流式语音识别问题,通过有界前瞻分块编码器与动态未来分块解码,在 LibriSpeech test-clean 上以 306 ms 中位延迟达到 6.5% WER 的静态前瞻最佳精度,等待预算将延迟尾部控制在静态基线 90 百分位以下 0.1 个 WER 点。该论文已被 IEEE SLT 2026 接收。

  16. arXiv · Robotics40

    TeAR:在执行器退化下的操控策略测试时自适应

    TeAR 是一种策略无关的测试时自适应方法,在操控策略输出端引入轻量 Transformer,结合关节温度、电机电流、供电电压等实时遥测信号,对动作进行放大、阻尼或偏置修正。在 18 个策略-任务对上评估,含退化模型失配时 TeAR 成功率为 31.8%,高于基线 25.6% 与假设模型逆的 30.6%;真实机械臂上加热场景成功率提升 10-15%,无需在机器人端微调。

  17. arXiv · Artificial Intelligence62

    Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models

    研究测试了认知多样性是否驱动多智能体辩论(MAD)收益,对比23个模型、5项任务、5500+次实验。发现辩论在匹配预算下与自一致性采样持平或更差,角色提示降低准确率,混合模型团队表现取决于成员能力而非异质性,且收益主要来自首轮回答。同时指出辩论转录会静默溢出上下文窗口,修正后辩论与采样差距从-1.8分变为持平。

    推荐理由:论文通过预算匹配的严格对照实验,对多智能体辩论的收益来源提出了新解释。

  18. arXiv · Neural and Evolutionary Computing25

    Hybrid Joint-Selective Optimization:针对低维感兴趣参数的降维 Levenberg-Marquardt 精修

    本文提出混合联合选择性优化(HJSO)框架,将参数分为高维剩余块与低维感兴趣参数(POI),先联合一阶优化再冻结其余变量、对 POI 做降维 Levenberg-Marquardt 精修。在矩阵特征值、逆 Bratu(PINN 求解)和 100 维非线性 Black-Scholes(DeepBSDE)三个问题上,HJSO 比联合一阶基线更快达到 POI 误差阈值并提升最终精度。

  19. arXiv · Machine Learning33

    通过行与列尺度场观察 Transformer 权重的中观视角

    研究提出行与列尺度场概念,通过中观层面的 log-RMS 剖面刻画权重矩阵的通道分布,结合全局尺度与平衡核心精确表示矩阵。在 Pythia 四个规模检查点与三组初始化控制实验中,平衡后核心幅度剖面相似;混合桥预测池化形状偏离,字段在共享功能通道的对齐投影间一致,query/key 剖面遵循重分配的 RoPE 频率。

  20. arXiv · Computation and Language42

    记忆适配方法 MATE 提升具身智能体任务执行成功率

    MATE 在 ALFWorld 134 个任务上分别用 Qwen2.5-14B 和 72B 达到 81.3% 与 93.3% 成功率,token 消耗约为原始轨迹的十分之一。该方法通过移除过时控制上下文、提取条件-动作-效果转换、经验证动作归一化和任务相关表示选择,将检索到的轨迹转为可执行记忆,无需额外 LLM 推理。实验表明经验证动作归一化是恢复检索经验有效性的主要机制。

  21. arXiv · Robotics42

    SkillWeaver:通过神经交互技能的智能体探索实现规模化机器人数据生成

    SkillWeaver 是一个智能体框架,通过探索可复用、参数化的闭环策略 Neural Interaction Skills(NIS)自主生成机器人数据。系统在 14.1K 场景中生成 39.1K 演示,并蒸馏为视觉运动策略,在仿真和真实操作基准上提升对新物体、空间配置和环境的泛化能力,支持零样本与少样本的 sim-to-sim 及 sim-to-real 迁移。