可微分声学仿真重建声道
论文提出可微分且 GPU 加速的声道声学模拟器,通过梯度下降从声音重建声道形状。技术贡献包括频域流体公式(比时域有限差分并行度高 70 倍)、可微分湍流模型以及神经网络参数化几何。实验覆盖 11 语言的自监督声道编码,以及与 MRI 生成模型耦合实现无配对数据的动态声道重建。
论文提出可微分且 GPU 加速的声道声学模拟器,通过梯度下降从声音重建声道形状。技术贡献包括频域流体公式(比时域有限差分并行度高 70 倍)、可微分湍流模型以及神经网络参数化几何。实验覆盖 11 语言的自监督声道编码,以及与 MRI 生成模型耦合实现无配对数据的动态声道重建。
论文提出 Elastic Dictionary Learning Networks(EDLNets),一种基于字典结构先验的新型 ResNet 架构,在多个数据集、主干网络和威胁模型上显著提升对抗鲁棒性与泛化能力。实验表明该方法是首个验证字典结构可在强自适应攻击下可靠增强深度学习鲁棒性的工作。
SABLE(Sparse-view Animal Behavior Latent Embeddings)是一个自监督框架,通过几何归纳偏置和多视角 Transformer,结合单目深度与姿态估计先验,从极稀疏视角重建 3D 动物行为。
Homo-RAG 是一个基于大语言模型的基因功能预测框架,结合同源引导的多跳检索与证据感知排序,利用斑马鱼与人类直系同源关系从 ZFIN、UniProt 和 PubMed 获取证据。
summary_zh: Google Cloud Gemini Enterprise DevEx 计划通过内部 Sprint 走查开发者工作流,不使用内部凭证或捷径,识别并修复摩擦点。
研究者构建了一个包含超过11000张标注图像的新数据集,用于识别图像中对象的拓扑关系。测试中,VGG16等深度学习方法验证准确率达到89.55%,显著优于传统机器学习模型。结果表明迁移学习在拓扑关系分析中的有效性,为空间推理研究提供了新基准。
BreakingWeb 通过在七家自托管网站的 519 组任务对上施加确定性、可检测且可恢复的环境干预,构建了挑战性浏览器使用基准,涵盖 29 种干预家族。评估六种主流浏览器智能体、三种仅看截图的 GUI 智能体及人类后,干预使智能体通过率平均下降 22.9%,近半数任务被推翻;75% 的失败属于智能体在未完成实际变更时声明成功。代码、数据与环境已公开。
ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。
研究比较了卷积神经网络与预训练音频变换器在蜂后缺失检测上的表现,基于2024年10月至2026年8月间5,129段录音、来自47个养蜂场的3,285个蜂箱数据。调制频谱图模型在未见蜂箱上AUROC达0.81、AUPRC为0.37,跨养蜂场泛化时性能下降。
summary_zh: 该研究将生成式大语言模型与弱监督技术结合,用于自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型。通过提示工程生成合成标签,方法具备成本效益和可扩展性,同时支持多标签与层次化分类。
行为评测把智能体拆解为可观测的离散动作(如是否先运行本地校验再提交、是否追问模糊需求),比端到端基准更能定位回归原因。评测框架将断言拆分为本地快速确定性检查,配合 LLM-as-a-judge 与批量评测监控稳定性,在提示词/工具/模型升级时提供安全网。文中示例基于 Antigravity SDK 的异步断言,验证智能体是否调用 SEARCH_WEB 而非凭记忆回答。
Brain-SAD提出一种受大脑启发的安全自动驾驶控制框架,通过动态恐惧信号在线决策长期常规交互策略与短期紧急碰撞防御策略。实验表明,该框架在任务完成和碰撞恢复时间上更短,在连续复杂交叉路口场景下可靠性更强。
Lookahead-R 将工具检索重构为资源约束下的序贯决策问题,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,并驱动代价敏感的不确定性引导蒙特卡洛树搜索。
GLaS-JEPA 直接预测当前编码器在掩码位置的连续表示,无需对比学习、离散目标或独立 EMA 目标编码器,并通过 SIGReg 表示空间正则化防止表征坍缩。
提出 JEPA 风格的世界模型,将动力学限制为双线性参数化,把建模负担转移至编码器,鼓励更丰富的表示并暴露系统的可控几何结构。该结构可结构性强制动作可恢复性,防止表示坍缩;非线性动力系统可通过变换变为双线性形式。在 2D 和 3D 控制任务中,从高维观测直接学习后规划时间减少近三个数量级,同时保持或提升控制精度,并支持更长时序规划与实时控制。
研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。
TRACE 是一种面向肿瘤学大语言模型的可部署树状关系结构增强框架,将昂贵的离线结构学习与轻量在线推理分离,在零样本设置下无需监督标签即可进行任务自适应证据选择。
论文提出 Kolmogorov-Arnold Classifier System(KACS),基于 Kolmogorov-Arnold 表示定理将目标函数分解为单变量子问题,为每个子问题分配独立规则集。
论文提出 Mara Chain,一种将拒绝候选保留并迭代细化为优化踏脚石的精炼过程,在 AppWorld、TerminalBench 2.1 和 MuSiQue 上以更少 rollout 取得更高性能提升。
推荐理由:提出将失败候选保留并迭代优化的 Mara Chain,在多个基准上以更少 rollout 提升性能,为 AI 系统自动演进提供可迁移方法。
Google 发布 autofinetune 项目,将自主研究循环应用于 LLM 后训练(SFT 与 GRPO),由 Tunix、Gemma 与 Cloud TPU 配合 Antigravity CLI 和 Gemini Flash 3.7 驱动。
Xiaomi-OCR-0 是一个统一的 0.8B 文档解析与 OCR 理解模型,基于 Qwen3.5-0.8B 训练,在 Real5-OmniDocBench、OmniDocBench v1.6 和 Wild-OmniDocBench 上分别取得 95.24、96.83 和 87.94 的成绩,五个 OCR 导向 VQA 基准平均 83.2。
论文提出基于 Transformer 的矩阵编码方法,通过共享麦克风级处理和掩码自注意力,实现任意麦克风阵列且支持可变麦克风数量。信号无关(SI)编码从阵列传递函数预测编码矩阵,信号相关(SD)扩展额外引入观测麦克风信号。两者在 LibriSpeech 模拟场景训练并在源类型、未见麦克风数量和源数量变化上评估,SD 整体强于 SI,均优于传统最小二乘编码。
本文提出一种仿人型、200 mm长、220 g重的17-DoF 3D打印机械手,基于双向拮抗肌腱路由机制实现掌侧与背侧双向抓取。实验显示电机到关节传动误差平均3.0%,关节带宽平均13.2 Hz,最大指尖力29 N,定位重复性达0.15 mm,Kapandji评分8,完成全部33种GRASP抓取类型验证。
研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。
Google 开发者博客第二部分演示了基于 ADK 的 Customer Support & Returns Agent,在 Gemini Enterprise Agent Platform 上引入 Model Armor、Semantic Governance Policies 与 Agent Anomaly Detection 三层运行时治理。
推荐理由:原文给出了三层运行时治理的具体分工与闭环方式,读者可据此理解零信任智能体在平台侧如何覆盖单请求与多轮会话两类边界。
研究者训练了一个带情景记忆缓冲区的循环神经网络(RNN),通过贝叶斯推理持续预测自然电影中的场景并推断上下文。上下文以低秩方式调节 RNN 的循环连接(工作记忆基础),模型活动模式与人类 fMRI 响应最匹配。上下文同时调节情景记忆检索,模型基于内容相似性和上下文相似性检索记忆,比无上下文调节的模型学习更快。
summary_zh: 机器学习领域多数论文的实证结果难以复现,代码也常不可获取,阻碍研究进展。该论文分析并量化了这些问题,提出在不具备可复现性时提升结果可检查性的具体方案。
研究提出多智能体框架(故事智能体、图像智能体与评论智能体协作)生成逼真的多模态假新闻,覆盖科学、健康与娱乐三大领域,共生成超过 9,000 条配对多模态新闻帖子,并基准测试了 16 个开源与闭源多模态大语言模型的自动检测能力。
FunKAN 在 MRI 去 Gibbs 伪影与解剖分割上达 SOTA,但 11.6M 参数、8.7 GFLOPs 难以部署于边缘医疗设备。
提出 Selective Lookahead 机制解决基于注意力模型的流式语音识别问题,通过有界前瞻分块编码器与动态未来分块解码,在 LibriSpeech test-clean 上以 306 ms 中位延迟达到 6.5% WER 的静态前瞻最佳精度,等待预算将延迟尾部控制在静态基线 90 百分位以下 0.1 个 WER 点。该论文已被 IEEE SLT 2026 接收。
TeAR 是一种策略无关的测试时自适应方法,在操控策略输出端引入轻量 Transformer,结合关节温度、电机电流、供电电压等实时遥测信号,对动作进行放大、阻尼或偏置修正。在 18 个策略-任务对上评估,含退化模型失配时 TeAR 成功率为 31.8%,高于基线 25.6% 与假设模型逆的 30.6%;真实机械臂上加热场景成功率提升 10-15%,无需在机器人端微调。
研究测试了认知多样性是否驱动多智能体辩论(MAD)收益,对比23个模型、5项任务、5500+次实验。发现辩论在匹配预算下与自一致性采样持平或更差,角色提示降低准确率,混合模型团队表现取决于成员能力而非异质性,且收益主要来自首轮回答。同时指出辩论转录会静默溢出上下文窗口,修正后辩论与采样差距从-1.8分变为持平。
推荐理由:论文通过预算匹配的严格对照实验,对多智能体辩论的收益来源提出了新解释。
Google 在 Gemini Enterprise Agent Platform 推出 Agent Anomaly Detection,目前处于私测阶段,要求 ADK 1.2 或更高版本。
推荐理由:原文给出了异步检测、OWASP 映射和可编程回调等具体能力,读者可据此评估它能否在不拖慢响应前提下补齐行为审计缺口。
本文提出混合联合选择性优化(HJSO)框架,将参数分为高维剩余块与低维感兴趣参数(POI),先联合一阶优化再冻结其余变量、对 POI 做降维 Levenberg-Marquardt 精修。在矩阵特征值、逆 Bratu(PINN 求解)和 100 维非线性 Black-Scholes(DeepBSDE)三个问题上,HJSO 比联合一阶基线更快达到 POI 误差阈值并提升最终精度。
研究提出行与列尺度场概念,通过中观层面的 log-RMS 剖面刻画权重矩阵的通道分布,结合全局尺度与平衡核心精确表示矩阵。在 Pythia 四个规模检查点与三组初始化控制实验中,平衡后核心幅度剖面相似;混合桥预测池化形状偏离,字段在共享功能通道的对齐投影间一致,query/key 剖面遵循重分配的 RoPE 频率。
summary_zh: SENSE 将 EEG 信号合成语义语音,结合基于电极几何图的编码器与 EEG Semantic Conditioning,在 N400 数据集上同时提升声学与语义指标。
CLIP 与 SigLIP 编码器中存在单一主导方向,捕获图像-文本均值分离平方范数的 94.4-99.9%,表明均值分离分量近似秩一。
MATE 在 ALFWorld 134 个任务上分别用 Qwen2.5-14B 和 72B 达到 81.3% 与 93.3% 成功率,token 消耗约为原始轨迹的十分之一。该方法通过移除过时控制上下文、提取条件-动作-效果转换、经验证动作归一化和任务相关表示选择,将检索到的轨迹转为可执行记忆,无需额外 LLM 推理。实验表明经验证动作归一化是恢复检索经验有效性的主要机制。
summary_zh: 该研究提出将 CVaR 应用于每步即时成本而非价值函数,使任意期望型 POMDP 规划器仅需修改代价计算即可具备风险敏感性,同时保留有限时间误差界且与风险水平无关,并在风险中性极限下回归标准期望规划。
SkillWeaver 是一个智能体框架,通过探索可复用、参数化的闭环策略 Neural Interaction Skills(NIS)自主生成机器人数据。系统在 14.1K 场景中生成 39.1K 演示,并蒸馏为视觉运动策略,在仿真和真实操作基准上提升对新物体、空间配置和环境的泛化能力,支持零样本与少样本的 sim-to-sim 及 sim-to-real 迁移。