FD-VAD:流式全双工语音的语义端点检测
FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。
FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。
InstCharVoice 提出一个统一框架,将自然语言指令映射到字符级声学控制,在 WordVoice-5A-zh 语料上使用 Qwen3-Omni 构建指令标注。模型通过关键词预测与接地感知损失加权,聚焦指令相关字符并预测其声学属性,再生成语音 token。实验显示在指令遵循和关键词级声学控制上优于代表性 ITTS 系统,同时保持自然度与字符级可控性。
HEIR 是一个包含 18,730 张图像的人体-实体交互基准,涵盖 6 种角色、105 种动作和 437 个名词,51.6% 的图像含多主体、62.1% 含多动作。CoRISP 利用共享实体身份组合角色条件证据,在 HEIR 上重复角色事件和共享参与者图像分别领先 2.87 和 3.82 Set mAP。代码和数据集已公开。
研究者与 K-12 教师协作,基于大语言模型(LLMs)共同设计了一套多智能体反欺凌模拟系统,用于生成真实校园场景,帮助学生提升应对欺凌的能力。该研究明确了 LLM 驱动的多智能体模拟系统的关键设计参数,为开发更有效、可扩展的反欺凌工具提供参考。
SPECTRA 是一种轻量级自主请求框架,通过显著性引导的定向扰动和高效认知轨迹分析,在预填充阶段量化智能体高维认知轨迹的拓扑发散,避免低效的输出解码。实验表明,GTA1-32B+InfiGUI-G1-3B 和 GTA1-32B+Holo1.5-3B 分别以 37.58% 和 39.24% 的平均请求率,保留了 93.44% 和 95.60% 的云端独占性能。已被 ACM MM 2026 接收。
HERO 是一个基于 ViT-G/14 的病理学基础模型,采用 DINO 和 iBOT 目标训练,并在约 57.5 万例临床全切片图像的 5 亿个图块上进行高分辨率 Gram 锚定微调。在公开基准上,HERO 在中心、扫描仪和染色变化下的鲁棒性最强,39 个切片级临床任务平均排名第一,6 个基准框架的等权综合排名最优。
研究者提出多深度时间融合(MDTF)脉冲神经网络架构,通过时间至首次脉冲(TTFS)延迟处理静态图像与事件流。网络采用四层卷积骨干与无监督脉冲时间依赖可塑性(STDP)逐层训练,在MNIST、Fashion-MNIST、CIFAR-10和N-MNIST上验证,选择性多深度融合在Fashion-MNIST和CIFAR-10上分别提升18.2和29.2个百分点。代码已公开。
提出一种结合深度学习与图像预处理的 OCR 模型,用于自动提取韩语发票中的关键信息。在收集的发票数据集上评估,达到 87% F1-score,且处理时间可忽略。
CoVLM-Bench 包含 2,196 对帧、35,136 条协同驾驶问答标注和 3 秒内 6 个航路点的规划目标。CoVLM-Drive 直接使用车路配对视角进行问答与规划,FDE 低于对比的 V2X 规划器,问答初始化与理由监督各自降低规划误差。
Perch 和 BirdNET 等生物声学基础模型虽能高精度识别物种,但置信度未经校准、难以解释为真实出现概率。研究利用 WABAD 全局标注声学数据集生成校准先验,并提出将声学预测与地理先验融合的新方法,在保持判别能力的同时改善校准性,为生物多样性监测提供更可靠的声学方案。
NeuroDyn-EEG 提出一种预训练框架,融合 Jansen-Rit 神经质量模型、leadfield 源投影与基于模拟的参数反演,在生理范围内用约 2.43M 可训练参数从标准 19 通道 EEG 估计 90 个 AAL 区域的 11 类区域参数及 1 个全局参数。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
NVIDIA 发布 VSS Blueprint 3.3,通过 Metropolis 视频搜索与摘要蓝图及 agent skills,帮助开发者构建可维护的视觉 AI Agent 系统,整合视频摄入、流处理、事件检测、检索、摘要与报告等管线,以降低生产级视觉 AI Agent 的构建与运行成本。
Condé Nast 与 AWS GenAIIC 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索系统,使用 TwelveLabs Marengo 嵌入模型对视频转录、视觉和音频进行语义搜索,将内容发现时间从平均 250 分钟降至 2 分钟以内。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。
研究者开发了一个不依赖系统发育的机器学习框架,仅从基因组序列预测菌株水平的噬菌体-宿主相互作用,在115,037个相互作用、949种细菌菌株和518种噬菌体的数据集上验证,可匹配现有物种特异性模型并指导噬菌体鸡尾酒设计。
summary_zh: 独立电影人 Jeff Synthesized 凭借《The Gifted》获得 Future Vision XPRIZE 大奖,从全球 2500 多部参赛作品中脱颖而出。
在 Amazon SageMaker AI 上用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,文本与音频经同一条持久双向连接传输,语音可在整段生成完成前开始播放。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
summary_zh: Amazon Nova Act 基于多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业客户用例中浏览器工作流准确率超过 90%,能适应样式变化而无需更新脚本。
研究提出 Pred-MutPRI 框架,结合加权原子级相互作用网络、掩码 ESM-2 熵项与 AlphaFold3 局部有效应变描述符,用 XGBoost 回归预测蛋白-RNA 突变 ΔΔG。在序列不重叠、结构低重叠的盲测集上 PCC 达 0.705,优于现有预测器;数据集与 Python 包已公开。
summary_zh: SpaCEy 是一种基于图神经网络的可解释方法,用于在组织切片中发现与临床结局相关的空间重要区域。相比现有方法依赖预定义细胞类型标签或局部聚类,SpaCEy 能直接从连续分子测量中识别具有临床意义的连贯空间模式,并提供驱动结局的分子标记组合。
summary_zh: SkyRL 是开源 RL 框架,结合 Amazon SageMaker HyperPod 的 Ray 集群与 GRPO 后训练,将 Qwen3-VL-8B 在 VisGym SFT 检查点上的迷宫求解率从 43.75% 提升至 95% 以上。
Qwen3-TTS-12Hz-1.7B-Base 是阿里千问团队公开的文本转语音模型,支持 10 种语言、基于 12Hz 语音 tokenizer 与流式生成,可通过少量参考音频实现说话人声音克隆,并跨语言保持声音身份。
Kai Cao 等人在 Nature Communications 发表一种结构信息驱动的深度学习框架,用于建模 TCR-peptide-HLA 相互作用。作者来自 Broad Institute of MIT and Harvard、Massachusetts General Hospital、MIT 等机构,研究获得 AstraZeneca、NIH、DOE 等资助。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构通过 AlphaFold Database 开放超过 2800 种病毒的蛋白质复合物预测结构,约 30% 为科学界全新发现的相互作用。
推荐理由:开放预测结果与推理流水线为研究者提供了可复用的基础设施,降低未来疫情中蛋白质结构解析的门槛。
summary_zh: MIT Senseable City Lab学者出版新书《How AI Sees the City: Urban Visual Intelligence》,探讨视觉AI在城市研究中的应用与隐患。
AlphaFold数据库于9月24日新增超过8,000个病毒蛋白二聚体结构预测,涵盖23个含有人类感染成员的病毒家族,并作为“大流行防范门户”的一部分上线。
推荐理由:AlphaFold数据库新增病毒蛋白复合物预测,为传染病研究和疫苗设计提供了新的结构参考。
Apple 研究提出通过潜在空间蒸馏压缩流式神经音频编码器,以预量化潜在表示作为监督目标,仅训练学生编码器回归教师逐帧潜在值。2.8× 压缩下,蒸馏学生在五个教师-学生对上相对 WER 保持在 1.9% 以内,且同等容量独立训练分词器提升 3.9%。该方案覆盖两种分词接口,无需微调。
UpTCR 是一个用于 T 细胞受体-抗原结合识别的大语言模型,采用统一渐进知识迁移架构。作者来自江南大学、清华大学深圳国际研究生院、澳门大学、腾讯 AI for Life Sciences Lab 等机构,文章发表于 Nature Communications,2025 年 11 月投稿,2026 年 9 月接收并发表。
综述探讨AI在放疗流程中的应用,涵盖器官分割、剂量预测、治疗计划优化与结局预测。涉及深度学习、U-Net、扩散模型及大语言模型在放疗物理与临床中的实践与挑战。
该方案基于 Strands Agents SDK 构建单一 AI Agent,运行时动态调用 Amazon Bedrock(Claude Sonnet)、Amazon Rekognition 和 Amazon Transcribe,处理自然语言视频查询。
Google Beam 正式扩展至美国、加拿大、英国、法国、德国、日本六国,由 18 家渠道伙伴部署支持,硬件由 HP Dimension with Google Beam 交付。
Ringg 使用 GPT-5.6 驱动多语言智能体,在语音、聊天、WhatsApp 和网页端处理客服通话,解决比例最高达 65%。相比 GPT-4.1,成本降低 90%。
summary_zh: 研究者提出 probe guidance 方法,利用冻结的扩散模型内部状态构建引导信号,无需推理时额外前向传播即可为流匹配模型提供可靠引导路径。
研究团队用铅元素检测法替代碳基扫描,成功在保持卷轴卷曲状态下识别出内部文字。他们用埃及纸莎草、日本灯黑墨和高温炉复原了碳化卷轴,并通过中子与X射线断层扫描结合自定义展开程序完成破译。
Higgsfield AI 借助 GPT-6 Astra 一日内上线新视频功能,让小企业视频广告创作更便捷,并加速新创意工具推向市场。
TangleDiff 是一个深度学习框架,用于从头设计具有可编程特性的同源二聚体纠缠蛋白。其在 silico 成功率超过 70%,远高于当前模型约 1%。实验验证的 9 个同源二聚体中有 7 个成功形成水凝胶,且应力松弛动力学与指定的结合能相关。