FD-VAD:流式全双工语音的语义端点检测
FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。
FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。
InstCharVoice 提出一个统一框架,将自然语言指令映射到字符级声学控制,在 WordVoice-5A-zh 语料上使用 Qwen3-Omni 构建指令标注。模型通过关键词预测与接地感知损失加权,聚焦指令相关字符并预测其声学属性,再生成语音 token。实验显示在指令遵循和关键词级声学控制上优于代表性 ITTS 系统,同时保持自然度与字符级可控性。
HEIR 是一个包含 18,730 张图像的人体-实体交互基准,涵盖 6 种角色、105 种动作和 437 个名词,51.6% 的图像含多主体、62.1% 含多动作。CoRISP 利用共享实体身份组合角色条件证据,在 HEIR 上重复角色事件和共享参与者图像分别领先 2.87 和 3.82 Set mAP。代码和数据集已公开。
研究者与 K-12 教师协作,基于大语言模型(LLMs)共同设计了一套多智能体反欺凌模拟系统,用于生成真实校园场景,帮助学生提升应对欺凌的能力。该研究明确了 LLM 驱动的多智能体模拟系统的关键设计参数,为开发更有效、可扩展的反欺凌工具提供参考。
SPECTRA 是一种轻量级自主请求框架,通过显著性引导的定向扰动和高效认知轨迹分析,在预填充阶段量化智能体高维认知轨迹的拓扑发散,避免低效的输出解码。实验表明,GTA1-32B+InfiGUI-G1-3B 和 GTA1-32B+Holo1.5-3B 分别以 37.58% 和 39.24% 的平均请求率,保留了 93.44% 和 95.60% 的云端独占性能。已被 ACM MM 2026 接收。
HERO 是一个基于 ViT-G/14 的病理学基础模型,采用 DINO 和 iBOT 目标训练,并在约 57.5 万例临床全切片图像的 5 亿个图块上进行高分辨率 Gram 锚定微调。在公开基准上,HERO 在中心、扫描仪和染色变化下的鲁棒性最强,39 个切片级临床任务平均排名第一,6 个基准框架的等权综合排名最优。
研究者提出多深度时间融合(MDTF)脉冲神经网络架构,通过时间至首次脉冲(TTFS)延迟处理静态图像与事件流。网络采用四层卷积骨干与无监督脉冲时间依赖可塑性(STDP)逐层训练,在MNIST、Fashion-MNIST、CIFAR-10和N-MNIST上验证,选择性多深度融合在Fashion-MNIST和CIFAR-10上分别提升18.2和29.2个百分点。代码已公开。
提出一种结合深度学习与图像预处理的 OCR 模型,用于自动提取韩语发票中的关键信息。在收集的发票数据集上评估,达到 87% F1-score,且处理时间可忽略。
CoVLM-Bench 包含 2,196 对帧、35,136 条协同驾驶问答标注和 3 秒内 6 个航路点的规划目标。CoVLM-Drive 直接使用车路配对视角进行问答与规划,FDE 低于对比的 V2X 规划器,问答初始化与理由监督各自降低规划误差。
Perch 和 BirdNET 等生物声学基础模型虽能高精度识别物种,但置信度未经校准、难以解释为真实出现概率。研究利用 WABAD 全局标注声学数据集生成校准先验,并提出将声学预测与地理先验融合的新方法,在保持判别能力的同时改善校准性,为生物多样性监测提供更可靠的声学方案。
NeuroDyn-EEG 提出一种预训练框架,融合 Jansen-Rit 神经质量模型、leadfield 源投影与基于模拟的参数反演,在生理范围内用约 2.43M 可训练参数从标准 19 通道 EEG 估计 90 个 AAL 区域的 11 类区域参数及 1 个全局参数。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
AMD宣布收购World Labs AI公司,交易估值82亿美元,待监管批准。World Labs由Fei-Fei Li等人于2024年创立,专注于世界模型,已推出Marble和Atlas等工具,可生成3D资产并用于机器人合成数据训练。
NVIDIA 发布 VSS Blueprint 3.3,通过 Metropolis 视频搜索与摘要蓝图及 agent skills,帮助开发者构建可维护的视觉 AI Agent 系统,整合视频摄入、流处理、事件检测、检索、摘要与报告等管线,以降低生产级视觉 AI Agent 的构建与运行成本。
AMD宣布收购专注于世界模型的初创公司World Labs,AI先驱李飞飞将加入AMD担任执行副总裁兼首席科学家。该交易为全股票估值约82亿美元,预计2026年底前完成监管审批。
推荐理由:AMD以82亿美元收购空间智能初创公司World Labs,读者可借此观察AI芯片竞争格局与硬件-模型协同趋势。
Condé Nast 与 AWS GenAIIC 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索系统,使用 TwelveLabs Marengo 嵌入模型对视频转录、视觉和音频进行语义搜索,将内容发现时间从平均 250 分钟降至 2 分钟以内。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。
Marissa Mayer 推出个人 AI 助手 Dazzle,以手机相册为核心信息源,替代邮箱和日历构建用户画像。该产品可扫描照片完成日历填充、推荐假期和生日礼物等个性化任务,但在测试中对部分细节存在记忆盲区。Mayer 强调隐私优先,丢弃 AI 标记的敏感信息;Dazzle 此前完成 $8 million 种子轮融资。
现代艾尼氪 V 于 9 月 29 日上市,共推出五款车型,限时权益价 9.99 万元起。高端智驾版搭载 Momenta 支持的「星动智行」辅助驾驶系统,硬件包括 1 颗毫米波雷达、7 颗高清摄像头和 12 颗超声波雷达。车内接入豆包和文心一言双大模型,同时支持百度和高德双地图,座舱配备 27 英寸 4K 一体大屏和 11.98 英寸「赛博之眼 HUD」。
音乐初创公司 Thoughtful Things 在 Kickstarter 推出首款硬件乐器 Engram,是一款本地运行 tiny AI 的采样器与 groovebox,可将输入音频扭曲并生成新的实验性声音。创始人 Evan King 将其比作
Mac mini M6 搭载 M6 芯片,单核性能比 M4 快 25%,多核快 50%,图形性能快 75%,售价 £899 起(16GB + 256GB)。机身 127×127×50mm,重 680g,配备 3 个 Thunderbolt 4、HDMI 2.1、2.5Gb Ethernet 和 Wi-Fi 7,底部电源键难触及。
AMD 收购 World Labs,价格 82 亿美元。World Labs 自 2024 年成立以来构建了面向创意、设计和机器人模拟的 AI 空间智能能力,并发布 Atlas 模型,通过结合生成模型与多视角几何解决稀疏重建问题,实现新相机视角预测。应用领域包括机器人强化学习环境、场景生成以及房地产、设计和施工的真实世界重建。
Claude Opus 5.5 本周发布,在 SimpleBench 得 88.4%,被评 Anthropic 迄今最佳视觉模型,成本约比 Fable 5.1 低 60%。
AMD全股票收购李飞飞创办的空间智能公司World Labs,交割后李飞飞将出任AMD执行副总裁兼首席科学家,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
推荐理由:AMD以82亿美元全股票收购空间智能公司World Labs,读者可借此观察芯片巨头在机器人仿真与物理AI新工作负载上的布局节奏。
研究者开发了一个不依赖系统发育的机器学习框架,仅从基因组序列预测菌株水平的噬菌体-宿主相互作用,在115,037个相互作用、949种细菌菌株和518种噬菌体的数据集上验证,可匹配现有物种特异性模型并指导噬菌体鸡尾酒设计。
summary_zh: 独立电影人 Jeff Synthesized 凭借《The Gifted》获得 Future Vision XPRIZE 大奖,从全球 2500 多部参赛作品中脱颖而出。
在 Amazon SageMaker AI 上用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,文本与音频经同一条持久双向连接传输,语音可在整段生成完成前开始播放。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
summary_zh: Amazon Nova Act 基于多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业客户用例中浏览器工作流准确率超过 90%,能适应样式变化而无需更新脚本。
NTU Singapore 团队开发 PLATO 数据库与 PhaseHub 分析平台,基于大语言模型挖掘 PubMed 文献并结合 MolPhase 算法,覆盖 5,118 条蛋白序列,其中 3,600 余条发生相分离、1,300 条未发生。研究发现真核生物相分离蛋白比例更高,且该比例随基因组增大趋于饱和。两平台已发表于 Molecular Plant。
summary_zh: 荣耀Magic9 Pro Max 首发评测。文章正文仅展示版权声明与公众号关注引导,未提供该机型任何具体参数、功能或评测细节。 荣耀Magic9 Pro Max 首发评测。文章正文仅展示版权声明与公众号关注引导,未提供该机型任何具体参数、功能或评测细节。
summary_zh: Simon Willison 用 Claude Opus 5.5 根据三张 kākāpō 照片生成 HTML5 Canvas 像素动画页面,20 只以上几维鸟随音乐跳跃跳舞,点击触发彩纸、气球等特效。
研究提出 Pred-MutPRI 框架,结合加权原子级相互作用网络、掩码 ESM-2 熵项与 AlphaFold3 局部有效应变描述符,用 XGBoost 回归预测蛋白-RNA 突变 ΔΔG。在序列不重叠、结构低重叠的盲测集上 PCC 达 0.705,优于现有预测器;数据集与 Python 包已公开。
summary_zh: SpaCEy 是一种基于图神经网络的可解释方法,用于在组织切片中发现与临床结局相关的空间重要区域。相比现有方法依赖预定义细胞类型标签或局部聚类,SpaCEy 能直接从连续分子测量中识别具有临床意义的连贯空间模式,并提供驱动结局的分子标记组合。
summary_zh: SkyRL 是开源 RL 框架,结合 Amazon SageMaker HyperPod 的 Ray 集群与 GRPO 后训练,将 Qwen3-VL-8B 在 VisGym SFT 检查点上的迷宫求解率从 43.75% 提升至 95% 以上。
Qwen3-TTS-12Hz-1.7B-Base 是阿里千问团队公开的文本转语音模型,支持 10 种语言、基于 12Hz 语音 tokenizer 与流式生成,可通过少量参考音频实现说话人声音克隆,并跨语言保持声音身份。
Ben 用了 Astra、Codex、Factory Droid 和多个 subagent 搭建了一个设备时间轴网站 bentossell.com/devices,展示 1976 到 2026 年共 87 款设备,所有图片由 Astra 生成。用户可拖动时间轴查看不同年份的设备,并投票"had/wanted",结果通过链接分享;投票数据由 here.now 存储,页面不存数据无需登录。
summary_zh: 任正非重申华为不造车,将继续帮助东风造好车,双方讨论了奕境 X9、猛士 X700 和岚图梦想家 9 等车型。DeepSeek 年化收入运行率达约 10 亿美元,数月内翻倍,模型 API 价格上调约 2.3 至 4.5 倍。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。