跳到正文

#多模态

今日 16 条
今天9月30日周三
  1. arXiv · Computation and Language39

    FD-VAD:流式全双工语音的语义端点检测

    FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。

  2. arXiv · Audio and Speech22

    InstCharVoice:基于自然语言指令的字符级可控文本转语音框架

    InstCharVoice 提出一个统一框架,将自然语言指令映射到字符级声学控制,在 WordVoice-5A-zh 语料上使用 Qwen3-Omni 构建指令标注。模型通过关键词预测与接地感知损失加权,聚焦指令相关字符并预测其声学属性,再生成语音 token。实验显示在指令遵循和关键词级声学控制上优于代表性 ITTS 系统,同时保持自然度与字符级可控性。

  3. arXiv · Computer Vision25

    HEIR:基于功能角色学习人体-实体交互

    HEIR 是一个包含 18,730 张图像的人体-实体交互基准,涵盖 6 种角色、105 种动作和 437 个名词,51.6% 的图像含多主体、62.1% 含多动作。CoRISP 利用共享实体身份组合角色条件证据,在 HEIR 上重复角色事件和共享参与者图像分别领先 2.87 和 3.82 Set mAP。代码和数据集已公开。

  4. arXiv · Human-Computer Interaction22

    SPECTRA:面向自主边缘-云 GUI 定位的认知扰动与轨迹分析

    SPECTRA 是一种轻量级自主请求框架,通过显著性引导的定向扰动和高效认知轨迹分析,在预填充阶段量化智能体高维认知轨迹的拓扑发散,避免低效的输出解码。实验表明,GTA1-32B+InfiGUI-G1-3B 和 GTA1-32B+Holo1.5-3B 分别以 37.58% 和 39.24% 的平均请求率,保留了 93.44% 和 95.60% 的云端独占性能。已被 ACM MM 2026 接收。

  5. arXiv · Computer Vision34

    HERO:肿瘤学鲁棒表征的组织学编码器

    HERO 是一个基于 ViT-G/14 的病理学基础模型,采用 DINO 和 iBOT 目标训练,并在约 57.5 万例临床全切片图像的 5 亿个图块上进行高分辨率 Gram 锚定微调。在公开基准上,HERO 在中心、扫描仪和染色变化下的鲁棒性最强,39 个切片级临床任务平均排名第一,6 个基准框架的等权综合排名最优。

  6. arXiv · Neural and Evolutionary Computing35

    多深度时间融合前馈局部训练脉冲神经网络

    研究者提出多深度时间融合(MDTF)脉冲神经网络架构,通过时间至首次脉冲(TTFS)延迟处理静态图像与事件流。网络采用四层卷积骨干与无监督脉冲时间依赖可塑性(STDP)逐层训练,在MNIST、Fashion-MNIST、CIFAR-10和N-MNIST上验证,选择性多深度融合在Fashion-MNIST和CIFAR-10上分别提升18.2和29.2个百分点。代码已公开。

  7. arXiv · Audio and Speech22

    Beyond Discrimination: Calibrated Geoprior Fusion for Bioacoustic Monitoring

    Perch 和 BirdNET 等生物声学基础模型虽能高精度识别物种,但置信度未经校准、难以解释为真实出现概率。研究利用 WABAD 全局标注声学数据集生成校准先验,并提出将声学预测与地理先验融合的新方法,在保持判别能力的同时改善校准性,为生物多样性监测提供更可靠的声学方案。

9月29日周二
  1. Microsoft Research72

    Microsoft 推出 Quine 生物 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。

    推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。

  2. TechCrunch · AI45

    Marissa Mayer 推出 Dazzle:相机相册比收件箱更了解你

    Marissa Mayer 推出个人 AI 助手 Dazzle,以手机相册为核心信息源,替代邮箱和日历构建用户画像。该产品可扫描照片完成日历填充、推荐假期和生日礼物等个性化任务,但在测试中对部分细节存在记忆盲区。Mayer 强调隐私优先,丢弃 AI 标记的敏感信息;Dazzle 此前完成 $8 million 种子轮融资。

  3. 爱范儿28

    9.99 万元起!现代艾尼氪 V 上市,十万级最先锋的设计来了

    现代艾尼氪 V 于 9 月 29 日上市,共推出五款车型,限时权益价 9.99 万元起。高端智驾版搭载 Momenta 支持的「星动智行」辅助驾驶系统,硬件包括 1 颗毫米波雷达、7 颗高清摄像头和 12 颗超声波雷达。车内接入豆包和文心一言双大模型,同时支持百度和高德双地图,座舱配备 27 英寸 4K 一体大屏和 11.98 英寸「赛博之眼 HUD」。

  4. Latent Space69

    AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题

    AMD 收购 World Labs,价格 82 亿美元。World Labs 自 2024 年成立以来构建了面向创意、设计和机器人模拟的 AI 空间智能能力,并发布 Atlas 模型,通过结合生成模型与多视角几何解决稀疏重建问题,实现新相机视角预测。应用领域包括机器人强化学习环境、场景生成以及房地产、设计和施工的真实世界重建。

  5. 量子位88

    李飞飞创业公司World Labs被AMD以82亿美元收购

    AMD全股票收购李飞飞创办的空间智能公司World Labs,交割后李飞飞将出任AMD执行副总裁兼首席科学家,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。

    推荐理由:AMD以82亿美元全股票收购空间智能公司World Labs,读者可借此观察芯片巨头在机器人仿真与物理AI新工作负载上的布局节奏。

9月28日周一
  1. 爱范儿12

    百万阿莱失踪案|荣耀Magic9 Pro Max 首发评测

    summary_zh: 荣耀Magic9 Pro Max 首发评测。文章正文仅展示版权声明与公众号关注引导,未提供该机型任何具体参数、功能或评测细节。 荣耀Magic9 Pro Max 首发评测。文章正文仅展示版权声明与公众号关注引导,未提供该机型任何具体参数、功能或评测细节。

9月27日周日
9月26日周六
9月25日周五
  1. Ben's Bites · News22

    50 years of tech devices

    Ben 用了 Astra、Codex、Factory Droid 和多个 subagent 搭建了一个设备时间轴网站 bentossell.com/devices,展示 1976 到 2026 年共 87 款设备,所有图片由 Astra 生成。用户可拖动时间轴查看不同年份的设备,并投票"had/wanted",结果通过链接分享;投票数据由 here.now 存储,页面不存数据无需登录。

  2. Google Research60

    Google Research 推出自动化一致长形式视频生成框架

    Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。

    推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。