Skip to content

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

81 selectedRelated topics图像生成AI 视频语音与音频

Latest selected

21–40 of 81
Oct 1Thu
  1. arXiv · Computation and Language60

    KlinikeBench:超越诊断准确率的大语言模型临床评估基准

    arXiv 论文提出 KlinikeBench,包含 333 个由临床医生撰写的任务,在隔离沙盒中评估大语言模型与虚拟患者的交互式临床接诊能力。31 个模型和 7 个模型家族的实验显示,表现最好的模型(如 GPT-6-astra 和 Claude Opus 5)在任务成功率低于 30%,尽管其诊断准确率达 90.7%。基准揭示诊断准确率与交互式临床评估之间存在显著差距。

    Why it matters: 原文揭示了诊断准确率与交互式临床评估之间的显著差距,为理解大语言模型在真实医患对话中的实际边界提供了新测试平台。

  2. arXiv · Artificial Intelligence60

    AI语音代理中的人格与说服框架:面向儿童的2×2现场实验

    研究者在德国圣诞老人电话热线嵌入2×2随机现场实验,将儿童通话随机分配至四种LLM语音代理。说服框架使亲社会愿望概率从11.6%升至45.7%;人格权威(Santa vs. Helper)近零效应,但Helper首分钟挂断率更高(65% vs. 39%)。结论为:当场景已赋予代理合法性时,说话方式比声称身份更能影响儿童顺从。

    Why it matters: 真实场景中的儿童语音交互实验提供了说服框架与角色设定的相对权重,对设计面向儿童的产品有参考价值。

  3. arXiv · Artificial Intelligence62

    Learning to Route in Visual Space via Multi-Step Embedding Retrieval

    论文提出 VHOP 数据生成框架与 VHOP-Router 端到端训练管线,将标准嵌入模型转为自回归多步检索器,直接在视觉潜在空间检索关联图像链。实验显示检索率从不足 5% 提升至 76.3%,智能体搜索成功率提高 52.7%,平均 token 长度从 1886 降至 728,同时减少上下文图像 23 倍、累计 API 负载 35 倍。

    Why it matters: 论文提出端到端训练方案,将检索器改造为多步自回归模型,在视觉智能体搜索上显著提升成功率并大幅降低 token 开销。

  4. Nature · Machine Learning62

    获奖显微影像使用AI 引发竞赛争议

    Ning Xu 凭激光显微镜视频获 Nikon Small World in Motion 奖,展示纤毛运动,但紫色、蓝色与红色结构被质疑生物学上不合理。Nikon 更新说明其使用了无监督AI 进行后处理,Xu 称AI 未生成原始影像,仅用于区分相似形态结构并上色。

    Why it matters: 显微镜竞赛获奖视频被指AI生成虚假生物结构,凸显科学影像中AI后处理的边界争议。

Sep 30Wed
  1. arXiv · Human-Computer Interaction62

    TouchingSpace:面向盲人和低视力读者的音频触觉地图系统

    论文提出 TouchingSpace,系统检索户外地点地图数据并在固定触控板位置渲染周围区域为有界区域,用户在探索时获得音频和触觉反馈,并可与对话代理进行开放式提问。研究招募了14名盲人和低视力参与者,参与者使用声音和振动定位地点、用语音识别和描述地点,有界表面支持手动发现、修正和空间检查,参与者预期这种感知能力可支持未来出行。

    Why it matters: 研究为视障用户提供了基于笔记本触控板的音频触觉地图交互方式,对可访问性地图设计有参考价值。

  2. arXiv · Artificial Intelligence60

    CoRe:协同演化奖励模型以缓解视频扩散模型中的潜在奖励欺骗

    论文提出 CoRe 框架,通过让奖励模型与生成器共同演化来缓解视频扩散模型中的潜在奖励欺骗问题。固定潜在奖励会在数百次更新后导致分布逃逸,使奖励分数与感知和运动质量脱钩;CoRe 在生成器当前样本上持续重训练奖励模型并锚定真实视频偏好,在 Wan2.1-T2V-1.3B 上相比预训练模型和先前对齐方法持续提升生成质量,并避免固定奖励优化的质量崩溃。

    Why it matters: 固定奖励信号会让视频生成模型在潜在空间偏离数据分布,CoRe 通过奖励模型与生成器共同演化来缓解这一问题,为视频扩散模型的对齐提供了可迁移的动态训练视角。

  3. arXiv · Robotics62

    微调检测器在部署词汇外覆盖率的测量与修复

    arXiv论文提出纵向协议,用预训练检查点对比其微调后代,追踪开放词汇top-K提案覆盖率Cτ。在四个架构、三个领域上的实验显示,Cτ随领域精度上升而下降,1024px²以上框下降5.12至63.35个百分点。

    Why it matters: 论文揭示细粒度微调提升精度的同时会侵蚀开放词汇覆盖,并给出无需训练即可修复的方法。

  4. arXiv · Robotics62

    FineART:细粒度标注机器人轨迹数据集与视觉-语言-动作模型用于双臂操作

    研究团队发布 FineART 数据集,包含 40,543 条轨迹、1,718 小时和 533,913 个子任务,覆盖 151 个双臂操作任务,并推出 FineART-VLA 视觉-语言-动作策略。

    Why it matters: 论文给出了细粒度标注的双臂操作数据集和自预测子任务训练方法,读者可据此评估其对长时序操作任务的实际提升。

  5. The Decoder78

    AMD以82亿美元收购AI世界模型初创公司World Labs

    AMD宣布收购专注于世界模型的初创公司World Labs,AI先驱李飞飞将加入AMD担任执行副总裁兼首席科学家。该交易为全股票估值约82亿美元,预计2026年底前完成监管审批。

    Why it matters: AMD以82亿美元收购空间智能初创公司World Labs,读者可借此观察AI芯片竞争格局与硬件-模型协同趋势。

Sep 29Tue
  1. Microsoft Research72

    Microsoft 推出 Quine 生物 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。

    Why it matters: 原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。

  2. 量子位88

    李飞飞创业公司World Labs被AMD以82亿美元收购

    AMD全股票收购李飞飞创办的空间智能公司World Labs,交割后李飞飞将出任AMD执行副总裁兼首席科学家,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。

    Why it matters: AMD以82亿美元全股票收购空间智能公司World Labs,读者可借此观察芯片巨头在机器人仿真与物理AI新工作负载上的布局节奏。

Sep 25Fri
  1. Google Research60

    Google Research 推出自动化一致长形式视频生成框架

    Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。

    Why it matters: Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。

Sep 24Thu
  1. NVIDIA Blog62

    NVIDIA 与合作方通过 AlphaFold 数据库开放 2800+ 病毒蛋白质复合物预测结构

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构通过 AlphaFold Database 开放超过 2800 种病毒的蛋白质复合物预测结构,约 30% 为科学界全新发现的相互作用。

    Why it matters: 开放预测结果与推理流水线为研究者提供了可复用的基础设施,降低未来疫情中蛋白质结构解析的门槛。

Sep 22Tue
Sep 16Wed
  1. MIT News · AI72

    MIT团队提出xvr技术:术中X射线与术前3D扫描亚毫米级精准配准

    MIT与协作机构开发xvr(X-ray volume registration)技术,利用患者术前3D扫描生成数千张合成X射线训练AI模型,可在数秒内将术中2D X射线与3D扫描精准对齐,精度达亚毫米级。 该模型在覆盖多医院、多器官系统的最大真实注册数据集上,比现有AI方法精度提升一个数量级,适配新患者仅需约5分钟。

    Why it matters: 该方法通过患者特异性合成数据训练,在真实数据集上显著超越现有AI方法,或提升微创手术的安全性与可及性。

  2. Google AI Blog62

    Google 发布多语言 AI 产品矩阵,覆盖 300 种语言及 1000 种语言计划

    Google 宣布其技术和产品已覆盖全球 300 多种语言、70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言、2000+ 语言对的实时口语翻译,Gemini 3.5 Transcribe 提供高精度语音转文本。

    Why it matters: 原文展示了从文本到音频理解再到端侧翻译的技术路径,读者可以据此判断 Google 在多语言 AI 交互上的最新能力边界。