跳到正文

#多模态

今日 195 条
9月22日周二
  1. Digital Trends · AI20

    Viture Vonder AI 眼镜发布,六款镜框支持处方镜片,售价 299 美元

    summary_zh: Viture Vonder AI 眼镜提供六种镜框样式,支持处方镜片,售价 299 美元,将于本月晚些时候开售。眼镜主打日常思绪的思维导图功能,将 AI 交互与时尚外观结合。 Viture Vonder AI 眼镜提供六种镜框样式,支持处方镜片,售价 299 美元,将于本月晚些时候开售。眼镜主打日常思绪的思维导图功能,将 AI 交互与时尚外观结合。

9月21日周一
9月20日周日
9月19日周六
9月18日周五
  1. Nature · Machine Learning28

    ReScale4DL:平衡像素与上下文信息以增强生物图像分割

    ReScale4DL 系统评估了图像分辨率对生物图像分割的影响,在分辨率降至原始 6%-25% 的下采样图像上训练 popular architectures,分割准确率最多提升 25% mean IoU 或仅下降不到 5%。下采样同等比例提升了信息吞吐并降低存储与推理时间,为高效、可持续、低成本的生物成像流程提供实用指导。

  2. Nature · Machine Learning26

    ConvexGating 从单细胞细胞术聚类中推断门控策略

    ConvexGating 从单细胞细胞术数据的聚类结果中推断最优门控策略,旨在将聚类得到的细胞群体转化为可用于分选的高纯度、低步骤门控方案。flow cytometry、mass cytometry(cyTOF)和 CITE-seq 等高维数据场景中,手动门控依赖操作者经验且存在跨操作者变异,而聚类方法虽能无偏分离细胞却难以直接转为分选策略。

9月17日周四
  1. Tom's Hardware · AI23

    Balatro 玩家用 Google 果蝇大脑模拟训练模型打牌,目前胜率 20%

    Google 发布成年雄性果蝇全脑及中枢神经系统连接组后,一名 Balatro 玩家用自研训练算法结合该结构训练模型玩 Balatro,当前随机种子胜率约 20%。玩家未公开训练细节和代码仓库,评论者对项目真实性提出质疑;Balatro 因小丑牌互动、boss 能力等复杂机制,对 AI 来说仍很难稳定通关。

9月16日周三
  1. MIT News · AI72

    MIT团队提出xvr技术:术中X射线与术前3D扫描亚毫米级精准配准

    MIT与协作机构开发xvr(X-ray volume registration)技术,利用患者术前3D扫描生成数千张合成X射线训练AI模型,可在数秒内将术中2D X射线与3D扫描精准对齐,精度达亚毫米级。 该模型在覆盖多医院、多器官系统的最大真实注册数据集上,比现有AI方法精度提升一个数量级,适配新患者仅需约5分钟。

    推荐理由:该方法通过患者特异性合成数据训练,在真实数据集上显著超越现有AI方法,或提升微创手术的安全性与可及性。

  2. AIHub31

    AI 潜入数据海洋:从浮游生物到污染监测

    iMagine 项目联合 11 个欧洲国家的水生科学家与数字专家,在 2022–2025 年间开发 AI 工具,帮助研究人员更快、更大规模地处理水下图像与环境传感器数据。AI 将原本需要数月甚至数年的手动分类缩短至数天到数周,并能识别浮游生物、鱼类、漂浮垃圾及珊瑚退化。该项目已公开数据集与训练工具,供其他科学家继续使用。

  3. Google AI Blog62

    Google 发布多语言 AI 产品矩阵,覆盖 300 种语言及 1000 种语言计划

    Google 宣布其技术和产品已覆盖全球 300 多种语言、70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言、2000+ 语言对的实时口语翻译,Gemini 3.5 Transcribe 提供高精度语音转文本。

    推荐理由:原文展示了从文本到音频理解再到端侧翻译的技术路径,读者可以据此判断 Google 在多语言 AI 交互上的最新能力边界。

9月15日周二
  1. NVIDIA Blog67

    费城儿童医院基于开源 NVIDIA AI 工具实现儿童心脏建模

    费城儿童医院使用 MONAI 等开源工具,将儿童心脏建模时间从数小时缩短到秒级,已用于术前规划和部分手术。波士顿儿童医院将建模用于约半数心脏手术,医院间正组建开源联盟。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月14日周一
9月10日周四
9月9日周三
9月8日周二
  1. AIHub50

    AI for ethology: an interview with Isla Duporge

    Isla Duporge 结合无人机视频、卫星影像与深度学习追踪动物行为,研究斑马群体逃逸时的结构变化与 Monarch 迁徙的向量定向。卫星普查的角马数量低于此前估计,AI 检测可补充开阔栖息地的航空调查。 quieter 无人机、更长续航与更小型化生物记录标签将推动群体行为从模型预测转向可观测验证。

9月7日周一
  1. RIKEN AIP18

    RIKEN AIP 音乐信息智能团队获 IPSJ SIG 音乐与计算机科学最佳演示奖

    RIKEN AIP 音乐信息智能团队(团队长浜田正敏、研究员三浦裕也、客座研究员小室哲也、JSPS PD 关真太郎)凭借「School Song Creation with Student Participation Using AI Composition Support」获得 IPSJ SIG 音乐与计算机科学最佳演示奖。该奖项由 SIG 委员会根据参会者投票选出,表彰研究发表表现。

9月4日周五
  1. AIHub34

    低成本AI摄像系统可监测大黄蜂种群

    研究者用商用组件搭建低成本摄像系统,在红三叶草田中记录到6种大黄蜂,与传统网捕和陷阱的物种多样性吻合。图像分析采用分块(tiled)深度学习模型,优于整图评估;靶心图案比纯色背景更能吸引大黄蜂。该技术可为濒危物种评估和栖息地划定提供更密集的大规模监测数据。

9月3日周四
  1. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

9月2日周三
9月1日周二
8月31日周一
  1. AIHub62

    GenMix:用有限真实图像扩增训练数据并提升检测鲁棒性

    墨尔本大学等机构提出GenMix方法,通过九种预设提示对真实图像做可控编辑并与原图融合,再经过滤丢弃语义漂移样本,将数十张标注图像扩增至数百张。测试覆盖日常物体识别、细粒度识别、小数据集和跨域场景,模型被微小像素对抗样本欺骗的比例降低约30%;代码已开源,作者强调临床使用仍需独立验证。

8月28日周五
  1. MIT News · AI48

    超越自然序列:MIT 推出 PottsMPNN 蛋白质设计框架

    MIT 生物系推出 PottsMPNN 机器学习框架,融入物理原理以改进序列生成与突变稳定性预测。该模型通过引入噪声、氨基酸配对分布和进化相关序列训练,更好地理解序列-能量景观,能为无天然对应序列的全新设计结构生成可行序列。研究显示,减少对天然序列的依赖可提升结构兼容性与能量预测精度。

8月27日周四