跳到正文

#多模态

今日 195 条
2月10日周二
2月7日周六
  1. ScienceDaily · AI35

    宾州州立团队开发可编程智能合成皮肤,可隐藏图像并改变形状

    宾州州立 Hongtao Sun 团队利用水凝胶和半色调编码 4D 打印技术,开发出可编程智能合成皮肤。该材料可通过热、溶剂或机械刺激改变外观、质地和形状,并能将图像编码进材料内:乙醇中透明,加热水或冰水后隐藏图像显现。单个薄片即可同时控制外观与形变,无需多层结构。

2月2日周一
  1. ScienceDaily · AI60

    斯坦福团队展示微透镜光腔阵列,实现千级光腔量子比特并行读出

    斯坦福大学物理学家团队在 Nature 发表论文,展示由 40 个光腔组成的阵列及超过 500 个光腔的原型,每个光腔容纳单个原子量子比特,通过微透镜将光聚焦到单个原子上,实现并行读出。研究指出该方案可扩展至百万量子比特的光腔网络,为分布式量子计算和量子数据中心提供基础。

1月28日周三
  1. Ethan Mollick · Notes36

    Management as AI superpower:MBA学生用 Claude Code / ChatGPT / Gemini 四天从零搭建创业原型

    Ethan Mollick 在宾大实验课中让 MBA 学生用 Claude Code、Google Antigravity、ChatGPT、Claude 和 Gemini 在四天内从零搭建创业原型,多数原型已具备核心功能,市场分析与创意多样性显著优于传统学期项目。AI 将创业启动成本大幅压缩,并降低试错与转向成本;成功关键在于管理能力与有效委托 AI,而非单纯提示技巧。

1月25日周日
  1. ScienceDaily · AI62

    研究人员对10万人测试AI与人类创造力

    蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。

1月22日周四
1月13日周二
1月10日周六
  1. Berkeley AI Research32

    Information-Driven Design of Imaging Systems

    伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。

1月9日周五
  1. ScienceDaily · AI75

    Stanford SleepFM:从单夜睡眠信号预测百余种疾病风险

    Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。

1月8日周四
12月30日周二
  1. Sebastian Raschka12

    LLM Research Papers: The 2025 List (July to December)

    Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。

12月17日周三
12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

10月14日周二
  1. Ollama Blog64

    Qwen3-VL 登陆 Ollama 云端

    Qwen3-VL 作为 Qwen 系列最强视觉语言模型已在 Ollama 云端上线,本地将随后推出。模型支持视觉 Agent 操作 PC/移动端界面、视觉编程生成 Draw.io/HTML/CSS/JS、2D/3D 空间推理、原生 256K 上下文可扩展至 1M,以及 32 语言 OCR。

    推荐理由:原文给出了 Qwen3-VL 在 Ollama 云端的入口与主要能力,读者可据此判断它对视觉 Agent 与多模态工作流的影响。

9月29日周一
9月1日周一
  1. Berkeley AI Research40

    word2vec 到底学到了什么?

    word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。

8月12日周二
  1. Vector Institute46

    Vector Institute 研究人员亮相 ICLR 2025,71 篇论文涵盖表示学习与可信 AI

    Vector Institute 在 ICLR 2025 发表 71 篇被接收论文,覆盖神经架构、优化、理论及多模态 AI、科学发现与负责任机器学习。ACES 自动提取事件流数据集的队列并提升可复现性;AttriBoT 用缓存激活与层次归因实现 300 倍加速,使上下文归因比生成响应快 30 倍;行动抽象方法在熵寻求 RL 与 GFlowNets 中提升样本效率并发现可解释的高层动作。

8月9日周六
8月1日周五
7月30日周三
  1. Ollama Blog35

    Ollama 推出 macOS 与 Windows 新应用

    Ollama 的新应用已在 macOS 和 Windows 上线,支持模型下载与对话、文件拖拽上传(包括文本和 PDF),并可处理代码文件。内置的多模态引擎支持向 Gemma 3 等模型发送图片,上下文长度可在设置中调整但需要更多内存。新应用可从 Ollama 官网下载,CLI 版本仍可从 GitHub releases 页面获取。

7月17日周四
  1. Mistral AI61

    Le Chat 新增深度研究、语音对话与项目管理功能

    Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。

    推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。

7月15日周二
  1. Mistral AI69

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。

    推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。

7月11日周五
5月15日周四
  1. Ollama Blog72

    Ollama 推出多模态模型新引擎

    Ollama 发布新多模态引擎,支持 Llama 4、Gemma 3、Qwen 2.5 VL、Mistral Small 3.1 等视觉模型。引擎改进包括模型模块化、图像元数据精度、图像缓存与 KV 缓存优化,并针对 Llama 4 Scout 实现分块注意力与 2D 旋转嵌入。

    推荐理由:原文给出了多模态引擎的具体改进与支持的模型,读者可以据此判断本地多模态推理的可靠性与扩展方向。

5月6日周二
4月25日周五
4月10日周四
  1. Vector Institute67

    Vector Institute 发布 State of Evaluation 研究:全球11个AI模型经16项基准评估

    Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。

    推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。

3月31日周一
3月19日周三
3月17日周一
1月28日周二
1月21日周二
  1. Vector Institute31

    FairSense:融合负责任 AI 与可持续性

    FairSense-AI 扩展偏见检测到文本与视觉内容,同时采用节能 AI 框架,由 Vector 团队开发。优化后 Llama 3.2 1B 每小时推理碳排放从 107,000 kg 降至 0.012 kg CO2,并使用 CodeCarbon 评估能耗。提供 Python 包,集成 LLM/VLM 进行偏见评分与风险识别,并计划接入 MIT 风险库与 NIST 框架。

12月6日周五
11月26日周二
11月17日周日
11月6日周三
10月24日周四
  1. Vector Institute25

    Vector Institute 发布多模态数据集 Newsmediabias-plus(NMB+)以支持伦理 AI 系统开发

    Vector Institute 发布了多模态数据集 Newsmediabias-plus(NMB+),包含约 90,000 篇新闻文章,覆盖文本与图像,并附带偏见分类和发布详情。该数据集面向学术研究者、NGO 及社会导向团队,用于检测虚假信息、分析媒体偏见及训练公平性模型。数据集在 Hugging Face 上以非商业许可开放。

10月15日周二
  1. Vector Institute62

    Vector研究:语音与AI检测阿尔茨海默病

    Vector Institute研究显示,基于Word2Vec和语言特征的简单AI模型在ADReSS数据集上以92%准确率和100%灵敏度检测阿尔茨海默病,性能超过微调的BERT和GPT-2等上下文模型。该方法结合词向量与34项语言特征,可解释性强、计算效率更高,未来需在不同人群和临床场景中进一步验证。

    推荐理由:用简单词向量加语言特征就能在ADReSS上达到92%准确率,为低成本、可解释的阿尔茨海默筛查提供新思路。

4月12日周五
  1. Lilian Weng39

    Diffusion Models for Video Generation

    扩散模型已用于图像合成,研究社区正将其扩展到视频生成任务。视频生成是图像的超集,需要在时间维度上保持一致性,并面临高质量视频数据收集困难的问题。Imagen Video 通过级联扩散模型和渐进蒸馏将采样步数减半,Sora 则采用 DiT 架构处理时空块。