Prima AI 系统可在数秒内读取脑部 MRI 并标记急症
密歇根大学团队开发的 Prima 视觉语言模型在 30,000 份 MRI 研究中准确率约 97.5%,并能判断紧急程度、自动通知相应专科医生。该模型使用 20 万份 MRI 和 560 万序列训练,整合临床病史与医嘱信息,研究发表于 Nature Biomedical Engineering。
密歇根大学团队开发的 Prima 视觉语言模型在 30,000 份 MRI 研究中准确率约 97.5%,并能判断紧急程度、自动通知相应专科医生。该模型使用 20 万份 MRI 和 560 万序列训练,整合临床病史与医嘱信息,研究发表于 Nature Biomedical Engineering。
宾州州立 Hongtao Sun 团队利用水凝胶和半色调编码 4D 打印技术,开发出可编程智能合成皮肤。该材料可通过热、溶剂或机械刺激改变外观、质地和形状,并能将图像编码进材料内:乙醇中透明,加热水或冰水后隐藏图像显现。单个薄片即可同时控制外观与形变,无需多层结构。
斯坦福大学物理学家团队在 Nature 发表论文,展示由 40 个光腔组成的阵列及超过 500 个光腔的原型,每个光腔容纳单个原子量子比特,通过微透镜将光聚焦到单个原子上,实现并行读出。研究指出该方案可扩展至百万量子比特的光腔网络,为分布式量子计算和量子数据中心提供基础。
Ethan Mollick 在宾大实验课中让 MBA 学生用 Claude Code、Google Antigravity、ChatGPT、Claude 和 Gemini 在四天内从零搭建创业原型,多数原型已具备核心功能,市场分析与创意多样性显著优于传统学期项目。AI 将创业启动成本大幅压缩,并降低试错与转向成本;成功关键在于管理能力与有效委托 AI,而非单纯提示技巧。
蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。
summary_zh: Vector Institute 举办的 Foundation Models for Science Workshop 聚焦科学场景下数据稀缺、 stakes 高且来源 disconnected 的 AI 落地挑战,归纳出 annotation bottleneck、trust gap 与 lab-to-production leap 三大主题。
剑桥大学等机构研究团队在Nature Machine Intelligence发表CytoDiffusion,基于生成式AI分析血涂片图像,在白血病异常细胞检测上敏感度高于现有系统,并在不确定时主动回避错误判断。
伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。
Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。
研究团队开发出可产生并探测飞秒级UV-C激光脉冲的平台,结合超快UV-C光源与基于二维半导体(GaSe/Ga2O3)的探测器,在室温下工作。所有材料兼容规模化制造,自由空间通信验证成功,传感器还表现出线性到超线性光电响应。
Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。
Mistral AI 发布 Mistral OCR 3,模型可通过 API(mistral-ocr-2512)或 Mistral AI Studio 中的 Document AI Playground 使用,定价为每 1,000 页 $2,Batch API 折扣后为每 1,000 页 $1。
summary_zh: Vector 研究人员在 NeurIPS 2025 发表 80 篇论文,涵盖基础模型、扩散生成、强化学习与隐私保护联邦学习等方向。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
Qwen3-VL 作为 Qwen 系列最强视觉语言模型已在 Ollama 云端上线,本地将随后推出。模型支持视觉 Agent 操作 PC/移动端界面、视觉编程生成 Draw.io/HTML/CSS/JS、2D/3D 空间推理、原生 256K 上下文可扩展至 1M,以及 32 语言 OCR。
推荐理由:原文给出了 Qwen3-VL 在 Ollama 云端的入口与主要能力,读者可据此判断它对视觉 Agent 与多模态工作流的影响。
summary_zh: Meta 发布 3D AssetGen 基础模型,目标是从简单文本提示生成完整 3D 世界。Meta XR Tech 团队在 Meta Tech Podcast 中介绍其训练方式,并讨论 LLM 在 VR 中的角色。
word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。
Vector Institute 在 ICLR 2025 发表 71 篇被接收论文,覆盖神经架构、优化、理论及多模态 AI、科学发现与负责任机器学习。ACES 自动提取事件流数据集的队列并提升可复现性;AttriBoT 用缓存激活与层次归因实现 300 倍加速,使上下文归因比生成响应快 30 倍;行动抽象方法在熵寻求 RL 与 GFlowNets 中提升样本效率并发现可解释的高层动作。
summary_zh: HumaniBench 是首个针对大多模态模型(LMMs)以人为中心的综合评测基准,涵盖公平性、伦理、理解、推理、语言包容性、同理心与鲁棒性七项原则。
summary_zh: Pixtral-12B 经过 LoRA 微调后在卫星图像分类任务上显著优于基础模型,在 AID 数据集(8000 训练 / 2000 测试)上减少了基础模型的幻觉和模糊类别误判。
Ollama 的新应用已在 macOS 和 Windows 上线,支持模型下载与对话、文件拖拽上传(包括文本和 PDF),并可处理代码文件。内置的多模态引擎支持向 Gemma 3 等模型发送图片,上下文长度可在设置中调整但需要更多内存。新应用可从 Ollama 官网下载,CLI 版本仍可从 GitHub releases 页面获取。
Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。
推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。
推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。
Vector 研究人员将在 2025 年 7 月于温哥华举办的 ICML 上发表 45 篇论文,涵盖 AI 安全性、医疗与环境监测等方向。亮点工作包括利用 LLM 进行自适应信息提取的框架、AutoElicit 方法,以及神经网络训练轨迹对初始条件的高度敏感性分析。
Ollama 发布新多模态引擎,支持 Llama 4、Gemma 3、Qwen 2.5 VL、Mistral Small 3.1 等视觉模型。引擎改进包括模型模块化、图像元数据精度、图像缓存与 KV 缓存优化,并针对 Llama 4 Scout 实现分块注意力与 2D 旋转嵌入。
推荐理由:原文给出了多模态引擎的具体改进与支持的模型,读者可以据此判断本地多模态推理的可靠性与扩展方向。
Vector Institute博士后James Requeima等人开发的Aardvark Weather模型在Nature发表论文,预报速度比传统系统快10倍、计算需求低1000倍,且仅需10%输入数据。
推荐理由:Aardvark Weather以端到端学习直接处理原始观测数据,为资源受限地区提供了可迁移的轻量级预报方法。
Kelsey Allen 加入 Vector Institute,研究自适应学习机制与推理、问题解决能力。她从粒子物理转向机器学习,关注人类认知与机器学习的类比,以及工具使用在跨物种智能中的连续谱系。她的研究曾获 Robotics: Science and Systems 2018 最佳论文奖。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
summary_zh: ACM 将 2024 年 A.M. Turing 奖授予 Richard Sutton 与 Andrew Barto,表彰强化学习(RL)领域的奠基性贡献。
Vector Institute 与 Be Node 宣布 Global AI Alliance for Climate Action 资助名单,CleanTech21、美国国家物候网络以及全球风险创新中心与吉尔吉斯斯坦互联网协会联合项目各获资助。
Mistral Small 3.1 正式发布,在文本指令、多模态理解和长上下文任务上超越 Gemma 3 与 GPT-4o Mini,推理速度达 150 tokens/秒。
summary_zh: 推荐系统融合AI与个性化,通过分析用户画像、物品特征和反馈来预测偏好并生成建议。经典方法涵盖协同过滤、内容过滤和混合模型;近期进展包括深度学习、图方法、序列模型和大语言模型(如GPT)的应用。
FairSense-AI 扩展偏见检测到文本与视觉内容,同时采用节能 AI 框架,由 Vector 团队开发。优化后 Llama 3.2 1B 每小时推理碳排放从 107,000 kg 降至 0.012 kg CO2,并使用 CodeCarbon 评估能耗。提供 Python 包,集成 LLM/VLM 进行偏见评分与风险识别,并计划接入 MIT 风险库与 NIST 框架。
summary_zh: Vector Institute 学者在 NeurIPS 2024 发表超过 98 篇论文,涵盖贝叶斯优化、多模态生物多样性数据集与扩散模型合成数据等方向。
summary_zh: Vector Institute 发表新论文提出共享与组提示调优(SGPT)方法,结合通用学习与个性化学习以应对联邦学习中的数据异构问题。
数学在机器学习研究中的角色正在演变,从提供理论保证转向事后解释经验现象和高层架构设计匹配。随着规模扩展,纯数学领域如拓扑、代数和几何开始加入传统应用数学,共同应对深度学习挑战。
Llama 3.2 Vision 已支持在 Ollama 中运行,提供 11B 与 90B 两种规格。11B 需至少 8GB VRAM,90B 需至少 64GB VRAM。用户可通过拖拽图片或添加图片路径将图像输入提示词,并使用 Python、JavaScript 库或 cURL 调用。
Vector Institute 发布了多模态数据集 Newsmediabias-plus(NMB+),包含约 90,000 篇新闻文章,覆盖文本与图像,并附带偏见分类和发布详情。该数据集面向学术研究者、NGO 及社会导向团队,用于检测虚假信息、分析媒体偏见及训练公平性模型。数据集在 Hugging Face 上以非商业许可开放。
Vector Institute研究显示,基于Word2Vec和语言特征的简单AI模型在ADReSS数据集上以92%准确率和100%灵敏度检测阿尔茨海默病,性能超过微调的BERT和GPT-2等上下文模型。该方法结合词向量与34项语言特征,可解释性强、计算效率更高,未来需在不同人群和临床场景中进一步验证。
推荐理由:用简单词向量加语言特征就能在ADReSS上达到92%准确率,为低成本、可解释的阿尔茨海默筛查提供新思路。
扩散模型已用于图像合成,研究社区正将其扩展到视频生成任务。视频生成是图像的超集,需要在时间维度上保持一致性,并面临高质量视频数据收集困难的问题。Imagen Video 通过级联扩散模型和渐进蒸馏将采样步数减半,Sora 则采用 DiT 架构处理时空块。