大语言模型注意力变体视觉指南
Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。
Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。
Google Research 在 The Check Up 活动中公布多项医疗 AI 成果,包括与 Fitbit 合作开发的 Personal Health Agent、与 Imperial College London 和 NHS 合作提升乳腺癌检测、并识别 25% 此前被漏诊的 interval cancers。
Google Research与多家NHS机构合作,在Nature Cancer发表两项互补研究,评估AI乳腺X光筛查系统。
推荐理由:两项Nature Cancer研究显示AI在乳腺X光筛查中可减少约四成人工阅读工作量,同时保持与双读流程相当的灵敏度。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
斯旺西大学一项超过800人参与的在线实验显示,使用AI支持系统设计虚拟汽车时,受试者花更多时间、产出更好设计且参与感更强。系统采用MAP-Elites方法生成包含高效、非常规乃至故意缺陷方案的视觉画廊,多样化输出帮助参与者突破初始假设并鼓励冒险。
Together AI 在 NVIDIA GTC 2026 宣布多项合作与模型上线,包括集成 NVIDIA Dynamo 1.0 推理框架、通过 NemoClaw 提供超 150 个优化模型、上线 NVIDIA Nemotron 3 Super(120B 参数、1M 上下文窗口)以及 NVIDIA Parakeet TDT 0.6B V3 ASR 模型。
summary_zh: Arcee AI 发布 Trinity Large(400B MoE,13B 激活参数),采用 SWA、QK-Norm、NoPE 与门控注意力。
密歇根大学团队开发的 Prima 视觉语言模型在 30,000 份 MRI 研究中准确率约 97.5%,并能判断紧急程度、自动通知相应专科医生。该模型使用 20 万份 MRI 和 560 万序列训练,整合临床病史与医嘱信息,研究发表于 Nature Biomedical Engineering。
宾州州立 Hongtao Sun 团队利用水凝胶和半色调编码 4D 打印技术,开发出可编程智能合成皮肤。该材料可通过热、溶剂或机械刺激改变外观、质地和形状,并能将图像编码进材料内:乙醇中透明,加热水或冰水后隐藏图像显现。单个薄片即可同时控制外观与形变,无需多层结构。
斯坦福大学物理学家团队在 Nature 发表论文,展示由 40 个光腔组成的阵列及超过 500 个光腔的原型,每个光腔容纳单个原子量子比特,通过微透镜将光聚焦到单个原子上,实现并行读出。研究指出该方案可扩展至百万量子比特的光腔网络,为分布式量子计算和量子数据中心提供基础。
蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。
剑桥大学等机构研究团队在Nature Machine Intelligence发表CytoDiffusion,基于生成式AI分析血涂片图像,在白血病异常细胞检测上敏感度高于现有系统,并在不确定时主动回避错误判断。
伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。
Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。
研究团队开发出可产生并探测飞秒级UV-C激光脉冲的平台,结合超快UV-C光源与基于二维半导体(GaSe/Ga2O3)的探测器,在室温下工作。所有材料兼容规模化制造,自由空间通信验证成功,传感器还表现出线性到超线性光电响应。
Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。
Mistral AI 发布 Mistral OCR 3,模型可通过 API(mistral-ocr-2512)或 Mistral AI Studio 中的 Document AI Playground 使用,定价为每 1,000 页 $2,Batch API 折扣后为每 1,000 页 $1。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
summary_zh: Meta 发布 3D AssetGen 基础模型,目标是从简单文本提示生成完整 3D 世界。Meta XR Tech 团队在 Meta Tech Podcast 中介绍其训练方式,并讨论 LLM 在 VR 中的角色。
word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。
summary_zh: Pixtral-12B 经过 LoRA 微调后在卫星图像分类任务上显著优于基础模型,在 AID 数据集(8000 训练 / 2000 测试)上减少了基础模型的幻觉和模糊类别误判。
Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。
推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。
推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。
Mistral Small 3.1 正式发布,在文本指令、多模态理解和长上下文任务上超越 Gemma 3 与 GPT-4o Mini,推理速度达 150 tokens/秒。
数学在机器学习研究中的角色正在演变,从提供理论保证转向事后解释经验现象和高层架构设计匹配。随着规模扩展,纯数学领域如拓扑、代数和几何开始加入传统应用数学,共同应对深度学习挑战。
扩散模型已用于图像合成,研究社区正将其扩展到视频生成任务。视频生成是图像的超集,需要在时间维度上保持一致性,并面临高质量视频数据收集困难的问题。Imagen Video 通过级联扩散模型和渐进蒸馏将采样步数减半,Sora 则采用 DiT 架构处理时空块。
summary_zh: 文章以 1928 年青霉素发现作类比,探讨 LLM 是否能成为自动驾驶的"意外答案"。传统自动驾驶依赖感知、定位、规划、控制四大模块,而端到端学习用单一神经网络替代各模块但存在黑箱问题。
summary_zh: 文章以水电大坝鱼类计数为例,探讨计算机科学家在数字转型领域中遇到的复杂社会技术问题。研究涉及通过鱼梯等结构进行鱼类过坝计数,观察者需对物种、伤病、人工/野生等属性进行分类标注。
summary_zh: VisualBERT 将图像区域与文本共同输入 BERT,在 MS COCO 上训练,NLVR 和 Flickr30K 上超越当时 SOTA,VQA 上仍有差距。
扩散模型受非平衡热力学启发,通过马尔可夫链逐步添加高斯噪声并学习逆向扩散过程来生成数据。与 GAN、VAE 和流模型相比,扩散模型具有固定训练过程、高维潜变量等区别。前向扩散过程可将数据逐步噪声化为各向同性高斯分布,逆向过程则通过学习模型近似条件概率实现从噪声重建样本。
summary_zh: 对比表征学习旨在让相似样本对在嵌入空间中靠近、不相似样本远离,可应用于有监督与无监督场景,是自监督学习中最强方法之一。
summary_zh: NAS 通过搜索空间、搜索算法与评估策略三大组件自动学习高性能网络架构。顺序层表示(如 Zoph & Le 2017)依赖专家知识硬编码参数,计算开销极大;基于单元(Cell)的表示(如 NASNet)将架构组织为 Normal Cell 与 Reduction Cell 的重复堆叠,并在块内学习跳跃连接。
自监督学习通过构造自生成的监督信号,利用无标注数据训练模型学到可用于下游任务的中间表征。图像领域常用预处理变换(如旋转、裁剪、失真)构造 pretext task,以 ImageNet 分类准确率评估表征质量。原文指出生成模型与自监督表征学习的目标不同,后者关注通用特征提取而非生成多样真实图像。
summary_zh: 文章综述 2018 年前后 NLP 领域通用预训练语言模型的进展,涵盖 CoVe、ELMo、OpenAI GPT 与 BERT 等模型。
本篇聚焦 SSD、RetinaNet 与 YOLO 系列等单阶段检测模型,承接 Part 3 的 R-CNN 两阶段方案。YOLO 将图像划分为 S×S 网格,每个 cell 预测 B 个边界框与类别概率,输出张量形状为 S×S×(5B+K),损失函数含定位损失与分类损失,分别由 λ_coord=5 与 λ_noobj=0.5 加权。
Flow-based deep generative models 通过 normalizing flows 显式学习数据分布 $p(\mathbf{x})$,以负对数似然为损失函数,克服 GAN 和 VAE 无法显式估计概率密度的困难。模型由一系列可逆变换构成,利用 Jacobian 行列式和变量替换定理实现精确密度估计,可用于生成新样本、密度估计、隐变量推断与缺失数据填补。
summary_zh: R-CNN 系列通过选择性搜索生成约 2k 个候选区域,对每个区域独立提取 CNN 特征并送入 SVM 分类,同时用边界框回归修正检测窗口。
本文介绍用于图像分类的经典卷积神经网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层)、VGG(19 层,3×3 卷积)和 ResNet(152 层,残差块)。目标检测评估指标 mAP 基于 PR 曲线面积计算,以 IoU 阈值 0.5 判定正样本。变形部件模型 DPM 由根滤波器、部件滤波器和空间模型组成,得分为滤波器点积减去形变代价。
summary_zh: Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练过程中的信息变化,并将 DNN 视为马尔可夫链。训练包含两个阶段:先充分表示输入以最小化泛化误差,再通过压缩表示遗忘无关细节。
summary_zh: 生成对抗网络(GAN)由生成器 G 和判别器 D 组成,通过极小极大博弈训练,但存在训练不稳定和难以收敛的问题。文章从 KL 散度与 JS 散度的数学差异出发,解释 GAN 损失函数为何难以优化,并引出旨在解决训练困难的 WGAN 改进方案。