Car-GPT:LLM 能否真正让自动驾驶成为现实?
summary_zh: 文章以 1928 年青霉素发现作类比,探讨 LLM 是否能成为自动驾驶的"意外答案"。传统自动驾驶依赖感知、定位、规划、控制四大模块,而端到端学习用单一神经网络替代各模块但存在黑箱问题。
summary_zh: 文章以 1928 年青霉素发现作类比,探讨 LLM 是否能成为自动驾驶的"意外答案"。传统自动驾驶依赖感知、定位、规划、控制四大模块,而端到端学习用单一神经网络替代各模块但存在黑箱问题。
LLaVA 1.6 支持最高 4 倍像素分辨率,并在文档、图表数据上训练以提升文本识别与推理能力。模型提供 7B、13B、34B 三种参数规模,采用 Apache 2.0 或 LLaMA 2 Community License 发布,可通过 ollama run llava:7b/13b/34b 调用。
summary_zh: 文章以水电大坝鱼类计数为例,探讨计算机科学家在数字转型领域中遇到的复杂社会技术问题。研究涉及通过鱼梯等结构进行鱼类过坝计数,观察者需对物种、伤病、人工/野生等属性进行分类标注。
文章讨论多模态系统与大型多模态模型(LMM),指出并非所有多模态系统都是 LMM(如 Midjourney、Stable Diffusion、DALL-E 属文本到图像模型,不含语言模型组件)。
文章梳理了 LLM 领域的 10 个主要研究方向,包括幻觉、上下文学习、多模态、新架构和 GPU 替代方案等。幻觉是企业在生产环境中采用 LLM 的首要障碍,需同时研究缓解方法与评估指标。上下文长度与构建方式影响 RAG 效果,模型对上下文首尾信息更敏感;多模态能提升性能并拓展应用场景。
summary_zh: Google 在 Google I/O 2023 将 PaLM API 以"public preview"形式开放,开发者可通过 PaLM API Chat 与 Text 服务在推荐系统中实现对话式推荐。
summary_zh: TensorFlow 发布新教程,演示如何用 dtreeviz 可视化并解释 TensorFlow Decision Forests 中的决策树。
fast.ai 发布新课程《From Deep Learning Foundations to Stable Diffusion》,为 Practical Deep Learning for Coders 第二部分,包含超过 30 小时视频内容。
作者用 Stable Diffusion、DALL-E 和 Midjourney 重制《Nemesis 2》1987 年开场动画,逐面板对比原版与 AI 生成效果。
Jay Alammar 用 6 张图讲解 Stable Diffusion 的核心组件与扩散过程:文本经 ClipText 编码器转为 token 嵌入,UNet+调度器在潜在空间逐步去噪,最后由 Autoencoder 解码器生成像素图像。文章说明扩散模型通过加噪训练预测噪声,并介绍如何将文本条件注入 UNet 的注意力层以实现文本控制生成。
summary_zh: VisualBERT 将图像区域与文本共同输入 BERT,在 MS COCO 上训练,NLVR 和 Flickr30K 上超越当时 SOTA,VQA 上仍有差距。
summary_zh: Stanford AI Lab 在 ICLR 2022(4 月 25 日至 29 日线上举办)发表了多篇论文,涵盖自主强化学习、上下文分布偏移数据集 MetaShift、基于贝叶斯推理的上下文学习解释、GreaseLM 图推理语言模型、大规模模型编辑以及基于视觉的机械臂手部感知。
summary_zh: Stanford AI Lab 在 CoRL 2021 录用多篇论文,涵盖语言指令机器人、共享自主、具身智能基准、人机协作模仿学习、可微渲染与声音识别、基于示例的模型强化学习等方向。
summary_zh: Stanford AI Lab 公布 ICCV 2021 录用论文列表,涵盖 GLoRIA 多模态医学图像识别、Point-Voxel Diffusion 3D 形状生成与补全、CAPTRA 类别级位姿跟踪、Human-Object Relationships 视频检测、Geography-Aware 自监督学习及 HuMoR 3D 人体运动模型。
扩散模型受非平衡热力学启发,通过马尔可夫链逐步添加高斯噪声并学习逆向扩散过程来生成数据。与 GAN、VAE 和流模型相比,扩散模型具有固定训练过程、高维潜变量等区别。前向扩散过程可将数据逐步噪声化为各向同性高斯分布,逆向过程则通过学习模型近似条件概率实现从噪声重建样本。
summary_zh: 对比表征学习旨在让相似样本对在嵌入空间中靠近、不相似样本远离,可应用于有监督与无监督场景,是自监督学习中最强方法之一。
summary_zh: NAS 通过搜索空间、搜索算法与评估策略三大组件自动学习高性能网络架构。顺序层表示(如 Zoph & Le 2017)依赖专家知识硬编码参数,计算开销极大;基于单元(Cell)的表示(如 NASNet)将架构组织为 Normal Cell 与 Reduction Cell 的重复堆叠,并在块内学习跳跃连接。
summary_zh: GPT-3 是一个基于 Transformer 解码器架构的大语言模型,包含 96 层、175B 参数,上下文窗口为 2048 tokens,训练使用了 300B tokens 数据集,估算消耗 355 GPU 年和 $4.6m。
自监督学习通过构造自生成的监督信号,利用无标注数据训练模型学到可用于下游任务的中间表征。图像领域常用预处理变换(如旋转、裁剪、失真)构造 pretext task,以 ImageNet 分类准确率评估表征质量。原文指出生成模型与自监督表征学习的目标不同,后者关注通用特征提取而非生成多样真实图像。
summary_zh: 文章综述 2018 年前后 NLP 领域通用预训练语言模型的进展,涵盖 CoVe、ELMo、OpenAI GPT 与 BERT 等模型。
本篇聚焦 SSD、RetinaNet 与 YOLO 系列等单阶段检测模型,承接 Part 3 的 R-CNN 两阶段方案。YOLO 将图像划分为 S×S 网格,每个 cell 预测 B 个边界框与类别概率,输出张量形状为 S×S×(5B+K),损失函数含定位损失与分类损失,分别由 λ_coord=5 与 λ_noobj=0.5 加权。
Flow-based deep generative models 通过 normalizing flows 显式学习数据分布 $p(\mathbf{x})$,以负对数似然为损失函数,克服 GAN 和 VAE 无法显式估计概率密度的困难。模型由一系列可逆变换构成,利用 Jacobian 行列式和变量替换定理实现精确密度估计,可用于生成新样本、密度估计、隐变量推断与缺失数据填补。
summary_zh: R-CNN 系列通过选择性搜索生成约 2k 个候选区域,对每个区域独立提取 CNN 特征并送入 SVM 分类,同时用边界框回归修正检测窗口。
本文介绍用于图像分类的经典卷积神经网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层)、VGG(19 层,3×3 卷积)和 ResNet(152 层,残差块)。目标检测评估指标 mAP 基于 PR 曲线面积计算,以 IoU 阈值 0.5 判定正样本。变形部件模型 DPM 由根滤波器、部件滤波器和空间模型组成,得分为滤波器点积减去形变代价。
summary_zh: Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练过程中的信息变化,并将 DNN 视为马尔可夫链。训练包含两个阶段:先充分表示输入以最小化泛化误差,再通过压缩表示遗忘无关细节。
summary_zh: 生成对抗网络(GAN)由生成器 G 和判别器 D 组成,通过极小极大博弈训练,但存在训练不稳定和难以收敛的问题。文章从 KL 散度与 JS 散度的数学差异出发,解释 GAN 损失函数为何难以优化,并引出旨在解决训练困难的 WGAN 改进方案。
summary_zh: 深度学习模型本质上是大型深层人工神经网络,其成功主要得益于数据规模增长与算力提升。CNN 受视觉皮层启发,通过卷积核提取图像特征;RNN 擅长处理序列数据,在手写识别、语音识别和机器翻译中表现显著。
Chris Olah 的笔记通过可视化概率分布讲解信息论,用天气与穿衣的独立与相关案例说明联合概率与条件概率的分解。文中展示 p(rain, coat) = p(rain)·p(coat|rain) 与 p(coat)·p(rain|coat) 两种等价视角,并提及贝叶斯定理与辛普森悖论。
summary_zh: 反向传播是训练深度模型的关键算法,相比朴素实现可将梯度下降训练速度提升多达一千万倍。 文章通过计算图讲解导数计算,介绍前向模式与反向模式微分,阐明反向传播通过路径合并高效计算导数的原理。
summary_zh: LSTM 是一种特殊的循环神经网络(RNN),通过细胞状态和门控机制解决长程依赖问题,能够有效学习长期信息。该网络由 Hochreiter & Schmidhuber(1997)提出,在语音识别、语言建模、翻译、图像描述等任务上表现优异,目前已广泛使用。
summary_zh: 文章探讨用降维技术可视化深度神经网络内部表示的方法。低维网络可通过观察各层表示及其变换过程来理解网络行为;高维网络则借助降维将表示投影到可理解空间。