TinyTorch:从零构建 PyTorch,20 个模块跑通张量到 Transformer
TinyTorch 是哈佛与苏黎世联邦理工推出的开源课程,用纯 Python 和 PyTorch API 从零实现一个可运行的 ML 框架,共 20 个模块、4 个层级,笔记本电脑 4 GB 内存无 GPU 即可运行。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
TinyTorch 是哈佛与苏黎世联邦理工推出的开源课程,用纯 Python 和 PyTorch API 从零实现一个可运行的 ML 框架,共 20 个模块、4 个层级,笔记本电脑 4 GB 内存无 GPU 即可运行。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。
Why it matters: 把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。
Cloudflare宣布Python Workers正式进入一般可用(GA)阶段,Python成为Cloudflare Developer Platform的一等语言。
Why it matters: Python开发者现在可以在Cloudflare Workers中原生运行Python应用与框架,并直接调用平台服务,无需编写JavaScript胶水代码。
Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。
Why it matters: 原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。
Jev 发布两天内获得 3600 万次视频观看,涌现 ModernBert、DiffusionGemmaJev、Bespoke Nimble、SemIf、Jevlike、Kev-0.5B 等复现;Bespoke Nimble 在评测中将 Qwen3.5 基线从 66% 提升至 90%,Kev-0.5B 可在 MacBook Pro 运行。数据被承认 100% 合成,且尚无该类模型的标准基准。
Why it matters: 原文梳理了 Jev 类判别式决策模型的复现生态与浏览器自动化集成路径,读者可借此判断工作流控制平面的近期走向。
Anthropic 在 Claude Code 推出 Projects,支持单对话衍生多云线程并传递上下文;Google 更新 Gemini managed agents,增加 Credentials 和 Files API 并声称成本下降 30%、缓存命中提升 22%;OpenAI 发布 Astra for Law 垂直包装。
Why it matters: 多线程协调、判断原语和可验证评测等讨论,为理解 Agent 运行时架构的下一层演进提供了可迁移的技术视角。
LangChain 发布开源智能体框架 Deep Life Sci,基于 Deep Agents harness,专为临床与实验室科学家设计。它可接入 ClinicalTrials.gov、PubMed 和 PubMed Central,由子代理并行审阅文献,并在 LangSmith 沙箱中安全运行代码。
Why it matters: 开源框架让药企可定制智能体并拥有完整审计轨迹,有望在合规前提下重塑研发工作流。
PyTorch Blog发布Low Precision Flash Attention 4,在Blackwell上扩展MXFP8前向与反向,前向达2.85 PF/s、反向达2 PF/s,LLM形状较BF16加速1.6×和1.52×。代码已开源至ads_model_kernel_library/lp_fa4。
Why it matters: 原文给出了MXFP8前向与反向的PFLOP/s数据及开源地址,读者可据此评估Blackwell训练栈的实际加速效果。
NVIDIA 官方发布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览结果,在 DeepSeek-R1 和 Qwen3-VL 上分别较 GB300 NVL72 提升最高 2.5x 和 3.7x 吞吐。
Why it matters: NVIDIA 官方公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的首秀成绩,读者可据此对比新旧平台推理吞吐与扩展效率。
Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。
Why it matters: 选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。
NVIDIA 在 AI Infra Summit 公布 Vera Rubin NVL72 与 DSX 平台新成果,MLPerf Inference v6.1 中 Vera Rubin NVL72 较 GB300 NVL72 吞吐量提升最高 3.7 倍,DSX MaxLPS 在相同功耗下集群 token 吞吐量提升 24%、每瓦性能提升 23%。
Why it matters: AI基础设施的关键指标正从峰值性能转向每兆瓦智能体token数,读者可据此评估自身AI工厂的能效与扩容空间。
费城儿童医院使用 MONAI 等开源工具,将儿童心脏建模时间从数小时缩短到秒级,已用于术前规划和部分手术。波士顿儿童医院将建模用于约半数心脏手术,医院间正组建开源联盟。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face Kernels 项目正式支持 Helion,开发者可通过 kernel-builder 打包和发布 Helion 内核,用户用 get_kernel 一键加载。Helion 以
Why it matters: Helion 与 Kernels 项目整合后,开发者可一键发布可调优内核,用户免依赖地狱即可加载预调优配置。
Together AI 升级微调平台,新增 GLM-5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源模型支持,并引入实验实时追踪、Expert LoRA、早停、任意批量大小、样本权重、预飞行校验与打包控制等功能。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research 提出 ToolGrad 框架,先生成真实的工具使用链再反推用户提示,仅需单步 LLM 调用即可完成标注。
Why it matters: 提出 answer-first 的 ToolGrad 框架,以文本梯度迭代构建工具链,为高效生成高质量工具使用数据提供了可迁移的新范式。
PyTorch Foundation 于 9 月 8–9 日在上海举办 PyTorch Conference China 2026,与 KubeCon + CloudNativeCon 和 OpenInfra Summit 同期举行。
Why it matters: PyTorch Foundation 在中国大会公布新成员与开放 AI 栈分层,读者可据此追踪开源生态的协作版图和硬件集成进展。
Together AI 内核团队在 Vera Rubin NVL72 上扩展 ThunderKittens,支持 NVFP4 与 FP8 GEMM,并通过双 K 步长、独占张量内存、更大共享内存、B 侧收集器与 Early A release 等优化,将 NVFP4 推至超 22 PFLOPS,与 cuBLAS 和 CuTE DSL 竞争。
Why it matters: 原文给出了在 Vera Rubin 上优化 NVFP4/FP8 GEMM 的具体方法与性能数据,读者可迁移这些调优思路到自家 Rubin 部署。
Hugging Face 用 Gradio Workflow 重建了 AUTOMATIC1111 的核心功能,形成包含 11 条媒体管道、73 个节点的单一工作流画布,涵盖文生图、高分辨率修复、图生图、提示词矩阵、VLM 问答、检测到 inpaint 掩码、ControlNet 风格标注器、背景去除、PNG Info 读取和图生视频。
Why it matters: 原文展示了用同一套画布串联多种模型与媒体管道的构建方式,读者可据此评估 gr.Workflow 在多模态工作流中的可复用性。
Weaviate 推出 HFresh,一种面向内存敏感场景的磁盘向量索引,默认用于 Weaviate Cloud 免费档的 Cost Optimized 配置。
Why it matters: 原文给出了 HFresh 的内存占用与吞吐对比,读者可以据此判断它是否适合自身规模与资源约束。
Together AI 发布开源 AI 栈指南,将栈分为模型、推理、网关与路由器、Harness、工具与上下文管理五层。推荐同时使用大模型(如 Kimi K3,1.8T 总参数)与小模型(如 GLM 5.3 Flash,320B 总参数)处理不同复杂度的任务,并可通过 OpenRouter、Vercel AI Gateway 或 LiteLLM 路由多提供商。
Why it matters: 原文分层拆解开源 AI 栈各层组件与选型思路,开发者可按需组合模型、网关与工具。